Actualités de l’IA de génération d’images et de vidéos — 2026-09-04
Les acteurs propriétaires évoluent vers l’intégration de la génération, de l’édition et de l’audio dans un seul modèle (FLUX 3, Kling 3.0), tandis que l’open source est alimenté par des laboratoires chinois (Alibaba, Tencent) publiant chaque mois des modèles Apache 2.0 peu gourmands en VRAM. La frontière entre les deux camps s’estompe elle-même avec des licences hybrides comme FLUX 3 et MiniMax H3.
Actualités de l’IA de génération d’images et de vidéos — 2026-09-04
Le camp propriétaire est passé de la « course ponctuelle à la qualité d’image » à une phase d’intégration dans un même modèle de la génération, de l’édition et de l’audio (FLUX 3 va même jusqu’à la prédiction d’actions). Google Nano Banana Pro domine presque seul la génération d’images, tandis qu’OpenAI a abandonné l’application Sora en mars 2026 : les fortunes divergent. Côté open source, les laboratoires chinois, principalement Alibaba (Wan/Qwen-Image/Z-Image) et Tencent (Hunyuan), publient à un rythme mensuel des modèles Apache 2.0 et s’implantent dans la communauté ComfyUI en mettant en avant leur fonctionnement sur GPU grand public. La frontière entre les deux camps devient floue : « poids ouverts » mais, en pratique, accès anticipé fermé (FLUX 3), ou poids ouverts mais licence commerciale vendue exclusivement par une seule entreprise (MiniMax H3). Parmi les six plateformes étudiées, Reddit était totalement inaccessible, Bluesky n’a fait remonter aucun sujet concernant les derniers modèles de 2026, et Pinterest n’a pratiquement apporté aucun signal open source. Ce rapport repose donc en pratique sur trois piliers : X, YouTube et Lemmy.
Enseignements transversaux des plateformes
- X et YouTube s’accordent à dire que FLUX 3 n’est « pas ouvert ». Le nouveau modèle de Black Forest Labs unifie image, vidéo, audio et prédiction d’actions, mais l’annonce de @bfl_ai, comme l’observation de @kimmonismus, précise qu’il s’agit d’un « accès anticipé fermé, pas d’open source ». La vidéo explicative d’ElevenLabs sur YouTube (https://www.youtube.com/watch?v=WlGmDRLZt9o) souligne elle aussi explicitement ce point.
- X, YouTube et Lemmy convergent : le principal terrain de l’open source se concentre chez les laboratoires chinois. Alibaba (Wan2.2/2.6/2.7, Qwen-Image, Z-Image-Turbo) et Tencent (HunyuanVideo 1.5, HunyuanImage 3.0) publient presque mensuellement de nouveaux modèles ; sur !«メールアドレス», leur transformation en nœuds ComfyUI est évoquée presque chaque jour.
- Le fonctionnement sur GPU grand public est l’argument commun du camp open source. Z-Image-Turbo (16 Go de VRAM, @stevenhoi) et HunyuanVideo 1.5 (14 Go, vidéo TensorArt https://www.youtube.com/watch?v=MJShdc8tkkA) sont présentés avec les mêmes chiffres sur X et YouTube.
- Le retrait de l’application Sora est corroboré sous deux angles par YouTube et Lemmy. YouTube (NBC News https://www.youtube.com/watch?v=6e3SINmPii4, Wall Street Millennial https://www.youtube.com/watch?v=ZkRYH6PEP5k) rapporte les inquiétudes liées aux deepfakes et les pertes financières ; sur Lemmy (republication via https://www.reddit.com/r/ArtificialInteligence/comments/1tovuid/, 2026-05-27), un projet de film IA de 30 millions de dollars en production a effectivement échoué.
- Les classements d’arènes (Artificial Analysis / Arena.ai) servent de « mesure commune » dans les annonces, ce qui est confirmé à la fois sur X et Lemmy. Les annonces de nouveaux modèles, propriétaires comme ouverts, sont systématiquement accompagnées d’un rang dans les arènes, et @ArtificialAnlys joue sur X un rôle de vérification transverse.
- L’effacement de la frontière ouvert/propriétaire se vérifie avec des exemples distincts sur X (FLUX 3) et Lemmy (MiniMax H3). Les poids de MiniMax H3 sont ouverts (MiniMax Community License), mais Comfy vend exclusivement sa licence commerciale (https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller) : une forme hybride qui fait éclater la simple dichotomie.
- Les restrictions d’accès aux plateformes ont été le principal obstacle commun de cette enquête. Reddit, l’API de recherche Bluesky et les pages YouTube elles-mêmes ont tous bloqué l’accès direct ; chaque étape a dû s’appuyer sur des informations indirectes via WebSearch.
Par plateforme
Reddit — Aucun accès n’a été possible, ni à reddit.com, ni aux miroirs, ni à archive.org : cette étape s’est achevée avec zéro publication. Des articles périphériques évoquaient indirectement l’enthousiasme autour de Wan 2.5 dans r/StableDiffusion ou la recherche d’alternatives après la fin de Sora dans r/SoraAi, mais ces éléments n’ont pas été retenus comme faits faute d’accès aux sources primaires.
X — 21 publications ont été recensées, ce qui en fait la plateforme la plus riche en informations du rapport. Les annonces primaires de comptes officiels (xAI, Runway, Alibaba_Wan, Alibaba_Qwen, TencentHunyuan, bfl_ai, Kling_ai) se combinent aux vérifications d’observateurs du secteur tels qu’Artificial Analysis et rohan_paul : 12 signaux propriétaires et 9 open source ont ainsi été identifiés. Sans connexion, les indicateurs d’engagement tels que les likes et reposts ont toutefois rarement pu être obtenus.
YouTube — La recherche via WebSearch a fonctionné de façon stable et a permis de confirmer 22 vidéos, titres, chaînes et contenus compris : 11 propriétaires et 11 open source. L’accès aux pages vidéo elles-mêmes étant limité, il a été impossible de vérifier les vues, le nombre d’abonnés et les commentaires.
Bluesky — Seulement 10 publications ont été trouvées (4 propriétaires, 6 open source), dont la plupart provenaient de communautés d’amateurs Civitai/Stable Diffusion datant de 2024 à la première moitié de 2025. Aucun nom majeur de modèle 2026 (Wan2.6, Qwen-Image-2512, Kling 3.0, FLUX 3, etc.) n’est apparu. Aucun compte officiel de laboratoire n’a été confirmé ; c’était un « autre monde » déconnecté du cycle d’actualité de X. Le blocage 403 de l’API de recherche semble en être la cause principale.
Lemmy — 13 publications ont été confirmées. !«メールアドレス» (environ 5 600 personnes) joue le rôle de terrain principal de l’open source, avec de nombreux sujets pratiques liés à ComfyUI, notamment MiniMax H3, LTX-2.3/2.5 et Boogu-Image-0.1. Côté propriétaire, les sujets liés aux controverses et aux procès — retrait de Sora, procès autour de contenus CSAM générés par Grok, critiques de DLSS5 — obtenaient davantage de scores que les annonces de modèles.
Pinterest — Parmi 50 Pins collectés, 32 ont été inspectés visuellement. La plupart étaient des infographies de comparaison de « meilleurs outils » consacrées aux grandes marques propriétaires (Google Veo, Sora, Runway, Kling, Midjourney, etc.). Les Pins évoquant l’open source (Stable Diffusion, Flux, Wan, HunyuanVideo, etc.) étaient en pratique inexistants. Plusieurs Pins présentaient aussi un décalage entre leur titre et leur image : Pinterest s’est révélé moins pertinent que les autres plateformes pour l’actualité immédiate.
Points à surveiller
- FLUX 3 deviendra-t-il réellement disponible en poids ouverts ? X : @bfl_ai parle explicitement d’« accès anticipé fermé » ; il faut suivre toute évolution ultérieure.
- Le modèle de « licence commerciale à apparence ouverte » de MiniMax H3 s’étendra-t-il à d’autres entreprises ? Lemmy : https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller
- L’évolution du rang d’arène de Qwen-Image-2512 / Z-Image-Turbo. X : @ArtificialAnlys
- La fin de l’API OpenAI Sora le 2026-09-24 et les services de remplacement qui suivront. Lemmy : https://www.reddit.com/r/ArtificialInteligence/comments/1tovuid/(republication)
- L’avancement du procès concernant la génération de CSAM par « Grok » de xAI. Lemmy : https://lemmy.world/post/51492879
- Dans quelle mesure Kling 3.0 transformera l’économie de l’IA vidéo. X : @CNBizInsider
Actions recommandées
- Suivre continuellement X et YouTube comme sources primaires pour les évolutions du secteur propriétaire.
- Utiliser !«メールアドレス» comme poste d’observation régulier de l’écosystème ComfyUI et des tendances d’implémentation open source.
- Prévoir, pour Reddit et Bluesky, une session connectée ou des clés d’API officielles lors de la prochaine enquête, faute de quoi une recherche utile restera impossible.
- Pinterest n’étant pas adapté aux informations de dernière minute, le réserver lors de la prochaine enquête à l’analyse de tendances visuelles (miniatures, palettes).
- Pour les cas se présentant comme « poids ouverts » mais reposant en réalité sur des licences fermées ou hybrides (FLUX 3, MiniMax H3), vérifier le texte exact de la licence avant chaque classification.
- Ajouter un contrôle régulier de Lemmy : les nouvelles juridiques ou controversées, telles que le retrait de Sora et le procès Grok, y apparaissent plus tôt que sur X avec des exemples concrets (montants, plaintes).
Qualité des données
Reddit n’a fourni aucun élément sur ce thème, en raison d’un blocage technique complet. L’API de recherche de Bluesky renvoyait une erreur 403, imposant le recours à des index via WebSearch ; la plupart des publications retrouvées étaient anciennes, de 2024 ou du premier semestre 2025, et n’abordaient pas les modèles majeurs de 2026. Pinterest n’a quasiment fourni aucun signal concret sur l’open source (AMD Amuse 3.0 uniquement) et était biaisé vers des infographies généralistes favorables aux outils propriétaires. X, YouTube et Lemmy ont chacun permis de confirmer plus de vingt publications, vidéos ou fils réels au total et constituent le socle principal de ce rapport.
Récapitulatif par plateforme
Reddit — Actualités de l’IA de génération d’images et de vidéos (propriétaire / open source)
Où
Aucun accès à reddit.com n’a été possible à cette étape ; il n’a donc pas été possible de vérifier quels subreddits étaient réellement actifs sur ce sujet, y compris leur nombre d’abonnés. Des subreddits habituellement cités dans ce domaine existent (r/StableDiffusion, r/midjourney, r/aivideo, r/SoraAi, r/singularity, etc.), mais ils n’ont pas pu être ouverts et ne peuvent donc pas être présentés comme des espaces confirmés.
Ce que disent les gens
L’environnement d’outils n’a permis d’ouvrir aucune publication Reddit. Il n’existe donc aucune découverte concrète assortie d’un « lien vers la publication + score d’upvotes + date ». Ni les 5 à 12 éléments demandés par le playbook, ni l’analyse d’environ 20 publications requise par le brief n’ont pu être réalisés.
Les éléments ci-dessous ont été indirectement évoqués par d’autres sites (blogs ou articles de synthèse) consultés via WebSearch. Comme ils n’ont pas pu être ouverts et vérifiés directement, ils ne sont pas retenus comme faits et restent de simples notes de référence :
- Un article de synthèse affirmait qu’un fil sur Wan 2.5 dans r/StableDiffusion avait recueilli plusieurs centaines d’upvotes et commentaires, que sa génération audio native était appréciée et que de nombreuses personnes réclamaient la publication de poids ouverts. L’URL du fil et les vrais nombres d’upvotes n’ont pas pu être vérifiés.
- Un autre article indiquait que lors de l’arrêt de l’application Sora par OpenAI, le 26 avril 2026, les publications demandant « Quelle alternative ? » avaient fortement augmenté dans r/SoraAi. La source primaire n’a pas non plus pu être ouverte.
- Une mention selon laquelle ByteDance Seedance 2.0 serait devenu une publication virale à plus de 12 300 upvotes dans r/aivideo a également été trouvée, sans pouvoir vérifier ni le lien ni la date.
Ces éléments ne résultent pas d’une lecture effective de Reddit et ne doivent donc pas être utilisés dans le rapport principal, qui exige au moins dix signaux pour les sources propriétaires comme open source.
Signaux
Aucun signal n’a été collecté depuis Reddit lui-même. Tout au plus, les sujets évoqués par les articles périphériques — génération audio native de Wan 2.5, réactions à l’arrêt de Sora, intérêt pour Seedance 2.0 — suggèrent seulement, par ouï-dire, qu’ils auraient fait parler d’eux sur Reddit. Ils doivent être vérifiés directement sur d’autres plateformes (X, YouTube, etc.) et ne peuvent pas être comptés comme résultats de cette étape.
Limites
- Tous les accès directs à reddit.com ont échoué. Des tentatives avec WebFetch sur
www.reddit.com(y compris la page d’accueil) etold.reddit.comont toutes été refusées avec le blocage « Claude Code is unable to fetch from ... ». - Des miroirs et proxys ont aussi été essayés sans succès :
redlib.catsarch.com→ HTTP 403,libreddit.spike.codes→ échec de résolution DNS,teddit.net→ blocage similaire. - La récupération de captures Reddit historiques via
web.archive.orga également échoué, archive.org étant lui-même bloqué. - Plus de dix recherches WebSearch, utilisant
site:reddit.com, des noms de subreddits et des titres de fils précis (par exemple « site:reddit.com r/StableDiffusion new open source model », « Wan 2.5 open source video model reddit thread discussion release »), n’ont jamais renvoyé une URL Reddit réelle. Les résultats étaient systématiquement remplacés par Wikipédia, des blogs d’entreprises, Substack, Hugging Face et d’autres sources secondaires. Ils résumaient parfois ce qui « serait dit » dans les fils Reddit, sans lien vérifiable. - Par conséquent, ni les « liens réels assortis d’upvotes et de dates » demandés par le playbook, ni l’« analyse d’environ 20 publications » requise pour valider le brief n’ont été obtenus à cette étape.
- Conclusion : Reddit était, en pratique, fermé lors de cette étape (rien à fournir). Il est recommandé de recueillir les signaux sociaux de remplacement sur X, YouTube, Bluesky, Lemmy et Pinterest.
X
X — Actualités de la génération d’images et de vidéos par IA
X (anciennement Twitter) ne peut pas être lu sans connexion ; les textes et URL de publications individuelles ont donc été trouvés par recherche externe avec site:x.com. Presque toutes les publications proviennent des comptes officiels eux-mêmes (xAI, Runway, Alibaba_Qwen, Alibaba_Wan, TencentHunyuan, bfl_ai, Kling_ai, ideogram_ai, etc.) ou de comptes d’observation et d’agrégation tels qu’Artificial Analysis, Rohan Paul et LudovicCreator.
Comptes et hashtags
Sources d’information liées aux modèles propriétaires
- @xai — annonces concernant Grok Imagine et la fin de grok-2-image-1212
- @runwayml — source primaire pour Gen-4 et Gen-4.5
- @Kling_ai — annonce de Kling 3.0
- @bfl_ai (Black Forest Labs) — FLUX 3, actuellement plus proche du fermé avec accès anticipé contrôlé
- @ideogram_ai — annonces de déploiements auprès de partenaires
- @ArtificialAnlys (Artificial Analysis) — publie régulièrement les rangs d’arène des modèles propriétaires et ouverts, et sert d’indicateur transversal
Sources d’information liées à l’open source
- @Alibaba_Wan / @AlibabaGroup — sources primaires pour Wan2.1/2.2/2.6
- @Alibaba_Qwen — Qwen-Image / Qwen-Image-2512
- @Ali_TongyiLab — Z-Image / Z-Image-Turbo
- @TencentHunyuan — HunyuanImage 2.1/3.0, HunyuanVideo 1.5, Hunyuan-GameCraft
- @stevenhoi (Tongyi-MAI) — annonce personnelle de la sortie de Z-Image-Turbo
- @rohanpaul_ai — publie fréquemment des fils explicatifs sur les modèles ouverts chinois
- Hashtags / termes de recherche :
#OpenSource,#Wan22,#QwenImage, nombreuses mentions de la licence Apache 2.0
Publications
Modèles propriétaires
- Classement d’arène de GPT Image 2 / MAI-Image-2.6 — @ChanPerco : indique que GPT-Image 2 occupe la première place et que MAI-Image-2.6 de Microsoft se classe deuxième, devant Grok Imagine 2.0. (Date inconnue, publication de la seconde moitié de 2026 ; aucune donnée d’engagement publique dans le texte.)
- MAI-Image-2.6 entre dans le top 3 de l’arène — @testingcatalog : « MAI-Image-2.6 a atteint la 3e place de l’Image Arena et est désormais disponible en aperçu privé sur MAI Playground et Microsoft Foundry. »
- Le mystérieux modèle « duct-tape » — @arrakis_ai : un modèle de test anonyme, apparemment basé sur GPT, a attiré l’attention dans l’arène. « Holy shxt… Les règles de la génération d’images par IA viennent complètement de changer. » La publication note un bond majeur de précision dans le rendu de texte natif.
- Renouvellement de génération du modèle d’images Grok — @daisuke : annonce la fin, effective le 28 février 2026, du modèle « grok-2-image-1212 » et son remplacement par
grok-imagine-image(citation d’une annonce officielle de xAI). - Modèle vidéo xAI Imagine v0.9 — @xai : « Présentation d’Imagine v0.9, notre nouveau modèle de génération vidéo offrant de très importantes améliorations de qualité visuelle, de mouvement et de génération audio par rapport à v0.1 », déployé gratuitement sur tous les produits.
- Runway Gen-4.5 — @runwayml : annonce un nouveau modèle de base avec 1 247 Elo dans l’arène Text to Video. L’entreprise a ensuite publié Gen-4.5 Image to Video (« Conçu pour des histoires plus longues. Contrôle précis de la caméra. Narrations cohérentes. »).
- Annonce de Kling 3.0 — @Kling_ai : sous le slogan « Everyone a Director », annonce une architecture tout-en-un réunissant génération, édition et audio dans un seul modèle, avec prise en charge de clips de 15 secondes. Le créateur francophone @tardquin a également relayé l’information.
- Commentaire sur l’économie de Kling 3.0 — @CNBizInsider : analyse un potentiel de transformation fondamentale de l’économie de l’IA vidéo.
- Exemples d’usage de Nano Banana Pro (Google) — @101babich : fil présentant trois cas d’usage en design produit.
- Comparaison Nano Banana standard vs Pro — @immasiddx : compare la différence de qualité entre les deux modèles avec la réaction « We’re cooked 💀 », tout en signalant des défauts anatomiques, notamment dans le rendu des doigts.
- FLUX 3 arrive comme modèle fermé — @kimmonismus : Black Forest Labs a annoncé « FLUX 3 », qui unifie image, vidéo, audio et prédiction d’actions, mais précise que « la version actuelle est un accès anticipé fermé, pas de l’open source ».
- Annonce officielle de FLUX 3 Video — @bfl_ai (source primaire) : « Un modèle multimodal pour l’image, la vidéo, l’audio et la prédiction d’actions », avec vidéos de 20 secondes et dialogues multilingues. Une publication ultérieure affirme que « FLUX 3 Video est n°2 mondial » dans l’arène, avec un accès gratuit temporaire.
Open source
- Sortie officielle de Wan2.2 — @Alibaba_Wan (officiel) : « Le premier modèle open source au monde de génération vidéo avec architecture MoE et contrôle cinématographique ! » Le compte personnel @scaling01 l’a immédiatement relayé.
- Wan2.6 : génère vidéo et audio en un seul passage — @FutureStacked : « le premier modèle open source qui génère vidéo ET audio ensemble en un seul passage. Sans assemblage. Sans outils externes. »
- Publication de Wan2.2-Animate — @Alibaba_Wan : modèle unifié destiné à l’animation et au remplacement de personnages. « Les poids du modèle et le code d’inférence sont désormais open source pour l’ensemble de la communauté ! »
- Publication de Qwen-Image — @Alibaba_Qwen (officiel) : modèle MMDiT de 20 milliards de paramètres, vantant un rendu de texte de niveau SOTA, rivalisant avec GPT-4o en anglais. @rohanpaul_ai précise : « Distribué sous Apache 2.0, chacun peut le déployer gratuitement. »
- Qwen-Image-2512, mise à jour de Nouvel An — @Alibaba_Qwen : publie ses résultats en affirmant : « Testé dans plus de 10 000 tours à l’aveugle sur AI Arena, Qwen-Image-2512 est le plus puissant modèle open source. »
- Qwen-Image-Layered — @azed_ai : s’émerveille de sa capacité à « décomposer nativement les images en parties modifiables, pas en masques, pas en astuces 🤯 ».
- HunyuanVideo 1.5 — @TencentHunyuan (officiel) : se présente comme « le plus puissant modèle open source de génération vidéo » ; ses 8,3 milliards de paramètres peuvent fonctionner sur un GPU grand public avec 14 Go de VRAM.
- HunyuanImage 3.0 — @TencentHunyuan : « le plus grand et le plus puissant modèle open source de texte vers image à ce jour, avec plus de 80 milliards de paramètres au total ».
- Publication de Z-Image-Turbo — @stevenhoi (équipe Tongyi-MAI) : sortie d’un modèle de 6 milliards de paramètres à l’inférence inférieure à une seconde sur GPU grand public doté de 16 Go de VRAM. La semaine suivante, Artificial Analysis l’a classé premier de la catégorie image à poids ouverts, et Arena.ai a confirmé son classement sous licence Apache 2.0.
Signaux
- Le terrain principal de l’open source se concentre chez les laboratoires chinois : Alibaba (Wan / Qwen-Image / Z-Image) et Tencent (Hunyuan) lancent de nouveaux modèles toutes les quelques semaines. Sur X, un cycle « annonce → vérification indépendante par Artificial Analysis ou des comptes communautaires → nouveau classement d’arène » s’est installé.
- Le camp propriétaire passe de la course ponctuelle à la qualité à l’intégration et aux écosystèmes : Kling 3.0 et FLUX 3 convergent tous deux vers un modèle unique réunissant génération, édition et audio ; FLUX 3 étend même cela à la prédiction d’actions et à la robotique. Les résultats de recherche soulignaient aussi que l’ère du générateur IA isolé s’achève, les concurrents cherchant à posséder l’ensemble du processus.
- La frontière entre ouvert et fermé s’estompe : FLUX 3 de Black Forest Labs se présente comme « open-weight », mais débute en réalité avec un accès anticipé fermé tout en annonçant des poids ouverts ultérieurs. Il ne faut pas classer un modèle comme open source sur la seule base de sa formulation : il faut vérifier à chaque fois la licence, notamment si elle est Apache 2.0.
- La compétition de benchmarks se joue dans l’arène d’Artificial Analysis : qu’ils soient propriétaires ou ouverts, les nouveaux modèles sont systématiquement annoncés avec un rang dans l’arène, devenu une mesure commune pour les utilisateurs de X.
- La faible exigence en VRAM devient un argument commercial : Z-Image-Turbo (16 Go), HunyuanVideo 1.5 (14 Go) et d’autres modèles open source mettent continuellement en avant leur exécution sur GPU grand public, ce qui constitue une stratégie claire pour toucher les communautés d’exécution locale autour de ComfyUI.
Limites
- L’accès à X sans connexion est impossible ; toutes les publications proviennent donc de résultats Google et de leurs extraits via
site:x.com. Les nombres précis de likes et de reposts n’apparaissent pas dans ces extraits et n’ont pas pu être vérifiés pour la plupart des publications, sauf lorsqu’ils étaient explicitement mentionnés. - Les dates de publication exactes ne peuvent pas être déduites de manière fiable des identifiants de statut ; pour beaucoup, seule l’année 2026 est connue. L’ordre chronologique précis n’est donc pas garanti.
- Aucun miroir nitter ni Threadreader exploitable n’a été trouvé lors de cette recherche, empêchant toute consultation directe.
- Midjourney (v7/fonctions vidéo), Adobe Firefly, Ideogram ainsi que les autres acteurs propriétaires occidentaux hors Runway (Luma, Pika, Stability AI) disposaient de peu de publications primaires sur X ; les informations se limitaient souvent à des mentions secondaires dans des articles de blog.
- Le critère d’« environ 20 publications » est satisfait par les 21 éléments de la section Publications (12 propriétaires, 9 open source). Certaines entrées regroupent toutefois plusieurs publications de suivi sur un même sujet, par exemple plusieurs posts de bfl_ai ; le nombre de posts effectivement référencés dépasse donc 25.
YouTube
YouTube — Actualités de l’IA de génération d’images et de vidéos (propriétaire / open source)
La page officielle des résultats de recherche YouTube (youtube.com/results) repose fortement sur le rendu JavaScript et WebFetch n’a pu lire que le pied de page. Les URL individuelles des vidéos ont donc été collectées par recherche WebSearch avec site:youtube.com <mot-clé>. Le titre et le nom de chaîne de chaque vidéo ont été confirmés de première main via youtube.com/oembed?url=... (API officielle de YouTube), tandis que la date et le contenu sont corroborés par les extraits WebSearch et les articles d’origine. Les vues et nombres d’abonnés n’ont pas pu être vérifiés, comme détaillé dans les limites.
Chaînes
Chaînes couvrant les modèles propriétaires
- Paul J Lipsky — test de Kling 3.0
- Theo - t3gg(t3.gg) — analyse de Nano Banana Pro
- NBC News — actualités sur Nano Banana Pro / Sora
- TheAIGRID — actualité sur Sora 2
- OpenArt — prise en main de Sora 2 / Wan 2.7
- Wall Street Millennial — analyse financière du retrait de Sora
- ElevenLabs — explication de FLUX 3
- ApiTechTips — présentation de Seedance 2.5
- LLM Master — tutoriel Grok Imagine 0.9
- Standarity — explication de Seedream 5.0 Pro
Chaînes couvrant l’open source
- Codedigipt — Wan 2.6 / Z-Image Turbo
- Sebastian Kamph — Wan 2.6 R2V
- Omar Ortiz — Wan 2.7 Image Pro
- Promptus AI — Z-Image vs Flux 2
- TensorArt — HunyuanVideo 1.5
- AI Search — classement de HunyuanVideo 1.5
- Alibaba Cloud (officiel) — annonce Qwen-Image-2.0
- kintu — test de Qwen-Image-2.0
- fal (fal Academy) — explication de LTX-2
Les nombres d’abonnés n’ont pas pu être confirmés, car l’accès aux pages vidéo était limité (voir Limites).
Vidéos
Évolutions propriétaires
- Kling 3.0: The Best AI Video Generation I've Ever Seen (Truly Incredible) — Paul J Lipsky — https://www.youtube.com/watch?v=p6cV7PitAvg — évalue « Kling 3.0 » de Kuaishou, avec génération cinématographique multi-plans, audio natif, synchronisation labiale et cohérence des personnages, comme la meilleure IA vidéo qu’il ait vue.
- Google won image generation (it's not even close) NANO BANANA PRO BREAKDOWN — Theo - t3gg — https://www.youtube.com/watch?v=UV9GqinedQ8 — affirme que Nano Banana Pro de Google (Gemini 3 Pro Image) domine presque sans concurrence la génération d’images.
- Google's Nano Banana Pro is raising concerns over realistic AI image generation — NBC News — https://www.youtube.com/watch?v=RmmrVCUGYp8 — chaîne d’information généraliste couvrant les risques d’abus liés au réalisme de Nano Banana Pro.
- OpenAI's Sora 2 Just SHOCKED The Entire Industry! (10 Things To Know About Sora 2) — TheAIGRID — https://www.youtube.com/watch?v=y4RCSU6SsA0 (2025-10-01) — explique la précision de simulation physique de Sora 2 (gymnastique, triple saut périlleux, etc.) et l’impact de son déploiement sous forme d’application sociale.
- Sora 2 Just Got An Update.....And? — OpenArt — https://www.youtube.com/watch?v=WmJrfuY8BXc — considère avec scepticisme que la mise à jour de Sora 2 n’a pas apporté les progrès espérés.
- OpenAI is shutting down its Sora video creation app — NBC News — https://www.youtube.com/watch?v=6e3SINmPii4 (2026-03-25) — couvre la fermeture de l’application Sora autonome et les inquiétudes autour des deepfakes.
- OpenAI Shuts Down Sora After Losing Billions — Wall Street Millennial — https://www.youtube.com/watch?v=ZkRYH6PEP5k — analyse le retrait de Sora sous l’angle des pertes financières massives.
- FLUX 3 Is Here — Everything You NEED to Know — ElevenLabs — https://www.youtube.com/watch?v=WlGmDRLZt9o (juste après l’annonce du 2026-07-23) — précise que FLUX 3 de Black Forest Labs, qui réunit image, vidéo, audio et prédiction d’actions, relève d’un « accès anticipé fermé » et n’est pas actuellement open source.
- ByteDance Seedance 2.5: 30-Second AI Video Generation with 50 Reference Inputs — ApiTechTips — https://www.youtube.com/watch?v=O2KNqKLANtQ — présente Seedance 2.5, annoncé au Volcano Engine FORCE le 23 juin 2026 : génération de 30 secondes, 4K et accès API fermé.
- GRATIS Grok Imagine 0.9. Crea videos en 20 segundos. — LLM Master — https://www.youtube.com/watch?v=ScWkfsrDAkw — explique que Grok Imagine v0.9 de xAI, qui génère des vidéos avec audio synchronisé, a été ouvert gratuitement à tous les utilisateurs.
- ByteDance Seedream 5.0 Pro: The Announcement, Read and Highlighted — Standarity — https://www.youtube.com/watch?v=g05iPef37Qs (2026-07) — lit et commente l’annonce de Seedream 5.0 Pro, un nouveau modèle d’image permettant l’édition localisée par calques.
Évolutions open source
- Wan 2.6 Just Changed AI Video Forever 😱 — Codedigipt — https://www.youtube.com/watch?v=gYcMhT-eZ_A (2025-12-16) — présente la conservation de l’identité des personnages par Alibaba Wan 2.6 et son découpage automatique multi-angle à partir d’un seul prompt.
- Wan 2.6 is HERE! R2V is AWESOME! — Sebastian Kamph — https://www.youtube.com/watch?v=dGDIpQz_l-E (2025-12-21) — démonstration de Reference-to-Video (R2V), mettant l’accent sur les poids ouverts sous licence Apache.
- Taking Wan 2.7 For A Ride! Here's What I Found Out — OpenArt — https://www.youtube.com/watch?v=RERsGjQrQ6E (2026-04) — test pratique de Wan 2.7, comparé à Kling 3 et Veo 3.1, dont la gratuité et l’absence de censure sont valorisées.
- Wan 2.7 Image Pro: The AI Image Model Nobody Saw Coming — Omar Ortiz — https://www.youtube.com/watch?v=GIMVt4vCv20 (2026-05) — observe que Wan progresse rapidement non seulement dans la vidéo, mais aussi dans la génération d’images.
- Z Image Turbo (FREE): This Open-Source AI Changed Image Generation Forever! (Like nano banana pro) — Codedigipt — https://www.youtube.com/watch?v=sPQQPpQ9X4E — présente Z-Image-Turbo d’Alibaba Tongyi-MAI, sous Apache 2.0, comme un modèle du niveau de Nano Banana Pro.
- New Open-Source Model DESTROYS Flux 2 — Z-Image + Promptus Tutorial — Promptus AI — https://www.youtube.com/watch?v=JF4Q5hXh-_Q — comparaison de benchmarks affirmant que Z-Image dépasse Flux 2.
- Tencent HunyuanVideo 1.5 has been officially open-sourced! — TensorArt — https://www.youtube.com/watch?v=MJShdc8tkkA (2025-12) — explique qu’un modèle DiT de 8,3 milliards de paramètres fonctionne avec 14 Go de VRAM sur GPU grand public et est utilisable commercialement sous Apache 2.0.
- We have a new #1 open-source AI video generator! — AI Search — https://www.youtube.com/watch?v=6EQP8-D37bs — présente HunyuanVideo 1.5 comme le nouveau roi de la génération vidéo open source.
- 🚀 Introducing Qwen-Image-2.0 — our next-gen image generation model! — Alibaba Cloud (chaîne officielle) — https://www.youtube.com/watch?v=NGkwBn0ebYk (2026-02-10) — annonce primaire d’un modèle de 7 milliards de paramètres unifiant génération et édition, avec résolution 2K native et typographie améliorée.
- "Qwen Image 2.0 Review: Insane Image & Text Rendering + Editing Beast!" — kintu — https://www.youtube.com/watch?v=dxLDvd1a_Sk (2026-02-16) — évaluation indépendante des performances de Qwen-Image-2.0 en rendu de texte et édition.
- LTX-2 Is Here - Native Audio AND Open-Source! | fal Academy — fal — https://www.youtube.com/watch?v=Odkj4zllsZg — présente LTX-2 de Lightricks comme le premier modèle à poids ouverts synchronisant image et son dans un même passage, avec 4K/50 fps natif et publication du code d’entraînement.
Signaux
- Le terrain de l’open source réunit les acteurs chinois (Alibaba Wan/Qwen/Tongyi-MAI, Tencent Hunyuan) et israéliens (Lightricks LTX-2). Toutes les chaînes les opposent aux modèles fermés à l’aide des mots-clés « Apache 2.0 », « gratuit » et « sans censure ». Les titres utilisent fréquemment des accroches comme « DESTROYS » ou « Nobody Saw Coming » : les modèles ouverts captent l’attention grâce à leurs performances. En 2026, les vidéos de tests se sont multipliées presque chaque mois autour de Wan 2.6 puis 2.7, HunyuanVideo 1.5, Z-Image/Turbo, Qwen-Image-2.0 et LTX-2.
- Le camp propriétaire est très fragmenté entre Google (Nano Banana Pro), OpenAI (Sora 2), Kuaishou (Kling 3.0), ByteDance (Seedance/Seedream), xAI (Grok Imagine) et Black Forest Labs (FLUX 3), chacun revendiquant la première place des arènes. Toutefois, l’application Sora a été retirée en mars 2026 (NBC News, Wall Street Millennial), montrant que certains acteurs propriétaires rencontrent également des difficultés de monétisation.
- FLUX 3 est un sujet à la frontière entre fermé et ouvert. Black Forest Labs était connu pour sa stratégie de poids ouverts, mais FLUX 3 est en « accès anticipé fermé ». La vidéo d’ElevenLabs insiste précisément sur ce fait, signe que la communauté observe ce recul de l’ouverture.
- Les chaînes de test (Codedigipt, OpenArt, Sebastian Kamph, Promptus AI) publient des comparaisons des modèles fermés et ouverts dans le même format à chaque sortie. Les titres suggèrent que le public choisit moins selon la plateforme que selon le rapport entre gratuité et performance.
Limites
- Il a été impossible de confirmer les nombres de vues et d’abonnés. Avec WebFetch sur
youtube.com/watch?v=..., le Markdown obtenu ne contenait que la navigation de pied de page de YouTube, accompagnée d’une note indiquant que le contenu avait été tronqué car trop long. Les données essentielles — vues, date de publication, abonnés — n’étaient pas accessibles. - À la place, les titres et noms de chaînes ont été confirmés via
youtube.com/oembed?url=...&format=json, l’API officielle de YouTube. Les dates proviennent le plus souvent d’extraits WebSearch ou de sources secondaires, et non de la page vidéo elle-même. Les vidéos dont la date n’était pas confirmée n’en affichent pas dans le texte. - Les miroirs Invidious (
yewtu.be) ont également été essayés, mais ont renvoyé une vérification anti-bot (CAPTCHA) plutôt que le contenu. La tentative de récupération via l’API interne avec le paramètrepbj=1n’a renvoyé qu’un JSON vide. - Les commentaires, y compris les commentaires principaux, n’ont pas pu être consultés puisque les pages vidéo elles-mêmes étaient inaccessibles.
- La recherche WebSearch par
site:youtube.comrenvoyait de manière stable une dizaine de liens à chaque requête, à l’inverse de Reddit où la plateforme était fermée. Le nombre de vidéos disponibles était très élevé ; les 11+11 éléments sont une sélection volontaire destinée à rester dans la limite de 5 à 12 éléments fixée par le playbook. Les 22 vidéos — 11 propriétaires et 11 open source — satisfont le critère d’environ 20 analyses demandé par le brief.
Bluesky
Bluesky — Actualités de l’IA de génération d’images et de vidéos
L’API de recherche officielle de Bluesky (public.api.bsky.app/xrpc/app.bsky.feed.searchPosts) a systématiquement renvoyé 403 Forbidden dans cet environnement. bsky.app est une SPA rendue en JavaScript : même en accès direct, le texte, les likes et les reposts n’ont pas pu être obtenus. Les publications réelles ont donc été collectées à partir de fragments de pages bsky.app indexées par Google via WebSearch. Aucun post Bluesky n’a été trouvé pour les principaux modèles de la seconde moitié de 2026 — Wan2.6, Qwen-Image-2512, Kling 3.0, FLUX 3, GPT Image 2, MAI-Image-2.6, Z-Image-Turbo. Contrairement à X (output/x.md), Bluesky a une présence très faible sur ce thème.
Comptes
- @simonwillison.net — chercheur indépendant suivant les LLM et l’IA générative au sens large ; mentionne parfois les modèles d’image, sans en être spécialiste.
- @todaystopainews.bsky.social — bot/agrégateur qui collecte automatiquement les actualités IA.
- @civitai-bot.bsky.social (bot de mises à jour CivitaiCheckPoint) — publie automatiquement les nouveaux checkpoints ou leurs mises à jour sur Civitai ; seul compte régulier identifié pour l’écosystème de modèles Stable Diffusion open source.
- @doctordiffusion.bsky.social — créateur individuel publiant des modèles Stable Diffusion sur Civitai.
- @luok.ai — compte individuel mentionnant les modèles vidéo open source SkyReels de Skywork AI.
- @dahara1.bsky.social — compte individuel publiant en japonais des retours de bêta-test en IA générative.
- @valeoai.bsky.social (Valeo.ai) — compte publiant en open source des recherches de vidéo et de modèles du monde pour la conduite autonome ; davantage académique que centré sur la génération image/vidéo.
- @midjourney.bsky.social — le profil officiel Midjourney existe, mais aucune publication récente n’a été trouvée dans cette recherche.
- @opensource.bsky.social (Open Source Initiative) — compte de sensibilisation généraliste à l’open source, non spécialisé dans l’IA image/vidéo.
- Aucun compte Bluesky officiel n’a été confirmé pour Alibaba (Wan/Qwen-Image), Tencent (Hunyuan), Kling/Kuaishou, Black Forest Labs, Runway, xAI ou OpenAI, pourtant sources primaires sur X.
Publications
Modèles propriétaires
- Détection SynthID de Nano Banana Pro — @simonwillison.net : indique qu’en téléversant une photo pour déterminer si elle a été générée par IA, il est possible de détecter le filigrane invisible SynthID inséré par Nano Banana Pro. Date inconnue, estimée en 2026. Likes et reposts non obtenus.
- Convergence fonctionnelle des fournisseurs d’API et adoption de FLUX — @simonwillison.net : note que les grands fournisseurs d’API LLM convergent vers l’exécution de code, la recherche Web, les bibliothèques de documents, la génération d’images et MCP ; mentionne dans ce contexte « image generation (FLUX for Mistral) », soit l’adoption de FLUX de Black Forest Labs par Mistral pour la génération d’images. Date inconnue.
- Exemple de production utilisant Kling AI 1.6 — @planet-gay-comic.bsky.social (2025-02-07) : explique que l’œuvre « Spring Feelings Arise » utilise Kling AI 1.6 pour l’image vers vidéo, SD-1.5 pour les images fixes et Suno AI v4 pour l’audio. Exemple concret d’intégration d’un outil vidéo fermé dans le flux de production d’un créateur indépendant.
- Commentaire sur l’avenir de Grok — @wilkos.bsky.social (2026-06-05) : « Grok ouvrira la voie des modèles de frontière en s’entraînant à partir de concurrents plus établis et plus capables. » Commentaire général, non spécifique à la génération d’images ou de vidéos ; inclus à titre de référence.
Open source
- Diffusion d’un « générateur local d’images IA sans censure » — @todaystopainews.bsky.social (2026-06-30) : publication automatique annonçant « Un nouveau meilleur générateur d’images IA local est là ! Déjà sans censure ». Il s’agit d’une reprise d’une vidéo YouTube sur un modèle à poids ouverts exécutable localement, et non d’une source primaire.
- Publication de SkyReels V1 — @luok.ai (2025-02-18) : présente SkyReels V1 de Skywork AI comme « le premier modèle de fondation vidéo open source centré sur l’humain ». Basé sur HunyuanVideo, il a appris 33 types d’expressions et plus de 400 mouvements naturels.
- Retour de bêta sur HunyuanVideo — @dahara1.bsky.social (2025-03-06) : rapporte en japonais : « J’ai participé au bêta-test de l’IA de génération vidéo HunyuanVideo et il est désormais possible de créer une vidéo à partir d’une image (I2V). » Mentionne des essais avec des contenus de style anime.
- Mise à jour automatique d’un checkpoint Civitai — @civitai-bot.bsky.social (2024-05-07) : annonce automatique d’une mise à jour de « Dream Come TrueXL v4.0 », un modèle de la famille SDXL/SD1.5. Cela montre que la communauté des modèles SD ouverts de Civitai subsiste sur Bluesky sous forme de publications automatisées.
- Distribution d’un modèle Civitai — @doctordiffusion.bsky.social (2025-01-19) : partage un modèle Stable Diffusion personnel avec un lien Civitai.
- Mise en open source d’un modèle vidéo/monde destiné à la conduite autonome — @valeoai.bsky.social (2025-02-24) : annonce, avec « Trained on YouTube?! We used OpenDV », la publication open source complète d’un article (arXiv:2502.15672), de la page projet, du code GitHub, de poids entraînés, de recettes d’entraînement et de lois d’échelle. Ce n’est pas directement de la génération image/vidéo, mais un modèle du monde davantage lié à la compréhension vidéo ; l’exemple reste pertinent car un compte d’entreprise a ouvert l’ensemble, y compris les poids.
Signaux
- Les noms des derniers modèles de 2026 ne donnent absolument aucun résultat. Plus de vingt requêtes ont été tentées pour Wan2.6, Qwen-Image-2512, Kling 3.0, FLUX 3, GPT Image 2, MAI-Image-2.6, Z-Image-Turbo, HunyuanImage 3.0, Runway Gen-4.5 et d’autres modèles actifs sur X ; pas une seule publication Bluesky n’a été trouvée. La conversation Bluesky sur ce sujet est presque entièrement déconnectée du cycle d’actualité de X.
- Absence de comptes officiels de laboratoires. Aucun des comptes Alibaba (Wan/Qwen), Tencent (Hunyuan), Kuaishou (Kling), Black Forest Labs, Runway, xAI ou OpenAI ne semble jouer le même rôle de source primaire sur Bluesky que sur X. Seul Midjourney a un identifiant existant, sans activité récente confirmée. Il n’existe donc pas de canal d’arrivée naturel des annonces sur la plateforme.
- Les sujets retrouvés sont anciens et centrés sur l’Occident, Stable Diffusion et Civitai. La plupart datent de 2024 ou du premier semestre 2025 et se concentrent sur les communautés d’amateurs Civitai et Stable Diffusion ; ils constituent un monde distinct de la concurrence 2026 menée par les laboratoires chinois Wan/Qwen/Hunyuan/Z-Image.
- Un contexte culturel peu favorable sur la plateforme. Le curateur de flux artistique bSky.art a intégré des listes d’exclusion de l’IA à des flux comme « Trending », et Bluesky affirme ne jamais utiliser les contenus des utilisateurs pour entraîner l’IA générative. Cette culture peu favorable à la mise en visibilité proactive de contenus IA pourrait expliquer en partie la faiblesse des échanges.
- Les nouvelles informations transitent par des bots, pas par les sources primaires. La rare publication concernant un modèle récent, @todaystopainews.bsky.social, est elle-même une reprise d’une vidéo YouTube et non une annonce du développeur.
- Les rares mentions de chercheurs IA reconnus ayant migré de X/Twitter sont éparses. Des observateurs comme Simon Willison évoquent parfois les modèles image/vidéo dans des discussions plus larges sur les LLM, sans les suivre de façon spécialisée.
Limites
- L’API officielle de recherche Bluesky
https://public.api.bsky.app/xrpc/app.bsky.feed.searchPostsa renvoyé 403 Forbidden pour les accès directs comme via plusieurs proxys CORS (allorigins.win, corsproxy.io, codetabs.com, etc.), avec parfois une erreur 522. Le texte des posts, les likes, les reposts et les dates n’ont donc pas pu être récupérés via l’API. - Les pages de recherche, profils et permaliens de
bsky.appsont toutes des SPA rendues en JavaScript. Le contenu récupéré n’était qu’une coquille d’application vide, avec un titre tel que « Bluesky » ou « @handle on Bluesky ». Les publications de ce rapport ont donc toutes été reconstruites à partir d’extraits de pagesbsky.appindexées par Google via WebSearch ; aucun nombre de likes ou reposts n’a été obtenu. - Ces contraintes signifient que l’index de recherche est peu fourni et ancien, et ne renvoie pratiquement rien pour les thèmes récents. Toutes les requêtes sur les principaux modèles de 2026 ont échoué et seules des publications 2024-2025 ont été trouvées. Cela ne prouve pas l’absence d’actualité sur Bluesky : cela peut surtout refléter la limite de cet accès indirect par index de recherche.
- Le critère d’environ 20 publications analysées n’a pas pu être atteint sur Bluesky seul, faute d’accès aux données directes. Les dix éléments ci-dessus, quatre propriétaires et six open source, sont l’ensemble des publications réelles qui ont pu être confirmées depuis cet environnement. Un volume supérieur exigerait une connexion à l’application officielle ou une autre voie d’accès API.
Lemmy
Lemmy — Enquête sur les actualités de l’IA de génération d’images et de vidéos
Communautés
- !«メールアドレス» (environ 5 600 à 5 700 personnes) — discussions générales sur les modèles d’images et de vidéos à poids ouverts. Les nœuds ComfyUI personnalisés et les nouveaux modèles Hugging Face y sont publiés presque quotidiennement : le meilleur point d’observation de cette enquête.
- !«メールアドレス» (2 359 personnes) — espace de publication d’œuvres réalisées avec Stable Diffusion ou d’autres modèles à poids ouverts.
- !«メールアドレス» (1 593 personnes) — communauté spécialisée dans l’art IA de style anime, réservée au SFW.
- !«メールアドレス» (1 662 personnes) — discussions sur SD comme « modèle open source d’apprentissage profond ».
- !«メールアドレス» (52 personnes), !«メールアドレス» (50 personnes), !«メールアドレス» (102 personnes), !«メールアドレス» (96 personnes) — petites communautés spécialisées par thème.
- !«メールアドレス» (222 personnes) — miroir ou communauté séparée de lemmy.dbzer0.com, avec peu de publications.
- !«メールアドレス», !«メールアドレス», !ai_reddit (sur diverses instances), !«メールアドレス» — les nouvelles liées aux IA propriétaires (Grok, Sora, Nvidia DLSS, etc.) et les opinions anti-IA circulent surtout ici. Les nombres d’abonnés ne sont pas publics ou fluctuent trop pour être confirmés.
Publications
- OpenAI ferme Sora, un film de 30 millions de dollars tombe à l’eau (!ai_reddit, 2026-05-27, score 1) — https://www.reddit.com/r/ArtificialInteligence/comments/1tovuid/ . Publication indiquant qu’un projet de film IA produit avec Sora a échoué à la suite de la fin de l’application et de l’API Sora 2, dont l’API devait fermer le 2026-09-24. Liens associés : « How OpenAI scrapping Sora points to tech problems » (!openai, 2026-04-13) https://timesofindia.indiatimes.com/technology/ , « Why OpenAI abandoned Sora » (!kagismallweb, 2026-04-03) https://onemanandhisblog.com/2026/03/ .
- La génération d’images par « Grok » de xAI aurait servi à produire 7 000 images sexuelles d’un enfant réel, et xAI est poursuivie pour génération de CSAM (!«メールアドレス», « Child sexual abuse survivor alleges Elon Musk's AI chatbot used photos of her to generate new illegal images », vers fin août 2026, score 119) — https://lemmy.world/post/51492879 . Le commentaire principal critique le mécanisme par lequel les milliardaires échappent à toute responsabilité.
- Un juge fédéral américain estime que des représentations de violences sexuelles sur mineurs générées par IA sont protégées par le premier amendement (!technology, 2026-08-30, score 16) — https://reason.com/volokh/2026/08/27/ . Sujet majeur concernant les limites juridiques de l’IA générative, ouverte ou propriétaire, republié sur plusieurs instances, y compris !«メールアドレス».
- Nvidia DLSS 5 : filtre d’amélioration d’image par IA au prix d’une baisse de performances de 50 à 60 % (!«メールアドレス», 2026-09-02 à 2026-09-03, score 21) — https://www.pcgamer.com/hardware/graphics-cards/dlss-5-comes-with-a-massive-50-60-percent-performance-hit/ . Les publications associées « Nvidia Announces DLSS 5...An AI slop filter over your game » https://lemmy.world/post/44347792 et « Experimental Build Of Nvidia's DLSS 5 AI Slop Filter Leaks... » https://lemmy.world/post/51240561 étaient également discutées à la même période.
- Publication de Google Nano Banana 2 Lite (!swisstechnews, 2026-07-02 ; republication !hackernews le 2026-06-30) — https://www.itmagazine.ch/artikel/87529/ , https://deepmind.google.com/models/ . Présenté comme un modèle léger de génération d’images de la famille Gemini 3.
- Microsoft MAI-Image-2.5 rejoint le niveau de Nano Banana (!ai_reddit, 2026-05-28, score 1) — https://www.reddit.com/r/ArtificialInteligence/comments/1tpu2cd/ . Sujet sur l’arrivée par Microsoft de son propre modèle d’image fermé pour concurrencer Google.
- Test comparatif photoréaliste de ByteDance Seedream 5.0 Pro (!ai_reddit, 2026-07-10, score 1) — https://www.reddit.com/gallery/1usc03q .
- Adobe Firefly en bêta publique (!swisstechnews, 2026-04-28) — https://www.itmagazine.ch/artikel/87034/ . L’intégration dans Photoshop d’un chatbot IA et de génération audio dans Firefly reste également discutée (!boycottus, 2025-10-29, score 22 https://alternativeto.net/news/2025/10/adobe-adds-ai-chatbots-to-photoshop-premiere-ai-masking-and-generative-audio-in-firefly/ ).
- Discussion : « Jusqu’où faut-il craindre les deepfakes IA ? » (!«メールアドレス», vers 2026-05-20, score 21) — https://lemmy.world/post/47088326 . L’auteur explique avoir supprimé toutes ses photos personnelles en ligne par précaution ; les commentaires soulignent que le risque dépend de la situation et est plus élevé pour les femmes.
- Publication des poids ouverts de MiniMax H3 (Hailuo 3.0) et vente exclusive de licences commerciales par ComfyUI (!«メールアドレス», « ComfyUI MiniMax H3 Commercial Licensing », 2026-08-28, score 4) — https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller . Les poids sont ouverts sous MiniMax Community License et l’usage commercial est permis sous 20 millions de dollars de chiffre d’affaires annuel, mais Comfy vend exclusivement la licence commerciale et l’accompagnement de déploiement : un modèle commercial « à apparence ouverte ». Un seul transformeur traite texte, image, vidéo et audio ; il produit jusqu’à 15 secondes en 2K avec audio stéréo natif. De nombreuses publications d’outils associés ont suivi (MiniMax-H3-Acc-LoRAs, MotionCache-FastVAE, Director-Cut-Studio, etc., 2026-08-28 à 2026-09-02).
- Multiplication des nœuds ComfyUI liés à LTX-2.3 / LTX-2.5, modèles vidéo à poids ouverts de Lightricks (!stable_diffusion, 2026-08-27 à 2026-09-01) — exemple : https://github.com/nazgut/ComfyUI-LTX2.3-CLSS . LTX-2.5 est un modèle audio-vidéo à poids ouverts de 22 milliards de paramètres, prenant en charge la génération multi-plans et la sortie 4K HDR ; avant l’arrivée de H3, il occupait la première place des modèles vidéo à poids ouverts.
- Prise en charge native de Trellis.2 et Pixal3D par ComfyUI (!stable_diffusion, 2026-09-01, score 4) — https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native . L’écosystème ComfyUI intègre ainsi aussi la génération 3D, au-delà de l’image et de la vidéo.
- Publication de Boogu-Image-0.1 (!stable_diffusion, 2026-06-17, score 5) — https://boogu.org/ . Modèle de 10 milliards de paramètres entièrement ouvert sous Apache-2.0, bien classé dans Qwen-Image-Bench, disponible en trois variantes : Base, Turbo et Edit. Il représente l’idée qu’un budget de calcul limité peut atteindre des performances de niveau propriétaire.
Signaux
- Climat côté propriétaire : le centre de gravité est davantage constitué de controverses, procès et retraits que d’annonces de modèles. La fermeture de Sora, le procès concernant le CSAM généré par Grok et les critiques liées aux pertes de performances de DLSS5 obtiennent généralement les meilleurs scores (21 pour DLSS5, 119 pour le procès Grok). Le sentiment anti-IA est aussi fort dans les communautés de type !«メールアドレス».
- Climat côté open source : !«メールアドレス» fonctionne de fait comme un journal de mises à jour de l’écosystème ComfyUI. De nouveaux nœuds personnalisés et LoRA autour de MiniMax H3, LTX-2.3/2.5, Flux et Qwen Image sont publiés presque chaque jour. Les publications d’outils destinées aux développeurs sont plus nombreuses que les œuvres, ce qui montre une communauté orientée vers l’usage pratique.
- La frontière ouvert/propriétaire devient floue : MiniMax H3 est une forme hybride où les poids sont ouverts, mais la licence commerciale est vendue exclusivement par Comfy ; la simple opposition binaire ne tient plus.
- Dans Lemmy au sens large, de nombreuses publications sont des republications passant par des communautés miroirs de Reddit telles que !ai_reddit. La communauté apportant le plus de publications originales de première main est !«メールアドレス».
Limites
- Lemmy a un volume global plus faible que X, YouTube ou Reddit, et aucune communauté dédiée spécifiquement à l’IA de génération vidéo (par exemple !video_generation) n’a été trouvée. Les sujets vidéo sont visibles seulement lorsqu’ils sont intégrés à des publications d’outils dans les communautés Stable Diffusion, notamment LTX, MiniMax H3 et WanGP.
- L’API de recherche globale de Lemmy renvoie parfois zéro résultat selon le mot-clé (
video generationseul,Ideogram,SeedreamouQwen Image), sans permettre de distinguer une véritable absence de publications des limites de l’index de recherche. - Le nombre d’abonnés de chaque communauté varie selon les instances et les sources : !«メールアドレス» apparaît par exemple avec 5,05 K, 5,64 K ou 5 707 membres. À cause du fonctionnement fédéré, un nombre unique exact n’a pas pu être obtenu.
- La page de communauté
lemmy.world/c/stable_diffusion_artrenvoyait une erreur serveur HTTP 500 en accès direct ; la liste des publications a été remplacée par des informations issues de recherches API. - L’examen complet de 20 publications précises sur une plateforme unique n’a pas été atteint. Le rapport contient une sélection de 13 publications et liens existants, confirmés via recherche API et WebSearch ; aucun lien inventé n’a été inclus.
Pinterest — Actualités de l’IA de génération d’images et de vidéos (propriétaire / open source)
Parmi les 50 Pins collectés (output/pinterest.pins.md), 32 ont été ouverts et examinés visuellement, sans répartition initiale par catégorie.
Thèmes visuels
- Les miniatures YouTube à clics sont le genre dominant. Des titres en gras et en capitales, des photos de créateurs au visage surpris et des têtes de robots lumineuses en bleu néon ou violet reviennent fréquemment. Des miniatures telles que « huge AI news », « AI NEWS » et « 15 Biggest AI Updates » ont été directement republiées sur Pinterest [1, 6, 8, 13, 14, 26, 47].
- Les infographies de comparaison « Top N outils » sont omniprésentes, avec réutilisation de modèles identiques. Les éléments [16] et [40] emploient le même agencement « BEST QUALITY(PAID) vs BEST FREE » : ChatGPT Plus/Gemini Advanced/Midjourney/Adobe Firefly/Recraft/Runway Gen-3/Luma/Pika Pro/Kaiber/Synthesia à gauche, puis Ideogram/Gemini Free/SeaArt/Playground/Krea/Canva/Inkscape/CapCut/Pika Free/Runway Free à droite. Seules les couleurs et le filigrane de compte « DA » changent. Cela indique une reproduction industrialisée de modèles visuels plutôt qu’une information originale. D’autres exemples montrent un décalage entre le titre et l’image : [10], intitulé « Top AI Video Generators of 2025 », montre en réalité un collage d’ambiance cinématographique ; [42], titré seulement « Video generation 📹 », affiche un classement générique « TOP 10 IMAGE-TO-VIDEO GENERATOR TOOLS » mettant Runway en avant, suivi de Kling, Google Veo, Sora, Luma, Pika, Kaiber, Synthesia, HeyGen, Adobe Firefly et InVideo.
- La palette bleu marine foncé et bleu néon, évoquant une technologie futuriste, sert à des graphiques généralistes sur l’IA plutôt qu’à des informations concrètes. Les cerveaux lumineux, circuits et icônes de têtes de robots sont réemployés comme symboles d’IA au sens large, y compris hors génération image/vidéo [2, 12, 30, 32, 36, 49].
- Les images de démonstration de produits nommés sont peu nombreuses, mais plus précises. Elles incluent un collage de scènes Google Veo 2 avec l’appel à l’action « Sign up to try on VideoFX » [5], Veo 3 en image-vers-vidéo via l’API Gemini sous forme d’entonnoir image + texte → génération rapide [9], Microsoft VASA-1 avec une photo et un extrait audio produisant une grille de visages parlants aux expressions variées [18], ShengShu Vidu S1 vanté comme « modèle de pointe pour l’interaction IA en temps réel » avec une interface de personnage anime [25], AMD Amuse 3.0 avec un portrait photoréaliste de vieux pêcheur crédité « AI generated image created on AMD Ryzen AI », rare mention de génération locale sur appareil [33], et une démonstration de transformation de style de type Luminate : la même vidéo source devient « blocs de bois », « origami », « jouet de blocs colorés » et « fleurs », tandis qu’une Tesla Model 3 et une tête de panda sont également transformées [3].
- Les Pins visualisant la méfiance vis-à-vis des deepfakes et de leur détection sont marquants. On trouve une photo de chat avec de faux chiffres d’engagement (1,2 K likes, 7,4 K vues) et un tampon rouge « FAKE » [1], une interface de détection audio indiquant « 97% likely AI generated » avec un visuel œil humain/cyborg [12], ainsi qu’un tableau opposant « Good or Bad? » pour les vidéos IA — avantages : gain de temps, faible coût, haute qualité ; inconvénients : manque de créativité humaine, absence de lien émotionnel, dépendance excessive [19].
- Des infographies statistiques avancent sans source des tailles de marché et taux de croissance. Elles annoncent par exemple « AI Video Generator Market: USD 2.56B by 2032, CAGR 20% » [48], ou une liste de « 6+ Best AI Video Generation Websites » avec la prédiction que 80 % des contenus en ligne comporteront de la vidéo d’ici 2026 (Runway/Pika/Kling AI/Luma AI/Canva AI/Hailuo AI) [6].
- Publicités pour des « présentateurs d’actualité IA » et chaînes IA sans visage. Il ne s’agit pas d’actualité réelle, mais de miniatures promotionnelles pour des services créant des vidéos de type journal télévisé par synchronisation labiale IA [46].
Pins notables
- [3] Démonstration comparative qui retranscrit une vidéo source en quatre styles — blocs de bois, origami, Lego et fleurs — et inclut des transformations de Tesla et de têtes de panda. C’est la preuve la plus concrète de génération vidéo par transformation de style parmi les Pins examinés.
- [5] Image de lancement de Google Veo 2. Six scènes très différentes — microscope, nageur sous l’eau, jeune fille anime, flamant rose et autres — sont réunies dans une même image avec « Sign up to try on VideoFX ».
- [9] Veo 3 image-vers-vidéo via l’API Gemini. Un graphique en entonnoir fait converger image et texte vers une génération rapide, suggérant la prise en charge audio native.
- [18] Microsoft VASA-1. Une seule photo et un clip audio servent à générer une grille de vidéos de visages parlants affichant plus d’une dizaine d’expressions.
- [25] ShengShu Vidu S1. Image promotionnelle d’un personnage anime, vantant le « meilleur modèle au monde pour la génération interactive en temps réel ».
- [28] Infographie « 15 Biggest AI Updates ». Une des rares images à mentionner des sorties précises relatives à la génération d’images, notamment les fonctions d’édition et de redimensionnement de Grok Imagine Image 2.0, ainsi que les baisses de prix API de DeepSeek V4 Pro.
- [32] Carte statistique « Google a analysé 15 millions de conversations ». Elle affirme que 86 % de l’usage de l’IA est hors travail et rapporte qu’un agent IA a dépassé 458 équipes sur 526 dans une compétition de programmation.
- [1] Photo de chat recouverte d’un tampon « FAKE » et de chiffres d’engagement inventés. Elle symbolise le climat de défiance envers les deepfakes qui traverse l’ensemble de ces Pins.
- [33] AMD Amuse 3.0. Portrait photoréaliste crédité « généré sur AMD Ryzen AI », seule mention de génération locale ou sur appareil dans l’échantillon.
- [16]/[40] Deux publications du même tableau comparatif « Best Quality (payant) vs Best Free (gratuit) », avec des couleurs et comptes différents : découverte révélatrice d’une duplication de modèles visuels plus que d’informations.
Signaux
- Les grandes marques propriétaires — Google Veo, OpenAI Sora, Runway, Kling, Pika, Luma, Midjourney, ChatGPT/DALL-E, Adobe Firefly et Synthesia — sont répétitivement nommées dans les Pins de comparaison de « meilleurs outils » et dominent le contenu Pinterest consacré au sujet ([6, 10, 16, 24, 40, 42], entre autres).
- Les Pins se réclamant de l’open source sont presque inexistants. Parmi les 32 images examinées, aucune ne concernait Stable Diffusion, Flux, Wan, HunyuanVideo ou des workflows ComfyUI. AMD Amuse 3.0 [33] est le seul élément proche d’une génération locale ou sur appareil, sans être à proprement parler un outil open source.
- Les titres des Pins ne correspondent souvent pas à leur contenu réel. Plusieurs éléments portent des titres associés à des grandes marques, comme « Google announces... » [3] ou « Google announces video generation AI 'Veo 3' » [37, voir Limites], alors que l’image ne comporte ni logo ni preuve du produit concerné. Les titres semblent probablement optimisés pour le SEO ou le clic.
- Les Pins présentés comme des nouvelles urgentes sont souvent des modèles généralistes réutilisés. La maquette « Breaking News » [30] aligne GPT-5, Llama 3.1 et Claude 3.5, des noms de modèles déjà anciens, ce qui suggère un template permanent dont la date n’est pas mise à jour.
- Globalement, Pinterest sert moins à transmettre l’actualité qu’à vendre l’adoption ou la comparaison d’outils IA, alimenter les craintes autour de l’IA, ou redistribuer des miniatures YouTube. Pour l’actualité récente demandée dans le brief, X et YouTube sont plus proches des sources primaires.
Limites
- Sur les 50 Pins collectés, 32 ont été consultés comme images : [1, 2, 3, 5, 6, 8, 9, 10, 12, 13, 14, 16, 18, 19, 20, 24, 25, 26, 28, 29, 30, 32, 33, 36, 37, 40, 41, 42, 46, 47, 48, 49]. Les 18 restants n’ont pas été vérifiés : [4, 7, 11, 15, 17, 21, 22, 23, 27, 31, 34, 35, 38, 39, 43, 44, 45, 50].
pinterest.pins.mdne comporte aucune séparation par genre (## <genre>) : les 50 éléments sont listés comme un seul résultat de recherche. Aucune agrégation par catégorie n’a donc été possible.- Le Pin [37], titré « Google announces video generation AI 'Veo 3' », montre en réalité un personnage monstre violet converti à partir d’une image en trois environnements — salle de serveurs, ruines sous-marines et ville de bonbons — sans logo Google ni Veo 3. L’affirmation du titre n’est donc pas étayée par l’image et n’a pas été retenue comme fait.
- Seules les images ont été lues : les indicateurs d’engagement Pinterest, tels que sauvegardes, commentaires et date de publication, n’ont pas été vérifiés et ne figurent pas dans
pinterest.pins.md. - Parmi les exigences du brief, qui demandent au moins dix signaux propriétaires et dix open source, Pinterest n’a fourni presque aucun signal directement open source. AMD Amuse 3.0 [33] est le seul élément vaguement pertinent ; les évolutions open source doivent être complétées par X, Reddit et Lemmy.
Actions recommandées
- Continuer à surveiller X et YouTube comme sources primaires des évolutions propriétaires.
- Utiliser !«メールアドレス» comme point d’observation de l’écosystème ComfyUI pour les tendances d’implémentation open source.
- Pour Reddit et Bluesky, prévoir lors de la prochaine enquête des sessions connectées ou des clés d’API officielles afin d’obtenir une recherche exploitable.
- Pinterest n’étant pas adapté aux actualités immédiates, limiter son usage futur à l’analyse des tendances visuelles.
- Vérifier le libellé précis des licences avant de classer les cas se revendiquant « poids ouverts » mais relevant en fait d’un accès fermé ou d’une licence hybride (FLUX 3, MiniMax H3).
- Ajouter Lemmy aux vérifications régulières : les nouvelles juridiques et controversées, comme le retrait de Sora ou le procès Grok, y apparaissent plus vite avec des exemples concrets.
Images collectées


















































Note sur la qualité des données
Reddit a fourni zéro publication en raison du blocage d’accès. Bluesky, dont l’API de recherche était bloquée, n’a permis de retrouver que des publications anciennes de 2024-2025 et aucune mention des principaux modèles de 2026. Pinterest n’a presque apporté aucun signal open source. Parmi les six plateformes, X, YouTube et Lemmy constituent donc les trois principales bases factuelles.



