Actualités de l’IA de génération d’images et de vidéos — 2026-09-12
Le camp open source, notamment les acteurs chinois Z-Image, Qwen-Image et MiniMax-H3, talonne les modèles propriétaires dans les évaluations à l’aveugle. Pendant ce temps, Google lance une offensive tous azimuts avec Nano Banana/Veo/Gemini Omni, tandis que Sora d’OpenAI montre des signes de ralentissement, avec le retrait de modèles de sa page tarifaire et le départ de son responsable.
Actualités de l’IA de génération d’images et de vidéos — 2026-09-12
Salut ! Cette fois, j’ai enquêté sérieusement sur l’écosystème de l’IA de génération d’images et de vidéos sur six plateformes : Reddit, X, YouTube, Bluesky, Lemmy et Pinterest 🔥 En résumé, du côté des modèles propriétaires, Google attaque à pleine puissance sur l’image comme sur la vidéo, tandis que Sora d’OpenAI semble quelque peu ralentir 😳. Côté open source, les acteurs chinois (Qwen, Z-Image, MiniMax, Wan) se rapprochent vraiment dans les évaluations à l’aveugle : la situation est ultra passionnante 🔥🔥 Cela dit, l’enquête sur X a été un échec total : aucune publication sur l’IA de génération d’images ou de vidéos n’a été trouvée. Je le signale donc honnêtement comme une véritable lacune 💦 Enfin, toutes plateformes confondues, les inquiétudes sur l’authenticité — « Est-ce vraiment de l’IA ? » — ont suscité énormément d’attention, avec une capacité de diffusion parfois supérieure aux discussions sur les performances des modèles, ce qui est assez surprenant 👀
À travers les plateformes
- Les acteurs chinois dominent désormais l’open source 🇨🇳 : indépendamment, YouTube, Bluesky et Lemmy présentent Qwen-Image, Z-Image (Turbo), MiniMax (H3/Hailuo 3.0) et Alibaba Wan comme les « nouveaux champions ». Selon un classement à l’aveugle sur Bluesky, Qwen-Image-3.0-Pro ne serait plus qu’à 92 points Elo de GPT Image 2 (high), ce qui est franchement impressionnant (https://bsky.app/profile/oludai.bsky.social/post/3mv5ywkauvt2t).
- Google attaque sur tous les fronts, image comme vidéo : entre une revue de Veo 3.1 sur YouTube (https://www.youtube.com/watch?v=sTOFXi2eY_k), la présentation de Nano Banana 2 par Teacher's Tech (https://www.youtube.com/watch?v=nikIxHM_AQY) et l’annonce sur Bluesky d’une application Windows intégrant « Gemini Omni » (https://bsky.app/profile/itmatterss.bsky.social/post/3mvayanva5c2n), la stratégie est particulièrement offensive 💪
- Les contenus du type « détecter si c’est de l’IA » cartonnent vraiment : les fils de jugement de Reddit (r/isthisAI) (https://www.reddit.com/r/isthisAI/comments/1wbspxo/) et les infographies Pinterest sur les deepfakes/la détection de voix IA ont suscité de l’intérêt de façon indépendante. L’inquiétude liée à l’authenticité est devenue un thème transversal. Le fait que cela se propage davantage que les nouvelles sur les performances des modèles est discrètement étonnant.
- Les promesses de type « illimité » ou « affiliation » suscitent de la méfiance partout : entre le commentaire Reddit selon lequel les sites qui annoncent « unlimited » sont souvent proches de l’arnaque (#4, r/generativeAI), et les publications répétées plus de 15 fois par jour par circuitai.bsky.social pour WAN 3.0, le schéma est le même. Les utilisateurs restent à juste titre sceptiques 😤
- Les utilisateurs ordinaires distinguent peu l’open source du propriétaire : dans les fils Reddit demandant des conseils d’outils, Qwen, Flux, Seedream, Veo et GPT Image sont présentés côte à côte dans des listes de modèles utilisables. Les commentaires faisant explicitement cette distinction sont presque inexistants. Il y a un écart notable entre la structure binaire demandée par le brief et la perception réelle des utilisateurs.
Plateforme par plateforme
Reddit — 12 fils collectés (loin de l’objectif d’environ 20). Le contenu le plus populaire ne concernait pas un nouveau modèle, mais la colère face à une IA utilisant GPT-6 pour contrôler une souris et créer de faux timelapses de dessins à la main (r/antiai, 7 146 pt, https://www.reddit.com/r/antiai/comments/1w81kdd/). Plusieurs fils ont aussi évoqué des plateformes intégrées non censurées et compatibles NSFW, telles que WildOwl.ai, cyberbara ou Tensor.art, ce qui suggère une demande réelle.
X — Échec total 😭 Les 40 publications collectées concernaient surtout la situation au Yémen, le memecoin $SONG ou Chelsea FC : zéro publication sur l’IA de génération d’images ou de vidéos. Les termes de recherche utilisés — des sujets tendance — étaient hors sujet. La prochaine fois, il faudra rechercher directement des noms comme Midjourney, Sora ou Runway.
YouTube — C’est la plateforme qui a livré le plus d’informations cette fois ✨ Côté propriétaire : GPT Image 2/2.5 arrive premier dans l’Artificial Analysis Image Arena (score Elo de 1 339, plus grand écart jamais observé entre la première et la deuxième place, https://www.youtube.com/watch?v=DY6TkI8XtkQ), Veo 3.1 améliore la synchronisation labiale, et Seedream 5.0 Pro de ByteDance surpasse les modèles existants (https://www.youtube.com/watch?v=WpcxwSNT3X4). Côté open source : FLUX.2 de Black Forest Labs est présenté comme un possible nouveau champion (https://www.youtube.com/watch?v=YQuTkPVkCS8), Z-Image Turbo d’Alibaba est qualifié de ROI des modèles locaux (https://www.youtube.com/watch?v=K0FgDU-9uik), et Lightricks LTX-2 est même décrit comme le « Saint Graal de la vidéo open source ».
Bluesky — Sora semble vraiment être en train de ralentir 👀 Une publication a détecté le retrait discret de sora-2 et sora-2-pro de la page tarifaire (https://bsky.app/profile/ctxwindow.kynth.studio/post/3muxriifygl23). Un scoop indique aussi que l’ancien responsable de Sora, Bill Peebles, lance une startup indépendante avec de grandes figures d’Hollywood (https://bsky.app/profile/theinformation.com/post/3mv6myz7pa52n). Côté open source, les acteurs chinois Qwen, Z-Image, MiniMax, WAN 3.0 et SenseNova-U1.5 monopolisent les discussions.
Lemmy — La plateforme est plus petite et dépend de fait de la curation d’une seule personne, Even_Adder 😅 Mais l’actualité la plus frappante du côté propriétaire est que Midjourney se serait réorienté de la génération d’images vers une activité de spa médical utilisant des scanners CT à ultrasons (https://www.theregister.com/ai-and-ml/2026/06/18/midjourney-pivots-from-ai-image-generation-to-body-scanning-medical-spa-where-patients-bathe-in-golden-light/5258429). Certains y voient un « retour de Theranos ». Côté open source, l’écosystème de MiniMax-H3 explose, avec plus de sept outils ComfyUI et de quantification publiés en une semaine.
Pinterest — Les 50 épingles ont toutes été vérifiées visuellement 👀 Les outils commerciaux propriétaires — Runway, Pika, Kling AI, Luma, Canva, Hailuo et Synthesia — reviennent presque systématiquement dans les infographies de classement, alors que les épingles open source sont quasiment absentes. On y trouve aussi quelques vraies actualités, comme du matériel promotionnel officiel de Google Veo 2/3 ou une information sur un accord de droit d’auteur entre ByteDance et Hollywood (MPA) (#31), mais la plupart sont des miniatures produites en série à des fins de SEO ou d’affiliation. Une épingle affirme également que « plus de 20 % de YouTube est désormais généré par IA » (#44).
À surveiller
- Déterminer si le ralentissement de Sora est réel — Bluesky, détection du retrait de modèles de la page tarifaire (https://bsky.app/profile/ctxwindow.kynth.studio/post/3muxriifygl23)
- Voir jusqu’où Qwen-Image-3.0-Pro peut réduire l’écart avec GPT Image 2 — Bluesky, classement d’évaluation à l’aveugle (https://bsky.app/profile/oludai.bsky.social/post/3mv5ywkauvt2t)
- Le rythme d’expansion de l’écosystème MiniMax-H3 — Lemmy, outils autour de ComfyUI (https://github.com/sepiablue-ai/ComfyUI-MiniMax-H3-W4A4-VSA)
- Les suites de l’activité de spa médical de Midjourney — Lemmy, article de The Register (https://www.theregister.com/ai-and-ml/2026/06/18/midjourney-pivots-from-ai-image-generation-to-body-scanning-medical-spa-where-patients-bathe-in-golden-light/5258429)
- L’issue de la compétition pour le titre de « champion local » entre FLUX.2 et Z-Image Turbo — YouTube (https://www.youtube.com/watch?v=YQuTkPVkCS8, https://www.youtube.com/watch?v=K0FgDU-9uik)
- L’évolution des plateformes intégrées non censurées/NSFW telles que WildOwl.ai — Reddit (https://www.reddit.com/r/AItips101/comments/1w9yftp/)
Recommandations
- La prochaine enquête sur X devrait utiliser des noms propres — Midjourney, Sora, Runway, Kling, Flux ou ComfyUI — plutôt que des mots-clés tendance.
- Il faudrait continuer à suivre les comptes Bluesky qui surveillent les pages tarifaires afin de confirmer l’évolution de Sora.
- Le suivi du score Elo de Qwen-Image-3.0Pro face à GPT Image 2 est l’indicateur le plus clair pour observer l’écart de performances entre open source et propriétaire.
- Le pivot médical de Midjourney mérite d’être suivi comme une actualité de stratégie d’entreprise plutôt que comme une simple actualité technologique.
- La collecte Reddit devrait élargir ses requêtes afin d’atteindre l’objectif de 20 fils plutôt que de rester à 12.
- Les infographies de classement sur Pinterest et les publications d’affiliation répétitives sur Bluesky ne devraient être retenues que lorsqu’elles sont corroborées sur d’autres plateformes.
Qualité des données
X ne contient aucune publication pertinente sur l’IA de génération d’images et de vidéos, à cause d’un mauvais choix de termes de recherche : il n’y a donc pratiquement aucune donnée sur ce thème. Reddit n’a atteint que 12 fils au lieu de l’objectif d’environ 20, et son contenu porte davantage sur des demandes de recommandations d’outils que sur des actualités. Pinterest ne séparait pas les contenus open source et propriétaires dans les données source, ce qui a imposé une reclassification manuelle. Lemmy est une petite plateforme dépendant essentiellement de la curation d’un seul compte, Even_Adder. Sur YouTube, les pages vidéo étant rendues en JavaScript, WebFetch n’a pas pu récupérer le contenu principal ; les vues et les nombres d’abonnés n’étaient pas non plus accessibles via oEmbed. Bluesky a renvoyé des erreurs 403 persistantes pour certains mots-clés (Runway, Kling, Black Forest Labs), ce qui a conduit à abandonner leur collecte ; les contenus sur WAN 3.0 étaient par ailleurs saturés par les publications répétées d’un compte de spam.
Résumé par plateforme
Reddit — Actualités de l’IA de génération d’images et de vidéos
Où
Les 12 fils collectés proviennent des 9 subreddits suivants.
| Subreddit | Nombre de membres | Nombre de fils collectés |
|---|---|---|
| r/isthisAI | 408,823 | 1 |
| r/antiai | 322,973 | 1 |
| r/GetNoted | 298,488 | 1 |
| r/generativeAI | 152,415 | 3 |
| r/aiwars | 167,809 | 1 |
| r/hatethissmug | 134,660 | 1 |
| r/aivideomaking | 6,823 | 2 |
| r/GoogleFlow | 1,884 | 1 |
| r/AItips101 | 1,299 | 1 |
Les grands subreddits qui débattent du bien-fondé de l’IA générative elle-même (r/antiai, r/aiwars, r/isthisAI, r/GetNoted) sont particulièrement présents, tandis que les subreddits de taille moyenne consacrés à la présentation et à la recommandation d’outils (r/generativeAI, r/aivideomaking) reflètent davantage les tendances d’usage réelles.
Ce que disent les gens
- 【#6, r/antiai, 7,146 pt / 1,025 commentaires, 2026-09-05】Publication affirmant qu’un LLM, indiqué comme GPT-6, a reçu l’autorisation de contrôler une souris et un clavier afin de « dessiner à la main » sur une tablette numérique et de falsifier jusqu’au timelapse. Le commentaire principal (2,511 pt, u/Nayutantantan) exprime sa colère : « Je n’ai même plus envie de filmer des timelapses de mes propres œuvres, car les faux timelapses deviennent la norme. » Ce seul fil a généré, de très loin, le plus de réactions parmi tous ceux collectés. https://www.reddit.com/r/antiai/comments/1w81kdd/
- 【#11, r/GetNoted, 4,470 pt / 325 commentaires, 2026-09-10】Exemple d’un post sur X utilisant une image générée par IA — avec un texte déformé comme « Handloags » sur une image de calendrier — devenu sujet de moqueries. Les principaux commentaires se moquent de la mauvaise qualité de l’image générée par IA. https://www.reddit.com/r/GetNoted/comments/1wcw3n9/
- 【#1, r/AItips101, 145 pt / 83 commentaires, 2026-09-07】« Classement 2026 des générateurs d’images IA non censurés ». WildOwl.ai est placé en première position : il donnerait accès à plus de 35 modèles, dont Qwen Image, Flux, Seedream, Wan, Kling, Seedance, Veo et GPT Image, via une facturation à l’usage, sans abonnement mensuel et avec des crédits sans expiration. Un commentaire de u/reliablemicrophone84 (4 pt) approuve, expliquant avoir gaspillé des crédits ailleurs à cause des filtres. À l’inverse, u/Pretend_Program_3696 (3 pt) recommande Perchance/Uncensored.ai : les avis sont partagés. https://www.reddit.com/r/AItips101/comments/1w9yftp/
- 【#8, r/aivideomaking, 4 pt / 21 commentaires, 2026-09-09】À une demande d’outils de génération d’images et de vidéos photoréalistes gratuits ou à crédits, les utilisateurs citent OpenartAI, fal, dzine, pixverse, Higgsfield et RunningHub, qui permet d’utiliser à la fois des modèles open source et propriétaires via ComfyUI. u/zeroludesigner ajoute que Seedance 2.5 de cyberbara est non censuré et gère les vrais visages. https://www.reddit.com/r/aivideomaking/comments/1wbxpdf/
- 【#3, r/generativeAI, 0 pt / 7 commentaires, 2026-09-11】Fil recherchant des outils de génération d’images et de vidéos NSFW entièrement utilisables depuis un navigateur. u/MisterZan25 présente RunDiffusion/Tensor.art pour les images et la cohérence des personnages, PornGen/PornJourney, ainsi que des miroirs de Pika Labs pour la vidéo. u/frighten (1 pt) recommande l’application iPhone « PixelForge », présentée comme locale et non censurée. https://www.reddit.com/r/generativeAI/comments/1wdkbxv/
- 【#4, r/generativeAI, 1 pt / 11 commentaires, 2026-09-07】À la question « Quel est le service de génération image-vers-vidéo 1080p illimité le moins cher ? », Artlist.io (€550/an) est proposé. Mais plusieurs commentaires critiquent l’affichage « illimité » : u/ai_art_is_art (3 pt) affirme que les sites utilisant cette promesse sont généralement proches de l’arnaque, citant le cas de 550 $ dépensés pour seulement 200 $ de production avant une attente de 24 heures. https://www.reddit.com/r/generativeAI/comments/1wa4k88/
- 【#5, r/aivideomaking, 16 pt / 38 commentaires, 2026-09-07】À une question sur la création gratuite d’une vidéo de 45 secondes uniquement avec un smartphone ou un iPad, u/NewLifeWares (2 pt) répond qu’il s’agit en pratique d’un besoin de niveau centre de données : gratuitement, il faut se contenter d’une ou deux vidéos de cinq secondes avec filigrane, puis les assembler. u/GuessingEngineer (2 pt) ironise : « Si cela pouvait se faire d’un coup, vous régneriez sur le monde. » Le fil met en évidence la demande, mais aussi l’irréalisme de vouloir à la fois gratuité, haute qualité et durée longue. https://www.reddit.com/r/aivideomaking/comments/1w9h5a9/
- 【#7, r/GoogleFlow, 6 pt / 2 commentaires, 2026-09-10】L’extension Chrome de génération par lots « AutoFlow » est publiée pour Google Flow (Veo). Elle propose la génération en lot, la génération de la suite à partir de la dernière image du clip précédent, ainsi que le montage automatique de vidéos narrées avec audio et sous-titres. Modèle gratuit, avec abonnements Pro/Ultra. https://www.reddit.com/r/GoogleFlow/comments/1wccmrg/
- 【#12, r/aiwars, 0 pt / 14 commentaires, 2026-09-08】Discussion sur les risques liés au droit à l’image et à la publicité lorsqu’une personne générée par IA ressemble par hasard à une personne réelle. u/Upstairs-Mammoth-509 (3 pt) souligne que le cas le plus délicat est celui d’une ressemblance accidentelle avec un inconnu : les entreprises ne peuvent guère faire plus qu’une recherche d’images inversée et espérer que tout se passe bien. https://www.reddit.com/r/aiwars/comments/1wafe86/
- 【#10, r/hatethissmug, 59 pt / 20 commentaires, 2026-09-12】Divergences au sein du mouvement anti-IA à propos de vidéos qui critiquent l’IA générative tout en l’utilisant. u/AprilsStuff (22 pt) déclare être anti-IA, mais estime que les arguments environnementaux sont trop exagérés et que l’idée selon laquelle l’IA « disparaîtra naturellement » est irréaliste. Cela montre qu’il existe des désaccords même au sein du discours anti-IA. https://www.reddit.com/r/hatethissmug/comments/1wdxv6k/
- 【#2, r/isthisAI, 0 pt / 31 commentaires, 2026-09-09】Fil visant à déterminer si une vidéo est générée par IA ou filmée. La disparition puis la réapparition d’un collier, relevée par u/smalltiddygothb (16 pt) et u/EmergencyWaffleBox (14 pt), est considérée comme l’élément décisif. u/BouncingSphinx (5 pt) remarque également que la durée exacte de 15 secondes ressemble à la limite actuelle des vidéos IA. Chez les utilisateurs ordinaires, les limites techniques des vidéos IA — durée et incohérences — semblent devenir des critères de détection établis. https://www.reddit.com/r/isthisAI/comments/1wbspxo/
Signaux
- Ce qui progresse : les plateformes intégrées non censurées et compatibles NSFW (WildOwl.ai, cyberbara, RunDiffusion, Tensor.art, PixelForge, etc.) sont mentionnées indépendamment dans plusieurs fils. La demande d’accès simultané aux derniers modèles et à une modération moins stricte est forte.
- Ce qui progresse : l’apparition d’un écosystème complémentaire aux outils officiels, comme AutoFlow (#7) pour Google Flow.
- Ce qui est mal perçu : les abonnements qui promettent un usage « illimité » (#4, comme Artlist.io) suscitent systématiquement la méfiance de la communauté.
- Ce qui est mal perçu : même au sein du camp anti-IA, les arguments insistant sur l’impact environnemental (#10) sont contestés comme étant trop exagérés ; le discours anti-IA n’est donc pas monolithique.
- Point surprenant : parmi les 12 fils collectés, ceux ayant suscité le plus d’engagement ne portaient pas sur des sorties de modèles, mais sur l’accusation selon laquelle une IA peut falsifier des timelapses de dessin (#6, 7 146 pt) et sur une polémique liée à une image IA (#11, 4 470 pt). Sur Reddit, les thèmes de la tromperie et de la fiabilité liées à l’IA se propagent largement davantage que les nouvelles produit.
- Point surprenant : la distinction même entre propriétaire et open source n’est pas au cœur des préoccupations des utilisateurs. Dans la plupart des fils, les modèles des deux catégories — Qwen, Flux, Seedream, Wan, Kling, Seedance, Veo, GPT Image, etc. — sont traités à égalité dans une liste de modèles utilisables.
Limites
- Une seule requête, « Image and Video Generation AI News », a été utilisée, et seuls 12 fils ont été collectés, loin de l’objectif d’environ 20.
- La collecte consistait à lire un travail préalable effectué par un agent dans un navigateur headless. Il n’a pas été possible d’effectuer de nouvelles recherches ou consultations Reddit directement, car Reddit refusait les pages accédées via WebFetch ou via les recherches.
- Une grande partie des publications collectées sont des fils de questions-réponses du type « recommandez-moi un outil », plus proches des usages communautaires que de véritables actualités. Aucun fil spécialisé ne discutant clairement les évolutions respectives de l’open source et du propriétaire n’a été trouvé.
- r/AItips101 (1 299 membres) et r/GoogleFlow (1 884 membres) sont des subreddits très petits : leurs enseignements reflètent davantage des voix individuelles que l’ensemble de la communauté.
X
X — Tendances des actualités de l’IA de génération d’images et de vidéos
Comptes
Les 40 publications collectées proviennent de 40 comptes distincts, avec une publication chacun ; aucun compte ne revient à plusieurs reprises. Aucun ne se spécialise dans l’IA de génération d’images ou de vidéos (Midjourney, Stable Diffusion, Sora, Runway, Kling, Veo, ComfyUI, Flux, etc.). Les groupes se répartissent selon les requêtes de recherche.
- Yemen/Saudi (actualité Moyen-Orient et OSINT) : @tleilax___, @Ahmed175143, @IranTimes72, @citrinowicz, @Osinttechnical, @c14english, @Rusia_HD, @MerruX — comptes OSINT et d’actualité sur les attaques contre les infrastructures pétrolières saoudiennes et le conflit au Yémen.
- $SONG (memecoin lié à Cardano) : @LagyADA, @EAjdarovic, @JureKaramarko, @SintoAndrej — petits comptes spéculatifs et promotionnels.
- Charlie Kirk (premier anniversaire de décès) : @tivent_1, @TruthNetwork24, @mscaradapawjob, @rokkstarrrrrrr — commentaires politiques et réactions sous forme de mèmes.
- Britain (politique britannique) : @brigantia__、@Steven41849941、@SirJBritain、@BROKENBRITAIN0 — publications nationalistes sur l’immigration et la sécurité.
- Anthropic (économie de l’IA et sécurité) : @restitutorII, @BrianRoemmele, @walterkirn, @claudecode84 — prévisions économiques d’Anthropic, open source de Claude Code et critiques de l’IA. Ces contenus portent sur les agents LLM et les débats sociétaux autour de l’IA, non sur la génération d’images ou de vidéos.
- Apple/Samsung (débat smartphones) : @FlossyCarter, @cagriozturkish, @appleinteligen, @BrandonKHill — affrontements entre fans autour des appareils pliables.
- Sony (industrie du jeu) : @JayDubcity16, @Cris_Uther, @treeblazah, @ScreenCraveHQ — rumeurs et actualités sur Hideo Kojima ou les films Spider-Man.
- « one ai os » (autopromotion de startups IA) : @de1lymoon, @neda_sefati, @harvey_control, @Iamanusbutt — publications de réseautage pour des startups d’agents IA ou d’OS pour entreprises ; elles ne mentionnent pas la génération d’images ou de vidéos.
- Chelsea (football) : @declanstar1, @TheHateCentra, @Lea_EFC, @chelcatastr0phe — contenu sur Chelsea FC.
Il n’existe pas de contributeur récurrent permettant de comparer une personne ayant beaucoup percé avec une autre ayant accumulé plusieurs petites publications. À la rigueur, @rokkstarrrrrrr (9 404 likes), @TheHateCentra (19 654 likes) et @Cris_Uther (17 095 likes) sont les publications individuelles les plus performantes, mais elles sont toutes hors sujet.
Publications
Aucune publication ne mentionne directement l’IA de génération d’images ou de vidéos. Voici, à titre indicatif, celles qui s’en rapprochent le plus — tout en restant hors sujet.
-
#21 @restitutorII — 458 likes · 69 reposts · 41 réponses · ~57 000 vues · 2026-09-10
https://x.com/restitutorII/status/2097918742571139093"Anthropic in its report imagines 3 possible futures for the American economy in 2030 based on the power and adoption of AI..."
→ Prévisions économiques d’Anthropic. Cela concerne l’IA générative dans son ensemble, et non les tendances de l’IA de génération d’images ou de vidéos. -
#24 @claudecode84 — 2 585 likes · 268 reposts · 24 réponses · ~741 000 vues · 2026-09-10
https://x.com/claudecode84/status/2097959830942367747« Le responsable d’Anthropic lui-même met tout son “environnement Claude Code” en open source. »
→ Il s’agit de l’open source de Claude Code, une IA de programmation, et non d’un modèle de génération d’images ou de vidéos. -
#33 @de1lymoon — 49 likes · 6 reposts · 9 réponses · ~3 500 vues · 2026-09-11
https://x.com/de1lymoon/status/2098428267158032841"Grok Bot + Kimi K3 is where an AI agent starts turning into an operating system..."
→ Discussion sur l’orchestration d’agents IA, sans lien avec la génération d’images ou de vidéos. -
#22 @BrianRoemmele — 792 likes · 187 reposts · 105 réponses · ~100 000 vues · 2026-09-10
https://x.com/BrianRoemmele/status/2098024115231924568
→ Publication sous forme de mème critiquant Anthropic et les menaces de l’IA, sans sujet lié à la génération d’images ou de vidéos. -
#23 @walterkirn — 723 likes · 91 reposts · 39 réponses · ~28 000 vues · 2026-09-10
https://x.com/walterkirn/status/2098059171325427949
→ Même contexte de critique d’Anthropic et des médias, sans mention de la génération d’images ou de vidéos.
Ces cinq publications sont tout ce qui peut être trouvé avec le mot-clé « AI ». Aucune ne peut être retenue comme une actualité d’IA de génération d’images ou de vidéos, qu’elle soit propriétaire ou open source.
Signaux
- Les dix principales tendances de X Explore dans cette session — vraisemblablement calculées pour la Croatie, d’après l’étiquette « Trending in Croatia » — étaient « Yemen », « Saudi », « $SONG », « Charlie Kirk », « Britain », « Anthropic », « Apple », « Sony », « one ai os » et « Chelsea ». Aucun terme relatif à la génération d’images ou de vidéos, comme Midjourney, Sora, Stable Diffusion, Runway, Kling ou Veo, n’y figurait.
- Le fait qu’« Anthropic » et « one ai os » soient tendance indique que les discussions sur les agents IA, les LLM et leurs conséquences économiques sont actives sur X, mais elles relèvent d’un autre ensemble de sujets que celui traité ici.
- Parmi les 40 publications, aucune ne mentionne un outil de génération d’images ou de vidéos, une sortie de produit, une démo ou une comparaison.
Limites
- Les requêtes utilisées — « Yemen », « Saudi », « $SONG », « Charlie Kirk », « Britain », « Anthropic », « Apple », « Sony », « one ai os » et « Chelsea » — correspondaient aux tendances quotidiennes de X Explore, et non à des requêtes sur l’IA de génération d’images ou de vidéos telle que Midjourney, Stable Diffusion, Sora, Runway, Kling, Veo, ComfyUI ou Flux. Aucune des 40 publications collectées ne contenait donc d’actualité pertinente, qu’elle soit open source ou propriétaire.
- Il était par conséquent impossible de produire les dix observations open source et les dix observations propriétaires demandées par le brief à partir des données X. Il ne faut pas interpréter ce résultat comme si X n’avait « rien dit » sur le sujet, mais comme le résultat de l’absence de recherche ciblée.
- La prochaine exécution devrait rechercher des noms d’outils et d’entreprises : Midjourney, Stability AI, Runway, Pika, Luma, Kling, Sora, Google Veo, Flux, ComfyUI, etc.
YouTube
YouTube — Actualités de l’IA de génération d’images et de vidéos (propriétaire/open source)
Chaînes
- There's An AI For That — Chaîne de présentation d’outils IA ; a publié une revue de FLUX.2.
- AI Search — Chaîne d’actualités rapides sur les nouveaux modèles ; vidéos sur Sora 2 et HunyuanVideo 1.5.
- Theoretically Media — Chaîne spécialisée dans la vidéo IA ; revue détaillée de Veo 3.1.
- Teacher's Tech — Chaîne consacrée aux outils pratiques ; revue de Nano Banana 2.
- Codebreakers — Chaîne de critiques et d’explications sur les modèles IA open source ; dossier MiniMax H3.
- Bijan Bowen — Chaîne très orientée IA locale pour l’image ; tests de Z-Image Turbo.
- Benji's AI Playground — Tutoriels ComfyUI/génération locale ; explication d’Ideogram 4.0.
- Curious Refuge — Chaîne historique de formation à la production audiovisuelle IA ; revue de Midjourney V8.
- RandomAI — Chaîne d’actualités et de comparaisons de modèles ; explication de GPT Image 2.5.
- Standarity / The AI Filmmaking Advantage — Chaînes d’actualités et de tests comparatifs ; résumé de l’annonce et test complet de Seedream 5.0 Pro.
- MattVidPro AI — Mentionné dans une vidéo de premières impressions sur Runway Gen-4.
Vidéos
- « Is FLUX 2.0 The New Open Source King? » — There's An AI For That — https://www.youtube.com/watch?v=YQuTkPVkCS8 — Vérifie si FLUX.2 de Black Forest Labs peut devenir le nouveau roi de la génération d’images open source.
- « We have a new #1 open-source AI video generator! » (2025-11-25) — AI Search — https://www.youtube.com/watch?v=6EQP8-D37bs — Revue et procédure d’installation de HunyuanVideo 1.5 dans ComfyUI, présenté comme capable de fonctionner même avec peu de VRAM.
- « Sora 2… wtf » — AI Search — https://www.youtube.com/watch?v=El-G4cO4x4I — Compare OpenAI Sora 2 à Veo 3, Kling 2.5 et Hailuo 02, en soulignant les progrès de la synchronisation audio et de la physique.
- « Veo 3.1 Is More Powerful Than You Realize! » (2025-10-16) — Theoretically Media — https://www.youtube.com/watch?v=sTOFXi2eY_k — Explique les améliorations de Veo 3.1 : synchronisation labiale, cohérence des personnages et upscale en 1080p.
- « The New Gemini Image Generator is Insane (Nano Banana 2) » — Teacher's Tech — https://www.youtube.com/watch?v=nikIxHM_AQY — Présente le remplacement du générateur par défaut de l’application Gemini par Nano Banana 2.
- « MiniMax H3: The New Open-Source Video Champ? » (2026-08-03) — Codebreakers — https://www.youtube.com/watch?v=3R5GROj8Tcg — Présente MiniMax H3 (Hailuo 3.0), modèle vidéo omnmodal à poids ouverts capable de générer nativement, en un seul passage, une vidéo avec audio stéréo.
- « Alibaba Z-Image Turbo Test – The New KING of LOCAL Image Models » — Bijan Bowen — https://www.youtube.com/watch?v=K0FgDU-9uik — Test local de Z-Image Turbo sous licence Apache-2.0, qualifié de ROI.
- « Ideogram 4.0 Released! The New Open Model That FINALLY Gets Text Right » (2026-06-04) — Benji's AI Playground — https://www.youtube.com/watch?v=HY_e5CZfJfQ — Indique que le premier modèle à poids ouverts d’Ideogram est arrivé premier dans Design Arena et restitue enfin correctement le texte.
- « I Tried Midjourney 8… Here's the Truth » (2026-03-19) — Curious Refuge — https://www.youtube.com/watch?v=i9qV9-2tzEA — Évaluation franche des capacités de Midjourney V8.
- « GPT Image 2.5 Is AMAZING: Full Breakdown of OpenAI's New Image Model » — RandomAI — https://www.youtube.com/watch?v=DY6TkI8XtkQ — Explication de GPT Image 2/2.5 d’OpenAI, notamment des améliorations du rendu de texte et de la prise en charge multilingue.
- « ByteDance Seedream 5.0 Pro: The Announcement, Read and Highlighted » — Standarity — https://www.youtube.com/watch?v=g05iPef37Qs — Résume l’annonce de Seedream 5.0 Pro, qui permet une édition par calques.
- « 🚨BREAKING: Seedream 5.0 Pro Just SMOKED Every Image Model (Fully Tested) » (2026-07-16) — The AI Filmmaking Advantage — https://www.youtube.com/watch?v=WpcxwSNT3X4 — Compare et teste intégralement Seedream 5.0 Pro, jugé supérieur aux modèles existants.
Signaux
Évolutions côté propriétaire
- OpenAI GPT Image 2 / 2.5 est premier de l’Artificial Analysis Image Arena avec un score Elo de 1 339 ; des sources parlent du « plus grand écart entre la première et la deuxième place de l’histoire de l’arène » en septembre 2026.
- Google renforce Veo 3.1 et Nano Banana Pro (Gemini 3 Pro Image) sur les volets vidéo et image. La synchronisation labiale, l’upscale en 1080p et l’édition par calques marquent une orientation nette vers les usages professionnels.
- Seedance 2.0 de ByteDance (2026-02) et Seedream 5.0 Pro (autour de juillet 2026) gagnent rapidement en visibilité grâce à leurs capacités multimodales : références textuelles, images, vidéos et audio.
- Plusieurs vidéos affirment que xAI Grok Imagine 1.5 dépasse Veo et Sora dans des benchmarks, ce qui devient un sujet de discussion vers juin 2026.
- Runway Gen-4/4.5, Midjourney V8 (V8.1, V8.2) et d’autres acteurs historiques continuent également d’être mis à jour. De nombreuses vidéos les présentent sous l’angle d’une « défense du trône ».
Évolutions côté open source
- Plusieurs revues décrivent FLUX.2 de Black Forest Labs comme un nouveau champion des modèles d’image de haute qualité exécutables localement.
- HunyuanVideo 1.5 de Tencent prend place comme nouveau standard de la génération vidéo open source, grâce à sa prise en charge native de ComfyUI et à son fonctionnement sur des configurations à faible VRAM.
- Z-Image et Z-Image Turbo d’Alibaba/Tongyi-MAI sont publiés sous Apache-2.0 et sont souvent qualifiés de « nouveaux rois des modèles locaux ».
- Ideogram 4.0 est publié comme le premier modèle à poids ouverts de l’entreprise, arrive premier dans Design Arena et est mis en avant pour sa précision de rendu de texte.
- MiniMax H3 (Hailuo 3.0) a fortement émergé en août 2026 comme modèle vidéo omnmodal à poids ouverts pouvant fonctionner sur un GPU personnel tel qu’une RTX 3090 ; les vidéos de prise en charge ComfyUI se multiplient.
- Lightricks LTX-2 permettrait, en open source, de générer des vidéos 4K à 50 fps avec synchronisation audio ; il est présenté comme le « Saint Graal de la vidéo open source ».
- Alibaba Wan 2.5/2.6 est régulièrement présenté comme un modèle vidéo open source acceptant des entrées texte, image, audio et vidéo.
Limites
- Les pages de résultats YouTube (
youtube.com/results?...) sont rendues en JavaScript. WebFetch ne pouvait donc récupérer que le pied de page, sans titres, vues ou informations sur les chaînes. Les pages de vidéos individuelles (watch?v=) souffraient de la même limite. Les titres et noms de chaînes ont donc été vérifiés via l’API oEmbed de YouTube (youtube.com/oembed). - L’API oEmbed ne fournit ni vues, ni dates de publication, ni abonnés, ni commentaires. Les vues et les nombres d’abonnés demandés par le playbook n’ont donc pas pu être obtenus. Les dates ne sont indiquées que lorsqu’elles figuraient dans certains extraits WebSearch ; elles sont omises lorsqu’elles étaient inconnues.
- L’accès oEmbed à « LTX-2: Open Source AI Video, Released to the Community » (zSvCnVi181A) a renvoyé une erreur 403 Forbidden et n’a pas pu être vérifié.
- Les commentaires de chaque vidéo n’ont pas pu être consultés pour les raisons ci-dessus ; les résumés reposent uniquement sur les titres et les descriptions.
- Les tendances ont été consolidées à l’aide d’informations obtenues par WebSearch — extraits d’articles et blogs connexes — mais toutes les vidéos liées ont été vérifiées comme étant des URL YouTube existantes.
Bluesky
Bluesky — Actualités de l’IA de génération d’images et de vidéos (propriétaire/open source)
Comptes
- theinformation.com / techmeme.com / mediagazer.com / lefiltech.fr — Bots d’actualité alimentés par RSS, relayant dans plusieurs langues des scoops sur OpenAI et Sora.
- ctxwindow.kynth.studio (#TechBluesky) — Observateur suivant les changements de la page tarifaire d’OpenAI.
- gen-ai.news — Compte personnel d’actualités sur les mises à jour de Midjourney.
- oludai.bsky.social — Exploite un classement indépendant d’évaluations humaines à l’aveugle (olud.ai), classant chaque heure les modèles d’image open source et propriétaires.
- aichina.news — Compte de type bot signalant presque chaque jour des LoRA de type FLUX sous licence Apache-2.0 publiés sur Modelers.cn de Huawei.
- circuitai.bsky.social — Compte de spam/promotion publiant plus d’une douzaine de fois par jour, avec un texte presque identique, des liens d’affiliation vers Alibaba WAN 3.0 (vidhapi.app).
- arxiv-cs-cv.bsky.social — Publication automatique des nouveaux articles arXiv dans le domaine de la génération d’images et de vidéos.
- un1v3rse.bsky.social / carlbetheav.bsky.social / stumblegirl.bsky.social / ttaships.airminded.org — Artistes individuels publiant quotidiennement des créations Midjourney (#midjourney #QP #FoxyFriday).
- rin-yamami.bsky.social / satomin6.alimika.jp — Illustrateurs IA japonophones utilisant Qwen-Image-Edit et ComfyUI.
Publications
- theinformation.com (2026-09-10, 👍1 🔁0) — Scoop selon lequel Bill Peebles, ancien responsable de Sora chez OpenAI, crée sa propre startup d’IA de génération vidéo avec Jeffrey Katzenberg, figure majeure d’Hollywood et ancien dirigeant de DreamWorks, ainsi qu’un ancien CFO de Dropbox.
https://bsky.app/profile/theinformation.com/post/3mv6myz7pa52n - ctxwindow.kynth.studio (2026-09-08, 👍0/1 🔁0) — Détecte le retrait discret de sora-2 et sora-2-pro de la page tarifaire d’OpenAI (anciens tarifs : 720p, 0,05 $ à 0,30 $). Élément à l’appui d’une réduction de voilure de Sora.
https://bsky.app/profile/ctxwindow.kynth.studio/post/3muxriifygl23 - somewhattolerable.com (2026-09-06, 👍2) — Émet l’hypothèse qu’OpenAI a abandonné Sora parce que les ingénieurs internes se plaignaient de sa trop grande consommation de ressources.
https://bsky.app/profile/somewhattolerable.com/post/3muuuazkaf223 - itmatterss.bsky.social (2026-09-11, 👍1) — Indique que Gemini de Google devient une application Windows pour ordinateur, lancée avec Alt+Espace. La publication précise que Nano Banana est utilisé pour la génération d’images et « Gemini Omni » pour la génération vidéo.
https://bsky.app/profile/itmatterss.bsky.social/post/3mvayanva5c2n - dimnews.bsky.social (2026-09-11, en russe) — SenseTime annonce SenseNova-U1.5, un modèle multimodal de 8 milliards de paramètres, qui prétend dépasser Nano-Banana-Pro en raisonnement visuel.
https://bsky.app/profile/dimnews.bsky.social/post/3mv7u7crnzz25 - gen-ai.news (2026-08-30, 👍1) — Signale qu’un correctif discret a été appliqué au modèle d’édition Midjourney V8.2 après des plaintes sur une dégradation de la qualité d’image.
https://bsky.app/profile/gen-ai.news/post/3mudbgowbnz2s - futureautomationai.bsky.social (2026-09-03, 👍2) — Récapitulatif « Midjourney en 2026 » : V8.2, personnalisation, moodboards, modèle d’édition et fonctions de référence.
https://bsky.app/profile/futureautomationai.bsky.social/post/3mumtnbxuv22d - oludai.bsky.social (2026-09-10/11, 👍1-2) — Dans son classement à l’aveugle, le « meilleur modèle téléchargeable » est Qwen-Image-3.0-Pro (#12), à seulement 92 points Elo de GPT Image 2 (high).
https://bsky.app/profile/oludai.bsky.social/post/3mv5ywkauvt2t - ddigitalmedia.bsky.social (2026-09-10, 👍1) — Estime que Qwen, Z-Image et MiniMax sont les seuls modèles capables de rivaliser avec les produits LLM et d’image occidentaux.
https://bsky.app/profile/ddigitalmedia.bsky.social/post/3mv6lyejx3223 - circuitai.bsky.social (2026-09-11 à 12, publications répétées) — Fait la promotion du modèle vidéo Alibaba WAN 3.0 comme alternative à bas coût et à facturation à l’usage face à Seedance 2.5 de ByteDance, avec des clips jusqu’à 30 secondes. ※ Le même texte d’affiliation est publié plus de 15 fois par jour.
https://bsky.app/profile/circuitai.bsky.social/post/3mvbvqsdvr22p - minaxlab.bsky.social (2026-09-11) — Annonce la sortie de ComfyUI v0.35.1, montrant que l’environnement local open source continue d’évoluer.
https://bsky.app/profile/minaxlab.bsky.social/post/3mvasr3l72x2i - aichina.news (2026-09-08 à 09, publications répétées) — Signale l’apparition successive de LoRA de type FLUX sous licence Apache-2.0 sur Modelers.cn de Huawei, tout en notant que beaucoup n’indiquent ni mots déclencheurs ni benchmarks. Le compte estime à plusieurs reprises que les preuves sont insuffisantes pour prétendre dépasser Qwen-Image.
https://bsky.app/profile/aichina.news/post/3mv3vq3zdui24 - arxiv-cs-cv.bsky.social (2026-09-11) — Annonce un nouvel article évaluant et améliorant la capacité de raisonnement « Think-with-Video » des modèles de génération vidéo (From Evaluation to Enhancement).
https://bsky.app/profile/arxiv-cs-cv.bsky.social/post/3mvbfk6tunc2j
Signaux
- Sora semble de fait ralentir : le retrait de modèles de la page tarifaire, le départ de son ancien responsable vers une startup concurrente et l’hypothèse d’un abandon dû à une consommation excessive de ressources se concentrent à la même période. La génération vidéo d’OpenAI semble adopter une posture défensive.
- Google adopte au contraire une stratégie d’expansion totale : Nano Banana pour l’image, Nano Banana Pro, Veo et Gemini Omni pour la vidéo sont intégrés jusque dans une application Windows, conformément à une stratégie consistant à injecter l’IA générative partout.
- Les acteurs chinois sont au centre de l’open source : Qwen-Image-3.0-Pro, Z-Image (Turbo), MiniMax, Alibaba WAN 3.0 et SenseTime SenseNova-U1.5 dominent les discussions. Plusieurs comptes affirment que seuls les modèles ouverts chinois peuvent rivaliser avec les produits occidentaux d’IA d’image et de vidéo.
- L’écart avec les modèles propriétaires se resserre : sur la base d’évaluations à l’aveugle, Qwen-Image-3.0-Pro s’est rapproché à 92 points Elo de GPT Image 2 (high), selon les mesures continues d’oludai.bsky.social.
- Attention au bruit et à la promotion : une grande partie des publications sur WAN 3.0 vient de circuitai.bsky.social, qui répète le même message d’affiliation. Il ne faut donc pas les interpréter comme un engouement organique.
- L’écosystème ComfyUI/LoRA continue d’évoluer : en plus des mises à jour de ComfyUI, des portages comme les LoRA FLUX pour les NPU Ascend de Huawei montrent une progression vers du matériel autre que CUDA.
Limites
- Les API publiques de Bluesky (
public.api.bsky.appetapi.bsky.app, endpointapp.bsky.feed.searchPosts) ont renvoyé des erreurs 403 intermittentes, probablement liées à des limites de débit. Les requêtes successives échouaient facilement ; les réessais espacés permettaient généralement d’aboutir. - Plusieurs mots-clés, notamment
Runway Gen,Kling AI,Black Forest LabsetWan 2.5selon les variantes orthographiques, ont continué à renvoyer des erreurs 403 et ont dû être abandonnés. Des requêtes de remplacement commeWan videoont été utilisées. Aucune publication directe sur Runway ou Kling n’a été conservée dans ce fichier. - L’interface Web de
bsky.app/searchest une application monopage JavaScript, dont le contenu n’était pas rendu lors de la récupération. L’analyse dépend donc entièrement du JSON de l’API publique. - Les termes comme « Flux » ou « Z-Image » sont recherchés littéralement et renvoient majoritairement des résultats sans rapport — Aeon Flux, flux solaire, Pokémon Z-A, sites de vidéos adultes, etc. — ce qui a nécessité un important travail de filtrage.
- Les contenus de The Information sur Katzenberg et l’article arXiv ne sont vérifiés qu’au niveau du titre et du résumé, sans validation intégrale du texte en raison du paywall et de la nature spécialisée de l’article.
Lemmy
Lemmy — Actualités de l’IA de génération d’images et de vidéos
Communautés
- !«メールアドレス» — 5 709 abonnés au total, dont 893 locaux. C’est le principal hub Lemmy pour les sorties d’outils et de modèles de génération d’images et de vidéos. Les publications récentes sont presque toutes des liens vers GitHub ou HuggingFace postés quotidiennement par une seule personne,
Even_Adder. - !«メールアドレス» / lemmy.world — Communautés de partage d’œuvres générées, davantage des galeries que des espaces d’actualité ; les scores vont de -14 à 16.
- !«メールアドレス» — Communauté spécialisée dans l’art abstrait produit avec SDXL et des LoRA personnalisées. Plus de dix publications ont été faites en septembre, ce qui indique une activité soutenue.
- !ai_reddit@[diverses instances] — Communautés agrégeant des crossposts de Reddit r/ArtificialInteligence ; peu de discussions originales.
- !«メールアドレス» — Actualités technologiques généralistes. Les articles sur Midjourney y ont obtenu des scores dépassant 70 pt.
- !hackernews@[diverses instances] — Crossposts de Hacker News, ayant relayé plusieurs actualités sur Midjourney.
- !techtakes@[diverses instances] — Communauté très critique envers l’IA, où « Midjourney pivots to Theranos » a obtenu 40 pt.
- !llm@[diverses instances] — Communauté spécialisée dans les LLM. Une publication sur GPT-6 Astra a un score négatif (-3), signe d’un accueil froid.
- !«メールアドレス» — Petite communauté dédiée à Perchance, outil de génération de texte et d’images.
Les API renvoient parfois des erreurs 404 selon les instances. En dehors de !«メールアドレス», les chiffres précis d’abonnés n’ont pas pu être confirmés.
Publications
Plutôt propriétaire
- "Midjourney pivots from AI image generation to body scanning medical spa" — !«メールアドレス», 58 pt, 2026-06-18. https://www.theregister.com/ai-and-ml/2026/06/18/midjourney-pivots-from-ai-image-generation-to-body-scanning-medical-spa-where-patients-bathe-in-golden-light/5258429 — Actualité étonnante selon laquelle Midjourney se réoriente de la génération d’images vers un spa médical utilisant de la tomodensitométrie à ultrasons (Midjourney Medical).
- "Midjourney AI pivots to Theranos: Ultrasonic CT" — !techtakes, 40 pt, 2026-06-19. https://pivot-to-ai.com/2026/06/19/midjourney-ai-pivots-to-theranos-ultrasonic-ct/ — Commentaire ironique présentant l’affaire comme le retour de Theranos.
- Page officielle "Midjourney Medical" — !hackernews, 3 pt, 2026-06-18. https://www.midjourney.com/medical
- "Midjourney wants Hollywood studios to reveal the details of their AI usage" — !«メールアドレス», 73 pt, 2026-07-05. https://techcrunch.com/2026/07/04/midjourney-wants-hollywood-studios-to-reveal-the-details-of-their-ai-usage/ — Midjourney demande aux studios d’Hollywood de dévoiler la réalité de leur usage de l’IA.
- "Behind the scenes with the Midjourney scanner" (vidéo) — !hackernews, 1 pt, 2026-07-06. https://www.youtube.com/watch?v=4nzzpUKhj1M
- "Amnesty International's May 2026 briefing calls leading generative AI systems 'unlawful by design'" — !ai_reddit, 1 pt, 2026-06-24. https://www.reddit.com/r/ArtificialInteligence/comments/1ue64s2/ — Une organisation de défense des droits humains critique les pratiques de collecte de données de grands systèmes d’IA générative propriétaires, y compris de génération d’images, qu’elle juge illégales par conception.
- Sortie de GPT-6 Astra — !llm, -3 pt, 2026-09-04. https://openai.com/index/gpt-6-astra/ — Le LLM ne génère pas directement d’images ou de vidéos ; il appelle des outils via l’API Responses. La réaction communautaire est faible et négative.
Plutôt open source (toutes dans !«メールアドレス», par Even_Adder)
- Ensemble d’outils autour du modèle vidéo MiniMax-H3 — Plus de sept sorties entre le 04 et le 10 septembre (
ComfyUI-MiniMax-H3-W4A4-VSA,MiniMax-H3-Semantic-Bridge,ComfyUI-Ref2VA-VSA,Minimax-h3_Singularity,minimax-h3_fl2v_8Step_motion_enhancer,ComfyUI-VDN-H3,vdn-minimax-h3,FastH3-Ref2V-Stream-Controller). L’écosystème du modèle vidéo open source MiniMax-H3 s’étend rapidement avec quantification, accélération et ponts sémantiques. Exemple : https://github.com/sepiablue-ai/ComfyUI-MiniMax-H3-W4A4-VSA - "LLaDA-Image: Building Strong Image Generators" — 3 pt, 2026-09-04. https://arxiv.org/abs/2609.03796 — Article sur un Diffusion Transformer open source de 6 milliards de paramètres.
- Deux LoRA pour Krea 2 Turbo —
F16/krea2-turbo-sda(2 pt, 10 septembre, https://huggingface.co/F16/krea2-turbo-sda) etlvladikov/Krea2-Turbo-Distill-4step-LoRA(2 pt, 8 septembre), ce dernier affirmant améliorer la qualité de 45 % grâce à une distillation en quatre étapes. - "Viggle/Viggle-Animate" — 10 pt, 2026-09-05. https://huggingface.co/Viggle/Viggle-Animate — Technique permettant de remplacer un personnage dans une vidéo à partir d’une seule image redessinée.
- "How a 20-year-old independent builder from Bihar created an open omni AI model" — !ai_reddit, 0 pt, 2026-09-11. https://www.reddit.com/gallery/1wdii5s — Un modèle omni ouvert de 5,84 milliards de paramètres dépasserait le modèle AFM 3B d’Apple dans le benchmark MATH-500.
Signaux
- Le terrain de jeu open source s’est déplacé du modèle lui-même vers l’écosystème périphérique. Autour de MiniMax-H3, plus de dix outils de quantification, d’accélération, de nœuds ComfyUI et de LoRA ont été publiés en une semaine. L’attention communautaire est concentrée là-dessus.
- L’expression sur Lemmy autour de ce sujet dépend en pratique de la curation d’une seule personne, Even_Adder. Le résultat ressemble davantage à un répertoire de liens qu’à des fils de discussion, et les publications reçoivent presque zéro commentaire.
- Du côté propriétaire, l’actualité principale n’est pas une compétition de performances entre nouveaux modèles, mais le pivot spectaculaire de Midjourney vers un spa médical. Le ton est plus celui de la critique d’entreprise et de l’ironie que de l’actualité technologique.
- Des critiques émanant d’organisations de défense des droits humains, comme le rapport d’Amnesty International, sur la légalité et la collecte de données par l’IA générative, émergent aussi parmi les sujets liés aux modèles propriétaires.
- GPT-6 Astra, sorti en septembre 2026, ne générant pas directement d’images ou de vidéos, reste peu pertinent pour ce thème et obtient un score négatif sur Lemmy.
Limites
- La recherche Lemmy dépend de la correspondance de mots-clés. Les recherches sur
Sora,Veo,Runway,Kling,Grok ImagineetNano Bananan’ont produit aucun résultat pertinent, seulement des contenus sans rapport. Ces thèmes sont donc à peine discutés sur Lemmy. !«メールアドレス», variante sur une autre instance, n’a pas pu être chargé en raison d’une erreur HTTP 503. La version dbzer0 a été utilisée à la place.- Les API de plusieurs communautés (
/api/v3/community?name=...) renvoyaient des erreurs 404, empêchant de vérifier précisément leurs abonnements. - Vingt publications pertinentes ont été collectées, mais Lemmy reste une plateforme très petite pour ce thème. Les sources sont concentrées dans quelques communautés et quelques comptes, avec peu de discussions originales : la plupart des contenus sont des liens ou des republications.
Pinterest — Actualités de l’IA de génération d’images et de vidéos
Les 50 épingles figurant dans output/pinterest.pins.md — collectées à partir d’une requête unique, « Image and Video Generation AI News », sans catégorisation — ont toutes été ouvertes et examinées visuellement.
Thèmes visuels
- Les arrière-plans d’interface futuristes bleu néon/violet dominent largement. Les fonds noirs avec motifs de circuits, logos IA lumineux et silhouettes humanoïdes holographiques se retrouvent autant dans les infographies que dans les miniatures vidéo
[1, 3, 4, 5, 34, 37, 39, 41, 48]. - Plusieurs miniatures reprennent le même modèle : visage d’un YouTubeur barbu, gros texte « AI NEWS » et assemblage de logos d’entreprises. Des expressions surprise ou sceptiques visent à attirer l’attention, avec les logos Google, OpenAI, Microsoft, Meta et Anthropic répétés
[4, 20, 21, 45]. - Les infographies de classement « best AI video tool » sont très nombreuses et réutilisent quasiment le même gabarit : cartes numérotées, logos, liste de caractéristiques et mention « best for ». Runway, Pika, Kling AI, Luma (Dream Machine), Canva, Hailuo et Synthesia sont présents dans presque toutes ces listes
[7, 8, 13, 24, 40]. - Le format « vrai ou généré par IA » est très visible : quiz de comparaison de paysages, explications sur les deepfakes et jauges de détection de voix IA font partie de plusieurs catégories d’épingles
[16, 17, 20, 37]. - Les images de robots humanoïdes utilisés comme symbole interchangeable de l’IA sont fréquentes : robot présentateur de journal, robot pointant la Terre, portrait moitié humain moitié cyborg. Elles servent d’illustrations génériques sans lien direct avec la technologie décrite
[2, 34, 37, 39, 48]. - Une épingle montre une grille de démonstration de transformation de matériaux : le même personnage, chien ou véhicule est transformé en blocs de bois, origami, Lego ou fleurs. C’est une démonstration concrète de l’expressivité d’un modèle de génération vidéo
[6]. - Plusieurs épingles promotionnelles pour freelances/prestataires sont présentes : annonces du type « je crée des vidéos IA », parfois avec un contact WhatsApp ou des annonces Fiverr utilisant une image générée de Jeff Bezos
[15, 32, 42]. - Les vraies actualités produit, sous forme de captures d’annonces officielles, ne représentent qu’une minorité. La plupart sont des infographies ou miniatures produites en série pour le SEO ou l’affiliation. Les contenus réellement informatifs concernent notamment Google Veo 2/3, Microsoft VASA-1, Vidu S1 de ShengShu, le modèle d’upscale d’Adobe, AMD Amuse 3.0 et l’accord de droit d’auteur ByteDance-MPA
[3, 5, 12, 29, 46, 10, 47, 31].
Épingles notables
- #3/#5 — Google announces ultra-high quality video / Veo 2 promo — Matériel promotionnel officiel de Google : chien nageant sous l’eau, flamant rose, animation d’une fille dans une cuisine et autres exemples de sorties Veo 2.
- #12 — Veo 3 Image-to-Video: Fast Generation & Native Audio via Gemini API — Mise à jour précise présentant la génération image-vers-vidéo Veo 3 et l’audio natif via l’API Gemini.
- #6 — Grille de démonstration de transformation de matériaux (type Luma) — Grille comparant la conversion de la même vidéo source en blocs de bois, origami, Lego et fleurs ; l’une des images montrant le plus concrètement les performances du modèle.
- #16 — "Why Is Trump Obama AI Video Trending?" — Infographie détaillée analysant une tendance de vidéos IA virales. Les outils mentionnés sont Runway ML, Pika Labs, Kaiber, HeyGen, CapCut AI et DeepBrain AI.
- #29 — ShengShu Technology unveils Vidu S1 — Épingle d’annonce pour un modèle chinois présenté comme offrant une « génération interactive en temps réel ».
- #31 — ByteDance and Hollywood reach global deal on AI copyright — Actualité juridique selon laquelle ByteDance et la MPA, l’association américaine du cinéma, seraient parvenues à un accord sur la protection du droit d’auteur pour les outils d’IA de génération d’images et de vidéos.
- #44 — "More than 20% of YouTube is now AI-generated" — Une des rares épingles avançant une statistique précise.
- #46 — Microsoft VASA-1 — Démonstration d’un résultat de recherche capable de produire une vidéo parlante à partir d’une photo et d’un extrait audio.
- #47 — "Amuse 3.0" (AMD) — Annonce d’une nouvelle version de l’outil de génération d’images IA.
- #37 — Infographie de détection de voix IA ("97% likely AI generated") — Épingle de sensibilisation sur l’authenticité, l’éthique et la détection de contenu IA.
Signaux
- Les outils commerciaux propriétaires — Runway, Pika, Kling AI, Luma, Canva, Hailuo, Synthesia et D-ID — restent le centre de gravité des discussions. Leurs logos apparaissent dans presque toutes les infographies de classement. Aucune épingle ne met clairement au premier plan des options open source ou auto-hébergées, comme Stable Video Diffusion, des workflows ComfyUI ou Open-Sora.
- Google Veo 2/3 constitue l’actualité produit officielle la plus visible, avec un accent mis sur la génération image-vers-vidéo et l’audio natif via l’API Gemini.
- Parmi les acteurs chinois, Vidu S1 de ShengShu est présenté sous l’angle de la génération interactive en temps réel.
- Les préoccupations liées aux deepfakes et à l’authenticité — tendance de la vidéo Trump-Obama, détection de voix IA, quiz « laquelle est générée par IA ? » — forment un sous-thème constant sur Pinterest.
- Des informations sur la structure du secteur et le droit, comme la part de contenus IA sur YouTube dépassant 20 % ou l’accord ByteDance-MPA, sont également présentes.
- En revanche, les analyses techniques approfondies — architecture des modèles, méthodes d’entraînement, comparaisons de benchmarks — sont presque inexistantes. La plateforme est surtout orientée vers les présentations d’outils, les tutoriels et l’explication de phénomènes viraux.
Limites
- La requête de collecte était unique (
"Image and Video Generation AI News") et les contenus n’étaient pas catégorisés entre open source et propriétaire. Cette analyse présente donc les 50 épingles ensemble, la séparation par catégorie étant laissée à l’étape d’intégration ultérieure. - Certaines épingles sont peu liées au thème ou utilisent des images de stock génériques : par exemple
#35, image d’actualité avec une carte du monde ;#43, statue jouant du violoncelle ;#22, élément graphique Adobe Stock. La recherche Pinterest semble avoir inclus ces éléments comme bruit. - Pinterest n’affiche pas de date de publication pour les épingles, de sorte qu’il est impossible de déterminer leur date précise. Seules les mentions « 2025 » ou « 2026 » dans les titres peuvent servir d’indice.
- Les titres des épingles sont du texte mis en cache par Pinterest ; ils peuvent différer de la date et des détails réellement présents sur les articles liés. Cette page ne les vérifie qu’à partir de l’image et du titre.
Actions recommandées
- Refaire la recherche sur X avec des noms propres — Midjourney, Sora, Runway, Kling, Flux, ComfyUI, etc. — plutôt qu’avec des mots-clés tendance.
- Observer dans le temps l’écart de score Elo entre Qwen-Image-3.0-Pro et GPT Image 2 afin de suivre le différentiel de performances entre open source et propriétaire.
- Continuer à suivre les comptes Bluesky surveillant les pages tarifaires pour confirmer ou infirmer l’hypothèse du ralentissement de Sora.
- Étendre les termes de recherche Reddit afin d’atteindre l’objectif de 20 résultats.
- Ne pas considérer seules les infographies de classement Pinterest ou les publications d’affiliation répétées sur Bluesky comme fiables avant corroboration sur d’autres plateformes.
Images collectées


















































Note sur la qualité des données
X n’a fourni aucune publication liée à l’IA de génération d’images ou de vidéos en raison d’un mauvais choix de requêtes. Reddit n’a produit que 12 résultats, au lieu d’environ 20 attendus ; YouTube n’a pas permis de récupérer les vues ni les abonnements à cause du rendu JavaScript ; Bluesky a dû abandonner certains mots-clés en raison d’erreurs 403 persistantes.



