KEN’S CAT LOG

Actualités de l’IA de génération d’images et de vidéos — 2026-09-05

GPT-6 « Astra » a dominé le buzz autour des modèles fermés sur X et Bluesky cette semaine, tandis que les modèles open source de vidéo et d’image (LTX-2.5, MiniMax H3, Qwen-Image-3.0) ont suivi le rythme presque entièrement au sein de l’écosystème ComfyUI. La plus grande actualité, tous sujets confondus, a été le virage de Midjourney, qui délaisse la génération d’images pour le matériel d’échographie médicale.

Récapitulatif des actualités de l’IA de génération d’images et de vidéos — modèles fermés vs open source — 2026-09-05

Salut ! Le monde de l’IA de génération d’images et de vidéos a été un chaos total cette semaine www🔥 Côté modèles fermés, GPT-6 « Astra » d’OpenAI a fait un buzz énorme sur X (ex-Twitter), dépassant les 100 millions de vues et raflant complètement la mise 😳 De leur côté, les projets open source n’ont pas démérité : des modèles très puissants comme LTX-2.5, MiniMax H3 et Qwen-Image-3.0 sont sortis successivement en open weights, et ComfyUI s’impose comme leur véritable vaisseau-mère 🛠️ Une autre nouvelle, plus discrète mais très folle, est que Midjourney aurait abandonné la génération d’images pour se réorienter vers les scanners à ultrasons médicaux 😱 C’était vraiment sidérant. Autre découverte : sur Reddit, les débats sur le traitement juridique des œuvres générées par IA ont davantage marqué les utilisateurs que l’évolution technologique elle-même.

À travers les plateformes

Plateforme par plateforme

Reddit : le récapitulatif mensuel de r/StableDiffusion est un fil exceptionnel : sorties massives de modèles ouverts comme Qwen3.8, DeepSeek-V4-Pro, Ling-3.0 et Gemma-4-31B, à un rythme que même les commentaires n’arrivent pas à suivre https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/ . À noter aussi Atlas de World Labs, une technologie qui génère immédiatement des mondes 3D à partir de vidéos ou de photos et qui pourrait s’étendre à la robotique https://www.reddit.com/r/accelerate/comments/1w5ye9s/ . Pourtant, le fil ayant le plus décollé n’était pas technologique : c’était celui sur la décision jugeant constitutionnel le contenu pédopornographique généré par IA. Les sujets juridiques et éthiques semblent davantage enflammer Reddit.

X : la recherche n’a remonté que quatre publications liées à Astra ; GPT-6 Astra a donc eu le champ libre 🎤 Parmi elles, la plus technique était la démonstration par le développeur @Dimillian d’un pipeline 3D « Blender vers UE5 » https://x.com/Dimillian/status/2095596700815516004 . Aucun sujet open source — Stable Diffusion, Flux, Wan, etc. — n’est apparu dans ce périmètre de recherche : c’est une vraie lacune.

YouTube : côté fermé, les comparatifs abondent : Nano Banana 2, Kling 3.0 contre Veo 3.1 contre Sora 2, ainsi que Seedance 2.5 et Seedream 5.0 Pro https://www.youtube.com/watch?v=AAD7wJ3DWiA . Côté ouvert, LTX-2.5 — un modèle très rapide qui génère 10 secondes en 720p en 6,8 secondes — https://www.youtube.com/watch?v=RjlbDhs1MPk , et HunyuanImage 3.0, un MoE de 80 milliards de paramètres https://www.youtube.com/watch?v=U-8RjjU7x14 , illustrent une époque où les modèles open weights sont comparés aux acteurs fermés dès leur sortie. Une information a également circulé selon laquelle OpenAI fermerait l’API Sora pour concentrer ses ressources sur le prochain modèle, « Spud » ; la vidéo YouTube elle-même n’a toutefois pas été vérifiée.

Bluesky : le traditionnel « benchmark de l’image du pélican » de Simon Willison est devenu un point d’observation régulier de la qualité des modèles fermés https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c . Le compte officiel de Replicate joue le rôle de hub pour les annonces de modèles vidéo tels que Kling 3.0, Seedance 2.0, Runway Gen-4.5 et Vidu Q3 https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c . Il y a presque aucune communication primaire autour de l’open source ; ostris, développeur d’outils LoRA, va jusqu’à dire que la communauté IA/ML est restée presque entièrement sur X (Twitter) 😅 Du côté japonais, on trouve notamment un partage d’article GIGAZINE sur Qwen-Image-3.0 https://gigazine.net/news/20260722-qwen-image-3/ .

Lemmy : !«メールアドレス» est la communauté la plus dense en informations sur l’open source. Les sujets MiniMax H3 — Comfy devenu revendeur commercial https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller , outils fonctionnant avec 16 Go de VRAM, etc. — représentaient près de la moitié des publications. LLaDA-Image, dont la recette d’entraînement est entièrement publiée https://arxiv.org/abs/2609.03796 , est également très intéressant. Côté fermé, la nouvelle qui a obtenu de très loin les meilleurs scores n’était pas un nouveau modèle mais le pivot de Midjourney, passé de la génération d’images aux scanners médicaux à ultrasons, avec des scores de 58 à 73.

Pinterest : visuellement, les modèles fermés dominent très largement : Google Veo 2/3, Microsoft VASA-1, Grok 4.6 et le franchissement du milliard d’utilisateurs de Gemini nourrissent les images de synthèse. Parmi les noms propres open source, on trouve à peine l’outil local d’AMD « Amuse 3.0 ». Les cas d’usage consistant à « animer ou créer des visages » — synchronisation labiale, reproduction d’expressions, génération de portraits — sont extrêmement nombreux. Cela semble refléter une bonne adéquation entre l’audience Pinterest, intéressée par la beauté et les idées de publications sociales, et la vidéo générée par IA.

À surveiller

  1. Les prochaines informations sur GPT-6 Astra orientées image et vidéo — X, https://x.com/flowith/status/2095750768204877858 (comparatif d’animation GPT-6 Astra contre GPT-5.6 annoncé prochainement)
  2. Fin de l’API Sora → futur modèle « Spud » — D’après une recherche YouTube, l’API doit fermer le 24 septembre 2026. Personne n’a encore confirmé les images ou les fonctions concrètes.
  3. L’évolution de la licence commerciale de MiniMax H3 — Lemmy, https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller (la voie hybride : open weights, mais usage commercial payant, va-t-elle s’installer ?)
  4. Le virage de Midjourney vers les dispositifs médicaux — Lemmy, https://lemmy.zip/post/66397234 (un acteur historique des modèles fermés va-t-il réellement quitter la génération d’images ?)
  5. La recette d’entraînement totalement ouverte de LLaDA-Image — Lemmy/arXiv, https://arxiv.org/abs/2609.03796 (jusqu’où les futurs modèles ouverts bien classés sur Qwen-Image-Bench seront-ils reproduits ?)
  6. Atlas de World Labs — Reddit, https://www.reddit.com/r/accelerate/comments/1w5ye9s/ (comment la génération de mondes 3D à partir de vidéos pourra être réutilisée pour les données d’entraînement de robots)

Recommandations

  1. Il faudrait relancer la collecte sur X avec des termes spécifiques comme « Stable Diffusion », « ComfyUI », « Flux », « Wan », « Kling » et « Sora », plutôt que de dépendre des tendances.
  2. L’API searchPosts de Bluesky a renvoyé une erreur 403 ; la prochaine fois, il serait plus efficace d’élargir à l’avance une liste de comptes connus via Google.
  3. Les modèles tels que MiniMax H3, « open weights mais payants pour le commercial », devraient être signalés explicitement dans le rapport au lieu d’être classés simplement comme ouverts.
  4. Les informations sur les abandons ou les réorientations des grands acteurs — le pivot de Midjourney ou l’arrêt de Sora chez OpenAI — méritent une veille récurrente, car elles attirent davantage l’attention que les nouvelles techniques.
  5. Pinterest contient peu d’informations primaires ; il vaut mieux l’utiliser comme thermomètre de la perception grand public que comme source pour suivre les tendances techniques.
  6. La tendance observée sur Reddit et Lemmy, où les décisions judiciaires et controverses éthiques font davantage le buzz que les nouveautés techniques, mérite d’être retenue comme signal distinct dans les prochaines synthèses.

Qualité des données

  • X : les publications collectées étaient basées sur des tendances localisées en Croatie. Hormis quatre publications sur GPT-6 Astra, les résultats étaient du bruit sans rapport avec le sujet : cryptomonnaies, Elon, sport, etc. Aucune mention open source n’a été trouvée, et l’objectif de 20 analyses n’a pas été atteint.
  • Bluesky : l’API officielle de recherche renvoyait 403 ; la méthode a donc été remplacée par la consultation individuelle des fils de comptes connus. Seules une douzaine de publications directement pertinentes ont été trouvées, avec presque aucune information primaire open source.
  • Reddit : une seule requête a produit 12 fils dans 9 subreddits, sous le seuil de 20. Les six premiers commentaires de chaque fil au maximum ont toutefois été enregistrés.
  • YouTube : les résultats de recherche et pages de vidéos étant rendus en JavaScript, les nombres de vues, d’abonnés et les dates exactes de publication n’ont pas pu être confirmés directement ; les dates ont été estimées à partir de libellés relatifs dans les extraits.
  • Lemmy : en raison de son caractère fédéré, les recherches sur une seule instance manquent des publications d’autres instances. Les recherches directes sur les services vidéo fermés — Sora, Kling, Veo, etc. — ont presque toutes échoué.
  • Pinterest : seules 24 images sur 50 ont réellement été ouvertes et vérifiées ; pour les autres, seuls les titres ont été consultés. Les données ne contiennent pas d’indicateurs d’engagement comme les mentions J’aime ou les enregistrements.

Résumé par plateforme

Reddit

Reddit — Actualités de l’IA de génération d’images et de vidéos

Les 12 fils collectés proviennent de 9 subreddits. Une seule requête a été utilisée : « Image and Video Generation AI News ».

Subreddit Abonnés Nombre de fils collectés
r/generativeAI 150,575 4
r/GrokAiDiscussion 4,883 1
r/freetoolsAI 7,616 1
r/StableDiffusion 1,000,814 1
r/accelerate 77,800 1
r/news 31,531,475 1
r/antiai 313,317 1
r/allthequestions 127,064 1
r/teenagers 3,673,210 1

r/generativeAI arrive en tête par le nombre de publications, avec quatre fils, et constitue le principal lieu pour les échanges plus informels sur la recherche et la comparaison d’outils. Les autres subreddits n’ont fourni qu’un fil chacun. Il est notable que le sujet ait aussi atteint des communautés non spécialisées dans la génération d’images ou de vidéos, comme r/news et r/teenagers.

Ce que disent les gens
  • #4 r/StableDiffusion « Local AI News You Missed - August 2026 » (201 pt, 22 commentaires, 2026-08-31, https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/) — Synthèse mensuelle affirmant que de nombreux modèles open source, dont Qwen3.8, DeepSeek-V4-Pro-0813, la série Ling-3.0 et Gemma-4-31B, sont sortis rien qu’en août. Les ajouts ont continué dans les commentaires : u/Narutobirama(20) indique « You probably missed Qwen3.8 Flash Next. », tandis que u/MoJaKF(14) écrit « Anima-3.8B its already on its 1.1 release that just released 3h ago », illustrant un rythme que même les récapitulatifs n’arrivent plus à suivre.
  • #5 r/accelerate « …They built an AI that looks at a few casual real-world videos or photos and instantly turns them into a full 3D playground » (763 pt, 76 commentaires, 2026-09-03, https://www.reddit.com/r/accelerate/comments/1w5ye9s/) — Atlas de World Labs génère des mondes 3D interactifs depuis des vidéos ou photos. Les réactions sont enthousiastes, comme u/stainless_steelcat(48) : « Matrix bullet time comes to real life...now I know it wasn't ambitious enough. » Le potentiel d’utilisation des technologies vidéo pour créer des données d’entraînement en robotique est aussi évoqué.
  • #6 r/generativeAI « Same prompt. Same 30 seconds. Two different AI video models. » (98 pt, 30 commentaires, 2026-09-03, https://www.reddit.com/r/generativeAI/comments/1w60fip/) — Comparatif entre Seedance 2.5 et Wan 3.0 avec le même prompt. u/SpecialistDragonfly9(5) estime que « seedance is the by FAR superior one », mais u/Positive-Key6640(4) remet en cause la méthode : « Same-prompt comparisons are fun but they mostly measure which model happens to like your prompt style, not which one is better ».
  • #2 r/GrokAiDiscussion « Have they loosened the image to video generation moderation » (14 pt, 28 commentaires, 2026-08-29, https://www.reddit.com/r/GrokAiDiscussion/comments/1w1w0e8/) — Les utilisateurs livrent des impressions opposées sur la modération de Grok Imagine. À u/Miserable_Appeal515(2), qui déclare « it has gotten better », u/joderrelldalejr(2) répond : « Hell no it gets worse and then they start to limit how many images you can even do in a week ».
  • #1 r/generativeAI « List of daily AI video generative websites » (38 pt, 27 commentaires, 2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3frr2/) — Échanges d’astuces pour les utilisateurs qui exploitent les quotas gratuits. Kling AI proposerait « 66 free credits every 24 hours », u/Murky-Race-3443(1) rappelle que « capcut gives daily free credits btw », et u/Julia_Leeds94(1) présente YalleryLabs, à partir de 0,18 $ pour cinq secondes de vidéo 720p avec un budget de 3 $.
  • #3 r/freetoolsAI « Free AI Image Generator » (31 pt, 31 commentaires, 2026-09-04, https://www.reddit.com/r/freetoolsAI/comments/1w6w0rj/) — Une publication promotionnelle pour un générateur d’images gratuit sans inscription a attiré des commentaires. u/Odd-Lingonberry1516(2) liste Deepany, Aifun et Perchance comme alternatives ; u/thecragmire(1) demande : « How do you maintain this? It's got to cost you something, right? »
  • #11 r/generativeAI « GOOD image-to-video ?? » (1 pt, 13 commentaires, 2026-08-29, https://www.reddit.com/r/generativeAI/comments/1w20rq1/) — Kling AI est décrit comme « practically king of the hill for realistic human motion », tandis que Runway serait « The gold standard for creative control ». Pour une approche locale, u/Ok-Addition1264(2) recommande ComfyUI avec WAN22/LTX2.3.
  • #7 r/generativeAI « Any good Ai video site ? Even if it paid ? » (0 pt, 15 commentaires, 2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3kptg/) — u/Previous-Course-5160(1) juge que gen-3 de Runway « actually handles motion pretty well compared to a lot of the jank », mais se montre plus sévère envers Pika : « fun for quick little loops...but the output gets samey after a while ».
  • #8/#10 r/news « Federal Judge rules AI generated child sex abuse material is protected by First Amendment. » (1,379 pt, 545 commentaires, 2026-09-02, https://www.reddit.com/r/news/comments/1w5k6pr/) et r/allthequestions « Why did a federal judge declare the creation of AI generated child porn as legal? » (31 pt, 277 commentaires, 2026-08-31, https://www.reddit.com/r/allthequestions/comments/1w3hf3o/) — Les discussions sur le statut juridique des œuvres générées par IA ont recueilli un engagement exceptionnel. u/Ntroepy(414) souligne qu’un titre est trompeur : « The headline reads like click-bait...bound by a 2002 Supreme Court ruling », tandis que u/TheGracefulCrane(31), dans r/allthequestions, résume l’interprétation juridique : « judges dont make laws and the law hasnt been updated to make it illegal ergo the ruling ».
  • #9 r/antiai « AI generated images are becoming harder to detect » (113 pt, 30 commentaires, 2026-08-30, https://www.reddit.com/r/antiai/comments/1w2mr8g/) — Contrairement à son titre, le fil s’est surtout transformé en blagues sur des erreurs anatomiques, comme u/GurInside278(31) : « why are her feet her hands ».
  • #12 r/teenagers « To all AI image/video generator users » (7 pt, 41 commentaires, 2026-08-31, https://www.reddit.com/r/teenagers/comments/1w2y305/) — Publication contestant l’idée que l’art IA ne demanderait aucun travail. Les réactions expriment toutefois une forte hostilité adolescente envers l’IA, comme u/LiterallyGarbage_0(5) : « people who use ai to make "art" genuinely make me so upset...pick up a pencil ».
Signaux
  • En hausse : la fréquence de sortie des modèles open source locaux — LLM, image et vidéo — est si élevée qu’elle dépasse déjà la capacité de suivi des commentaires du fil #4. Atlas de World Labs (#5) ouvre aussi une nouvelle piste d’intérêt : la conversion de génération vidéo en données pour la robotique.
  • Conflits d’opinions : les avis sur la modération de Grok Imagine (#2) sont totalement partagés entre amélioration et dégradation. Le duel Seedance contre Wan (#6) oppose lui aussi ceux qui considèrent Seedance nettement supérieur et ceux qui jugent qu’un comparatif à prompt identique a peu de sens. Aucune conclusion unique ne s’impose.
  • Relativisé ou remis en question : le format classique de comparaison de modèles à prompt identique (#6) est lui-même critiqué méthodologiquement par u/Positive-Key6640.
  • Point surprenant : le fil #9, intitulé « les images IA deviennent plus difficiles à détecter », est en réalité devenu une source de plaisanteries sur les ratés de mains et de pieds. Il existe donc un décalage entre le titre et les réactions. Les décisions judiciaires (#8 et #10, plus de 800 commentaires cumulés) ont aussi très largement dépassé les nouvelles produit : sur Reddit, le statut légal et éthique des créations IA est le principal foyer de controverse, davantage que les avancées techniques.
Limites
  • La recherche a utilisé une seule requête, « Image and Video Generation AI News », et n’a réuni que 12 fils dans 9 subreddits. Elle reste sous l’objectif d’environ 20 publications par réseau demandé dans brief.md.
  • Cette étape s’est limitée à la lecture des fichiers précollectés par le worker, output/reddit.threads.md et .threads.json, sans nouvelle collecte avec d’autres termes ni accès direct aux fils et commentaires, conformément au playbook. Les omissions probables se situent donc hors du périmètre de cette requête unique.
  • Seuls les six premiers commentaires de chaque fil au maximum ont été enregistrés ; les réactions moins visibles et les opinions minoritaires ne sont pas représentées dans ce rapport.

X

X — Actualités de l’IA de génération d’images et de vidéos

Comptes

Sur les 34 comptes de cette collection, quatre seulement ont publié du contenu lié à l’IA de génération d’images ou de vidéos — tous à propos du même lancement et durant les mêmes 24 heures (2026-09-03) :

  • @OpenAI (OpenAI) — une publication seulement, mais elle résume toute l’histoire : 309 095 mentions J’aime, 55 587 republications, environ 108 000 000 de vues. Le compte a fait le minimum, avec un unique tweet d’annonce illustré, et a laissé le volume parler.
  • @MatthewBerman (Matthew Berman) — compte d’influenceur IA, une publication (4 054 mentions J’aime, environ 1 500 000 vues) présentée comme un fil de première prise en main avec « early access », le positionnant comme testeur plutôt que comme source.
  • @Dimillian (Thomas Ricouard) — une publication (7 199 mentions J’aime, environ 2 300 000 vues), montrant un pipeline précis — Blender → Unreal Engine 5 — au lieu d’un simple enthousiasme général. C’est l’affirmation technique la plus concrète du lot.
  • @flowith (Flowith) — le plus petit compte ici (947 mentions J’aime, environ 115 000 vues), un compte produit qui profite du lancement pour proposer une comparaison directe avec le modèle précédent.

Tous les autres comptes de la collection — 34 comptes au total, 40 publications — comptes crypto et mèmes (@songoncardano, @nmkr_io, @legsdotfun, @robincatonhood), comptes de fans d’Elon/Tesla (@LunarOptimus, @Optimus_RH, @HeavyMetalShip), influenceurs cybersécurité (@corewarrior, @hackerzspace), comptes d’actualités et de mèmes de Pologne, d’Afrique ou de Bosnie, comptes de fans d’Ariana Grande (@vodolove a publié 3 de ses 4 éléments), et comptes de concours de marques de bière (@naturallight, @ChinookCi) — n’ont aucun rapport avec l’IA de génération d’images ou de vidéos. Ils ne sont mentionnés ici que parce que c’est ce que la collecte a effectivement renvoyé ; voir Limites.

Publications
1. Lancement de GPT-6 « Astra » — @OpenAI

« This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast. »

De très loin la plus grande publication de l’ensemble de la collecte. Elle présente Astra comme un agent généraliste d’utilisation d’ordinateur, non comme un modèle spécifiquement dédié à l’image ou à la vidéo. Pourtant, les démonstrations qui ont suivi sur d’autres comptes sont toutes visuelles ou 3D, ce qui suggère que les forces mises en avant d’Astra se situent de ce côté.

2. Astra contre le modèle précédent, sous l’angle de l’animation — @flowith

« GPT-6 Astra VS GPT-5.6 on animation coming soon to flowith.io »

Un compte produit tiers annonce explicitement une comparaison Astra contre la génération précédente en animation : un signal concret qu’Astra est testé et commercialisé sur ses capacités de génération d’animation, et pas seulement sur son utilisation générale d’ordinateur.

3. Fil de prise en main en accès anticipé — @MatthewBerman

« Astra (GPT-6) is here!!! I've had early access and tested it like crazy with things like games, code, writing, browser control, presentations and general knowledge work. This is the best model I've ever used. Period. »

Il est notable de voir ce qui n’est pas cité : l’image ou la vidéo n’apparaissent pas explicitement dans la liste de capacités, même si le fil promet des « incredible demos below ».

4. Présentation Blender vers Unreal Engine 5 — @Dimillian

« Astra is very good at 3D modeling, and I can't wait for all of you to experience it, for now here is a little walkthrough on how I built the demo house for our launch blog post. From a Blender scene to a Unreal Engine 5 walkable experience. »

L’affirmation la plus concrète et spécifique à un outil de la collection : Astra est utilisé dans un véritable pipeline de contenu 3D, de Blender à UE5. C’est le flux de travail le plus proche de la génération vidéo et visuelle que X ait fait apparaître dans cette collecte.

Signaux
  • En hausse : GPT-6 « Astra » est la seule actualité liée à l’image ou à la vidéo remontée par cette collecte, et elle domine très largement en engagement : environ 108 millions de vues pour la publication de lancement seule, contre quelques centaines de milliers pour les autres. Le regroupement des réactions — comparaison produit, prise en main d’influenceur, démonstration de pipeline 3D par un développeur — dans les 24 heures ressemble à un lancement coordonné, et non à une découverte organique.
  • Absent ou écarté : aucun modèle open source de génération d’images ou de vidéos — Stable Diffusion, Flux, Wan, HunyuanVideo, Kling, ComfyUI, etc. — n’apparaît nulle part dans cette collection. Si des travaux open source sont actifs sur X actuellement, cette recherche ne les a pas atteints.
  • Surprenant : très peu du discours entourant le lancement « IA » cite réellement la génération d’images ou de vidéos. La liste de tests en accès anticipé de Matthew Berman l’omet entièrement, et Astra est présenté comme un agent généraliste (« anything you can do on a computer »). L’angle image et vidéo est déduit de ce que les premiers testeurs ont choisi de montrer — modélisation 3D, comparaison d’animation — et non du cadrage d’OpenAI.
Limites
  • Les recherches collectées ne visaient pas ce thème. Les dix termes réellement recherchés — « Astra », « $SONG », « Robinhood », « Elon », « #CyberSecurity », « Poland », « Africa », « Bosnia », « ariana », « #Sweepstakes » — provenaient de la liste des tendances de X pour cette session, et non de mots-clés choisis pour l’IA de génération d’images ou de vidéos. Seules les recherches « Astra » ont fourni du contenu pertinent ; les 36 autres publications sont du bruit issu d’une liste de recherche inadaptée.
  • Les critères de complétude ne sont pas atteints. Le brief demande environ 20 publications analysées par plateforme ; cette collecte ne fournit que 4 publications utilisables, toutes liées au même lancement fermé, GPT-6 Astra, et aucune sur l’open source. Une nouvelle recherche portant sur « Stable Diffusion », « ComfyUI », « Flux », « Kling AI », « Runway », « Sora », « Midjourney », « Wan 2.x » ou « HunyuanVideo » serait nécessaire pour couvrir réellement le brief sur X.
  • Réserve géographique : la liste Explore de X était localisée en Croatie, explicitement étiquetée « Trending in Croatia » pour la plupart des entrées. C’est pourquoi des jetons crypto, le football bosnien et des actualités ou mèmes des Balkans dominent la liste ayant servi de point de départ. Il s’agit des tendances d’une localisation serveur, pas d’un aperçu mondial.
  • Aucune couverture open source. Rien dans cette collection ne traite des actualités, outils ou sorties open source de génération d’images et de vidéos : cette lacune est totale, pas partielle.

YouTube

YouTube — Actualités de l’IA de génération d’images et de vidéos (source fermée / open source)

Chaînes

Chaînes trouvées via la recherche YouTube et les résultats de recherche d’actualités. Pour beaucoup d’entre elles, les pages vidéo étant rendues en JavaScript, le nombre d’abonnés n’a pas pu être confirmé directement (voir ## Limites).

  • Theoretically Media — chaîne de référence qui teste régulièrement des IA génératives open source telles que Wan, FLUX et Qwen-Image dans ComfyUI. (« Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial... » https://www.youtube.com/watch?v=3BFDcO2Ysu4)
  • Matt Wolfe / The Next Wave — connus pour leurs comparatifs d’outils IA fermés : Runway, Kling, Veo et Sora.
  • Plusieurs chaînes personnelles consacrées aux outils IA, publiant des tests de modèles individuels tels que LTX-2.5, MiniMax H3 et Nano Banana 2 ; seuls les titres des vidéos étaient visibles dans les résultats de recherche.
Vidéos
Modèles fermés
  1. « Nano Banana 2 Is INSANE – Full Test of Google's New Image Model! » — vers le 2026-02-26 — https://www.youtube.com/watch?v=k0dujOUePeU — Test de Gemini 3.1 Flash Image de Google, surnommé Nano Banana 2, présenté comme résolvant le compromis entre vitesse et qualité.
  2. « Nano Banana 2 vs Nano Banana Pro: I Tested Both So You Don't Have To » — fin février 2026 — https://www.youtube.com/watch?v=B1d3SIfoQLk — Comparatif des sorties des versions standard et Pro afin de déterminer laquelle utiliser.
  3. « Kling 3.0 Surprised Me! Compared To Veo 3.1 & Sora 2 » — vers le 2026-02-05 — https://www.youtube.com/watch?v=AAD7wJ3DWiA — Comparaison directe entre Kling 3.0 de Kuaishou, Veo 3.1 et Sora 2 ; Kling y est jugé solide en réalisme visuel et mouvements de caméra.
  4. « Is Kling 3.0 Actually Good? (I Spent $500 Testing For You) » — vers le 2026-02-04 — https://www.youtube.com/watch?v=Rme22R7a9O8 — Test payant des fonctions multishot et de sortie 4K60fps de Kling 3.0.
  5. « Seedream 5.0 Tested & Seedance 2.5 Leaks Are Unreal! » — vers le 2026-07-15 — https://www.youtube.com/watch?v=pn-YwWn3kkM — Test du modèle d’images Seedream 5.0 Pro de ByteDance et de Seedance 2.5, alors non publié ; la vidéo indique que ByteDance a sauté Seedance 2.1.
  6. « Seedance 2.5 Is Insane — 30 Seconds In ONE Shot? » — vers le 2026-06-23 — https://www.youtube.com/watch?v=8sGVhuoPOXI — Vérifie l’affirmation selon laquelle Seedance 2.5 peut générer 30 secondes de vidéo continue en un seul plan.
  7. « MiniMax H3 Review | Testing Hailuo's New 2K AI Video Model » — début août 2026 — https://www.youtube.com/watch?v=67CCQBAwZiA — Test pratique de MiniMax H3, ou Hailuo 3.0, publié le 2026-07-31, avec vidéos 2K de 15 secondes et audio stéréo natif.
  8. « Hailuo AI's NEW MiniMax H3 Model Is INCREDIBLE! (Full Test) » — vers août 2026 — https://www.youtube.com/watch?v=la0iBk8g8_g — Test complet des fonctions omnimo­dales de MiniMax H3 : texte, image, vidéo et audio en entrée simultanée.
  9. « FLUX 3 Sneak Peek » — 2026-07-23 — https://www.youtube.com/watch?v=PCPhl8qMF_Y — Présentation anticipée de FLUX 3 de Black Forest Labs, modèle multimodal pour image, vidéo de 20 secondes, audio et action ; la vidéo a atteint la disponibilité générale le 2026-08-04.
  10. « Gen-4.5 Updates — Research Demo Day 2025 | Runway » — 2025-12-16 — https://www.youtube.com/watch?v=yNXxuzmiwEo — Présentation technique officielle de Runway sur Gen-4.5, notamment le contrôle de la caméra et la cohérence des personnages.
  11. « All in one AI | Text to Image & Video AI | Kling, Veo, Sora, Nano Banana Pro | Daily Free Credits! » — récent — https://www.youtube.com/watch?v=SnmRpf_VfgU — Vidéo montrant comment utiliser les quotas gratuits de plusieurs IA fermées : Kling, Veo, Sora et Nano Banana Pro.
Modèles open source
  1. « LTX 2.5 In ComfyUI — Setup, First Gens, And The Catch » — mi-août 2026, environ trois semaines après la publication open weights de LTX-2.5 le 2026-08-11 — https://www.youtube.com/watch?v=RjlbDhs1MPk — Installation native dans ComfyUI du modèle mondial 22B de Lightricks et vérification d’une génération de vidéo 720p de 10 secondes en 6,8 secondes.
  2. « LTX 2.5 ComfyUI: Physics Test vs MiniMax H3 + Free Workflows » — il y a environ trois semaines — https://www.youtube.com/watch?v=WpKNXZZqQEU — Comparaison directe de LTX-2.5 open weights et de MiniMax H3 non public sur la physique et le multishot.
  3. « New LTX 2.5 Video Model is INSANELY Fast (ComfyUI Local) » — il y a environ trois semaines — https://www.youtube.com/watch?v=pA2BQw9LY8A — Test centré sur la vitesse d’exécution locale.
  4. « Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial for Open Source SOTA Image & Video Gen Models » — Theoretically Media — https://www.youtube.com/watch?v=3BFDcO2Ysu4 — Tutoriel ComfyUI sur Wan 2.2, modèle vidéo MoE, FLUX, FLUX Krea et Qwen Image. Wan 2.2 est jugé proche de Sora en cohérence, tandis que FLUX est considéré supérieur en détail.
  5. « HunyuanImage 3.0 — The Most Powerful Open-Source Image Generator Yet » — 2025-09-30 — https://www.youtube.com/watch?v=U-8RjjU7x14 — Présentation du modèle d’images MoE de Tencent à 80 milliards de paramètres, annoncé comme ayant un léger avantage en taux de victoire face à Seedream 4.0, Nano Banana et GPT-Image.
  6. « Flux.2 Dev: Full Review, Pros & Cons, ComfyUI Setup! » — vers le 2025-11-26 — https://www.youtube.com/watch?v=MoAwonm53hQ — Test et installation ComfyUI de FLUX.2, y compris sa version open weights. La vidéo présente la possibilité de conserver la cohérence d’un sujet avec jusqu’à dix images de référence.
  7. « FLUX 2 Released! 🤯 ComfyUI Install, Workflow & The "Active Parameter" Secret » — vers le 2025-11-26 — https://www.youtube.com/watch?v=nfeDS_EoblE — Installation de FLUX.2 dans ComfyUI et explication de ses nouveautés.
  8. « Qwen Image First Look & LOCAL Testing (The BEST New Image Model?) » — 2025-08-05 — https://www.youtube.com/watch?v=ex2YCqtTHSY — Première vérification en local de Qwen-Image d’Alibaba, prédécesseur de Qwen-Image-2512.
  9. « Qwen Image Edit 2511–Local Image Editing in ComfyUI | Multi-Reference Style Transfer & GGUF Workflow » — 2025-12-26 — https://www.youtube.com/watch?v=iFnTqZmsRIc — Test du transfert de style à partir de plusieurs images de référence avec Qwen Image Edit dans un workflow GGUF ComfyUI.
  10. « MiniMax H3: The New Open-Source Video Champ? » — vers août 2026 — https://www.youtube.com/watch?v=3R5GROj8Tcg — Présente MiniMax H3 comme un modèle vidéo omnimo­dal open weights, évoquant une première place dans un classement d’édition vidéo.
Signaux
  • Les open weights rattrapent rapidement le haut de gamme : LTX-2.5, publié le 2026-08-11, et MiniMax H3, le 2026-07-31, sont tous deux sortis en open weights dans les 60 derniers jours. Les miniatures de comparaison mettent en avant l’idée qu’ils rivalisent avec MiniMax H3 fermé, voire le dépassent. Les modèles ouverts ne sont plus présentés comme des poursuivants : ils deviennent des références de comparaison dès leur lancement.
  • Cycle de sortie rapide chez ByteDance : Seedream 5.0 Pro et Seedance 2.5, avec Seedance 2.1 sauté, sont mis à jour à quelques mois d’intervalle ; les vidéos de testeurs utilisent fortement les codes de l’actualité immédiate, comme « Tested » et « Leaks ».
  • Réorganisation de l’écosystème Google : toute la ligne Imagen doit être abandonnée le 2026-08-17, au profit de Nano Banana, basé sur Gemini 3.x Image. Nano Banana 2, sorti le 2026-02-26, fait déjà l’objet de plusieurs comparatifs avec ses successeurs, notamment Pro.
  • Retrait d’un grand acteur fermé : OpenAI prévoit de fermer l’API Sora le 2026-09-24 et de rediriger ses ressources de calcul vers « Spud », son prochain modèle, selon les résultats de recherche ; la vidéo YouTube n’a pas été vérifiée. C’est un tournant majeur pour les évolutions des modèles fermés.
  • ComfyUI devient la base de test de fait de l’open source : Wan, FLUX, Qwen-Image et LTX-2.5 sont presque toujours présentés avec une procédure d’installation ComfyUI dans les vidéos de test open source.
Limites
  • Les pages de résultats de recherche YouTube (youtube.com/results?...) et les pages vidéo (youtube.com/watch?v=...) sont rendues en JavaScript. Une récupération directe ne fournissait que les liens de navigation du pied de page, sans données brutes comme les vues, abonnés ou dates de publication exactes. Les dates ont donc été estimées à partir des extraits de moteurs de recherche, d’indications relatives comme « 3 weeks ago », ou de mentions dans les articles. La majorité des comptes de vues et d’abonnés reste non vérifiée.
  • Aucune vidéo YouTube directe concernant la fin de Sora chez OpenAI et son successeur « Spud » n’a été trouvée ; cet élément repose sur des mentions dans des articles d’actualité. Les éventuelles vidéos de réaction sur YouTube n’ont pas été vérifiées.
  • Des vidéos officielles ont été trouvées pour les mises à jour récentes de Runway Gen-4.5 et Midjourney, mais aucun test récent, dans les 60 derniers jours, par un évaluateur indépendant n’a été trouvé au cours de cette recherche.
  • Des liens ont été confirmés pour des vidéos de test de Nano Banana Pro, aux titres tels que « Nano Banana Pro… wtf », mais les noms de chaîne et les vues n’ont pas pu être récupérés.

Bluesky

Bluesky — Dernières évolutions de l’IA de génération d’images et de vidéos

Comptes
  • Simon Willison @simonwillison.net — développeur connu pour ses évaluations de modèles LLM et d’images. À chaque nouveau modèle, il publie son traditionnel « benchmark de l’image du pélican ». Les réactions de ses abonnés sont nombreuses, ce qui en fait une excellente source primaire pour les modèles d’images fermés.
  • fofr @fofr.ai — spécialiste des prompts d’images autour de Replicate. Il publie fréquemment des usages pratiques de Nano Banana Pro, ou Gemini 3 Pro Image.
  • Replicate (officiel) @replicate.com — compte officiel de l’entreprise d’hébergement d’API de modèles IA. Il annonce l’arrivée de nouveaux modèles sur Replicate et constitue une source rapide pour les lancements vidéo, ouverts ou fermés.
  • Amanda Silberling (journaliste TechCrunch) @amanda.omg.lol — journaliste couvrant les dimensions culturelles de la génération d’images par IA.
  • AI News Updates @ai-latestnews.bsky.social — compte bot publiant automatiquement des actualités de l’industrie IA.
  • gigowat @gigowat.bsky.social — compte partageant sur Bluesky des articles du média technologique japonais GIGAZINE. Il fait partie des rares sources d’actualités japonaises sur l’IA de génération d’images.
  • ostris @ostris.com — développeur de l’outil open source d’entraînement LoRA « AI-Toolkit ». Il publie sur les modèles de la famille Flex, mais indique lui-même que l’univers IA/ML est resté presque entièrement sur Twitter ; ses mises à jour sur Bluesky sont donc rares.
Publications
  1. Simon Willison — Publication d’une grille comparant les images de pélican générées par GPT-6 Astra et GPT-5.6 Sol/Terra/Luna, soit une comparaison de modèles d’images OpenAI fermés. 2026-09-04, 👍91 · 🔁6 · 💬12.
    https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c
    Il a aussi publié une version pleine taille de l’image générée, dont le texte alternatif a également été produit par GPT-5-astra. 👍23.
    https://bsky.app/profile/simonwillison.net/post/3mupxztoyqs2c

  2. Simon Willison — Comparatif d’une image de pélican générée avec Google Gemini 3.7 Flash. 2026-09-02, 👍6.
    https://bsky.app/profile/simonwillison.net/post/3muitt5g3q22r

  3. fofr — Partage du prompt détaillé permettant de recréer un rendu de jeu rétro avec Nano Banana Pro, ou Gemini 3 Pro Image. 2026-01-19, 👍31.
    https://bsky.app/profile/fofr.ai/post/3mcrt3avp222p
    Le même jour, il a également partagé un prompt pour créer des captures d’écran de type Street View. 👍10.
    https://bsky.app/profile/fofr.ai/post/3mcrilugr5c2m

  4. Replicate (officiel) — Annonce de la disponibilité de « GPT Image 2 » d’OpenAI sur Replicate. La publication souligne son photoréalisme, sa précision pour le rendu de texte et ses usages d’interface ou de design. Modèle fermé. 2026-04-21.
    https://bsky.app/profile/replicate.com/post/3mjzygaefs224

  5. Replicate (officiel) — Annonce de l’ouverture à tous les utilisateurs du modèle vidéo « Seedance 2.0 » de ByteDance. Il combine texte, image, vidéo et audio dans une même scène, avec génération synchronisée de son stéréo. Modèle fermé. 2026-04-09.
    https://bsky.app/profile/replicate.com/post/3mj3junhvnh26

  6. Replicate (officiel) — Ajout de Gen-4.5 de Runway à Replicate, un modèle de génération vidéo mettant l’accent sur le réalisme physique. Modèle fermé. 2026-02-18.
    https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c

  7. Replicate (officiel) — Ajout de Kling 3.0 (+ o3) de Kuaishou à Replicate. Il prend en charge le multishot 4K et la synchronisation audio. Modèle fermé. 2026-02-17.
    https://bsky.app/profile/replicate.com/post/3mf35lkhoyw2q

  8. Replicate (officiel) — Ajout de Vidu Q3, modèle de génération vidéo depuis du texte, des images ou des images de début et de fin, jusqu’à 16 secondes en 1080p. Modèle fermé. 2026-03-11.
    https://bsky.app/profile/replicate.com/post/3mgsan3ddpl2w

  9. Amanda Silberling (TechCrunch) — Publication demandant des témoignages d’experts sur les raisons pour lesquelles les images de nourriture générées par IA ont souvent une esthétique particulière. 2026-08-28, 👍17 · 🔁5 · 💬4.
    https://bsky.app/profile/amanda.omg.lol/post/3mu5itcncgc2x

  10. AI News Updates (bot) — Indique que « Midjourney Inc. a acquis l’application d’astrologie Co-Star et lance une nouvelle application de génération d’images ». 2026-07-25. Cette information concorde avec les articles de TechCrunch et Bloomberg, datés du 2026-07-24, qui indiquent que l’acquisition s’est conclue au printemps ; elle peut donc être recoupée.
    https://bsky.app/profile/ai-latestnews.bsky.social/post/3mrh6gdxnqy2s

  11. gigowat (partage japonais d’un article GIGAZINE) — Partage d’un article sur Qwen-Image-3.0, IA open source de génération d’images, évaluée pour ses illustrations et son rendu de texte japonais. 2026-07-22.
    https://bsky.app/profile/gigowat.bsky.social/post/3mr7dvb332z2q
    (Article source : https://gigazine.net/news/20260722-qwen-image-3/ )

  12. ostris — Annonce de la sortie de « Flex.2-preview », modèle open source d’images combinant texte-vers-image, contrôle universel et inpainting. Publication plus ancienne, du 2025-04-22, mais exemple rare d’un développeur de modèle open source communiquant directement sur Bluesky. 👍4.
    https://bsky.app/profile/ostris.com/post/3lngo5cf66k2a

Signaux
  • Les modèles fermés dominent : les publications ayant réellement suscité de l’engagement sur Bluesky se concentrent sur les grands modèles fermés : GPT, Gemini et Nano Banana Pro, ou Midjourney. Le benchmark du pélican de Simon Willison est devenu un observatoire régulier de la qualité des modèles d’images fermés.
  • Le compte Replicate sert de hub rapide pour la vidéo : Kling 3.0, Seedance 2.0, Runway Gen-4.5 et Vidu Q3 ont tous été annoncés via le compte officiel de Replicate depuis le début de 2026. Même si les mentions J’aime restent faibles, souvent une ou deux, le compte est utile pour suivre l’ordre chronologique des sorties.
  • La communication open source reste faible sur Bluesky : presque aucune mention primaire n’a été trouvée pour les principaux modèles open weights de 2026, tels que Wan 2.7 d’Alibaba, HunyuanVideo 1.5 de Tencent, Chroma ou LTX-2.3. ostris, développeur d’un outil d’entraînement LoRA, écrit lui-même que la communauté IA/ML est presque entièrement restée sur Twitter, ce qui suggère que le centre de gravité communautaire demeure sur X.
  • Les publications japonaises passent surtout par GIGAZINE : les posts en japonais sont majoritairement des repartages d’articles de sites d’actualité comme gigowat ; aucune analyse primaire indépendante n’a été trouvée.
Limites
  • L’API de recherche de publications officielle de Bluesky, app.bsky.feed.searchPosts, a systématiquement renvoyé 403 Forbidden via l’outil WebFetch pendant cette session. Il a donc été impossible de collecter de façon exhaustive des publications par mots-clés avec leurs indicateurs d’engagement. La méthode a été remplacée par la consultation de fils de comptes connus, trouvés via Google, avec getAuthorFeed.
  • La page de recherche bsky.app est une SPA rendue en JavaScript ; WebFetch, qui convertit uniquement le HTML en Markdown, n’a pas permis de récupérer le texte des publications.
  • Du fait de ces contraintes, la recherche n’a pas pu vérifier exhaustivement toutes les publications correspondant à des noms de modèles spécifiques. Elle a sélectionné les éléments pertinents dans les fils récents de comptes reconnus. Un peu plus de 20 publications et fils ont été examinés au total, mais seulement une douzaine concernaient directement l’IA de génération d’images et de vidéos.
  • Pour les modèles open source Wan, HunyuanVideo, Chroma, Z-Image et LTX-2.3, plusieurs comptes ont été testés mais aucune publication pertinente de 2026 n’a été découverte. Le fil de huggingface.bsky.social était vide et civitai-bot.bsky.social ne semblait plus actif depuis mai 2024.
  • Une publication d’un compte personnel, en février 2026, suggérait que Midjourney était devenu partie de Meta.ai. Les sources externes ont montré qu’il s’agissait en réalité d’un accord de licence datant d’août 2025, Midjourney restant indépendant ; l’information n’a donc pas été retenue dans ce rapport.

Lemmy

Lemmy — Dernières évolutions de l’IA de génération d’images et de vidéos (modèles fermés / open source)

Communautés
  • !«メールアドレス» — 5 708 personnes. Discussions techniques sur l’ensemble de l’IA de génération d’images et de vidéos open weights. C’est la communauté la plus riche en informations de cette enquête.
  • !«メールアドレス» — 2 360 personnes. Espace de partage de créations réalisées avec les modèles Stable Diffusion. Peu de contenu d’actualité.
  • !«メールアドレス» — 1 593 personnes. Dédiée à l’art IA de style anime. Faible valeur d’actualité.
  • !«メールアドレス» — 50 personnes. Communauté bot relayant automatiquement des flux RSS Reddit ; il ne s’agit pas de discussions humaines.
  • !«メールアドレス» et !«メールアドレス» — communautés générales d’actualité technologique. Les publications exclusivement consacrées à la génération d’images ou de vidéos par IA y sont rares et noyées dans les actualités IA générales.
  • Il n’existe pas sur Lemmy de grande communauté spécialisée dans l’IA de génération d’images et de vidéos comparable à r/StableDiffusion de Reddit ; les discussions sont réparties dans les petites communautés ci-dessus.
Publications
Modèles open source
  1. MiniMax H3 : Comfy devient revendeur officiel de licences commerciales — !«メールアドレス», score 4, 2026-08-28. Article source : https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller . MiniMax H3 est un modèle vidéo open weights publié en août 2026. Il fonctionne localement sur des GPU de niveau RTX 3060 et génère des vidéos 2K avec son stéréo natif. Comfy est devenu revendeur des licences commerciales Professional et Enterprise ; l’offre Enterprise permet même d’utiliser les modèles non distillés.
  2. LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes — !«メールアドレス», score 2, 2026-09-04. https://arxiv.org/abs/2609.03796 . Modèle d’images dont la recette d’entraînement est complètement ouverte, avec un score de premier plan sur Qwen-Image-Bench et une version turbo distillée plus rapide.
  3. Trellis.2 et Pixal3D intégrés nativement à ComfyUI — !«メールアドレス», score 4, 2026-09-01. https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native . Annonce selon laquelle « les meilleurs modèles ouverts de génération 3D » font désormais partie du cœur de ComfyUI.
  4. ComfyUI-MiniMaxH3-CLSS — !«メールアドレス», score 0, 2026-09-01. https://github.com/nazgut/ComfyUI-MiniMaxH3-CLSS . Outil destiné à MiniMax H3, permettant apparemment de générer des vidéos avec audio de longueur arbitraire même sur des machines grand public dotées de 16 Go de VRAM.
  5. Fizgig LoRA/LoKR Studio — !«メールアドレス», score 4, 2026-08-30. https://github.com/shootthesound/Fizgig . Outil ouvert permettant d’entraîner et d’extraire des LoRA/LoKR pour plusieurs familles de modèles : Krea 2, MiniMax, Klein 9B, etc.
  6. VibeVoice-ComfyUI, intégration du TTS open source de Microsoft dans ComfyUI — !«メールアドレス», score 1, 2026-08-28. https://github.com/nikhilprasanth/VibeVoice-ComfyUI . Exemple de l’intégration de l’audio aux workflows de génération vidéo.
  7. Boogu-Image-0.1 — Efficient Image Generation Foundation Model — !«メールアドレス», score 5, 2026-06-17. Modèle de base ouvert de génération d’images, axé sur la légèreté et l’efficacité.
Modèles fermés
  1. Midjourney se réoriente de l’IA de génération d’images vers les scanners médicaux à ultrasons — !«メールアドレス», score 58, 2026-06-18. https://lemmy.zip/post/66397234 . Plusieurs fils associés, dont des miroirs Hacker News atteignant un score de 40 ou plus, ont alimenté une forte discussion sous les termes « Midjourney Medical » et « Ultrasonic CT ». C’est l’une des plus grandes nouvelles concernant une plateforme fermée historique d’images.
  2. Midjourney demande aux studios hollywoodiens de divulguer en détail leur utilisation de l’IA — !«メールアドレス», score 73, 2026-07-05. https://lemmy.today/post/56011946
  3. Sortie du nouveau modèle d’images de Google, « Nano Banana 2 Lite » — !«メールアドレス», score 0, 2026-07-02. https://lemmy.world/post/48936394(miroir Hacker News : https://lemmy.bestiver.se/post/1199483 )
  4. MAI-Image-2.5 de Microsoft approche Nano Banana 2 de Google dans les benchmarks — !«メールアドレス», score 1, 2026-05-28. https://lemmy.durstig.online/post/35068
  5. Test comparatif pratique de Seedream 5.0 Pro — !«メールアドレス», score 1, 2026-07-10. https://lemmy.durstig.online/post/46063
  6. Runway annonce le doublement de son activité entreprise et un taux de rétention nette des revenus supérieur à 300 % — !«メールアドレス», score 0, 2026-08-30. https://lemmy.durstig.online/post/56937
  7. La fonction Earth AI de Google retirée discrètement le lendemain de sa sortie à cause d’un problème de génération NSFW — !«メールアドレス», score 1, 2026-08-07. https://lemmy.durstig.online/post/52162
Signaux
  • L’open source est dominé par MiniMax H3 : près de la moitié des publications de la communauté stable_diffusion, entre fin août et début septembre 2026, concernent MiniMax H3 : génération vidéo, fonctionnement local sur des GPU de niveau RTX 3060, audio intégré, extensions ComfyUI et outils d’accélération. Il semble devenir une référence de la vidéo ouverte.
  • La frontière entre ouvert et fermé devient floue : MiniMax H3 est open weights, mais son usage commercial nécessite une licence payante achetée via Comfy. Ce modèle hybride, gratuit à l’usage mais payant pour le commercial, pourrait devenir courant.
  • La plus grande nouvelle côté fermé est un retrait : plutôt que la course aux nouveaux modèles, l’annonce du pivot de Midjourney vers l’équipement médical a recueilli des scores très largement supérieurs, de 58 à 73. L’idée qu’un des acteurs majeurs de l’image fermée change totalement d’activité a davantage captivé les utilisateurs de Lemmy.
  • La génération 3D est elle aussi intégrée à ComfyUI : Trellis.2, Pixal3D et d’autres modèles ouverts de texte/image-vers-3D entrent dans les fonctions principales de ComfyUI. Les workflows locaux intègrent donc progressivement les actifs 3D, au-delà des seules images et vidéos.
  • Lemmy ne possède pas de grande communauté dédiée à l’IA de génération d’images et de vidéos ; les discussions sont réparties entre des communautés techniques proches de Stable Diffusion, comptant quelques milliers de personnes, et de petites communautés bot comme ai_reddit, qui ne comptent qu’une cinquantaine de membres.
Limites
  • Lemmy est fédéré et son API de recherche ne couvre que l’index d’une instance donnée. La recherche via l’API de lemmy.world manque donc des publications d’autres instances, telles que lemmy.dbzer0.com ou lemmy.today. Cette enquête a recoupé API et recherches de plusieurs instances, sans pouvoir prétendre à l’exhaustivité.
  • La communauté localllama de lemmy.ml a renvoyé une erreur 404 lors de la récupération directe des informations de communauté via /api/v3/community, empêchant une vérification détaillée.
  • !«メールアドレス» est une communauté bot qui republie mécaniquement des flux RSS Reddit. Avec 50 abonnés, elle comporte presque aucune discussion humaine. Elle peut servir de source d’actualité, mais ses données ne constituent pas un indicateur de l’intensité des débats sur Lemmy.
  • Les recherches directes portant sur les services fermés de génération vidéo — Sora, Kling AI, Veo et Runway Gen — ont renvoyé presque uniquement des résultats sans rapport, tels que des noms de lieux, de personnes ou des nouvelles générales. Une seule publication économique sur Runway a été trouvée.
  • Le volume de publications reste extrêmement faible par rapport à Reddit, avec des scores le plus souvent compris entre un chiffre et quelques dizaines. Lemmy seul ne fournit pas assez de matière pour analyser vingt publications et en tirer des tendances solides. Sept requêtes liées ont été exécutées sur plusieurs instances, puis des exemples représentatifs parmi les publications réelles trouvées ont été retenus.

Pinterest

Pinterest — Actualités de l’IA de génération d’images et de vidéos

Thèmes visuels
  • Le style « miniature YouTube / image de couverture de blog » est très largement majoritaire. Les compositions reposent sur des fonds noirs ou bleu marine, des dégradés néon bleus, violets et orange, et de très gros titres sans serif tels que « AI NEWS », « THE FUTURE IS AI », « BREAKING NEWS » et « AI IS CHANGING EVERYTHING! ». Les visuels portent davantage sur des articles et vidéos parlant d’IA que sur les créations générées elles-mêmes [2, 7, 11, 38, 39, 42, 48]
  • Les visages et portraits humains constituent le motif central. Animation d’expressions, synchronisation labiale, recréation de visages via Microsoft VASA-1, séances photo IA avec ChatGPT + Higgsfield : les usages consistant à créer ou animer un visage reviennent constamment [13, 14, 18, 23, 50]
  • Les visuels d’humanoïdes et de robots sont souvent employés comme symbole générique de l’IA. On trouve de nombreuses images de stock sans lien avec des outils particuliers : profil de robot blanc, femme cybernétique, etc. [2, 39]
  • Les compositions en grille « avant/après » ou « une image d’entrée vers plusieurs styles ». Exemples : une vidéo réelle transformée en bois, origami, briques Lego ou bouquet de fleurs, probablement avec un outil de type Luma ; ou images comparant l’intégration d’un personnage en peluche dans des décors réalistes [3, 31]
  • Les infographies de comparaison et de classement d’outils. Listes de logos, tableaux opposant « Best Quality (Paid) » et « Best Free », comparatifs de fonctionnalités avec coches : des visuels d’aide au choix d’outils [7, 37]
  • Les miniatures utilisent des visages inspirés de personnalités réelles. Portrait IA ressemblant à Jeff Bezos, présentateur de type YouTube avec le titre « AI NEWS », photo de conférence de Jensen Huang de NVIDIA : les visages servent à créer de la crédibilité ou de l’attrait [11, 36, 40]
  • Les superpositions de maillages et wireframes faciaux. Des lignes de grille et étiquettes numériques évoquant l’analyse des expressions ou la biométrie sont superposées sur des visages et cous dans des épingles à visée publicitaire [23, 50]
  • Une palette très cohérente. Une ambiance sombre agrémentée de néons cyan, magenta et jaune constitue le langage visuel commun à presque toutes les épingles liées aux outils IA [2, 7, 38, 39, 42]
Épingles notables
  1. [1] Image to Video AI: How It Works and Why It Matters — Image de couverture d’un article expliquant, sous forme de schéma, la conversion d’une image fixe en une « chronologie vidéo » composée de plusieurs images.
  2. [3] Google announces ultra-high quality video... (en réalité, une démonstration de transfert de style à conservation d’identité de type Luma) — Grille 3 × 5 transformant une vidéo source en bois, origami, Lego, fleurs et autres matières. Elle montre clairement une démonstration de conservation du même personnage et de la même voiture tout en ne modifiant que la texture.
  3. [7] 6+ Best AI Video Generation Websites — Infographie à conserver, listant Runway, Pika, Kling AI, Luma AI (Dream Machine), Canva AI et Hailuo AI, avec leurs fonctions, utilisateurs visés et disponibilité ou non d’un plan gratuit.
  4. [10] Veo 2 — Épingle promotionnelle de Google pour VideoFX : plan photoréaliste d’une personne au microscope, nageur sous l’eau, femme animée dansant parmi les constellations, réunis en une seule image.
  5. [14] Veo 3 Image-to-Video: Fast Generation & Native Audio via Gemini API — Visuel promotionnel indiquant que l’API Gemini permet la génération image-vers-vidéo, avec un accent sur l’audio natif.
  6. [23] Microsoft Unveils VASA-1 — Technologie générant presque en temps réel des vidéos de visages parlants expressifs à partir d’une photo, d’un clip audio et de signaux de contrôle. La miniature aligne plusieurs visages et expressions.
  7. [27] ShengShu Technology Unveils Vidu S1 — Épingle annonçant Vidu S1 de ShengShu Technology en Chine, mettant en avant la génération « interactive en temps réel », avec un personnage visuel de style cyberpunk.
  8. [31] Google announces video generation AI 'Veo 3' — Quatre exemples où une image d’entrée, une peluche de monstre violet, est intégrée dans une salle de serveurs réaliste, des ruines sous-marines et une ville en bonbons.
  9. [33] 'Amuse 3.0', an AI art creation tool — Annonce d’une nouvelle version de l’outil local de création artistique d’AMD, basé sur Stable Diffusion. C’est l’un des rares signaux concrets en faveur du local et de l’open source dans un ensemble largement dominé par les outils fermés.
  10. [42] Breaking News Latest AI Developments — Synthèse de trois nouvelles : fonctions d’agent de Grok 4.6, Gemini dépassant un milliard d’utilisateurs et générant 150 millions d’images par jour, et téléphone robot IA de Honor ; datée du 12 août 2026.
Signaux
  • Les modèles fermés se distinguent nettement. Les annonces de Google Veo 2/Veo 3, Microsoft VASA-1, OpenAI, Grok 4.6 et Gemini, qui franchit le milliard d’utilisateurs, alimentent directement les épingles. À l’inverse, les noms typiques de l’open source — Stable Diffusion, ComfyUI, Flux, Wan, HunyuanVideo, LTX — sont presque absents de l’échantillon, à l’exception d’Amuse 3.0 d’AMD. Pinterest semble donc bien davantage orienté vers des contenus de synthèse et de comparaison pour le grand public et les marketeurs que vers les communautés techniques.
  • Forte concentration sur la création et l’animation de visages. Synchronisation labiale, reproduction des expressions, alternative aux séances photo de portrait et vidéos de présentateur IA reviennent continuellement. Cela semble correspondre au croisement entre la demande Pinterest — beauté, amélioration de son image, idées de publications sociales — et le marketing de la vidéo IA.
  • Les synthèses secondaires dominent sur l’information primaire. Les miniatures du type « visage d’un présentateur + titre » et les infographies comparant les outils sont plus fréquentes que les captures de résultats de modèles. Pinterest fonctionne davantage comme porte d’entrée vers des articles de blog, vidéos YouTube et contenus d’affiliation que comme point de diffusion des annonces primaires.
  • Signal d’absence : aucun contenu évoquant le Japon, des publications japonaises ou des entreprises japonaises — telles que des start-ups IA locales ou des services nationaux de génération vidéo — n’a été observé dans l’échantillon. Les outils et actualités anglophones occupent presque tout l’espace.
Limites
  • Sur les 50 éléments de output/pinterest.pins.md, 24 images ont été effectivement ouvertes afin de vérifier leur contenu en tenant compte de leur représentativité. Pour les 26 autres, seuls les titres étaient disponibles ; il est supposé qu’ils relèvent de motifs visuels comparables — infographies, portraits et comparatifs d’outils.
  • Huit épingles portaient le titre « (untitled) » : [12, 19, 20, 30, 35, 39, 46, 50]. Les images [39] et [50] ont été inspectées, mais les autres ne l’ont pas été.
  • Les données collectées pour cette étape ne proposaient aucune répartition par genre : pinterest.pins.md est une simple liste plate. Aucun décompte par genre n’a donc été produit.
  • Pinterest lui-même n’a pas été parcouru au cours de cette étape. Conformément au playbook, l’analyse se fonde uniquement sur les images et titres précollectés par le worker. Les indicateurs d’engagement des épingles — mentions J’aime, enregistrements et commentaires — n’étaient pas inclus dans les données et n’ont pas pu être consultés.

Actions recommandées

  • Relancer la recherche X avec des termes explicites de modèles et d’outils — Stable Diffusion, ComfyUI, Flux, Wan, Kling et Sora — au lieu de dépendre de la liste des tendances.
  • Constituer une liste permanente de comptes Bluesky connus à consulter via getAuthorFeed, puisque app.bsky.feed.searchPosts a renvoyé 403 lors de cette collecte.
  • Identifier explicitement les modèles hybrides ouverts et commerciaux, tels que MiniMax H3, au lieu de les ranger dans une unique catégorie open source.
  • Mettre en place une veille récurrente sur les réorientations ou arrêts des grands fournisseurs — pivot médical de Midjourney, fin de vie de l’API Sora — car ces annonces ont suscité davantage d’intérêt sur Reddit et Lemmy que les lancements de produits.
  • Considérer Pinterest comme un indicateur de sentiment grand public plutôt que comme une source technique primaire, compte tenu de son absence presque totale de couverture open source.

Images collectées

Image to Video AI: How It Works and Why It Matters - The Data Scientist🎨 Création d’images et de vidéos par IAGoogle annonce une vidéo d’ultra-haute qualité...Contenu IA et préoccupations liées aux réseaux sociauxLa plateforme ultime de génération d’images et de vidéos par IA - The Data ScientistConcept de création de contenu par IA avec icônes pour la génération de texte, image, musique et vidéo — Parcourir 57 photos, vecteurs et vidéos de stockRéussissez, tout simplement 🎥️ Image vers vidéo par IA – Animez vos photos avec l’IACréation de contenu vidéo par IA : les hauts revenus,...Google dévoile Veo 2 : outil avancé de génération vidéo IA au réalisme et aux fonctions cinématographiques améliorésActualités IA : OpenAI a enfin publié ce que nous demandionsimageCréez des séances photo IA photoréalistes de vous-même avec ChatGPT + Higgsfield 📸🤖Veo 3 image vers vidéo : génération rapide et audio natif via l’API GeminiTop 10 des outils de synchronisation labiale (2026) – Meilleurs logiciels IA pour une vidéo de lip sync réalisteMeilleurs générateurs vidéo IA de 2025IA pour la génération d’images et de vidéos‎🚨 L’IA devient terriblement performante.imageimageAnalyse d’images et de vidéos pilotée par IAPlus de 20 % de YouTube est désormais généré par IAMicrosoft dévoile VASA-1, établissant de nouvelles normes pour l’IA générative en génération vidéoVidéos générées par IA : bonnes ou mauvaises ? Voici la vérité ! 🤖🎥outils IAQu’est-ce qu’Imagvio AI et comment aide-t-il les créateurs...ShengShu Technology dévoile Vidu S1, apportant la génération interactive en temps réel à la vidéo IAMaîtriser la vidéo et l’IA : principales tendances du marketing des réseaux sociaux 2025"Transformez votre vision avec des vidéos 4K personnalisées propulsées par IA 🎥✨"imageGoogle annonce l’IA de génération vidéo « Veo 3 »,...Histoire de l’IA générative« Amuse 3.0 », un outil de création artistique par IA qui comprend...Cette semaine dans les actualités IA - 15 août 2026imageJe réaliserai une vidéo explicative de création vidéo IA avec synthesia, sora ai, kling ai, runway ai et invideo🚀10 meilleurs outils d’images et de vidéos IA en 2026 | Comparatif gratuit vs payantActualités IA et dernières mises à jour | Tendances et avancées de l’intelligence artificielleimageNouveaux outils IA de Nvidia 🤯 #news #ai #openai #chatgpt #highlights #shortsCroissance du marché des générateurs vidéo IA 2025–2032 : transformer l’avenir de la création vidéo 🎥🤖Dernières actualités IA : Grok 4.6, Gemini 1B, téléphone robot HonorTransformez vos idées en visuels époustouflants ! 🎥Création vidéo IA professionnelle | Vidéos IA cinématographiques | Montage vidéo personnaliséGénération d’images par IAimageGénération vidéo 📹"Pourquoi les chatbots IA n’arrivent pas à suivre les actualités de dernière minute"Comment créer une chaîne d’actualités avec l’IA || Générateur de vidéos d’actualité IA || Synchronisation labiale IAimage

Note sur la qualité des données

X et Bluesky sont restés très loin de l’objectif d’environ 20 publications par plateforme du brief : X n’a remonté que quatre publications pertinentes, toutes portant sur des modèles fermés ; l’API de recherche de Bluesky a renvoyé 403, ce qui a imposé une couverture fondée sur des comptes connus. Reddit, Lemmy et YouTube ont également collecté moins d’éléments que prévu, et YouTube n’a pas pu confirmer les vues et abonnés en raison de ses pages rendues en JavaScript.

Galerie