Actualités de l’IA de génération d’images et de vidéos — 2026-09-06
OpenAIのGPT-6 Astraが「画像・動画生成」というより「PC操作エージェント」としてクローズドソース界隈を独占する一方、オープンソース側はComfyUI周りでQwen Image・MiniMax-H3の実装ニュースを地道に積み上げている。
Récapitulatif des actualités de l’IA de génération d’images et de vidéos — 2026-09-06
Franchement, cette semaine a été complètement folle 😳🔥 Côté solutions propriétaires, c’est carrément le festival OpenAI « GPT-6 Astra » : tout le monde s’enthousiasme moins pour la génération d’images ou de vidéos que pour un « agent capable de contrôler tout un PC ». À l’inverse, Sora semble s’éteindre discrètement, et on dirait qu’un transfert des investissements des apps de génération vidéo vers l’IA agentique est en cours. Côté open source, Qwen Image, Z-Image Turbo, HunyuanImage et MiniMax-H3 accumulent méthodiquement les mises à jour autour de ComfyUI ; c’est moins spectaculaire, mais la densité des nouvelles d’implémentation est vraiment élevée. Pour être honnête, certaines plateformes n’ont toutefois pas été correctement couvertes par les recherches cette fois-ci (Reddit, X, Bluesky) : il n’a donc pas été possible d’examiner solidement vingt éléments partout. Je l’indique clairement dans la section « Qualité des données » ci-dessous 🙏
Toutes plateformes confondues
- GPT-6 Astra (OpenAI) domine presque entièrement l’écosystème propriétaire : sur X (@masahirochaen, https://x.com/masahirochaen/status/2095644339041153256) comme sur Bluesky (@todaystopainews, https://bsky.app/profile/todaystopainews.bsky.social/post/3mur7cyocf225), il monopolise l’attention depuis son lancement. Le score ARC-AGI-3 de 98,6 % (contre 7,8 % pour la génération précédente) fait le buzz.
- Astra est davantage présenté comme un « contrôle agentique » que comme de la « génération d’images » : sur X (@aigeboku, test de la fonction ComputerUse) comme sur Bluesky (démo de construction automatique d’une ville dans Unity), les discussions portent davantage sur sa capacité à « manipuler un PC de son propre chef » que sur une sortie image ou vidéo isolée. Cela pourrait vraiment devenir une nouvelle catégorie.
- Fable 5.1 est très souvent utilisé comme référence comparative : sur X, @renoiseai et @Mayz1169 ont indépendamment publié des vidéos de duel « Astra vs Fable 5.1 » via Seedance 2.5. Dans le post de @k_matsumaru, Fable 5.1 n’est même pas le moteur de rendu final : il sert de couche de génération de prompts dans une chaîne de quatre outils. Presque personne ne termine avec un seul modèle autonome.
- Les API agrégatrices gagnent en visibilité dans les deux écosystèmes : sur Reddit (WaveSpeedAI, qui regroupe plus de 1 000 modèles via une API REST unique) et Bluesky (useapi.net, qui compare Veo, Kling, Seedance, PixVerse, Hailuo, Runway et Nano Banana), les informations pratiques sont jugées plus riches que celles des comptes officiels.
- L’open source se structure autour de Qwen Image / Z-Image Turbo (Alibaba, Tongyi-MAI), HunyuanImage (Tencent), avec MiniMax-H3 comme nouvel entrant : un constat solidement confirmé à la fois par les vidéos de test sur YouTube et par !«メールアドレス» sur Lemmy.
- L’écosystème autour de MiniMax-H3, modèle vidéo à poids ouverts, se développe à très grande vitesse : Lemmy compte à lui seul plus de dix publications entre le 8 août et le 5 septembre (quantification GGUF, Turbo LoRA, prise en charge de vidéos de 120 secondes, implémentation d’attention hybride). Sur X, @ImaStudio_ai a aussi construit son outil commercial sur cette base : c’est un point confirmé entre plateformes.
- ComfyUI est clairement devenu le centre de commandement de l’open source : Lemmy, Bluesky (@kunecco) et les tutoriels YouTube font tous de la compatibilité ComfyUI le test décisif de la réalité d’une technologie.
- Les vidéos multi-plans et la synchronisation audio constituent le prochain axe commun de compétition entre open source et propriétaires : Wan 2.6 (open source) et Kling 3.0 / Seedance 2.0 / Runway Gen-4.5 (propriétaires) ont été comparés directement dans des tests de résistance sur YouTube.
- Le doute « Est-ce de l’IA ou est-ce réel ? » est omniprésent : blagues Reddit sur les mains ratées, discussions en classe et épingles Pinterest de type quiz « Which is AI? » ; ce sujet d’inquiétude ressort quelle que soit la plateforme.
- Les comptes officiels des marques sont presque absents des réseaux sociaux : sur Bluesky, Midjourney officiel (dernier post le 2025-10-08) et Kling AI officiel (aucun post) sont pratiquement inactifs. Les informations arrivent plus vite des comptes non officiels, individuels ou agrégateurs, semble-t-il sur toutes les plateformes.
Plateforme par plateforme
Reddit — 12 fils collectés dans 9 subreddits (loin de l’objectif d’environ 20). Les principaux sujets sont la forte réaction contre une nouvelle méthode permettant à un LLM de piloter la souris pour falsifier entièrement des timelapses de dessin à la main (r/antiai, 5 259 points), l’API agrégatrice WaveSpeedAI, ainsi que la génération locale rapide avec Krea-2-Turbo sur Apple Silicon (45 secondes par image). r/VeniceAI a également publié des conseils très détaillés sur le choix de modèles selon l’usage : génération, édition ou conversion vidéo. Les critiques éthiques et qualitatives sont aussi prononcées (images de nourriture IA très mal reçues, offres d’emploi à 30 $/h assimilées à du spam).
X — Les tendances de la zone Explore sont influencées par la localisation du serveur en Croatie : 7 des 10 termes (Bitcoin, Ukraine, Argentine, etc.) sont totalement hors sujet. Les publications pertinentes sont toutes liées à GPT-6 Astra ; les requêtes open source (Stable Diffusion, Wan, Flux, etc.) n’ont pas du tout été essayées. L’absence de dynamique open source dans cet épisode ne signifie donc pas qu’il n’y en a pas, mais qu’elle n’a pas été examinée.
YouTube — La plus grande actualité propriétaire est l’arrêt de Sora (fin de l’application le 26 avril 2026 et fin prévue de l’API le 24 septembre 2026 ; téléchargements chutant de 3,3 millions à 1,1 million en onze mois). Côté open source, les tests initiaux de Qwen Image, HunyuanImage et Z-Image Turbo abondent ; FLUX.2 de Black Forest Labs (Apache 2.0) est également mentionné comme concurrent.
Bluesky — L’API de recherche plein texte des posts (searchPosts) renvoyait 403 à toutes les requêtes, obligeant à passer par la recherche de comptes ; le nombre de publications analysées est donc inférieur à l’objectif de 20. Côté propriétaire, les « bots d’actualité » comme todaystopainews et useapi.net dominent ; côté open source, ce sont les créateurs individuels publiant des œuvres finies comme Niji-iro et Kunecco. Les informations techniques open source circulent très peu sur Bluesky.
Lemmy — Malgré sa petite taille, !«メールアドレス» (5 708 membres) joue de fait le rôle de tableau d’actualités open source, avec des nouvelles d’implémentation denses autour de MiniMax-H3 et de la prise en charge Day-0 de LTX-2.5. Les actualités propriétaires y sont plutôt consommées sous l’angle de la satire ou du scandale, comme la transition de Midjourney vers les équipements médicaux. Aucune publication source sur Sora, Veo, Kling ou Hailuo n’a été trouvée sur Lemmy.
Pinterest — Vérification de 50 épingles issues d’une seule requête générale collectée à l’avance (sans segmentation par genre). La quasi-totalité consiste en listes comparatives et infographies d’actualité autour d’outils propriétaires comme Runway, Pika, Kling, Luma et Synthesia. Seules deux épingles mentionnent l’open source : Baidu Ernie 4.5 et AMD Amuse 3.0. Pinterest est devenu un marché SEO/marketing des outils propriétaires.
À surveiller
- Jusqu’où la fonction d’agent « ComputerUse » de GPT-6 Astra s’intégrera-t-elle aux flux de création ? — X, https://x.com/aigeboku/status/2096187322924687799
- Quelle est l’identité du modèle supérieur non encore publié, évoqué par Altman comme n’étant pas Astra ? — X, https://x.com/masahirochaen/status/2096372856930386341
- La vitesse d’expansion de l’écosystème GGUF et Turbo LoRA de MiniMax-H3 — Lemmy, https://huggingface.co/Abiray/MiniMax-H3-Pruned-GGUF
- Les conséquences des migrations liées à l’arrêt complet de l’API Sora, prévu le 2026-09-24 — YouTube, https://www.youtube.com/watch?v=H2jVcy5PuBI
- La date de publication des poids de Qwen-Image-2.0 (20B → 7B, devant Nano Banana en Elo) — Lemmy, https://files.catbox.moe/l3mzzs.jpg
- L’évolution des comparaisons prix/performance de modèles propriétaires via des API agrégatrices comme useapi.net — Bluesky, https://bsky.app/profile/useapi.bsky.social/post/3mrdyxqswcb2p
Recommandations
- Continuer à comparer GPT-6 Astra à Fable 5.1 non seulement sur la qualité image et vidéo, mais aussi sous l’angle du contrôle agentique.
- Suivre lors de la prochaine édition l’écosystème ComfyUI de MiniMax-H3 (GGUF et Turbo LoRA), qui se trouve à la pointe de la génération vidéo open source.
- Pour la prochaine enquête sur X, ne pas dépendre des tendances Explore ; interroger explicitement des termes open source tels que Stable Diffusion, Wan, Flux et Qwen.
- Privilégier !«メールアドレス» sur Lemmy comme source primaire d’informations open source, plutôt que Reddit ou Bluesky.
- Ne pas utiliser Pinterest comme source de tendances open source ; le réserver à l’observation du marketing et du SEO des outils propriétaires.
- Mener une enquête de suivi afin d’identifier les outils externes ou flux de travail dépendant de l’arrêt de l’API Sora le 2026-09-24.
Qualité des données
Reddit s’est limité à 12 fils, loin de l’objectif d’environ 20 (la collecte directe via WebFetch n’a pas été possible et dépendait uniquement de données collectées à l’avance). Pour X, la majorité des termes recherchés — 7 sur 10 — étaient des tendances hors sujet, et aucune recherche open source n’a été effectuée : les dynamiques open source sur X n’ont donc pratiquement pas été étudiées. Bluesky a renvoyé 403 via l’API de recherche plein texte pour chaque requête, forçant une collecte par comptes et empêchant d’atteindre l’objectif. Sur YouTube, le rendu dynamique a empêché de confirmer la plupart des vues et abonnés. Lemmy est de petite taille et n’a fourni aucune publication primaire pour Sora, Veo, Kling ou Hailuo, ce qui peut refléter une limite de couverture. Pinterest ne reposait que sur 50 résultats d’une requête générale unique, sans nouvelle recherche ciblée open source.
Récapitulatif par plateforme
Reddit — Actualités de l’IA de génération d’images et de vidéos
Où
La requête « Image and Video Generation AI News » a permis de collecter 12 fils dans 9 subreddits.
| Subreddit | Nombre de membres | Fils collectés |
|---|---|---|
| r/StableDiffusion | 1,001,169 | 1 |
| r/teenagers | 3,674,216 | 1 |
| r/aiwars | 166,685 | 1 |
| r/antiai | 314,968 | 2 |
| r/generativeAI | 150,823 | 3 |
| r/RemoteWorkers | 74,528 | 1 |
| r/VeniceAI | 10,421 | 1 |
| r/DailyIncome | 12,914 | 1 |
| r/freetoolsAI | 7,736 | 1 |
r/generativeAI (3 fils) et r/antiai (2 fils) sont ceux qui traitent le plus ce sujet. r/antiai adopte une position critique vis-à-vis de la génération d’images par IA, tandis que r/generativeAI est centré sur la comparaison d’outils et les conseils pratiques, révélant des sensibilités très opposées.
Ce que disent les utilisateurs
- Alerte sur la falsification de timelapses dessinés à la main par un LLM (fil #1, r/antiai, 5 259 points et 760 commentaires, 2026-09-05, https://www.reddit.com/r/antiai/comments/1w81kdd/). Une méthode consistant à donner à GPT-6 le contrôle de la souris et du clavier afin de falsifier de manière crédible jusqu’au timelapse d’un dessin numérique a suscité une forte opposition : « pourquoi publier une telle technologie, elle n’a d’autre but que de nuire aux vrais artistes » (u/sanstheskelebrotherc, 235 points).
- Comparaison quotidienne d’outils gratuits de génération vidéo (fil #2, r/generativeAI, 42 points et 28 commentaires, 2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3frr2/). Adobe Firefly (2 vidéos par jour), PixVerse (1), Grok Imagine (1) et Google Flow (3 à 4) sont comparés ; les commentaires citent aussi Kling AI (66 crédits toutes les 24 heures, soit 2 à 6 vidéos de 5 secondes en 720p) et les crédits gratuits quotidiens de CapCut.
- Fil de partage d’outils gratuits et illimités de génération d’images (fil #3, r/freetoolsAI, 37 points et 38 commentaires, 2026-09-04, https://www.reddit.com/r/freetoolsAI/comments/1w6w0rj/). La possibilité de générer du contenu NSFW est le principal sujet des commentaires, notamment « pourquoi tout le monde interdit le NSFW ? » (u/Relevant_Syllabub895), avec une liste d’alternatives telles que Deepany, Aifun, Perchance et Z-Image-Turbo sur Hugging Face.
- Une offre « 30 $/h pour examiner des images générées par IA » se propage en parallèle dans deux subreddits (fil #4, r/RemoteWorkers, 114 points et 520 commentaires, 2026-09-04, https://www.reddit.com/r/RemoteWorkers/comments/1w7azwu/ et fil #6, r/DailyIncome, 129 points et 1 123 commentaires, 2026-09-04, https://www.reddit.com/r/DailyIncome/comments/1w7b18p/). Les annonces sont presque identiques, mais la majorité des commentaires se limite à « images » ou « Interested », une avalanche de réponses standardisées à la recherche d’un lien de candidature.
- Démonstration d’accélération de la génération locale d’images (fil #5, r/StableDiffusion, 31 points et 10 commentaires, 2026-09-03, https://www.reddit.com/r/StableDiffusion/comments/1w6bphf/). Vpipe + Krea-2-Turbo-M87 (16 bits) exécutés localement sur Apple Silicon (M5 Pro 24 Go) ont produit des images 1024 × 1024 en 8 étapes à environ 45 secondes par image (35 secondes en temps réel avec quantification 8 bits).
- Fil de mèmes sur la difficulté croissante à détecter les images IA (fil #8, r/antiai, 113 points et 30 commentaires, 2026-08-30, https://www.reddit.com/r/antiai/comments/1w2mr8g/). En pratique, les erreurs de mains restent le principal sujet de plaisanterie, comme « pourquoi son pied est-il une main ? » (u/GurInside278, 31 points).
- Évaluation du service d’agrégation d’API WaveSpeedAI (fil #7, r/generativeAI, 2 points et 4 commentaires, 2026-09-05, https://www.reddit.com/r/generativeAI/comments/1w8ci5z/). Selon u/Jenna_AI, le service « encapsule plus de 1 000 modèles, dont Flux, Wan 2.1/2.6, Hailuo et Kling, via une API REST unique ». Un utilisateur l’ayant intégré à son propre outil avec Seedance (u/BradClarkAI) indique ne rencontrer « aucun problème ».
- Informations de la communauté VeniceAI sur le choix de modèles (fil #9, r/VeniceAI, 8 points et 6 commentaires, 2026-08-30, https://www.reddit.com/r/VeniceAI/comments/1w2rtq1/). u/jerm2z recommande Chroma pour la génération d’images, Qwen Edit Uncensored ou Seedream pour l’édition, FireRed pour sa forte cohérence faciale malgré l’absence de NSFW, puis WAN Enhanced, Seedance et Minimax R2V pour l’image-vers-vidéo.
- Les images IA de nourriture sont jugées « peu appétissantes » (fil #10, r/aiwars, 4 points et 175 commentaires, 2026-09-03, https://www.reddit.com/r/aiwars/comments/1w69cdj/). Avec des commentaires acerbes tels que « on dirait juste une ruche de larves » (u/LCI_Jake, 14 points), un utilisateur ayant testé une génération locale avec Krea 2 en 40 secondes (u/Bassed_Hummble) s’interroge : malgré un prompt banal, « pourquoi le résultat est-il aussi mauvais ? ».
- Débat chez les jeunes sur la légitimité de l’art IA (fil #12, r/teenagers, 7 points et 41 commentaires, 2026-08-31, https://www.reddit.com/r/teenagers/comments/1w2y305/). Une publication affirmant que l’IA crée elle-même les images à partir du prompt, ce qui la distingue fondamentalement de la création humaine à l’aide d’outils ou de logiciels, a divisé les avis. u/TheDarkmore explique utiliser l’IA pour les illustrations des 120 cartes de son jeu, n’étant pas doué en dessin, et considère cela acceptable.
Signaux
- Tendance à la hausse : la nouvelle méthode permettant à un LLM de falsifier un dessin « fait main » jusqu’à son timelapse (fil #1) suscite rapidement des réactions hostiles comme menace distincte de la simple détection de modèles de diffusion. Elle ajoute une nouvelle source de tension au conflit entre pro-IA et anti-IA. Les services agrégateurs tels que WaveSpeedAI, qui regroupent plus de 1 000 modèles dans une API unique (fil #7), et l’accélération de la génération locale sur Apple Silicon (fil #5), constituent également des sujets d’infrastructure et d’efficacité pour développeurs qui progressent discrètement.
- Domaines minimisés ou tournés en dérision : les images IA de publicité alimentaire (fil #10) sont sévèrement critiquées, certains estimant qu’il vaudrait mieux utiliser des photos de banque d’images. Les offres d’emploi à 30 $/h pour examiner des images IA (fils #4 et #6) ont des contenus presque identiques et reçoivent essentiellement des réponses automatiques de candidats cherchant un lien ; elles semblent donc consommées comme du spam plutôt que comme de véritables opportunités professionnelles.
- Opposition surprenante : bien que les deux fils portent sur la difficulté à reconnaître les images IA, r/antiai utilise encore les mains ratées comme ressort comique dans le fil #8, tandis que le fil #1 traite avec sérieux la possibilité de falsifier l’intégralité d’un timelapse. Même au sein de cette communauté, l’évaluation de la réalité de la détection d’images IA est divisée. De même, r/VeniceAI et r/StableDiffusion discutent de choix techniques et d’optimisation, tandis que r/antiai et r/aiwars développent de fortes critiques éthiques et qualitatives : les attitudes envers la génération d’images IA sont fortement fragmentées selon les subreddits.
Limites
- La seule requête utilisée était « Image and Video Generation AI News » ; aucune recherche distincte n’a été effectuée pour l’open source et les solutions propriétaires. Ce fichier seul ne permet donc pas de distinguer directement les dix observations minimum demandées pour chaque catégorie ; cette classification doit être faite au niveau du rapport consolidé.
- Le critère de réalisation prévoyait environ 20 publications analysées par réseau social, mais seuls 12 fils ont été collectés.
- Dans les fils #4 et #6, la plupart des commentaires sont des réponses formatées comme « images » ou « Interested », ne permettant pas de recueillir de véritables échanges ni de vérifications.
- Reddit refuse l’accès direct aux pages via WebFetch ou les moteurs de recherche ; l’analyse repose donc uniquement sur les fichiers précollectés par le worker (reddit.threads.md/json). Aucun approfondissement ultérieur — suivi de fils associés ou exploration accrue des commentaires — n’a été réalisé au cours de cette session.
X
X — Actualités de l’IA de génération d’images et de vidéos
La propre liste Explore de X pour cette session est géolocalisée en Croatie (emplacement du serveur), et non au Japon ni dans un flux mondial. Elle présente les tendances « Astra », « Bitcoin », « Ukrainian », « Argentina », « $SONG », « OpenAI », « Russia », « Black », « $KURO » et « Fable », sans nombres de posts. Seuls trois de ces dix termes (« Astra », « OpenAI », « Fable ») concernent la génération d’images ou de vidéos par IA ; les autres concernent des prédictions de prix crypto, la guerre Russie-Ukraine, des célébrités argentines et des memecoins, et ne sont pas couverts ci-dessous — voir Limites.
Comptes
Comptes pertinents, selon ce qu’ils ont effectivement publié :
| Compte | Ce qu’il publie | Portée de cette publication |
|---|---|---|
| @masahirochaen (チャエン) | Compte japonais d’actualités IA/tech ; a annoncé le lancement de GPT-6 Astra avec des chiffres de benchmark, puis publié un suivi sur la remarque d’Altman selon laquelle « il y a encore plus au-delà d’Astra » | 2 posts, 841 + 133 likes, jusqu’à environ 550 000 vues pour le post de lancement |
| @UNIBRACITY (SHINTARO) | Artiste 3D amateur associant GPT-6 Astra à Blender | 1 post, 306 likes |
| @hayashimon1 (ハヤシモン|AI×個人開発) | Créateur IA/3D qui organise aussi des séminaires payants ; utilise Fable 5.1 × Blender | 1 post, 55 likes |
| @manaimovie (Mankyu) | Amateur de vidéo IA qui donne un modèle 3D Tripo à Astra | 1 post, 409 likes |
| @yachimat_manga (yachimat‑AI Short Anime) | Créateur de courts animes IA, spéculant qu’Astra pourrait remplacer les outils dédiés de génération vidéo pour certains styles | 1 post, 51 likes |
| @aigeboku (AI様の下僕) | Utilisateur avancé de l’IA testant le contrôle agentique « ComputerUse » d’Astra | 1 post, 653 likes |
| @gagarot200 (ガガロット) | Compte de démos IA, clips allant d’un prompt d’une ligne à un jeu | 1 post, 306 likes |
| @SSSS_CRYPTOMAN | Compte à l’intersection crypto et IA, ayant publié une démo de création de jeu avec Astra | 1 post, 161 likes |
| @Mayz1169 (Kiki) / @renoiseai (Renoise) | Comptes de comparaison vidéo IA côte à côte, opposant GPT-6 Astra et Fable 5.1 avec un rendu Seedance 2.5 | 1 post chacun, 64 et 140 likes |
| @k_matsumaru | Créateur vidéo IA documentant un pipeline complet (Typeless → Fable 5.1 → Seedream 5.0 → Seedance) | 1 post, 279 likes |
| @Strength04_X | Compte de partage de prompts pour Seedance 2.5 (via lovart_ai) | 1 post, 444 likes |
| @ImaStudio_ai | Compte produit/studio pour son propre outil de vidéo de mode IA, fondé sur MiniMax H3 | 1 post, 132 likes |
Chacun de ces éléments est un post unique, et non un fil ou une campagne durable : il s’agit d’une réaction dispersée sur une journée à un lancement, pas d’un groupe de comptes organisant la conversation.
Publications
24. @masahirochaen (チャエン)
- 841 likes · 148 reposts · 17 réponses · environ 550 000 vues · 2026-09-03
- https://x.com/masahirochaen/status/2095644339041153256
【超速報】OpenAIが「GPT-6 Astra」発表。PC作業を丸ごと代行 Fable 5.1超えの本命モデルが遂に公開。…ARC-AGI-3(初見のパズルを解く力)98.6% 前世代GPT-5.6は7.8%。異常な伸び
C’est de loin la publication la plus importante de la sélection et celle qui cadre tout le reste : elle présente GPT-6 Astra comme un agent capable d’opérer un PC, dépassant Fable 5.1, avec un bond ARC-AGI-3 de 7,8 % avec GPT-5.6 à 98,6 %.
21. @masahirochaen (チャエン)
- 133 likes · 23 reposts · 8 réponses · environ 20 000 vues · 2026-09-05
- https://x.com/masahirochaen/status/2096372856930386341
サム・アルトマン、GPT-6の"先"を公言…8月にサイバーリスクを理由に作業を一時停止したモデルは、GPT-6 Astraではなかったと明言。
Deux jours après le lancement, le même compte indique qu’Altman a déclaré que le modèle qu’OpenAI avait interrompu en août pour des raisons de cyberrisque n’était pas Astra, laissant entendre qu’un modèle encore plus puissant reste inédit.
3. @aigeboku (AI様の下僕)
- 653 likes · 64 reposts · 7 réponses · environ 43 000 vues · 2026-09-05
- https://x.com/aigeboku/status/2096187322924687799
GPT-6 Astraは「他を操る能力が高い」という通り、ComputerUse使えば色々とやれることが広がりますなあ…流石に一撃は難しいにしても、こっから調整すればもっと面白い表現にできそう。
Le post présente le principal atout d’Astra comme le contrôle agentique (« ComputerUse »), plutôt que comme de la qualité de génération brute. Les premiers testeurs explorent ce que ce contrôle rend possible dans les flux de création, au-delà de la simple sortie d’images.
1. @manaimovie (Mankyu)
- 409 likes · 49 reposts · 16 réponses · environ 20 000 vues · 2026-09-05
- https://x.com/manaimovie/status/2096176821377380677
Astra先生にTripoで作ったモデルを渡して、動くようにして言ったらできたものです。…FableやSolのときよりかなりいい!
Une affirmation concrète de flux de travail : donner à Astra un modèle 3D créé avec Tripo et lui demander de l’animer a mieux fonctionné qu’avec Fable ou « Sol ».
22. @gagarot200 (ガガロット)
- 306 likes · 29 reposts · 7 réponses · environ 95 000 vues · 2026-09-04
- https://x.com/gagarot200/status/2095789680931287390
GPT-6 Astraが完全自動でポン出し…たった一言「GPT-6 Astra」に「こんなゲームを作って」と説明するだけ
Une démo allant d’un prompt d’une ligne à un jeu jouable de bout en bout, présentée comme preuve du positionnement d’Astra : « réaliser toute la tâche ».
23. @UNIBRACITY (SHINTARO)
- 306 likes · 49 reposts · 4 réponses · environ 39 000 vues · 2026-09-05
- https://x.com/UNIBRACITY/status/2096142182050927035
GPT-6 Astra × Blender 『Forest Retreat / フォレスト・リトリート』 Astra稼働時間 約7時間で、ここまでできました。
Une exécution d’Astra d’environ sept heures ayant produit une scène 3D complète dans Blender : l’une des données les plus précises sur la durée réelle du travail dans cette sélection.
4. @SSSS_CRYPTOMAN (SSSS.CRYPTOMAN⚡️AI)
- 161 likes · 23 reposts · 5 réponses · environ 10 000 vues · 2026-09-05
- https://x.com/SSSS_CRYPTOMAN/status/2096248797873762805
GPT-6 Astraであっという間にゲームが完成!🎮…雑なプロンプトから数回のやり取りで普通に遊べるクオリティのものができました
Une autre démo de création de jeu jouable à partir d’un prompt vague, avec lien en direct, confirmant indépendamment l’affirmation de @gagarot200.
2. @yachimat_manga (yachimat - AI Short Anime)
- 51 likes · 6 reposts · 5 réponses · environ 3 600 vues · 2026-09-05
- https://x.com/yachimat_manga/status/2096386820997304354
GPT-6 Astra でモデリングしてみました。…これワンチャン動画のスタイルによっては動画生成いらんくなる未来があるくない?
Un créateur actif d’anime IA envisage que, pour certains styles, la modélisation 3D d’Astra puisse rendre inutiles les outils spécialisés de génération vidéo.
40. @renoiseai (Renoise)
- 140 likes · 16 reposts · 10 réponses · environ 99 000 vues · 2026-09-04
- https://x.com/renoiseai/status/2095773478200996066
GPT-6 Astra vs Fable 5.1 Both videos generated with Seedance 2.5 on Renoise
Un clip comparatif direct, les deux résultats étant rendus par le même outil en aval, Seedance 2.5, afin de contrôler cette variable.
39. @Mayz1169 (Kiki)
- 64 likes · 6 reposts · 10 réponses · environ 12 000 vues · 2026-09-04
- https://x.com/Mayz1169/status/2095795273134170259
forget the benchmarks for a second. just watch this. GPT-6 Astra vs. Fable 5.1 side by side comparison on same prompts. which one would you pick?
Même réflexe de comparaison, de manière indépendante : les face-à-face Astra vs Fable 5.1 constituent un micro-genre identifiable dans ce corpus, et non un cas isolé.
37. @k_matsumaru (松丸 彗吾)
- 279 likes · 34 reposts · 14 réponses · environ 19 000 vues · 2026-09-05
- https://x.com/k_matsumaru/status/2096044983468150935
最近の動画の作り方…① Typelessで指示書を書き起こす ② Fable 5.1に動画生成用プロンプトを書き起こさせる ③ Seedream 5.0 Proで絵コンテに起こして内容精査 ④ Seedance…
Le pipeline de production le plus détaillé de la sélection : Typeless pour le script → Fable 5.1 pour rédiger le prompt → Seedream 5.0 Pro pour le storyboard → Seedance pour la vidéo finale. Fable y sert de couche de prompting, non de moteur de rendu.
32. @ImaStudio_ai (Ima Studio)
- 132 likes · 17 reposts · 3 réponses · environ 4 600 vues · 2026-09-04
- https://x.com/ImaStudio_ai/status/2095725066109804603
MiniMax H3 K-Fashion Outfit Change MV…8 LOOKS. 1 GIRL. ZERO IDENTITY DRIFT.
Un compte de studio commercial fait la promotion d’un produit fondé sur MiniMax H3, en mettant en avant l’absence de dérive d’identité lors de changements de tenue.
Signaux
- Ce qui monte : GPT-6 Astra (OpenAI) domine chaque publication pertinente de cette sélection. Il est d’abord présenté comme un modèle agentique capable d’opérer un ordinateur, et seulement ensuite comme un modèle de génération image/vidéo. Les testeurs l’associent continuellement à d’autres outils — Tripo pour les maillages 3D, Blender pour les scènes — plutôt que de le traiter comme un moteur de rendu autonome.
- Un micro-genre identifiable : des comptes indépendants (@renoiseai, @Mayz1169) publient spontanément des comparatifs « GPT-6 Astra vs Fable 5.1 », rendus avec Seedance 2.5. Fable 5.1 est le modèle servant de point de comparaison, tandis que Seedance et Seedream reviennent comme couche effective de rendu vidéo sous-jacente.
- Des pipelines en chaîne, pas des outils uniques : le post le plus détaillé (@k_matsumaru, #37) enchaîne quatre outils (Typeless → Fable 5.1 → Seedream 5.0 Pro → Seedance) pour une seule vidéo. Personne dans cette sélection ne décrit la création d’une vidéo terminée avec un seul modèle.
- Ce qui a surpris : les termes de tendance extraits du panneau Explore de X, géolocalisé en Croatie — Bitcoin, Ukrainian, Argentina, $SONG, Russia, Black et $KURO — n’avaient presque aucun lien avec la génération image/vidéo par IA. Les tendances de l’emplacement du serveur les 2026-09-05/06 portent sur la crypto et la géopolitique, pas sur les modèles IA ; les prendre comme indicateur du débat sur l’IA aurait été trompeur.
- Ce qui est absent ou écarté : aucun fil sceptique ou critique au sujet de GPT-6 Astra n’est apparu dans cette sélection. Toutes les publications pertinentes sont des démos, des reprises de benchmarks ou des clips de comparaison. Cette absence est elle-même notable, compte tenu de l’agressivité de l’affirmation « dépasse Fable 5.1 » du post #24.
Limites
- Les dix termes utilisés (« Astra », « Bitcoin », « Ukrainian », « Argentina », « $SONG », « OpenAI », « Russia », « Black », « $KURO », « Fable ») proviennent de la liste Explore de X pour cette session, pas d’une liste de termes IA image/vidéo sélectionnée. Sept sur dix (« Bitcoin », « Ukrainian », « Argentina », « $SONG », « Russia », « Black », « $KURO ») ont renvoyé des publications sans rapport avec le thème de recherche et sont exclus de la section Publications.
- La couverture open source est donc mince et indirecte : aucune publication de cette sélection n’utilisait « Stable Diffusion », « ComfyUI », « Wan », « HunyuanVideo » ou « Flux ». Ces recherches n’ont pas été lancées. Tout élément pertinent renvoie à des noms propriétaires ou commerciaux (GPT-6 Astra, Fable 5.1, Seedance, Seedream, MiniMax H3, Tripo) ; l’image de l’open source sur X doit être considérée comme absente, et non comme preuve qu’il ne s’y passe rien.
- Le post #35 (@MINHxDYNASTY, étiqueté « $KURO ») a été collecté sans texte, donc inutilisable comme constat.
- La colonne « Où » d’Explore dépend de la géolocalisation du serveur de session, en Croatie, et non du Japon ni du monde entier ; elle ne doit pas être lue comme une image des tendances mondiales ou japonaises.
- Aucun échec de session ou d’accès ne s’est produit : la collecte a renvoyé des données pour tous les termes recherchés. La lacune est thématique — les termes choisis — et non technique.
YouTube
YouTube — Actualités de l’IA de génération d’images et de vidéos (propriétaire/open source)
Chaînes
- Bijan Bowen (@Bijanbowen, environ 37 000 abonnés) — Spécialisée dans les tests approfondis de LLM et de modèles de génération d’images. Teste Qwen Image-2512.
- Future Tools / Matt Wolfe (@mreflow, plus de 900 000 abonnés) — Produit chaque semaine un format « Everything in AI This Week » rassemblant l’actualité de Midjourney, Runway et d’autres IA de génération d’images et de vidéos.
- Ensemble de chaînes de tutoriels ComfyUI/génération locale (nombreuses vidéos expliquant les flux Wan 2.2/2.6, FLUX et Qwen Image ; seuls les titres des vidéos étaient visibles, les noms individuels des chaînes ne l’étaient pas dans les résultats de recherche).
Vidéos
- "Why OpenAI Shut Down Sora So Fast: What's Next?" — Publiée autour de mars-avril 2026. Explique le contexte de la fermeture par OpenAI de l’application Sora le 26 avril 2026, et de l’arrêt prévu de l’API le 24 septembre 2026 : les téléchargements mensuels sont passés de 3,3 millions en novembre 2025 à 1,1 million en février 2026, et un accord de trois ans à 1 milliard de dollars avec Disney a échoué. https://www.youtube.com/watch?v=H2jVcy5PuBI
- "Why Did Sora AI Shut Down? The Real Reason OpenAI Killed Its Viral Video App" — Publiée au printemps 2026. Examine les coûts économiques d’une application de génération vidéo ayant échoué à se monétiser et le virage stratégique vers l’IA agentique. https://www.youtube.com/watch?v=MpLY9bjYVuA
- "HunyuanImage-3.0 First Test – The Open Source Nano Banana?" — Publiée le 2025-09-29. Teste localement HunyuanImage-3.0 de Tencent, l’un des plus grands modèles open source de texte-vers-image, y compris ses exigences matérielles. https://www.youtube.com/watch?v=lLTv4sGf8Wo
- "Qwen Image-2512 First Test – The BEST Open Source Image Model!" (Bijan Bowen) — Publiée le 2025-12-31. Teste l’amélioration du réalisme des personnes et du rendu de texte avec Qwen Image-2512 d’Alibaba. https://www.youtube.com/watch?v=SBaK616nP6Q
- "New Qwen Image 2512: Better Than Z-Image? (Open Source & Free)" — Publiée le 2026-01-05. Compare directement Qwen Image 2511/2512 et Z-Image Turbo de Tongyi-MAI. https://www.youtube.com/watch?v=uAGH_yRZ2Gw
- "Tencent Hunyuan 2.1 vs. Qwen Image: Who is the True King? A 2K Image & Text Rendering Showdown!" — Publiée le 2025-09-28. Duel de rendu de texte 2K entre Hunyuan Image 2.1, alors en tête du classement Arena open source de texte-vers-image, et Qwen Image. https://www.youtube.com/watch?v=MUDTryJS0XM
- "Z-Image la nouvelle star des modèles Open Source?? Test dans ComfyUI" — Publiée le 2025-11-28. Teste dans ComfyUI Z-Image Turbo, modèle open source de texte-vers-image d’Alibaba/Tongyi-MAI. https://www.youtube.com/watch?v=eOKSBu7KLh0
- "Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial for Open Source SOTA Image & Video Gen Models" — Publiée le 2026-01-11. Long tutoriel ComfyUI couvrant les derniers modèles open source de génération d’images et de vidéos, dont Wan 2.2, FLUX et Qwen Image. https://www.youtube.com/watch?v=3BFDcO2Ysu4
- "WAN 2.6 Hands-On: The Good, the Bad, and the Useful" — Publiée le 2025-12-26. Test pratique de Wan 2.6 publié par Alibaba, avec prise en charge de vidéos jusqu’à 15 secondes, multi-plans et synchronisation audio. https://www.youtube.com/watch?v=iNnmLwPg7OE
- "Multi-Shot AI Videos: Wan 2.6 vs Kling 2.6 (Stress Test)" — Publiée le 2025-12-27. Compare les générations multi-plans de Wan 2.6, open source, et Kling 2.6, propriétaire, dans un test de résistance. https://www.youtube.com/watch?v=CDRKn4I-Iv0
- "I Tested Google's Nano Banana Pro Tips - This One Creates Pro Graphics in 30 Seconds" — Publiée vers novembre-décembre 2025. Test pratique de Gemini 3 Pro Image de Google DeepMind, surnommé Nano Banana Pro, avec sortie 4K, prise en charge de plus de 14 objets et rendu de texte multilingue. https://www.youtube.com/watch?v=ca4SXmRqtKE
- "Qwen Image Edit Review — Free Open-Source Alternative to Nano Banana" — Publiée le 2025-12-04. Teste Qwen Image Edit, modèle d’édition open source proposé comme alternative gratuite à Nano Banana, propriétaire. https://www.youtube.com/watch?v=Ur3udfFJ2QQ
Signaux
- La plus grande actualité propriétaire est le retrait de Sora : OpenAI a prévenu les développeurs le 2026-03-24, a mis fin aux versions application et web de Sora le 26 avril, et prévoit d’arrêter l’API le 24 septembre 2026. Plusieurs vidéos citent la chute des téléchargements — de 3,3 millions en novembre 2025 à 1,1 million en février 2026 — et l’échec du partenariat de 1 milliard de dollars avec Disney. L’événement est interprété comme le signe d’un transfert des ressources de la génération vidéo vers l’IA de programmation et les agents.
- Le camp open source suit une structure « deux leaders + nouveaux venus » : l’écosystème Alibaba (Qwen Image, Z-Image Turbo, Wan 2.2/2.6) et celui de Tencent (HunyuanImage 3.0/2.1) se disputent la tête des principaux classements, tandis que FLUX.2 de Black Forest Labs ([dev]/[klein], VAE Apache 2.0 publié) rivalise sur le photoréalisme. Beaucoup de créateurs présentent Qwen Image ou HunyuanImage comme des « alternatives open source à Nano Banana », installant la comparaison directe entre propriétaire et open source comme format établi.
- Pour la vidéo, les multi-plans et la synchronisation audio deviennent la nouvelle norme : Wan 2.6 (open source) et Kling 3.0 / Seedance 2.0 / Runway Gen-4.5 (propriétaires) rivalisent tous sur la production de plusieurs plans dans une seule génération et d’audio/SFX simultanés. La compétition dépasse désormais le simple clip isolé.
- De nombreuses vidéos d’évaluation suivent le format de test pratique « first test » ou « first look », publié quelques jours à une semaine après l’annonce d’un modèle, ce qui en fait un format d’actualité rapide bien établi.
Limites
- Les pages de résultats et de visionnage YouTube (
youtube.com/results,youtube.com/watch) étant rendues en JavaScript, WebFetch ne récupère qu’un pied de page statique. Les nombres précis de vues, abonnés et commentaires n’ont donc pas pu être confirmés directement dans la plupart des cas. Les données de vues et d’abonnés indiquées ci-dessus proviennent uniquement des extraits de recherche disponibles, et manquent pour la majorité des vidéos. - Les URL directes de tests YouTube individuels pour Kling 3.0, Seedance 2.0 et Runway Gen-4.5 n’ont pas été trouvées, les résultats étant dominés par des articles de blogs de comparaison technique tels que invideo.io, Pixo et AI.cc.
- Les nombres d’abonnés individuels n’ont pu être établis que pour Bijan Bowen (environ 37 000) et Matt Wolfe / Future Tools (plus de 900 000).
Bluesky
Bluesky — Actualités de l’IA de génération d’images et de vidéos
L’API officielle de recherche Bluesky (app.bsky.feed.searchPosts) a systématiquement renvoyé 403 Forbidden durant cette session, rendant impossible la collecte de publications par mots-clés ; voir Limites. La méthode a donc été remplacée par une recherche de comptes liés au thème via app.bsky.actor.searchActors, puis par une lecture individuelle de leurs historiques via getAuthorFeed.
Comptes
| Compte | Contenu | Nombre d’abonnés | Nombre de publications |
|---|---|---|---|
| @todaystopainews.bsky.social | « Today's Top AI News ». Compte de type bot qui collecte et publie automatiquement des actualités IA. Couvre fréquemment les modèles propriétaires GPT-6 Astra et Fable 5.1 | 272 | 1,826 |
| @useapi.bsky.social | useapi.net. Compte officiel d’un service agrégateur qui regroupe les API d’image et vidéo de Veo, Kling, Seedance, PixVerse, Hailuo, Runway et Nano Banana | 13 | 24 |
| @nijiironokeshiki.bsky.social | « Niji-iro ». Créateur individuel publiant deux à trois fois par jour des illustrations de fan art de Re:Zero, Lycoris Recoil et Frieren avec Stable Diffusion et ComfyUI | 699 | 1,963 |
| @kunecco.bsky.social | « Kunecco ». Développeur de nœuds, flux de travail et LoRA pour la version git de ComfyUI. Publie aussi des contenus techniques, tels que la traduction de tags danbooru | 540 | 494 |
| @midjourneyofficial.bsky.social | Compte officiel de Midjourney. A annoncé son arrivée sur Bluesky en août 2025 | Inconnu | Dernier post le 2025-10-08 |
| @comfyuistudio.bsky.social | Compte tiers de présentation de flux ComfyUI | Inconnu | Dernier post le 2024-12-19 |
| @klingaivideo.bsky.social | Compte de présentation de l’outil de génération vidéo Kling AI | Inconnu | Fil vide, aucune publication |
Publications
Solutions propriétaires
-
GPT-6 Astra génère un SVG de manette PS4 (@todaystopainews, 11 likes, 2 reposts, 1 réponse, 2026-09-05, https://bsky.app/profile/todaystopainews.bsky.social/post/3mur7cyocf225). Le temps de génération — 11 minutes et 54 secondes — est indiqué, fournissant un exemple concret du temps que GPT-6 Astra met à accomplir une tâche visuelle.
-
GPT-6 Astra assemble une scène urbaine dans Unity (@todaystopainews, 4 likes, 1 repost, 2026-09-04, https://bsky.app/profile/todaystopainews.bsky.social/post/3muoucqf4tk2w). Cette démo compose automatiquement une scène 3D à partir d’assets existants et illustre un usage agentique allant au-delà de la génération d’images simple.
-
Repost de « Fable 5.1 world modeling » (@todaystopainews, 11 likes, 4 reposts, 2026-09-03, https://bsky.app/profile/todaystopainews.bsky.social/post/3mumdxgujh22h), ainsi que la publication de la veille, « Une ville médiévale créée avec Fable 5.1 » (10 likes, 3 reposts, 2026-09-02, https://bsky.app/profile/todaystopainews.bsky.social/post/3mukekiwxws2j). Fable 5.1 est régulièrement présenté comme une démo de modélisation 3D et de mondes.
-
Billet useapi.net « Seedance 2.5 sur l’API Dreamina » (@useapi.bsky.social, 2026-08-08, https://bsky.app/profile/useapi.bsky.social/post/3mskj7fb2ok2a). Présente, sous forme de billet technique, l’accès à Seedance 2.5 via l’API Dreamina.
-
Comparaison useapi.net « MiniMax H3 vs Seedance 2.0 » avec la même image de référence (@useapi.bsky.social, 2026-07-31, https://bsky.app/profile/useapi.bsky.social/post/3mrw5xyd4zk2x). Comparaison directe entre modèles utilisant les mêmes références omni, depuis le point de vue d’un fournisseur d’API.
-
useapi.net « Comparaison approfondie de plus de 17 modèles d’images IA » (@useapi.bsky.social, 3 likes, 2026-07-25, https://bsky.app/profile/useapi.bsky.social/post/3mrigfks25k2n). Une comparaison transversale de nombreux modèles de génération d’images, révélant la prolifération des offres propriétaires.
-
useapi.net « Comparaison de prix Seedance 2.0 : voie officielle contre voie tierce » (@useapi.bsky.social, 2026-07-23, https://bsky.app/profile/useapi.bsky.social/post/3mrdyxqswcb2p). Montre concrètement que le prix d’un même modèle diffère entre API officielle et agrégateur, ce qui fait apparaître la structure en couches du marché des API.
Open source
-
Publications quotidiennes d’illustrations IA de « Niji-iro » (@nijiironokeshiki, entre 87 et 245 likes, plusieurs publications du 2026-09-02 au 09-05, exemple : https://bsky.app/profile/nijiironokeshiki.bsky.social/post/3mumi7nop522l, 104 likes et 25 reposts). Le profil indique explicitement l’usage de Stable Diffusion et ComfyUI ; il obtient régulièrement un engagement particulièrement élevé pour Bluesky.
-
Messages de Kunecco sur le développement de flux ComfyUI (@kunecco, 2025-10-27, https://bsky.app/profile/kunecco.bsky.social/post/3m45jd5s2ek2f) : « créer des nœuds et des workflows devient amusant, je m’y enfonce de plus en plus ». Le même compte indique à la même période avoir « traduit 140 000 lignes de tokens danbooru » (https://bsky.app/profile/kunecco.bsky.social/post/3m432qalae22t), exemple d’un travail dans l’écosystème ComfyUI au niveau des dictionnaires de tags.
-
Stagnation des comptes officiels ou semi-officiels ComfyUI (@comfyuistudio.bsky.social, dernier post le 2024-12-19 ; @comfy-ui.bsky.social a un fil vide). La recherche d’acteurs révèle de nombreux pseudos similaires —
comfyuistudio,real-comfyui,comfy-ui,comfyuiorg— mais les comptes réellement actifs sont les créateurs individuels d’illustrations IA, comme Niji-iro et Kunecco. Les développeurs de l’outil ou les sources officielles sont presque absents de Bluesky.
Signaux
- Côté propriétaire, l’accent est mis sur les actualités ; côté open source, sur les œuvres : todaystopainews et useapi.net publient des noms de modèles, prix d’API et benchmarks liés à GPT-6 Astra, Fable 5.1, Seedance et MiniMax H3. Leurs likes sont faibles, souvent de l’ordre de un à dix, mais leur densité informationnelle est élevée. À l’inverse, le côté open source Stable Diffusion/ComfyUI est dominé par les illustrations finalisées de créateurs individuels comme Niji-iro : l’attention porte sur l’œuvre, non sur l’évolution des modèles. Les nouvelles techniques open source circulent très peu sur Bluesky.
- Les comptes officiels de Midjourney et Kling AI sont de fait inactifs : Midjourney a déclaré être arrivé sur Bluesky en août 2025, mais son dernier post date du 2025-10-08. Le compte Kling AI Video n’a aucune publication. Les marques n’utilisent pas Bluesky comme canal d’information continu.
- Existence de comptes-personas d’agents IA sous la marque GPT-6 Astra : des comptes tels que
astrra.space(Astra, « AI agent running on GPT-6 Astra ») etmaple-nekokami.bsky.social(« Runs on OpenAI GPT-6 Astra ») utilisent le nom du modèle comme enseigne de personnages. Il ne s’agit pas directement de génération d’images ou de vidéos, mais cela montre que GPT-6 Astra est consommé comme un mème sur Bluesky. - Les API agrégatrices comme useapi.net deviennent un hub de comparaison des modèles propriétaires : useapi.net, qui regroupe Veo, Kling, Seedance, PixVerse, Hailuo, Runway et Nano Banana, fournit les publications les plus concrètes de Bluesky sur les prix et performances. Ces services transversaux offrent davantage d’informations pratiques que les comptes officiels de modèles isolés.
Limites
app.bsky.feed.searchPosts, l’API de recherche plein texte, a renvoyé HTTP 403 pour toutes les requêtes — y compris « image generation AI », « Stable Diffusion » et des mots isolés tels que « Flux ». En revanche,app.bsky.actor.searchActorsetapp.bsky.feed.getAuthorFeedont répondu normalement. Le rapport repose donc sur l’identification de comptes potentiellement pertinents puis sur leur lecture individuelle, et n’inclut pas les publications ou comptes non découverts par cette méthode.- Face à l’objectif d’environ 20 publications analysées par réseau social, seulement les 10 éléments ci-dessus, ainsi que quelques publications périphériques, ont pu être lus et analysés. Dans les limites de la recherche par comptes, augmenter ce nombre aurait nécessité d’identifier davantage de comptes. Les principaux angles — bots d’actualité propriétaires autour de GPT-6 Astra/Fable 5.1, agrégateurs tels que useapi.net, créateurs ComfyUI/Stable Diffusion — ont été vérifiés ; les nouveaux comptes trouvés étaient majoritairement inactifs ou non pertinents (sport, politique, journalisme), d’où l’arrêt de la collecte.
- Les comptes de marque, notamment Midjourney et Kling AI, étant arrêtés ou vides, ils n’ont pas servi de sources d’actualité courante.
- Les recherches de comptes avec « Wan2.5 », « Flux.2 » ou « open source image generation » n’ont renvoyé aucun résultat. Aucun compte Bluesky publiant sur Wan, HunyuanVideo, Qwen-Image ou Chroma n’a été trouvé. Les tendances open source n’ont donc pu être confirmées qu’à travers les marques existantes Stable Diffusion et ComfyUI.
Lemmy
Lemmy — Dernières tendances de l’IA de génération d’images et de vidéos
Communautés
- !«メールアドレス» — 5 708 membres. De loin la communauté la plus active. Nœuds personnalisés ComfyUI, publication de poids de nouveaux modèles et LoRA y apparaissent quotidiennement ; c’est de fait le tableau d’actualités de l’IA open source d’images et vidéos.
- !«メールアドレス» — 2 360 membres. Principalement consacré au partage de créations générées, avec peu d’actualité.
- !«メールアドレス» — 1 662 membres. Similaire à la version dbzer0, mais moins active.
- !«メールアドレス» — 87 858 membres. L’une des plus grandes communautés techniques de Lemmy, mais peu de discussions uniquement dédiées à l’IA d’images/vidéos ; les actualités corporate de Midjourney y apparaissent parfois.
- !«メールアドレス» (y compris ses miroirs sur d’autres instances) — Reprend beaucoup de publications de subreddits IA. Peu de volume, mais permet de relever des sources particulières, telles que les résultats financiers de Runway.
- !techtakes — Communauté critique et sceptique envers l’IA. Publie notamment des contenus ironiques sur les errements de Midjourney.
Publications
- Midjourney se réoriente vers les scanners CT à ultrasons médicaux — !«メールアドレス», score 58, 2026-06-18, https://www.theregister.com (article source : The Register). Associé à : blog officiel Midjourney https://midjourney.com/medical/blogpost (!hackernews, score 2, 2026-06-18), et à la réaction ironique « Midjourney AI pivots to Theranos » dans !techtakes, score 40, 2026-06-19, https://pivot-to-ai.com/2026/06/19
- Midjourney demande aux studios hollywoodiens de dévoiler leur utilisation de l’IA — !«メールアドレス», score 73, 2026-07-05, https://techcrunch.com/2026/07/04
- Runway : « l’activité entreprise a doublé, le NRR dépasse 300 % » — !ai_reddit, score 0, 2026-08-30, https://www.reddit.com/r/ArtificialInteligence/comments/1w2hnea/ (reprise Reddit sur Lemmy)
- Lancement de Qwen-Image-2.0 : réduction importante de 20B à 7B de paramètres, génération et édition unifiées, devant Nano Banana en Elo ; publication des poids prévue prochainement — !«メールアドレス», score 12, 2026-02-12, https://files.catbox.moe/l3mzzs.jpg (également cross-posté sur !LocalLLaMA, !Aii et !artificial_intel)
- Wan Animate 2 devient disponible dans ComfyUI — !«メールアドレス», score 8, 2026-08-08, https://blog.comfy.org/p/wan-animate-2-is-now-available-in
- Prise en charge Day-0 de LTX-2.5 dans ComfyUI — !«メールアドレス», score 5, 2026-08-12, https://blog.comfy.org/p/ltx-25-day-0-support-in-comfyui
- Prise en charge native de Trellis.2 et Pixal3D, modèles de génération 3D, dans ComfyUI — !«メールアドレス», score 4, 2026-09-01, https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native
- Expansion rapide de l’écosystème MiniMax-H3, modèle vidéo à poids ouverts — plus de dix publications dans !«メールアドレス» du 8 août au 5 septembre. Extraits : version quantifiée GGUF (21,6 Go → 8,9 Go, score 10, https://huggingface.co/Abiray/MiniMax-H3-Pruned-GGUF) / LoRA d’accélération 4 à 8 étapes (score 6-7, https://huggingface.co/lightx2v/Minimax-h3-Turbo) / prise en charge de vidéos longues jusqu’à 120 secondes avec synchronisation audio (score 5, https://huggingface.co/Smite79/MiniMax-H3-Longvideos) / implémentation d’attention hybride (score 3, https://github.com/Saganaki22/ComfyUI-VDN-H3, 2026-09-05)
- Ensemble de nœuds GPU natifs d’amélioration vidéo : ComfyUI-AetherScale et DLSS5 Visual Enhancer — !«メールアドレス», score 5, 2026-09-01/09-05, https://github.com/vizart-vj/ComfyUI-AetherScale ・ https://github.com/Merserk/dlss5-visual-enhancer
- Un MCP pour Claude appelle plus de 30 modèles de génération d’images et vidéos depuis un seul chat, réduisant un projet de 2,5 heures à 50 minutes — !ai_reddit, score 1, 2026-05-01, https://i.redd.it/6gqfafpaukyg1.png
Signaux
- Le côté open source est entièrement dominé par les « nouvelles d’implémentation » autour de ComfyUI et Hugging Face. Plus que les annonces de modèles elles-mêmes, les publications portent sur « tel modèle a été intégré à ComfyUI », « un LoRA est sorti » ou « une version quantifiée est disponible ». Le développement d’outils autour du modèle vidéo MiniMax-H3 est actuellement le principal terrain d’activité.
- La génération 3D, avec Trellis.2 et Pixal3D, commence à être intégrée dans ComfyUI, gagnant en importance comme nouvelle cible générative après les images et la vidéo.
- Sur Lemmy, les solutions propriétaires sont davantage consommées comme critiques ou scandales que comme actualités produit. La réorientation médicale de Midjourney a davantage progressé dans les communautés générales de tech et de satire que dans les communautés d’IA générative (scores 58, 73 et 40).
- Les mentions de Nano Banana sur Lemmy apparaissent presque exclusivement dans le contexte comparatif « un modèle open source l’a dépassé » ; aucune publication comme information primaire venant de Google n’a été trouvée.
- Aucune mention directe récente de Sora, Veo, Kling, Hailuo, Seedream/Seedance ou de la dernière version d’Adobe Firefly n’a été trouvée durant la période étudiée. La publication Adobe Firefly la plus récente datait de 2025.
Limites
- Lemmy est de petite taille, et la discussion spécialisée sur l’IA d’images et vidéos est presque entièrement concentrée dans !«メールアドレス». Une recherche transversale parmi d’autres instances, telles que lemmy.ml, lemm.ee et lemmy.zip, a surtout renvoyé des doublons ou des résultats non pertinents.
- La recherche plein texte (
/api/v3/search) a une faible correspondance approximative : des noms courts comme « Sora » ou « Veo » renvoyaient surtout des résultats hors sujet. Les recherches via API et Web n’ont pas trouvé de publication primaire sur Lemmy concernant OpenAI Sora, Google Veo, Kling AI, Hailuo ou ByteDance Seedream/Seedance. Cela peut refléter une limite de recherche ou de couverture de Lemmy, plutôt qu’une absence de discussion. - La publication Qwen-Image-2.0 date de février 2026 et non du dernier mois, mais a été conservée car elle est précieuse pour l’axe de comparaison open source/propriétaire.
- Les publications sur Runway et Claude MCP ne proviennent pas initialement de Lemmy, mais sont des reprises de Reddit dans !ai_reddit ; la source primaire est donc Reddit.
Pinterest — Actualités de l’IA de génération d’images et de vidéos
50 épingles Pinterest ont été collectées avec la requête « Image and Video Generation AI News » (output/pinterest.pins.md, une seule recherche sans segmentation par genre). Les 50 images ont été examinées.
Thèmes visuels
- L’IA symbolisée par un robot humanoïde blanc ou un cyborg : indépendamment de la réalité technique de l’IA générative, des robots humanoïdes blancs ou des visages mi-robots mi-humains représentent systématiquement « l’IA » ([2, 19, 30, 35, 37, 40, 43, 44, 46, 48]). Les vignettes d’actualité et d’explication convergent presque toutes vers ce motif.
- Une palette cyber néon sur fond bleu marine domine : la majorité des infographies adopte un style de modèle réutilisable combinant lueurs cyan, violet et magenta, motifs de circuit imprimé et fonds sombres ([3, 5, 6, 7, 10, 13, 17, 18, 19, 21, 29, 32, 34, 39, 42, 44, 46, 48, 49]). Les éléments photographiques ou dessinés à la main sont presque absents, ce qui évoque des designs produits en série sur Canva ou à partir d’images de stock.
- Les listes de classement « best AI tool » forment le cœur du genre : des tableaux comparatifs affichant les logos de Runway, Pika, Kling AI, Luma AI (Dream Machine), Synthesia, HeyGen, InVideo AI, Kaiber, Adobe Firefly, ChatGPT Plus, Midjourney et Canva AI reviennent continuellement ([9, 16, 20, 24, 38, 42]). Les épingles [16] et [24] sont presque identiques — tableau « Best Quality/Best Free » — ce qui montre qu’un même modèle de contenu est réutilisé par plusieurs auteurs.
- Infographies d’actualité et de récapitulatif : beaucoup d’épingles imitent une mise en page de journal ou utilisent une bannière « Breaking News » pour résumer « les actualités IA de la semaine » ([11, 12, 21, 29, 32, 33, 39, 43, 47, 50]). Des images datées de périodes très différentes coexistent dans les mêmes résultats — 2025-06-30 [29], 2026-05-20 [21], 2026-08-15 [32].
- Les épingles montrant de véritables sorties ou démos sont minoritaires : la plupart sont des images marketing composées de logos ou de texte. Parmi les rares exemples de résultats réels figurent le reel officiel de Google Veo 2 [8], une grille de transfert de style apparemment Luma (personne → sculpture sur bois / origami / Lego / fleurs) [4], la démo Microsoft VASA-1 d’animation d’expressions à partir d’une image et d’un son [22], un exemple image-vers-vidéo préservant un personnage monstre violet [26], et un portrait photoréaliste de vieux pêcheur créé avec AMD Amuse [41]. Ces exemples ne représentent qu’environ 10 % des 50 épingles.
- Le thème sceptique ou de détection « Est-ce réel ? Est-ce de l’IA ? » : photo de chat estampillée FAKE et robot [2], quiz de photos de montagne « Which is AI? » [15], détection audio IA à 97 % [18], liste pour et contre « les vidéos générées par IA sont-elles bonnes ou mauvaises ? » [23], panneau néon affirmant que « tout le monde utilise mal l’IA » [46] ; le contenu attisant le doute et la détection occupe une place non négligeable.
- Mélange de photos de personnalités réelles et d’images IA « façon célébrité » : la liste comprend une photo de scène réelle du PDG de Nvidia Jensen Huang [45] et une vignette YouTube montrant une personne qui semble être Sam Altman [33], mais aussi une publicité Fiverr générant par IA un visage ressemblant à Bezos [36]. Dans la liste d’épingles, la frontière entre photo réelle et image IA est difficile à discerner.
- Très peu de mentions de l’open source : les outils propriétaires — Veo, Sora, ChatGPT, Midjourney et Runway — sont largement majoritaires. Seulement deux épingles concernent l’open source ou la génération locale : un article sur l’ouverture de Baidu Ernie 4.5 [29] et AMD Amuse 3.0 [41]. Aucune épingle n’évoque les communautés open source de génération d’images autour de Stable Diffusion, ComfyUI ou LoRA.
Épingles notables
- [4] (sans titre / grille de transformation de style type Lumalabs) — Transforme une image de vidéo réelle en « sculpture sur bois », « origami », « briques Lego » et « fleurs », avec la même transformation appliquée à des chiens et à une voiture Tesla. C’est la démo technique la plus concrète.
- [8] Google Unveils Veo 2 — Assemblage de matériel promotionnel officiel montrant une femme au microscope, une personne nageant sous l’eau, une danseuse dessinant une constellation, une fille animée dans une cuisine et un groupe de flamants roses ; l’exemple le plus direct de la variété visuelle de Veo 2.
- [9] 6+ Best AI Video Generation Websites — Infographie à conserver qui classe Runway, Pika, Kling AI, Luma AI, Canva AI et Hailuo AI par fonctions et publics cibles. L’appel à l’action « Save this pin » illustre le comportement de consommation des listes propre à Pinterest.
- [16] AI Image Video: Best Quality vs Best Free — Compare 10 outils payants et 10 gratuits, avec un flux de décision selon l’usage. Son contenu est presque identique à [24], ce qui confirme la diffusion de modèles visuels du même genre.
- [22] VASA-1 (Microsoft) — Schéma de démonstration de recherche générant divers visages parlants et expressions depuis une image fixe, un clip audio et des signaux de contrôle optionnels. C’est l’épingle la plus académique parmi les contenus techniques.
- [27] Vidu S1 — Image cyberpunk tape-à-l’œil du modèle de ShengShu Technology conçu pour l’interaction IA en temps réel, qui témoigne de la présence des modèles vidéo chinois.
- [29] AI NEWS (style journal, 2025-06-30) — Résume quelques évolutions concrètes d’entreprises : ouverture de Baidu Ernie 4.5, emprunt de TPU Google par OpenAI, investissement de 14,3 milliards de dollars de Meta dans Scale AI. C’est l’une des rares épingles proches d’une source d’information primaire.
- [38] Top 10 Image-to-Video Generator Tools — Liste Runway Gen-3, Kling, Google Veo, OpenAI Sora, Luma AI, Pika Labs, Kaiber AI, Synthesia, HeyGen, Adobe Firefly et InVideo AI. Bonne vue d’ensemble des principaux acteurs.
- [41] Amuse 3.0 (AMD) — Utilise un portrait photoréaliste de vieux pêcheur pour promouvoir la qualité d’un outil d’art IA local fonctionnant sur GPU AMD. Un des rares exemples du versant open source/génération locale.
- [50] This Week's Top AI Developments — Compile des évolutions basées sur des statistiques : étude Google de 15 millions de chats, dont 86 % d’usages non professionnels ; utilisation illimitée de ChatGPT ; résultat d’un concours où l’IA a battu 458 équipes sur 526.
Signaux
- Ce que montre la situation actuelle : sur Pinterest, « Image and Video Generation AI » est de fait devenu un marché SEO et affilié de listes comparatives d’outils et d’infographies d’actualité. Runway, Pika, Kling AI, Luma AI, Synthesia, HeyGen, InVideo AI, Adobe Firefly et Google Veo apparaissent régulièrement en tête ; ils forment l’ensemble canonique perçu des outils propriétaires de génération vidéo.
- Réutilisation d’un même modèle : comme les épingles [16] et [24] sont en pratique la même image, les contenus de comparaison d’outils IA sur Pinterest semblent probablement produits et repostés en masse à partir d’un petit nombre de modèles.
- Absence de l’open source : seules [29] (Baidu Ernie 4.5) et [41] (AMD Amuse 3.0) peuvent servir directement à étudier les tendances open source demandées. Aucune image relative à Stable Diffusion, ComfyUI ou Hugging Face n’est présente. Les résultats Pinterest favorisent des créations visuellement attractives et des ressources marketing, ce qui semble peu compatible avec les publications des communautés techniques open source.
- Les images d’explication, de comparaison et d’incitation surpassent les productions réelles : sur 50 épingles, environ 10 % seulement placent les images ou vidéos réellement générées par IA au premier plan ; la grande majorité sont des listes ou infographies dominées par le texte. Sur Pinterest, les contenus aidant à choisir un outil semblent se diffuser plus facilement que les exemples concrets de ce que produit un outil.
Limites
- Cette étape s’est limitée à l’examen d’images Pinterest précollectées par un worker (
images/pinterest/manifest.json, 50 éléments, une seule requête sans division par genre) ; Pinterest lui-même n’a pas été parcouru. De nouvelles recherches, par exemple « open source AI art » ou « Stable Diffusion », auraient pu trouver davantage d’épingles orientées open source. - Les dates intégrées à l’image des épingles — 2025-06-30, 2026-05-20, 2026-08-15, etc. — indiquent uniquement la date de création du modèle graphique. La date réelle de publication ou d’enregistrement sur Pinterest n’est pas disponible dans
manifest.json. - Une partie du texte intégrée aux images [12], [15], [21], [23] et [29] est légèrement floue. Les descriptions ci-dessus sont des synthèses, non des citations exactes ; certains modèles contiennent des fautes telles que « Human Journalism » ou « Machine-Genertsd Media ».
- Cinq épingles ont un titre vide — [12], [15], [21], [29] et certaines de [35] — et ont été classées à partir de leur contenu visuel.
Actions recommandées
- Continuer à comparer GPT-6 Astra à Fable 5.1 sur l’axe du contrôle agentique, et non sur la seule qualité.
- Continuer à surveiller l’écosystème ComfyUI de MiniMax-H3, notamment les quantifications GGUF et Turbo LoRA.
- Lors de la prochaine étude de X, ne pas s’appuyer sur les tendances Explore ; utiliser explicitement Stable Diffusion, Wan, Flux et Qwen comme requêtes open source.
- Donner priorité à !«メールアドレス» sur Lemmy comme source d’information primaire open source.
- Ne pas employer Pinterest comme source d’information sur les tendances open source ; le limiter à l’observation du marketing des outils propriétaires.
- Vérifier si des outils externes dépendent de l’arrêt de l’API Sora prévu le 2026-09-24.
Images collectées


















































Note sur la qualité des données
Reddit n’a fourni que 12 fils précollectés, car WebFetch était indisponible, et n’a donc pas atteint l’objectif d’environ 20. Sur X, la plupart des tendances Explore étaient sans rapport et aucune recherche open source n’a été effectuée. Bluesky a renvoyé 403 pour la recherche plein texte, obligeant à une méthode de collecte alternative. Lemmy n’a fourni aucune publication primaire côté propriétaire. Pinterest n’a été étudié qu’au moyen d’une requête générale unique, sans recherche ciblée sur l’open source.



