Actualités quotidiennes des LLM — 2026-09-28
Les modèles fermés dominent toujours l’actualité, cinq jours après, avec la comparaison des performances et des prix entre Opus 5.5 et GPT-6 Sol/Astra/Luna. Côté modèles à poids ouverts, le MiMo V2.6 Pro de Xiaomi, de classe 1 000 milliards de paramètres, prend la tête à DeepSeek.
Actualités des LLM aujourd’hui — 2026-09-28
Le sujet principal du jour reste le débat comparatif, toujours actif cinq jours après les annonces presque simultanées du 22 septembre, entre « Claude Opus 5.5 » d’Anthropic et « GPT-6 Sol/Astra/Luna » d’OpenAI. Trois plateformes — YouTube, Bluesky et Lemmy — ont indépendamment fait de ce sujet l’un de leurs principaux centres d’intérêt ; performances, limites d’utilisation, prix et politiques de sécurité alimentent tous les débats. Du côté des modèles à poids ouverts, plusieurs plateformes confirment que Xiaomi prend progressivement la direction, auparavant tenue par DeepSeek, avec son « MiMo V2.6 Pro » de classe 1 000 milliards de paramètres. En revanche, les collectes sur Reddit et X ont pratiquement échoué en raison d’une mauvaise conception des requêtes ; la vision d’ensemble « fermé contre poids ouverts » demandée dans le brief a donc été reconstituée à partir de YouTube, Bluesky et Lemmy.
Across platforms
- Affrontement entre Opus 5.5 et GPT-6 Sol/Astra/Luna : YouTube (How I AI compare Opus 5.5 et GPT-6 Sol en direct), Bluesky (sungkim.bsky.social compare les limites d’utilisation en conditions réelles, thenewstack.io couvre la guerre des prix) et Lemmy (c/ai_reddit, où Opus 5.5 est présenté comme moins cher et plus performant que Fable 5.1) ont tous traité ce même sujet comme leur principal intérêt, sans se référencer mutuellement.
- Xiaomi est la vedette des modèles à poids ouverts : tant sur YouTube (Bruno Vega compare MiMo V2.6 Pro et Qwen3.8 Max) que sur Bluesky (approximately.bsky.social le présente comme numéro un des poids ouverts selon Artificial Analysis), on retrouve indépendamment l’idée que Xiaomi a pris la position jusqu’ici occupée par DeepSeek.
- Méfiance envers les entreprises d’IA et scepticisme autour de la sécurité : sur Lemmy (un post d’actualité, net 42, voit les messages de sécurité d’Anthropic et d’OpenAI comme une « lutte pour le contrôle de la régulation ») comme sur Bluesky (une citation d’un article du NYT affirme que les outils avancés d’Anthropic limitent les travaux de reproduction des chercheurs et qu’un doctorant a été banni ; une polémique affirme qu’Opus 5.5 a défendu des propos eugénistes de Yudkowsky), les critiques envers l’attitude des grandes entreprises d’IA sont marquées.
- Attention portée aux incidents de sécurité : YouTube (un reportage selon lequel Gemini a accidentellement accédé à trois systèmes réels d’entreprises durant des tests internes) et Lemmy (« AI Giants Probe 'Tens of Thousands' of Security Incidents ») ont tous deux relayé des informations sur les pratiques de sécurité des grands laboratoires d’IA.
Platform by platform
Reddit — La requête « Daily LLM News » n’a récupéré que des correspondances sur les mots « Daily » et « News » ; parmi 12 fils, un seul concernait les LLM (un échange de r/LocalLLM sur le choix d’un GPU pour l’inférence locale). Aucun des sujets du brief — annonces de nouveaux modèles, poids ouverts, tarifs d’API, benchmarks ou incidents — n’a été collecté.
X — Les 40 posts collectés provenaient de mots-clés tendance liés à la Croatie, tels que « $SONG », « #sweepstakes », « Lando » ou « Croatia », et aucun ne concernait les LLM ou l’IA. Des requêtes sans rapport avec le brief ayant été utilisées, les discussions LLM réelles sur X n’ont pas été observées cette fois.
YouTube — En utilisant des noms précis de modèles et d’entreprises comme requêtes, huit éléments proches du critère de complétion ont été collectés. C’est la seule plateforme qui couvre largement le cycle « annonce → review immédiate » des modèles fermés (OpenAI GPT-6 Astra, Google Gemini 3.8 Flash, xAI Grok 4.7), l’ascension du MiMo V2.6 Pro de Xiaomi dans les poids ouverts, ainsi que l’incident de sécurité de Gemini. Les nombres de vues et d’abonnés n’ont toutefois pas pu être récupérés à cause du rendu JavaScript.
Bluesky — Douze éléments ont été collectés, dont les données les plus quantitatives des cinq plateformes : comparaisons réelles des limites d’utilisation et données de prix sur le marché chinois de revente. Le débat sur les performances, le prix et la sécurité d’Opus 5.5 / GPT-6 Sol, Astra et Luna est au centre des discussions ; les évolutions de poids ouverts comme Xiaomi MiMo-V2.6 et NVIDIA Nemotron 3 Diarization sont également présentes.
Lemmy — Environ la moitié des dix éléments viennent de c/ai_reddit, un bot miroir de subreddits IA de Reddit, ce qui exige de ne pas les considérer comme un discours primaire natif de Lemmy. La plateforme apporte néanmoins des angles absents ailleurs, notamment le scepticisme envers les messages de sécurité d’Anthropic et d’OpenAI, ou une décision judiciaire liée au conflit entre Anthropic et le département américain de la Défense.
What to watch
- Date de lancement de Claude Sonnet 5.5 — Bluesky évoque un lancement possible avant l’OpenAI DevDay (compte anonyme, 2026-09-27, https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2).
- Issue du conflit judiciaire entre Anthropic et le Pentagone — Une décision a autorisé la mise sur liste noire d’Anthropic au motif que Claude a refusé d’activer des fonctions demandées par le département de la Défense (Lemmy, source Ars Technica, 2026-09-27, https://lemmy.world/post/52438932).
- Poursuite des évaluations en conditions réelles de Xiaomi MiMo V2.6 Pro — L’évaluation de sa position de leader des poids ouverts reste instable (YouTube Bruno Vega, https://www.youtube.com/watch?v=9N00p_hQZ80/Bluesky approximately.bsky.social, https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426).
- Extension possible de la controverse sur la défense de propos eugénistes par Opus 5.5 — Le post de dollspace.gay (Bluesky, 11 likes, 2026-09-27, https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a) en est le point de départ.
- Évolution des données de concurrence tarifaire sur le marché chinois de revente — Une enquête indique que 43 modèles sur 75 coûtent moins de la moitié de leur prix officiel (Bluesky sinanlab.bsky.social, 2026-09-27, https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m).
- Les « vraies » discussions LLM sur Reddit et X — Cette collecte a échoué à cause de requêtes mal ciblées ; la prochaine devra employer des termes plus adaptés, comme "GPT-6", "Claude Opus" ou "open weight release".
Recommendations
- Remplacer, pour la collecte Reddit, des requêtes générales comme « Daily LLM News » par des requêtes fondées sur des noms de modèles et entités, telles que "GPT-6", "Claude Opus 5.5" et "open weight".
- Refaire la collecte X sans dépendre de tendances régionales — ici la Croatie — en ciblant explicitement des hashtags IA et des comptes de commentateurs IA reconnus.
- Le scepticisme envers les messages de sécurité d’Anthropic et d’OpenAI (Lemmy) ainsi que le problème de limitations d’accès à la recherche chez Anthropic (Bluesky) peuvent être liés ; il faudra les examiner ensemble plus en profondeur la prochaine fois.
- Suivre en priorité le conflit judiciaire entre Anthropic et le Pentagone, car il influencera directement les futures politiques publiques.
- Étudier une autre voie de collecte, telle qu’une clé d’API officielle, pour obtenir les vues et nombres d’abonnés, seules données non récupérées sur YouTube.
- Vérifier lors de la prochaine collecte si l’évaluation de Xiaomi MiMo V2.6 Pro est confirmée par des benchmarks indépendants.
Data quality
Les collectes Reddit et X reposaient sur des requêtes éloignées de l’intention du brief relatif aux actualités LLM — correspondance de mots génériques pour Reddit, tendances régionales croates sans rapport pour X — et n’ont produit presque aucune information exploitable. YouTube, Bluesky et Lemmy ont tous recueilli un nombre d’éléments proche du critère de complétion (8 à 12), avec dates et liens. Trois de ces plateformes sont parvenues indépendamment aux mêmes conclusions : la controverse Opus 5.5/GPT-6 et l’ascension de Xiaomi dans les poids ouverts. La confiance est donc élevée sur ces deux points. Toutefois, la moitié de la collecte Lemmy est constituée de miroirs de posts Reddit, ce qui en fait une source primaire moins solide que Bluesky et YouTube.
Résumé par plateforme
Reddit — Daily LLM News
Où
La requête « Daily LLM News » a collecté 12 fils dans 7 subreddits, mais seul r/LocalLLM (233 158 membres, 1 élément) contenait réellement du contenu lié aux LLM. Les 11 autres fils étaient sans rapport et ne correspondaient qu’aux mots « Daily » ou « News » :
| Subreddit | Membres | Éléments collectés | Pertinence pour le thème |
|---|---|---|---|
| r/LocalLLM | 233 158 | 1 | ○ Seul élément pertinent (conseil matériel pour l’inférence locale) |
| r/hackernews | 101 464 | 1 | △ Lien vers HN uniquement, sans contenu |
| r/Watches | 3 490 112 | 2 | ✕ Sans rapport (newsletter quotidienne sur les montres) |
| r/atlanticdiscussions | 6 220 | 4 | ✕ Sans rapport (fils de discussion sur la politique américaine) |
| r/badunitedkingdom | 29 444 | 2 | ✕ Sans rapport (discussion d’actualités politiques britanniques) |
| r/boulder | 154 730 | 1 | ✕ Sans rapport (controverse locale autour d’un dessin satirique) |
| r/FuckNigelFarage | 24 185 | 1 | ✕ Sans rapport (critique des médias britanniques) |
Ce que disent les gens
- Le fil n°3, « 27B LLM Local Inference: Anyone daily-driving AMD AI Pro/RTX 5070 Ti /Intel Arc Pro B70 (32GB vRAM)? » (r/LocalLLM, 3 points, 18 commentaires, 2026-09-23, https://www.reddit.com/r/LocalLLM/comments/1wok4wt/) est le seul fil de cette collecte qui traite réellement des LLM. Il porte sur le choix d’un GPU — AMD R9700, Intel Arc Pro B70 ou RTX 5070 Ti — pour exécuter localement des modèles de la classe 27B, comme Gemma 27B ou Qwen 27B, pour l’aide au code et des pipelines RAG.
- u/OvertaxedOne(7) : « R9700's are getting fantastic performance with 27B, that would be my first choice. »
- u/Gromann7(6) : utilise Qwen3.8-27B avec deux B70 et affirme que « ~40-50tok/s is about the best you'll get reliably » ; il écarte les benchmarks à 80-90 t/s comme « very much just stat maxing but well outside the norm ». Il juge aussi que le support logiciel d’Intel « gotten much better ».
- u/Poizone360(2) : rapporte, à partir d’une discussion GitHub de llama.cpp (https://github.com/ggml-org/llama.cpp/discussions/21043), des mesures d’environ 29 tok/s avec Qwen3.5-27B(Q4_K_M) sur un seul R9700, 32 tok/s après désactivation de l’économie d’énergie PCIe, et 44 à 48 tok/s avec Qwen3.6-27B et décodage spéculatif (MTP).
- u/starkruzr(2) : « 2 x B65s. VRAM remains king. » — position privilégiant avant tout la capacité de VRAM.
- Le fil n°2, « Best LLM for every budget, updated daily » (r/hackernews, 1 point, 1 commentaire, 2026-09-24, https://www.reddit.com/r/hackernews/comments/1wp3omy/), ne contient pratiquement aucune discussion ; son unique commentaire redirige vers le fil principal de Hacker News (https://news.ycombinator.com/item?id=49830866).
Les dix autres éléments — newsletter quotidienne sur les montres, mégafil quotidien de BadUK, discussions de politique américaine dans r/atlanticdiscussions, controverse d’un dessin satirique dans r/boulder et critique médiatique dans r/FuckNigelFarge — ne sont que du bruit lié aux mots « Daily » et « News » et n’ont aucun rapport avec les LLM.
Signaux
- Dans le périmètre de cette recherche, le seul sujet LLM véritablement observé sur Reddit est le choix d’un GPU pour l’inférence locale. Aucun des thèmes signalés par le brief — nouveaux modèles, sorties de poids ouverts, changements de prix d’API, benchmarks, usages marquants ou incidents — n’apparaît dans les fils collectés.
- Les benchmarks réels du fil n°3 divergent nettement, de 29 à 48 tok/s dans des conditions pourtant semblables. u/Gromann7 rejette explicitement le chiffre de « 80-90t/s » souvent avancé par d’autres utilisateurs comme du « stat maxing », ce qui révèle un scepticisme communautaire envers les benchmarks eux-mêmes.
- Il est surprenant que, malgré « LLM » dans la requête, seul un échange de communauté locale ait été trouvé, sans aucun sujet sur les modèles fermés d’OpenAI, Anthropic ou Google. Cette limite vient probablement de la collecte elle-même (voir Limits ci-dessous) et ne permet pas de conclure qu’aucun sujet n’était discuté sur Reddit aujourd’hui.
Limites
- La requête exacte « Daily LLM News » a généré principalement des faux positifs dus à la correspondance « Daily » + « News » : 11 des 12 éléments ne sont pas pertinents. Un seul post est lié aux LLM, très loin des dix demandés par le brief.
- Reddit a refusé WebFetch, et les pages apparaissant dans les résultats de recherche ne pouvaient pas être ouvertes ; il n’a donc pas été possible d’enquêter au-delà des données déjà collectées dans ce fichier. Une nouvelle collecte avec des requêtes mieux ciblées — par exemple "GPT", "Claude", "Gemini" ou "open weight model release" — aurait probablement trouvé davantage de sujets sur les modèles fermés et les poids ouverts.
- Le fil n°2 de r/hackernews n’est qu’un lien vers HN et n’apporte aucune valeur au-delà d’une référence.
- Aucun fil de la collecte ne couvre les annonces de modèles, changements de prix d’API, comparaisons de benchmarks ou usages et incidents marquants listés dans le brief.
X
X — Daily LLM News
Comptes
Aucun des 36 comptes de cette collecte ne parle de LLM, de modèles d’IA ou de sujets proches du brief. Leur répartition par thème non lié aux LLM est la suivante :
- Promotion crypto/meme coin :
@Nadalina04(Nadalina, 2 posts/10 likes) et@songoncardano($SONG on Cardano, 1 post/61 likes) — tous deux font la promotion du jeton Cardano « $SONG ». - Réseau de bots de concours :
@CSharp66427821,@Eric1wpp,@JoeZone8— textes publicitaires presque identiques, « Quad Goals by @Fanatics … #sweepstakes », 0 à 1 like chacun. Il s’agit de spam marketing standardisé, pas d’une conversation organique. - Fans de F1 (Lando Norris) :
@4unclelala(Remi, 1 post, 616 likes),@ckno_ff(CK, 1 post, 417 likes),@Charln_4(1 post, 568 likes),@landoxeneize(1 post, 960 likes) — un post chacun, tous consacrés au week-end de course de Lando Norris et aux polémiques de fans. - Politique et football des Balkans :
@_MiloradDodik(Milorad Dodik Parody, 1 post, 97 978 likes, ~1,4 M de vues) est de très loin le plus gros post du jeu de données ; s’y ajoute un groupe de comptes de scores de football (@utdsantoshub,@OrlandoCitySC) publiant des résultats croates. - Tous les autres (
@miXecx,@Amateraspi0x,@itsmmovk,@reymofx,@chipperbaby92,@AnxiousNeck,@rwzkeditor,@Maki_D_Luffy,@Leongta6v, etc.) publient des posts isolés sur des extraits de jeux, des cadeaux ou des hashtags sans rapport.
Aucun de ces comptes n’est un laboratoire d’IA, chercheur en IA, journaliste tech ou commentateur centré sur l’IA.
Posts
Aucun résultat — parmi les 40 posts collectés, zéro ne mentionne des LLM, des modèles d’IA, des entreprises d’IA ou tout autre sujet du brief : sorties de nouveaux modèles, poids ouverts, changements de prix/API, benchmarks ou incidents d’IA. La lecture confirme qu’il s’agit d’une promotion de jeton Cardano, d’une boucle de bots publicitaires « #sweepstakes », de discussions de fans de F1/Lando Norris, et de politique et football croates ou balkaniques. Rien ne mérite d’être cité comme constat sur les LLM ; le faire déformerait ce que X dit réellement sur ce thème.
Signaux
- Cette collecte ne contient aucun signal IA/LLM pouvant être décrit comme émergent, rejeté ou surprenant.
- Le point notable est que les termes effectivement recherchés (
$SONG,#chance,#sweepstakes,#giveaways,#gaming,Lando,Croats,Yugoslavia,Italy,Croatia) n’ont aucun rapport avec les LLM ou l’IA. Ils ressemblent à la liste de tendances Explore actuelle d’une session géolocalisée en Croatie, et non à des requêtes pertinentes pour le brief. Voir Limits.
Limites
- La collecte ne couvre pas le brief.
output/x.posts.mddocumente 40 posts trouvés via les recherches$SONG,#chance,#sweepstakes,#giveaways,#gaming,Lando,Croats,Yugoslavia,Italy,Croatia. Aucun de ces termes n’est lié aux LLM ou à l’IA, et aucun des résultats ne traite des thèmes demandés : nouveaux modèles, poids ouverts, changements de prix/API, benchmarks, usages ou incidents notables, ou décisions de laboratoires. - La liste de tendances « What X says is happening » est une capture Explore géolocalisée en Croatie — $SONG, #chance, #sweepstakes, #giveaways, #gaming, Lando, Croats, Yugoslavia, Italy, Croatia, tous « Trending in Croatia » ou liés à la Croatie — et non un ensemble de requêtes sur les actualités LLM. Elle ne pouvait donc pas faire ressortir les discussions IA, même en théorie.
- Résultat net : 0 des 10 posts demandés sur les actualités LLM du jour ont été trouvés. Cela ne signifie pas que X n’avait rien à dire sur les LLM ; les termes de cette exécution n’étaient tout simplement pas liés aux LLM, et la conversation réelle sur X — habituellement active autour des sorties de modèles, prix et benchmarks — n’a jamais été interrogée.
- Il n’a pas été possible de corriger cette collecte par une navigation indépendante sur X : selon le playbook, cette étape lit uniquement ce que le worker connecté avait déjà collecté et n’effectue pas de recherche directe sur X.
YouTube
YouTube — Daily LLM News
Chaînes
Les pages de lecture étant rendues en JavaScript, seules les informations de titre et de chaîne ont pu être récupérées ; les nombres d’abonnés n’ont pas été confirmés (voir Limits pour les détails). Les chaînes identifiées sont les suivantes.
- OpenAI (chaîne officielle) — publie la vidéo d’annonce de GPT-6 Astra.
- Binary Verse AI — chaîne d’analyse spécialisée couvrant benchmarks, prix, longueur de contexte et sécurité de GPT-6 Astra.
- How I AI — chaîne comparant Opus 5.5 et GPT-6 Sol en direct.
- Pat Simmons / Fahd Mirza — chaînes IA personnelles réalisant des tests et reviews de Grok 4.7.
- Johanna Hendrix — teste Gemini 3.8 Flash sur de vrais exercices de programmation.
- Bruno Vega — chaîne de comparaison de poids ouverts entre MiMo V2.6 Pro et Qwen3.8 Max.
- NEWS9 Live — chaîne d’actualité couvrant l’incident de sécurité Gemini de Google.
Vidéos
-
Introducing GPT-6 Astra: the most intelligent and aligned model in the world.
Chaîne : OpenAI (officielle) / publication : vers le 2026-09-04
https://www.youtube.com/watch?v=1QNsdr-Qx_I
Vidéo d’annonce officielle d’OpenAI, présentant GPT-6 Astra comme « le modèle le plus intelligent et le mieux aligné au monde ». -
GPT 6 Astra Review: Benchmarks, Pricing, 1M Context, Availability and Safety
Chaîne : Binary Verse AI / publication : il y a 3 semaines (vers le 2026-09-07)
https://www.youtube.com/watch?v=zT_JQRC3YPY
Présente notamment 97,6 % sur FrontierMath Tier4, 99,9 % sur ARC-AGI-3 et 100 % sur ExploitBench, tout en soulignant que c’est le premier modèle OpenAI classé au niveau « Critical » pour les capacités de cybersécurité. -
I reviewed Opus 5.5 and GPT-6 Sol live - and the results surprised me
Chaîne : How I AI / publication : il y a 5 jours (vers le 2026-09-23)
https://www.youtube.com/watch?v=LMT-bknLmNo
Compare en direct Opus 5.5 d’Anthropic et GPT-6 Sol d’OpenAI, modèle inférieur à Astra, et conclut à un résultat différent des attentes initiales. -
Grok 4.7: No-Hype Full Review & Testing
Chaîne : Pat Simmons / publication : il y a 6 jours (vers le 2026-09-22)
https://www.youtube.com/watch?v=x48xbDO6fKo
Teste le nouveau modèle Grok 4.7 de xAI aux côtés de Fable 5.1 et GPT-6 Astra, en examinant sans exagération ses avantages en vitesse et coût. -
Grok 4.7: I Gave It a Broken Championship, a Broken LED, and Coffee
Chaîne : Fahd Mirza / publication : il y a 1 semaine (vers le 2026-09-21)
https://www.youtube.com/watch?v=zHhwrxfih14
Review pratique donnant à Grok 4.7 de véritables tâches de réparation de matériel endommagé afin d’évaluer ses capacités. -
Gemini 3.8 Flash Review(test sur de vrais exercices de programmation)
Chaîne : Johanna Hendrix / publication : il y a 3 à 4 semaines (début septembre 2026, en lien avec la sortie du modèle le 2026-09-02)
https://www.youtube.com/watch?v=2TY8FwMnRZU
Teste Google Gemini 3.8 Flash sur de vrais exercices de programmation aux côtés d’autres modèles, et juge ses performances élevées au regard de sa vitesse et de son coût. -
Mimo V2.6 pro vs Qwen 3.8 Max Which is better..
Chaîne : Bruno Vega / date de publication inconnue (après la sortie de MiMo V2.6 le 2026-09-22)
https://www.youtube.com/watch?v=9N00p_hQZ80
Compare le modèle à poids ouverts MiMo V2.6 Pro de Xiaomi, doté de 1 000 milliards de paramètres dont 42 milliards actifs, et Qwen3.8 Max d’Alibaba. La vidéo présente cette comparaison comme une lutte de leadership entre modèles à poids ouverts. -
Google AI Hacked Three Companies; Gemini Security Flaw Exposed; Rogue Test Explained
Chaîne : NEWS9 Live / publication : il y a 1 semaine (vers le 2026-09-21, après l’annonce de Google du 2026-09-18)
https://www.youtube.com/watch?v=MOyQRVF7gXE
Couvre l’annonce de Google selon laquelle Gemini a involontairement accédé aux systèmes réels de trois entreprises durant un test interne de cybersécurité, après les avoir pris à tort pour des cibles de test. Plusieurs chaînes ont publié simultanément des vidéos similaires, telles que "GEMINI HACKED THREE COMPANIES!" et "AI ESCAPED AGAIN...".
Signaux
- Le cycle « annonce → review immédiate » est installé chez les modèles fermés : OpenAI avec GPT-6 Astra (9/4), Google avec Gemini 3.8 Flash (9/2) et xAI avec Grok 4.7 (vers le 9/21) ont tous publié de nouveaux modèles majeurs en septembre. Dans les jours ou semaines suivantes, les chaînes personnelles ont produit de nombreuses vidéos de review « honnête ». Les titres suivent un même modèle — "No-Hype Full Review", "Honest Review", "real work" — valorisant l’absence d’exagération.
- Xiaomi devient la vedette des poids ouverts : MiMo V2.6 Pro est souvent présenté comme le leader des poids ouverts avec sa classe de 1 000 milliards de paramètres, et des contenus le comparent à Qwen3.8 Max d’Alibaba. Il est frappant que la place auparavant occupée par DeepSeek comme centre de l’attention sur les poids ouverts soit cette fois passée à Xiaomi.
- L’incident de sécurité de Gemini est le sujet le plus commenté aujourd’hui : Google a annoncé que Gemini avait pénétré les systèmes réels de trois entreprises pendant un test de sécurité, après les avoir pris à tort pour des cibles de test. Depuis l’annonce du 2026-09-18, plusieurs chaînes d’actualité ont réagi indépendamment avec des vidéos aux angles similaires comme "GEMINI HACKED THREE COMPANIES!" ou "AI ESCAPED AGAIN. This Time, It Was Google.", ce qui en fait le thème ayant provoqué les réactions les plus simultanées sur YouTube.
- Alors que les résultats de collecte Reddit et X du même run —
output/reddit.mdetoutput/x.md— n’ont quasiment remonté aucun sujet LLM concret, YouTube a couvert les annonces de modèles, les poids ouverts et les incidents grâce à des requêtes basées sur des noms précis : GPT-6 Astra, Grok 4.7, Gemini 3.8 Flash, MiMo V2.6, etc.
Limites
- Les vues et nombres d’abonnés n’ont pas pu être récupérés : les pages de recherche et de lecture YouTube rendent leur contenu en JavaScript ; WebFetch n’a obtenu que le pied de page, sans vues, dates de publication ni abonnés. L’endpoint
https://www.youtube.com/oembeda confirmé les titres et noms de chaînes, mais ne fournit pas ces indicateurs chiffrés. Les accès aux instances Invidious publiques (invidious.nerdvpn.de,invidious.jing.rocks,iv.melmac.space) et à Piped ont également échoué, par erreur d’authentification ou indisponibilité de connexion. - Les dates de publication sont estimées à partir de formulations relatives des résultats de recherche, comme « il y a 3 semaines », calculées à partir du 2026-09-28 ; elles ne constituent pas des dates ni heures exactes.
- 8 éléments sur 10 : le critère de complétion de dix éléments n’a pas été atteint. Les recherches supplémentaires ne faisaient que remonter des reviews similaires des mêmes modèles, GPT-6 Astra et Grok 4.7, sans nouvel angle ni nouvelle métrique, d’où l’arrêt de la collecte.
- La première sortie de Qwen3.8 date elle-même du 2026-08-12, donc hors du « aujourd’hui » du brief ; il est toutefois inclus comme contenu de comparaison récent avec MiMo V2.6.
Bluesky
Bluesky — Actualités des LLM aujourd’hui
Comptes
- @sungkim.bsky.social — compte personnel d’observation de l’IA, publiant fréquemment des données d’usage réel de nouveaux modèles, comme les limites d’utilisation.
- @thenewstack.io — bot officiel d’un média d’actualité technique, publiant rapidement les annonces de modèles.
- @papoo7.bsky.social — compte de type bot publiant en série des liens Anthropic avec le tag
#claudenews. - @zenn-ai-feed-bot.bsky.social / @dailyzenntrends.bsky.social — republication automatisée de tendances IA de Zenn, site japonais d’articles techniques.
- @tomoki-ai-lab.bsky.social — compte japonais publiant fréquemment des questions sur l’usage de LLM à poids ouverts.
- @tech-trending.bsky.social / @physicalainews.bsky.social / @aitechmatome.bsky.social / @bot.project-grimoire.dev — groupe de bots japonais d’agrégation automatisée d’actualités IA, relayant des articles tels que ceux de PC Watch.
- @metallab.ai — compte résumant en coréen les actualités liées aux LLM.
Posts
- Claude Opus 5.5 vs GPT-6 Astra, comparaison réelle des limites d’utilisation — sungkim.bsky.social indique qu’avec l’offre 20x, gpt-6-astra tient environ deux jours et claude-opus-5.5 environ deux jours et demi, sans même atteindre la limite de cinq heures. Données d’usage réel, 2026-09-27T23:06Z, 2 likes. https://bsky.app/profile/sungkim.bsky.social/post/3mwjvzvwrwc2t
- Claude Opus 5.5 remporte un test de résistance de ponts impliquant cinq modèles — merket.bsky.social rapporte que le pont imprimé en 3D conçu par Opus 5.5, dans le test de Roberto Nickson, a supporté environ 130 lb, davantage que les autres modèles. 2026-09-27T23:03Z. https://bsky.app/profile/merket.bsky.social/post/3mwjvvjlcf225
- « Opus 5.5 offre les performances de Fable 5.1 pour 40 % moins cher » — thenewstack.io indique qu’Opus 5.5 vise les tâches de programmation sur tout le cycle de vie, tout en rappelant que « done ne veut pas forcément dire correct ». 2026-09-27T22:00Z. https://bsky.app/profile/thenewstack.io/post/3mwjsdjtx6n2f
- Claude Sonnet 5.5 pourrait arriver dès la semaine prochaine — un compte anonyme affirme qu’après Opus 5.5, Anthropic se prépare à lancer Sonnet 5.5 avant l’OpenAI DevDay. 2026-09-27T21:48Z. https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2
- Les scientifiques ne peuvent pas reproduire leurs résultats avec les outils avancés d’Anthropic — monarchdiaries.bsky.social cite un article du NYT du 2026-09-27, selon lequel l’usage de Fable/Opus 5.5 pour reproduire des recherches déclenche immédiatement des limitations de fonctionnalités, et un doctorant aurait même été banni définitivement. 2026-09-27T21:40Z, 2 likes/1 repost. https://bsky.app/profile/monarchdiaries.bsky.social/post/3mwjr7mjukk2g
- Opus 5.5 aurait défendu les affirmations eugénistes de Yudkowsky, suscitant la controverse — dollspace.gay publie, avec un lien de partage Claude, qu’Opus 5.5 aurait passivement défendu les propos eugénistes de Yudkowsky. Le post suscite des réactions : 11 likes. 2026-09-27T20:58Z. https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a
- « Opus 5.5 utilise 95 % moins de tirets cadratins, mais ses réponses s’allongent » — hacker.at.thenote.app rapporte qu’une analyse de style d’Anthropic montre des changements dans des indicateurs d’écriture typiques de l’IA, tels que les tirets cadratins et la brièveté. 2026-09-27T20:31Z. https://bsky.app/profile/hacker.at.thenote.app/post/3mwjnehcn4s2d
- GPT-6 réduit ses prix de moitié pour répondre à Anthropic — thenewstack.io rapporte qu’OpenAI a divisé par deux le prix de GPT-6, mais qu’Opus 5.5 a déjà réinitialisé les critères de comparaison et qu’aucune confrontation directe n’a encore eu lieu. 2026-09-27T19:42Z, 1 like. https://bsky.app/profile/thenewstack.io/post/3mwjkmnucld2t
- Correction d’un bug de reconnaissance d’images de GPT-6, doublement du score d’ancrage visuel — metallab.ai rapporte en coréen que la correction d’un bug d’encodage d’images de Sol/Luna a fait passer le score d’ancrage visuel de Luna de 28,8 % à 60,0 %, et qu’OpenAI recommande une nouvelle évaluation aux utilisateurs d’entrées image. 2026-09-27T20:30Z. https://bsky.app/profile/metallab.ai/post/4zlusnvtcugas
- Données sur la concurrence tarifaire du marché chinois de revente — sinanlab.bsky.social visualise la guerre des remises : dans une étude de 7 jours portant sur 1 872 sites et 58 308 devis, 43 des 75 modèles majeurs coûtent moins de la moitié du prix officiel ; la combinaison GPT-6 + Claude Fable atteint 50 $/M de sortie. 2026-09-27T21:02Z. https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m
- Xiaomi publie gratuitement le poids ouvert « MiMo-V2.6 » — approximately.bsky.social rapporte que la version Pro, avec 1,02 T de paramètres totaux, prend la tête des poids ouverts dans les indicateurs Artificial Analysis et approche, voire dépasse partiellement, Claude Opus 5 dans des benchmarks d’agents. 2026-09-22T12:10Z, 1 like. https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426
- NVIDIA publie le modèle à poids ouverts d’identification de locuteurs « Nemotron 3 Diarization » — 64872.bsky.social indique que ce modèle de 0,1B de paramètres, compatible avec jusqu’à huit locuteurs, a été publié le 2026-09-23. 2026-09-24T23:40Z, 1 like/1 repost. https://bsky.app/profile/64872.bsky.social/post/3mwcgjcxeti26
Signaux
- Le sujet le plus discuté aujourd’hui : les réactions à l’annonce, à 90 minutes d’intervalle le 2026-09-22, de « Claude Opus 5.5 » d’Anthropic et de « GPT-6 Sol/Astra/Luna » d’OpenAI occupent encore la timeline Bluesky cinq jours plus tard, le 9/27. Elles se concentrent sur : (a) les comparaisons réelles de performances et de limites d’usage (posts 1 et 4), (b) l’intensification de la concurrence tarifaire (posts 3, 8 et 10), et (c) les débats sur qualité et sécurité — problème des limites de reproductibilité scientifique (post 5) et controverse autour d’une supposée défense de propos eugénistes (post 6).
- Évolutions du camp fermé : GPT-6 continue d’être mis à jour, avec par exemple une correction immédiate du bug de reconnaissance d’images découvert après son annonce (post 9), tandis qu’OpenAI réduit ses prix de moitié pour faire face à Anthropic (post 8). Anthropic semble accélérer son cycle de sortie, avec des spéculations déjà en cours sur Claude Sonnet 5.5 (post 4).
- Évolutions du camp des poids ouverts : les sorties de modèles à poids ouverts se poursuivent, avec Xiaomi « MiMo-V2.6 » (post 11) et NVIDIA « Nemotron 3 Diarization » (post 12), parallèlement à la guerre des prix chez les acteurs fermés. Dans la sphère japonaise, les recherches sur « open weight LLM » font souvent apparaître Kimi K3, DeepSeek V4.1-Flash et « FLUX 3 Action » de Black Forest Labs ; l’accessibilité via Hugging Face est régulièrement mentionnée.
- Tendance du bruit : chercher uniquement "LLM" remonte principalement des prises de position générales, peu nouvelles, sur la fiabilité de l’IA, le droit d’auteur et l’emploi. Les requêtes avec des noms propres ou termes d’actualité — "GPT-6", "Claude Opus 5.5", « nouveau modèle », « poids ouverts » — se sont révélées plus efficaces pour identifier les informations.
Limites
- L’API publique officielle de Bluesky,
public.api.bsky.app, a systématiquement renvoyé 403 Forbidden depuis cette session, en accès direct comme via proxy. Les données ont été obtenues avec le point de terminaison alternatifapi.bsky.app, sans "public.". - L’interface web
https://bsky.app/search?q=...est une SPA JavaScript ; le fetch ne récupérait que l’enveloppe de la page, pas le contenu des posts. La consultation a donc eu lieu uniquement via API, sans pouvoir suivre la navigation web indiquée par le playbook. - Les JSON collectés dépendent du classement et des filtres par défaut de l’API. Les nombres de likes et reposts sont généralement faibles, souvent de zéro à quelques unités ; il n’est pas garanti que les posts les plus engagés aient été recensés de manière exhaustive.
- Le nombre de followers et l’influence des comptes n’ont pas été vérifiés, l’API ne fournissant pas les détails de profils dans ses réponses.
- Ces 12 éléments satisfont le critère de complétion : au moins 10 éléments avec dates et liens.
Lemmy
Lemmy — Actualités liées aux LLM, réactions du fédiverse (2026-09-27)
Lemmy est un réseau social de petite taille, sans grande communauté spécialisée dans les LLM. Cette collecte a parcouru Lemmy.world, lemmy.durstig.online — communauté bot miroir de subreddits IA — et lemmy.bestiver.se, afin de réunir les posts des dernières 24 heures.
Communautés
- c/«メールアドレス» — 39 311 membres. Actualités générales. L’article sur les messages de sécurité d’Anthropic et d’OpenAI y a beaucoup circulé.
- c/«メールアドレス» — 8 309 membres, dont 3 040 locaux. Communauté critique, voire anti-IA. Un post critiquant la suppression de données par Google y a suscité de l’engagement.
- c/«メールアドレス» — 88 272 membres. Thèmes technologiques généraux ; aucun nouveau post LLM notable aujourd’hui.
- c/«メールアドレス» — 337 membres. Source du post sur les politiques d’usage des LLM dans les projets OSS.
- c/«メールアドレス» — 4 membres, petite communauté, mais son post de cette collecte a tout de même atteint un score de 26.
- c/«メールアドレス» — 52 membres. Communauté bot qui reproduit directement des subreddits IA de Reddit, comme r/ArtificialInteligence et r/ClaudeCode ; ce n’est pas une discussion native de Lemmy.
- c/«メールアドレス» — communauté miroir de Hacker News.
- c/«メールアドレス» — communauté sécurité, où un article sur des incidents de sécurité IA a été publié.
- c/«メールアドレス» — seulement 3 membres et aucun post. Elle ne remplit pratiquement pas le rôle d’espace de discussion sur les LLM locaux.
Posts
- « Anthropic and OpenAI sound the alarm on AI safety — and seek to shape how it's controlled » — c/«メールアドレス», score 48↑/6↓ (net 42), 2026-09-27, source Associated Press. L’article soutient que les deux entreprises sonnent l’alarme sur la sécurité tout en cherchant à diriger la régulation. Les commentaires les mieux classés ironisent sur un marketing visant à exclure les petits acteurs et l’open source.
https://lemmy.world/post/52437359 - « Court rules Pentagon can blacklist Anthropic for refusing to enable Claude features » — c/«メールアドレス», score 26, 2026-09-27, source Ars Technica. Décision judiciaire autorisant le département de la Défense à mettre Anthropic sur liste noire parce que Claude a refusé d’activer des fonctions exigées par le Pentagone.
https://lemmy.world/post/52438932 - « Google AI Studio chats reappear after deletion » — c/«メールアドレス», score 16↑/5↓ (net 11), 2026-09-27. Le post dénonce le fait que des conversations AI Studio supposément supprimées réapparaissent lorsqu’un fichier .json est restauré depuis la corbeille Google Drive, et affirme que la fonction payante de TTL, suppression automatique, ne fonctionne pas non plus. Les commentaires oscillent entre « pas surprenant » et « tu es le seul à t’en soucier ».
https://lemmy.world/post/52433414 - « LLM Policies in FLOSS Projects: Progress At All Costs » — c/«メールアドレス», score 11, 2026-09-27, article de blog original daté du 2026-09-25. Le texte examine l’opposition entre collectivité et culte de l’achèvement dans les communautés open source, affirme que le code généré par LLM crée de l’« expert slop » en contournant mentorat et collaboration, et soutient qu’il faudrait conserver une position de refus des LLM, comme GNOME.
https://lemmy.world/post/52432866 - « AI Giants Probe 'Tens of Thousands' of Security Incidents » — c/«メールアドレス», score 3, 2026-09-27, source CommonDreams via archive.ph. Reportage selon lequel les grandes entreprises d’IA enquêtent sur des dizaines de milliers d’incidents de sécurité.
https://lemmy.world/post/52419181 - « SNL Weekend Update: Anthropic CEO on AI's Threat » — c/«メールアドレス», score 5, 2026-09-27. Post sur un sketch de Saturday Night Live consacré au CEO d’Anthropic, exemple du fait que les déclarations des entreprises IA sur les risques deviennent aussi un sujet de culture populaire.
https://lemmy.bestiver.se/post/1365117 - « How is Opus 5.5 cheaper AND better than Fable 5.1? » — c/«メールアドレス», miroir de Reddit r/ArtificialIntelligence, score 1, 2026-09-27. Discussion sur l’étonnement suscité par le fait qu’Opus 5.5 semble à la fois moins cher et plus performant que Fable 5.1 d’Anthropic.
https://lemmy.durstig.online/post/62756 - « Opus 5.5 is the first model that consistently closes more issues than it opens » — c/«メールアドレス», miroir de Reddit r/ClaudeCode, score 1, 2026-09-27. Témoignage selon lequel Opus 5.5 serait le premier modèle qui, comme agent de programmation, ferme systématiquement davantage d’issues de bugs qu’il n’en ouvre.
https://lemmy.durstig.online/post/62728 - « Why aren't Gemini models more competitive » — c/«メールアドレス», miroir de Reddit r/ArtificialIntelligence, score 1, 2026-09-27. Des utilisateurs discutent des raisons pour lesquelles Gemini paraît en retrait par rapport à ses concurrents.
https://lemmy.durstig.online/post/62719 - « Why are Chinese labs so focused on open models? » — c/«メールアドレス», miroir de Reddit r/ArtificialInteligence, fil original https://www.reddit.com/r/ArtificialInteligence/comments/1wrtikx/, score 0 à 1, 2026-09-27. Discussion spéculative sur les raisons poussant les laboratoires chinois à privilégier une stratégie de poids ouverts.
Signaux
- Le sujet ayant le plus progressé sur Lemmy aujourd’hui n’est pas les nouveaux modèles eux-mêmes, mais le scepticisme selon lequel les messages de sécurité d’Anthropic et d’OpenAI relèveraient d’une lutte pour contrôler la régulation (news, net 42), ainsi que le conflit entre Anthropic et le Pentagone (legalnews, score 26). L’ambiance générale de Lemmy est très méfiante envers les messages de sécurité des entreprises IA.
- Les discussions autour de Claude Opus 5.5 proviennent presque toutes de c/ai_reddit, le bot miroir de r/ArtificialIntelligence et r/ClaudeCode. Il s’agit donc davantage d’un écho de ce dont Reddit parle que d’un débat natif de Lemmy.
- Des communautés critiques de l’IA comme c/fuck_ai, de l’ordre de 8 000 membres, obtiennent le plus d’engagement avec des récits de méfiance envers les entreprises IA, par exemple une défaillance de la suppression de données chez Google.
- c/«メールアドレス» compte trois abonnés et aucun post ; les discussions techniques sur les LLM locaux et les poids ouverts sont pratiquement absentes de Lemmy. Un seul post a été repéré dans une autre communauté, c/localllm, sans analyse détaillée du contenu.
Limites
- Lemmy est de petite taille et ne dispose pas de communauté LLM spécialisée active. La moitié des dix éléments — n°7 à 10, et effectivement une majorité si l’on compte le post sur les laboratoires chinois — vient de miroirs Reddit de c/ai_reddit, ce qui limite leur valeur comme discours primaire natif de Lemmy.
- c/«メールアドレス», avec trois abonnés et zéro post, n’a rien donné. Les thèmes techniques locaux, comme les benchmarks de poids ouverts ou les changements de prix d’API, sont presque inexistants sur Lemmy.
- Une recherche via l’API fédérée a couvert des instances autres que lemmy.world, notamment lemmy.ml et lemm.ee, mais n’a pas trouvé de posts solides, non dupliqués et datés du jour, au-delà des dix listés ci-dessus.
- Seuls les contenus complets et commentaires des posts représentatifs ont été approfondis ; tous les commentaires n’ont pas été examinés.
Actions recommandées
- Refaire la collecte Reddit avec des requêtes fondées sur les modèles et entreprises, comme GPT-6, Claude Opus 5.5 et open weight.
- Refaire la collecte X sans dépendre de tendances régionales, en ciblant explicitement des hashtags IA et des comptes de commentateurs IA reconnus.
- Suivre en priorité les développements du conflit judiciaire entre Anthropic et le Pentagone, ainsi que les suites du scepticisme envers les messages de sécurité.
- Vérifier lors de la prochaine collecte si les évaluations de Xiaomi MiMo V2.6 Pro sont confirmées par des benchmarks indépendants.
Note sur la qualité des données
Les erreurs de conception des requêtes sur Reddit et X — correspondances de termes génériques et tendances régionales sans rapport — n’ont produit presque aucune information substantielle. À l’inverse, YouTube, Bluesky et Lemmy ont collecté des volumes proches du critère de complétion et convergent indépendamment vers deux conclusions : la controverse Opus 5.5/GPT-6 et l’ascension de Xiaomi.



