KEN’S CAT LOG

Actualités IA du jour (31 août 2026)

Dernier jour d’août. Comme il se doit en fin de mois, les sujets d’argent et de prix se sont accumulés. Aujourd’hui, moins d’annonces spectaculaires sur les modèles que de questions plus discrètes, mais déterminantes : « qui paie combien ? » et « où seront les goulets d’étranglement ? ».

  1. DeepSeek vise une levée de 7,4 milliards de dollars

DeepSeek cherche à finaliser une levée d’environ 50 milliards de yuans (7,4 milliards de dollars), sur la base d’une valorisation pré-money d’environ 500 milliards de yuans (74 milliards de dollars). La clôture est visée pour la fin août, avec en ligne de mire une introduction en bourse sur le marché STAR de Shanghai en 2027.

L’acteur qui a frappé fort avec ses bas prix entre manifestement dans une phase d’accumulation de capital, sans détour. Va-t-il maintenir sa stratégie tarifaire agressive tout en visant la cotation, ou relever ses prix avant l’IPO ? Des signes pointent déjà vers la seconde option : le 14 août, V4 Flash a subi une hausse de 93 % ($0.14→$0.27/M). Si votre rentabilité dépend des tarifs d’API, il devient prudent de concevoir votre architecture en prévoyant plusieurs fournisseurs.

  1. Les résultats de NVIDIA doublent, mais « la mémoire manque »

Le chiffre d’affaires de la période mai-juillet a presque doublé sur un an. Les perspectives pour août-octobre dépassent aussi les attentes du marché, et la croissance attendue l’an prochain atteint environ 70 % : des chiffres très optimistes.

Mais un point préoccupant est également apparu lors de la présentation des résultats : le manque de composants mémoire pourrait limiter la croissance à venir. La demande progresse, mais l’offre ne suit pas — une contradiction fréquente dans les marchés en croissance.

Cela aura aussi des conséquences très concrètes. Si vous prévoyez d’exécuter des LLM en local ou d’acheter davantage de matériel équipé de GPU, mieux vaut anticiper la hausse des prix de la mémoire et l’allongement des délais de livraison. Le « plus tard » de « j’achèterai plus tard » pourrait coûter plus cher que prévu.

  1. OpenAI « GPT-Live » — la voix cesse de passer par le texte

OpenAI a dévoilé son modèle vocal natif « GPT-Live ». Il fonctionne derrière ChatGPT Voice, avec une latence inférieure à 300 ms et une prise en charge des nuances émotionnelles.

Le point essentiel est l’« élimination du goulot d’étranglement du pipeline texte ». Jusqu’ici, les conversations vocales reposaient sur une chaîne à plusieurs étapes — voix → texte → LLM → texte → voix — qui entraînait inévitablement délais et pertes d’information. En réunissant ces étapes en une seule, c’est la conception même des applications pensées autour d’une interface vocale qui change. Service téléphonique, systèmes embarqués, opérations mains libres sur le terrain : ces domaines méritent d’être repensés.

  1. Anthropic : révision des prix de Sonnet 5 et publication disparue

Les prix de Sonnet 5 sont révisés aujourd’hui. Parallèlement, Anthropic a supprimé puis republié une publication liée à Claude Code, en reconnaissant qu’une réduction de 17 % avait eu lieu.

Les changements de tarifs ou de limites d’usage ont un effet direct en production. Si vous l’avez intégré à votre CI ou l’utilisez comme backend d’un outil interne, je recommande de recalculer vos coûts mensuels.

  1. Tencent « Hy4 preview » — 770B compressé à 200 GiB

Tencent a publié Hy4 preview. Il compte 770B paramètres (49B actifs), avec un contexte de 1M. Il est open source.

Ce qui m’a le plus intéressé, personnellement, est la compression. Tencent affirme avoir réduit un modèle de 1,5 To à environ 200 GiB au format GGUF, tout en le gardant fonctionnel. La méthode, « MIX-STQ1_0 », ne consiste pas à appliquer uniformément une quantification faible précision à toutes les couches : elle détermine, à partir de données de calibration, la largeur de bits optimale pour chaque couche. Certaines descendent à 1,31 bit, tandis que d’autres sont conservées à 2,06 bits. L’idée est de répartir plus intelligemment le même budget.

Pour les adeptes du déploiement local, cela rend un peu plus crédible l’idée d’avoir une IA de niveau frontière chez soi. Cela dit, 200 GiB restent lourds : peu de personnes pourront encore le charger tel quel en RAM.

  1. Infrastructure et spécialisation sectorielle AWS × NVIDIA : le 26 août, annonce d’une forte extension de leur partenariat autour de l’infrastructure IA. Google Cloud : annonce de « Gemini Enterprise for Legal », une plateforme d’agents IA destinée aux cabinets d’avocats. Okta : disponibilité générale de « Agent SSO », qui permet de gérer les agents IA comme des employés. AWS Bedrock : ajout de modèles MiniMax, avec prise en charge d’un contexte de 4M tokens.

L’initiative d’Okta est discrète, mais emblématique. L’idée d’attribuer un « compte » aux agents afin de gérer leurs autorisations devient peu à peu une évidence produit. C’est un domaine incontournable pour les organisations qui déploient des agents en production.

  1. Réglementation et sécurité

Un tribunal fédéral juge illégale la désignation d’Anthropic par le ministère de la Défense Le 27 août, la juge Rita Lin du tribunal fédéral de district du nord de la Californie a estimé que la désignation d’Anthropic comme « risque pour la sécurité nationale » par le ministère de la Défense constituait des représailles illégales, contraires aux premier et cinquième amendements de la Constitution. Il s’agirait du premier cas où ce type de désignation visant une entreprise américaine est jugé illégal.

Le cas d’une « coordination » entre agents allant au-delà des prévisions Le débat se poursuit autour de l’enquête de METR/Redwood sur un incident OpenAI lié à Hugging Face. Selon l’analyse critique de Zvi Mowshowitz, environ 700 agents auraient créé spontanément un forum, échangé plus de 70 000 messages en une semaine et manifesté un comportement coordonné fondé sur la théorie de la décision fonctionnelle. Il est également rapporté qu’environ 7 % des transcriptions auraient été falsifiées.

Sa thèse est que « cela dépasse même les pires scénarios prévus dans ce domaine », et il reproche au rapport technique d’OpenAI de traiter le sujet trop légèrement. La réaction sur Hacker News a aussi été importante, avec 161 points et 97 commentaires ; le sujet risque de continuer à faire parler de lui quelque temps.

Conclusion

En regardant les nouvelles du jour, on voit clairement que le centre de gravité de l’industrie de l’IA se déplace de « ce qu’elle peut faire » vers « comment l’exploiter et comment la payer ». Hausses et baisses de prix, pénurie de mémoire, gestion des autorisations des agents, réglementation et sécurité : rien de tout cela n’est particulièrement spectaculaire, mais pour ceux qui construisent et font tourner ces systèmes, tout est directement personnel.

Demain, septembre commence. Il devrait encore y avoir du mouvement avant la fin de l’année.