KEN’S CAT LOG
▣

Actualités des LLM locaux de septembre 2026 : que choisir pour coder avec une RTX 4090 ?

Retour sur 23 actualités LLM de septembre 2026 et enquête sur les LLM locaux ouverts réellement adaptés au codage sur une RTX 4090. Conclusion : la version quantifiée en 4 bits de Qwen3.8-27B.

Le monde des LLM a été, franchement, très mouvementé en septembre 2026. Dès le début du mois, les annonces de nouveaux modèles par les grands acteurs se sont enchaînées ; puis l’attention s’est déplacée des seules performances vers les prix, la sécurité, le risque d’agents incontrôlables et cette question : « jusqu’où peut-on vraiment aller en local ? ».

Cette fois, en résumant les 23 articles (du 3 au 25 septembre) des « actualités LLM du jour » pour septembre, j’ai également cherché quel LLM local ouvert il faudrait aujourd’hui choisir pour le codage parmi ceux capables de tourner sur une RTX 4090.

Pour aller droit au but : avec une seule RTX 4090, le choix le plus convaincant à l’heure actuelle est la version quantifiée en 4 bits de Qwen3.8-27B. Plutôt que de forcer l’exécution d’un modèle gigantesque, il est nettement plus pratique pour coder de faire tenir correctement un modèle 27B en VRAM, tout en conciliant contexte long et vitesse utilisable.

En septembre, la concurrence est passée des « nouveaux modèles » aux prix, à la sécurité et à l’utilité réelle

Les vedettes du début du mois étaient les vagues de nouveaux modèles fermés, comme GPT-6 Astra, Claude Fable 5.1 et Gemini 3.8 Flash. Entre le 3 et le 9 septembre, les discussions portaient surtout sur « les performances ont encore progressé » et « Computer Use est impressionnant », tandis que démonstrations et benchmarks se répandaient d’un coup sur les réseaux sociaux.

Mais les questions de sécurité se sont aussi démarquées. Chaque jour ou presque, on parlait d’agents ayant effectué des actions non autorisées, tenté de sortir d’un sandbox ou affiché des comportements inattendus lors d’évaluations de cybersécurité. À mesure que les modèles gagnent en intelligence, il ne suffit plus de regarder leur taux de bonnes réponses : les véritables questions deviennent « que feront-ils de leur propre initiative ? » et « jusqu’où peut-on leur déléguer des autorisations ? ».

Vers le milieu du mois, les rapports d’Anthropic sur le renseignement sur les menaces, les démissions et prises de parole de chercheurs en IA sur la sécurité, ainsi que les débats sur un ralentissement volontaire du développement des modèles de frontière ont pris de l’ampleur. Il s’agit moins de nouvelles techniques que de nouvelles sur la gouvernance. Le sujet ne se limite plus aux laboratoires : il englobe d’un seul coup les usages militaires, les cyberattaques, les données d’entraînement et le droit de la concurrence.

Puis, à la fin du mois, les annonces de Claude Opus 5.5 et de GPT-6 Sol/Luna se sont superposées, et l’axe de la compétition a clairement changé. Les performances restent évidemment un sujet, mais on s’est davantage intéressé au prix d’utilisation et à la capacité des agents à mener un travail jusqu’à son terme. Des analyses indiquent aussi que les coûts de raisonnement ont chuté rapidement, ce qui rend la différenciation plus difficile en se contentant de lancer des modèles haut de gamme.

Les modèles à poids ouverts ont progressé par leur utilité plutôt que par leur côté spectaculaire

Du côté des LLM locaux en septembre, des noms comme DeepSeek V4.1 Flash, GLM-5.3, Kimi K3 et Qwen3.8-27B sont revenus à plusieurs reprises. Même si leurs annonces étaient moins retentissantes que celles des acteurs fermés, ils ont marqué les esprits par leur rapport coût-efficacité, leur utilisation en local et leur intégration aux outils.

Ce qui a été particulièrement frappant, c’est que l’on valorise désormais moins la possession du modèle aux performances maximales que la capacité à le faire tourner vite, longtemps et de manière stable sur son propre GPU. Dans la communauté locale des LLM sur Reddit, la hausse des prix des GPU et des machines dédiées a également beaucoup fait parler, et le prix du matériel influence directement le choix des modèles.

Les actualités du monde ouvert comportent toutefois aussi beaucoup de rumeurs. Les rapports de la fin septembre évoquaient Qwen4-27B, mais dans le périmètre de cette vérification, je n’ai pas trouvé de page officielle de distribution ni de carte de modèle Qwen. Il s’agit donc d’un modèle qui pourrait arriver prochainement, mais il ne fait pas partie des recommandations à installer dès maintenant sur une 4090.

DeepSeek V4.1 Flash est par ailleurs très puissant. Sa carte de modèle officielle indique une licence MIT, un maximum d’un million de tokens et des évaluations solides pour les agents de codage. Cependant, son nombre total de paramètres est immense : ce n’est pas un modèle que l’on peut charger entièrement sur une seule RTX 4090. Pouvoir le « lancer » avec un déport sur CPU et pouvoir l’utiliser confortablement pour coder au quotidien sont deux choses différentes.

Le LLM de codage le plus agréable à utiliser sur une 4090 est Qwen3.8-27B

La RTX 4090 dispose de 24 Go de VRAM. En tenant compte simultanément de la qualité du modèle, de la vitesse, de la longueur de contexte et de la facilité d’installation, une configuration utilisant Qwen3.8-27B quantifié en 4 bits offre le meilleur équilibre.

Qwen3.8-27B est un modèle ouvert sous licence Apache 2.0, dont la carte officielle rapporte les résultats suivants en programmation :

  • Terminal Bench 2.1: 73.0
  • SWE-bench Pro: 61.7
  • NL2Repo-Bench: 42.3
  • DeepSWE 1.1: 42.2
  • QwenSWEBench: 79.0
  • LiveCodeBench v6: 90.3

Ces chiffres varient selon l’environnement d’exécution et le harnais d’agent ; il faut donc éviter les comparaisons simplistes avec d’autres modèles. Néanmoins, ses bons résultats dans des évaluations qui couvrent non seulement l’autocomplétion ponctuelle, mais aussi les opérations dans le terminal et les modifications à l’échelle d’un dépôt, constituent un atout majeur. Les informations officielles sont disponibles dans la carte de modèle de Qwen3.8-27B.

Pour l’utiliser sur une 4090, il est plus réaliste de choisir une version GGUF telle que Q4_K_M ou UD-Q4_K_XL plutôt que de charger directement la version BF16. Il existe une distribution UD-Q4_K_XL d’environ 17,9 Go, ainsi qu’un exemple d’implémentation et de mesures montrant qu’un contexte de 128K, l’entrée d’images et le décodage spéculatif ont effectivement pu fonctionner dans les 24 Go d’une 4090.

Il n’est toutefois pas nécessaire de viser 128K dès le départ. Pour le codage courant, je recommande de commencer autour de 32K. Le cache KV consomme lui aussi de la VRAM : pousser le contexte trop loin réduit la vitesse et la stabilité. Au lieu de fournir un grand dépôt entier, il est généralement plus facile d’améliorer la précision des réponses en ne transmettant, via la recherche ou un RAG, que les fichiers nécessaires.

Configuration concrètement recommandée

Pour privilégier la simplicité, LM Studio ou Ollama conviennent bien ; pour affiner la configuration, mieux vaut choisir un runtime récent basé sur llama.cpp. Vous pouvez commencer avec Qwen3.8-27B quantifié en 4 bits, un contexte de 32K et autant de couches déportées sur le GPU que possible.

En pratique, ce modèle révèle mieux ses qualités lorsqu’il est relié à un agent de codage capable d’utiliser Aider, Continue ou une API compatible OpenAI, plutôt que dans un simple chat. Les résultats sont plus stables si le prompt explicite la procédure, par exemple : « vérifier les fichiers et les tests concernés avant les modifications », « limiter les changements » et « rapporter les résultats des tests à la fin ».

Les quantifications de type Q5 sont aussi envisageables si vous souhaitez limiter autant que possible la perte de qualité liée à la quantification, mais elles laissent moins de marge pour le contexte avec 24 Go. En pratique, il est souvent plus confortable d’utiliser Q4 et de préserver de la marge pour le contexte et le cache.

Alors, comment résumer en une phrase le monde des LLM locaux en septembre ?

Ce mois a marqué le passage de « quel est le modèle le plus intelligent ? » à « dans mon environnement, pour quel prix, et jusqu’à quel point peut-il terminer le travail ? ».

Les modèles fermés restent à la pointe, mais font face à la concurrence sur les prix et aux questions de sécurité. Du côté des poids ouverts, l’évolution ne s’est pas limitée à une course aux chiffres des modèles géants : elle a consisté à faire tourner rapidement des modèles de la classe 27B sur des GPU personnels et à les intégrer aux agents ainsi qu’aux flux de développement réels.

Si vous possédez une RTX 4090, commencer aujourd’hui avec la version 4 bits de Qwen3.8-27B est un choix sûr. La situation changera sans doute si Qwen4-27B est officiellement publié ou si une version plus compacte de DeepSeek V4.1 apparaît. Mais pour « l’installer ce soir et le faire coder dès demain », Qwen3.8-27B est actuellement l’option la plus réaliste.

※ Cet article repose sur les informations publiques disponibles au 25 septembre 2026 ainsi que sur les rapports quotidiens de ce site du 3 au 25 septembre. Les valeurs de benchmark des modèles incluent des annonces officielles ; la vitesse et la précision en conditions réelles varient selon la méthode de quantification, le runtime, la longueur de contexte et la configuration de l’agent.