Quel modèle d’IA choisir quand onze des quinze meilleurs LLM du marché sont sortis en septembre ? Anthropic a publié Claude Opus 5.5 le 22 septembre puis Claude Sonnet 5.5 le 28. OpenAI a lancé GPT-6 Astra le 3, puis GPT-6.1 Sol le 29.
Google est revenu dans la course le 30 septembre avec Gemini 4 Argon, et Xiaomi a pris la tête des modèles en poids ouverts avec MiMo-V2.6-Pro.
Résultat : le podium est entièrement neuf, et le prix d’une même tâche varie désormais de 0,13 $ à 7,63 $ selon le modèle.
Ce classement s’appuie sur l’Intelligence Index d’Artificial Analysis, qui évalue plus de 250 modèles dans les mêmes conditions. Vous y trouverez le top 15 avec les tarifs, puis le modèle à retenir selon votre usage. C’est parti !
Le top 15 des LLM les plus intelligents en octobre 2026
Les scores ci-dessous ont été relevés le 1er octobre 2026. Chaque modèle apparaît une seule fois, dans sa meilleure configuration. La colonne « coût par tâche » indique ce que coûte réellement une épreuve du test, raisonnement compris.
| # | Modèle | Créateur | Score | Contexte | Prix/1M tokens (in/out) | Coût par tâche |
| 1 | Claude Opus 5.5 (max) | Anthropic | 58 | 1 M | 4 $ / 20 $ | 5,98 $ |
| 2 | Claude Sonnet 5.5 (max) | Anthropic | 56 | 1 M | 2 $ / 10 $ | 7,62 $ |
| 3 | Claude Fable 5.1 (max) | Anthropic | 53 | 1 M | 10 $ / 50 $ | 7,63 $ |
| 4 | GPT-6 Astra (max) | OpenAI | 53 | 1 M | 10 $ / 50 $ | 3,26 $ |
| 5 | Gemini 4 Argon (high) | 53 | 1 M | 2 $ / 10 $ (promo) | 1,99 $ | |
| 6 | GPT-6.1 Sol (max) | OpenAI | 52 | 1 M | 2 $ / 10 $ | 0,72 $ |
| 7 | Muse Spark 1.3 (max) | Meta | 48 | 1 M | 1,25 $ / 4,25 $ | 1,60 $ |
| 8 | Grok 4.7 (xhigh) | SpaceXAI | 46 | 500 K | 2 $ / 6 $ | 3,74 $ |
| 9 | MiMo-V2.6-Pro | Xiaomi | 46 | 1 M | 0,43 $ / 0,87 $ (open) | 0,13 $ |
| 10 | Qwen3.8 Max | Alibaba | 45 | 984 K | 2 $ / 6 $ | 5,41 $ |
| 11 | GLM-5.3 (max) | Z.ai | 45 | 1 M | 1,40 $ / 4,40 $ (open) | 2,01 $ |
| 12 | Step 5 Preview | StepFun | 44 | 1 M | 1 $ / 2,70 $ | 0,72 $ |
| 13 | Kimi K3 (max) | Moonshot AI | 44 | 1,05 M | 3 $ / 15 $ (open) | 2,00 $ |
| 14 | GPT-5.6 Terra (max) | OpenAI | 42 | 1 M | 2 $ / 12 $ | 1,40 $ |
| 15 | GLM-5.3-Flash | Z.ai | 42 | 1 M | 0,15 $ / 0,50 $ (open) | 0,25 $ |
Un point à connaître avant de lire ces chiffres : le barème est devenu plus dur le 7 septembre. Artificial Analysis a publié la version 4.3 de son index, avec deux changements :
- Terminal-Bench 4.0 remplace la version 2.1, avec des tâches de code en autonomie nettement plus difficiles ;
- AutomationBench-AA, un test d’automatisation de workflows monté avec Zapier, prend la place de l’épreuve bancaire.
Conséquence : tous les scores ont baissé de dix à quinze points. Claude Opus 5 est passé de 63 à 51 points en septembre, sans changer d’une ligne. Un 58 d’aujourd’hui ne se compare donc pas à un score relevé cet été.
Analyse détaillée des modèles phares
Claude Opus 5.5 : premier, et 20 % moins cher que son prédécesseur
Sorti le 22 septembre, Claude Opus 5.5 atteint 58 points, soit cinq de plus que tous ses concurrents hors Anthropic.
À sa sortie, il a pris la tête de six des dix épreuves de l’index, dont le code scientifique (67 % au SciCode).
Anthropic a aussi baissé ses prix. Le modèle coûte 4 $ / 20 $ par million de tokens, contre 5 $ / 25 $ pour Opus 5, et la lecture de cache tombe à 0,20 $.
Le réglage d’effort fait varier la facture du simple au triple :
- max : 58 points pour 5,98 $ par tâche ;
- xhigh : 56 points pour 3,46 $ ;
- high : 54 points pour 1,82 $, soit encore un point devant GPT-6 Astra.
Pour la plupart des usages, le réglage high est le bon compromis.
Claude Sonnet 5.5 : deuxième du classement, mais très gourmand
Publié le 28 septembre, Sonnet 5.5 gagne 18 points sur Sonnet 5 et se place deuxième avec 56 points. Il signe même le meilleur score du classement en code agentique : 64 % au Terminal-Bench 4.0, devant Opus 5.5 (60 %).
Son tarif n’a pas bougé, à 2 $ / 10 $. Le piège est ailleurs : en effort maximal, il consomme environ 193 000 tokens de sortie par tâche, le volume le plus élevé jamais mesuré par Artificial Analysis.
Résultat : une tâche coûte 7,62 $ avec Sonnet 5.5, contre 5,98 $ avec Opus 5.5, pourtant deux fois plus cher au token. En effort high, il redescend à 1,08 $ pour 47 points.
Artificial Analysis précise que ces mesures viennent d’une préversion et seront refaites.
Claude Fable 5.1 et GPT-6 Astra : les deux modèles à 50 $
Sortis les 1er et 3 septembre, Fable 5.1 et GPT-6 Astra affichent le même score (53 points) et le même tarif : 10 $ / 50 $ par million de tokens.
Trois semaines plus tard, Opus 5.5 les dépasse avec un tarif au token 60 % plus bas.
Entre les deux, la différence se joue sur la consommation. Astra boucle une tâche avec 27 000 tokens de sortie, contre 78 000 pour Fable :
- GPT-6 Astra : 3,26 $ par tâche, 60 % au Terminal-Bench 4.0 en xhigh ;
- Claude Fable 5.1 : 7,63 $ par tâche, 63 % au SciCode, deuxième meilleur score sur le code scientifique.
J’ai mis les deux modèles face à face sur un exercice précis : recréer 5 SaaS en un seul prompt. Vous verrez dans la vidéo lequel livre une application qui tourne du premier coup.
Le détail des résultats, épreuve par épreuve, est dans mon comparatif Claude Fable 5.1 vs GPT-6 Astra.
Gemini 4 Argon : Google revient dans le trio de tête
Google n’avait pas sorti de modèle au-dessus de la gamme Flash depuis plus de sept mois. Gemini 4 Argon, annoncé le 30 septembre, atteint 53 points, soit 23 de plus que Gemini 3.1 Pro Preview.
Son vrai point fort est la fiabilité. Son taux d’hallucination est de 15 %, contre 51 % pour GPT-6 Astra : quand il ne sait pas, il le dit au lieu d’inventer.
Deux réserves avant de miser dessus :
- l’accès est restreint : le modèle est déployé auprès d’utilisateurs sélectionnés, pas encore ouvert à tous ;
- le prix est promotionnel : 2 $ / 10 $ avec 50 % de remise, sans date de fin annoncée. Le coût par tâche passera alors de 1,99 $ à 3,98 $.
GPT-6.1 Sol : le meilleur rapport intelligence/coût du classement
OpenAI a sorti GPT-6 Sol le 22 septembre, puis l’a remplacé sept jours plus tard par GPT-6.1 Sol. Le nouveau modèle atteint 52 points, à un point de GPT-6 Astra.
La différence se voit sur la facture. Une tâche coûte 0,72 $ avec GPT-6.1 Sol, contre 3,26 $ avec Astra, pour un tarif de 2 $ / 10 $ par million de tokens.
En effort high, il tient encore 50 points pour 0,32 $ par tâche. À ce niveau d’intelligence, aucun modèle n’est moins cher aujourd’hui.
Les challengers à connaître
MiMo-V2.6-Pro : Xiaomi prend la tête des poids ouverts
C’est la surprise du mois. Xiaomi a publié les poids de MiMo-V2.6-Pro le 22 septembre sous licence MIT, donc utilisable commercialement. Avec 46 points, il devient le meilleur modèle en poids ouverts du classement.
Ses chiffres clés :
- tarif d’API : 0,43 $ / 0,87 $ par million de tokens, le plus bas du top 10 ;
- coût par tâche : 0,13 $, soit 46 fois moins qu’Opus 5.5 pour 12 points d’écart ;
- contexte : 1 million de tokens.
Sa limite : l’auto-hébergement n’est pas à la portée de tous. Le modèle pèse plus de 1 000 milliards de paramètres et Xiaomi recommande un déploiement sur deux nœuds de GPU haut de gamme.
Grok 4.7 : un prix affiché trompeur
SpaceXAI a sorti Grok 4.7 le 21 septembre, au même tarif que Grok 4.6 : 2 $ / 6 $. Il gagne deux points, à 46.
Attention à la consommation : il utilise 81 000 tokens de sortie par tâche, contre 36 000 pour son prédécesseur. Une tâche revient donc à 3,74 $, plus cher que GPT-6 Astra.
Son contexte reste plafonné à 500 000 tokens, quand tous ses concurrents directs sont à 1 million.
Muse Spark 1.3 : Meta mise sur la vitesse
Sorti le 2 septembre, Muse Spark 1.3 atteint 48 points pour 1,25 $ / 4,25 $. Il génère 181 tokens par seconde, deux fois plus vite qu’Opus 5.5.
Le modèle reste propriétaire : Meta promet une version en poids ouverts, sans date.
GLM-5.3, Kimi K3, Qwen3.8 et Step 5 : le peloton chinois
Quatre modèles se tiennent en un point :
- Qwen3.8 Max (Alibaba) : 45 points, 2 $ / 6 $, mais 5,41 $ par tâche ;
- GLM-5.3 (Z.ai) : 45 points, 1,40 $ / 4,40 $, en poids ouverts ;
- Step 5 Preview (StepFun) : 44 points pour 0,72 $ par tâche ;
- Kimi K3 (Moonshot AI) : 44 points, poids ouverts, mais seulement 34 tokens par seconde.
La déclinaison GLM-5.3-Flash reste l’affaire du bas de tableau : 42 points pour 0,15 $ / 0,50 $.
Gemini 3.8 Flash et DeepSeek V4.1 Flash : la vitesse d’abord
Ces deux modèles restent hors du top 15, mais ils sont les plus rapides à ce niveau de score :
- Gemini 3.8 Flash : 41 points, 236 tokens par seconde, 0,75 $ / 3,75 $ jusqu’au 31 décembre 2026 (le double ensuite) ;
- DeepSeek V4.1 Flash : 39 points, 209 tokens par seconde, 0,30 $ / 1,20 $ en heures pleines, en poids ouverts.
Comment choisir son LLM selon son cas d’usage
Pour la performance maximale
Claude Opus 5.5 est le choix par défaut. Commencez en effort high (54 points, 1,82 $ par tâche) et ne montez en max que sur les problèmes qui résistent.
Pour le développement logiciel
Claude Sonnet 5.5 signe le meilleur score en code agentique, GPT-6.1 Sol le meilleur rapport résultat/prix. J’ai consacré un classement complet aux meilleurs modèles IA pour coder, avec le coût et la durée par tâche.
Pour le meilleur rapport qualité/prix
GPT-6.1 Sol, sans hésiter : 52 points pour 0,72 $ par tâche. Si vous y avez accès, Gemini 4 Argon fait un point de mieux pour 1,99 $, tant que la promotion dure.
Pour un budget serré ou la souveraineté
Trois modèles en poids ouverts sortent du lot :
- MiMo-V2.6-Pro : 46 points, licence MIT ;
- GLM-5.3 : 45 points ;
- GLM-5.3-Flash : 42 points pour 0,15 $ / 0,50 $.
Tous sont chinois. En auto-hébergement, rien ne transite chez l’éditeur. Par leur API, une analyse de conformité s’impose.
Vous pouvez aussi faire tourner un modèle sur votre propre machine. Dans cette vidéo, j’installe 5 modèles en local et je compare ce qu’ils donnent sur un ordinateur de bureau.
Les résultats détaillés sont dans mon comparatif des meilleures IA locales.
Pour limiter les erreurs factuelles
Gemini 4 Argon hallucine trois fois moins que GPT-6 Astra (15 % contre 51 %). Pour de la recherche documentaire ou du contenu qui sera publié sans relecture experte, c’est le critère qui compte.
Pour le temps réel
Deux modèles se détachent sur la vitesse :
- Gemini 3.8 Flash : 236 tokens par seconde, pour un chatbot ou un traitement de flux ;
- Muse Spark 1.3 : 181 tokens par seconde, avec sept points d’intelligence de plus.
Les tendances marquantes du marché en octobre 2026
Le prix au token ne dit plus rien. Sonnet 5.5 est deux fois moins cher qu’Opus 5.5 au token et 27 % plus cher à la tâche. GPT-6 Astra affiche le même tarif que Fable 5.1 et coûte deux fois moins à l’usage.
Le réflexe à prendre : regarder le coût par tâche avant de signer.
Les sorties s’enchaînent à un rythme inédit. GPT-6 Sol a été remplacé au bout de sept jours. Fable 5.1 a perdu la première place en trois semaines. Un contrat annuel sur un seul modèle n’a plus beaucoup de sens.
Les prix du haut de gamme baissent. Anthropic a retiré 20 % sur Opus, et OpenAI a divisé par deux le tarif de Sol entre GPT-5.6 et GPT-6. La pression vient des modèles ouverts.
Les poids ouverts restent à 12 points du leader. MiMo-V2.6-Pro est à 46 quand Opus 5.5 est à 58. Six lignes du top 15 sont occupées par des laboratoires chinois, dont quatre avec des modèles téléchargeables.
Conclusion : quel LLM choisir en octobre 2026 ?
Si vous voulez le meilleur modèle du moment, prenez Claude Opus 5.5. Il est premier, il coûte moins cher qu’Opus 5 et son réglage high suffit dans la majorité des cas.
Si vous regardez la facture, la réponse est GPT-6.1 Sol : six points de moins que le leader pour un coût par tâche huit fois inférieur. C’est l’arbitrage le plus rentable de ce classement.
Et si vos données ne doivent pas sortir de chez vous, MiMo-V2.6-Pro et GLM-5.3 sont les deux meilleurs modèles en poids ouverts du classement.
Ce classement est mis à jour chaque mois. Pensez à le mettre en favori pour suivre l’évolution du marché.