Classement des meilleurs modèles d’IA (LLM) en août 2026

Classement des meilleurs modèles d’IA (LLM) en août 2026

Table des matières

Juillet a été l’un des mois les plus denses depuis longtemps. Anthropic a sorti Claude Opus 5 le 24 juillet et lui a immédiatement pris la première place du classement. Moonshot AI a publié Kimi K3, le plus gros modèle en poids ouverts jamais diffusé. Grok 4.5 est arrivé sous une nouvelle bannière, SpaceXAI, après la fusion de xAI et SpaceX. Et OpenAI a fini de déployer GPT-5.6 avant de casser ses tarifs fin juillet. Même Meta change de logiciel : la firme vend désormais une API payante.

Ce guide s’appuie sur les données d’Artificial Analysis, qui suit plus de 250 modèles et fait référence pour l’évaluation objective des IA. Les scores ci-dessous utilisent l’Intelligence Index v4.1, la grille en vigueur depuis la mi-juin : ils sont comparables à ceux de mon classement du mois dernier, mais pas à ceux d’avant juin. Voici mon top 15 des LLM les plus performants en août 2026, avec leurs tarifs et mes recommandations selon votre cas d’usage.

Le top 15 des LLM les plus intelligents en août 2026

Le classement ci-dessous est basé sur l’Intelligence Index v4.1 d’Artificial Analysis au 1er août 2026. Le score synthétise les performances sur des benchmarks variés : agents autonomes, code, mathématiques, raisonnement scientifique et compréhension du langage. J’ai retenu une ligne par modèle, dans sa meilleure configuration.

# Modèle Créateur Score Intel. (v4.1) Contexte Prix/1M tokens (in/out)
1 Claude Opus 5 (max) Anthropic 61 1 M $5 / $25
2 Claude Fable 5 Anthropic 60 1 M $10 / $50
3 GPT-5.6 Sol (max) OpenAI 59 1 M $5 / $30
4 Kimi K3 (max) Moonshot AI 57 1,05 M $3 / $15 (open)
5 GPT-5.6 Terra (max) OpenAI 55 1 M $2 / $12
6 Grok 4.5 (high) SpaceXAI 54 500 K $2 / $6
7 Claude Sonnet 5 (max) Anthropic 53 1 M $3 / $15
8 GPT-5.6 Luna (max) OpenAI 51 1 M $0,20 / $1,20
9 GLM-5.2 (max) Z.ai 51 1 M ~$0,90 (open)
10 Muse Spark 1.1 (xhigh) Meta 51 1,05 M $1,25 / $4,25
11 Gemini 3.6 Flash Google 50 1 M $1,50 / $7,50
12 Gemini 3.5 Flash Google 50 1 M $1,50 / $9
13 DeepSeek V4-Flash 0731 DeepSeek 50 1 M N.C. (open)
14 Gemini 3.1 Pro Preview Google 46 1 M $2 / $12
15 Qwen3.7 Max Alibaba 46 1 M N.C.

Scores Intelligence Index v4.1 d’Artificial Analysis, relevés le 1er août 2026. Les tarifs sont donnés à titre indicatif (prix catalogue input/output), à vérifier sur la fiche de chaque éditeur.

Analyse détaillée des modèles phares

Claude Opus 5 : le nouveau numéro un

C’est l’événement du mois. Lancé le 24 juillet 2026, Claude Opus 5 prend la première place de l’Intelligence Index avec un score de 61, devant Claude Fable 5. Anthropic occupe donc les deux premières marches avec ses propres modèles.

Le point vraiment intéressant, c’est le prix : 5 $/M input et 25 $/M output, soit exactement le tarif d’Opus 4.8 et la moitié de Fable 5. Autrement dit, la meilleure intelligence du marché coûte désormais deux fois moins cher que le modèle qu’elle dépasse. Il embarque 1 million de tokens de contexte par défaut, jusqu’à 128 000 tokens en sortie, et un réglage d’effort sur cinq niveaux qui permet d’arbitrer finement entre profondeur de raisonnement et facture.

Ce réglage change la lecture du classement. Opus 5 en mode « medium » affiche encore un score de 56, pour un coût par tâche mesuré à 0,72 $ contre 2,34 $ en mode « max ». Vous pouvez donc rester dans le très haut du tableau en divisant votre coût par trois, simplement en baissant le curseur.

Claude Fable 5 : toujours là, mais plus seul

Claude Fable 5, sorti le 9 juin, conserve un score de 60 et reste redoutable sur le raisonnement, l’écriture et le développement logiciel. Mais son positionnement devient plus difficile à défendre : à 10 $/M input et 50 $/M output, il coûte le double d’Opus 5 pour un point d’intelligence en moins.

Il garde un intérêt sur les tâches les plus exigeantes, celles où la moindre marge de qualité justifie la dépense. Pour tout le reste, Opus 5 est le choix rationnel.

GPT-5.6 : OpenAI déploie enfin, puis casse les prix

Après un déploiement freiné en juin, GPT-5.6 est désormais pleinement disponible dans ses trois déclinaisons. Sol, le haut de gamme, décroche un score de 59 et se place juste derrière Opus 5. Terra vise le milieu de gamme à 55, avec une vitesse remarquable de 125 tokens par seconde. Et Luna joue l’entrée de gamme à 51.

Le vrai coup, c’est la baisse tarifaire du 30 juillet : OpenAI a réduit Luna de 80 % (de 1 $/6 $ à 0,20 $/1,20 $) et Terra de 20 % (à 2 $/12 $). Sol reste à 5 $/30 $. Résultat, Luna offre un score de 51, soit le niveau de GLM-5.2, pour un coût par tâche mesuré à 0,07 $. C’est l’une des équations les plus agressives du tableau, et un signal clair : OpenAI attaque désormais sur le prix autant que sur la performance.

Gemini 3.6 Flash : Google affine sa recette

Sorti le 21 juillet, Gemini 3.6 Flash remplace la version 3.5 avec un score identique de 50, mais une facture allégée : l’output passe de 9 $ à 7,50 $/M, et le modèle consomme environ 17 % de tokens en moins pour un résultat équivalent. L’économie réelle est donc plus large que ne le laisse penser l’étiquette.

Il ajoute aussi une date de coupure de connaissances repoussée à mars 2026, ce qui réduit le besoin d’aller chercher des informations récentes à l’extérieur. Avec 222 tokens par seconde, c’est le modèle le plus rapide du top 15. Pour les applications à haut volume, Google reste très difficile à battre.

Les challengers qui redessinent le marché

Kimi K3 : l’open-source chinois entre dans la cour des grands

Voilà le deuxième événement du mois. Kimi K3 de Moonshot AI affiche 2 800 milliards de paramètres, ce qui en fait le plus gros modèle en poids ouverts jamais publié. Son score de 57 le place quatrième du classement, devant GPT-5.6 Terra et Grok 4.5.

Les poids ont été mis en ligne le 26 juillet, avec une disponibilité immédiate chez plusieurs hébergeurs. Le tarif API est de 3 $/M input et 15 $/M output, avec un cache d’entrée à 0,30 $. Il propose 1,05 million de tokens de contexte et un mode de raisonnement toujours actif.

Le fait qu’un modèle librement téléchargeable talonne de si près les frontier américains constitue le vrai basculement de ce mois de juillet. Pour les organisations qui tiennent à héberger leur IA elles-mêmes, l’écart de qualité avec le sommet du marché n’a jamais été aussi faible.

Grok 4.5 : xAI devient SpaceXAI

Grok 4.5 est sorti le 8 juillet, et c’est le premier modèle publié après la fusion de xAI et SpaceX. Le créateur s’appelle désormais SpaceXAI dans les classements, un changement à retenir si vous suivez le secteur.

Sur le fond, le modèle vise clairement les développeurs : il a été entraîné sur des milliards de tokens issus de Cursor, avec lequel il a été lancé conjointement. Il décroche un score de 54 pour 2 $/M input et 6 $/M output, ce qui en fait l’un des meilleurs rapports intelligence/prix du haut de tableau. Deux réserves : sa fenêtre de contexte plafonne à 500 000 tokens, la plus courte du top 15, et son taux d’hallucination reste supérieur à celui de ses concurrents directs.

Muse Spark 1.1 : Meta passe au payant

Changement de stratégie notable chez Meta. Jusqu’ici, la firme misait sur la gratuité et l’ubiquité, avec son IA diffusée dans WhatsApp, Instagram et Messenger. Le 9 juillet, Meta Superintelligence Labs a lancé Muse Spark 1.1 et, surtout, une API payante à 1,25 $/M input et 4,25 $/M output.

Le modèle est multimodal, propriétaire (les poids ne sont pas publiés) et pensé pour les tâches agentiques : il orchestre du travail à travers des applications externes et lance des sous-agents en parallèle plutôt que de traiter les étapes une par une. Avec un score de 51 et 1,05 million de tokens de contexte, il devient un concurrent sérieux sur l’usage des outils, où il domine plusieurs benchmarks.

GLM-5.2, DeepSeek et Qwen : l’alternative économique

GLM-5.2 de Z.ai maintient son score de 51 et passe désormais à 1 million de tokens de contexte, pour environ 0,90 $/M. DeepSeek V4-Flash, dans sa révision du 31 juillet, affiche un score de 50 avec le coût par tâche le plus bas de tout le haut de tableau, mesuré à 0,03 $. Et Qwen3.7 Max d’Alibaba continue de briller sur le raisonnement scientifique à 201 tokens par seconde.

Pour les équipes qui veulent de la performance sans dépendance ni facture salée, ces trois-là forment un socle solide.

Comment choisir son LLM selon son cas d’usage

Pour la performance maximale

Claude Opus 5 est le nouveau choix par défaut : meilleur score du marché, et à la moitié du prix de Fable 5. Ne gardez Claude Fable 5 que si vos tâches justifient réellement le surcoût. Si vos usages tournent autour des agents autonomes, GPT-5.6 Sol reste très proche et souvent plus rapide.

Pour le développement logiciel

Claude Opus 5 et GPT-5.6 Sol se tiennent en un point sur l’Intelligence Index, et le choix se joue surtout sur votre outillage. Grok 4.5 mérite un test si vous travaillez dans Cursor, puisqu’il a été entraîné pour. Pour les budgets serrés, Kimi K3 et GLM-5.2 offrent l’essentiel à une fraction du prix. J’entre dans le détail des benchmarks de code dans mon comparatif des meilleurs modèles d’IA pour coder.

Pour le meilleur rapport qualité/prix

GPT-5.6 Luna devient difficile à battre depuis la baisse du 30 juillet : un score de 51 à 0,20 $/1,20 $. Gemini 3.6 Flash reste le meilleur choix pour les gros volumes, et Claude Sonnet 5 conserve son tarif d’intro à 2 $/10 $ jusqu’au 31 août. Autre piste que beaucoup négligent : baisser le niveau d’effort d’Opus 5 à « medium » vous laisse à un score de 56 pour trois fois moins cher.

Pour un budget serré ou la souveraineté

DeepSeek V4-Flash reste le champion de l’économie, avec le coût par tâche le plus bas du classement. Côté poids ouverts, Kimi K3 change la donne : c’est le premier modèle librement téléchargeable à s’approcher à quatre points du sommet mondial. GLM-5.2, MiniMax-M3 et MiMo V2.5 Pro complètent la sélection pour l’auto-hébergement.

Pour traiter des documents volumineux

La quasi-totalité du top 15 propose désormais 1 million de tokens de contexte natifs, ce qui n’était pas le cas il y a six mois. Seul Grok 4.5 reste en retrait à 500 000 tokens. Pour les contrats massifs, les dossiers juridiques ou les bases de code entières, Gemini 3.6 Flash et GPT-5.6 Luna restent les plus rapides et les moins chers de cette catégorie.

Les tendances marquantes du marché en août 2026

  • La performance devient moins chère : Opus 5 dépasse Fable 5 à la moitié du prix. C’est la première fois cette année que le meilleur modèle du classement n’est pas le plus cher.
  • Le niveau d’effort devient un levier de coût : un même modèle peut occuper quatre rangs du classement selon son réglage. Opus 5 va de 61 à 51 points, et de 2,34 $ à 0,43 $ par tâche.
  • L’open-source chinois n’est plus un compromis : avec Kimi K3 à 57 points, l’écart avec le sommet mondial tombe à quatre points, pour un modèle que vous pouvez héberger vous-même.
  • La guerre des prix s’accélère : OpenAI a réduit Luna de 80 % et Terra de 20 % le 30 juillet, Google a baissé l’output de son Flash. Le milieu de gamme devient un champ de bataille tarifaire.
  • Meta change de modèle économique : après des années de gratuité totale, la firme lance une API payante. Le signe que même les acteurs les plus gratuits cherchent désormais à monétiser.

Conclusion : quel LLM choisir en août 2026 ?

Le choix d’un LLM en 2026 n’est plus une question de « meilleur dans l’absolu », c’est une question de cas d’usage et de budget. La bascule de ce mois-ci, c’est que la meilleure performance ne s’achète plus au prix fort : Opus 5 le prouve, et la baisse des tarifs OpenAI enfonce le clou.

Mes 3 recommandations principales pour août 2026 :

  • Pour la performance maximaleClaude Opus 5 (nouveau leader, à moitié prix de Fable 5)
  • Pour le meilleur rapport qualité/prixGPT-5.6 Luna ou Gemini 3.6 Flash
  • Pour la souveraineté et l’auto-hébergementKimi K3 (le meilleur modèle en poids ouverts jamais publié)

Le rythme d’innovation reste effréné : je mets à jour ce classement à chaque évolution majeure.

Passionné par les SaaS, l'IA et l'entrepreneuriat, j'ai fondé Digitiz en 2016. Mon objectif est de vous transmettre mon expérience et de pouvoir vous faire gagner du temps dans le choix de vos outils.

Partagez cet article sur les réseaux sociaux
Rejoignez la newsletter
+ de 100 000 professionels aidés grâce à Digitiz
Reviewer 1 Reviewer 2 Reviewer 3 Reviewer 4 Reviewer 5