Comparatif des modèles d'IA frontière : les classements ne disent pas la même chose
Claude Opus 5, Fable 5, Grok 4.6, GPT-5.6 Sol, Kimi K3, Gemini 3.7 Flash. Selon la source consultée, le même indice donne des scores différents pour les mêmes modèles. Voici les chiffres, et pourquoi ils divergent.

Photo : 1981 Digital / Unsplash
Choisir un modèle en août 2026 revient à arbitrer entre une dizaine de candidats séparés par quelques points sur des indices agrégés. Nous avons rassemblé les chiffres publics. En les rapprochant, un problème saute aux yeux avant même la comparaison : les sources ne s'accordent pas.
Le classement, tel qu'il est publié
L'indice le plus cité est l'Artificial Analysis Intelligence Index, qui agrège dix épreuves. Voici l'instantané relevé par BenchLM le 14 août 2026, sur 177 modèles suivis.
1. Claude Opus 5 (Anthropic) — 63,0 %
2. Claude Fable 5 (Anthropic) — 62,1 % — contexte 1 M
3. Grok 4.6 (xAI) — 60,9 % — contexte 500 K
4. Kimi K3 (Moonshot AI) — 59,7 %
5. GPT-5.6 Sol (OpenAI) — 58,9 %
6. Qwen3.8 Max Preview (Alibaba) — 58,1 %
7. Claude Opus 4.8 (Anthropic) — 57,3 %
8. Muse Spark 1.2 (Meta) — 56,8 %
9. GPT-5.5 (OpenAI) — 56,3 %
10. Gemini 3.7 Flash (Google) — 56,0 %
Le problème : trois sources, trois chiffres
Prenons Claude Fable 5. L'instantané ci-dessus lui donne 62,1 et la deuxième place. Mais l'article publié par Artificial Analysis lui-même, à la sortie du modèle, annonce 64,9 et la première place, avec « environ 5 points d'avance sur le modèle non-Anthropic le plus proche ».
Même écart côté xAI. La page d'annonce de Grok 4.6 revendique 61 points à égalité avec GPT-5.6 Sol. L'instantané du 14 août place Grok 4.6 à 60,9 et GPT-5.6 Sol à 58,9 : deux points d'écart, pas une égalité.
Un détail dans l'évaluation de Fable 5 illustre bien la fragilité de l'exercice. Artificial Analysis note qu'environ 8 % des tâches ont déclenché un basculement vers Claude Opus 4.8, un mécanisme de repli sur les requêtes signalées, alors qu'Anthropic annonce un déclenchement sur moins de 5 % des sessions en moyenne. Le score mesuré n'est donc pas tout à fait celui d'un modèle unique.
Ce qui, lui, ne bouge pas : le prix
Les tarifs par million de tokens sont publics, stables et faciles à vérifier. Ils dessinent une hiérarchie très différente du classement d'intelligence.
Grok 4.6 — 2 $ en entrée / 6 $ en sortie, 0,50 $ en cache.
GPT-5.6 — trois paliers : Sol à 5 $ / 30 $, Terra à 2,50 $ / 15 $, Luna à 1 $ / 6 $. Lecture de cache remisée de 90 %, écriture facturée 1,25 fois l'entrée.
Claude Fable 5 — 10 $ / 50 $, écriture de cache 12,50 $ et lecture 1 $, contexte de 1 million de tokens.
Autrement dit : entre le premier et le troisième de l'indice, l'écart d'intelligence est de deux points sur cent, et l'écart de prix en sortie d'un facteur huit. Artificial Analysis relève d'ailleurs que GPT-5.6 Sol coûte environ un tiers du prix de Fable 5 pour une intelligence proche.
Les scores agrégés cachent des spécialités
Un indice global écrase les différences qui comptent en pratique. Trois exemples tirés des mêmes sources :
Code en autonomie — GPT-5.6 Sol mène le Coding Agent Index à 80 points, devant Fable 5 et Opus 4.8. Il n'est pourtant que cinquième au classement général.
Efficacité en tokens — Sol consomme environ 15 000 tokens de sortie par tâche de l'indice, moins que la plupart des modèles de niveau comparable. À prix affiché égal, la facture réelle est plus basse.
Tâches d'agent — Grok 4.6 se classe 7ᵉ sur 130 en catégorie agentique chez BenchLM, nettement mieux que son 18ᵉ rang en code.
Comment choisir, concrètement
Volume élevé, tâches répétitives : le prix domine tout le reste. Grok 4.6 et GPT-5.6 Luna sont d'un autre ordre de grandeur que le haut de gamme.
Agent au long cours : regardez les épreuves agentiques et l'efficacité en tokens, pas l'indice global. Un modèle bavard coûte cher deux fois — en tokens et en latence.
Conversation en direct : le débit et la latence avant premier token comptent plus que deux points d'indice. Un modèle de raisonnement peut mettre une trentaine de secondes avant d'écrire son premier mot.
Documents très longs : la fenêtre de contexte tranche seule. 1 million de tokens chez Fable 5, 500 000 chez Grok 4.6.
Sources
Classement : BenchLM, instantané de l'Artificial Analysis Intelligence Index, relevé du 14 août 2026. Scores et tarifs à la sortie : Artificial Analysis sur Claude Fable 5 et sur GPT-5.6. Chiffres Grok 4.6 : xAI. Les scores d'indice sont des mesures datées, pas des propriétés des modèles.
À lire ensuite
OpenAI suspend les nouveaux abonnements ChatGPT Pro, débordée par la demande pour GPT-6 Astra
OpenAI a suspendu les nouvelles souscriptions à ChatGPT Pro, invoquant une demande sans précédent pour GPT-6 Astra. Les abonnés déjà inscrits ne sont pas concernés. La mesure fait écho, sans lui être formellement liée, à des propos de Sam Altman sur un ralentissement possible du rythme de l'IA.
Kelvyn3 min de lecture
DeepSeek V4.1 Flash mise sur des « N-grammes » pour alléger la mémoire de son modèle
DeepSeek dévoile V4.1 Flash, une mise à jour qui introduit des « N-grammes », un nouveau type de paramètres censé réduire fortement la consommation mémoire. Les chiffres d'efficience sont documentés, mais aucun benchmark de qualité ne vient encore les mettre en perspective.
Kelvyn2 min de lecture
Universal Music lance une plateforme IA de remix musical avec ElevenLabs
Universal Music Group annonce un accord pluriannuel avec ElevenLabs pour une plateforme IA de remix et mashup musicaux. La participation des artistes est optionnelle et aucune date de lancement public n'a été fixée.
Kelvyn3 min de lecture