Aller au contenu
KLYNLABS

Comparatif des modèles d'IA frontière : les classements ne disent pas la même chose

Claude Opus 5, Fable 5, Grok 4.6, GPT-5.6 Sol, Kimi K3, Gemini 3.7 Flash. Selon la source consultée, le même indice donne des scores différents pour les mêmes modèles. Voici les chiffres, et pourquoi ils divergent.

Kelvyn4 min de lecture

Choisir un modèle en août 2026 revient à arbitrer entre une dizaine de candidats séparés par quelques points sur des indices agrégés. Nous avons rassemblé les chiffres publics. En les rapprochant, un problème saute aux yeux avant même la comparaison : les sources ne s'accordent pas.

Le classement, tel qu'il est publié

L'indice le plus cité est l'Artificial Analysis Intelligence Index, qui agrège dix épreuves. Voici l'instantané relevé par BenchLM le 14 août 2026, sur 177 modèles suivis.

  • 1. Claude Opus 5 (Anthropic) — 63,0 %

  • 2. Claude Fable 5 (Anthropic) — 62,1 % — contexte 1 M

  • 3. Grok 4.6 (xAI) — 60,9 % — contexte 500 K

  • 4. Kimi K3 (Moonshot AI) — 59,7 %

  • 5. GPT-5.6 Sol (OpenAI) — 58,9 %

  • 6. Qwen3.8 Max Preview (Alibaba) — 58,1 %

  • 7. Claude Opus 4.8 (Anthropic) — 57,3 %

  • 8. Muse Spark 1.2 (Meta) — 56,8 %

  • 9. GPT-5.5 (OpenAI) — 56,3 %

  • 10. Gemini 3.7 Flash (Google) — 56,0 %

Le problème : trois sources, trois chiffres

Prenons Claude Fable 5. L'instantané ci-dessus lui donne 62,1 et la deuxième place. Mais l'article publié par Artificial Analysis lui-même, à la sortie du modèle, annonce 64,9 et la première place, avec « environ 5 points d'avance sur le modèle non-Anthropic le plus proche ».

Même écart côté xAI. La page d'annonce de Grok 4.6 revendique 61 points à égalité avec GPT-5.6 Sol. L'instantané du 14 août place Grok 4.6 à 60,9 et GPT-5.6 Sol à 58,9 : deux points d'écart, pas une égalité.

Un détail dans l'évaluation de Fable 5 illustre bien la fragilité de l'exercice. Artificial Analysis note qu'environ 8 % des tâches ont déclenché un basculement vers Claude Opus 4.8, un mécanisme de repli sur les requêtes signalées, alors qu'Anthropic annonce un déclenchement sur moins de 5 % des sessions en moyenne. Le score mesuré n'est donc pas tout à fait celui d'un modèle unique.

Ce qui, lui, ne bouge pas : le prix

Les tarifs par million de tokens sont publics, stables et faciles à vérifier. Ils dessinent une hiérarchie très différente du classement d'intelligence.

  • Grok 4.6 — 2 $ en entrée / 6 $ en sortie, 0,50 $ en cache.

  • GPT-5.6 — trois paliers : Sol à 5 $ / 30 $, Terra à 2,50 $ / 15 $, Luna à 1 $ / 6 $. Lecture de cache remisée de 90 %, écriture facturée 1,25 fois l'entrée.

  • Claude Fable 5 — 10 $ / 50 $, écriture de cache 12,50 $ et lecture 1 $, contexte de 1 million de tokens.

Autrement dit : entre le premier et le troisième de l'indice, l'écart d'intelligence est de deux points sur cent, et l'écart de prix en sortie d'un facteur huit. Artificial Analysis relève d'ailleurs que GPT-5.6 Sol coûte environ un tiers du prix de Fable 5 pour une intelligence proche.

Les scores agrégés cachent des spécialités

Un indice global écrase les différences qui comptent en pratique. Trois exemples tirés des mêmes sources :

  • Code en autonomie — GPT-5.6 Sol mène le Coding Agent Index à 80 points, devant Fable 5 et Opus 4.8. Il n'est pourtant que cinquième au classement général.

  • Efficacité en tokens — Sol consomme environ 15 000 tokens de sortie par tâche de l'indice, moins que la plupart des modèles de niveau comparable. À prix affiché égal, la facture réelle est plus basse.

  • Tâches d'agent — Grok 4.6 se classe 7ᵉ sur 130 en catégorie agentique chez BenchLM, nettement mieux que son 18ᵉ rang en code.

Comment choisir, concrètement

  • Volume élevé, tâches répétitives : le prix domine tout le reste. Grok 4.6 et GPT-5.6 Luna sont d'un autre ordre de grandeur que le haut de gamme.

  • Agent au long cours : regardez les épreuves agentiques et l'efficacité en tokens, pas l'indice global. Un modèle bavard coûte cher deux fois — en tokens et en latence.

  • Conversation en direct : le débit et la latence avant premier token comptent plus que deux points d'indice. Un modèle de raisonnement peut mettre une trentaine de secondes avant d'écrire son premier mot.

  • Documents très longs : la fenêtre de contexte tranche seule. 1 million de tokens chez Fable 5, 500 000 chez Grok 4.6.

Sources

Classement : BenchLM, instantané de l'Artificial Analysis Intelligence Index, relevé du 14 août 2026. Scores et tarifs à la sortie : Artificial Analysis sur Claude Fable 5 et sur GPT-5.6. Chiffres Grok 4.6 : xAI. Les scores d'indice sont des mesures datées, pas des propriétés des modèles.

À lire ensuite