Course aux modèles
Le classement LiveBench, une étude des rendements décroissants
GPT-5.6 Sol remporte la couronne globale sur LiveBench avec une moyenne de 82,4, mais Claude Fable 5 le suit de seulement 1,6 point à près de trois fois le coût. La véritable histoire est la manière dont le peloton s'est éclairci en dessous.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-22 · 4 min de lecture

LiveBench a publié sa dernière mise à jour, et la forme du classement est révélatrice. Le sommet est dominé par deux laboratoires, OpenAI avec GPT-5.6 Sol et Anthropic avec Claude Fable 5, séparés par une erreur d'arrondi sur le score composite mais à des années-lumière en termes de prix.
GPT-5.6 Sol Max Effort affiche une moyenne globale de 82,4. Claude Fable 5 Max Effort se situe à 80,8. Cet écart de 1,6 point coûte près de 2,7 fois plus par token si vous utilisez la configuration supérieure d'Anthropic. GPT-5.6 Terra, la variante la moins chère de la même famille, atteint 79,8, plus proche du Claude du haut de gamme que de l'écart entre Sol et Fable. Les rendements marginaux des dépenses supplémentaires sont infimes, et ils se compriment rapidement.
Ce que chaque modèle fait bien
La moyenne globale cache des divergences réelles au niveau des catégories. Claude Fable 5 domine l'écriture avec 90,7, à égalité avec GPT-5.5 Thinking et Claude 4.8 Opus Thinking, et un plein 3 points d'avance sur GPT-5.6 Sol à 87,7. Si votre charge principale est la prose, Claude Fable est le choix évident, et la variante GPT la plus proche (5.5 Thinking) coûte 0,53 $ par token contre 1,57 $ pour Fable.

Le raisonnement est une histoire plus complexe. GPT-5.6 Sol atteint 96,2 sur les benchmarks de raisonnement, légèrement en avance sur le 96,0 de Claude Fable et le 95,9 de GPT-5.5 Thinking. Tout cela est dans la marge d'erreur. La véritable chute intervient après les quatre premiers : Gemini 3.1 Pro Preview obtient 91,0 et Claude 4.7 Opus Thinking atterrit à 92,9. Au-delà, les chiffres glissent assez rapidement dans les années 80.
Les mathématiques restent un bastion pour la gamme GPT. GPT-5.6 Sol mène avec 91,7, suivi par GPT-5.6 Terra à 90,6 et GPT-5.5 Thinking à 89,7. Claude Fable 5 égalise le score de GPT-5.5 à 89,7, mais Claude 4.8 Opus Thinking le suit également à 89,7, identique sur le papier. La variation est suffisamment faible pour qu'une seule mauvaise graine puisse inverser l'ordre.
Les résultats en codage montrent plus d'écart. GPT-5.6 Sol obtient 83,9 en codage. Claude Fable 5 obtient 86,0. Plusieurs variantes de la gamme Claude surpassent GPT en codage, Claude Sonnet 5 à 80,7 et Claude 4.6 Opus Thinking à 78,2, mais aucune n'égale les deux premiers. Le classement du codage est la seule catégorie où un modèle extérieur au duopole, Gemini 3.1 Pro Preview à 76,5, se trouve à portée de la prochaine tranche inférieure.
La zone budget : modèles ouverts et outsiders
En dessous de 75 au global, le terrain se remplit d'options intéressantes. DeepSeek V4 Pro, en poids ouvert, affiche une moyenne de 71,6 à 0,05 $ par token, soit environ 30 fois moins cher que Claude Fable 5 pour environ 89 % de la performance composite. Kimi K3, également ouvert, obtient 78,5 à 0,379 $, ce qui en fait le meilleur rapport qualité-prix dans la bande des hauts 70. Qwen 3.7 Max à 73,1 et 0,182 $ est compétitif avec GPT-5.4 Nano à 69,6 et 0,091 $ dans le même quartier de prix.
Grok 4.5 à 76,3 et 0,128 $ est un nouveau venu qui mérite l'attention ; il bat plusieurs variantes Claude et GPT plus chères au composite tout en coûtant une fraction du prix. Sa faiblesse est l'écriture (68,6) et le codage (70,8), mais le raisonnement à 90,8 est véritablement de premier ordre. Si xAI itère sur les faiblesses, cette gamme pourrait grimper rapidement dans le classement.
La contraction au sommet
La caractéristique la plus frappante de cette mise à jour est la manière dont les quatre meilleurs modèles se regroupent à moins de 2,2 points les uns des autres tandis que tout le reste chute régulièrement. Ce n'est pas la courbe de progrès exponentielle que les laboratoires d'IA aiment projeter. C'est une longue traîne de gains incrementaux à un coût exponentiel. La différence entre GPT-5.6 Sol et GPT-5.4 Nano est de 12,8 points au composite, mais la différence de prix est d'environ 6,5x. Payer plus vous apporte plus, mais la courbe s'aplatit.
Pour quiconque déploie à grande échelle, le point idéal se situe probablement dans la fourchette de 0,10 $ à 0,20 $ où vivent des modèles comme Grok 4.5, DeepSeek V4 Pro et Qwen 3.7 Max. Ils sont suffisamment bons pour la plupart des charges de production, et le delta de coût par rapport au sommet finance beaucoup de cycles d'évaluation avant que vous n'atteigniez le point mort sur les gains de précision.
Les données LiveBench ne disent pas quel modèle est le meilleur, cela dépend de votre tâche et de votre budget. Elles disent que l'écart entre le meilleur et le très bon se réduit, et que le meilleur devient cher plus vite qu'il ne s'améliore.
- Source : LiveBench
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.