SevenTnewS

Intelligence artificielle

Grok 4.6 fait match nul avec GPT-5.6 Sol à 61, puis les scores par composante divergent

Le Grok 4.6 de xAI fait match nul avec GPT-5.6 Sol à 61 sur l'indice Artificial Analysis Intelligence, un composite de neuf benchmarks. La répartition est déséquilibrée : victoires sur le travail de connaissance et la plupart des tests de code, défaites sur DeepSWE et Terminal-Bench. Disponible dès maintenant dans Cursor et Grok Build, à partir de 2 $ par million de jetons d'entrée.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-13 · 4 min de lecture

Grok 4.6 fait match nul avec GPT-5.6 Sol à 61, puis les scores par composante divergent
Sources : xAI: Grok 4.6 r…·seventnews cove…

La nouvelle version de xAI défend l'idée que les modèles de pointe devraient être jugés sur leur capacité à soutenir une tâche dans la durée, et non sur leur rapidité à répondre à une seule requête. Grok 4.6, disponible aujourd'hui, est conçu pour des travaux qui s'étendent sur de nombreuses étapes : approfondir un sujet, analyser des informations, travailler sur une base de code, mener une idée jusqu'à une application fonctionnelle. xAI affirme que le modèle reste sur des tâches complexes tout au long de ces trajectoires et, sur les exécutions plus longues, commence à vérifier son propre travail avant de poursuivre.

Le chiffre principal est un 61 sur l'indice Artificial Analysis Intelligence, un composite de neuf benchmarks. Cela place Grok 4.6 au même niveau que GPT-5.6 Sol et un point derrière Fable 5 à 62. Comparé à la version précédente de xAI, la progression est sans ambiguïté : Grok 4.5 avait obtenu 56 sur le même indice.

C'est dans le composite que réside la parité. Les scores par composante publiés par xAI racontent une histoire plus contrastée. Grok 4.6 bat GPT-5.6 Sol sur six des benchmarks listés : GDPVal-AA v2 (1753 contre 1728), CursorBench v3.2 (69.9% contre 67.2%), FrontierCode v1.1 dans sa forme étendue (61.3% contre 60.6%), APEX-Agents (57.5% contre 56.7%), AA-Briefcase (1577 contre 1502) et l'évaluation Harvey LAB (Vals), où il affiche 15.8% contre 2.5% pour son rival. Sur APEX-SWE, xAI rapporte 56.4% et GPT-5.6 Sol n'a pas de score publié. Les défaites se concentrent sur deux lignes : DeepSWE v1.1 à 65.9% contre 73%, et Terminal-Bench v3.0 à 26% contre 34.6%.

Ces deux lacunes sont celles qui comptent pour une version destinée aux agents de longue durée. Les deux benchmarks récompensent une exécution soutenue sur une longue session, exactement le terrain que le modèle est censé maîtriser. La trajectoire est encourageante : DeepSWE passe de 54% sur Grok 4.5 à 65.9%, Terminal-Bench de 15.7% à 26%, et APEX-Agents de 47.1% à 57.5%, soit les trois plus fortes progressions en points de pourcentage du tableau de bord de xAI. Mais GPT-5.6 Sol conserve une avance de sept à neuf points sur les deux tests d'exécution, et Fable 5 devance de quatre à huit points.

Le tableau de bord publié par xAI

BenchmarkGrok 4.6Grok 4.5GPT-5.6 SolFable 5
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1 (Extended)61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%n/a58.8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%

Le meilleur score de chaque ligne est en gras. Les chiffres des concurrents proviennent des fiches système publiées par chaque développeur ou des classements de benchmarks, selon le communiqué de xAI.

Comment Grok 4.6 a été entraîné : la boucle auto-construite se poursuit

L'histoire de l'entraînement prolonge le schéma mis en place par xAI avec Grok 4.5, dont les environnements d'entraînement ont été construits par des agents autonomes plutôt que par des ingénieurs humains, un détail que Cursor, qui a entraîné 4.5 aux côtés de xAI, avait révélé à l'époque. Pour 4.6, xAI décrit une session d'entraînement supplémentaire plus longue que celle de 4.5, alimentée par des données générées par le modèle et sélectionnées pour le raisonnement et les concepts techniques avancés, des données d'ingénierie de haute qualité, ainsi qu'un optimiseur et une recette améliorés. Grok 4.5 a ensuite généré les trajectoires SFT à travers les efforts de raisonnement, les harnais d'agents, les STEM, le génie logiciel et le travail de connaissance, avec des vérifications basées sur des modèles filtrant les mauvaises traces. L'étape de RL qui a suivi couvrait des tâches agentiques, notamment le codage général et des environnements spécifiques à des domaines pour l'optimisation des noyaux, le développement web et la conception assistée par ordinateur.

Les résultats au niveau du modèle correspondent au discours. xAI affirme que Grok 4.6 est particulièrement fort pour transformer une idée de produit large en une première version fonctionnelle, explorer des domaines inconnus, structurer une application, implémenter les interactions centrales et affiner le travail à travers plusieurs cycles de retours. Il fait également état de premières passes plus solides sur les travaux visuels et interactifs que ce que Grok 4.5 produisait généralement, la structure et le langage visuel d'un projet étant établis en une seule passe.

Où il est disponible et ce qu'il coûte

Grok 4.6 est disponible aujourd'hui dans Grok Build et Cursor, via l'API xAI, et par l'intermédiaire de partenaires comme OpenRouter, Vercel et Cloudflare. Les tarifs commencent à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, avec une variante rapide au double du prix. Pour mettre le modèle entre les mains des utilisateurs rapidement, xAI double l'utilisation incluse dans Grok Build et Cursor pendant la première semaine.

En matière de sécurité, xAI indique que les garde-fous ont été calibrés en parallèle des capacités élargies du modèle, appuyés par sa suite de tests la plus étendue jamais réalisée avant déploiement, ainsi que par des tests post-déploiement et des tests tiers. La version maintient explicitement dans son périmètre les travaux légitimes comme l'application de correctifs de vulnérabilités et l'accélération des cycles de conception technique.

L'égalité composite avec GPT-5.6 Sol est réelle, et le tableau de bord qui la sous-tend est plus resserré que ne le laisse entendre le cadrage. Grok 4.6 gagne sur les travaux auxquels xAI l'a destiné, la recherche à forte teneur en connaissances et les builds interactifs, et se laisse distancer sur les tâches d'exécution les plus longues. Les écarts sur DeepSWE et Terminal-Bench le placent sept à neuf points derrière GPT-5.6 Sol. Suffisamment petits pour être comblés lors d'une version intermédiaire. Suffisamment grands pour compter pour exactement les charges de travail auxquelles ce modèle est destiné.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.