SevenTnewS

Analyse de benchmark

GPQA Diamond a été conçu pour être à l'épreuve de Google. Les modèles frontaliers dépassent désormais 95% malgré tout

GPQA Diamond a été conçu pour que des humains équipés de moteurs de recherche ne puissent pas répondre de manière fiable à ses questions scientifiques de niveau expert. Les modèles frontaliers franchissent désormais 89% à 96%, poussant le benchmark vers la même saturation qui a retiré MMLU.

Emmanuel Fabrice Omgbwa Yasse

2026-08-01 · Dernière mise à jour : 2026-08-03 · 2 min de lecture

GPQA Diamond a été conçu pour être à l'épreuve de Google. Les modèles frontaliers dépassent désormais 95% malgré tout
Sources : Évaluation et B…·GPQA — official…·GPQA: A Graduat…

GPQA signifie Google-Proof Q&A, et ce nom est une contrainte de conception, pas un argument marketing. Chaque question de l'ensemble a été rédigée par un expert de niveau doctorat en physique, chimie ou biologie, puis testée sur des humains non experts ayant un accès complet et sans restriction aux moteurs de recherche. Si un humain équipé d'un moteur de recherche ne pouvait pas trouver la réponse de manière fiable, la question était retenue. Le sous-ensemble « Diamond » est le niveau le plus difficile : des questions sur lesquelles même les experts du domaine concerné, travaillant sans contrainte de temps, ne sont pas toujours d'accord.

C'est une barre vraiment difficile à franchir. C'est aussi, de plus en plus, une barre que les modèles de pointe franchissent quand même. Sur le classement actuel, Claude Sonnet 5 obtient 96,2 %, GPT-5.6 Sol 94,6 %, Gemini 3.1 Pro 94,3 %, et Claude Opus 5 et Claude Mythos 5 sont tous deux au-dessus de 95 %. Même les modèles plus bas dans le classement, Kimi K3 à 91,5 %, GLM 5.2 à 90,8 %, DeepSeek V4 Flash à 89,2 %, évoluent dans une fourchette qui aurait été impensable lors du lancement de GPQA.

Un benchmark qui ronge son propre fossé

Il s'agit du même schéma de saturation qui a tué le MMLU, mais qui arrive plus rapidement car GPQA Diamond est un test plus petit et plus concentré. Lorsque presque tous les modèles de pointe atteignent 89 % ou plus, le benchmark cesse de les distinguer de manière significative. Un score de 96,2 % et un de 89,2 % semblent représenter un grand écart sur le papier, mais les deux décrivent des modèles qui, en pratique, répondent correctement à presque toutes les questions qu'un docteur du domaine aurait également raison. Les erreurs restantes se concentrent sur les cas limites véritablement contestés autour desquels le niveau Diamond a été construit, ce qui constitue un signal beaucoup plus étroit et plus bruité que ce que la conception originale du benchmark prévoyait.

Comparez cela à Humanity's Last Exam, où les mêmes modèles de pointe plafonnent à environ 65 %. Les deux benchmarks tirent dans des directions différentes : GPQA Diamond manque de marge en haut du classement, tandis que HLE conserve encore 35 points d'écart entre le meilleur modèle et la performance d'un expert humain. Ce contraste est en soi une information utile. Il vous indique que GPQA Diamond est effectivement devenu un test de confirmation, un moyen de vérifier qu'un modèle atteint un seuil élevé de raisonnement scientifique de niveau graduate, plutôt qu'un discriminateur entre la frontière actuelle et ce qui vient ensuite.

Pourquoi il est encore constamment cité

Malgré la saturation, GPQA Diamond n'a pas été retiré comme l'a été MMLU. Cela tient en partie à l'inertie : c'est peu coûteux à exécuter, bien compris, et ses questions validées par des experts sont plus difficiles à contester qu'un ensemble de questions à choix multiples. Une partie de la raison est qu'un modèle qui échoue à GPQA Diamond reste un véritable signal d'alarme, même si le réussir ne sépare plus le peloton. Les chercheurs le traitent de plus en plus comme un seuil à franchir plutôt qu'un plafond à atteindre, HLE et les benchmarks dynamiques résistants à la contamination faisant le véritable travail de classement des systèmes de pointe les uns par rapport aux autres.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.