Analyse de benchmark
L'Examen Final de l'Humanité a débuté avec un score de 2,7 %. Les meilleurs modèles ne parviennent toujours pas à dépasser les 65 %
L'Examen Final de l'Humanité a été construit par CAIS et Scale AI pour succéder à MMLU en tant que benchmark général LLM le plus difficile. Deux ans plus tard, même le score de tête de 64,7 % de Claude Opus 5 reste bien en dessous de la référence humaine experte de 90 %.

Lorsque l'Examen Final de l'Humanité (HLE) a été lancé début 2025, GPT-4o a obtenu un score de 2,7 %. Claude 3.5 Sonnet a obtenu 4,1 %. La référence humaine experte se situe autour de 90 %. Cet écart n'était pas un accident dû à un test mal calibré, c'était le but. HLE a été construit par le Center for AI Safety et Scale AI précisément parce que MMLU avait cessé d'être suffisamment difficile pour avoir du sens, et le projet était suffisamment formel pour être publié dans Nature.
L'examen comporte 2 500 questions, rédigées par des spécialistes de plus d'une centaine de disciplines académiques, et est structuré pour résister aux deux choses qui ont tué la génération précédente de benchmarks : la recherche web et la mémorisation des ensembles d'entraînement. Il n'y a pas de format de dissertation à exploiter avec des remplissages fluides. Les réponses sont soit courtes et exactes (76 % des questions), soit à choix multiples avec des distracteurs suffisamment sophistiqués pour punir la reconnaissance superficielle de motifs (24 %). Quatorze pour cent des éléments nécessitent la lecture d'un diagramme, d'un graphique ou d'une image en plus du texte, de sorte qu'un modèle ne peut pas se contenter du langage seul.
D'où viennent les questions
La répartition par matière vous indique ce que le test valorise réellement : les mathématiques représentent 41 % de la banque de questions, la biologie et la médecine 11 %, l'informatique et l'IA 10 %, la physique 9 %, la chimie 7 %, les sciences humaines et sociales 9 %, l'ingénierie 4 %, et divers domaines spécialisés le reste. C'est un examen très quantitatif par conception, plus proche d'un examen de qualification doctorale que d'un quiz de culture générale.
Le classement actuel
Selon les scores publiés les plus récents, le classement se présente comme suit :
- Claude Opus 5 : 64,7 %
- Claude Mythos 5 : 64,5 %
- Claude Opus 4.8 : 57,9 %
- Claude Sonnet 5 : 57,4 %
- Kimi K3 : 56,0 %
- GLM 5.2 : 54,7 %
- Claude Fable 5 : 53,3 %
- Hy3 (Tencent) : 53,2 %
- DeepSeek V4 Flash : 51,6 %
- GPT-5.6 Sol : 47,2 %
- Gemini 3.1 Pro : 44,4 %
- GPT-5.5 Pro : 43,1 %
Deux choses ressortent. Premièrement, les modèles dotés de modes de raisonnement dédiés, qui passent plus de temps d'inférence à planifier et vérifier leur propre travail avant de répondre, dominent le haut du classement. Le nombre brut de paramètres a cessé d'être le facteur déterminant une fois que HLE est devenu le test de référence ; ce qui sépare un score de 65 % d'un score de 45 % ressemble de plus en plus à la capacité d'un modèle à détecter ses propres erreurs en cours de réponse. Deuxièmement, même le leader a encore 25 points de retard par rapport à la référence humaine experte, sur un test explicitement conçu pour être difficile à contourner.
L'examen n'était pas non plus parfait
La propre version précoce de HLE comportait des erreurs ; un audit dans le cadre de l'initiative HLE-Verified a révélé que jusqu'à 30 % des sous-sections de chimie et de biologie contenaient des invites ambiguës ou des réponses de référence incorrectes, ce qui a forcé une révision composant par composant. Plutôt que de laisser cela nuire au benchmark comme des erreurs non découvertes ont nui à MMLU et GSM8K, le projet a construit HLE-Verified pour le corriger et HLE-Rolling pour continuer à ajouter des questions validées de la communauté scientifique de manière continue. Cette volonté d'auditer et de republier, au lieu de livrer un ensemble fixe une fois et de le défendre pour toujours, fait partie des raisons pour lesquelles HLE a conservé sa position de benchmark général le plus difficile du domaine, plutôt que de suivre ses prédécesseurs dans la saturation.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.