Dernier Examen de l'Humanité
2 published articles
Tests & BenchmarksFeatured2 min read
Analyse de benchmark
L'Examen Final de l'Humanité a débuté avec un score de 2,7 %. Les meilleurs modèles ne parviennent toujours pas à dépasser les 65 %
L'Examen Final de l'Humanité a été construit par CAIS et Scale AI pour succéder à MMLU en tant que benchmark général LLM le plus difficile. Deux ans plus tard, même le score de tête de 64,7 % de Claude Opus 5 reste bien en dessous de la référence humaine experte de 90 %.
2026-07-31
LLM & Modèles4 min read
Recherche en IA
Quatre personnalités, une réponse : pourquoi le raisonnement hétérogène vient de battre la meilleure IA au test le plus difficile de l’humanité
PoTRE divise l’inférence en quatre agents travaillant en parallèle, puis concilie leurs réponses de manière dynamique. Il atteint 49,92 % sur l’Examen Final de l’Humanité, surpassant le meilleur précédent officiel. L’approche fonctionne avec moins de tokens que les baselines mises à l’échelle.
2026-07-24