Análisis de Benchmark
El Último Examen de la Humanidad comenzó con un puntaje del 2.7%. Los mejores modelos aún no superan el 65%
El Último Examen de la Humanidad fue creado por CAIS y Scale AI para suceder a MMLU como el benchmark general de LLM más difícil. Dos años después, incluso el puntaje líder de Claude Opus 5 del 64.7% está muy por debajo del 90% de referencia de expertos humanos.

Cuando el Último Examen de la Humanidad (HLE) se lanzó a principios de 2025, GPT-4o obtuvo un 2.7%. Claude 3.5 Sonnet obtuvo un 4.1%. La línea base de expertos humanos se sitúa alrededor del 90%. Esa brecha no fue un accidente de una prueba mal calibrada, era el objetivo. HLE fue creado por el Center for AI Safety y Scale AI específicamente porque MMLU había dejado de ser lo suficientemente difícil como para significar algo, y el proyecto fue lo suficientemente formal como para ser publicado en Nature.
El examen tiene 2,500 preguntas, escritas por especialistas de más de cien disciplinas académicas, y está estructurado para resistir las dos cosas que mataron a la generación anterior de benchmarks: la búsqueda web y la memorización del conjunto de entrenamiento. No hay formato de ensayo que pueda ser manipulado con relleno fluido. Las respuestas son cortas y exactas (76% de las preguntas) o de opción múltiple con distractores lo suficientemente sofisticados como para castigar el reconocimiento superficial de patrones (24%). El catorce por ciento de los ítems requieren leer un diagrama, un gráfico o una imagen junto al texto, por lo que un modelo no puede arreglárselas solo con el lenguaje.
De dónde provienen las preguntas
La distribución de materias muestra lo que la prueba realmente valora: matemáticas constituye el 41% del banco de preguntas, biología y medicina el 11%, ciencias de la computación e IA el 10%, física el 9%, química el 7%, humanidades y ciencias sociales el 9%, ingeniería el 4%, y el resto son dominios especializados diversos. Es un examen eminentemente cuantitativo por diseño, más cercano a un examen de calificación doctoral que a un cuestionario de conocimientos generales.
La tabla de clasificación actual
- Claude Opus 5: 64.7%
- Claude Mythos 5: 64.5%
- Claude Opus 4.8: 57.9%
- Claude Sonnet 5: 57.4%
- Kimi K3: 56.0%
- GLM 5.2: 54.7%
- Claude Fable 5: 53.3%
- Hy3 (Tencent): 53.2%
- DeepSeek V4 Flash: 51.6%
- GPT-5.6 Sol: 47.2%
- Gemini 3.1 Pro: 44.4%
- GPT-5.5 Pro: 43.1%
Dos cosas destacan. Primero, los modelos con modos de razonamiento dedicados, aquellos que invierten tiempo extra de inferencia planificando y verificando su propio trabajo antes de responder, dominan la cima de la lista. El recuento bruto de parámetros dejó de ser el factor decisivo una vez que HLE se convirtió en la prueba de referencia; lo que separa un puntaje del 65% de uno del 45% se parece cada vez más a si un modelo puede detectar sus propios errores a mitad de respuesta. Segundo, incluso el líder todavía está 25 puntos por debajo de la línea base de expertos humanos, en una prueba explícitamente diseñada para ser difícil de manipular.
El examen tampoco era perfecto
La propia versión temprana de HLE tenía errores; una auditoría bajo la iniciativa HLE-Verified encontró que hasta el 30% de la subsección de química y biología contenía indicaciones ambiguas o respuestas de referencia incorrectas, lo que obligó a una revisión componente por componente. En lugar de permitir que eso socavara el benchmark de la misma manera que los errores no descubiertos socavaron MMLU y GSM8K, el proyecto construyó HLE-Verified para corregirlo y HLE-Rolling para seguir añadiendo preguntas verificadas de la comunidad científica de forma continua. Esa disposición a auditar y republicar, en lugar de lanzar un conjunto fijo una vez y defenderlo para siempre, es parte de por qué HLE ha mantenido su posición como el benchmark general más difícil del campo en lugar de seguir a sus predecesores hacia la saturación.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.