El último examen de la humanidad
2 published articles
Pruebas y BenchmarksFeatured2 min read
Análisis de Benchmark
El Último Examen de la Humanidad comenzó con un puntaje del 2.7%. Los mejores modelos aún no superan el 65%
El Último Examen de la Humanidad fue creado por CAIS y Scale AI para suceder a MMLU como el benchmark general de LLM más difícil. Dos años después, incluso el puntaje líder de Claude Opus 5 del 64.7% está muy por debajo del 90% de referencia de expertos humanos.
2026-07-31
LLMs y Modelos4 min read
Investigación en IA
Cuatro personalidades, una respuesta: por qué el razonamiento heterogéneo acaba de vencer a la mejor IA en la prueba más difícil de la humanidad
PoTRE divide la inferencia en cuatro agentes que trabajan en paralelo, luego reconcilia sus respuestas dinámicamente. Alcanzó un 49.92% en Humanity's Last Exam, superando el mejor resultado oficial anterior. El enfoque funciona con menos tokens que las líneas base escaladas.
2026-07-24