MMLU
2 published articles
Análisis de benchmarks
Lo que tres benchmarks de IA se equivocaron sobre el rendimiento real
Los benchmarks de IA como MMLU son el estándar para comparar modelos, pero tres casos recientes muestran que omiten dimensiones críticas. El Nemotron-4 de Nvidia carece de verificación independiente, Celeris-1 intercambia precisión por velocidad, y el mejor agente de IA para vigilancia de patógenos solo completa la mitad de las tareas. La evidencia apunta a la necesidad de marcos de evaluación que midan lo que realmente importa en la práctica.
2026-07-29
Análisis de benchmarks
MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas
MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.
2026-07-28