Análisis de benchmarks
MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas
MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.

MMLU, el benchmark Massive Multitask Language Understanding, fue durante los primeros años de la década de 2020 el criterio predeterminado para medir la calidad de los modelos de lenguaje. Cincuenta y siete materias, formato de opción múltiple, desde álgebra abstracta hasta política exterior de EE.UU. Era fácil de ejecutar, fácil de comparar y fácil de incluir en un comunicado de prensa.
Esa conveniencia es exactamente lo que lo rompió. Una vez que las preguntas de un benchmark son texto público, eventualmente terminan en el corpus de entrenamiento de alguien. Auditorías independientes de conjuntos de prueba multilingües han encontrado tasas de contaminación de hasta el 91.8% en modelos grandes, y el patrón es consistente: cuanto más grande es el modelo, más parte de la prueba parece haber memorizado en lugar de haber razonado. Un modelo que ha visto una pregunta y su respuesta durante el preentrenamiento no necesita resolver nada. Solo necesita recordar.
La contaminación es solo la mitad del problema. La prueba en sí tiene fallos. Auditorías del subconjunto de matemáticas de MMLU encontraron que aproximadamente el 2% de las preguntas eran simplemente incorrectas, respuestas mal etiquetadas, redacción ambigua o matemáticas que no cuadran. El dos por ciento suena pequeño hasta que te das cuenta de que la puntuación de cada modelo se compara con un techo que incluye preguntas defectuosas que nadie puede responder correctamente.
Lo que la saturación realmente oculta
A mediados de la década de 2020, los modelos de frontera alcanzaban entre el 88% y el 90% en MMLU. Eso parece un triunfo. En realidad está más cerca de un piso de medición. Cuando la mayoría del campo se agrupa cerca de la parte superior de una prueba, la prueba deja de decirte algo sobre quién es realmente mejor. Una brecha de dos puntos entre dos modelos en un benchmark saturado podría reflejar capacidad real, o podría reflejar qué modelo tuvo más suerte con el 2% defectuoso.
Este es el argumento central que ahora presentan los investigadores para retirar MMLU de la evaluación seria: ya no puede distinguir el razonamiento genuino de la recuperación estadística. Un modelo puede obtener una buena puntuación simplemente por haber absorbido Internet, incluidas las partes de Internet que resultan ser MMLU.
Lo que lo reemplazó
La respuesta no fue parchear MMLU. Fue construir pruebas que no puedan memorizarse de la misma manera. Humanity's Last Exam fue diseñado explícitamente como un sucesor de MMLU, con preguntas revisadas para resistir tanto la búsqueda web como la recuperación del preentrenamiento. GPQA Diamond hace algo similar para la ciencia de nivel de posgrado. Los benchmarks dinámicos que regeneran sus grupos de preguntas de forma continua, en lugar de enviar un conjunto fijo una vez y reutilizarlo durante años, se están convirtiendo en la norma precisamente porque una clave de respuestas estática tiene una vida útil.
Nada de esto significa que MMLU carezca de valor. Sigue siendo una verificación de cordura razonable; un modelo que obtiene una puntuación baja en MMLU probablemente tenga problemas reales. Pero como métrica de tabla de clasificación, un número que un laboratorio usa para afirmar el estado del arte, su utilidad se agotó más o menos cuando todos dejaron de fallarlo.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.