Pruebas y BenchmarksFeatured2 min read
Análisis de benchmarks
MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas
MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.
2026-07-28