contaminación de datos
3 published articles
Informe Especial: Evaluación de IA
Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan
Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.
2026-08-03
Análisis de referencia
LiveBench se niega a quedarse quieto. Ese es el punto
LiveBench reemplaza una clave de respuestas fija por un conjunto continuamente renovado de problemas de programación, repositorios y preguntas de predicción, evitando la contaminación que socavó a MMLU y GSM8K. Es parte de un cambio más amplio hacia la evaluación dinámica junto con LiveCodeBench, ForecastBench y LLMEval-Fair.
2026-08-03
Análisis de benchmarks
MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas
MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.
2026-07-28