SevenTnewS

saturación de benchmarks

4 published articles

Pruebas y BenchmarksFeatured8 min read

Informe Especial: Evaluación de IA

Estado de la evaluación comparativa de IA en 2026: el colapso de las pruebas estáticas y los sistemas que las reemplazan

Un recorrido completo por el panorama de los benchmarks de IA en 2026: por qué se rompieron MMLU, GSM8K y HumanEval, cómo los benchmarks dinámicos y exámenes de expertos como HLE y GPQA Diamond los reemplazaron, qué revelan las pruebas de inteligencia agéntica y desigual, y cómo la preferencia humana, los jueces LLM y la observabilidad en producción completan ahora la pila de evaluación.

2026-08-03

Pruebas y BenchmarksFeatured2 min read

Análisis de benchmark

GPQA Diamond se construyó para ser a prueba de Google. Los modelos frontera ahora superan el 95% de todos modos

GPQA Diamond fue diseñado para que los humanos equipados con búsqueda no puedan responder de manera confiable sus preguntas de ciencias a nivel experto. Los modelos frontera ahora superan del 89% al 96%, llevando el benchmark hacia la misma saturación que retiró a MMLU.

2026-08-01

Pruebas y BenchmarksFeatured2 min read

Análisis de benchmark

Se suponía que GSM8K evaluaría matemáticas de primaria. Hasta el 42% de sus preguntas no lo hacen

GSM8K se convirtió en una prueba estándar de razonamiento aritmético en LLMs, pero auditorías han encontrado tasas de error en su conjunto de preguntas de hasta el 42%, socavando lo que sus puntuaciones realmente miden.

2026-07-29

Pruebas y BenchmarksFeatured2 min read

Análisis de benchmarks

MMLU dominó la evaluación de IA durante años. Luego los modelos empezaron a acertar la clave de respuestas

MMLU definió una generación de evaluación comparativa de IA, pero la contaminación de datos de entrenamiento y una clave de respuestas defectuosa han empujado a los laboratorios de frontera hacia sucesores dinámicos como HLE y GPQA Diamond.

2026-07-28