Análisis de benchmark
Se suponía que GSM8K evaluaría matemáticas de primaria. Hasta el 42% de sus preguntas no lo hacen
GSM8K se convirtió en una prueba estándar de razonamiento aritmético en LLMs, pero auditorías han encontrado tasas de error en su conjunto de preguntas de hasta el 42%, socavando lo que sus puntuaciones realmente miden.

GSM8K, abreviatura de Grade School Math 8K (Matemáticas de Escuela Primaria 8K), es un conjunto de aproximadamente 8,000 problemas de razonamiento matemático de nivel de secundaria: trenes saliendo de estaciones, personas dividiendo cuentas, ese tipo de cosas. Durante algunos años fue la forma estándar de comprobar si un modelo de lenguaje podía encadenar varios pasos aritméticos sin perder el hilo. Resolver GSM8K de manera confiable se consideraba evidencia de un razonamiento real de múltiples pasos, en oposición al reconocimiento de patrones.
Luego, auditorías independientes comenzaron a leer las preguntas detenidamente en lugar de solo ejecutar modelos contra ellas. Lo que encontraron fue un benchmark con un problema de calidad, no de dificultad. Las tasas de error en el conjunto de preguntas de GSM8K se han estimado hasta en un 42%: preguntas con redacción ambigua, información faltante o respuestas de referencia que no coinciden con ninguna lectura defendible del problema. Un modelo marcado como "incorrecto" en una de estas no necesariamente razona peor que un modelo marcado como "correcto". Podría ser que simplemente esté leyendo la pregunta con más cuidado.
Por qué esto importa más de lo que parece
Una tasa de error del 2% es ruido. Una tasa de error del 42% es un benchmark diferente al que todos creen estar ejecutando. Si casi la mitad de los ítems de la prueba no son confiables, entonces la puntuación misma deja de ser una medición limpia del razonamiento aritmético y comienza a reflejar algo más cercano a qué tan bien un modelo adivina lo que una rúbrica defectuosa quiere escuchar.
Esto se combina con el mismo problema de contaminación que afectó a MMLU. Las preguntas de GSM8K son lo suficientemente antiguas y públicas como para que los modelos grandes casi con certeza hayan visto muchas de ellas, o paráfrasis cercanas, durante el preentrenamiento. Combine la memorización con una clave de respuestas poco sólida, y una puntuación alta en GSM8K le dice menos de lo que solía sobre si un modelo realmente puede hacer la aritmética, y más sobre si resultó coincidir con la misma interpretación de un problema mal redactado que hicieron los autores del conjunto de datos.
Qué utilizan los laboratorios en su lugar
La evaluación matemática no desapareció, se trasladó a un terreno más difícil y más cuidadosamente auditado. Los benchmarks de matemáticas al estilo de competencias, extraídos de problemas recientes de olimpiadas y concursos, son más difíciles de contaminar simplemente porque los problemas son más nuevos que la mayoría de los cortes de entrenamiento. El razonamiento de múltiples pasos se prueba cada vez más dentro de exámenes de nivel de posgrado más amplios como GPQA Diamond y Humanity's Last Exam, donde las matemáticas son una disciplina entre muchas, en lugar de toda la prueba, y donde el listón de calidad de los ítems es explícitamente más alto: el propio proceso de verificación de HLE se construyó específicamente para detectar el tipo de errores que plagaron a GSM8K.
Nada de esto significa que GSM8K sea inútil para una verificación rápida. Un modelo que falla en problemas básicos de razonamiento claramente tiene un problema. Pero tratar un porcentaje de GSM8K como una medida precisa de la capacidad de razonamiento, como hicieron los artículos durante años, asume una clave de respuestas que resulta ser mucho menos sólida de lo que parecía.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.