Análisis de benchmark
GPQA Diamond se construyó para ser a prueba de Google. Los modelos frontera ahora superan el 95% de todos modos
GPQA Diamond fue diseñado para que los humanos equipados con búsqueda no puedan responder de manera confiable sus preguntas de ciencias a nivel experto. Los modelos frontera ahora superan del 89% al 96%, llevando el benchmark hacia la misma saturación que retiró a MMLU.

GPQA significa "Preguntas y Respuestas a prueba de Google", y el nombre es una restricción de diseño, no un eslogan de marketing. Cada pregunta del conjunto fue escrita por un experto con nivel de doctorado en física, química o biología, y luego probada con humanos no expertos que tenían acceso total y sin restricciones a motores de búsqueda. Si un humano con acceso a búsqueda no podía encontrar la respuesta de manera confiable, la pregunta calificaba. El subconjunto "Diamond" es el nivel más difícil: preguntas donde incluso expertos en el campo relevante, trabajando sin presión de tiempo, no siempre se ponen de acuerdo.
Ese es un listón realmente difícil de superar. También es, cada vez más, un listón que los modelos de frontera están superando de todos modos. En el ranking actual, Claude Sonnet 5 obtiene un 96.2%, GPT-5.6 Sol un 94.6%, Gemini 3.1 Pro un 94.3%, y Claude Opus 5 y Claude Mythos 5 ambos superan el 95%. Incluso los modelos más abajo en la tabla, Kimi K3 con 91.5%, GLM 5.2 con 90.8%, DeepSeek V4 Flash con 89.2%, están operando en una franja que habría sido impensable cuando se lanzó GPQA.
Un benchmark devorando su propia zanja
Este es el mismo patrón de saturación que acabó con MMLU, solo que llega más rápido porque GPQA Diamond es una prueba más pequeña y concentrada. Cuando casi todos los modelos de frontera superan el 89% o más, el benchmark deja de discriminarlos de manera significativa. Un 96.2% y un 89.2% parecen una gran brecha en papel, pero ambas puntuaciones describen modelos que, en términos prácticos, responden correctamente a casi todas las preguntas que un doctor en la materia también acertaría. Los errores restantes se agrupan en los casos límite genuinamente disputados para los que se diseñó el nivel Diamond, lo cual es una señal mucho más estrecha y ruidosa de lo que pretendía el diseño original del benchmark.
Compárese esto con Humanity's Last Exam, donde los mismos modelos de primer nivel alcanzan un máximo de alrededor del 65%. Los dos benchmarks tiran en direcciones opuestas: GPQA Diamond se está quedando sin espacio en la cima, mientras que HLE todavía tiene 35 puntos de diferencia entre el mejor modelo y el rendimiento de un experto humano. Ese contraste es en sí mismo información útil. Indica que GPQA Diamond se ha convertido efectivamente en una prueba de confirmación, una forma de verificar que un modelo supera un alto piso de razonamiento científico de nivel de posgrado, en lugar de un discriminador entre la frontera actual y lo que venga después.
Por qué sigue siendo citado constantemente
A pesar de la saturación, GPQA Diamond no ha sido retirado como lo fue MMLU. Parte de ello es inercia: es barato de ejecutar, bien entendido, y sus preguntas validadas por expertos son más difíciles de refutar que un conjunto de trivialidades de opción múltiple. Otra parte es que un modelo que reprueba GPQA Diamond sigue siendo una verdadera bandera roja, incluso si aprobarlo ya no separa al grupo. Los investigadores lo tratan cada vez más como un piso que hay que superar en lugar de un techo que perseguir, con HLE y benchmarks dinámicos y resistentes a la contaminación haciendo el trabajo real de clasificar los sistemas de frontera entre sí.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.