SevenTnewS

Fisher-R1 | Prueba de hipótesis

Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas

Los agentes que automatizan la prueba de hipótesis pueden ejecutar análisis a la perfección y aun así llegar a conclusiones erróneas, porque la mayoría de los benchmarks nunca comprueban si el valor p es válido. Un benchmark de 425 tareas cuantifica la brecha, y un modelo de peso abierto entrenado con RL cierra una parte de ella.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-19 · 3 min de lectura

Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas

Los agentes de LLM están siendo apuntados a una de las tareas más importantes de la ciencia: la prueba de hipótesis. Inspeccionan conjuntos de datos, generan código y producen análisis de principio a fin. Un preprint publicado en arXiv el 7 de agosto de 2026 advierte que esta automatización tiene un punto ciego. Los agentes con frecuencia extraen conclusiones incorrectas incluso cuando el análisis en sí se ejecuta correctamente. Los errores son inferenciales, no mecánicos: un método estadístico que los datos no respaldan, un valor p que no se sostiene bajo los supuestos de los datos. La mayoría de los benchmarks existentes nunca ven estos fallos, porque califican resultados, no la validez de la inferencia subyacente.

El diagnóstico es fácil de enunciar: las suites de evaluación actuales rara vez preguntan si un valor p reportado es estadísticamente válido bajo los supuestos de los datos. Esa brecha importa porque los agentes de LLM se usan cada vez más para automatizar la prueba de hipótesis, y una ejecución limpia puede parecer un resultado confiable. El patrón se hace eco de hallazgos en otras áreas de la investigación sobre agentes. Trabajos anteriores sobre agentes de codificación documentaron la misma inversión, donde verificar de manera confiable una solución generada se ha vuelto más difícil que producir una. El nuevo artículo traslada esa lección a la estadística.

El modo de fallo que los benchmarks pasan por alto

Para medir la brecha, el equipo construyó P-Bench, un benchmark de 425 tareas abiertas de prueba de hipótesis que abarcan economía, biología y medicina. Cada tarea le da al agente solo una hipótesis científica y un conjunto de datos. El agente debe seleccionar un método estadístico, calcular un valor p y extraer una conclusión. La puntuación luego hace lo que el artículo dice que las evaluaciones existentes no hacen: comprueba si el valor p reportado es estadísticamente válido dados los supuestos subyacentes a los datos.

P-Bench de un vistazo
Tareas425 problemas abiertos de prueba de hipótesis
DominiosEconomía, biología, medicina
Formato de promptHipótesis y conjunto de datos de entrada; método, valor p y conclusión de salida
Comprobación centralSi el valor p se sostiene bajo los supuestos de los datos

Lo que aportó el aprendizaje por refuerzo

La solución propuesta es Fisher-R1, un agente de LLM de peso abierto entrenado para la prueba rigurosa de hipótesis con tareas sintéticas y aprendizaje por refuerzo. La decisión de diseño que importa es la recompensa: verificación estadística en lugar de concordancia con una respuesta de referencia. En P-Bench, Fisher-R1-14B mejora sustancialmente respecto de su modelo base y supera a sólidas líneas base propietarias y de código abierto, incluidos GPT-5.4 y DeepSeek-V4-Pro. La cifra principal es una mejora relativa promedio del 21 % en éxito en un solo intento frente a DeepSeek-V4-Pro, que aumenta al 26 % en las tareas más difíciles.

Resultados reportados en P-BenchFisher-R1-14B
Frente a DeepSeek-V4-Pro21 % de ganancia relativa promedio en éxito en un solo intento
Frente a DeepSeek-V4-Pro, tareas más difícilesHasta un 26 % de ganancia relativa
Frente a GPT-5.4 y otras líneas base sólidasLas supera, según el preprint

Los autores son directos sobre la línea base: «los agentes de LLM actuales carecen de razonamiento estadístico confiable para la prueba de hipótesis». Su afirmación, en resumen, es que el RL en tareas con una recompensa estadística verificada mejora sustancialmente la confiabilidad.

Las salvedades detrás de una brecha del 21 %

El resultado merece las salvedades estándar de un preprint. No está revisado por pares, y P-Bench es una construcción de los propios autores, por lo que las líneas base fueron evaluadas en un benchmark diseñado por sus creadores, una razón para leer los márgenes con cuidado. El éxito en un solo intento es una métrica. Un agente al que se le permita revisar su trabajo podría cerrar o ampliar la brecha; este artículo no lo dice.

Lo que es más difícil de descartar es el diagnóstico, que encaja en un campo que ya lidia con la confiabilidad de la evaluación. El corpus Messier, un esfuerzo de julio de 2026 para unificar la evaluación de agentes, contó 957,253 registros en 30 benchmarks y 714 agentes y sostuvo que la mayor parte de ese registro empírico no es comparable. P-Bench es una respuesta más acotada al mismo problema: un benchmark construido para medir un modo de fallo específico en lugar de otra puntuación agregada.

Para los equipos que delegan la prueba de hipótesis en agentes, la lección práctica es barata de enunciar y costosa de aprender. Una ejecución limpia no es una inferencia válida, y el valor p solo es tan bueno como los supuestos que nadie revisó.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.