Laboratorios e Investigación3 min read
Fisher-R1 | Prueba de hipótesis
Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas
Los agentes que automatizan la prueba de hipótesis pueden ejecutar análisis a la perfección y aun así llegar a conclusiones erróneas, porque la mayoría de los benchmarks nunca comprueban si el valor p es válido. Un benchmark de 425 tareas cuantifica la brecha, y un modelo de peso abierto entrenado con RL cierra una parte de ella.
2026-08-19