Laboratoires & Recherche3 min read
Fisher-R1 | Test d'hypothèses
Les agents IA produisent des statistiques sans faille et tirent pourtant de mauvaises conclusions
Les agents qui automatisent les tests d'hypothèses peuvent exécuter des analyses sans faille tout en parvenant à de mauvaises conclusions, car la plupart des benchmarks ne vérifient jamais si la valeur p est valide. Un benchmark de 425 tâches quantifie cet écart, et un modèle open-weight entraîné par RL en comble une partie.
2026-08-19