Tests & Benchmarks4 min read
Benchmark
Le fossé entre les LLM et la méthode scientifique : un nouveau benchmark révèle que les modèles peuvent décrire des données mais pas raisonner à travers elles
SDABench, un nouveau benchmark orienté vers les capacités, couvrant six compétences fondamentales de raisonnement scientifique et cinq domaines, teste 15 LLM et constate que les modèles sont performants sur l’analyse descriptive mais s’effondrent sur les tâches inférentielles et causales. L’article propose un cadre d’analyse d’erreurs en cinq étapes pour localiser les échecs.
2026-07-25