Benchmark LLM
4 published articles
Benchmark de raisonnement financier
Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer
Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.
2026-08-20
Recherche en IA
Pourquoi votre tuteur IA ne voit pas comment les mathématiques se construisent les unes sur les autres
Le K12-Bench de l'Université de Pékin révèle que même les meilleurs modèles de langage comprennent à peine comment les concepts scolaires sont reliés. Des scores de 57 % et 46 % montrent une lacune dans la capacité de l'IA à gérer les chaînes de prérequis, les taxonomies de concepts et l'ancrage visuel, des compétences que les tuteurs réels utilisent chaque jour.
2026-08-02
Benchmark
Le fossé entre les LLM et la méthode scientifique : un nouveau benchmark révèle que les modèles peuvent décrire des données mais pas raisonner à travers elles
SDABench, un nouveau benchmark orienté vers les capacités, couvrant six compétences fondamentales de raisonnement scientifique et cinq domaines, teste 15 LLM et constate que les modèles sont performants sur l’analyse descriptive mais s’effondrent sur les tâches inférentielles et causales. L’article propose un cadre d’analyse d’erreurs en cinq étapes pour localiser les échecs.
2026-07-25
Performance des LLM
Une startup chinoise de génération vidéo vient discrètement de surpasser Claude Opus en codage
Le M2.7 de MiniMax obtient 56,22 % sur SWE-Pro, égalant presque la performance de Claude Opus, tout en vantant une adhérence aux compétences de 97 % sur des tâches complexes et une édition de productivité bureautique supérieure. Le modèle signale un passage de la course aux benchmarks à un déploiement réel d'agents.
2026-07-14