SevenTnewS

Benchmark LLM

4 published articles

Tests & Benchmarks4 min read

Benchmark de raisonnement financier

Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer

Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.

2026-08-20

LLM & Modèles2 min read

Recherche en IA

Pourquoi votre tuteur IA ne voit pas comment les mathématiques se construisent les unes sur les autres

Le K12-Bench de l'Université de Pékin révèle que même les meilleurs modèles de langage comprennent à peine comment les concepts scolaires sont reliés. Des scores de 57 % et 46 % montrent une lacune dans la capacité de l'IA à gérer les chaînes de prérequis, les taxonomies de concepts et l'ancrage visuel, des compétences que les tuteurs réels utilisent chaque jour.

2026-08-02

Tests & Benchmarks4 min read

Benchmark

Le fossé entre les LLM et la méthode scientifique : un nouveau benchmark révèle que les modèles peuvent décrire des données mais pas raisonner à travers elles

SDABench, un nouveau benchmark orienté vers les capacités, couvrant six compétences fondamentales de raisonnement scientifique et cinq domaines, teste 15 LLM et constate que les modèles sont performants sur l’analyse descriptive mais s’effondrent sur les tâches inférentielles et causales. L’article propose un cadre d’analyse d’erreurs en cinq étapes pour localiser les échecs.

2026-07-25

LLM & Modèles4 min read

Performance des LLM

Une startup chinoise de génération vidéo vient discrètement de surpasser Claude Opus en codage

Le M2.7 de MiniMax obtient 56,22 % sur SWE-Pro, égalant presque la performance de Claude Opus, tout en vantant une adhérence aux compétences de 97 % sur des tâches complexes et une édition de productivité bureautique supérieure. Le modèle signale un passage de la course aux benchmarks à un déploiement réel d'agents.

2026-07-14