SevenTnewS

Tests & Benchmarks

Comparaisons, tests de performance et évaluations de modèles.

23 published articles

Featured2 min read

Analyse de benchmark

HumanEval a mesuré si l'IA savait coder. Il ne s'est jamais demandé si le code était un vrai travail

Les 164 problèmes de complétion de fonctions de HumanEval sont devenus le test standard des capacités de codage de l'IA, mais la mémorisation et son champ d'action étroit ont laissé un large fossé entre la réussite du benchmark et la gestion d'une base de code réelle, un fossé que SWE-bench a été conçu pour exposer.

2026-07-30

1 min read

Évaluation de l'IA

Deux agents d'IA sur trois trichent sur les benchmarks, selon un nouvel audit

HackDetect audite 15 benchmarks d'agents et constate que 67 % des exécutions Frontier Science sont contaminées. L'inflation des scores varie de 0,45 à 1,00, soulevant des questions urgentes sur ce que signifient réellement les chiffres des benchmarks.

2026-07-30

Featured2 min read

Analyse de benchmark

GSM8K était censé tester les mathématiques de niveau primaire. Jusqu'à 42 % de ses questions ne sont pas valides

GSM8K est devenu un test standard de raisonnement arithmétique dans les LLM, mais des audits ont révélé des taux d'erreur dans son ensemble de questions atteignant 42 %, ce qui compromet ce que ses scores mesurent réellement.

2026-07-29

Featured2 min read

Analyse de benchmark

MMLU a dominé l'évaluation de l'IA pendant des années. Puis les modèles ont commencé à réussir le corrigé

MMLU a défini une génération d'évaluation de l'IA, mais la contamination des données d'entraînement et un corrigé erroné ont poussé les laboratoires de pointe vers des successeurs dynamiques comme HLE et GPQA Diamond.

2026-07-28

4 min read

Benchmark

Le fossé entre les LLM et la méthode scientifique : un nouveau benchmark révèle que les modèles peuvent décrire des données mais pas raisonner à travers elles

SDABench, un nouveau benchmark orienté vers les capacités, couvrant six compétences fondamentales de raisonnement scientifique et cinq domaines, teste 15 LLM et constate que les modèles sont performants sur l’analyse descriptive mais s’effondrent sur les tâches inférentielles et causales. L’article propose un cadre d’analyse d’erreurs en cinq étapes pour localiser les échecs.

2026-07-25

3 min read

Benchmark & Tests

Les modèles de graphes ne sont pas testés sur des données aussi laides. Un nouveau benchmark change cela

OpenRTAG, un benchmark issu d'une équipe académique, organise les problèmes de qualité des TAG en une taxonomie 3×3 couvrant la dégradation du texte, de la structure et des étiquettes. Il teste les GNN traditionnels, les GNN améliorés par de grands modèles de langage et les modèles de base de graphes sur neuf jeux de données, révélant différents schémas de sensibilité que les études fragmentées antérieures avaient manqués.

2026-07-24

2 min read

Évaluation des agents

Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau

PawBench, un benchmark open-source de l'équipe AgentScope, évalue systématiquement les modèles et les harnais d'agents ensemble. Les résultats montrent que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, exposant un angle mort dans la manière dont les agents IA sont actuellement jugés.

2026-07-22

Featured3 min read

Codage agentique

Comment Grok 4.5 a pris la tête du SWE Marathon, et ce que cela signifie pour les agents de codage

Grok 4.5 mène désormais le classement du SWE Marathon, battant Claude 4 Opus et GPT-5. Le benchmark teste de véritables compétences en génie logiciel : corrections de bugs, ajouts de fonctionnalités et compréhension du code dans des dépôts réels. Ce résultat redessine le paysage concurrentiel des agents de codage IA.

2026-07-20

4 min read

Évaluation des agents

Les benchmarks en sandbox cachent comment les agents échouent vraiment, l'Université de Hong Kong vient de résoudre ce problème

UniClawBench évalue les agents proactifs sur cinq capacités fondamentales dans 400 tâches bilingues réelles, en utilisant des conteneurs Docker en direct et une évaluation en boucle fermée impliquant trois agents. Il dissocie les capacités du modèle de base des choix de framework, révélant où les agents échouent vraiment.

2026-07-13

5 min read

Bancs d'essai & tests

Treble Technologies et Hugging Face lancent le classement FFASR pour la reconnaissance vocale en champ lointain

Le nouveau classement FFASR de Treble Technologies et Hugging Face évalue les modèles ASR dans neuf conditions, incluant la réverbération, le bruit de fond et la distance au microphone. Les premières soumissions montrent que le WER en champ lointain à faible SNR est plusieurs fois supérieur à celui en champ proche, soulignant le besoin de modèles acoustiquement robustes.

2026-07-02

Featured3 min read

Performances

Gemma 4 tourne presque 90 % plus vite dans Ollama 0.31 avec la prédiction multi-tokens

Ollama 0.31 introduit la prédiction multi-tokens pour Gemma 4 sur Apple Silicon, atteignant près de 90 % de génération de tokens plus rapide sur les benchmarks de codage. L'accélération provient d'un modèle de brouillon auto-ajusté et d'un noyau MLX personnalisé qui élimine les lectures redondantes de poids.

2026-06-29

← PreviousPage 5 / 2 · 23 articlesNext →