SevenTnewS

Benchmarks d'IA

19 published articles

Qwen / Alibaba5 min read

IA open source

Qwen 3.8-Max : le modèle le plus puissant d'Alibaba est désormais téléchargeable gratuitement

Alibaba met en open source Qwen 3.8-Max, son modèle le plus performant jamais conçu : un MoE de 2.4 billions de paramètres qui bat GPT-5.6 Sol sur SWE-bench Pro, PaperBench et IFBench. Nous décortiquons les réserves sur les benchmarks et ce qu'un modèle vedette ouvert à 95B actifs signifie pour les développeurs.

2026-08-16

Qwen / AlibabaFeatured5 min read

IA open source

Qwen3.8-Max a battu 458 équipes humaines en 24 heures, en travaillant seul

Qwen3.8-Max a battu 458 des 526 équipes humaines lors d'un concours de 24 heures en travaillant seul, et Alibaba mettra ses poids en open source la semaine prochaine. Chaque chiffre est pour l'instant auto-déclaré, ce qui explique précisément pourquoi les affirmations d'autonomie méritent d'être examinées de près.

2026-08-03

Tests & BenchmarksFeatured8 min read

Rapport spécial : Évaluation de l'IA

L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer

Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.

2026-08-03

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

LiveBench refuse de rester figé. C'est tout l'intérêt

LiveBench remplace un corrigé fixe par un pool continuellement actualisé de problèmes de codage, de dépôts et de questions de prédiction, contournant la contamination qui a miné MMLU et GSM8K. Cela fait partie d'un virage plus large vers l'évaluation dynamique, aux côtés de LiveCodeBench, ForecastBench et LLMEval-Fair.

2026-08-03

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

5 millions de votes, 25 points Elo : Dans les coulisses du classement Chatbot Arena que personne ne peut ébranler

LMSYS Chatbot Arena classe les modèles selon les préférences humaines en aveugle sur une échelle Elo, avec près de cinq millions de votes qui resserrent désormais les meilleurs laboratoires dans une bande de 25 points. Les méthodes LLM-en-tant-que-Juge qui permettent de passer à l'échelle cette évaluation comportent leurs propres biais documentés en faveur de la verbosité et de la position.

2026-08-02

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %

SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.

2026-08-02

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

GPQA Diamond a été conçu pour être à l'épreuve de Google. Les modèles frontaliers dépassent désormais 95% malgré tout

GPQA Diamond a été conçu pour que des humains équipés de moteurs de recherche ne puissent pas répondre de manière fiable à ses questions scientifiques de niveau expert. Les modèles frontaliers franchissent désormais 89% à 96%, poussant le benchmark vers la même saturation qui a retiré MMLU.

2026-08-01

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

L'Examen Final de l'Humanité a débuté avec un score de 2,7 %. Les meilleurs modèles ne parviennent toujours pas à dépasser les 65 %

L'Examen Final de l'Humanité a été construit par CAIS et Scale AI pour succéder à MMLU en tant que benchmark général LLM le plus difficile. Deux ans plus tard, même le score de tête de 64,7 % de Claude Opus 5 reste bien en dessous de la référence humaine experte de 90 %.

2026-07-31

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

HumanEval a mesuré si l'IA savait coder. Il ne s'est jamais demandé si le code était un vrai travail

Les 164 problèmes de complétion de fonctions de HumanEval sont devenus le test standard des capacités de codage de l'IA, mais la mémorisation et son champ d'action étroit ont laissé un large fossé entre la réussite du benchmark et la gestion d'une base de code réelle, un fossé que SWE-bench a été conçu pour exposer.

2026-07-30

IAFeatured3 min read

Analyse des benchmarks

Ce que trois benchmarks IA ont mal compris sur les performances réelles

Les benchmarks IA comme MMLU sont la norme pour comparer les modèles, mais trois cas récents montrent qu'ils manquent des dimensions critiques. Le Nemotron-4 de Nvidia manque de vérification indépendante, Celeris-1 échange la précision contre la vitesse, et le meilleur IA de surveillance des agents pathogènes n'effectue que la moitié des tâches. Les preuves indiquent un besoin de cadres d'évaluation qui mesurent ce qui compte dans la pratique.

2026-07-29

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

GSM8K était censé tester les mathématiques de niveau primaire. Jusqu'à 42 % de ses questions ne sont pas valides

GSM8K est devenu un test standard de raisonnement arithmétique dans les LLM, mais des audits ont révélé des taux d'erreur dans son ensemble de questions atteignant 42 %, ce qui compromet ce que ses scores mesurent réellement.

2026-07-29

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

MMLU a dominé l'évaluation de l'IA pendant des années. Puis les modèles ont commencé à réussir le corrigé

MMLU a défini une génération d'évaluation de l'IA, mais la contamination des données d'entraînement et un corrigé erroné ont poussé les laboratoires de pointe vers des successeurs dynamiques comme HLE et GPQA Diamond.

2026-07-28

← PreviousPage 1 / 2 · 19 articlesNext →