SevenTnewS

Tests & Benchmarks

Comparaisons, tests de performance et évaluations de modèles.

23 published articles

4 min read

Benchmark de raisonnement financier

Les LLM connaissent les formules comptables. FinIndices montre qu'ils ne savent pas les appliquer

Les LLM peuvent réciter des formules comptables, mais FinIndices, un benchmark construit sur de véritables états financiers chinois, montre qu'ils peinent à les appliquer. La précision de Gemini-3.1-Pro est passée de 70,70 % à 38,22 % lorsque les indices de formules ont été retirés, et la génération de tableaux a activement dégradé le raisonnement des modèles.

2026-08-20

5 min read

IA dans l'éducation

Les tuteurs IA aident trop par conception. Un nouveau benchmark le quantifie

Un benchmark construit sur 462 séances de tutorat réelles révèle que les tuteurs IA font par défaut le travail à la place des élèves. Une consigne explicite aide, mais les modèles peinent toujours sur le jugement central : quand pousser, quand étayer, quand reculer.

2026-08-10

5 min read

Agents vocaux

Pourquoi Grok 4.1 Fast bat des modèles plus intelligents au téléphone

Les classements généraux choisissent les mauvais LLM pour les appels vocaux. Le classement 2026 de BenchLM place la latence en premier : Grok 4.1 Fast répond en 0.54s tandis que Claude Opus 4.6, le meilleur scoreur, a besoin de 1.78s. Les modèles rapides mènent la conversation ; les modèles de raisonnement restent sur les appels d'outils en arrière-plan.

2026-08-05

Featured5 min read

Évaluation IA

Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.

Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.

2026-08-04

Featured8 min read

Rapport spécial : Évaluation de l'IA

L'état du benchmarking IA en 2026 : l'effondrement des tests statiques et les systèmes conçus pour les remplacer

Un tour d'horizon complet du paysage du benchmarking IA en 2026 : pourquoi MMLU, GSM8K et HumanEval ont cassé, comment les benchmarks dynamiques et les examens d'experts comme HLE et GPQA Diamond les ont remplacés, ce que révèlent les tests agentiques et d'intelligence irrégulière, et comment les préférences humaines, les juges LLM et l'observabilité en production complètent désormais la pile d'évaluation complète.

2026-08-03

Featured3 min read

Benchmark

Les modèles de vision IA de pointe échouent dans la perception de base, selon un nouveau benchmark

PerceptionBench teste dix capacités visuelles atomiques sur 3 000 questions. Aucun modèle de pointe n'a dépassé 60 %, et des scores globaux similaires masquent des profils de faiblesse radicalement différents.

2026-08-03

Featured2 min read

Analyse de benchmark

LiveBench refuse de rester figé. C'est tout l'intérêt

LiveBench remplace un corrigé fixe par un pool continuellement actualisé de problèmes de codage, de dépôts et de questions de prédiction, contournant la contamination qui a miné MMLU et GSM8K. Cela fait partie d'un virage plus large vers l'évaluation dynamique, aux côtés de LiveCodeBench, ForecastBench et LLMEval-Fair.

2026-08-03

Featured2 min read

Analyse de benchmark

5 millions de votes, 25 points Elo : Dans les coulisses du classement Chatbot Arena que personne ne peut ébranler

LMSYS Chatbot Arena classe les modèles selon les préférences humaines en aveugle sur une échelle Elo, avec près de cinq millions de votes qui resserrent désormais les meilleurs laboratoires dans une bande de 25 points. Les méthodes LLM-en-tant-que-Juge qui permettent de passer à l'échelle cette évaluation comportent leurs propres biais documentés en faveur de la verbosité et de la position.

2026-08-02

Featured2 min read

Analyse de benchmark

Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %

SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.

2026-08-02

Featured2 min read

Analyse de benchmark

GPQA Diamond a été conçu pour être à l'épreuve de Google. Les modèles frontaliers dépassent désormais 95% malgré tout

GPQA Diamond a été conçu pour que des humains équipés de moteurs de recherche ne puissent pas répondre de manière fiable à ses questions scientifiques de niveau expert. Les modèles frontaliers franchissent désormais 89% à 96%, poussant le benchmark vers la même saturation qui a retiré MMLU.

2026-08-01

3 min read

Benchmarks

Les agents de bureau IA échouent à un test avant-après dans 35% des cas

DDB teste les tâches d'ordonnancement et de paires avant-après sur 2 013 instances. Le meilleur modèle a atteint 65,1% de correspondance exacte sur les séquences sans leurre et 65,7% avec leurres, exposant une lacune dans la façon dont les agents vérifient les changements d'état.

2026-08-01

Featured2 min read

Analyse de benchmark

L'Examen Final de l'Humanité a débuté avec un score de 2,7 %. Les meilleurs modèles ne parviennent toujours pas à dépasser les 65 %

L'Examen Final de l'Humanité a été construit par CAIS et Scale AI pour succéder à MMLU en tant que benchmark général LLM le plus difficile. Deux ans plus tard, même le score de tête de 64,7 % de Claude Opus 5 reste bien en dessous de la référence humaine experte de 90 %.

2026-07-31

← PreviousPage 1 / 2 · 23 articlesNext →