SevenTnewS

Benchmarks LLM

5 published articles

Tests & Benchmarks5 min read

IA dans l'éducation

Les tuteurs IA aident trop par conception. Un nouveau benchmark le quantifie

Un benchmark construit sur 462 séances de tutorat réelles révèle que les tuteurs IA font par défaut le travail à la place des élèves. Une consigne explicite aide, mais les modèles peinent toujours sur le jugement central : quand pousser, quand étayer, quand reculer.

2026-08-10

Tests & Benchmarks5 min read

Agents vocaux

Pourquoi Grok 4.1 Fast bat des modèles plus intelligents au téléphone

Les classements généraux choisissent les mauvais LLM pour les appels vocaux. Le classement 2026 de BenchLM place la latence en premier : Grok 4.1 Fast répond en 0.54s tandis que Claude Opus 4.6, le meilleur scoreur, a besoin de 1.78s. Les modèles rapides mènent la conversation ; les modèles de raisonnement restent sur les appels d'outils en arrière-plan.

2026-08-05

Tests & BenchmarksFeatured5 min read

Évaluation IA

Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.

Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.

2026-08-04

IAFeatured4 min read

Course aux modèles

Le classement LiveBench, une étude des rendements décroissants

GPT-5.6 Sol remporte la couronne globale sur LiveBench avec une moyenne de 82,4, mais Claude Fable 5 le suit de seulement 1,6 point à près de trois fois le coût. La véritable histoire est la manière dont le peloton s'est éclairci en dessous.

2026-07-22

Outils & Frameworks4 min read

Frameworks & Outils

Le nouveau langage de visualisation de Microsoft cache le code superflu pour que les agents IA arrêtent enfin de trébucher sur les graphiques

Microsoft Research a présenté Flint, un langage intermédiaire de visualisation qui aide les LLM et les agents IA à créer des graphiques soignés sans coder manuellement des paramètres bas niveau comme les échelles et le formatage des axes. Dans une étude portant sur trois modèles, Flint a surpassé la génération directe de Vega-Lite et est déjà utilisé en interne dans Data Formulator.

2026-07-08