Benchmarks LLM
5 published articles
IA dans l'éducation
Les tuteurs IA aident trop par conception. Un nouveau benchmark le quantifie
Un benchmark construit sur 462 séances de tutorat réelles révèle que les tuteurs IA font par défaut le travail à la place des élèves. Une consigne explicite aide, mais les modèles peinent toujours sur le jugement central : quand pousser, quand étayer, quand reculer.
2026-08-10
Agents vocaux
Pourquoi Grok 4.1 Fast bat des modèles plus intelligents au téléphone
Les classements généraux choisissent les mauvais LLM pour les appels vocaux. Le classement 2026 de BenchLM place la latence en premier : Grok 4.1 Fast répond en 0.54s tandis que Claude Opus 4.6, le meilleur scoreur, a besoin de 1.78s. Les modèles rapides mènent la conversation ; les modèles de raisonnement restent sur les appels d'outils en arrière-plan.
2026-08-05
Évaluation IA
Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.
Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.
2026-08-04
Course aux modèles
Le classement LiveBench, une étude des rendements décroissants
GPT-5.6 Sol remporte la couronne globale sur LiveBench avec une moyenne de 82,4, mais Claude Fable 5 le suit de seulement 1,6 point à près de trois fois le coût. La véritable histoire est la manière dont le peloton s'est éclairci en dessous.
2026-07-22
Frameworks & Outils
Le nouveau langage de visualisation de Microsoft cache le code superflu pour que les agents IA arrêtent enfin de trébucher sur les graphiques
Microsoft Research a présenté Flint, un langage intermédiaire de visualisation qui aide les LLM et les agents IA à créer des graphiques soignés sans coder manuellement des paramètres bas niveau comme les échelles et le formatage des axes. Dans une étude portant sur trois modèles, Flint a surpassé la génération directe de Vega-Lite et est déjà utilisé en interne dans Data Formulator.
2026-07-08