IAFeatured3 min read
Analyse des benchmarks
Ce que trois benchmarks IA ont mal compris sur les performances réelles
Les benchmarks IA comme MMLU sont la norme pour comparer les modèles, mais trois cas récents montrent qu'ils manquent des dimensions critiques. Le Nemotron-4 de Nvidia manque de vérification indépendante, Celeris-1 échange la précision contre la vitesse, et le meilleur IA de surveillance des agents pathogènes n'effectue que la moitié des tâches. Les preuves indiquent un besoin de cadres d'évaluation qui mesurent ce qui compte dans la pratique.
2026-07-29