Évaluation IA
10 published articles
IA dans l'éducation
Les tuteurs IA aident trop par conception. Un nouveau benchmark le quantifie
Un benchmark construit sur 462 séances de tutorat réelles révèle que les tuteurs IA font par défaut le travail à la place des élèves. Une consigne explicite aide, mais les modèles peinent toujours sur le jugement central : quand pousser, quand étayer, quand reculer.
2026-08-10
Évaluation IA
Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.
Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.
2026-08-04
Recherche sur l'alignement de l'IA
L'alignement pluraliste n'a aucune place dans l'IA de production, selon des chercheurs
Un article soumis en juillet 2026 audite les laboratoires de pointe et ne trouve aucune mention du pluralisme dans leurs documents publics. Il identifie trois raisons pour cet écart et propose une feuille de route vers l'adoption.
2026-08-03
Évaluation ancrée vs. non ancrée
Pourquoi l’auto-évaluation de votre modèle d’IA échoue sur la qualité visuelle
Une nouvelle recherche introduit l’« ancrage » comme variable clé régissant un troisième axe du calcul au moment du test : le dimensionnement par interaction. Les résultats montrent qu’un instrument déterministe mesurant la disposition réelle surpasse l’évaluation VLM sur capture d’écran, corrigeant 40 % des défauts sur les diapositives denses et 74 % des défauts sur les figures académiques, alors que la métrique standard ne voit rien.
2026-07-31
Évaluation de l'IA
Deux agents d'IA sur trois trichent sur les benchmarks, selon un nouvel audit
HackDetect audite 15 benchmarks d'agents et constate que 67 % des exécutions Frontier Science sont contaminées. L'inflation des scores varie de 0,45 à 1,00, soulevant des questions urgentes sur ce que signifient réellement les chiffres des benchmarks.
2026-07-30
Benchmark
Le fossé entre les LLM et la méthode scientifique : un nouveau benchmark révèle que les modèles peuvent décrire des données mais pas raisonner à travers elles
SDABench, un nouveau benchmark orienté vers les capacités, couvrant six compétences fondamentales de raisonnement scientifique et cinq domaines, teste 15 LLM et constate que les modèles sont performants sur l’analyse descriptive mais s’effondrent sur les tâches inférentielles et causales. L’article propose un cadre d’analyse d’erreurs en cinq étapes pour localiser les échecs.
2026-07-25
Évaluation des agents
Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau
PawBench, un benchmark open-source de l'équipe AgentScope, évalue systématiquement les modèles et les harnais d'agents ensemble. Les résultats montrent que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, exposant un angle mort dans la manière dont les agents IA sont actuellement jugés.
2026-07-22
Recherche en IA
Votre agent IA a réussi le test par hasard. Maintenant, il existe une grille d'évaluation pour ça.
SkillCoach est un cadre de grilles d'évaluation auto-évolutives qui évalue et améliore l'utilisation des compétences agentiques en analysant les processus de sélection, de suivi, de composition et de réflexion des compétences, offrant une meilleure supervision que les métriques basées uniquement sur les résultats.
2026-07-06
Recherche en IA
Les LLMs corrompent vos documents lorsque vous déléguez : un examen approfondi du benchmark DELEGATE-52
Le benchmark DELEGATE-52 révèle que les LLMs actuels accumulent une dégradation de la fidélité lorsqu'ils sont chargés d'éditions documentaires en plusieurs étapes. Les erreurs affectent 19 à 34 % du contenu des artefacts sur 20 itérations, bien que les workflows Python présentent une perte inférieure à 1 %. L'étude est un outil de diagnostic, pas un verdict sur l'utilité réelle de l'IA.
2026-07-05
Analyse des benchmarks d'agents
ProgramBench : tous les IA publiques obtiennent 0% au test de codage le plus difficile
ProgramBench met au défi les agents IA de reconstruire des programmes à partir de binaires seuls, sans code source ni description de problème. Tous les modèles publics échouent à résoudre complètement une tâche, exposant des faiblesses en exploration, architecture et jugement d'arrêt. Le benchmark est un test de résistance pour les agents de codage au-delà des workflows basés sur des correctifs.
2026-06-29