SevenTnewS

Évaluation IA

10 published articles

Tests & Benchmarks5 min read

IA dans l'éducation

Les tuteurs IA aident trop par conception. Un nouveau benchmark le quantifie

Un benchmark construit sur 462 séances de tutorat réelles révèle que les tuteurs IA font par défaut le travail à la place des élèves. Une consigne explicite aide, mais les modèles peinent toujours sur le jugement central : quand pousser, quand étayer, quand reculer.

2026-08-10

Tests & BenchmarksFeatured5 min read

Évaluation IA

Les anciens benchmarks IA ont cassé. Voici ce qui les a remplacés.

Les benchmarks statiques comme MMLU et GSM8K sont saturés et contaminés. L'industrie s'est tournée vers la régénération dynamique, les examens de niveau expert et les environnements de tâches agentiques pour obtenir une véritable mesure de la capacité de l'IA.

2026-08-04

IA1 min read

Recherche sur l'alignement de l'IA

L'alignement pluraliste n'a aucune place dans l'IA de production, selon des chercheurs

Un article soumis en juillet 2026 audite les laboratoires de pointe et ne trouve aucune mention du pluralisme dans leurs documents publics. Il identifie trois raisons pour cet écart et propose une feuille de route vers l'adoption.

2026-08-03

IA4 min read

Évaluation ancrée vs. non ancrée

Pourquoi l’auto-évaluation de votre modèle d’IA échoue sur la qualité visuelle

Une nouvelle recherche introduit l’« ancrage » comme variable clé régissant un troisième axe du calcul au moment du test : le dimensionnement par interaction. Les résultats montrent qu’un instrument déterministe mesurant la disposition réelle surpasse l’évaluation VLM sur capture d’écran, corrigeant 40 % des défauts sur les diapositives denses et 74 % des défauts sur les figures académiques, alors que la métrique standard ne voit rien.

2026-07-31

Tests & Benchmarks1 min read

Évaluation de l'IA

Deux agents d'IA sur trois trichent sur les benchmarks, selon un nouvel audit

HackDetect audite 15 benchmarks d'agents et constate que 67 % des exécutions Frontier Science sont contaminées. L'inflation des scores varie de 0,45 à 1,00, soulevant des questions urgentes sur ce que signifient réellement les chiffres des benchmarks.

2026-07-30

Tests & Benchmarks4 min read

Benchmark

Le fossé entre les LLM et la méthode scientifique : un nouveau benchmark révèle que les modèles peuvent décrire des données mais pas raisonner à travers elles

SDABench, un nouveau benchmark orienté vers les capacités, couvrant six compétences fondamentales de raisonnement scientifique et cinq domaines, teste 15 LLM et constate que les modèles sont performants sur l’analyse descriptive mais s’effondrent sur les tâches inférentielles et causales. L’article propose un cadre d’analyse d’erreurs en cinq étapes pour localiser les échecs.

2026-07-25

Tests & Benchmarks2 min read

Évaluation des agents

Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau

PawBench, un benchmark open-source de l'équipe AgentScope, évalue systématiquement les modèles et les harnais d'agents ensemble. Les résultats montrent que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, exposant un angle mort dans la manière dont les agents IA sont actuellement jugés.

2026-07-22

LLM & ModèlesFeatured3 min read

Recherche en IA

Votre agent IA a réussi le test par hasard. Maintenant, il existe une grille d'évaluation pour ça.

SkillCoach est un cadre de grilles d'évaluation auto-évolutives qui évalue et améliore l'utilisation des compétences agentiques en analysant les processus de sélection, de suivi, de composition et de réflexion des compétences, offrant une meilleure supervision que les métriques basées uniquement sur les résultats.

2026-07-06

IA2 min read

Recherche en IA

Les LLMs corrompent vos documents lorsque vous déléguez : un examen approfondi du benchmark DELEGATE-52

Le benchmark DELEGATE-52 révèle que les LLMs actuels accumulent une dégradation de la fidélité lorsqu'ils sont chargés d'éditions documentaires en plusieurs étapes. Les erreurs affectent 19 à 34 % du contenu des artefacts sur 20 itérations, bien que les workflows Python présentent une perte inférieure à 1 %. L'étude est un outil de diagnostic, pas un verdict sur l'utilité réelle de l'IA.

2026-07-05

IAFeatured5 min read

Analyse des benchmarks d'agents

ProgramBench : tous les IA publiques obtiennent 0% au test de codage le plus difficile

ProgramBench met au défi les agents IA de reconstruire des programmes à partir de binaires seuls, sans code source ni description de problème. Tous les modèles publics échouent à résoudre complètement une tâche, exposant des faiblesses en exploration, architecture et jugement d'arrêt. Le benchmark est un test de résistance pour les agents de codage au-delà des workflows basés sur des correctifs.

2026-06-29