SevenTnewS

Évaluation des agents

Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau

PawBench, un benchmark open-source de l'équipe AgentScope, évalue systématiquement les modèles et les harnais d'agents ensemble. Les résultats montrent que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, exposant un angle mort dans la manière dont les agents IA sont actuellement jugés.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-22 · 4 min de lecture

Votre agent IA échoue constamment ? Ce pourrait être le harnais, pas le cerveau

Lorsqu'un agent IA échoue à accomplir une tâche en plusieurs étapes, l'instinct naturel est de blâmer le modèle. Mais un nouveau benchmark de l'équipe AgentScope suggère que le vrai problème pourrait se trouver dans l'échafaudage qui l'entoure. the-1115-problem-when-ai-writing-challenges-become-a-test-of-editorial-integrity

PawBench, publié aujourd'hui dans le cadre de l'écosystème OpenJudge, mesure comment les grands modèles de langage et les harnais qui les orchestrent fonctionnent ensemble comme une unité. Il exécute 9 modèles sur 3 harnais pour 150 tâches sélectionnées, produisant 4 050 cellules de test visant à démêler où les échecs des agents commencent réellement.

Le modèle contre le harnais

La plupart des benchmarks évaluent les modèles isolément, en leur fournissant des prompts et en notant les sorties. Ce n'est pas ainsi que les agents du monde réel sont déployés. En pratique, le modèle fixe la limite supérieure de ce qu'un agent pourrait faire, et le harnais décide si cette capacité se traduit de manière fiable en exécution réussie de la tâche. Le harnais open-source CUGA d'IBM évite la plomberie et…

PawBench formalise cela comme une fonction : Performance de l'agent = f(Modèle, Harnais). La version 1.0 inclut des tâches issues de six benchmarks d'agents de haute qualité : claweval, qwenclawbench, pinchbench, qwenpawbench, skillsbench et wildclawbench. Chaque tâche est étiquetée selon cinq dimensions : scénario d'application, capacité atomique, complexité, modalité d'entrée et environnement d'exécution.

Toutes les tâches s'exécutent dans des sandbox Docker avec une traçabilité complète, ce qui permet de relier les scores du benchmark au comportement d'exécution réel. Le score final combine des correcteurs automatisés, des vérifications de règles et des sous-affirmations, avec LLM-as-judge pour les sorties plus sémantiques. IFBench : le nouveau benchmark testant le respect des…

Les lacunes du harnais sont réelles et mesurables

Le résultat principal parmi les 4 050 cellules est que la conception du harnais peut introduire une variation significative des performances. Deux extrêmes illustrent ce point. Claude Opus 4.6 montre une dispersion de seulement 2,3 points entre différents harnais. Le modèle Qwen3.6-35B-A3B varie de 11,5 points complets en fonction uniquement du harnais.

L'analyse de traçabilité pointe vers trois sources courantes d'échec : le modèle perd la trace du répertoire de travail actuel, juge mal si un fichier a réellement été écrit, ou choisit le mauvais premier outil lorsque la liste d'outils devient trop grande. Les modèles plus grands semblent mieux compenser le manque de contexte ; ils infèrent les chemins, filtrent les grandes listes d'outils et vérifient si des artefacts ont réellement été produits. Les modèles plus petits sont plus fragiles.

La conclusion n'est pas que les petits modèles sont faibles. C'est qu'ils s'appuient davantage sur la structure du harnais. Un harnais bien conçu peut réduire considérablement l'écart.

Les compétences et la recherche web révèlent de nouveaux schémas d'échec

PawBench inclut deux catégories de tâches qui exposent des dynamiques d'échec distinctes. La première sont les tâches liées aux compétences, qui simulent des développeurs stockant des compétences spécifiques au projet directement dans leur espace de travail. Sur les trois harnais, les tâches de compétences ont été systématiquement plus difficiles que l'utilisation d'outils, la planification ou le raisonnement. MiniMax lance le modèle M2.7 avec de solides…

Deux problèmes ressortent : le harnais doit mettre en évidence clairement les compétences (nom, portée, utilisation), et le modèle doit décider de manière fiable de les invoquer. Si l'un ou l'autre côté échoue, le modèle contourne la compétence et tente de résoudre la tâche par un raisonnement général, échouant souvent.

Les tâches de recherche web testent la capacité du modèle à rechercher sur le web, récupérer du contenu et mener des recherches approfondies. PawBench recrée l'expérience de développeur par défaut : cloner une version fixe, ajouter la clé LLM et exécuter, sans supposer que chaque clé API de recherche est préconfigurée. Les résultats ont montré que certains modèles ignoraient simplement les sorties d'outils cassées, tandis que d'autres tombaient dans des boucles en essayant de réexécuter les outils défaillants. Les modèles forts peuvent contourner les outils manquants ; les modèles plus faibles dépendent du harnais pour maintenir le chemin de recherche stable et explicite.

Quatre principes pour une meilleure conception de harnais

Sur la base des résultats du benchmark, l'équipe AgentScope propose quatre principes pour des harnais efficaces. Premièrement, soyez explicite : les modèles ne peuvent pas agir sur des informations qu'ils n'ont pas. Dites au modèle où il se trouve, quelles ressources existent et quels résultats sont attendus. Ne supposez jamais que le modèle inférera ces détails.

Deuxièmement, gardez les outils suffisants et efficaces. Fournissez les outils qui comptent, assurez-vous que les outils critiques sont utilisables par défaut, mais évitez de submerger le modèle avec des options inutiles.

Troisièmement, vérifiez, ne faites pas confiance. Ne vous fiez pas uniquement à ce que dit le modèle. Vérifiez les artefacts, fichiers, sorties et résultats d'exécution plutôt que de vous fier uniquement à l'auto-rapport de l'agent.

Quatrièmement, intégrez la récupérabilité. De nombreux échecs sont récupérables si le cadre fournit des retours d'information utiles et des opportunités de nouvelle tentative. Fournissez des informations critiques telles que l'état actuel, les exigences manquantes et les artefacts existants, et donnez au modèle une opportunité structurée de récupération. La nouvelle plateforme de Microsoft donne aux…

Le résultat le plus important de PawBench n'est pas quel modèle se classe premier. C'est que la performance de l'agent n'est pas une propriété du modèle seul. PawBench v1.0 est entièrement open-source, et l'équipe accueille favorablement les nouveaux harnais, modèles, tâches et contributions de la communauté.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.