Recherche en IA
L'évolution des harnais semble impressionnante jusqu'à ce qu'on la teste sur des tâches inédites
L'évolution automatique des harnais est censée améliorer les agents LLM, mais un nouvel article soutient que de nombreux gains rapportés pourraient provenir d'un surapprentissage sur l'ensemble de test public. Dans les expériences, des méthodes simples de test-time scaling ont égalé ou surpassé l'évolution, et les harnais évolués ont montré une généralisation limitée à des tâches inédites.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-27 · 3 min de lecture

L'article, disponible sur arXiv au numéro 2607.12227, constitue une critique méthodologique directe. Il revisite la manière dont l'évolution automatique des harnais, la pratique consistant à utiliser les retours des tests unitaires pour rechercher itérativement de meilleures configurations de harnais, est généralement évaluée, et constate que le protocole standard est fondamentalement défaillant.
Les deux préoccupations centrales sont assez simples à énoncer. Premièrement, l'évolution des harnais est elle-même une procédure de recherche qui consomme du calcul d'inférence et des retours de tâches. Pour savoir si ses gains proviennent d'une meilleure conception du harnais ou simplement de la recherche supplémentaire, il faut la comparer à des lignes de base tout aussi coûteuses, l'échantillonnage parallèle, le raffinement séquentiel, qui reçoivent les mêmes retours mais ne modifient pas le harnais. L'article soutient que cette ligne de base n'est presque jamais réalisée.
Deuxièmement, si vous recherchez sur le même benchmark que celui sur lequel vous faites votre rapport, vous mesurez la capacité du harnais à s'adapter à cet ensemble spécifique de tâches, et non la transférabilité de l'amélioration. L'article le souligne sans détour : les gains rapportés risquent un surapprentissage à cet ensemble de tâches spécifique.
Ce que les expériences ont réellement montré

Sur Terminal-Bench 2.1, en utilisant GPT-5.4 et Claude Opus 4.6, les chercheurs ont comparé l'évolution des harnais à des méthodes simples de test-time scaling sous des budgets d'inférence appariés. Les résultats ne sont pas tendres avec le récit dominant.
L'évolution automatique des harnais n'a pas systématiquement surpassé l'échantillonnage parallèle simple ou le raffinement séquentiel, même lorsque les retours des tests unitaires étaient disponibles. Lorsque les tâches de recherche et d'évaluation ont été séparées, le harnais évolué testé sur des tâches inédites qu'il n'avait pas vues pendant l'évolution, les améliorations étaient marginales au mieux.
Les auteurs prennent soin de ne pas exagérer. Leur conclusion n'est pas que l'évolution des harnais est inefficace, mais que ses avantages doivent être évalués en utilisant des configurations équitables, des lignes de base solides avec des budgets comparables, et des benchmarks réellement sensibles à la conception du harnais.
Cela fait écho aux travaux connexes de l'équipe AgentScope, qui ont montré que la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits, mais que ces travaux antérieurs portaient sur l'évaluation des harnais, et non sur leur évolution. Le nouvel article étend le même principe au processus d'évolution lui-même : si les harnais sont importants, alors isoler correctement leur effet de l'artefact de recherche est également important.
Pourquoi cela importe pour le domaine
L'article arrive à un moment où l'écosystème des agents IA s'efforce de trouver une évaluation fiable. La liste des articles connexes signalés par Semantic Scholar est elle-même révélatrice. Il y a « Do Agent Optimizers Compound? », « SEAGym », « MemoHarness », « Harness Updating Is Not Harness Benefit », « Evolving Agents in the Dark », « Self-Harness », et « TTHE: Test-Time Harness Evolution », tout un sous-domaine se forme autour de la question de savoir comment évaluer les évaluateurs.
La critique soulève également un point plus large sur le pipeline d'évaluation des agents. Comme indiqué dans notre couverture précédente, la conception du harnais peut faire varier les scores de plus de 11 points pour les modèles plus petits. Si l'évolution ajoute une autre couche de recherche qui n'est pas correctement séparée de la mesure, le domaine risque de construire un château de cartes où les scores rapportés reflètent la profondeur de la recherche et la familiarité avec le benchmark plutôt que la véritable capacité de l'agent.
Le code est disponible à l'adresse https://github.com/rethinking-harness-evolution pour quiconque souhaite reproduire les expériences ou les étendre à d'autres familles de modèles et ensembles de tâches.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.