SevenTnewSL'actu IA & tech, expliquée

Agents de codage autonomes · préprint arXiv

Harness-of-Harness revendique un gain de 52,25 % en exécutant d'autres agents de codage

HoH enveloppe les harnais d'agents de codage existants dans des boucles répétées planification-codage-test et rapporte un gain relatif moyen de 52,25 % sur trois suites de benchmarks. Le résumé laisse indéfinis la métrique sous-jacente, le coût en ressources et la ventilation par modèle.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-09-25 · 5 min de lecture

Harness-of-Harness revendique un gain de 52,25 % en exécutant d'autres agents de codage

Le préprint Harness-of-Harness a été mis en ligne sur arXiv le 1er septembre 2026 et défend une séparation que la plupart des articles sur les agents évitent. Au lieu de livrer un agent de codage, il enveloppe ceux qui existent déjà et prend en charge ce qu'ils font ensuite.

HoH organise les exécutions d'un harnais en boucles de planification, de codage et de test, puis répète ces boucles afin que chaque passe reparte de ce que la précédente a laissé derrière elle. L'affirmation du résumé est que cette couche externe améliore les performances sans toucher au modèle sous-jacent : un gain relatif moyen de 52,25 %, un maximum de 82,86 %, mesurés après trois itérations.

L'affirmation : un harnais qui améliore d'autres harnais

Une grande partie du résumé décrit ce que HoH refuse de faire. Il contraint ce qui compte comme sortie vérifiable au lieu de prescrire la manière dont un agent doit travailler, et il découpe le développement en petits incréments vérifiables. Les tests effectués pendant l'écriture du code sont tenus séparés d'une étape d'évaluation qui s'exécute de son côté.

Vient ensuite l'équilibre que les auteurs mettent en avant : la réparation face à la croissance des capacités. Une boucle qui ne fait que corriger des défauts maintient un projet en vie sans le faire avancer ; une boucle qui ne fait qu'ajouter des fonctionnalités accumule les casses. HoH est décrit comme maintenant les deux en tension au fil des itérations, exposant livrables, outils et compétences progressivement plutôt que d'un seul coup, et conservant un historique de projet versionné pour que la trace survive à l'exécution.

52,25 % de quoi ?

Les gains ont été mesurés sur GameCraft-Bench, FrontierSWE et ProgramBench, face au même harnais exécuté seul. Trois itérations ont produit la moyenne ; l'une des paires a produit le maximum. C'est là que le résumé s'arrête.

Il ne nomme jamais la métrique qui s'est améliorée. Un gain relatif de 52,25 % peut être un taux de réussite, un nombre de tâches accomplies, ou un indicateur composite défini par les auteurs pour la circonstance, et le lecteur ne peut pas le savoir à la lecture du texte. Le résultat n'est pas non plus ventilé par harnais, par modèle ou par benchmark, ce qui laisse la moyenne comme seul chiffre disponible. « Relatif » est le mot qui porte tout le poids ici : un gain par rapport à une base faible représente un changement absolu plus petit qu'il n'y paraît.

Affirmation du résuméCe que le texte précise réellement
Gain relatif moyen de 52,25 %Sur trois paires harnais-modèle, après trois itérations
Gain maximal de 82,86 %Meilleur résultat de ces trois mêmes paires, après trois itérations
Amélioration constante face aux harnais seulsAffirmée pour les trois paires ; aucun chiffre par paire fourni
Développement autonome sur plusieurs joursUn projet, plus de 70 itérations, un jeu de tir à la première personne
Coût, budget de tokens, temps réelNon communiqués

Soixante-dix itérations, un jeu de tir à la première personne

Le déploiement est la partie qui ira le plus loin. Sur plus de 70 itérations, HoH aurait produit un jeu de tir à la première personne doté d'une intrigue cohérente, de mécaniques de base implémentées, d'une version jouable par un humain, de « visuels soignés et d'un audio intégré ».

Un jeu de tir teste des choses qu'un utilitaire en ligne de commande ne teste pas : l'état en temps réel, la gestion des entrées, les collisions, une chaîne d'actifs qui survit à un agent réécrivant des fichiers qu'il a écrits une heure plus tôt. Que la version de HoH franchisse cette barre est affirmé plutôt que mesuré. Le résumé ne donne ni fréquence d'images, ni nombre de sessions de test, ni comparaison avec un projet humain de portée similaire. « Plusieurs jours » n'est pas non plus un nombre de jours, et le texte ne fournit aucun chiffre de calcul ni décompte d'interventions humaines pour l'exécution.

Modèle contre harnais

Les trois paires sont Codex avec GPT-5.5, OpenCode avec DeepSeek-V4-Pro et Pi avec MiniMax-M3. Trois harnais sur trois familles de modèles, c'est la bonne configuration pour un article sur l'échafaudage. Si la boucle n'avait aidé que le harnais autour duquel elle a été conçue, l'idée entière ressemblerait à une recette de prompt rebaptisée.

Le résumé affirme que HoH a battu à chaque fois le harnais seul correspondant, ce qui est l'affirmation la plus forte possible sans publier la ventilation. L'effort est ce qu'il ne peut pas exclure à la seule lecture du texte. Une boucle itérative qui tourne plus longtemps, essaie plus de variantes et écarte plus d'échecs aura tendance à mieux scorer sur n'importe quel benchmark, et aucun budget de tokens, chiffre de temps réel ou comptabilité des coûts n'apparaît dans le résumé. La part des 52,25 % qui vient d'un meilleur ordonnancement et celle qui vient d'une dépense accrue de toutes les ressources restent indéterminées.

Ce que l'article ne montre pas

Il s'agit d'un préprint soumis le 1er septembre 2026, et chaque chiffre appartient à ses auteurs. Aucune réplication indépendante n'est mentionnée. Citer trois benchmarks publics soulève la question habituelle de la contamination, car des suites largement diffusées peuvent se retrouver dans les données d'entraînement, et le texte n'aborde pas ce point. La comptabilisation des ressources manque pour la démonstration la plus longue, celle qui paraît la plus impressionnante.

Le résultat pourrait bien tenir. Pour l'instant, il n'est pas vérifié, ce qui est la condition ordinaire d'un préprint récent et une raison de tenir le 52,25 % à distance jusqu'à ce que quelqu'un le reproduise.

L'argument le plus intéressant de HoH se situe sous son chiffre vedette. Si la boucle autour d'un agent de codage est elle-même un endroit où trouver des gains, alors la concurrence entre harnais compte autant que celle entre modèles. C'est cette affirmation que la réplication trancherait, et il n'y a pas encore grand-chose à vérifier.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.