SevenTnewS

Agents IA

Personne ne peut dire ce que leurs agents de codage IA ont réellement fait aujourd'hui

Les entreprises qui dépensent massivement pour des agents de codage IA ne peuvent pas voir ce que ces agents ont réellement fait, les benchmarks mesurant leur amélioration peuvent être sur-ajustés aux ensembles de test publics, et le code qu'ils écrivent n'est pas examiné par défaut. Trois problèmes distincts avec la même cause racine : l'adoption a dépassé les outils pour l'observer.

Emmanuel Fabrice Omgbwa Yasse

2026-07-30 · 2 min de lecture

Personne ne peut dire ce que leurs agents de codage IA ont réellement fait aujourd'hui
Sources : Analysis synthe…

Les entreprises dépensent massivement dans les agents de codage IA avec pratiquement aucune visibilité sur leur comportement réel : ce qu'ils ont essayé, ce qui a échoué silencieusement, ce qui a été refait trois fois avant d'aboutir. La réponse d'Alibaba Cloud, un outil d'observabilité open source appelé LoongSuite Pilot, traite cette lacune comme un problème d'outillage. C'en est probablement un, mais le fait que l'outillage n'existait pas avant que les dépenses ne soient déjà suffisamment élevées pour être remarquées est le fait le plus intéressant.

Les benchmarks mesurant les agents ont leur propre problème

Un nouvel article sur l'évolution automatique des harnais, la pratique qui consiste à laisser un agent améliorer itérativement son propre échafaudage, a révélé que bon nombre des gains rapportés ressemblent à un surapprentissage de l'ensemble de test public plutôt qu'à une réelle amélioration des capacités. Dans des expériences en tête-à-tête, des méthodes simples de mise à l'échelle au moment du test ont égalé ou battu les harnais évolués, et ces derniers ont montré une généralisation limitée aux tâches pour lesquelles ils n'avaient pas été optimisés. C'est une découverte sérieuse pour une industrie qui cite régulièrement les benchmarks d'évolution de harnais pour justifier les achats d'agents : si le nombre qui augmente ne reflète pas la capacité que les acheteurs pensent qu'il reflète, la conversation sur le ROI que les entreprises peinent déjà à avoir devient encore plus difficile à mener honnêtement.

Et le code que ces agents écrivent n'est pas vérifié par défaut

La décision séparée d'Alibaba d'ajouter une revue de code en session, qui détecte les vulnérabilités avant qu'elles n'atterrissent dans un dépôt plutôt que de compter sur le modèle de codage pour éviter de les écrire, n'a de sens en tant que produit que si l'état par défaut du code généré par IA n'est pas révisé. C'est l'aveu silencieux enfoui dans l'annonce : les agents de codage de l'industrie ont livré du code dans des dépôts de production sans passerelle de sécurité comme pratique standard, et les fournisseurs ne construisent maintenant cette barrière de sécurité que comme un module complémentaire optionnel plutôt que comme une condition de base.

Trois problèmes, une cause racine

Dépenses sans visibilité, gains de capacité qui pourraient être des artefacts de mesure, et code livré sans révision par défaut sont trois problèmes distincts sur le papier. En pratique, ils partagent une cause racine : les agents de codage IA ont été adoptés assez rapidement pour que l'infrastructure nécessaire pour les observer, les évaluer et les sécuriser soit construite après coup, en réponse à des problèmes déjà apparus, plutôt qu'en amont. Ce n'est pas inhabituel pour une nouvelle catégorie technologique. Les applications web ont connu le même décalage avant que l'analyse de sécurité ne devienne standard, et l'infrastructure cloud l'a connu avant que les plateformes d'observabilité ne mûrissent. Ce qui est inhabituel, c'est la vitesse : les agents de codage sont passés de la nouveauté à un poste budgétaire significatif en entreprise en environ deux ans, plus rapidement que l'écosystème d'outillage nécessaire pour suivre le rythme.

L'implication pratique pour toute équipe utilisant ces agents aujourd'hui est qu'aucun des chiffres auxquels ils se fient actuellement, efficacité des dépenses, gains de capacité rapportés par les benchmarks, qualité du code, ne doit être pris au pied de la lettre sans les couches d'observabilité et de révision que ces trois histoires décrivent. Les agents sont devenus rapides. La mesure de ce qu'ils font réellement est encore en train de rattraper son retard.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.