Observabilité des agents
Vos agents de codage IA brûlent des millions, et personne ne sait où
Les entreprises dépensent massivement dans des agents de codage IA sans aucune visibilité sur leur comportement réel. Un nouveau projet open source d'Alibaba Cloud vise à combler ce gap d'observabilité, mais le problème central est général : personne ne peut suivre ce que ces agents font.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-26 · 4 min de lecture

Le marché des agents de codage IA explose. Cursor, Claude Code, Codex et Qoder sont passés du statut de jouets à celui d'outils quotidiens. Les frais d'abonnement varient de 20 à 200 dollars par personne et par mois, auxquels s'ajoutent les coûts des tokens API. Une équipe d'ingénieurs de cinquante personnes peut brûler un million de dollars par an. Et lorsqu'un dirigeant demande si cet investissement porte ses fruits, la réponse est généralement un haussement d'épaules. Le marché lui-même montre à quelle vitesse l'adoption croît : OpenCode a atteint 40 millions de dollars de revenus annuels récurrents rien qu'avec des agents open source.
Cette lacune en matière de visibilité est structurelle. Les outils d'observabilité traditionnels, sondes hôtes, agents linguistiques, tableaux de bord APM, sont conçus pour les charges de travail côté serveur. Ils supposent que le code s'exécute dans un centre de données. Les agents de codage IA s'exécutent sur un ordinateur portable de développeur, dans un IDE, dans des processus qui apparaissent et disparaissent en quelques secondes. Leurs données aboutissent dans des bases de données SQLite, des fichiers de logs JSON, des callbacks de hooks et des vidages de session. Aucun pipeline de collecte standard n'existe.
Les trois couches du problème d'observabilité
Les ingénieurs d'Alibaba Cloud, dans un article de blog sur LoongSuite Pilot, décrivent la difficulté en trois couches. Premièrement, le comportement des agents est naturellement difficile à observer. Une seule tâche peut contenir plus de dix cycles d'inférence ReAct. Chaque cycle implique plusieurs appels de modèle, sélections d'outils et réflexions sur les résultats. Les métriques, logs et traces standards ne voient qu'un tas de requêtes HTTP indépendantes, et non la chaîne de décision hiérarchique qui les sous-tend. Cela rejoint les conclusions selon lesquelles la mémoire de travail des agents est souvent le goulot d'étranglement dans les tâches longues comme l'a montré une étude récente sur StructAgent.
Deuxièmement, les données multi-agents sont fragmentées. Chaque outil laisse ses données dans son propre format et à son propre emplacement. Cursor stocke l'historique à un endroit, Claude Code à un autre. Les comparaisons inter-agents sont presque impossibles sans une couche de normalisation.
Troisièmement, le point de terminaison lui-même est une zone morte pour l'observabilité. Les sondes au niveau de l'hôte et les agents au niveau des processus sont conçus pour les serveurs, pas pour les machines des développeurs. Les données sont dispersées dans les fichiers d'historique de l'IDE, les bases de données locales et les logs de hooks que les solutions traditionnelles ne touchent jamais.
Une architecture de collecte unifiée
LoongSuite Pilot, désormais open source dans l'écosystème LoongSuite d'Alibaba Cloud, tente de combler cette lacune. La décision de conception centrale est une plateforme de collecte unifiée qui détecte automatiquement les agents de codage IA installés sur une machine de développeur et s'adapte à leurs formats de données natifs. L'architecture utilise cinq classes de base de collecte, chacune adaptée à un type différent de comportement d'agent :
| Classe de base de collecte | Stratégie | Cas d'utilisation typique |
|---|---|---|
| BaseHookInput | Lecture incrémentale des logs JSONL des hooks | Claude Code, Cursor, Codex |
| BaseIdeInput | Interrogation par snapshot des fichiers d'historique de l'IDE | Agents de plugins IDE |
| BaseSqliteInput | Requête incrémentale par curseur rowid SQLite | Agents avec bases de données natives (ex. Qoder) |
| BaseSessionInput | Interrogation des fichiers de session | Agents de logs de session |
| BaseCliForwarder | Transfert des logs de télémétrie CLI | Agents en ligne de commande |
Toutes les données collectées sont normalisées dans un format d'événement standard appelé AgentActivityEntry, construit sur les conventions sémantiques OpenTelemetry GenAI. Cela signifie qu'une seule requête SQL peut agréger des données provenant de Claude Code, Cursor, Codex et Qoder, une capacité qui était absente de l'industrie jusqu'à présent.
ROI au-delà du ressenti
Avec des données unifiées, les équipes peuvent commencer à répondre à des questions qui relevaient auparavant de la supputation. Quel agent produit le plus de résultats par token ? Où les tokens sont-ils gaspillés dans des cycles d'essais-erreurs ? Le pilote inclut des exemples de requêtes pour la consommation totale de tokens par utilisateur et par semaine, la distribution de fréquence des appels d'outils et la détection des anomalies pour les sessions dépassant 50 000 tokens en un seul tour. Ces inefficacités ne sont pas théoriques. Les déploiements d'agents en production échouent souvent en raison de problèmes de planification qui n'apparaissent que lorsque l'on dispose de données au niveau des traces comme le souligne l'analyse des échecs d'agents en production.
En pratique, l'équipe d'Alibaba a constaté que les sessions utilisant le plus de tokens donnent souvent les pires résultats. Ils ont identifié trois schémas : les cycles d'essais-erreurs (écrire et tester des solutions erronées à plusieurs reprises), le gonflement du contexte (traîner un contexte non pertinent d'un tour à l'autre) et la prudence excessive (consacrer la plupart des tokens à réfléchir avant d'agir). Aucun de ces schémas n'était visible sans données au niveau des traces.
L'angle mort sécuritaire
Au-delà du coût, le problème d'observabilité a un volet sécuritaire. Les agents de codage IA sont les premières entités non humaines disposant de droits d'écriture de code généralisés. Un seul agent peut modifier des dizaines de fichiers, exécuter des commandes shell et accéder à des centaines de chemins de code en quelques minutes, le tout piloté par des décisions probabilistes d'un modèle qui peut être manipulé. L'injection de prompts est une menace réelle : des attaquants intègrent des instructions dans des commentaires de code ou des descriptions de tickets qui amènent les agents à fuiter des variables d'environnement, supprimer des fichiers ou envoyer des données vers des serveurs externes. Sans journalisation comportementale complète, de tels incidents sont impossibles à distinguer d'une activité normale. La gravité de cette menace n'est pas abstraite. Dans un incident réel, un modèle OpenAI a pénétré Hugging Face lors d'une évaluation cyber sans être détecté comme OpenAI lui-même l'a révélé.
Le projet Pilot inclut une couche de désidentification qui masque automatiquement les clés API, les chaînes de connexion à la base de données et les clés privées avant que les données ne quittent la machine locale. Il offre également des contrôles de collecte granulaires : les équipes peuvent choisir de ne collecter que les compteurs de tokens et les noms de modèles, ou le contenu complet des messages à des fins d'audit.
Ce dont l'industrie a besoin ensuite
LoongSuite Pilot est une tentative, mais le problème dépasse tout projet unique. Les agents de codage IA sont jeunes. L'écosystème d'outils évolue plus vite que les normes d'observabilité qui devraient le régir. La véritable valeur de Pilot est de faire avancer la conversation au-delà des tableaux de bord propriétaires vers une manière ouverte et standardisée de mesurer ce que font réellement les agents.
Les équipes qui déploient des agents sans collecter ces données volent à l'aveugle. La question n'est pas de savoir si l'observabilité compte. Elle est de savoir combien de temps elles peuvent se permettre de l'ignorer.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.