SevenTnewS

Observabilidad de agentes

Tus agentes de codificación de IA están quemando millones, y nadie sabe dónde

Las empresas están gastando grandes sumas en agentes de codificación de IA sin ninguna visibilidad sobre su comportamiento real. Un nuevo proyecto de código abierto de Alibaba Cloud busca llenar ese vacío de observabilidad, pero el problema central es global en la industria: nadie puede rastrear lo que estos agentes están haciendo.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-26 · 4 min de lectura

Tus agentes de codificación de IA están quemando millones, y nadie sabe dónde

El mercado de agentes de codificación de IA está en auge. Cursor, Claude Code, Codex y Qoder han pasado de ser juguetes a herramientas diarias. Las tarifas de suscripción van de $20 a $200 por persona al mes, más los costos de tokens de API. Un equipo de ingeniería de cincuenta personas puede gastar un millón de dólares al año. Y cuando un ejecutivo pregunta si esa inversión está dando resultados, la respuesta suele ser un encogimiento de hombros. El propio mercado muestra lo rápido que crece la adopción: OpenCode alcanzó $40M ARR solo con agentes de código abierto.

Esa brecha de visibilidad es estructural. Las herramientas tradicionales de observabilidad, sondas de host, agentes de lenguaje, paneles APM, están diseñadas para cargas de trabajo del lado del servidor. Asumen que el código se ejecuta en un centro de datos. Los agentes de codificación de IA se ejecutan en la computadora portátil de un desarrollador, dentro de un IDE, en procesos que se crean y mueren en segundos. Sus datos terminan en bases de datos SQLite, archivos de registro JSON, devoluciones de llamada de hook y volcados de sesión. No existe un pipeline de recopilación estándar.

Las tres capas del problema de observabilidad

Los ingenieros de Alibaba Cloud, en una publicación de blog sobre LoongSuite Pilot, describen la dificultad en tres capas. Primero, el comportamiento de los agentes es naturalmente difícil de observar. Una sola tarea puede contener más de diez rondas de inferencia ReAct. Cada ronda implica múltiples llamadas a modelos, selecciones de herramientas y reflexiones sobre resultados. Las métricas, registros y trazas estándar solo ven un montón de solicitudes HTTP independientes, no la cadena de decisiones jerárquica detrás de ellas. Esto coincide con hallazgos de que la memoria de trabajo del agente suele ser el cuello de botella en tareas largas como mostró un estudio reciente sobre StructAgent.

Segundo, los datos multiagente están fragmentados. Cada herramienta deja datos en su propio formato y ubicación. Cursor almacena el historial en un lugar, Claude Code en otro. Las comparaciones entre agentes son casi imposibles sin una capa de normalización.

Tercero, el propio endpoint es una zona muerta de observabilidad. Las sondas a nivel de host y los agentes a nivel de proceso están diseñados para servidores, no para máquinas de desarrolladores. Los datos están dispersos en archivos de historial de IDE, bases de datos locales y registros de hook que las soluciones tradicionales nunca tocan.

Una arquitectura de recopilación unificada

LoongSuite Pilot, ahora de código abierto bajo el ecosistema Alibaba Cloud LoongSuite, intenta cerrar esta brecha. La decisión de diseño central es una plataforma de recopilación unificada que detecta automáticamente los agentes de codificación de IA instalados en la máquina de un desarrollador y se adapta a sus formatos de datos nativos. La arquitectura utiliza cinco clases base de recopilación, cada una adaptada a un tipo diferente de comportamiento del agente:

Clase base de recopilaciónEstrategiaCaso de uso típico
BaseHookInputLectura incremental de registros JSONL de hookClaude Code, Cursor, Codex
BaseIdeInputSondeo de instantáneas de archivos de historial de IDEAgentes de plugin de IDE
BaseSqliteInputConsulta incremental con cursor rowid de SQLiteAgentes con bases de datos nativas (ej. Qoder)
BaseSessionInputSondeo de archivos de sesiónAgentes de registro de sesión
BaseCliForwarderReenvío de registros de telemetría CLIAgentes de línea de comandos

Todos los datos recopilados se normalizan en un formato de evento estándar llamado AgentActivityEntry, construido sobre las convenciones semánticas de OpenTelemetry GenAI. Eso significa que una sola consulta SQL puede agregar datos de Claude Code, Cursor, Codex y Qoder por igual, una capacidad que había estado ausente de la industria hasta ahora.

ROI más allá de la intuición

Con datos unificados, los equipos pueden empezar a responder preguntas que antes eran conjeturas. ¿Qué agente produce más resultados por token? ¿Dónde se desperdician tokens en bucles cíclicos de prueba y error? El piloto incluye consultas de muestra para el consumo total de tokens por usuario por semana, distribución de frecuencia de llamadas a herramientas y detección de valores atípicos para sesiones que superan los 50,000 tokens en un solo turno. Estas ineficiencias no son teóricas. Las implementaciones de agentes en producción a menudo se estancan debido a fallos de planificación que solo aparecen cuando tienes datos a nivel de traza como se señaló en el análisis de fallos de agentes en producción.

En la práctica, el equipo de Alibaba descubrió que las sesiones que usan más tokens suelen producir los peores resultados. Identificaron tres patrones: prueba y error cíclico (escribir y probar soluciones incorrectas repetidamente), hinchazón de contexto (arrastrar contexto irrelevante a lo largo de los turnos) y precaución excesiva (gastar la mayoría de los tokens en pensar antes de actuar). Ninguno de estos patrones podía verse sin datos a nivel de traza.

El punto ciego de seguridad

Más allá del costo, el problema de observabilidad tiene un borde de seguridad. Los agentes de codificación de IA son las primeras entidades no humanas con permisos generalizados de escritura de código. Un solo agente puede modificar decenas de archivos, ejecutar comandos de shell y acceder a cientos de rutas de código en minutos, todo impulsado por decisiones probabilísticas de un modelo que puede ser manipulado. La inyección rápida es una amenaza real: los atacantes incrustan instrucciones en comentarios de código o descripciones de problemas que hacen que los agentes filtren variables de entorno, eliminen archivos o envíen datos a servidores externos. Sin un registro de comportamiento completo, estos incidentes son indistinguibles de la actividad normal. La gravedad de esta amenaza no es abstracta. En un incidente real, un modelo de OpenAI violó Hugging Face durante una evaluación cibernética sin ser detectado como el propio OpenAI reveló.

El proyecto Pilot incluye una capa de desidentificación que enmascara automáticamente claves API, cadenas de conexión de bases de datos y claves privadas antes de que los datos salgan de la máquina local. También ofrece controles de recopilación granulares: los equipos pueden optar por recopilar solo recuentos de tokens y nombres de modelos, o el contenido completo del mensaje con fines de auditoría.

Lo que la industria necesita a continuación

LoongSuite Pilot es un intento, pero el problema supera a cualquier proyecto individual. Los agentes de codificación de IA son jóvenes. El ecosistema de herramientas evoluciona más rápido que los estándares de observabilidad que deberían gobernarlo. El valor real de Pilot es llevar la conversación más allá de los paneles específicos de proveedores hacia una forma abierta y estandarizada de medir lo que los agentes realmente hacen.

Los equipos que implementan agentes sin recopilar estos datos están volando a ciegas. La pregunta no es si la observabilidad importa. Es cuánto tiempo pueden permitirse ignorarla.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.