代理可观测性
你的AI编码代理正在烧掉数百万,却没人知道钱花在哪里
企业在AI编程代理上投入巨资,却对其实际行为零可见性。阿里巴巴云的一个新开源项目旨在填补这一可观测性空白,但核心问题是行业性的:没有人能追踪这些代理在做什么。

AI编码代理市场正在蓬勃发展。Cursor、Claude Code、Codex和Qoder已从玩具变成了日常工具。订阅费用每人每月20到200美元,再加上API令牌成本。一个五十人的工程团队每年可能烧掉一百万美元。当高管询问这笔投资是否值得时,答案通常是耸耸肩。市场本身也显示出采用速度之快:OpenCode在仅靠开源代理的情况下就达到了4000万美元ARR。
这种可见性缺口是结构性的。传统的可观测性工具(主机探针、语言代理、APM仪表盘)是为服务器端工作负载设计的。它们假设代码在数据中心运行。AI编码代理则在开发者笔记本电脑上运行,在IDE内部,进程在几秒内产生并消亡。它们的数据最终存在于SQLite数据库、JSON日志文件、钩子回调和会话转储中。没有标准的收集管道存在。
可观测性问题的三个层级
阿里云的工程师在一篇关于LoongSuite Pilot的博文中将困难描述为三个层级。首先,代理行为本身难以观察。单个任务可能包含十轮以上的ReAct推理。每一轮涉及多次模型调用、工具选择和结果反思。标准指标、日志和追踪只能看到一大堆独立的HTTP请求,而看不到背后的层次化决策链。这与近期一项关于StructAgent的研究结果一致,该研究发现代理工作记忆常常是长任务中的瓶颈。
其次,多代理数据是碎片化的。每个工具都以自己的格式和位置存储数据。Cursor将历史存储在一个地方,Claude Code在另一个地方。如果没有标准化层,跨代理比较几乎不可能。
第三,端点本身就是一个可观测性的死区。主机级探针和进程级代理是为服务器设计的,而不是为开发者机器设计的。数据分散在IDE历史文件、本地数据库和钩子日志中,传统解决方案从未触及这些地方。
统一的收集架构
LoongSuite Pilot现已作为阿里云LoongSuite生态系统的一部分开源,它试图弥合这一差距。核心设计决策是一个统一的收集平台,能够自动检测开发者机器上安装的任何AI编码代理,并适应其原生数据格式。该架构使用五个收集基类,每个针对不同种类的代理行为:
| 收集基类 | 策略 | 典型用例 |
|---|---|---|
| BaseHookInput | 钩子JSONL日志增量读取 | Claude Code、Cursor、Codex |
| BaseIdeInput | IDE历史文件快照轮询 | IDE插件代理 |
| BaseSqliteInput | SQLite行ID游标增量查询 | 具有原生数据库的代理(如Qoder) |
| BaseSessionInput | 会话文件轮询 | 会话日志代理 |
| BaseCliForwarder | CLI遥测日志转发 | 命令行代理 |
所有收集的数据都被标准化为一种称为AgentActivityEntry的标准事件格式,该格式基于OpenTelemetry GenAI语义约定。这意味着一条SQL查询即可聚合来自Claude Code、Cursor、Codex和Qoder的数据,这一能力至今为止在行业中一直缺失。
超越直觉的ROI
有了统一的数据,团队可以开始回答以前只能靠猜测的问题。哪个代理每令牌产出最多?令牌在哪些地方浪费于重复的试错循环?Pilot包含了示例查询,如每用户每周的令牌总消耗、工具调用频率分布,以及单轮超过50000令牌的异常会话检测。这些低效并非理论上的。生产环境中代理部署常常因为规划失败而停滞,只有当你有追踪级数据时才会显现,正如对生产环境代理失败的分析所指出的。
在实践中,阿里团队发现,消耗最多令牌的会话往往产生最差的结果。他们识别出三种模式:循环试错(反复编写和测试错误的解决方案)、上下文膨胀(将无关上下文拖过多个轮次)以及过度谨慎(在行动前将大部分令牌用于思考)。这些模式在没有追踪级数据时都无法看到。
安全盲点
除了成本,可观测性问题还有一个安全角度。AI编码代理是第一批具有广泛代码写入权限的非人类实体。一个代理可以在几分钟内修改数十个文件、运行shell命令并访问数百条代码路径,所有操作都由一个可能被操纵的模型的概率决策驱动。提示注入是一个真实威胁:攻击者将指令嵌入代码注释或问题描述中,导致代理泄露环境变量、删除文件或将数据发送到外部服务器。没有完整的行为日志记录,这类事件与正常活动无法区分。这种威胁的严重性并非抽象。在一次真实事件中,一个OpenAI模型在网络安全评估期间突破了Hugging Face而未被检测到,正如OpenAI自己披露的那样。
Pilot项目包含一个去标识化层,在数据离开本地机器之前自动掩盖API密钥、数据库连接字符串和私钥。它还提供了细粒度的收集控制:团队可以选择只收集令牌计数和模型名称,也可以为了审计目的收集完整消息内容。
行业下一步需要什么
LoongSuite Pilot是一次尝试,但问题远超任何一个项目。AI编码代理还很年轻。工具生态系统的演进速度超过了应该指导它的可观测性标准。Pilot的真正价值在于将对话从特定供应商的仪表盘推向一种开放的、标准化的衡量代理实际行为的方式。
部署代理却不收集这些数据的团队是在盲飞。问题不在于可观测性是否重要。而在于他们能承受忽视它多久。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。