多智能体工程
Qoder 多智能体实验:错误率降低 60%,但代价是什么?
对阿里云Qoder Experts Mode的分析,该模式将专门的AI智能体部署为协调团队。针对现实世界用例和多智能体复杂性的权衡,对显著减少错误的说法进行了审查。

几个月来,AI 编程工具大多遵循相同的公式:提示、生成、重复。阿里云 Qoder 正在通过 Experts Mode 测试一种不同的方法,该系统将复杂任务分解为多个部分,并将每个部分交给一个专门的智能体,与其余部分并行工作,新研究将这一策略视为下一个协调战场。
多智能体编程的承诺
Experts Mode 并非让一个模型按顺序逐步完成所有步骤,而是组建一个虚拟团队。Team Lead 智能体负责拆解需求,然后将工作分配给 Frontend、Backend、QA 和 Review 智能体,每个智能体都针对其领域进行校准。该公司表示,这减少了上下文切换和冗余推理,从而产生比任何单一智能体所能达到的更准确的结果。这建立在 Qoder 此前引入的可见性优先理念之上,将其扩展到团队级协调,类似于 Claude Code 将任务路由给不同模型的方式。
衡量 60% 的改进
Qoder 在复杂任务(如全栈开发、跨语言重构和功能实现)上的内部基准测试显示,错误率降低 60%,返工任务减少 50%,成功率提高 11.6 个百分点。该公司指出,与相同任务上的单智能体基线相比,成本保持持平或下降。这些数字令人印象深刻,但它们来自阿里巴巴自己的测试套件,而非外部评估。更广泛的教训也适用于此,正如 对 HumanEval 范围狭窄的批评 所强调的那样:精心策划的测试往往偏向于被测系统,而生产环境会引入任何基准都无法完全捕捉的干扰因素。
现实场景:Experts Mode 的优势所在
Qoder 重点强调的三个用例都是经过精心挑选的。构建一个以前需要数天的用户管理模块,现在可以通过并行实现和同步编写测试在数小时内完成。跨微服务调试性能瓶颈,变成了对日志和调用链的协作追踪。研究 GraphQL 迁移的可行性,可以同时获得多个角度的输入。每个场景都涉及多个文件或服务、清晰的子问题和可衡量的结果。这些正是多智能体编排应该增加价值的任务类型,也是单智能体工具通常在上下文窗口填满时性能下降的场景。然而,从演示到日常使用的跨越并非易事。生产环境常常暴露出演示中跳过故障模式,例如智能体之间对接口的分歧,或者当一个专家智能体误解需求时产生的级联错误,这种模式被称为 智能体系统中的规划陷阱。
局限性以及单智能体选项
阿里巴巴承认,对于简单的文件编辑,
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。