智能体评估
你的AI智能体总失败?问题可能出在“绑定“而非“大脑”
PawBench 是 AgentScope 团队推出的开源基准测试,系统性地同时评估模型和智能体绑定。结果显示,对于较小模型,绑定设计可使得分波动超过 11 分,暴露了当前 AI 智能体评判中的一个盲点。

当 AI 智能体未能完成多步骤任务时,直觉反应是指责模型。但 AgentScope 团队的新基准测试表明,真正的问题可能出在模型周围的框架上。 the-1115-problem-when-ai-writing-challenges-become-a-test-of-editorial-integrity
PawBench 今天作为 OpenJudge 生态系统的一部分发布,评估大型语言模型与编排它们的绑定如何协同工作。它在 3 个绑定上对 9 个模型运行 150 个精心挑选的任务,产生 4050 个测试单元,旨在厘清智能体失败的实际起点。
模型与绑定
大多数基准测试孤立地评估模型,给它们输入提示并评分输出。这不是现实世界智能体的部署方式。实践中,模型设定了智能体可能达到的上限,而绑定决定了这种能力是否能可靠地转化为成功的任务执行。 IBM 开源 CUGA 智能体框架:跳过基础设施搭建,直接写提示词
PawBench 将此形式化为一个函数:智能体性能 = f(模型, 绑定)。v1.0 版本包含从六个高质量智能体基准测试中提取的任务:claweval、qwenclawbench、pinchbench、qwenpawbench、skillsbench 和 wildclawbench。每个任务都根据五个维度进行标记:应用场景、原子能力、复杂度、输入模态和运行时环境。
所有任务都在完全可追溯的 Docker 沙箱中运行,这使得有可能将基准测试分数与实际执行行为联系起来。最终得分结合了自动评分器、规则检查和子断言,对于更加语义化的输出则使用 LLM 作为评委。 IFBench:测试AI指令遵循能力的新基准
绑定差距是真实且可衡量的
跨 4050 个单元的标题发现是,绑定设计可以引入显著的性能变化。两个极端说明了这一点。Claude Opus 4.6 在不同绑定之间的得分差异仅为 2.3 分。而 Qwen3.6-35B-A3B 模型仅因绑定的不同,得分波动就高达 11.5 分。
追踪分析指出了三个常见的失败根源:模型丢失当前工作目录的追踪、错误判断文件是否实际写入、或在工具列表过大时选择了错误的第一个工具。较大的模型似乎更能补偿缺失的上下文:它们推断路径、过滤大的工具列表、并检查工件是否实际生成。较小的模型则更脆弱。
结论并非小模型弱。而是它们更依赖绑定结构。设计良好的绑定可以显著缩小差距。
技能与网络搜索揭示新的失败模式
PawBench 包含两个任务类别,揭示了不同的失败动态。第一个是与技能相关的任务,模拟开发人员将项目特定技能直接存储在工作空间中的情况。在所有三个绑定中,技能任务始终比工具使用、规划或推理更困难。 MiniMax发布M2.7模型,拥有强大的软件工程和办公生产力能力
两个问题凸显出来:绑定必须清晰地展现技能, , 名称、范围、用法, , 并且模型必须可靠地决定调用它们。如果任何一方出错,模型就会绕过技能并尝试通过通用推理来解决问题,常常失败。
网络搜索任务测试模型搜索网络、获取内容并进行更深入研究的能力。PawBench 重现了默认的开发人员体验:克隆固定版本、添加 LLM 密钥并运行,而不假设每个搜索 API 密钥都已预先配置。结果显示,一些模型只是忽略了损坏的工具输出,而另一些模型则陷入尝试重新运行失败工具的循环。强大的模型可以绕过缺失的工具;较弱的模型则依赖绑定保持搜索路径稳定且明确。
更好的绑定设计的四个原则
基于基准测试结果,AgentScope 团队提出了有效绑定的四个原则。首先,要明确:模型无法对没有的信息采取行动。告诉模型它在哪里、存在哪些资源、以及期望什么输出。永远不要假设模型会推断出这些细节。
第二,保持工具充分且高效。提供重要的工具,确保关键工具默认可用,但避免用不必要的选项淹没模型。
第三,要验证,不要信任。不要仅仅依赖模型所说的。验证工件、文件、输出和执行结果,而不是仅仅依赖智能体的自我报告。
第四,构建可恢复性。如果框架提供有用的反馈和重试机会,许多失败是可恢复的。提供关键信息,如当前状态、缺失要求和现有工件,并给模型一个结构化的恢复机会。 微软新平台为科学家提供受治理的AI智能体工厂
PawBench 最重要的结果不是哪个模型排名第一。而是智能体性能不仅仅是模型本身的属性。PawBench v1.0 完全开源,团队欢迎来自社区的新绑定、模型、任务和贡献。
- 来源 : Your ai agent's failure might not be the model's fault — 2025-10-31
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。