LLM智能体
回归税:为什么给LLM智能体添加技能可能适得其反
一项新研究表明,给LLM智能体添加程序性技能并不总是有帮助,它可能引入回归现象, , 那些之前无需技能就能解决的任务在添加技能后反而失败。研究确定了三个原因,并认为可靠性更依赖于基础定位和验证,而非技能本身。

每个LLM智能体开发者都熟悉这个流程:智能体在某个任务上失败,于是你添加一个技能、一个短脚本、一个验证规则、一个编码为提示的标准操作流程。平均分数上升。问题解决了,对吧?
一篇新论文表明答案更为复杂。2026年7月24日提交至arXiv的《The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents》一文,在近6000次运行中比较了有技能和无技能的智能体,使用了两个办公自动化基准和三个模型测试套件。主要发现是,技能同样会导致失败, , 以往无需技能就能良好处理的任务,当技能出现在上下文中时会突然失败。
作者将这些失败称为“回归”,并认为大多数论文报告的净改进隐藏了一个更深层的真相:表现最佳的技能之所以优于其他技能,主要是因为回归更少,而非收益更多。
什么是回归税?
论文将任务结果分为四类:有技能和无技能均解决、有技能解决但无技能未解决(收益)、有技能失败但无技能解决(回归)、以及两者均失败(残留失败)。大多数评估将收益和回归合并为一个净改进数字,作者认为这掩盖了添加技能的成本。
当他们检视实际导致回归的原因时,识别出三种机制。
三种回归模式
技能描述渗透。一个技能仅仅通过存在于上下文中就会改变智能体的行为,即使它从未被调用。智能体读到一个关于格式化输出的技能,就开始也重新格式化输入;或者读到一个关于错误处理的技能,就变得更加谨慎,从而破坏了先前正常的工作流。
基础定位偏移。技能规定的程序覆盖了智能体解释输入的方式。智能体不再查看实际屏幕,而是遵循技能提供的、与当前状态不匹配的检查清单。智能体停止看到真正存在的东西,开始看到技能告诉它看到的东西。
验证偏移。技能提供的程序抑制了智能体本应对其输出执行的自检。一个原本会双重检查文件路径的智能体停止了双重检查,因为技能说“运行此命令”,而智能体更信任技能而非自己的验证习惯。
收益来自别处
论文并非主张技能无用。收益确实存在,但集中在特定情况。更值得关注的模式来自持续的失败, , 那些无论有无技能都会失败的任务。当作者分析这些失败追踪时,他们发现现有技能过度强调程序性指导,而程序性指导恰恰是最不常导致失败的环节。真正的瓶颈是基础定位(理解当前状态)和验证(检查输出是否正确)。目前技能对两者的支持都不足。
在纠正评估伪影并研究追踪后,作者报告称,许多回归和持续失败可以通过更好的基础定位和验证来恢复,而不是通过更好的程序性技能。
更广泛转变的一部分
该论文加入了一日益增长的研究阵营,重新思考如何评估和构建智能体技能。2026年6月一项比较GUI和CLI智能体的研究发现,当两者获得相同的目标和验证器时,GUI智能体优于依赖技能的CLI智能体,表明技能接口本身引入了脆弱性。另一篇论文SkillCoach(2026年7月)提出了过程评分标准,以评估超越最终准确率的技能使用,分离了技能选择、遵循、组合和反思等维度,这与回归论文中的维度相呼应。而EvoPolicyGym(也是2026年7月)则对智能体迭代改进策略进行了基准测试,其中GPT-5.5在套件中排名第一,暗示技能的迭代优化可能最终减少回归税。
这并不意味着智能体应该停止使用技能。而是意味着那种幼稚的方法, , 把一个技能扔进上下文,然后看着平均数字上升, , 已经不够好了。下一代智能体框架将需要衡量回归,而不仅仅是净改进,并投资于基础定位和验证基础设施,而不是简单堆叠更多程序性规则。
正如论文所言,可靠性更依赖于基础定位和验证,而非程序性技能选择。这对技能优先范式是一个艰难教训,但证据现在要求如此。
- 来源 : The regression tax: why loading LLM agents with skills can backfire — 2026-07-24
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。