SevenTnewSAI 与科技新闻,深度解读

AI 研究:关于 agent 技能的新 arXiv 预印本

COBRA-Skills 在 50 个样本上将 agent 技能调优成本降低 55-58%

COBRA-Skills 将上下文老虎机优先级排序与技能演化相结合,相对于 SkillOpt 把 agent 技能优化成本降低 55-58%,每个基准仅使用 50 个独特样本。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-19 · 阅读需 4 分钟

COBRA-Skills 在 50 个样本上将 agent 技能调优成本降低 55-58%

教语言模型 agent 一项可复用的技能,意味着从它已经运行过的任务中提炼出一套流程,这样它就不必对同一个问题推理两次。难的地方在于提炼本身。大多数现有方法通过执行候选技能来给它们打分,一个任务接一个任务地跑,而成本正是在执行环节堆积起来的。一个方法想要测试的候选技能越多,它烧掉的任务数据和算力就越多。

COBRA-Skills,在一份于 2026 年 9 月 10 日提交的 arXiv 预印本中描述,把这一过程重新表述为在一个随着 agent 学习而不断变化的候选空间上进行的、有预算约束的序贯问题。该框架结合了摘要所称的两种机制:上下文老虎机引导的优先级排序,与有证据支撑的技能演化。前者决定哪些候选技能能在评估队列中获得一个位置。后者根据实际执行过的运行所给出的反馈,来改进存留下来的种群。

决定测试什么的老虎机算法

上下文老虎机是一种标准工具,用于在反馈随每一次决策逐个到达、而目标是把有限预算花好的情况下,在多个选项之间做选择。用在技能候选上,它让该方法把评估导向被标记为有前景或信息量大的选项,而不是给池子里的每个候选打分。由于候选空间不断演化,排名会随着种群的改进而重新初始化,而不是在开始时固定不变。

这一设计是该论文对成本问题的回答。基于执行的评估依然保留,因为一项技能只有真正跑过才值得信任。杠杆在于削减该方法所需的执行次数。

六个基准与三个模型显示了什么

作者报告了两项主要结果。在六个异构 agent 基准和三个目标模型上,COBRA-Skills 在与之比较的方法中取得了最强的平均表现。在成本方面,相对于一种名为 SkillOpt 的方法,它把优化开销降低了 55% 到 58%,而每个基准只使用了 50 个独特的优化样本。

指标报告数值
平均表现在所比较的方法中最强
相对于 SkillOpt 的优化成本低 55-58%
每个基准的独特优化样本数50
评估的 agent 基准数6
目标模型3

与这些数字一同出现的还有两项次要发现。当 agent 运行框架(harness)发生变化时,该方法依然稳健;而当目标模型被用来自行生成和改进技能时,它也能有效发挥作用。后一项结果意味着,该设置不需要一个单独的、更强的模型来坐在改进循环里。

摘要省略了什么

摘要不是结果章节,持怀疑态度的读者想要看到的几样东西都缺失了。文中没有逐基准的分解,也没有列出三个目标模型的名字。摘要也没有给出绝对成本数字,只给出了相对于 SkillOpt 的相对降幅。“在所比较的方法中取得最强平均表现”这一说法,受限于作者挑选了哪些方法,而除 SkillOpt 之外,摘要并未说明那些方法是什么。

这篇论文以预印本而非同行评审出版物的形式出现,因此没有独立团队复现过这些数字。这一缺口在这里比通常更重要,因为成本降幅是以区间形式、相对于单一具名基线给出的,而性能声明是相对的,而非绝对的。

效率数字是这篇论文之外也具备影响力的部分。技能优化的代价一直高到让跨任务复用同一套技能往往成为实际选择。一种能把这一代价削减一半以上、并且只要求 50 个样本而非庞大任务语料的方法,会改变这种权衡的样子。

就目前而言,诚实的解读仍应保持克制。COBRA-Skills 提出了一种更便宜的搜索 agent 技能的方式:让老虎机算法决定测试什么。效率数字来自作者本人,在该团队之外有人运行同样的比较之前,它们仍然是作者自己的数字。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。