研究
你使用工具的AI模型正在让简单问题变得更难
KlingTeam的一篇新论文衡量了多模态模型何时真正需要工具、何时工具反而造成损害。所提出的Beacon模型通过必要性感知奖励训练,在提高准确率的同时改善了工具使用纪律。

让一个多模态模型回答它本来就能回答的问题,得体的做法就是直接作答。KlingTeam的一篇新论文指出,太多的智能体推理模型会优先调用工具。代价是可衡量的:在从未需要帮助的问题上耗费多余的算力,并且在模型本就正确的场景中引入了更多出错的机会。
该论文于2026年7月30日发布在arXiv上,题为“Beacon: Knowing When and How to Perform Agentic Visual Reasoning”,重新思考了多模态大语言模型(MLLM)在视觉推理中应如何使用工具。其核心主张是,目标是在复杂任务上取得更高的成功率,而不是构建更花哨的推理流水线。当直接回答就能解决问题时,建立一个在每一个问题上都串联工具调用的智能体,就失去了意义。
工具使用的两个维度
作者提出了用于评估智能体视觉推理的两个特性。模式自适应性(Mode Adaptiveness)衡量模型能否识别工具真正必要的场景并相应调用,从而在提升挑战性问题表现的同时避免不必要的计算开销。工具效果(Tool Effect)衡量工具使用的实际影响:工具应当在纯文本推理无法解决的问题上扩展模型的能力,同时在模型无需工具就能处理的问题上避免引入额外错误。
他们对现有智能体视觉推理模型的分析发现,这两个特性都较为欠缺。模型在模式自适应性上表现有限,工具在困难样本上带来的收益,在很大程度上被模型本已能解决的简单样本上的损害所抵消。换言之,业界那种给所有问题都强行套上工具的本能不仅浪费资源,还会主动降低最简单案例上的准确率, , 而这些案例通常构成真实流量的主体。
为什么Beacon的行为与众不同
Beacon的构建来自这两个观察,而非更大的工具箱。它的训练使用强化学习,核心包含两个机制:必要性感知自适应奖励(Necessity-Aware Adaptive Reward)和提示引导的能力扩展(Hint-Guided Capability Expansion)。前者鼓励基于任务必要性的自适应工具调用,后者则强化模型在最具挑战性问题上的工具使用能力。
这种设计既是一个模型架构问题,也是一个激励问题。如果模型只因为给出正确答案而获得奖励,它就不会内化不必要工具调用的代价,因此会继续调用。Beacon的奖励结构将克制纳入训练信号,并只在真正需要的场景中保留工具训练。
在多个不同的基准测试中,作者报告称Beacon实现了更强的整体表现,并在模式自适性和工具效果两方面都取得了显著提升,带来了真正的工具诱导性能收益,而不是仅仅改变正确答案实现方式的工具使用。
实际启示
这篇论文最有用的贡献可能在于其评估视角。任何在MLLM之上构建智能体的人,都熟悉那种充满工具调用的日志,而这些问题人类用一句话就能回答。Beacon的框架将这种烦恼转化为两个可衡量的数字,让团队能够判断自己的智能体是把工具用作杠杆还是拐杖。当工具效果数值接近于零时,工具层就只是装饰品。
这些观点并不是反对工具。有些问题仅靠纯文本推理无法解决,论文明确指出,正是在这类问题上扩展模型的能力,才是工具的用武之地。关键在于校准:最好的智能体不是能做最多的那个,而是知道哪些事情自己可以完成、哪些事情必须借助外力的那一个。
- 来源 : Your tool-using AI model is making easy questions harder — 2026-07-30
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。