SevenTnewS

人工智能

为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题

麻省理工学院研究人员提出OS-Pruner,这是一个插件,能在后续计算不值得令牌成本时动态停止思维链推理。测试显示,在最小化准确率牺牲的情况下,长度减少20-60%。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-29 · 阅读需 4 分钟

为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题
来源 : OS-Pruner: Prun…

每当一个大型语言模型解决数学问题或编写代码时,它都会生成一条思维链, , 一条可延伸至数千个令牌的推理步骤轨迹。但并非所有这些令牌都服务于最终答案。模型通常会过度思考:重述结论、验证已解决的问题、或追寻死胡同。代价是真实的:更高的延迟、更高的推理账单,而且反常的是,有时准确率更低。

过度思考作为计算税

这种现象有据可查。DeepSeek-R1通过长推理轨迹来扩展测试时计算,常常在正确解决方案已被解码后继续生成。相同的行为出现在GPT-OSS-20B和蒸馏模型如DeepSeek-R1-Distill-Qwen-7B中。O1-Pruner和DRPO的研究显示,高达60%的生成令牌可能是冗余的。

早期尝试削减这种浪费分为三类。模型端方法如O1-Pruner和DRPO重新训练基座模型以生成更短的轨迹,有效但昂贵,且可能损害在分布外任务上的性能。预算控制方法如s1的budget-forcing从外部强加固定令牌限制,忽略了一些问题确实需要更多推理。基于训练的早期退出分类器, , HALT-CoT、Answer Convergence、FlashThink, , 将停止视为置信度上的阈值,忽略了决策的顺序本质。

OS-Pruner重新定义问题

OS-Pruner背后的麻省理工学院团队认为标准公式是错误的。他们从论文中指出:“我们认为CoT剪枝更自然地是一个顺序决策问题。”他们的关键见解是,在每个推理步骤之后,系统面临两个动作的选择:立即停止并生成最终答案,或继续推理并支付更多令牌以期改进。这是一个最优停止问题,而非分类问题。

该框架学习一个轻量级策略头, , 仅一个线性层加上最后两个变换器层的微调, , 将每个推理前缀映射到停止的概率。奖励函数明确地在准确率和长度之间权衡:“r(y≤i|x) = A(y≤i|x) - λL(y≤i)”。单一标量λ控制剪枝的激进程度,使用户可以在准确率-效率前沿上调整所需操作点。

为什么分类方法有缺陷

论文提供了理论和实证原因。作者证明了定理1:基于阈值的分类可能比最优停止损失任意大的价值。直觉是,两个具有相同估计正确性的部分推理链可能具有非常不同的续值, , 一个可能即将取得突破,另一个则陷入循环。分类器同等对待它们;最优停止看到差异。

在DeepSeek-R1-Distill-Qwen-7B、GPT-OSS-20B和DRPO-7B(后者已通过模型端压缩为简洁性进行了优化)的基准测试中,OS-Pruner在准确率效率评分(AES)上持续优于基线方法。在过度思考最猖獗的简单问题上增益最大:在GSM8K上长度减少59.3%,在MATH-500上减少52.8%,准确率变化分别为-0.7%和+2.7%。

训练效率作为设计原则

由于基座模型被冻结,OS-Pruner可以通过在每个段落边界终止推理并检查答案是否正确来预计算奖励。训练期间无需昂贵的在策略滚动。在推理过程中,策略头并行处理每个前缀,仅在段落边界调用, , 这一设计选择与vLLM等现代服务框架一致。

渐进式训练计划解决了一个实际挑战:对于低λ值,朴素训练会陷入一个平凡局部最小值,策略永不停止。从高λ开始并定期退火,会产生清晰的准确率-长度权衡帕累托前沿。

部署的影响

OS-Pruner的插件性质意味着它可以附加到任何冻结的推理模型上,即使是已经压缩过的。作者在DRPO-7B(一个显式训练为长度效率的模型)上进行了测试,仍记录了平均20%的AES改进,其中在AIME上为17%。

对于运行高吞吐量推理管线的从业者来说,令牌节省并非微不足道。在几乎相同准确率下生成令牌减少50%,将基础设施成本和延迟减半。λ参数提供了一个可校准的杠杆:对于延迟敏感应用设置高值,对于高精度要求设置低值。

局限性与开放问题

当前工作聚焦于数学推理基准。作者承认,扩展到编程、科学推理和超过20亿参数的边界模型仍是未来工作。消融研究还揭示了一个关键限制:指令遵循能力差的模型可能在强制停止后继续在“回答”部分推理,从而破坏剪枝。GPT-OSS-20B很好地处理了这一点;DeepSeek-R1-Distill-Qwen-7B则不行。

尽管如此,OS-Pruner有力地证明了其论文标题“通过最优停止剪枝推理模型的思维链”不仅是一项方法论贡献。这是在一个每个令牌都算数的时代中的实用工具。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。