SevenTnewS

测试时扩展

CoBa路由以58.9%更少的token追平best-of-16投票

CoBa,一篇新arXiv论文中提出的计算平衡路由策略,在0.01个百分点内追平best-of-16多数投票,同时将参数加权token削减58.9%。在跨MATH-500、AIME和AMC的3,129次评估中,它还完全胜过单样本解码,不过在预算不受限时,best-of-16仍保持微弱优势。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-19 · 阅读需 5 分钟

CoBa路由以58.9%更少的token追平best-of-16投票

测试时扩展有一个默认形态:花费更多推理算力,并相信答案会随之改善。采样更多解决方案、延长推理轨迹,或引入更强的评估器。一篇于2026年8月7日提交至arXiv的论文认为,这三种手段彼此竞争,而关键问题不在于系统花费多少算力,而在于它如何决定下一单位算力用在哪里。论文提出的答案是CoBa, , 一种计算平衡的路由策略,其核心结果直截了当:以约一半的token成本实现同等准确率。

这篇题为“CoBa:通过计算平衡路由实现经济高效的测试时扩展”的论文,将测试时推理重新定义为算力分配问题。每一步,系统都必须在生成、验证或停止之间做出选择。现有策略往往只押注单一轴,将算力集中投入某一阶段。CoBa则从一个相反的观察出发:在固定预算下,某一条轴上的花费会挤占其他轴。

为什么单一轴扩展正在碰壁

CoBa并不是近期唯一质疑“花得更多”逻辑的研究。2026年8月11日提交的姊妹论文ThinkRetrieve报告,顺序式测试时扩展往往带来递减甚至负收益,因为更长的推理轨迹会积累不确定性、叠加错误,并偏离原始问题。同一时期,《验证地平线》一文认为,对于编程智能体而言,“验证比生成更容易”的旧假设已经反转:可靠地检查一个候选答案现在成了更难的问题,而每个验证器都只是人类意图的代理。

两篇论文都指向CoBa的前提:更智能的分配带来的收益可能超过更多算力带来的收益。2026年7月的框架PoTRE以与大规模同质基线相似或更少的推理token实现了更好的推理性能。2026年7月28日提交的Penelope将循环计算局部化,以避免冗长的可见推理轨迹。同样的转变也出现在推理侧:DSpark等研究将加速视为调度与资源分配问题,而非纯粹模型优化。整个领域正趋向于用分配取代蛮力。

CoBa如何路由算力

CoBa分两层工作。它首先生成一小批候选答案,对所有候选广泛进行廉价验证,然后将不确定或高价值的候选路由到更强的验证。弱验证器以低成本过滤明显失败;强验证只用在可能改变结果的地方。

该系统在3,129次示例生成器评估上进行了评测,覆盖MATH-500、AIME 2024和2025、AMC 2023以及程序化符号推理。这些基准涵盖竞赛数学和结构化符号任务, , 测试时扩展相关主张通常在此类领域接受检验。

关键效率数字

CoBa-Routed-Strong达到85.13%的宏平均准确率,在统计上与自评估加权投票代理的85.20%持平,同时使用的参数加权token减少49.1%。与蛮力方法相比,结果更为显著:它在0.01个百分点内追平best-of-16多数投票,同时使用的参数加权token减少58.9%,尽管配对检验显示best-of-16在成本大幅更高的情况下仍保持微弱优势。

参数加权token按生成每个token的模型大小来计算其工作量,因此这一比较同时涵盖输出长度和模型规模。这笔账值得一算:token减少58.9%意味着CoBa的运行成本约为best-of-16的41%,即便宜约2.4倍。自评估代理消耗的预算几乎是CoBa的两倍。

配对bootstrap检验证实了相对单样本解码的显著提升。CoBa不只是省token同时保持质量;它击败了最便宜的基线,并追平了昂贵的基线。

CoBa-Routed-Strong与数学和符号推理基线的对比
方法宏平均准确率相对CoBa的成本
CoBa-Routed-Strong85.13%基线
自评估加权投票代理85.20%约为CoBa token的2倍
Best-of-16多数投票与CoBa相差0.01个百分点约为CoBa token的2.4倍
单样本解码显著更低(配对检验)最低
池预言机更高;未达到上界

CoBa仍有哪些不足

论文对局限性直言不讳。在配对检验中,best-of-16仍保持微弱但显著的领先:当每个准确率点都很重要且预算充足时,蛮力投票仍会略胜一筹。而始终从候选池中选出最佳答案的池预言机仍然遥不可及。与预言机的差距被描述为更精准路由的改进空间,换句话说,廉价验证层仍会误分类那些更强验证本可捕捉的候选。

结果还依赖于特定的基准族。竞赛数学和符号推理奖励可验证、边界明确的答案。同样的路由经济学是否适用于开放式的智能体任务或创造性任务,本文并未证明。

对本地和预算受限系统的意义

论文最后落脚于对端侧和成本受限部署最重要的启示:对本地推理系统而言,测试时扩展变成了“下一单位计算用在哪里最有价值”的问题。当每个token都有价格时,选择路由而非采样的策略并非为了方便,而是决定一项技术是适配预算还是无法适配预算的关键。

这一框架也暴露了CoBa所依赖的假设:廉价验证能捕捉大多数失败。《验证地平线》一文的警告同样适用。路由策略降低了验证成本,但并不能改变“验证器只是代理”这一事实。效率提升是真实的,但认知风险并不会消失。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。