SevenTnewS

测试时扩展

4 published articles

人工智能5 min read

测试时扩展

CoBa路由以58.9%更少的token追平best-of-16投票

CoBa,一篇新arXiv论文中提出的计算平衡路由策略,在0.01个百分点内追平best-of-16多数投票,同时将参数加权token削减58.9%。在跨MATH-500、AIME和AMC的3,129次评估中,它还完全胜过单样本解码,不过在预算不受限时,best-of-16仍保持微弱优势。

2026-08-19

实验室与研究4 min read

AI 研究

更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复

一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。

2026-08-18

工具与框架3 min read

AI研究

工具链进化看起来令人印象深刻,直到你在未见过任务上测试它

自动工具链进化本应让LLM智能体变得更好,但一篇新论文认为,许多报道的收益可能来自对公开测试集的过拟合。在实验中,简单的测试时扩展方法匹配或优于进化,而进化后的工具链在未见过的任务上表现有限。

2026-07-27

人工智能Featured5 min read

人工智能

MiniMax M3 与打造防作弊推理模型的艺术

MiniMax 详解了 M3 推理能力背后的工程细节:一种深度防御验证器,成功避免了 M2 周期中的奖励破解失败模式;以及 MaxProof,一种群体级测试时扩展框架,将采样转化为引导式搜索。在 IMO 2025 和 USAMO 2026 上,使用 MaxProof 的 M3 超过了人类金牌得主阈值。

2026-07-16