AI 研究
更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复
一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。

一段时间以来,让推理模型变得更聪明的标准做法是让它思考更久:投入更多的推理时计算,生成更长的思维链,准确率理应随之提升。ThinkRetrieve 是一篇于 2026 年 8 月 11 日发布在 arXiv 上的预印本论文,它恰恰基于相反的观察。论文认为,近期研究表明,顺序式的测试时扩展往往带来收益递减甚至负收益,因为更长的推理轨迹会累积不确定性,放大自身的错误,并偏离最初的问题。
顺序式扩展为何走到尽头
这种失效模式很容易被忽视,因为 token 仍在不断生成。模型写啊写,但推理轨迹已不再追踪问题。早期累积的错误随着链条增长被不断放大,推理逐渐偏离方向,计算账单持续攀升,而准确率却趋于平稳甚至下降。ThinkRetrieve 的回应是:不再把推理轨迹当作一段封闭的独白。
该框架将推理模型与外部已解决问题语料库相结合,每个问题都配有逐步解答。在每一个中间步骤,它从该语料库中检索最相关的示例,并将其直接注入思维轨迹。在思考过程中,模型被展示已经完成的解题步骤,以说明应当如何推理。传统检索用事实支撑答案;ThinkRetrieve 则直接引导推理过程本身。
预印本论文报告了什么
实验覆盖了 1.5B 到 8B 参数规模的五个推理模型,在 GSM-8K、MATH-500、AIME 2025 和 SciQ 上进行了测试。在所有四个测试集上,ThinkRetrieve 相比标准测试时扩展都提升了准确率,而最大的相对提升出现在 AIME 2025 上,达到 60%。
| 预印本论文一览 | |
|---|---|
| 提交时间 | arXiv,2026 年 8 月 11 日 |
| 测试模型 | 五个推理模型,1.5B 至 8B 参数 |
| 基准测试 | GSM-8K、MATH-500、AIME 2025、SciQ |
| 基线 | 标准测试时扩展 |
| 核心结果 | AIME 2025 上最高 60% 的相对提升 |
摘要并未说明各基准的具体数字、检索步骤的计算成本,以及示例语料库的来源。60% 这个数字也是作为上限报告的,即最佳提升,而非平均值。这些细节很重要,它们收录在论文全文中,而非摘要里。
同属一个更智能推理之夏
ThinkRetrieve 出现在 2026 年一段拥挤的预印本发布期,这些论文各自从不同角度质疑同一个假设。7 月 28 日提交的 Penelope 将大部分推理计算隐藏在可见 token 之外:它先对较低的解码器前缀评估一次,构建一个以问题为条件的边界记忆,然后通过局部循环对其进行精炼。7 月 22 日的 PoTRE 将推理拆分到四个智能体, , 对抗式精炼智能体、层次化规划智能体、频谱搜索智能体和直接链智能体, , 并用一个任务自适应聚合层来协调它们的输出。同日的另一篇预印本论文将量化后的小型推理模型包裹在一个形如 CUSUM 的统计监控器中,监控推理轨迹是否退化,并在警报触发时将生成回滚到计算出的回退点。
这些论文的机制各不相同,但诊断一致:推理时计算正在无监督的情况下被消耗,解决办法是更智能地分配,而不是投入更大的量。甚至连奖励设计也在被重新审视。在 6 月 24 日的一篇论文中,Qwen 团队认为,对编码智能体而言,验证, , 而非候选生成, , 如今才是更难的问题,因为每个验证器都只是人类意图的代理。
未解之问
ThinkRetrieve 是一篇预印本论文,需要以通常的审慎态度看待。实验运行在 1.5B 到 8B 参数之间的模型上;摘要中没有任何内容承诺在前沿规模上会有同样的表现。而且该框架只在已经存在一个高质量、附带逐步解答的已解决问题语料库时才有效。竞赛数学有这样的语料库。大多数现实世界任务没有,而注入的指导质量也继承了语料库的质量。
对于 60% 这个数字,请抱持对预印本应有的保留态度。方向才是重点。“想得越多就一定越好”这一假设正在被多个方向同时检验,而 ThinkRetrieve 的答案是:模型不必独自推理。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。