SevenTnewS

AI 研究

Penelope 将其推理隐藏在一个解码器层中,以降低推理成本

Penelope 是一个用于仅解码器 Transformer 的潜在推理框架,它将循环计算局部化到一个狭窄的解码器区间内,在不显著影响准确性的情况下降低推理延迟。该论文描述了一个将推理从可见 token 转移到内部 GRU 循环的课程。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-04 · 阅读需 3 分钟

Penelope 将其推理隐藏在一个解码器层中,以降低推理成本

大型语言模型处理一个新想法的方式与处理任何其他想法相同:通过逐个生成 token。这对于简单查找有效,但复杂的推理通常迫使模型写出完整的思维链,这会使成本成倍增加。问题需要的推理越多,模型生成的 token 就越多,而每个 token 都需要时间和金钱成本。

Penelope 是一个在 7 月 28 日提交到 arXiv 的论文中描述的框架,它采取了不同的路线。该框架不是将推理步骤作为文本输出,而是将它们压缩到单个解码器层内的循环中。解码器的较低层仅处理一次输入以构建上下文表示。然后在解码器的一个选定区间内,该表示被推送到一个门控循环单元中,其状态会经过多次迭代演变。解码器的其余部分保持静止。模型仅在循环结束后读出答案。

这一技巧使额外的计算对用户不可见:没有长的可见痕迹,也没有对每个推理步骤的自回归惩罚。作者称之为局部潜在循环。

从思维链到隐藏优化

当前的推理模型通常依赖于思维链提示,将每个中间步骤写入输出。新一代的测试时计算研究(包括本文)旨在将这种推理推入模型的内部表示。另一篇最近的预印本 PoTRE 将推理分解为四个代理,每个代理处理不同的策略,然后合并它们。CUSUM 形状的监控关注死胡同并触发回滚。Penelope 将额外的工作聚焦在解码器的一个狭窄频带上,保持整体模型架构不变。

为了教会模型内部推理,该论文描述了一个从思维链开始并逐渐将推理转移到潜在循环中的课程。经过训练,模型学会减少对可见 token 的依赖,而更多地依赖迭代的 GRU 更新。作者还引入了时间调制动态,让循环状态随着循环运行而适应,而不是每一步都应用相同的变换。

数据结果

该论文报告了在开源结构化推理基准上的结果。在验证选择的潜在预算下,Penelope 与已建立的潜在推理模型的准确性相当,同时提供了更低的测量推理延迟。作者并未声称达到最先进的分数。其贡献是一种实用的准确性与效率权衡:通过避免重复的全解码器传递或长的可见痕迹来降低延迟,使得该架构对于大规模运行结构化推理的团队更易于部署。

一个未解决的问题是该方法如何扩展到需要数百个推理步骤的任务。局部循环有一个固定的迭代预算,作者在验证时选择该预算。更难的问题可能需要比架构在重新考虑预算前所能分配的更多迭代。另一个未知数是潜在表示是否仍然可解释,这是一个对调试和安全性重要的问题。

工具箱中的实用补充

Penelope 并不试图取代大型模型。它使小型或中型模型在它们已经处理得不错的推理任务上更高效。这篇论文是对额外计算放在哪里以及如何训练模型使用它的精心工程。这类工作往往比增加另一个参数更有用。

这篇论文少有炒作,注重机制。对于大规模运行结构化推理的团队,该方法可以在不重新设计栈的情况下削减推理成本。它能推广到多远将取决于下一轮实验,但方向很难反驳:更多地推理,更少地生成。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。