SevenTnewS

AI研究

记忆解码器:6.9B附加记忆让410M模型击败Pythia-12B

《Memory Decoder at Scale》将LLM中的长期记忆与推理分离开来。一个6.9B预训练记忆以少39%的参数让Pythia-410M在17项基准测试中超越Pythia-12B;在每一个测试规模下,1.7B领域记忆都为Qwen3 Base增加了9个点以上的分数。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-31 · 最后更新:2026-08-02 · 阅读需 3 分钟

记忆解码器:6.9B附加记忆让410M模型击败Pythia-12B

7月30日发布在arXiv上的《Memory Decoder at Scale》论文中,最有用的数字并非基准测试得分,而是39, , 如果你不再把全部预算花在更大的基础模型上,而是将其中一部分用于预训练记忆模块,你显然不再需要的总参数百分比。

作者认为,仅解码器语言模型将长期记忆与推理折叠在同一组参数中,这使得记忆容量难以单独增长。Memory Decoder是早期工作中提出的参数化长期记忆模块,它将两者分离开来。不过,早期版本只在小规模下研究过。新论文对其进行了扩展:记忆模块最高达6.9B参数,在300B token上预训练,并挂载到从410M到14B参数的基础模型上。

搭载记忆升级的410M模型击败12B模型

旗舰结果是“巨人杀手”式的配对组合。在17项基准测试中,一个6.9B通用记忆模块挂载到Pythia-410M后,将其平均得分从29.86提升至37.34。大得多的Pythia-12B平均得分为37.24。配备记忆的410M模型以约7.3B总参数领先于Pythia-12B的12B,论文将这一差异表述为少39%的参数。

差距为0.10分,在17项基准测试的平均值上这并非微不足道,而重点落在成本方面:更小的总参数账单换来了相同或更好的分数。

同样的规律在另一个模型家族中重现。对于参数从0.6B到14B的Qwen3 Base模型,1.7B领域记忆在每一个测试规模下都将三个领域的平均得分提升了超过9个点。无论基础模型大小如何,购买记忆都比购买参数回报更高。

检索之墙

当预训练规模达到300B token后,扩展记忆就不再是纯粹的参数问题。作者写道,索引与搜索的综合成本使标准Faiss流水线在该数据规模下不可行。他们的解决方案是:用于Faiss索引与检索的分布式流水线,并结合kNN分布的稀疏、逐批次加载。

这个基础设施细节值得展开说明,因为它是该架构真正的代价。只有当检索能够跟得上记忆模块时,记忆模块才能改进模型。任何想要复现结果或在其基础上继续构建的团队,都要继承这一工程问题,而不是走下载更多参数这条简单路径。

数字一览

以下是论文所依据的核心对比:

配置平均得分(17项基准)总参数
仅Pythia-410M29.860.41B
Pythia-410M + 6.9B记忆37.34~7.3B
Pythia-12B37.2412B

约7.3B的数字来自论文自身数据的简单相加:0.41B基础模型加上6.9B记忆,这正是论文能够声称比12B少39%参数的原因。

这对扩展预算意味着什么

更广泛的论断是架构层面的:记忆与推理不应争夺同一组参数。如果一个大型记忆可以预训练一次并跨多个较小的基础模型复用,那么改进模型就变成了升级记忆的问题,而不是重建整个技术栈。Qwen3的数据支持这一解读,因为1.7B领域记忆提升了其所挂载的每一个基础模型。

未解的问题多于答案。记忆模块止步于6.9B参数,预训练规模止步于300B token,因此这种权衡在超过这些上限后是否仍然有利于记忆,尚未经过测试。这些分数是17项基准测试的平均值,可能掩盖记忆在哪些方面有帮助、在哪些方面没有帮助。此外,配备记忆的模型还带有参数数量无法体现的检索基础设施,这是一项只有在生产环境中才会显现的部署成本。

该论文于7月30日出现在arXiv上,其项目页面在HuggingFace上获得了48个赞,这是一个适度的社区信号,表明扩展领域的人们已经注意到了它。这一切都不会让基础模型扩展就此退役。它给实验室提供了第二个调节旋钮,而论文的数据表明,这个旋钮一直被低估了。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。