SevenTnewS

智能体编码与提示词膨胀

灾难性记忆:为什么 CLAUDE.md 文件会增长 226% 且永不缩小

一项针对 1,867 个代码仓库的 arXiv 研究发现,CLAUDE.md 等智能体编码指令文件在其生命周期内体积增至三倍,因为一旦指令背后的理由被遗忘,删除一行就可能引发性能回退。作者将其命名为“灾难性记忆”,并表明记录推理过程可将多余指令削减 99.3%。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-15 · 阅读需 4 分钟

灾难性记忆:为什么 CLAUDE.md 文件会增长 226% 且永不缩小

每个与编码智能体合作过的开发者都熟悉这种感觉。项目的指令文件, , Claude Code 环境中的 CLAUDE.md 或其同类文件, , 起初是一份整洁的规则清单。数月之后,它读起来就像一堆无人能完全解释的决策的堆积,而且没人敢修剪它,因为删错一行可能会悄悄破坏智能体的行为。

这不是人类习惯问题。这是结构性的,一篇于 2026 年 8 月 11 日发布到 arXiv 的论文为其命名。由 Kushal Chakrabarti 撰写的《Why Does CLAUDE.md Keep Growing?》将这种模式称为灾难性记忆(catastrophic remembering):它是持续学习研究多年来反复探讨的灾难性遗忘的镜像。

膨胀背后的数字

该论文追踪了 1,867 个代码仓库中的 247,694 条指令生命周期。这种模式在所有地方都成立:智能体提示词无界增长,在其生命周期内增至三倍以上,增幅达 +226%。每次提交净增加 4.9 条指令。而且指令越老,被移除的可能性越低:在对数尺度上,每次提交的删除风险下降 0.032。只有当代码仓库退役或有人从头重写时,文件才会停止增长。

指标数值
研究的代码仓库数1,867
追踪的指令生命周期数247,694
提示词生命周期内的增长+226%
每次提交净增加的指令数+4.9
每次提交的删除风险-0.032(对数尺度)
通过注释移除的多余指令99.3%
真实场景指令遵循能力的提升+23.1%

这些机制解释了数据。追加一条指令毫无成本:多一行,完事。删除一条则是另一回事。一旦指令背后的推理丢失,在不冒正确性回退风险的前提下,从包含 |D| 条指令的提示词中移除它,其成本为 O(2^|D|)。没有人愿意支付这笔账单。文件只会不断增长。

为什么删除才是代价高昂的操作

这笔账单之所以如此难以定价,原因超出了提示词本身。通义千问(Qwen)研究团队的相关工作《The Verification Horizon》认为,当今编码智能体的瓶颈已经反转:生成候选解决方案不再是难点,可靠地验证它们才是。团队能构建的每个验证器都只是人类意图的代理,而绝非意图本身。如果你无法低成本地证明删除一条指令不会改变任何东西,那么保留它, , 即使它是死重, , 看起来也是理性的。

这正是该论文的解决方案所在。作者反转了 IFEval(一个标准的指令遵循基准),以构建“可验证世界”,在这些世界中最优提示词是预先已知的。在这些受控设置中,编码了指令背后潜在推理的注释移除了 99.3% 的多余指令,将增长从 +211.3% 削减至 +1.4%。将同样的反转应用于 WildIFEval(一个噪声更大的真实世界基准)时,提示词注释将指令遵循能力提升了最多 23.1%。

注释,但用于提示词

论文以一个值得广泛传播的问题作结:“如果英语是新的代码,为什么我们还没有注释?”

重点不在于为人类编写文档。记录指令为何存在的注释,为下一个编辑者, , 无论是人还是模型, , 提供了安全删除它所需的信息。正是这种推理过程让删除重新变得廉价,因为成本问题只有在推理过程消失后才会出现。附带理由的提示词是可以缩小的提示词。一旦失去理由,每条指令都会变成无人能审计的永久承诺。实际的启示几乎平淡无奇:把指令文件当作代码来对待,像审查任何一次提交那样审查新增内容,并要求每条规则都附带其存在的理由。

该论文是一份预印本,其受控实验并不能证明注释能驯服每一个生产环境中的 CLAUDE.md。但底层发现很难反驳:一个只增不减、没有任何内容可以被安全移除的文件,正走在通往膨胀的单行道上。为这种失败命名是第一步,而这个名称会流传开来,因为任何目睹过指令文件体积增至三倍的人,都确切知道灾难性记忆是什么感觉。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。