SevenTnewS

开源AI研究

百万token上下文,KV缓存仅需十分之一:DeepSeek-V4的效率赌注

DeepSeek的V4预览将一款1.6万亿参数的Pro模型与一款2840亿参数的Flash变体组合在一起,两者均支持百万token上下文。论文声称其推理FLOPs仅为V3.2的27%,KV缓存仅为其10%, , 正是这些数字让该上下文的部署变得经济可行。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-06-22 · 最后更新:2026-08-02 · 阅读需 4 分钟

百万token上下文,KV缓存仅需十分之一:DeepSeek-V4的效率赌注

百万token上下文的成本从来都不在于token本身,而在于它们占用的内存。窗口中的每个token都驻留在KV缓存中,而该缓存随序列长度不断增长,这正是长上下文服务代价高昂的原因。DeepSeek的V4预览版正是直指这一成本曲线。

两款模型,百万token

DeepSeek以技术预览形式发布了V4系列,检查点(checkpoints)已上线Hugging Face。该系列包含两款混合专家(Mixture-of-Experts)模型。DeepSeek-V4-Pro拥有1.6万亿参数,每个token激活490亿参数。DeepSeek-V4-Flash是更轻量的选择:2840亿参数,每个token激活130亿。两款模型均支持百万token上下文窗口。

模型参数每token激活上下文窗口
DeepSeek-V4-Pro1.6T49B1M tokens
DeepSeek-V4-Flash284B13B1M tokens

效率数据

效率数据才是真正的头条。论文称,在百万token上下文下,DeepSeek-V4-Pro相比DeepSeek-V3.2仅需27%的单token推理FLOPs和10%的KV缓存。更少的FLOPs意味着更快的生成速度。KV缓存降至十分之一,意味着在出现任何其他瓶颈之前,相同的内存预算可以支撑约十倍数量的并发长上下文会话。正是这样的算术,让论文中“日常支持百万token上下文”的说法变得可信。

架构如何实现

三项架构改动承担了重任。首先是混合注意力设计,在压缩稀疏注意力(Compressed Sparse Attention, CSA)和重度压缩注意力(Heavily Compressed Attention, HCA)之间分配工作。稀疏注意力让你真正需要的远距离token保持可达;重度压缩路径则控制其余一切的内存占用。其次是流形约束超连接(Manifold-Constrained Hyper-Connections, mHC),这是对传统残差连接的升级。第三是Muon优化器,论文称其带来了更快的收敛速度和更高的训练稳定性。两款模型均在超过32万亿token的数据上完成预训练,随后经过一套广泛的后训练流水线,旨在解锁并扩展其能力。

Pro-Max与开放权重竞赛

DeepSeek还介绍了V4-Pro-Max,即Pro模型的最高推理强度模式。论文称其“重新定义了开放模型的最先进水平”,并在核心任务上优于前代。预览中不包含基准测试表,因此除效率数据外,这一说法背后没有任何公开数字。不妨将其视为一个有待独立结果出现后验证的声明。

这一时间点正值开放权重发布的密集期。我们对Google DeepMind Gemma 4的报道显示,这款260亿参数的MoE模型旨在对整个代码库和长达数小时的转录内容进行推理,同样展现了开放权重模型对长上下文的追逐。Gemma较小的稠密模型支持256,000 token的上下文窗口。DeepSeek则在两款V4变体上都承诺完整的百万token。这一差距对论文所点出的用例最为关键:长周期任务。此前,这类任务迫使开发者采用分块和检索流水线,这会在模型本身能力之上再增加延迟和复杂性。

仍有待验证之处

这次预览同时也是对市场是否将效率视为核心卖点的一次考验。检查点已开放,任何人都可以运行。双模型设计为DeepSeek提供了两条产品线:Pro面向重负载任务,Flash的激活参数数量则指向更低的推理服务成本。论文并未明确Flash模型的定位,因此请将其视为一种解读,而非规格说明。对于服务长上下文工作负载的开发者而言,实际问题更简单:如果27%和10%这两个数字在论文之外依然成立,那么记住百万token的成本就不再是围绕检索而非上下文来构建系统的理由。

上述一切都无法证明模型本身是否优秀。效率只是等式的一半,强大的长上下文质量从来都不只是内存问题。这次预览为批评者提供了一个明确的目标:在百万token设置下进行独立运行测试, , 这正是该架构为之而生的场景, , 并将成本数据与V3.2进行核对。在这些结果出现之前,该系列以一款人们确实可以下载的模型为支撑,有力地论证了长上下文成本的发展方向。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。