KV缓存
2 published articles
人工智能5 min read
深度技术
跨层共享路由使稀疏注意力速度提升7倍,且不牺牲质量
CLSA每个序列仅执行一次路由,而非每层一次,在保持标记级选择性的同时大幅削减KV缓存开销。基准测试显示,在128K上下文下吞吐量提升17.1倍。
2026-07-26
DeepSeek4 min read
开源AI研究
百万token上下文,KV缓存仅需十分之一:DeepSeek-V4的效率赌注
DeepSeek的V4预览将一款1.6万亿参数的Pro模型与一款2840亿参数的Flash变体组合在一起,两者均支持百万token上下文。论文声称其推理FLOPs仅为V3.2的27%,KV缓存仅为其10%, , 正是这些数字让该上下文的部署变得经济可行。
2026-06-22