DeepSeek-V4.1-Flash落地寒武纪vLLM技术栈
一个552B模型、四分之一的HBM,以及寒武纪的首日移植
DeepSeek-V4.1-Flash首日即通过vLLM登陆寒武纪加速器。这次移植与其说说明了模型本身,不如说反映了中国芯片厂商如今跟进公共推理框架的速度。

DeepSeek发布了DeepSeek-V4.1-Flash的检查点,寒武纪表示该模型当天即在其加速器上运行。集成目标是vLLM, , 运营方已标准化采用的这一开源推理技术栈,而非其私有分支。
这类新闻总是以模型新闻的面目出现。真正值得检验的说法更为具体:一家芯片厂商在发布首日就交付了一条可用的服务路径,并且对各个环节的描述足够详细,可以依据工程细节、而非发布话术来评判。
寒武纪为DeepSeek-V4.1-Flash究竟交付了什么
交付物是一个融合算子库、一组手写内核以及一份服务配置。寒武纪工程师使用Torch-MLU-Ops来加速公司命名为Engram和Compressor的结构,并为稀疏与压缩注意力编写了优化后的BangC内核。在vLLM内部,寒武纪称其路径支持张量、流水线、序列、数据与专家五个维度的混合并行,通信与计算相互重叠,此外还支持低精度量化与预填充-解码分离。整个技术栈构建于NeuWare之上, , 这是寒武纪长期以来的软件平台。
这涵盖了决定集群能否保持忙碌的服务栈的各个环节,却没有给出任何数字。公告中没有吞吐量数据、没有延迟数据,也没有与其他加速器的对比,因此首日可用性只是一种排期上的声明,而非性能上的声明。
几天前,寒武纪以白金会员身份加入了PyTorch基金会,这使其与其他硬件及云厂商贡献者一同进入董事会。结合这次首日移植来看,这一连串动作指向的是上游投入,而非一次性的补丁。
首日移植背后的内存算术
DeepSeek-V4.1-Flash是DeepSeek较新架构家族中体量最小的成员。它是一个拥有5520亿参数的混合专家模型,输入端激活约80亿参数,输出端激活约160亿参数,并原生支持视觉。其架构布局为因果编码器-解码器(Causal-Encoder-Decoder)。
压缩才是加速器厂商所关心的。DeepSeek称,KV缓存压缩将HBM需求降至上一代的大约四分之一,SSD需求降至大约八分之一,缓存规模据称比第一代设计小数百倍。
| 指标 | DeepSeek-V4.1-Flash对比上一代 |
|---|---|
| HBM需求 | 大约四分之一 |
| SSD需求 | 大约八分之一 |
| KV缓存规模 | 据称比第一代设计小数百倍 |
在密集服务节点上,KV缓存决定了内存中能容纳多少并发序列,而这些节点本已让HBM预算吃紧。节省四分之三,要么意味着每张卡能服务更多用户,要么意味着每次部署可用更少的卡,这也是更小的缓存首先表现为芯片厂商热情高涨的原因。这些是DeepSeek给出的数字,是针对模型本身的陈述,而非在寒武纪硬件上测得的结果,且目前尚无独立的验证公布。
五条模型线,一套配方
寒武纪列出对五条中国模型线提供首日或生产级推理支持:智谱AI的GLM、DeepSeek、阿里巴巴的Qwen、月之暗面的Kimi以及MiniMax。
这一措辞所宣告的内容比表面上要少。“首日或生产级”既涵盖发布首日就绪,也涵盖对数月前已发布的模型追加的支持,而这份清单并未将两者区分开来。
| 模型线 | 开发者 | 寒武纪所述状态 |
|---|---|---|
| GLM | 智谱AI | 首日或生产级推理支持 |
| DeepSeek | DeepSeek | 首日或生产级推理支持 |
| Qwen | 阿里巴巴 | 首日或生产级推理支持 |
| Kimi | 月之暗面 | 首日或生产级推理支持 |
| MiniMax | MiniMax | 首日或生产级推理支持 |
对集群运营方而言,这一区分正是该声明的全部价值所在。发布首日移植意味着检查点一经发布就有据可查的配方。事后适配则意味着要等厂商事后追赶。
闭源分支与公共框架之争
财新全球(Caixin Global)将这一当日启用视为一个标志,表明国内从模型到芯片的软件闭环正在缩短, , 从长达数月的私有移植,转向在运营方已经运行的公共框架上实现发布首日就绪。这里衡量的短板是软件短板,而非芯片短板。能够跟进上游vLLM版本的厂商,其支持负担要低于为所服务的每个模型都维护一套闭源分支的厂商。
这份公告悬而未决的问题是:这一模式能否规模化。DeepSeek-V4.1-Flash是其家族中体量最小的成员,而寒武纪自己的表述也指向了下一次考验:更大的DeepSeek变体以及多模态服务组合。一天之内移植小模型是个好迹象,但尚不能证明同一支团队能按同样的时间表消化一个更大的检查点,或是一项同时服务视觉与文本的工作负载。
“首日”已成为多家厂商都能宣称的事。而随着检查点越来越大仍能持续做到的那一家,才是值得关注的。
- 来源 : A 552B model, a quarter of the HBM, and a day-one Cambricon port — 2026-09-11
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。