DeepSeek-V4.1-Flash débarque sur la pile vLLM de Cambricon
Un modèle de 552 milliards de paramètres, un quart de la HBM, et un portage Cambricon dès le premier jour
DeepSeek-V4.1-Flash a atteint les accélérateurs de Cambricon dès le premier jour via vLLM. Ce portage en dit moins sur le modèle que sur la vitesse à laquelle les fabricants chinois de puces peuvent désormais suivre un framework d'inférence public.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-09-22 · 4 min de lecture

DeepSeek a publié le checkpoint de DeepSeek-V4.1-Flash, et Cambricon affirme que le modèle a tourné sur ses accélérateurs le jour même. La cible d'intégration était vLLM, la pile d'inférence open source sur laquelle les opérateurs sont déjà standardisés, plutôt qu'un fork privé de celle-ci.
Ce genre d'actualité arrive déguisée en actualité de modèle. L'affirmation qui mérite d'être testée est plus étroite : un fabricant de puces a livré un chemin de service fonctionnel le jour du lancement et a décrit les pièces avec assez de détail pour être jugé sur l'ingénierie plutôt que sur le langage d'annonce.
Ce que Cambricon a réellement livré pour DeepSeek-V4.1-Flash
La livraison consiste en une bibliothèque d'opérateurs fusionnés, un ensemble de kernels écrits à la main et une configuration de service. Les ingénieurs de Cambricon ont utilisé Torch-MLU-Ops pour accélérer des structures que l'entreprise nomme Engram et Compressor, et ont écrit des kernels BangC optimisés pour l'attention sparse et compressée. Au sein de vLLM, Cambricon affirme que son chemin prend en charge un parallélisme mixte à cinq dimensions sur les dimensions tensor, pipeline, sequence, data et expert, avec la communication recouvrée sur le calcul, plus une quantification en basse précision et une désagrégation prefill-decode. L'ensemble de la pile repose sur NeuWare, la plateforme logicielle de longue date de Cambricon.
Cela couvre les parties d'une pile de service qui déterminent si un cluster reste occupé. Mais aucun chiffre n'est inclus. L'annonce ne comporte ni chiffre de débit, ni chiffre de latence, ni comparaison avec un autre accélérateur ; la disponibilité le jour même est donc une affirmation de planification plutôt qu'une affirmation de performance.
Cambricon a rejoint la PyTorch Foundation en tant que membre Platinum quelques jours plus tôt, ce qui le place au conseil d'administration aux côtés d'autres contributeurs matériels et cloud. Lu conjointement avec le portage Day-0, la séquence indique un investissement en amont plutôt qu'un correctif ponctuel.
Les calculs mémoire derrière le portage le jour même
DeepSeek-V4.1-Flash est le plus petit membre de la nouvelle famille d'architectures de DeepSeek. C'est un modèle mixture-of-experts de 552 milliards de paramètres qui active environ 8 milliards de paramètres côté entrée et 16 milliards côté sortie, et qui traite la vision nativement. La disposition est un Causal-Encoder-Decoder.
La compression est ce qui intéresse les fabricants d'accélérateurs. DeepSeek affirme que la compression du cache KV ramène la demande de HBM à environ un quart et la demande de SSD à environ un huitième de la génération précédente, la taille du cache étant décrite comme des centaines de fois plus petite que la conception de première génération.
| Métrique | DeepSeek-V4.1-Flash vs génération précédente |
|---|---|
| Demande de HBM | environ un quart |
| Demande de SSD | environ un huitième |
| Taille du cache KV | décrite comme des centaines de fois plus petite que la conception de première génération |
Sur un nœud de service dense, le cache KV plafonne le nombre de séquences simultanées qui tiennent en mémoire, et ces nœuds sollicitent déjà fortement les budgets HBM. En économiser les trois quarts signifie soit plus d'utilisateurs par carte, soit moins de cartes par déploiement, ce qui explique pourquoi un cache plus petit se manifeste d'abord par de l'enthousiasme chez les fabricants de puces. Ce sont les chiffres de DeepSeek, énoncés pour le modèle plutôt que mesurés sur du matériel Cambricon, et aucune vérification indépendante n'a été publiée.
Cinq lignes de modèles, une seule recette
Cambricon liste un support d'inférence Day-0 ou en production sur cinq lignes de modèles chinoises : GLM de Zhipu AI, DeepSeek, Qwen d'Alibaba, Kimi de Moonshot AI, et MiniMax.
La formulation annonce moins qu'il n'y paraît. « Day-0 ou production » couvre à la fois la disponibilité le jour du lancement et un support ajouté après coup à des modèles sortis des mois plus tôt, et la liste ne sépare pas les deux.
| Ligne de modèle | Développeur | Statut déclaré par Cambricon |
|---|---|---|
| GLM | Zhipu AI | Support d'inférence Day-0 ou en production |
| DeepSeek | DeepSeek | Support d'inférence Day-0 ou en production |
| Qwen | Alibaba | Support d'inférence Day-0 ou en production |
| Kimi | Moonshot AI | Support d'inférence Day-0 ou en production |
| MiniMax | MiniMax | Support d'inférence Day-0 ou en production |
Pour les opérateurs de clusters, cette distinction constitue toute la valeur de l'affirmation. Un portage le jour du lancement signifie qu'une recette documentée existe dès la publication du checkpoint. Une adaptation après coup signifie attendre que le fournisseur rattrape son retard.
Forks fermés contre frameworks publics
Caixin Global a noté cette mise en service le jour même comme un marqueur du raccourcissement des boucles logicielles entre modèles et puces nationaux, passant de portages privés de plusieurs mois à une disponibilité le jour du lancement sur des frameworks publics que les opérateurs utilisent déjà. Le retard mesuré est un retard logiciel, pas un retard de silicium. Un fournisseur capable de suivre les versions amont de vLLM porte une charge de support moins coûteuse que celui qui maintient un fork fermé de chaque modèle qu'il sert.
Ce que l'annonce laisse en suspens, c'est de savoir si le schéma passe à l'échelle. DeepSeek-V4.1-Flash est le plus petit membre de sa famille, et la présentation de Cambricon elle-même indique le prochain test : des variantes DeepSeek plus grandes et des mélanges de service multimodaux. Porter le petit modèle en un jour est un bon signe. Ce n'est pas encore la preuve que la même équipe absorbe un checkpoint plus gros, ou une charge de travail servant ensemble vision et texte, selon le même calendrier.
Le Day-0 est devenu une affirmation que plusieurs fournisseurs peuvent formuler. Celui qui continue de la formuler à mesure que les checkpoints grossissent est celui qui mérite d'être surveillé.
- Source : A 552B model, a quarter of the HBM, and a day-one Cambricon port — 2026-09-11
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.