SevenTnewS

Recherche en IA open source

Contexte d'un million de tokens avec un dixième du cache KV : le pari d'efficacité de DeepSeek-V4

L'aperçu V4 de DeepSeek associe un modèle Pro de 1,6T de paramètres à une variante Flash de 284B, tous deux avec un contexte d'un million de tokens. Le document revendique 27 % des FLOPs d'inférence et 10 % du cache KV de V3.2, soit les chiffres qui rendent ce contexte rentable à servir.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-06-22 · Dernière mise à jour : 2026-08-02 · 4 min de lecture

Contexte d'un million de tokens avec un dixième du cache KV : le pari d'efficacité de DeepSeek-V4

La partie coûteuse d'un contexte d'un million de tokens n'a jamais vraiment été les tokens. C'est la mémoire qu'ils occupent. Chaque token de la fenêtre se trouve dans le cache KV, et ce cache grandit avec la séquence, c'est pourquoi le service de longs contextes a toujours eu un prix élevé. L'aperçu V4 de DeepSeek vise directement cette courbe de coûts.

Deux modèles, un million de tokens

DeepSeek a publié la série V4 en tant qu'aperçu technique, avec des checkpoints sur Hugging Face. La gamme comprend deux modèles Mixture-of-Experts. DeepSeek-V4-Pro compte 1,6 billion de paramètres avec 49 milliards d'actifs par token. DeepSeek-V4-Flash est l'option plus légère : 284 milliards de paramètres, 13 milliards d'actifs. Les deux acceptent une fenêtre de contexte d'un million de tokens.

ModèleParamètresActifs par tokenFenêtre de contexte
DeepSeek-V4-Pro1.6T49B1M tokens
DeepSeek-V4-Flash284B13B1M tokens

La promesse d'efficacité

Les chiffres d'efficacité sont le véritable titre. À un million de tokens de contexte, indique le document, DeepSeek-V4-Pro n'a besoin que de 27 % des FLOPs d'inférence par token et de 10 % du cache KV par rapport à DeepSeek-V3.2. Moins de FLOPs signifie une génération plus rapide. Un dixième du cache KV signifie que le même budget mémoire peut accueillir environ dix fois plus de sessions de long contexte en parallèle, avant que tout autre goulot d'étranglement n'intervienne. C'est cette arithmétique qui rend crédible l'affirmation du document selon laquelle il peut « prendre en charge en routine des contextes d'un million de tokens ».

Comment l'architecture y parvient

Trois changements architecturaux portent la charge. Le premier est une conception d'attention hybride qui répartit le travail entre l'attention sparse compressée (Compressed Sparse Attention, CSA) et l'attention fortement compressée (Heavily Compressed Attention, HCA). L'attention sparse maintient accessibles les tokens distants dont vous avez réellement besoin ; la voie fortement compressée maîtrise l'empreinte mémoire de tout le reste. Le deuxième est celui des hyper-connexions contraintes par variété (Manifold-Constrained Hyper-Connections, mHC), une évolution des connexions résiduelles classiques. Le troisième est l'optimiseur Muon, auquel le document attribue une convergence plus rapide et une plus grande stabilité d'entraînement. Les deux modèles ont été pré-entraînés sur plus de 32 billions de tokens, puis soumis à un vaste pipeline de post-entraînement destiné à libérer et à étendre leurs capacités.

Pro-Max et la course aux poids ouverts

DeepSeek décrit également V4-Pro-Max, le mode d'effort de raisonnement maximal du modèle Pro. Le document affirme qu'il « redéfinit l'état de l'art des modèles ouverts » et qu'il surpasse ses prédécesseurs dans les tâches fondamentales. L'aperçu ne comprend aucun tableau de benchmarks, donc cette affirmation ne repose sur aucun chiffre public en dehors des chiffres d'efficacité. Il faut le lire comme une déclaration à vérifier lorsque des résultats indépendants paraîtront.

Le calendrier s'inscrit en plein dans une période chargée pour les poids ouverts. Notre couverture de Gemma 4 de Google DeepMind, un modèle MoE de 26 milliards de paramètres conçu pour raisonner sur des codebases entières et des transcriptions de plusieurs heures, montre la même course au long contexte dans les modèles à poids ouverts. Les modèles denses plus petits de Gemma offrent des fenêtres de 256 000 tokens. DeepSeek promet un million complet sur les deux variantes V4. Cet écart importe surtout pour le cas d'usage que le document met en avant : les tâches à long horizon qui obligeaient auparavant les développeurs à recourir à des pipelines de découpage et de récupération, lesquels ajoutent latence et complexité en plus de ce que le modèle peut faire.

Ce qui reste à prouver

L'aperçu sert aussi de test pour savoir si le marché traite l'efficacité comme une caractéristique de premier plan. Les checkpoints sont disponibles pour que chacun puisse les exécuter, et la répartition en deux modèles donne à DeepSeek un niveau Pro pour les tâches lourdes et un niveau Flash dont le nombre de paramètres actifs indique un service moins coûteux. Le document ne positionne pas explicitement le modèle Flash, alors considérez ceci comme une interprétation, pas une spécification. Pour les développeurs qui servent des charges de travail à long contexte, la question pratique est plus simple : si les chiffres de 27 % et 10 % se confirment en dehors du document, le coût de mémorisation d'un million de tokens cesse d'être la raison de construire autour de la récupération plutôt que du contexte.

Tout cela ne tranche pas la question de savoir si le modèle est bon. L'efficacité n'est que la moitié de l'équation, et une qualité de long contexte élevée n'a jamais été uniquement un problème de mémoire. L'aperçu donne aux critiques une cible claire : des exécutions indépendantes du réglage à un million de tokens, le réglage exact pour lequel l'architecture a été conçue, avec les chiffres de coût vérifiés par rapport à V3.2. Jusqu'à ce qu'elles existent, la série avance un argument solide sur la direction que prennent les coûts du long contexte, appuyé par un modèle que les gens peuvent réellement télécharger.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.