IA à poids ouverts
dots3-note de Xiaohongshu : un MoE ouvert de 280B qui n'active que 16B
Le studio dots de Xiaohongshu a publié dots3-note preview, son premier modèle à poids ouverts : un MoE multimodal de 280B de paramètres, 16B actifs et une fenêtre de contexte de 512K. La conception sparse vise un faible coût d'inférence sur un nœud de 8 GPU, mais la fiche technique n'a pas encore publié de chiffres de benchmarks.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-20 · 5 min de lecture

Xiaohongshu, l'entreprise chinoise de l'internet grand public, a publié son premier modèle à poids ouverts. dots3-note preview, développé par son studio dots, est une architecture Mixture-of-Experts de 280B de paramètres au total, dont 16B activés par jeton. Il accepte le texte, les images, la vidéo et l'audio en entrée, génère du texte, dispose d'une fenêtre de contexte de 512K jetons, et est distribué sous licence Apache 2.0.
Cette publication est le coup d'envoi d'une famille de modèles, pas un événement isolé. La gamme dots3 est conçue autour de compromis entre capacité, latence et coût d'inférence, et la fiche technique présente dots3-note preview comme son membre le plus léger. Cela le place à l'extrémité la plus abordable d'un espace de conception que le studio s'est laissé la possibilité d'étendre.
Les premiers poids ouverts de Xiaohongshu
Xiaohongshu n'est pas une source évidente de poids de classe frontière. L'entreprise exploite une plateforme grand public, pas une activité d'infrastructure IA. Cette première arrive à un moment où la publication de poids ouverts est devenue la norme pour l'industrie chinoise de l'IA, et la fiche technique positionne le modèle sur une large liste de tâches : suivi d'instructions, raisonnement mathématique et logique, utilisation d'outils et workflows agents multi-étapes, génération de code, traitement de longs contextes, et compréhension d'images, de documents, de graphiques, d'audio et de vidéo.
Ce que la fiche technique ne publie pas compte autant que ce qu'elle promet. Les sections d'évaluation pour le raisonnement général et les agents ainsi que pour la compréhension multimodale sont listées, mais aucun chiffre ne figure en dessous. Un rapport complet porte la mention « à venir ».
Un pari de 17:1 sur des paramètres sparse
Lisez la fiche technique et un chiffre ressort. Avec 16B activés sur 280B au total, le rapport entre paramètres totaux et actifs est d'environ 17:1, une sparsité plus marquée que certains MoE ouverts actuels. Qwen3-VL, parmi les familles de modèles vidéo-langage à poids ouverts les plus importantes, plafonne avec une variante 235B-A22B, soit un rapport plus proche de 10:1. À cette échelle, le coût par jeton est déterminé par le chiffre de 16B, pas par celui de 280B.
L'architecture, en bref :
| Propriété | dots3-note preview |
|---|---|
| Paramètres totaux / activés | 280B / 16B |
| Couches | 1 dense + 45 MoE |
| Experts | 256 routés + 1 partagé, top-8 |
| Attention | 13 DSA + 33 SWA (~1:3) |
| Longueur de contexte | 512K jetons |
| Encodeur visuel | MoE ViT, 7B au total / 1,2B actifs |
| Encodeur audio | Dense, 800M |
| Précision | BF16, FP8 |
| Licence | Apache 2.0 |
Plusieurs détails pertinents pour l'inférence se cachent dans ces lignes. Le mélange utilise 256 experts routés plus un expert partagé avec un routage top-8. L'encodeur visuel est lui-même un MoE, 7B au total avec 1,2B actifs, tandis que l'encodeur audio est un modèle dense de 800M. L'attention se répartit entre 13 couches DSA et 33 couches SWA, soit environ 1:3. Une tête de prédiction multi-jetons, une couche partagée de 1,13B, alimente un chemin de décodage spéculatif optionnel.
L'annexe des benchmarks est vide
C'est là que la publication devrait inciter à la prudence. La fiche technique annonce un large éventail de capacités, mais telle que publiée, elle n'offre aucun chiffre d'évaluation pour l'étayer. Les affirmations agentiques méritent une prudence particulière : l'utilisation d'outils, les workflows multi-étapes et les tâches qui exigent exploration et mémoire sont précisément les domaines où le secteur constate en permanence que les benchmarks flattent les modèles. Des évaluations publiées ont mesuré les agents à 49 % sur un test que des experts humains réussissent à 95 %. La fenêtre de contexte de 512K mérite le même scepticisme, car le contexte annoncé et le contexte utilisable sont rarement identiques.
Rien de tout cela ne signifie que le modèle déçoit. Cela signifie que les chiffres du fournisseur ne sont pas encore publiés, et que les comparaisons avec les modèles ouverts concurrents devraient attendre leur publication.
Le faire tourner : FP8, un nœud, deux pull requests en attente
Le volet déploiement est plus concret que le volet benchmarks, avec une réserve : le support n'est qu'à moitié intégré. vLLM offre un support natif sur sa branche principale, les utilisateurs doivent donc utiliser une version nightly récente jusqu'à la prochaine version stable. Les intégrations SGLang et Transformers n'existent que sous forme de pull requests, #33829 et #47844, toutes deux encore en cours de revue. En attendant leur intégration, la documentation oriente les utilisateurs vers ces branches PR.
Le chemin recommandé est le checkpoint FP8 sur un nœud unique de 8 GPU. L'exemple vLLM utilise huit H100 avec un parallélisme tensoriel de 8, un parallélisme d'experts de 8, deep_gemm comme backend MoE, et une longueur de contexte de 262 144 jetons. C'est la moitié du maximum annoncé, et la fiche technique précise d'ajuster le contexte en fonction de la mémoire disponible, de la concurrence et de la modalité d'entrée. Le BF16 est pris en charge mais nécessite plus de mémoire.
La voie SGLang est fournie sous forme d'image Docker, lmsysorg/sglang:dev-dots3-note, qui télécharge le checkpoint FP8 depuis Hugging Face au premier lancement. Les flags couvrent le backend d'attention fa3 et une configuration de décodage spéculatif optionnelle où la tête de prédiction multi-jetons fonctionne comme NEXTN ; la documentation indique que cela peut réduire le temps par jeton généré de plus de 50 %. Les CUDA graphs de prefill ne sont pas encore pris en charge.
Pour des tests plus légers, la voie Transformers ajoute torchcodec et FFmpeg pour l'audio et la vidéo en plus de la pile habituelle. Les deux piles de service exposent une API compatible OpenAI, et l'appel d'outils s'active avec un flag de parseur spécifique à dots. Une option de template de chat, enable_thinking, bascule entre une trace de raisonnement et une réponse directe.
Ce qu'une plateforme grand public attend des poids ouverts
Le schéma stratégique derrière cette publication est l'efficacité. Le M3 de MiniMax combine déjà une multimodalité native, un contexte d'un million de jetons et un codage agentique dans un package ouvert. Qwen couvre des variantes denses et MoE allant de 30B-A3B à 235B-A22B. À l'extrême, l'Inkling ouvert de 975B de paramètres a été distribué à 1,9 To avant qu'Unsloth ne le compresse à 270 Go en 1 bit avec un maintien de précision de 74,2 %. Même les petits garde-fous jouent le même jeu : Mistral affirme que son Shieldstral de 3B égalise les modèles ouverts de sécurité textuelle jusqu'à sept fois sa taille.
dots3-note preview correspond au schéma, avec une société mère inhabituelle. La licence Apache 2.0 maintient les poids utilisables dans des produits commerciaux sans restriction, et l'approche FP8 sur un nœud unique suggère que le studio vise de vrais déploiements, pas seulement des passages sur les leaderboards. La famille étant conçue autour de multiples points de capacité et de coût, il s'agit probablement de la première de plusieurs publications.
Ce qui manque, c'est le rapport. Un ratio de sparsité de 17:1 et une fenêtre de 512K ne deviennent intéressants que lorsque les chiffres qui les sous-tendent sont rendus publics. En attendant, dots3-note preview est une déclaration architecturale venue d'un acteur inattendu. Cela suffit déjà à le rendre remarquable. Les benchmarks décideront s'il est davantage.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.