Analyse approfondie de l'infrastructure
Nous Research passe à l'échelle le parallélisme expert avec DeepEP : notes de terrain du pré-entraînement MoE
Nous Research publie des notes de terrain sur la mise à l'échelle du parallélisme expert MoE avec DeepEP. Détail du débit, des compromis de configuration et des goulots d'étranglement issus du pré-entraînement d'un modèle MoE de 1 billion de paramètres. Informations pratiques pour le déploiement d'un entraînement distribué à grande échelle.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-19 · 2 min de lecture

Nous Research a publié un rapport technique détaillé sur la mise à l'échelle du parallélisme expert des Mixture-of-Experts (MoE) pour le pré-entraînement à grande échelle à l'aide de DeepEP, une bibliothèque open-source pour la communication efficace entre experts. Le rapport s'appuie sur l'expérience de l'équipe d'exploitation d'un cluster de plusieurs térawatts-mois pour pré-entraîner un modèle MoE non nommé de 1 billion de paramètres. Le document va au-delà des chiffres de référence pour aborder les réalités de mise en œuvre : quelles configurations ont fonctionné, quels goulots d'étranglement sont apparus et comment l'équipe les a résolus.
Le principal défi du MoE à grande échelle est le déséquilibre de charge des experts. Lorsque les routeurs envoient un trafic disproportionné à certains experts, certains GPU restent inactifs tandis que d'autres font la queue. DeepEP résout ce problème grâce à un parallélisme à deux niveaux : parallélisme de données entre les experts, all-reduce entre les experts partagés, combiné à un routage dynamique qui rééquilibre la charge pendant l'entraînement. Le rapport de Nous confirme que DeepEP atteint un équilibre de charge quasi parfait avec une déviation inférieure à 2 % pour 64 experts répartis sur 1024 GPU.
Chiffres clés du rapport : débit de 380 t/s/gpu sur H100 pour un modèle MoE de 1T avec 64 experts ; surcharge de communication entre experts à 3 % du temps total d'entraînement après les optimisations DeepEP ; déséquilibre de charge sans DeepEP à 34 % de temps d'inactivité sur le pire GPU ; déséquilibre de charge avec DeepEP sous 2 % de temps d'inactivité.
Le rapport oppose DeepEP à la communication expert à expert conventionnelle, qui devient un goulot d'étranglement de bande passante à grande échelle. DeepEP utilise un schéma de communication personnalisé qui superpose le calcul expert avec l'échange de données, masquant la latence de communication derrière le calcul. L'équipe de Nous décrit également la topographie de leur cluster de production : un cluster de 1024 nœuds géré par Slurm avec des GPU H100 connectés via NVLink et InfiniBand.
Implications pratiques pour les autres laboratoires : DeepEP n'est pas une solution clé en main. Le rapport de Nous prévient que les gains du parallélisme expert sont sensibles aux facteurs d'architecture du modèle comme le nombre d'experts, le facteur de capacité et la valeur top-k. La configuration idéale doit être déterminée empiriquement par famille de modèles. L'équipe publie ses fichiers de configuration et ses scripts de surveillance comme modèles de référence.
Dans le paysage plus large, le travail MoE de Nous Research rejoint les contributions de Google avec GLaM, Meta avec V-MoE et Mistral avec Mixtral. Mais là où ces laboratoires publient des articles d'architecture finaux, les notes de terrain de Nous mettent l'accent sur la couche opérationnelle : ce que l'administrateur de cluster doit savoir pour maintenir un entraînement stable sur des mois. Cette perspective est rare dans la recherche ouverte et directement utile pour tout laboratoire construisant un cluster MoE à grande échelle.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.