SevenTnewS

Inmersión profunda en infraestructura

Nous Research escala el paralelismo experto con DeepEP: notas de campo del preentrenamiento MoE

Nous Research publica notas de campo sobre la escalabilidad del paralelismo experto MoE con DeepEP. Detalla el rendimiento, las compensaciones de configuración y los cuellos de botella del preentrenamiento de un modelo MoE de 1T de parámetros. Información práctica de implementación para el entrenamiento distribuido a gran escala.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-19 · 2 min de lectura

Nous Research escala el paralelismo experto con DeepEP: notas de campo del preentrenamiento MoE
Fuentes : Nous Research f…

Nous Research publicó un informe técnico detallado sobre la escalabilidad del paralelismo experto en Mixture-of-Experts (MoE) para el preentrenamiento a gran escala utilizando DeepEP, una biblioteca de código abierto para la comunicación eficiente entre expertos. El informe se basa en la experiencia del equipo al operar un clúster de varios teravatios-mes para preentrenar un modelo MoE no nombrado de 1 billón de parámetros. El documento va más allá de los números de referencia hacia las realidades de implementación: qué configuraciones funcionaron, qué cuellos de botella aparecieron y cómo los resolvió el equipo.

El desafío principal con MoE a escala es el desequilibrio de carga de los expertos. Cuando los enrutadores envían tráfico desproporcionado a ciertos expertos, algunas GPUs quedan inactivas mientras otras hacen cola. DeepEP aborda esto mediante un paralelismo de dos niveles: paralelismo de datos entre expertos y all-reduce entre expertos compartidos, combinado con enrutamiento dinámico que reequilibra la carga durante el entrenamiento. El informe de Nous confirma que DeepEP logra un equilibrio de carga casi perfecto con una desviación del 2% en 64 expertos distribuidos en 1024 GPUs.

Números clave del informe: rendimiento de 380 t/s/gpu en H100 para un modelo MoE de 1T con 64 expertos; sobrecarga de comunicación de expertos del 3% del tiempo total de entrenamiento después de las optimizaciones de DeepEP; desequilibrio de carga sin DeepEP del 34% de tiempo inactivo en la peor GPU; desequilibrio de carga con DeepEP por debajo del 2% de tiempo inactivo.

El informe contrasta DeepEP con la comunicación convencional de todos contra todos entre expertos, que se convierte en un cuello de botella de ancho de banda a escala. DeepEP utiliza un esquema de comunicación personalizado que superpone el cálculo de expertos con el intercambio de datos, ocultando la latencia de comunicación detrás del cómputo. El equipo de Nous también describe la topografía de su clúster de producción: un clúster de 1024 nodos gestionado por Slurm con GPUs H100 conectadas mediante NVLink e InfiniBand.

Las implicaciones prácticas para otros laboratorios: DeepEP no es una solución plug-and-play. El informe de Nous advierte que las ganancias del paralelismo experto son sensibles a factores de la arquitectura del modelo como el número de expertos, el factor de capacidad y el valor top-k. La configuración ideal debe determinarse empíricamente por familia de modelos. El equipo publica sus archivos de configuración y scripts de monitoreo como plantillas de referencia.

En el panorama más amplio, el trabajo MoE de Nous Research se suma a las contribuciones de Google con GLaM, Meta con V-MoE y Mistral con Mixtral. Pero donde esos laboratorios publican artículos de arquitectura final, las notas de campo de Nous enfatizan la capa operativa: lo que el administrador del clúster necesita saber para mantener el entrenamiento estable durante meses de ejecución. Esa perspectiva es rara en la investigación abierta y directamente útil para cualquier laboratorio que construya un clúster MoE a gran escala.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.