تعمق في البنية التحتية
Nous Research توسع نطاق التوازي الخبير باستخدام DeepEP: ملاحظات ميدانية من التدريب المسبق لنموذج MoE
تنشر Nous Research ملاحظات ميدانية حول توسيع نطاق التوازي الخبير لـ MoE باستخدام DeepEP. تفاصيل الإنتاجية والمقايضات في التهيئة والاختناقات من التدريب المسبق لنموذج MoE بـ 1 تريليون معلمة. رؤى عملية للنشر في التدريب الموزع واسع النطاق.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-19 · قراءة 2 دقائق

نشرت Nous Research تقريرًا فنيًا مفصلاً حول توسيع نطاق التوازي الخبير لنماذج Mixture-of-Experts (MoE) للتدريب المسبق على نطاق واسع باستخدام DeepEP، وهي مكتبة مفتوحة المصدر للاتصال الخبير الفعال. يستمد التقرير من تجربة الفريق في تشغيل مجموعة عنقودية متعددة تيراواط/شهر لتدريب نموذج MoE غير مسمى يحتوي على تريليون معلمة. تتجاوز الوثيقة أرقام المعايير لتصل إلى واقع التنفيذ: أي التهيئات نجحت، وأي الاختناقات ظهرت، وكيف حلها الفريق.
التحدي الأساسي مع MoE على نطاق واسع هو عدم توازن الحمل الخبير. عندما ترسل أجهزة التوجيه حركة مرور غير متناسبة إلى خبراء معينين، تظل بعض وحدات معالجة الرسوميات خاملة بينما تنتظر أخرى في طابور. يعالج DeepEP هذا من خلال التوازي ذي المستويين: التوازي في البيانات عبر الخبراء، والتجميع الكلي عبر الخبراء المشتركين، بالإضافة إلى التوجيه الديناميكي الذي يعيد توازن الحمل أثناء التدريب. يؤكد تقرير Nous أن DeepEP يحقق توازن حمل شبه مثالي مع انحراف بنسبة 2% عند 64 خبيرًا موزعين عبر 1024 وحدة معالجة رسومية.
أرقام رئيسية من التقرير: إنتاجية 380 رمزًا/ثانية/وحدة معالجة رسومية على H100 لنموذج MoE بحجم 1 تريليون مع 64 خبيرًا؛ تكلفة الاتصال الخبير بنسبة 3% من إجمالي وقت التدريب بعد تحسينات DeepEP؛ عدم توازن الحمل بدون DeepEP يسبب 34% من وقت الخمول في أسوأ وحدة معالجة رسومية؛ عدم توازن الحمل مع DeepEP أقل من 2% من وقت الخمول.
يقارن التقرير DeepEP مع الاتصال الخبير التقليدي من الكل إلى الكل، والذي يصبح عنق زجاجة في عرض النطاق الترددي عند التوسع. يستخدم DeepEP مخطط اتصال مخصصًا يتداخل فيه حساب الخبير مع تبادل البيانات، مما يخفي زمن الوصول للاتصال خلف الحساب. يصف فريق Nous أيضًا طبوغرافيا مجموعتهم الإنتاجية: مجموعة عنقودية مكونة من 1024 عقدة مُدارة بواسطة Slurm مع وحدات معالجة رسومية H100 متصلة عبر NVLink وInfiniBand.
الآثار العملية للمختبرات الأخرى: DeepEP ليس حلاً جاهزًا. يحذر تقرير Nous من أن فوائد التوازي الخبير حساسة لعوامل بنية النموذج مثل عدد الخبراء وعامل السعة وقيمة Top-k. يجب تحديد التهيئة المثلى تجريبيًا لكل عائلة نموذج. يطلق الفريق ملفات التهيئة ونصوص المراقبة الخاصة بهم كقوالب مرجعية.
في المشهد الأوسع، تنضم أعمال Nous Research في مجال MoE إلى مساهمات من Google مع GLaM وMeta مع V-MoE وMistral مع Mixtral. ولكن حيث تنشر تلك المختبرات أوراقًا نهائية حول البنية، تركز ملاحظات Nous الميدانية على طبقة العمليات: ما يحتاج مسؤول العنقودية إلى معرفته للحفاظ على استقرار التدريب على مدى أشهر. هذه المنظور نادر في الأبحاث المفتوحة ومفيد بشكل مباشر لأي مختبر يبني مجموعة MoE واسعة النطاق.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.