SevenTnewS

NVIDIA

Nvidia وHugging Face تتعاونان لجعل تدريب الانتشار الموزع أمرًا اعتياديًا

يتكامل NeMo Automodel من Nvidia الآن مباشرة مع Hugging Face Diffusers، مما يتيح التدريب الموزع بجودة إنتاجية لنماذج مثل FLUX وWan 2.1 وHunyuanVideo. تتعامل مكتبة Apache 2.0 مع التوازي كمفتاح تكوين وتسمح بتحميل نقاط التفتيش المضبوطة بدقة مباشرة إلى خطوط أنابيب الاستدلال.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-19 · قراءة 5 دقائق

Nvidia وHugging Face تتعاونان لجعل تدريب الانتشار الموزع أمرًا اعتياديًا
المصادر : Fine-tune video…

تستمر نماذج الانتشار في النمو، ويظل تدريبها أكثر صعوبة. يزن FLUX.1-dev 12 مليار معامل. يحتاج متغير Wan 2.1 الذي يحتوي على 14 مليار معامل إلى توازي المصفوفات فقط ليتناسب مع H100. يعمل HunyuanVideo 1.5 بـ 13 مليار معامل. يُفهم توسيع نطاق الاستدلال لهذه النماذج جيدًا نسبيًا. لكن توسيع نطاق التدريب ليس كذلك، خاصة إذا كنت تريد الانتقال من تجربة LoRA على وحدة معالجة رسومية واحدة إلى ضبط دقيق كامل عبر مجموعة دون إعادة كتابة برنامج التدريب الخاص بك.

تستهدف هذه الفجوة كل من Nvidia وHugging Face من خلال تكامل جديد بين NeMo Automodel ومكتبة Diffusers، والذي تم توثيقه الآن في دليل تدريب Diffusers وتم إصداره بموجب ترخيص Apache 2.0. الادعاء واضح: أنت تشير إلى أي نموذج متوافق مع Diffusers على Hub، ونفس سير العمل القائم على YAML يتعامل مع تجزئة FSDP2 وتوازي المصفوفات وتوازي السياق والتخزين المؤقت الكامن وتجميع الدقة المتعددة. لا توجد خطوة تحويل. لا يوجد تنسيق تدريب منفصل. تخرج نقطة التفتيش بشكل Diffusers ويتم تحميلها مباشرة في خط أنابيب الانتشار للاستدلال.

بالنسبة للفرق التي كانت تقوم بتجميع برامج تدريب مخصصة حول كل إصدار نموذج جديد، فإن هذه الحزمة مهمة أكثر من أي رقم أداء فردي.

ما الذي يتغير بالفعل

تنقسم المكاسب العملية إلى ثلاثة أجزاء. أولاً، لا تحويل لنقطة التفتيش. نقطة تفتيش NeMo مضبوطة بدقة هي نقطة تفتيش Diffusers، نفس هيكل المجلدات، نفس فئات النماذج. تستمر أدوات المصب (القياس، التجميع، أخذ العينات المخصصة، دمج LoRA) في العمل دون خطوة تكيف. ثانيًا، دعم سريع للنماذج الجديدة. عندما تظهر بنية انتشار جديدة في Diffusers، فإن تمكينها في NeMo Automodel يتطلب معالج إعداد بيانات أولية ومهايئ نموذج بدلاً من برنامج تدريب مخصص كامل. باقي مكدس الوصفة، التوازي، التجميع، نقاط التفتيش، التوليد، ينتقل دون تغيير.

مخطط: NeMo Automodel + Diffusers سير عمل التدريب
يزيل تكامل NeMo Automodel مع Diffusers تحويل نقطة التفتيش من خلال السماح للمستخدمين بإطلاق التدريب الموزع من أي نموذج متوافق مع Diffusers والحصول مباشرة على نقطة تفتيش بتنسيق Diffusers لأدوات المصب والاستدلال، كما هو موضح في المقال.

ثالثًا، يتم التعامل مع كل من الضبط الدقيق الكامل وLoRA بأسلوب PEFT بواسطة نفس هيكل الوصفة. يحدد تكوين YAML أيًا منها سيتم تشغيله؛ مسار الكود مشترك. وهذا يعني أن الممارس يمكنه البدء باستخدام LoRA على عقدة واحدة للتحقق من جودة البيانات، ثم التوسع إلى الضبط الدقيق الكامل عبر ثماني وحدات معالجة رسومية (أو ثمانين) عن طريق تغيير بعض حقول التكوين وإعلان التوازي، وليس عن طريق تبديل برامج التدريب.

طبقة المعايير

المعايير المنشورة على 8x H100 80GB تعطي فكرة عن مكانة المكتبة. يعمل الضبط الدقيق الكامل لـ FLUX.1-dev بدقة 512x512 بمعدل 35.5 صورة في الثانية بحجم دفعة عالمي يبلغ 32 وتخصيص ذاكرة GPU يصل إلى 63.9 جيجابايت. LoRA بمرتبة 64 مع DDP يدفع ذلك إلى 53.7 صورة في الثانية، ويستهلك 67.4 جيجابايت. بالنسبة للنص إلى فيديو، يعمل الضبط الدقيق الكامل لـ Wan 2.1 بسعة 14B على مقاطع 49 إطارًا بدقة 512x512 بمعدل حوالي 2.1 مقطع في الثانية مع تفعيل نقطة تفتيش التنشيط، ويبلغ الذروة عند 33.4 جيجابايت لكل GPU. متغير 1.3B يتناسب بسهولة، بذروة 6.1 جيجابايت، ولا حاجة إلى تفعيل نقطة تفتيش التنشيط.

هذه الأرقام هي متوسطات حالة مستقرة مع تعطيل عمليات كتابة نقاط التفتيش وتطبيق الدفعات الكاملة. ستكون عمليات التشغيل في العالم الحقيقي مع نقاط التفتيش الدورية أبطأ قليلاً، لكن الفجوة بين LoRA على GPU واحد والضبط الدقيق الكامل الموزع ضيقة بما يكفي لدرجة أن الاختناق الرئيسي لمعظم الفرق سيكون إعداد البيانات والتقييم، وليس إنتاجية التدريب.

جولة عملية

يتضمن التوثيق ضبطًا دقيقًا كاملاً لـ FLUX.1-dev من البداية إلى النهاية على مجموعة بيانات Rider-Waite tarot المكونة من 78 صورة. سير العمل هو: ترميز مجموعة البيانات مسبقًا إلى كمونات VAE مخزنة مؤقتًا وتضمينات نصية، ثم بدء التدريب باستخدام YAML الحالي لـ FLUX مع تجاوزات سطر الأوامر لمسارات مجموعة البيانات وإعدادات التشغيل. بعد 200 خطوة محسّن، تنتج نقطة التفتيش مخرجات تمزج محتوى موجه رائد الفضاء مع اللوحات القديمة والخطوط الحبرية المستفادة من بطاقات التاروت، وهو تكيف مجال متحكم فيه وليس استيلاء على النموذج الأساسي.

يعمل رمز التشغيل trtcrd كمفتاح نمط. معه، تتحول التوليدات إلى حقول ألوان مسطحة بالكريمي والأحمر والأسود. بدونه، ينتج نفس البذرة والموجه نتيجة فوتوغرافية. هذا النوع من التحكم الدقيق هو بالضبط ما يجب أن يبدو عليه ضبط المجال الدقيق، وحقيقة أنه تطلب ملف تكوين واحدًا ولا تعديلات على مصدر النموذج هو الهدف.

الجزء المفقود

يدعم NeMo Automodel حاليًا نماذج مطابقة التدفق فقط. وهذا يترك نماذج الانتشار ذات الوقت المنفصل التي لا تزال مستخدمة على نطاق واسع في المجتمع، مثل بنيات Stable Diffusion 3 وSDXL. كما تشحن المكتبة بتنسيق تنسيق SLURM متعدد العقد ولكن ليس بعد دعم Kubernetes، مما يحد من جاذبيتها للفرق التي تعمل على منصات سحابية مُدارة.

لا يزال واجهة برمجة تطبيقات الوصفة Pythonic المخطط لها، والتي من شأنها أن تسمح للمستخدمين بتجميع نفس المكونات من Python مكتوبة بدلاً من YAML، مدرجة كإصدار مستقبلي. بالنسبة للفرق التي تحتاج إلى دمج التدريب في أطر إدارة التجارب الحالية، سيكون هذا المسار البرمجي أكثر أهمية من بدء التشغيل السريع باستخدام YAML.

لا شيء من هذا ينتقص من قيمة ما هو موجود بالفعل. يحل تكامل Diffusers-NeMo مشكلة محددة، وهي التدريب الموزع على الانتشار بجودة إنتاجية دون السقالات المعتادة، ويحلها بشكل نظيف. أرقام الأداء قوية، وسير العمل قابل للتكرار، والقطعة الأثرية تعمل مع الأدوات الحالية. بالنسبة للمختبرات التي كانت تدير نصوصًا مخصصة عبر المجموعات، فمن المرجح أن يكون هذا هو المسار الأقل مقاومة لإعداد قابل للتوسع.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.