أبحاث الذكاء الاصطناعي
توليد الفيديو أسرع 120 مرة على GPU واحد: اختراق Nvidia في الانتباه الهجين
يجمع نموذج SANA-Video 2.0 من Nvidia Research بين الانتباه الخطي والانتباه Softmax الدوري بنسبة 3:1 ليعمل أسرع 120 مرة من Wan 2.2 على H100 واحد. يستعيد التصميم الهجين التعبير الكامل للرتبة مع الحفاظ على زمن الاستدلال عند 13 ثانية لمقطع بدقة 720p. التحذيرات: المعايير تتوقف عند 720p وتدمج تغيير الانتباه مع تحسينات مملوكة.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-31 · قراءة 3 دقائق

كانت تكلفة توليد الفيديو دائمًا هي الانتباه. ليس النوع الذي تدفع مقابله للنقرات، بل آلية الانتباه الذاتي داخل محولات الانتشار. كل إطار يضيف المزيد من الرموز المميزة، ويجعل الانتباه الكامل softmax كل رمز ينظر إلى كل رمز آخر. هذا التوسع التربيعي يحول المقطع القصير إلى انتظار طويل.
يحاول إصدار SANA-Video 2.0 من Nvidia Research، الذي نُشر كمسودة مسبقة في يوليو 2026، فك هذه التكلفة. فهو يمزج الانتباه الخطي مع خطوات softmax الدورية بنسبة 3:1، وتدعي الورقة أن النتيجة تعمل أسرع 120 مرة من Wan 2.2-A14B على H100 واحد لمقاطع مدتها 5 ثوانٍ بدقة 720p. هذا الرقم لافت للنظر، لكن تفكيكه يظهر مقدار الهندسة التي بُذلت لسد الفجوة بين النظرية والتطبيق.
آلية الانتباه الهجين
تتجنب البنية العقوبة التربيعية عن طريق استبدال معظم عمليات softmax ببديل خطي مُبوَّب. كل خطوة انتباه رابعة تحتفظ بـ softmax، وتعمل كمرساة كاملة الرتبة. الفكرة هي أن الانتباه الخطي الخالص يفقد التعبيرية لأن الرموز المميزة تتفاعل بشكل غير مباشر. خطوات softmax الدورية تستعيد التفاعل المباشر. تسمي الورقة هذا الانتباه الخطي-softmax الهجين، وهو يجمع بين مسار خطي مُبوَّب لمزج O(N) مع مراسي softmax دورية بنسبة 3:1.
لدفع هذه التمثيلات المحدثة عبر الشبكة، تقوم بقايا الانتباه الكتلي (AttnRes) بتوجيه ملخصات الكتل المكتملة إلى الطبقات اللاحقة. تذكر الورقة زيادة في الرتبة الفعالة للطبقات العميقة بنحو 12%. تم تدريب النموذج من الصفر لتعلم النمط الهجين مباشرة، متجنبًا التدهور الذي يمكن أن يحدث عند خطية محول مُدرَّب مسبقًا.
حزمة التحسين
فوق الهيكل الأساسي، طبقت Nvidia حزمة التحسين Sol-Engine الخاصة بها، والتي تتضمن دمج النواة والتخزين المؤقت والانتباه المتناثر. تقول الورقة إن هذه الطبقة الإضافية تسرّع الهيكل الأساسي المتوافق مع الأجهزة بمقدار 3.58 مرة إضافية. يؤدي تكامل كلا التحسينين إلى جعل خط الأنابيب الذي يبلغ حجمه 5 مليارات معلمة عند 13.06 ثانية لمقطع بدقة 720p مدته 5 ثوانٍ على H100 واحد. عند 720p و60 ثانية، يكون تمرير DiT المُجمَّع أسرع 3.2 مرة من خط الأساس المطابق لـ softmax الكامل، وتتسع الفجوة مع مقاطع الفيديو الأطول.
المعايير والمقارنات
تُقاس الجودة على VBench، حيث يسجل SANA-Video 2.0 درجة 84.30 عند 480p باستخدام 40 خطوة أخذ عينات، ويكتمل في 13.2 ثانية على H100 واحد. يقول المؤلفون إن هذا تنافسي مع محولات الانتشار الكبيرة ذات الانتباه الكامل. عند 720p و5 ثوانٍ، يكون خط الأنابيب الكامل أسرع بحوالي 120 مرة من Wan 2.2-A14B. تزداد الفجوة مع مدة الفيديو، وهو أمر مهم لتوليد الفيديو الطويل.
| المقياس | SANA-Video 2.0 (5B) |
|---|---|
| درجة VBench (480p، 40 خطوة) | 84.30 |
| زمن الاستدلال (480p، 40 خطوة) | 13.2 ثانية على H100 واحد |
| زمن الاستدلال (720p، 5 ثوانٍ، خط الأنابيب الكامل) | 13.06 ثانية على H100 واحد |
| تسريع تمرير DiT مقابل خط الأساس ذي الانتباه الكامل (720p/60 ثانية) | 3.2x |
| التسريع مقابل Wan 2.2-A14B (720p/5 ثوانٍ، خط الأنابيب الكامل) | 120x على H100 واحد |
أسئلة مفتوحة ومقايضات
تختبر الورقة عند 480p و720p حتى 60 ثانية. لا تستكشف 1080p أو متواليات أطول. تم اختيار نسبة الـ 25% softmax من دراسات وكيلة بدقة أقل، وليس من الواضح ما إذا كانت النسبة نفسها صالحة لدقة أعلى أو سياق أطول. أرقام التسريع تدمج تغيير الانتباه مع Sol-Engine، مما يجعل من الصعب عزل مساهمة كل مكون. والمقارنة مع Wan 2.2، وهو نموذج مختلف بهندسة وتدريب مختلفين، تترك مجالًا للنقاش حول مقدار العامل 120x القابل للتعميم خارج أجهزة Nvidia.
هذه ليست عيوبًا قاتلة، لكنها تحذيرات حقيقية لأي شخص يقيّم ما إذا كان هذا النهج مناسبًا لخط أنابيبه الخاص. الهندسة مثيرة للإعجاب. الادعاءات كبيرة. لكن كما هو الحال مع أي مسودة مسبقة، التفاصيل أهم من العنوان الرئيسي.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.