الذكاء الاصطناعي مفتوح المصدر
نموذج AV-Flamingo من Nvidia يتصدى لفهم الفيديو الطويل حيث تفشل معظم النماذج
تطلق Nvidia نموذج AV-Flamingo، وهو نموذج لغوي كبير سمعي-بصري مفتوح المصدر مصمم لفهم الفيديو الطويل والمعقد. يستخدم منهجًا تدريبيًا ثلاثي المراحل وإطار استدلال متسلسل مع طابع زمني للتعامل مع الاستدلال الزمني والمتعدد الوسائط الذي يعيق معظم النماذج.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-28 · قراءة 5 دقائق

فهم الفيديو هو مشكلة محلولة فقط إذا كنت تعني بفيديو مقطعًا مدته خمس ثوانٍ لقطة على لوح تزلج. بمجرد أن تطلب من نموذج تتبع محادثة عبر تسجيل اجتماع مدته عشر دقائق أو تجميع ما حدث في تغذية مراقبة تمتد لعدة دقائق، فإن معظم الأنظمة الحالية تتوقف عن أن تكون مفيدة.
أطلقت Nvidia، بالتعاون مع باحثين من مؤسسات متعددة، نموذج AV-Flamingo، وهو نموذج لغوي كبير سمعي-بصري مفتوح بالكامل يأخذ رهانًا مختلفًا. بدلاً من التحسين للمقاطع القصيرة التي تهيمن على معظم المعايير، يتم تدريب النموذج من الأساس لمقاطع فيديو طويلة ومعقدة وواقعية تجمع بين الصوت والمرئيات والبنية الزمنية.
ما الذي يجعل الفيديو الطويل صعبًا
المشكلة الأساسية في الفيديو الطويل هي أنه يضاعف كل نقاط ضعف نماذج اللغات الكبيرة. تصل المعلومات المرئية بمعدلات إطارات عالية. تحتوي المسارات الصوتية على كلام متداخل وضوضاء بيئية وصمت. والشيء الذي يهتم به السؤال، وهو إجراء محدد، تغير في نبرة شخص ما، ظهور جسم في الخلفية، قد يحدث في الثانية 3 ولا يتم حله حتى الثانية 47. النماذج التي تعمل بشكل جيد على المقاطع القصيرة تميل إلى فقدان الخيط بعد ثلاثين ثانية لأن آليات الانتباه لديها لم تُدرب لتمتد لتلك الفترة الزمنية.
يعالج نموذج AV-Flamingo هذا من خلال ثلاث مساهمات رئيسية، موثقة في ورقة البحث المنشورة على arXiv والمرتبطة من صفحة المشروع على Hugging Face.
مجموعة بيانات مبنية للاستدلال، وليس للتعرف

أولاً، مجموعة البيانات Audio-Visual-Skills، وهي مجموعة بيانات واسعة النطاق تضم حوالي 7 ملايين مثال تدريبي من التسميات التوضيحية والأسئلة والأجوبة المستمدة من مقاطع فيديو واقعية. صُممت مجموعة البيانات لفرض الاستدلال الزمني والتأليفي والمتعدد الوسائط، وهي أنواع المهام التي يتعين على النموذج فيها ربط شيء مسموع في نقطة زمنية بشيء مرئي في نقطة أخرى. إنها انقطاع متعمد عن العديد من مجموعات بيانات الفيديو التي تعامل كل إطار كمستقل تقريبًا وتختبر بشكل أساسي التعرف على الأشياء.
التدريب المنهجي ثلاثي المراحل
المساهمة الثانية هي منهج تدريبي ثلاثي المراحل يزيد تدريجيًا من تعقيد ما يعالجه النموذج. تركز المرحلة الأولى على الإدراك قصير المدى، ومحاذاة الإشارات الصوتية والمرئية على مدى فترات زمنية قصيرة. تنتقل المرحلة الثانية إلى مقاطع متوسطة الطول مع حدود أحداث بسيطة. تدفع المرحلة الثالثة نحو الاستدلال طويل المدى متعدد الأحداث، حيث يجب على النموذج تتبع خيط سردي كامل عبر دقائق من اللقطات.
هذا النهج المتدرج مهم لأن القفز مباشرة إلى مقاطع فيديو طويلة مع تهيئة عشوائية هو وصفة لمخرجات غير متماسكة. يتعلم النموذج المشي قبل أن يركض، وتظهر ورقة البحث أن كل مرحلة تحسن بشكل قابل للقياس الأداء في المرحلة التالية.
سلسلة التفكير مع الطوابع الزمنية
الجزء الثالث هو Temporal Audio-Visual Interleaved Chain-of-Thought، وهو إطار استدلالي يجبر النموذج على تأريخ خطوات الاستدلال الوسيطة الخاصة بطوابع زمنية محددة. بدلاً من إنتاج إجابة نهائية بناءً على مزيج غامض من كل ما رآه وسمعه، يجب على النموذج أن يقول، في الواقع: في الثانية 12 سمعت هذا، في الثانية 14 رأيت ذلك، وبالتالي الإجابة هي هذه.
هذا يجعل مخرجات النموذج أكثر قابلية للتفسير، ووفقًا للورقة، يحسن المحاذاة الزمنية، فالنموذج أقل عرضة للخلط بين الأحداث التي حدثت في أوقات مختلفة عندما يضطر إلى الالتزام بطوابع زمنية على طول الطريق.
نتائج المقارنة مع النماذج المفتوحة والمغلقة
| نوع المقارنة | AV-Flamingo (مفتوح، حجم مماثل) | أفضل نموذج مفتوح مماثل | نماذج أكبر مفتوحة/مغلقة |
|---|---|---|---|
| فهم سمعي-بصري (فيديو طويل) | يتصدر أو منافس | متخلف بهوامش واضحة | منافس، يتفوق أحيانًا |
| معايير متعددة الوسائط | قوي | مماثل | منافس |
| مهام صوتية فقط | قوي | مماثل | منافس |
| مهام بصرية فقط | جيد | مماثل | متخلف في البعض |
عبر أكثر من 15 معيارًا تغطي المهام السمعية-البصرية والمتعددة الوسائط والصوتية والبصرية، يتفوق نموذج AV-Flamingo على النماذج المفتوحة ذات الحجم المماثل بهوامش واضحة. إنه يصمد أمام النماذج الأكبر بكثير، بما في ذلك النماذج المغلقة، خاصة في مهام فهم الفيديو الطويل والمعقد التي بُني من أجلها. لا تقدمه الورقة كأفضل نموذج في كل معيار على حدة، بعض الأنظمة المتخصصة لا تزال تقود في الاختبارات البصرية الضيقة، ولكن في الجمع بين الفهم السمعي-البصري والاستدلال الزمني عبر مقاطع الفيديو الطويلة، فإنه يضع معيارًا جديدًا بين النماذج مفتوحة الأوزان.
فجوة الفائدة الواقعية
نتائج المعايير تحكي جزءًا فقط من القصة. تؤكد الورقة أن نموذج AV-Flamingo ينتقل جيدًا إلى مهام غير مألوفة ويظهر فائدة واقعية قوية. هذا ادعاء أصعب في القياس الكمي ولكنه حاسم: العديد من النماذج التي تتفوق في معايير مقيدة تنهار عند توجيهها إلى فيديو غير منظم وغير مكتوب بجودة صوت متغيرة وقطع غير متوقعة وضوضاء خلفية. تدريب نموذج AV-Flamingo على لقطات واقعية بدلاً من المقاطع المنتقاة هو الفرق الرئيسي هنا.
أوزان مفتوحة، بيانات مفتوحة، مستقبل مفتوح
أطلقت Nvidia أوزان النموذج ومجموعة بيانات Audio-Visual-Skills والكود على Hugging Face تحت مساحة المشروع nvidia/av-skills. يمكن للباحثين إعادة إنتاج النتائج أو ضبط النموذج بدقة على بياناتهم الخاصة أو البناء على المنهج ثلاثي المراحل للمشكلات ذات الصلة.
يأتي الإصدار كجزء من نمط أوسع في Nvidia لنشر نماذج مفتوحة قادرة إلى جانب خطوط إنتاجها المغلقة، ويضع ضغطًا على المختبرات التي أبقَت أفضل نماذج فهم الفيديو الخاصة بها خلف واجهات برمجة التطبيقات أو الجدران النقدية. للممارسين الذين يحتاجون إلى تحليل فيديو طويل مع صوت وتسجيلات اجتماعات وأرشيف محاضرات ولقطات أمنية ومجموعات وثائقية، فإن نموذج AV-Flamingo هو الآن الخيار المفتوح بالكامل الأكثر قابلية للتطبيق المتاح.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.