أبحاث الذكاء الاصطناعي
Kling يصدر معيارين يكشفان مدى سوء الجيل التوليدي للفيديو في الواقع
يقدم فريق Kling معياري MultiRef-Compass وKeyFrame-Compass، وهما معياران يدفعان نماذج توليد الفيديو إلى ما هو أبعد من النص إلى الفيديو وإلى مهام متعددة المرجع ومشروطة بالإطارات الرئيسية. أظهرت الاختبارات المبكرة على ثمانية وتسعة أنظمة على التوالي إخفاقات مستمرة في ربط الكيانات، والحفاظ على الترتيب الزمني، والتعامل مع القيود الكثيفة.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-26 · قراءة 3 دقائق

اختبرت معظم معايير توليد الفيديو شيئًا واحدًا: مدى نجاح النموذج في تحويل جملة إلى مقطع. بدلاً من ذلك، تنظر ورقتا فريق Kling الجديدتان، اللتان نُشرتا في نفس اليوم، إلى مشاكل أصعب.
الأولى، MultiRef-Compass، تستهدف ما يسميه المؤلفون التوليد متعدد المرجع إلى الصوت والفيديو، أو MR2AV. بدلاً من موجه نصي واحد، يحصل النموذج على عدة صور مرجعية بالإضافة إلى تعليمات، ويجب أن ينتج صوت وفيديو متزامنين يحترمان كل مرجع. يتضمن المعيار 350 عينة تغطي الحفاظ على الكائن من زوايا متعددة، وربط الكيانات المتعددة، وتكوين الإنسان-الكائن-المشهد.
أظهرت الاختبارات على ثمانية أنظمة MR2AV تمثيلية أن أياً منها لا يعالج المهمة بشكل جيد. تحدد الورقة أربعة أبعاد تقييم: الجودة الأساسية، واتساق المرجع، واتساق الصوت والفيديو، واتباع التعليمات مع 14 مقياسًا فرعيًا. سجلت النماذج باستمرار أدنى الدرجات في اتساق المرجع واتباع التعليمات، وهما بالضبط البعدان الأكثر أهمية للاستخدام العملي.

المعيار الثاني، KeyFrame-Compass، يعالج توليد الفيديو المشروط بالإطارات الرئيسية. يستخدم المبدعون بشكل متزايد القصص المصورة - سلسلة من الصور المرجعية - لتوجيه نموذج الفيديو. يتضمن المعيار 386 عينة عبر ثلاثة مجالات تطبيق، وبنيتين فيديو، ودرجتي دقة موجه، وتنسيقي شرط، وأربع كثافات للإطارات الرئيسية.
النتيجة الرئيسية هنا هي مقايضة تبين أنها أساسية: النماذج التي تنفذ الإطارات الرئيسية بأمانة تنتج فيديو أقل طبيعية، والنماذج التي تنتج فيديو طبيعي تتجاهل الإطارات الرئيسية. يتدهور الأداء مع زيادة كثافة الإطارات الرئيسية. تفشل معظم النماذج مفتوحة المصدر أيضًا في تفسير مدخلات شبكة القصة المصورة كتسلسلات مرتبة زمنيًا - تعامل النماذج شبكة من الصور كمركب واحد بدلاً من خط زمني.
يستخدم كلا المعيارين إطار تقييم MLLM-as-a-Judge معزز بإعادة التقييم. وهذا يعني أن التحكيم نفسه يتم بواسطة نموذج كبير متعدد الوسائط، مع مرحلة ثانية تلتقط أخطاء التقييم. النهج قابل للتطوير والتدقيق، ولكنه يعني أيضًا أن هذه المعايير تعتمد على نفس التقنية التي تختبر النماذج الأخرى ضدها.
نشر فريق Kling المعيارين على arXiv في 15 يوليو 2026. تلقت الورقتان 31 و34 صوتًا مؤيدًا على Hugging Face على التوالي في وقت كتابة هذا التقرير، وهو اهتمام متواضع لمختبر أبحاث أنتج نماذج فيديو عالية المستوى. قد يعكس الاستقبال حقيقة أن الأخبار السيئة للمجال أقل قابلية للمشاركة من عرض توضيحي جديد.
تتفق النتائج مع نمط كان واضحًا منذ العروض التوضيحية الأولى لـ Sora: التقييم المتحكم فيه يكشف عن إخفاقات تخفيها المقاطع الترويجية المختارة بعناية. تحسنت جودة النص إلى الفيديو بشكل كبير خلال العامين الماضيين. لم يواكب الإسناد المتعدد المرجع والشرط بالإطارات الرئيسية هذا التحسن.
لأي شخص يبني خطوط إنتاج على هذه النماذج، تشير المعايير إلى ضرورة تعديل التوقعات. النموذج الذي ينتج مقاطع لمرة واحدة مثيرة للإعجاب من موجه واحد قد ينتج مواد رديئة عندما يُطلب منه الحفاظ على مظهر شخصية عبر المشاهد، أو الانصياع لتسلسل دقيق من إطارات القصة المصورة. المقايضة بين الإخلاص والطبيعة لن تختفي في الجيل الحالي من البنى.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.