SevenTnewS

أبحاث الذكاء الاصطناعي

التعلم التعزيزي لتوليد الصور: Qwen-Image-2.0-RL يحصل على نظام مكافآت مركب

يصف تقرير Qwen-Image-2.0-RL خط أنابيب ما بعد التدريب الذي يجمع بين RLHF والتقطير على السياسة ونماذج المكافآت المركبة لتحسين جودة تحويل النص إلى صورة وتحرير الصور. يحقق النهج مكاسب قابلة للقياس عبر الجودة الجمالية واتباع التعليمات والحفاظ على هوية الوجه.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-20 · قراءة 5 دقائق

التعلم التعزيزي لتوليد الصور: Qwen-Image-2.0-RL يحصل على نظام مكافآت مركب
المصادر : Qwen-Image-2.0-…

التعلم التعزيزي من التغذية الراجعة البشرية، وهي تقنية معروفة بمواءمة نماذج اللغة الكبيرة، يتم تطبيقها الآن مباشرة على نماذج الانتشار. يصف أحدث تقرير فني لفريق Qwen، الذي نُشر على arXiv في 25 يونيو، Qwen-Image-2.0-RL، وهو خط أنابيب ما بعد التدريب يستخدم RLHF والتقطير على السياسة لتحسين كل من الجودة البصرية واتباع التعليمات في النموذج الحالي Qwen-Image-2.0.

التحدي الرئيسي الذي عالجه الفريق هو أن ما بعد التدريب لنماذج التوليد يعتمد عادةً على الضبط الدقيق الخاضع للإشراف، مما قد يؤدي إلى "اختراق المكافأة"، حيث يتعلم النموذج استغلال إشارة التدريب بدلاً من التحسن الحقيقي. يقدم التعلم التعزيزي طريقة للتغلب على ذلك من خلال التحسين مباشرة مقابل وظيفة مكافأة، لكن بناء نظام مكافآت موثوق لتوليد الصور أصعب منه للنص، لأن جودة الصورة ذاتية ومتعددة الأبعاد.

نماذج مكافآت مركبة

لتوفير الإشارات المطلوبة، بنى الباحثون نماذج مكافآت مركبة خاصة بالمهام، مع ضبط نماذج الرؤية واللغة الحالية بدقة باستخدام نموذج تسجيل نقطي واستدلال سلسلة الأفكار. لتوليد النص إلى صورة، يغطي نظام المكافآت ثلاثة أبعاد: محاذاة المطالبة (مدى تطابق الصورة مع النص)، والجودة الجمالية (الجاذبية الذاتية والتكوين)، ودقة رسم الوجه (مدى جودة تقديم الوجوه). لمهام تحرير الصور، تقيم نماذج المكافآت دقة اتباع التعليمات والحفاظ على هوية الوجه، وهما جانبان غالبًا ما تعاني منهما نماذج الانتشار، خاصةً عندما يُطلب منها تعديل ميزات محددة مع الحفاظ على إمكانية التعرف على الشخص.

تطلب بناء هذا السقالة للمكافآت تكييف نماذج الرؤية واللغة لإخراج درجة عددية لكل صورة، بالإضافة إلى خطوة استدلال سلسلة الأفكار التي تجعل التسجيل شفافًا جزئيًا. يلاحظ التقرير أن نموذج التسجيل هذا تفوق على التفضيلات الزوجية في الاتساق والموثوقية.

مخطط: خط أنابيب ما بعد التدريب لـ Qwen-Image-2.0-RL
يبدأ خط الأنابيب بنموذج Qwen-Image-2.0 الأساسي، ويستخدم نماذج المكافآت المركبة لتوجيه تدريب GRPO إلى اثنتين من سياسات التعلم التعزيزي المتخصصة، ثم يدمجهما عبر التقطير على السياسة في النموذج النهائي Qwen-Image-2.0-RL، كما هو موصوف في التقرير الفني لفريق Qwen.

تدريب GRPO قابل للتوسع

مع وجود نظام المكافآت، طور الفريق إطار تدريب قابل للتوسع يعتمد على تحسين السياسة النسبية الجماعية (GRPO)، وهو متغير من التعلم التعزيزي يقارن مجموعات من الإكمالات بدلاً من الإكمالات الفردية. يتضمن خط الأنابيب ثلاثة خيارات هندسية تهدف إلى الحفاظ على المعرفة المدربة مسبقًا أثناء تعلم سلوكيات جديدة:

  • التوجيه الخالي من التصنيف الهجين (CFG): يتحول النموذج بين مقاييس CFG المدربة والمجمدة أثناء التدريب لتجنب نسيان التوزيع الأصلي، وهي مشكلة معروفة عند تطبيق التعلم التعزيزي على نماذج الانتشار من الصفر.
  • تصفية نطاق المكافأة داخل المجموعة: تختلف جودة التوليد على مستوى المطالبة، ويمكن أن تحتوي دفعة على مخرجات ممتازة وسيئة لنفس المطالبة. يقوم الفريق بتصفية المطالبات حسب نطاق المكافآت داخل مجموعتها، متجاهلاً تلك التي تسجل فيها جميع المتغيرات درجات متشابهة أو حيث يكون الانتشار ضيقًا جدًا لتوفير تدرج مفيد.
  • معايرة وزن المكافأة لكل فئة: ليست جميع أبعاد المكافأة مهمة بنفس القدر لكل مطالبة. يقوم النظام بضبط الوزن المخصص للمحاذاة مقابل الجماليات مقابل دقة رسم الوجه ديناميكيًا بناءً على فئة المطالبة، مما يمنع أي مقياس واحد من السيطرة على إشارة التدريب.

لا يكشف التقرير عن حجم النموذج أو قوة الحوسبة التدريبية، لكن النهج مصمم ليتم تطبيقه فوق نموذج انتشار موجود مدرب مسبقًا وضبط بدقة تحت الإشراف، مما يعني أن مرحلة التعلم التعزيزي تضيف تكلفة هامشية مقارنة بالتدريب من الصفر.

التقطير على السياسة يدمج سياستين

قرار تصميم ملحوظ هو فصل مرحلة التدريب. قام الفريق أولاً بتدريب سياستين منفصلتين للتعلم التعزيزي، واحدة متخصصة في توليد النص إلى صورة، والأخرى في تحرير الصور، ثم دمجهما في نموذج واحد باستخدام التقطير على السياسة. تعامل هذه المرحلة الأخيرة النموذجين المتخصصين كمعلمين ونسخة جديدة من النموذج الأساسي كطالب، وتدريبه على مطابقة سرعة مسار المعلمين، أي اتجاه وحجم التحديثات في كل خطوة، بدلاً من المخرجات النهائية فقط. هذا يتجنب النسيان الكارثي الذي يحدث غالبًا عند ضبط نموذج واحد بدقة على مهمتين مختلفتين بالتتابع.

النموذج الطالب الناتج، Qwen-Image-2.0-RL، تم تقييمه على Qwen-Image-Bench، مجموعة المعايير الخاصة بالفريق، حيث سجل 57.84 بشكل عام، بتحسن +2.61 عن النموذج الأساسي Qwen-Image-2.0. في مجال النص إلى صورة، حقق تصنيف Elo قدره 1193 (+78)، وفي مجال تحرير الصور، 1349 (+93).

الزيادة في Elo في مجال التحرير هي الأكبر من الاثنتين، مما قد يعكس حقيقة أن التحرير الموجه، أي تعديل منطقة معينة من صورة موجودة دون تدهور الباقي، لا يزال أحد أصعب المشكلات لنماذج الانتشار وبالتالي يوفر مساحة أكبر للتحسين من خلال ما بعد التدريب القائم على التعلم التعزيزي.

أسئلة مفتوحة

التقرير هو ورقة فنية وليس إطلاق منتج، وتبقى عدة أسئلة دون إجابة. تم ضبط نماذج المكافآت المركبة بدقة على مجموعة بيانات غير معلنة من التفضيلات البشرية، ومقاييس التقييم كلها داخلية لفريق Qwen. من شأن التحقق المستقل، خاصةً على معيار التحرير، حيث يصعب تقييم الحفاظ على هوية الوجه تحت التحرير تلقائيًا، أن يعزز الادعاءات.

لا توجد أيضًا مقارنة مع طرق ما بعد التدريب البديلة مثل تحسين التفضيل المباشر (DPO) المطبق على نماذج الانتشار. يذكر التقرير بإيجاز تجربة خسائر على غرار DPO لكنه لا يقدم مقارنات كمية. بالنظر إلى الشعبية المتزايدة لـ DPO في مجال الرؤية، فإن المقارنة المباشرة ستساعد المجتمع في تحديد متى تكون التعقيدات الإضافية لـ GRPO جديرة بالاهتمام.

تواجه التقنية قيودًا خاصة بالمجال في صياغة التقرير نفسه. تفترض نماذج المكافآت لدقة رسم الوجه أن الوجوه هي الموضوع الرئيسي؛ بالنسبة للمشاهد التي لا تظهر فيها وجوه بشرية، يتم ببساطة صفر هذا البعد. بشكل أوسع، لا يزال بناء نماذج مكافآت قوية لمطالبات عشوائية، خاصة تلك التي تتضمن مفاهيم مجردة أو جماليات غير عادية، غير محلول، ومن المحتمل أن يتدهور أداء النظام على المطالبات البعيدة عن توزيع الضبط الدقيق.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.