التعلم بالتعزيز
باحثون من ميتا وجامعة إلينوي في أوربانا-شامبين يدربون نماذج الرؤية واللغة على التحقق من عملهم وإعادة التفكير في الإجابات الخاطئة
يحول SVR-R1 الحكم الذاتي الثنائي لنموذج الرؤية واللغة إلى إشارة تعلم. تم اختباره على معايير تفكير الرسم البياني والجداول، ويتفوق على GRPO القياسي بهامش كبير بينما يحتاج النموذج تدريجياً إلى جولات تحقق أقل، مما يشير إلى أنه يستوعب التصحيح الذاتي.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-25 · قراءة 4 دقائق

عندما يُمنح الإنسان فرصة ثانية للتفكير، فإنه غالبًا ما يصل إلى إجابات أفضل. تظهر ورقة بحثية جديدة من ميتا وجامعة إلينوي في أوربانا-شامبين أن نماذج الرؤية واللغة (VLMs) يمكنها تعلم فعل الشيء نفسه، من خلال التحقق من عملها وإعادة التفكير عندما تشير إلى أن الإجابة خاطئة، كل ذلك ضمن حلقة تعلم بالتعزيز لا تحتاج إلى قضاة خارجيين أو منتقدين مساعدين.
يستخدم إطار العمل، وهو العقل المدقق الذاتي (SVR-R1)، مخطط تدريب بالتعزيز متعدد الجولات مبني على GRPO. لكل استعلام، ينتج النموذج إجابة ويصدر في الوقت نفسه حكمًا ذاتيًا ثنائيًا (نعم أو لا). يؤدي الخيار "لا" إلى إعادة تفكير كفرصة ثانية؛ بينما يؤدي الخيار "نعم" (أو الوصول إلى حد الجولات) إلى إنهاء المخرجات، التي تتلقى بعد ذلك مكافأة قائمة على النتيجة. تعمل أوزان النموذج نفسها كمولد ومدقق، ويتم إخفاء رموز التحقق من حساب الخسارة لتجنب إشارات التحسين المتضاربة.
نتائج تتحدث عن نفسها
عند تقييمه على مجموعة ChartQA (826 زوجًا من أسئلة وأجوبة الاختبار) ومجموعة TableVQA (1250 سؤالًا قائمًا على الجداول)، تفوق SVR-R1 باستمرار على معايير GRPO القياسية على مقياسي 3 مليار و7 مليار معامل. على ChartQA، حقق SVR-R1 بحجم 3 مليار دقة 83.3% في وضع التشغيل النقي (بدون تحقق في مرحلة الاستدلال) مقابل 80.5% لمعيار GRPO. مع تفعيل التحقق النهائي في مرحلة الاستدلال، وصل SVR-R1 إلى نفس الدقة 83.3% بينما وصل المعيار إلى 80.9%. على TableVQA، وصل SVR-R1 بحجم 3 مليار إلى 72.4% (تشغيل نقي) و72.9% (مع التحقق)، مقارنة بـ 68.3% و68.7% لـ GRPO.
تُحقق مكاسب مماثلة على مقياس 7 مليار. على ChartQA، سجل SVR-R1 82.9% (تشغيل نقي ومع التحقق) مقابل 80.4% و81.1% لـ GRPO. على TableVQA، سجل SVR-R1 80.3% و80.6% مقابل 78.7% و78.5% لـ GRPO. على معيار التفكير العام ThinkLite-VL-70K، تفوق SVR-R1 على أفضل معيار GRPO على MathVista (71.6% مقابل 70.8%)، وMathVision (19.1% مقابل 17.4%)، وMMStar (49.3% مقابل 48.7%)، بينما تطابق على AI2D (81.4% مقابل 81.5%).
جولات تحقق أقل، ثقة أعلى
أكثر الديناميكيات إثارة للاهتمام أثناء التدريب هو الانخفاض المطرد في متوسط عدد جولات التحقق. مع تدريب النموذج، يصبح أكثر ثقة في إجاباته الأولية ويميل إلى تأكيدها فورًا، ليستقر على حوالي خطوة توليد واحدة تليها كلمة "نعم" واحدة من المدقق. بحلول مراحل التدريب المتأخرة، يحقق SVR-R1 دقة متطابقة تقريبًا في إعدادات التشغيل النقي والتحقق النهائي، مما يشير إلى أن النموذج قد استوعب التصحيح الذاتي ويمكنه إنتاج إجابات يعتبرها صحيحة دون الحاجة إلى إجراء عملية إعادة التفكير فعليًا في وقت الاستدلال.
يعزو المؤلفون جزءًا من هذا الكسب إلى قدرة الإطار على إنهاء الإجابات عالية الجودة للأسئلة متوسطة الصعوبة من خلال جولات طرح متعددة. إعادة التفكير المتكرر في الأسئلة الصعبة للغاية يساهم بقليل، حيث قد تظل الإجابة الصحيحة بعيدة المنال حتى مع جولات تحقق غير محدودة.
تداعيات عملية وأسئلة مفتوحة
يسد SVR-R1 الفجوة الأقل استكشافًا بين التحسين الذاتي في وقت الاستدلال وتدريب التعلم بالتعزيز لنماذج الرؤية واللغة. بالاعتماد فقط على التحقق الذاتي الثنائي (نعم/لا)، يتجنب النهج الحاجة إلى مبررات مفصلة أو علامات حقيقة خارجية، مما يجعله قابلاً للتوسع وفعالاً من حيث البيانات. يخطط الباحثون لجعل SVR-R1 مفتوح المصدر لتمكين المزيد من العمل على التفكير متعدد الوسائط.
تثير الورقة أيضًا أسئلة حول كيفية تحسين قدرات التحقق والتوليد بشكل مشترك، خاصة مع تحسن قدرات التحقق الذاتي لنماذج الرؤية واللغة. في الوقت الحالي، يقدم SVR-R1 وصفة بسيطة لتعزيز التفكير متعدد الوسائط لا تتطلب أكثر من قدرة النموذج على قول نعم أو لا لمحاولته الأولى.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.