RLHF
2 published articles
نماذج اللغات الكبيرةFeatured5 min read
أبحاث الذكاء الاصطناعي
التعلم التعزيزي لتوليد الصور: Qwen-Image-2.0-RL يحصل على نظام مكافآت مركب
يصف تقرير Qwen-Image-2.0-RL خط أنابيب ما بعد التدريب الذي يجمع بين RLHF والتقطير على السياسة ونماذج المكافآت المركبة لتحسين جودة تحويل النص إلى صورة وتحرير الصور. يحقق النهج مكاسب قابلة للقياس عبر الجودة الجمالية واتباع التعليمات والحفاظ على هوية الوجه.
2026-07-20
المختبرات والأبحاثFeatured4 min read
أبحاث الذكاء الاصطناعي
حل مكون من كلمتين لمشكلة التخريب الذاتي في التعلم التعزيزي
التعلم التعزيزي متعدد المهام له سر قذر: إشارات المكافأة التي تدفع التوافق غالباً ما تعمل ضد بعضها البعض. نشر فريق دولي للتو طريقة تمنع النظام من محاربة نفسه، وتكاد لا تكلف شيئاً لإضافتها إلى خطوط الأنابيب الحالية.
2026-07-19