الذكاء الاصطناعيFeatured3 min read
الذكاء الاصطناعي
نماذج أصغر تعيد النظر في حلها باستمرار يمكنها التفوق على نماذج أكبر بعشر مرات
يدرب RefineRL نماذج لغوية صغيرة على تحسين حلولها البرمجية التنافسية بشكل تكراري باستخدام وكيل متشكك وتعزيز التعلم يحقق نموذج 4B باستخدام هذه الطريقة أداءً يتفوق على نماذج 32B ويقترب من أداء 235B، مما يشير إلى أن التحسين الذاتي، وليس الحجم الخام، قد يكون مسارًا أقوى للتفكير في مهام الاستدلال.
2026-07-25