الاستدلال متعدد الوسائط
2 published articles
الذكاء الاصطناعي3 min read
التعلم بالتعزيز
باحثون من ميتا وجامعة إلينوي في أوربانا-شامبين يدربون نماذج الرؤية واللغة على التحقق من عملهم وإعادة التفكير في الإجابات الخاطئة
يحول SVR-R1 الحكم الذاتي الثنائي لنموذج الرؤية واللغة إلى إشارة تعلم. تم اختباره على معايير تفكير الرسم البياني والجداول، ويتفوق على GRPO القياسي بهامش كبير بينما يحتاج النموذج تدريجياً إلى جولات تحقق أقل، مما يشير إلى أنه يستوعب التصحيح الذاتي.
2026-07-25
نماذج اللغات الكبيرة4 min read
الذكاء الاصطناعي متعدد الوسائط
لماذا تحتاج نماذج الرؤية واللغة إلى نافذة ترحيل بصرية لوقف التخيل
يكشف بحث جديد عن إعادة توزيع مستقرة ثلاثية المراحل للانتباه متعدد الوسائط في نماذج الرؤية واللغة، تم تفعيلها كنافذة الترحيل البصري (VRW). يستخدم إطار عمل TRACE وحدات مدربة خفيفة الوزن لتحديد مواعيد هذه النافذة لكل مهمة، مما يحسن معايير الحساسية للتثبيت بمتوسط 4.33 نقاط ويصل إلى 6.6 نقاط.
2026-07-23