تعلم التعزيز
26 published articles
مصدر مفتوح
OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم
OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.
2026-08-01
ذكاء اصطناعي للبحث العميق
عامل البحث الجديد من BAAI لا يبحث لفترة أطول فحسب، بل يراجع واجباته بنفسه
تستخدم عوامل AREX من BAAI حلقة تحسين ذاتي متكررة تضغط سجلات البحث الطويلة، مما يتيح تحسينًا فعالًا قائمًا على التحقق. تم تدريبها باستخدام وصفة تعلم تعزيزي جديد طويل الأمد، وتتفوق على خطوط الأساس المماثلة في BrowseComp وDeepSearchQA وHLE.
2026-07-31
التعلم المعزز
حل مايكروسوفت للتعلم التجريبي يمنح نماذج الذكاء الاصطناعي مدربًا، وليس مجرد درجة
التعلم التجريبي يعيد توظيف نموذج اللغة الكبير كحكم إلى نموذج اللغة الكبير كمدرب يستخرج معرفة قابلة للنقل من كل استجابة ويستوعبها عبر تقطير السياق القائم على السياسة، متغلبًا على التعلم المعزز القائم على معايير التقييم في المهام المحتجزة ويقلل من اختراق المكافأة.
2026-07-30
بحث
التعلم المعزز القابل للتفسير يتعامل مع مراقبة الحركة الجوية، خريطة واحدة في كل مرة
يطبق فريق من الباحثين التعلم المعزز القابل للتفسير على التحكم في الحركة الجوية، وتدريب وكيل لتجنب مناطق حظر الطيران واستخدام خرائط البروز للكشف عن منطقه. العمل هو خطوة أولية نحو الثقة في الذكاء الاصطناعي عالي المخاطر.
2026-07-27
بحث
الذاكرة المشتركة سيف ذو حدين: توسيع خوارزميات الممثل-الناقد إلى ما بعد خمسة عوامل يُظهر عوائد متناقصة
قام الباحثون بمشاركة مخازن التكرار عبر عوامل الممثل-الناقد في مهام الإجراءات المعلمية. قفز أداء GAC بشكل ملحوظ، لكن SAC و TQC تقدما فقط بخطوات بطيئة. بعد خمسة عوامل، ترتفع التكلفة الحاسوبية دون عائد ذي معنى. تقدم الورقة حدًا عمليًا لمدى قدرة طرق الخبرة المشتركة على التقدم قبل أن تتوقف.
2026-07-27
أبحاث واجهة الدماغ الحاسوبية
التعلم المعزز يحسن فك تشفير واجهة الدماغ الحاسوبية بنسبة 41%
يقترح الباحثون CNN-LSTM-RL، وهو إطار ذو مرحلتين يطبق التعلم المعزز لتصحيح الأخطاء المنهجية في أجهزة فك التشفير غير الغازية لواجهة الدماغ الحاسوبية. بدون أي بيانات عصبية إضافية، حسنت الطريقة ارتباط فك التشفير ثلاثي الأبعاد للحركة بنسبة 41.5% وخفضت جذر متوسط مربع الخطأ بنسبة 40.2% عبر عشرة مشاركين.
2026-07-27
التعلم بالتعزيز
باحثون من ميتا وجامعة إلينوي في أوربانا-شامبين يدربون نماذج الرؤية واللغة على التحقق من عملهم وإعادة التفكير في الإجابات الخاطئة
يحول SVR-R1 الحكم الذاتي الثنائي لنموذج الرؤية واللغة إلى إشارة تعلم. تم اختباره على معايير تفكير الرسم البياني والجداول، ويتفوق على GRPO القياسي بهامش كبير بينما يحتاج النموذج تدريجياً إلى جولات تحقق أقل، مما يشير إلى أنه يستوعب التصحيح الذاتي.
2026-07-25
الذكاء الاصطناعي
نماذج أصغر تعيد النظر في حلها باستمرار يمكنها التفوق على نماذج أكبر بعشر مرات
يدرب RefineRL نماذج لغوية صغيرة على تحسين حلولها البرمجية التنافسية بشكل تكراري باستخدام وكيل متشكك وتعزيز التعلم يحقق نموذج 4B باستخدام هذه الطريقة أداءً يتفوق على نماذج 32B ويقترب من أداء 235B، مما يشير إلى أن التحسين الذاتي، وليس الحجم الخام، قد يكون مسارًا أقوى للتفكير في مهام الاستدلال.
2026-07-25
بحث
فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي
SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.
2026-07-25
الذكاء الاصطناعي للمستندات
لماذا يتناسب أفضل محلل للمستندات الآن مع 800 مليون معلمة
نموذج OvisOCR2 من علي بابا، وهو نموذج شامل صغير بحجم 0.8 مليار معلمة، يحقق نتائج متطورة على OmniDocBench (96.58) و PureDocBench (75.06)، متجاوزًا المحللات الأكبر القائمة على خطوط الأنابيب. يعود نجاحه إلى محرك بيانات يمزج بين المستندات الحقيقية المصفاة والصفحات الاصطناعية، والتعلم المعزز على نموذج معلم بحجم 4 مليارات معلمة، والتقطير على السياسة في النموذج الصغير.
2026-07-24
وكلاء البرمجة بالذكاء الاصطناعي
نموذج Qwen-Coder-Qoder من علي بابا يتفوق على Cursor في اختبارها الخاص ويخفض استهلاك الرموز بنسبة 14.5%
نموذج البرمجة الجديد من علي بابا Qwen-Coder-Qoder يتفوق على Cursor Composer-1 في معيار Qoder Bench. تُظهر مقاييس الإنتاج زيادة بنسبة 3.85% في الاحتفاظ بالكود، وانخفاضًا بنسبة 61.5% في أخطاء الأدوات، وتقليصًا بنسبة 14.5% في استهلاك الرموز. يدرب النموذج على آثار الوكلاء الحقيقية من خلال إطار عمل المكافأة والمهاجم لمواجهة اختراق المكافآت.
2026-07-23
التعلم الممكن بيولوجياً
استبدل MNIST بـ CIFAR-10 وستنقلب وصفة الذكاء الاصطناعي الشبيه بالدماغ رأساً على عقب
قامت Sakana AI بتوسيع نطاق بنية خالية من الانتشار العكسي ومتوافقة مع مبدأ ديل لتتجاوز MNIST لأول مرة. المشكلة: أي خدعة تكون الأكثر أهمية تنعكس بين مجموعات البيانات، وهو تحذير حول كيفية قياس الذكاء الاصطناعي الممكن بيولوجياً.
2026-07-22