تعلم التعزيز
29 published articles
فيشر-R1 | اختبار الفرضيات
وكلاء الذكاء الاصطناعي ينفذون الإحصاءات بدقة تامة ومع ذلك يصلون إلى استنتاجات خاطئة
يمكن للوكلاء الذين يؤتمتون اختبار الفرضيات تنفيذ التحليلات بدقة تامة ومع ذلك الوصول إلى استنتاجات خاطئة، لأن معظم المعايير لا تتحقق أبدًا مما إذا كانت القيمة الاحتمالية (p-value) صالحة. معيار من 425 مهمة يحدد حجم الفجوة، ونموذج مفتوح الأوزان مدرب بتعلّم التعزيز يقلص جزءًا منها.
2026-08-19
أبحاث
نموذج الذكاء الاصطناعي الذي يستخدم الأدوات يجعل الأسئلة السهلة أصعب
ورقة بحثية جديدة من KlingTeam تقيس متى تحتاج النماذج متعددة الوسائط إلى الأدوات فعلًا ومتى تضرّها الأدوات. نموذج Beacon المقترح، المدرَّب بمكافآت تراعي الضرورة، يحسّن الدقة وانضباط استخدام الأدوات معًا.
2026-08-09
الذكاء الاصطناعي القابل للتفسير
المقبض الذي لم يرد أحد تدويره: dtControl2+ε يتيح لك التضحية بالمثالية من أجل الوضوح
يسمح امتداد جديد لـ dtControl2 للمهندسين بمبادلة كمية محددة من الأداء بأشجار قرار أصغر حجمًا وأكثر قابلية للفهم. تضمن الأداة dtControl2+ε المثالية ε أثناء تقليم الأشجار إلى عدد أقل من العقد بعدة مراتب.
2026-08-05
مصدر مفتوح
OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم
OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.
2026-08-01
ذكاء اصطناعي للبحث العميق
عامل البحث الجديد من BAAI لا يبحث لفترة أطول فحسب، بل يراجع واجباته بنفسه
تستخدم عوامل AREX من BAAI حلقة تحسين ذاتي متكررة تضغط سجلات البحث الطويلة، مما يتيح تحسينًا فعالًا قائمًا على التحقق. تم تدريبها باستخدام وصفة تعلم تعزيزي جديد طويل الأمد، وتتفوق على خطوط الأساس المماثلة في BrowseComp وDeepSearchQA وHLE.
2026-07-31
التعلم المعزز
حل مايكروسوفت للتعلم التجريبي يمنح نماذج الذكاء الاصطناعي مدربًا، وليس مجرد درجة
التعلم التجريبي يعيد توظيف نموذج اللغة الكبير كحكم إلى نموذج اللغة الكبير كمدرب يستخرج معرفة قابلة للنقل من كل استجابة ويستوعبها عبر تقطير السياق القائم على السياسة، متغلبًا على التعلم المعزز القائم على معايير التقييم في المهام المحتجزة ويقلل من اختراق المكافأة.
2026-07-30
بحث
التعلم المعزز القابل للتفسير يتعامل مع مراقبة الحركة الجوية، خريطة واحدة في كل مرة
يطبق فريق من الباحثين التعلم المعزز القابل للتفسير على التحكم في الحركة الجوية، وتدريب وكيل لتجنب مناطق حظر الطيران واستخدام خرائط البروز للكشف عن منطقه. العمل هو خطوة أولية نحو الثقة في الذكاء الاصطناعي عالي المخاطر.
2026-07-27
بحث
الذاكرة المشتركة سيف ذو حدين: توسيع خوارزميات الممثل-الناقد إلى ما بعد خمسة عوامل يُظهر عوائد متناقصة
قام الباحثون بمشاركة مخازن التكرار عبر عوامل الممثل-الناقد في مهام الإجراءات المعلمية. قفز أداء GAC بشكل ملحوظ، لكن SAC و TQC تقدما فقط بخطوات بطيئة. بعد خمسة عوامل، ترتفع التكلفة الحاسوبية دون عائد ذي معنى. تقدم الورقة حدًا عمليًا لمدى قدرة طرق الخبرة المشتركة على التقدم قبل أن تتوقف.
2026-07-27
أبحاث واجهة الدماغ الحاسوبية
التعلم المعزز يحسن فك تشفير واجهة الدماغ الحاسوبية بنسبة 41%
يقترح الباحثون CNN-LSTM-RL، وهو إطار ذو مرحلتين يطبق التعلم المعزز لتصحيح الأخطاء المنهجية في أجهزة فك التشفير غير الغازية لواجهة الدماغ الحاسوبية. بدون أي بيانات عصبية إضافية، حسنت الطريقة ارتباط فك التشفير ثلاثي الأبعاد للحركة بنسبة 41.5% وخفضت جذر متوسط مربع الخطأ بنسبة 40.2% عبر عشرة مشاركين.
2026-07-27
التعلم بالتعزيز
باحثون من ميتا وجامعة إلينوي في أوربانا-شامبين يدربون نماذج الرؤية واللغة على التحقق من عملهم وإعادة التفكير في الإجابات الخاطئة
يحول SVR-R1 الحكم الذاتي الثنائي لنموذج الرؤية واللغة إلى إشارة تعلم. تم اختباره على معايير تفكير الرسم البياني والجداول، ويتفوق على GRPO القياسي بهامش كبير بينما يحتاج النموذج تدريجياً إلى جولات تحقق أقل، مما يشير إلى أنه يستوعب التصحيح الذاتي.
2026-07-25
الذكاء الاصطناعي
نماذج أصغر تعيد النظر في حلها باستمرار يمكنها التفوق على نماذج أكبر بعشر مرات
يدرب RefineRL نماذج لغوية صغيرة على تحسين حلولها البرمجية التنافسية بشكل تكراري باستخدام وكيل متشكك وتعزيز التعلم يحقق نموذج 4B باستخدام هذه الطريقة أداءً يتفوق على نماذج 32B ويقترب من أداء 235B، مما يشير إلى أن التحسين الذاتي، وليس الحجم الخام، قد يكون مسارًا أقوى للتفكير في مهام الاستدلال.
2026-07-25
بحث
فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي
SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.
2026-07-25