تعلم التعزيز

26 published articles

مفتوح المصدر2 min read

مصدر مفتوح

OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم

OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.

2026-08-01

وكلاء الذكاء الاصطناعي3 min read

ذكاء اصطناعي للبحث العميق

عامل البحث الجديد من BAAI لا يبحث لفترة أطول فحسب، بل يراجع واجباته بنفسه

تستخدم عوامل AREX من BAAI حلقة تحسين ذاتي متكررة تضغط سجلات البحث الطويلة، مما يتيح تحسينًا فعالًا قائمًا على التحقق. تم تدريبها باستخدام وصفة تعلم تعزيزي جديد طويل الأمد، وتتفوق على خطوط الأساس المماثلة في BrowseComp وDeepSearchQA وHLE.

2026-07-31

نماذج اللغات الكبيرة3 min read

التعلم المعزز

حل مايكروسوفت للتعلم التجريبي يمنح نماذج الذكاء الاصطناعي مدربًا، وليس مجرد درجة

التعلم التجريبي يعيد توظيف نموذج اللغة الكبير كحكم إلى نموذج اللغة الكبير كمدرب يستخرج معرفة قابلة للنقل من كل استجابة ويستوعبها عبر تقطير السياق القائم على السياسة، متغلبًا على التعلم المعزز القائم على معايير التقييم في المهام المحتجزة ويقلل من اختراق المكافأة.

2026-07-30

المختبرات والأبحاثFeatured1 min read

بحث

التعلم المعزز القابل للتفسير يتعامل مع مراقبة الحركة الجوية، خريطة واحدة في كل مرة

يطبق فريق من الباحثين التعلم المعزز القابل للتفسير على التحكم في الحركة الجوية، وتدريب وكيل لتجنب مناطق حظر الطيران واستخدام خرائط البروز للكشف عن منطقه. العمل هو خطوة أولية نحو الثقة في الذكاء الاصطناعي عالي المخاطر.

2026-07-27

NLP والتعلم الآلي3 min read

بحث

الذاكرة المشتركة سيف ذو حدين: توسيع خوارزميات الممثل-الناقد إلى ما بعد خمسة عوامل يُظهر عوائد متناقصة

قام الباحثون بمشاركة مخازن التكرار عبر عوامل الممثل-الناقد في مهام الإجراءات المعلمية. قفز أداء GAC بشكل ملحوظ، لكن SAC و TQC تقدما فقط بخطوات بطيئة. بعد خمسة عوامل، ترتفع التكلفة الحاسوبية دون عائد ذي معنى. تقدم الورقة حدًا عمليًا لمدى قدرة طرق الخبرة المشتركة على التقدم قبل أن تتوقف.

2026-07-27

الذكاء الاصطناعي4 min read

أبحاث واجهة الدماغ الحاسوبية

التعلم المعزز يحسن فك تشفير واجهة الدماغ الحاسوبية بنسبة 41%

يقترح الباحثون CNN-LSTM-RL، وهو إطار ذو مرحلتين يطبق التعلم المعزز لتصحيح الأخطاء المنهجية في أجهزة فك التشفير غير الغازية لواجهة الدماغ الحاسوبية. بدون أي بيانات عصبية إضافية، حسنت الطريقة ارتباط فك التشفير ثلاثي الأبعاد للحركة بنسبة 41.5% وخفضت جذر متوسط مربع الخطأ بنسبة 40.2% عبر عشرة مشاركين.

2026-07-27

الذكاء الاصطناعي3 min read

التعلم بالتعزيز

باحثون من ميتا وجامعة إلينوي في أوربانا-شامبين يدربون نماذج الرؤية واللغة على التحقق من عملهم وإعادة التفكير في الإجابات الخاطئة

يحول SVR-R1 الحكم الذاتي الثنائي لنموذج الرؤية واللغة إلى إشارة تعلم. تم اختباره على معايير تفكير الرسم البياني والجداول، ويتفوق على GRPO القياسي بهامش كبير بينما يحتاج النموذج تدريجياً إلى جولات تحقق أقل، مما يشير إلى أنه يستوعب التصحيح الذاتي.

2026-07-25

الذكاء الاصطناعيFeatured3 min read

الذكاء الاصطناعي

نماذج أصغر تعيد النظر في حلها باستمرار يمكنها التفوق على نماذج أكبر بعشر مرات

يدرب RefineRL نماذج لغوية صغيرة على تحسين حلولها البرمجية التنافسية بشكل تكراري باستخدام وكيل متشكك وتعزيز التعلم يحقق نموذج 4B باستخدام هذه الطريقة أداءً يتفوق على نماذج 32B ويقترب من أداء 235B، مما يشير إلى أن التحسين الذاتي، وليس الحجم الخام، قد يكون مسارًا أقوى للتفكير في مهام الاستدلال.

2026-07-25

نماذج اللغات الكبيرةFeatured5 min read

بحث

فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي

SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.

2026-07-25

نماذج اللغات الكبيرةFeatured4 min read

الذكاء الاصطناعي للمستندات

لماذا يتناسب أفضل محلل للمستندات الآن مع 800 مليون معلمة

نموذج OvisOCR2 من علي بابا، وهو نموذج شامل صغير بحجم 0.8 مليار معلمة، يحقق نتائج متطورة على OmniDocBench (96.58) و PureDocBench (75.06)، متجاوزًا المحللات الأكبر القائمة على خطوط الأنابيب. يعود نجاحه إلى محرك بيانات يمزج بين المستندات الحقيقية المصفاة والصفحات الاصطناعية، والتعلم المعزز على نموذج معلم بحجم 4 مليارات معلمة، والتقطير على السياسة في النموذج الصغير.

2026-07-24

Qwen / AlibabaFeatured4 min read

وكلاء البرمجة بالذكاء الاصطناعي

نموذج Qwen-Coder-Qoder من علي بابا يتفوق على Cursor في اختبارها الخاص ويخفض استهلاك الرموز بنسبة 14.5%

نموذج البرمجة الجديد من علي بابا Qwen-Coder-Qoder يتفوق على Cursor Composer-1 في معيار Qoder Bench. تُظهر مقاييس الإنتاج زيادة بنسبة 3.85% في الاحتفاظ بالكود، وانخفاضًا بنسبة 61.5% في أخطاء الأدوات، وتقليصًا بنسبة 14.5% في استهلاك الرموز. يدرب النموذج على آثار الوكلاء الحقيقية من خلال إطار عمل المكافأة والمهاجم لمواجهة اختراق المكافآت.

2026-07-23

Sakana AIFeatured1 min read

التعلم الممكن بيولوجياً

استبدل MNIST بـ CIFAR-10 وستنقلب وصفة الذكاء الاصطناعي الشبيه بالدماغ رأساً على عقب

قامت Sakana AI بتوسيع نطاق بنية خالية من الانتشار العكسي ومتوافقة مع مبدأ ديل لتتجاوز MNIST لأول مرة. المشكلة: أي خدعة تكون الأكثر أهمية تنعكس بين مجموعات البيانات، وهو تحذير حول كيفية قياس الذكاء الاصطناعي الممكن بيولوجياً.

2026-07-22

← PreviousPage 1 / 3 · 26 articlesNext →