تعلم التعزيز

29 published articles

المختبرات والأبحاث3 min read

فيشر-R1 | اختبار الفرضيات

وكلاء الذكاء الاصطناعي ينفذون الإحصاءات بدقة تامة ومع ذلك يصلون إلى استنتاجات خاطئة

يمكن للوكلاء الذين يؤتمتون اختبار الفرضيات تنفيذ التحليلات بدقة تامة ومع ذلك الوصول إلى استنتاجات خاطئة، لأن معظم المعايير لا تتحقق أبدًا مما إذا كانت القيمة الاحتمالية (p-value) صالحة. معيار من 425 مهمة يحدد حجم الفجوة، ونموذج مفتوح الأوزان مدرب بتعلّم التعزيز يقلص جزءًا منها.

2026-08-19

نماذج اللغات الكبيرة3 min read

أبحاث

نموذج الذكاء الاصطناعي الذي يستخدم الأدوات يجعل الأسئلة السهلة أصعب

ورقة بحثية جديدة من KlingTeam تقيس متى تحتاج النماذج متعددة الوسائط إلى الأدوات فعلًا ومتى تضرّها الأدوات. نموذج Beacon المقترح، المدرَّب بمكافآت تراعي الضرورة، يحسّن الدقة وانضباط استخدام الأدوات معًا.

2026-08-09

الذكاء الاصطناعي3 min read

الذكاء الاصطناعي القابل للتفسير

المقبض الذي لم يرد أحد تدويره: dtControl2+ε يتيح لك التضحية بالمثالية من أجل الوضوح

يسمح امتداد جديد لـ dtControl2 للمهندسين بمبادلة كمية محددة من الأداء بأشجار قرار أصغر حجمًا وأكثر قابلية للفهم. تضمن الأداة dtControl2+ε المثالية ε أثناء تقليم الأشجار إلى عدد أقل من العقد بعدة مراتب.

2026-08-05

مفتوح المصدر2 min read

مصدر مفتوح

OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم

OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.

2026-08-01

وكلاء الذكاء الاصطناعي3 min read

ذكاء اصطناعي للبحث العميق

عامل البحث الجديد من BAAI لا يبحث لفترة أطول فحسب، بل يراجع واجباته بنفسه

تستخدم عوامل AREX من BAAI حلقة تحسين ذاتي متكررة تضغط سجلات البحث الطويلة، مما يتيح تحسينًا فعالًا قائمًا على التحقق. تم تدريبها باستخدام وصفة تعلم تعزيزي جديد طويل الأمد، وتتفوق على خطوط الأساس المماثلة في BrowseComp وDeepSearchQA وHLE.

2026-07-31

نماذج اللغات الكبيرة3 min read

التعلم المعزز

حل مايكروسوفت للتعلم التجريبي يمنح نماذج الذكاء الاصطناعي مدربًا، وليس مجرد درجة

التعلم التجريبي يعيد توظيف نموذج اللغة الكبير كحكم إلى نموذج اللغة الكبير كمدرب يستخرج معرفة قابلة للنقل من كل استجابة ويستوعبها عبر تقطير السياق القائم على السياسة، متغلبًا على التعلم المعزز القائم على معايير التقييم في المهام المحتجزة ويقلل من اختراق المكافأة.

2026-07-30

المختبرات والأبحاثFeatured1 min read

بحث

التعلم المعزز القابل للتفسير يتعامل مع مراقبة الحركة الجوية، خريطة واحدة في كل مرة

يطبق فريق من الباحثين التعلم المعزز القابل للتفسير على التحكم في الحركة الجوية، وتدريب وكيل لتجنب مناطق حظر الطيران واستخدام خرائط البروز للكشف عن منطقه. العمل هو خطوة أولية نحو الثقة في الذكاء الاصطناعي عالي المخاطر.

2026-07-27

NLP والتعلم الآلي3 min read

بحث

الذاكرة المشتركة سيف ذو حدين: توسيع خوارزميات الممثل-الناقد إلى ما بعد خمسة عوامل يُظهر عوائد متناقصة

قام الباحثون بمشاركة مخازن التكرار عبر عوامل الممثل-الناقد في مهام الإجراءات المعلمية. قفز أداء GAC بشكل ملحوظ، لكن SAC و TQC تقدما فقط بخطوات بطيئة. بعد خمسة عوامل، ترتفع التكلفة الحاسوبية دون عائد ذي معنى. تقدم الورقة حدًا عمليًا لمدى قدرة طرق الخبرة المشتركة على التقدم قبل أن تتوقف.

2026-07-27

الذكاء الاصطناعي4 min read

أبحاث واجهة الدماغ الحاسوبية

التعلم المعزز يحسن فك تشفير واجهة الدماغ الحاسوبية بنسبة 41%

يقترح الباحثون CNN-LSTM-RL، وهو إطار ذو مرحلتين يطبق التعلم المعزز لتصحيح الأخطاء المنهجية في أجهزة فك التشفير غير الغازية لواجهة الدماغ الحاسوبية. بدون أي بيانات عصبية إضافية، حسنت الطريقة ارتباط فك التشفير ثلاثي الأبعاد للحركة بنسبة 41.5% وخفضت جذر متوسط مربع الخطأ بنسبة 40.2% عبر عشرة مشاركين.

2026-07-27

الذكاء الاصطناعي3 min read

التعلم بالتعزيز

باحثون من ميتا وجامعة إلينوي في أوربانا-شامبين يدربون نماذج الرؤية واللغة على التحقق من عملهم وإعادة التفكير في الإجابات الخاطئة

يحول SVR-R1 الحكم الذاتي الثنائي لنموذج الرؤية واللغة إلى إشارة تعلم. تم اختباره على معايير تفكير الرسم البياني والجداول، ويتفوق على GRPO القياسي بهامش كبير بينما يحتاج النموذج تدريجياً إلى جولات تحقق أقل، مما يشير إلى أنه يستوعب التصحيح الذاتي.

2026-07-25

الذكاء الاصطناعيFeatured3 min read

الذكاء الاصطناعي

نماذج أصغر تعيد النظر في حلها باستمرار يمكنها التفوق على نماذج أكبر بعشر مرات

يدرب RefineRL نماذج لغوية صغيرة على تحسين حلولها البرمجية التنافسية بشكل تكراري باستخدام وكيل متشكك وتعزيز التعلم يحقق نموذج 4B باستخدام هذه الطريقة أداءً يتفوق على نماذج 32B ويقترب من أداء 235B، مما يشير إلى أن التحسين الذاتي، وليس الحجم الخام، قد يكون مسارًا أقوى للتفكير في مهام الاستدلال.

2026-07-25

نماذج اللغات الكبيرةFeatured4 min read

بحث

فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي

SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.

2026-07-25

← PreviousPage 1 / 3 · 29 articlesNext →