تعلم التعزيز

26 published articles

نماذج اللغات الكبيرةFeatured5 min read

أبحاث الذكاء الاصطناعي

التعلم التعزيزي لتوليد الصور: Qwen-Image-2.0-RL يحصل على نظام مكافآت مركب

يصف تقرير Qwen-Image-2.0-RL خط أنابيب ما بعد التدريب الذي يجمع بين RLHF والتقطير على السياسة ونماذج المكافآت المركبة لتحسين جودة تحويل النص إلى صورة وتحرير الصور. يحقق النهج مكاسب قابلة للقياس عبر الجودة الجمالية واتباع التعليمات والحفاظ على هوية الوجه.

2026-07-20

Sakana AI7 min read

الذكاء الاصطناعي القابل للتحقق بيولوجيًا

إصلاح واحد أنقذ CIFAR-10 ولم يفعل شيئًا لـ MNIST، وهذا يجب أن يقلق باحثي الذكاء الاصطناعي

تمكنت Sakana AI من توسيع نطاق خطأ الانتشار المشابه للدماغ، الخالي من الانتشار العكسي، إلى CIFAR-10 وRL. المشكلة: أي اختيارات تصميم تعتمد على المعايير تنعكس بين المعايير القياسية، وتكلفة مبدأ ديل تزداد مع صعوبة المهمة.

2026-07-19

المختبرات والأبحاثFeatured4 min read

أبحاث الذكاء الاصطناعي

حل مكون من كلمتين لمشكلة التخريب الذاتي في التعلم التعزيزي

التعلم التعزيزي متعدد المهام له سر قذر: إشارات المكافأة التي تدفع التوافق غالباً ما تعمل ضد بعضها البعض. نشر فريق دولي للتو طريقة تمنع النظام من محاربة نفسه، وتكاد لا تكلف شيئاً لإضافتها إلى خطوط الأنابيب الحالية.

2026-07-19

نماذج اللغات الكبيرةFeatured4 min read

الذكاء الاصطناعي التجسيدي

نموذج 8B الصغير من ميسترال يجعل الليدار اختياريًا للروبوتات المكتبية

Robostral Navigate من ميسترال هو نموذج 8B يستخدم كاميرا RGB واحدة فقط لتحقيق 76.6% على معايير R2R-CE، متجاوزًا الأساليب متعددة المستشعرات بـ 4.5 نقطة. بُني ببيانات محاكاة وطريقة تخزين مؤقت مسبق للرموز موفرة للكفاءة، فهو يعمم عبر أنواع الروبوتات ويتكيف مع العقبات غير المرئية.

2026-07-17

الذكاء الاصطناعيFeatured5 min read

أبحاث الذكاء الاصطناعي

العائق الذي يعيق وكلاء الذكاء الاصطناعي ليس الاستكشاف، بل التقييم

ورقتان بحثيتان جديدتان من Hugging Face تعالجان نفس المشكلة الأساسية من اتجاهين متعاكسين: كيفية جعل وكلاء الذكاء الاصطناعي يقيمون أفعالهم بشكل موثوق. تبني AJ-Bench معيارًا لوكلاء القضاة المدركين للبيئة، بينما تجادل HeavySkill بأن أفضل قاضٍ يقع داخل معلمات النموذج نفسه.

2026-07-17

نماذج اللغات الكبيرة4 min read

الذكاء الاصطناعي

علي بابا تنشر نموذجًا عالميًا مفتوح المصدر يتيح لوكلاء الذكاء الاصطناعي التدريب داخل محاكي

أطلق فريق Qwen التابع لشركة علي بابا نموذج Qwen-AgentWorld، وهو نموذج عالمي لغوي يحاكي بيئات الوكلاء عبر سبعة مجالات. خط أنابيبه الثلاثي المراحل، CPT، SFT، RL، ينتج محاكيًا يتفوق على GPT-5.4 في الدقة ويتيح للوكلاء التدريب عبر البروفة الذهنية بدلاً من عمليات النشر المكلفة في البيئة الحقيقية.

2026-07-16

الأدوات والأطرFeatured2 min read

أدوات للتعلم المعزز

Tinker-atropos يربط تجارب التعلم المعزز بإطار عمل Atropos

تطلق Nous Research أداة tinker-atropos، وهي طبقة تكامل بين واجهة Tinker API وإطار عمل التعلم المعزز Atropos. تفصل خدمات المدرب، وجمع النتائج، والبيئة إلى مكونات قابلة للنشر بشكل مستقل لتجارب تعلم معزز أكثر مرونة.

2026-07-16

نماذج اللغات الكبيرة2 min read

البرمجة التنافسية

نوسكودر-14B يتحدى برمجة الأولمبياد بخط أنابيب تعزيز مفتوح

تطلق Nous Research نموذج NousCoder-14B، وهو نموذج برمجة تنافسية مبني على Qwen3-14B عبر التعلم المعزز. مجموعة كاملة مفتوحة المصدر: الأوزان والبيئة ومجموعة التقييم. يستهدف معايير البرمجة على مستوى الأولمبياد.

2026-07-16

الذكاء الاصطناعيFeatured5 min read

الذكاء الاصطناعي

مينيماكس M3 وفن جعل نموذج الإثبات مقاومًا للاختراق

تشرح مينيماكس التفاصيل الهندسية وراء قدرات الإثبات لنموذج M3: مُحقق متعدد الطبقات اجتاز نمط فشل اختراق المكافآت الذي عانى منه دورة M2، وإطار MaxProof القائم على الاختبار عند وقت التشغيل على مستوى المجموعة، والذي يحول أخذ العينات إلى بحث موجه. في مسابقتَي IMO 2025 و USAMO 2026، يتجاوز نموذج M3 مع MaxProof عتبة الميدالية الذهبية البشرية.

2026-07-16

وكلاء الذكاء الاصطناعي3 min read

وكلاء الذكاء الاصطناعي

OpenManus قضى على جدار الدعوات لوكلاء الذكاء الاصطناعي. إليك كيفية تشغيله في عشر دقائق.

OpenManus هو إطار عمل مفتوح المصدر لوكلاء الذكاء الاصطناعي يمكن لأي شخص تثبيته وتشغيله فورًا: لا حاجة لرمز دعوة، ولا حيل، فقط بيئة بايثون ومفتاح API. إليك لماذا تحتاجه.

2026-07-11

NLP والتعلم الآليFeatured4 min read

أبحاث الذكاء الاصطناعي

لماذا يهيمن GPT-5.5 على معيار يختبر كيف يحسن الوكلاء أنفسهم

يعزل EvoPolicyGym قدرة حرجة ولكنها غير مدروسة بشكل كافٍ: قدرة الوكيل على تحسين سياسة قابلة للتنفيذ من خلال تعديلات متكررة مقيدة بردود الفعل. يكشف المعيار أن GPT-5.5 هو أقوى أداء عبر 16 بيئة، ويوفر تشخيصات على مستوى المسار تكشف كيف تخصص الوكلاء المختلفون الميزانية ويحولون ردود الفعل إلى معلمات مضبوطة.

2026-07-11

xAI / GrokFeatured3 min read

Grok 4.5

تم بناء Grok 4.5 من Cursor بواسطة وكلاء ذكاء اصطناعي، وليس بشرًا. هذه هي القصة الحقيقية.

Grok 4.5 من Cursor هو نموذج خليط من الخبراء (Mixture-of-Experts) تم بناؤه باستخدام التعلم المعزز في بيئات أنشأها وكلاء ذكاء اصطناعي سابقون، وليس بشرًا. يتعامل مع المهام المعقدة طويلة المدة عبر هندسة البرمجيات، وعلوم البيانات، والمالية، والقانون، وهو متاح الآن.

2026-07-10

← PreviousPage 2 / 3 · 26 articlesNext →