تعلم التعزيز
26 published articles
أبحاث الذكاء الاصطناعي
التعلم التعزيزي لتوليد الصور: Qwen-Image-2.0-RL يحصل على نظام مكافآت مركب
يصف تقرير Qwen-Image-2.0-RL خط أنابيب ما بعد التدريب الذي يجمع بين RLHF والتقطير على السياسة ونماذج المكافآت المركبة لتحسين جودة تحويل النص إلى صورة وتحرير الصور. يحقق النهج مكاسب قابلة للقياس عبر الجودة الجمالية واتباع التعليمات والحفاظ على هوية الوجه.
2026-07-20
الذكاء الاصطناعي القابل للتحقق بيولوجيًا
إصلاح واحد أنقذ CIFAR-10 ولم يفعل شيئًا لـ MNIST، وهذا يجب أن يقلق باحثي الذكاء الاصطناعي
تمكنت Sakana AI من توسيع نطاق خطأ الانتشار المشابه للدماغ، الخالي من الانتشار العكسي، إلى CIFAR-10 وRL. المشكلة: أي اختيارات تصميم تعتمد على المعايير تنعكس بين المعايير القياسية، وتكلفة مبدأ ديل تزداد مع صعوبة المهمة.
2026-07-19
أبحاث الذكاء الاصطناعي
حل مكون من كلمتين لمشكلة التخريب الذاتي في التعلم التعزيزي
التعلم التعزيزي متعدد المهام له سر قذر: إشارات المكافأة التي تدفع التوافق غالباً ما تعمل ضد بعضها البعض. نشر فريق دولي للتو طريقة تمنع النظام من محاربة نفسه، وتكاد لا تكلف شيئاً لإضافتها إلى خطوط الأنابيب الحالية.
2026-07-19
الذكاء الاصطناعي التجسيدي
نموذج 8B الصغير من ميسترال يجعل الليدار اختياريًا للروبوتات المكتبية
Robostral Navigate من ميسترال هو نموذج 8B يستخدم كاميرا RGB واحدة فقط لتحقيق 76.6% على معايير R2R-CE، متجاوزًا الأساليب متعددة المستشعرات بـ 4.5 نقطة. بُني ببيانات محاكاة وطريقة تخزين مؤقت مسبق للرموز موفرة للكفاءة، فهو يعمم عبر أنواع الروبوتات ويتكيف مع العقبات غير المرئية.
2026-07-17
أبحاث الذكاء الاصطناعي
العائق الذي يعيق وكلاء الذكاء الاصطناعي ليس الاستكشاف، بل التقييم
ورقتان بحثيتان جديدتان من Hugging Face تعالجان نفس المشكلة الأساسية من اتجاهين متعاكسين: كيفية جعل وكلاء الذكاء الاصطناعي يقيمون أفعالهم بشكل موثوق. تبني AJ-Bench معيارًا لوكلاء القضاة المدركين للبيئة، بينما تجادل HeavySkill بأن أفضل قاضٍ يقع داخل معلمات النموذج نفسه.
2026-07-17
الذكاء الاصطناعي
علي بابا تنشر نموذجًا عالميًا مفتوح المصدر يتيح لوكلاء الذكاء الاصطناعي التدريب داخل محاكي
أطلق فريق Qwen التابع لشركة علي بابا نموذج Qwen-AgentWorld، وهو نموذج عالمي لغوي يحاكي بيئات الوكلاء عبر سبعة مجالات. خط أنابيبه الثلاثي المراحل، CPT، SFT، RL، ينتج محاكيًا يتفوق على GPT-5.4 في الدقة ويتيح للوكلاء التدريب عبر البروفة الذهنية بدلاً من عمليات النشر المكلفة في البيئة الحقيقية.
2026-07-16
أدوات للتعلم المعزز
Tinker-atropos يربط تجارب التعلم المعزز بإطار عمل Atropos
تطلق Nous Research أداة tinker-atropos، وهي طبقة تكامل بين واجهة Tinker API وإطار عمل التعلم المعزز Atropos. تفصل خدمات المدرب، وجمع النتائج، والبيئة إلى مكونات قابلة للنشر بشكل مستقل لتجارب تعلم معزز أكثر مرونة.
2026-07-16
البرمجة التنافسية
نوسكودر-14B يتحدى برمجة الأولمبياد بخط أنابيب تعزيز مفتوح
تطلق Nous Research نموذج NousCoder-14B، وهو نموذج برمجة تنافسية مبني على Qwen3-14B عبر التعلم المعزز. مجموعة كاملة مفتوحة المصدر: الأوزان والبيئة ومجموعة التقييم. يستهدف معايير البرمجة على مستوى الأولمبياد.
2026-07-16
الذكاء الاصطناعي
مينيماكس M3 وفن جعل نموذج الإثبات مقاومًا للاختراق
تشرح مينيماكس التفاصيل الهندسية وراء قدرات الإثبات لنموذج M3: مُحقق متعدد الطبقات اجتاز نمط فشل اختراق المكافآت الذي عانى منه دورة M2، وإطار MaxProof القائم على الاختبار عند وقت التشغيل على مستوى المجموعة، والذي يحول أخذ العينات إلى بحث موجه. في مسابقتَي IMO 2025 و USAMO 2026، يتجاوز نموذج M3 مع MaxProof عتبة الميدالية الذهبية البشرية.
2026-07-16
وكلاء الذكاء الاصطناعي
OpenManus قضى على جدار الدعوات لوكلاء الذكاء الاصطناعي. إليك كيفية تشغيله في عشر دقائق.
OpenManus هو إطار عمل مفتوح المصدر لوكلاء الذكاء الاصطناعي يمكن لأي شخص تثبيته وتشغيله فورًا: لا حاجة لرمز دعوة، ولا حيل، فقط بيئة بايثون ومفتاح API. إليك لماذا تحتاجه.
2026-07-11
أبحاث الذكاء الاصطناعي
لماذا يهيمن GPT-5.5 على معيار يختبر كيف يحسن الوكلاء أنفسهم
يعزل EvoPolicyGym قدرة حرجة ولكنها غير مدروسة بشكل كافٍ: قدرة الوكيل على تحسين سياسة قابلة للتنفيذ من خلال تعديلات متكررة مقيدة بردود الفعل. يكشف المعيار أن GPT-5.5 هو أقوى أداء عبر 16 بيئة، ويوفر تشخيصات على مستوى المسار تكشف كيف تخصص الوكلاء المختلفون الميزانية ويحولون ردود الفعل إلى معلمات مضبوطة.
2026-07-11
Grok 4.5
تم بناء Grok 4.5 من Cursor بواسطة وكلاء ذكاء اصطناعي، وليس بشرًا. هذه هي القصة الحقيقية.
Grok 4.5 من Cursor هو نموذج خليط من الخبراء (Mixture-of-Experts) تم بناؤه باستخدام التعلم المعزز في بيئات أنشأها وكلاء ذكاء اصطناعي سابقون، وليس بشرًا. يتعامل مع المهام المعقدة طويلة المدة عبر هندسة البرمجيات، وعلوم البيانات، والمالية، والقانون، وهو متاح الآن.
2026-07-10