تعلم التعزيز
29 published articles
الذكاء الاصطناعي للمستندات
لماذا يتناسب أفضل محلل للمستندات الآن مع 800 مليون معلمة
نموذج OvisOCR2 من علي بابا، وهو نموذج شامل صغير بحجم 0.8 مليار معلمة، يحقق نتائج متطورة على OmniDocBench (96.58) و PureDocBench (75.06)، متجاوزًا المحللات الأكبر القائمة على خطوط الأنابيب. يعود نجاحه إلى محرك بيانات يمزج بين المستندات الحقيقية المصفاة والصفحات الاصطناعية، والتعلم المعزز على نموذج معلم بحجم 4 مليارات معلمة، والتقطير على السياسة في النموذج الصغير.
2026-07-24
وكلاء البرمجة بالذكاء الاصطناعي
نموذج Qwen-Coder-Qoder من علي بابا يتفوق على Cursor في اختبارها الخاص ويخفض استهلاك الرموز بنسبة 14.5%
نموذج البرمجة الجديد من علي بابا Qwen-Coder-Qoder يتفوق على Cursor Composer-1 في معيار Qoder Bench. تُظهر مقاييس الإنتاج زيادة بنسبة 3.85% في الاحتفاظ بالكود، وانخفاضًا بنسبة 61.5% في أخطاء الأدوات، وتقليصًا بنسبة 14.5% في استهلاك الرموز. يدرب النموذج على آثار الوكلاء الحقيقية من خلال إطار عمل المكافأة والمهاجم لمواجهة اختراق المكافآت.
2026-07-23
التعلم الممكن بيولوجياً
استبدل MNIST بـ CIFAR-10 وستنقلب وصفة الذكاء الاصطناعي الشبيه بالدماغ رأساً على عقب
قامت Sakana AI بتوسيع نطاق بنية خالية من الانتشار العكسي ومتوافقة مع مبدأ ديل لتتجاوز MNIST لأول مرة. المشكلة: أي خدعة تكون الأكثر أهمية تنعكس بين مجموعات البيانات، وهو تحذير حول كيفية قياس الذكاء الاصطناعي الممكن بيولوجياً.
2026-07-22
أبحاث الذكاء الاصطناعي
التعلم التعزيزي لتوليد الصور: Qwen-Image-2.0-RL يحصل على نظام مكافآت مركب
يصف تقرير Qwen-Image-2.0-RL خط أنابيب ما بعد التدريب الذي يجمع بين RLHF والتقطير على السياسة ونماذج المكافآت المركبة لتحسين جودة تحويل النص إلى صورة وتحرير الصور. يحقق النهج مكاسب قابلة للقياس عبر الجودة الجمالية واتباع التعليمات والحفاظ على هوية الوجه.
2026-07-20
الذكاء الاصطناعي القابل للتحقق بيولوجيًا
إصلاح واحد أنقذ CIFAR-10 ولم يفعل شيئًا لـ MNIST، وهذا يجب أن يقلق باحثي الذكاء الاصطناعي
تمكنت Sakana AI من توسيع نطاق خطأ الانتشار المشابه للدماغ، الخالي من الانتشار العكسي، إلى CIFAR-10 وRL. المشكلة: أي اختيارات تصميم تعتمد على المعايير تنعكس بين المعايير القياسية، وتكلفة مبدأ ديل تزداد مع صعوبة المهمة.
2026-07-19
أبحاث الذكاء الاصطناعي
حل مكون من كلمتين لمشكلة التخريب الذاتي في التعلم التعزيزي
التعلم التعزيزي متعدد المهام له سر قذر: إشارات المكافأة التي تدفع التوافق غالباً ما تعمل ضد بعضها البعض. نشر فريق دولي للتو طريقة تمنع النظام من محاربة نفسه، وتكاد لا تكلف شيئاً لإضافتها إلى خطوط الأنابيب الحالية.
2026-07-19
الذكاء الاصطناعي التجسيدي
نموذج 8B الصغير من ميسترال يجعل الليدار اختياريًا للروبوتات المكتبية
Robostral Navigate من ميسترال هو نموذج 8B يستخدم كاميرا RGB واحدة فقط لتحقيق 76.6% على معايير R2R-CE، متجاوزًا الأساليب متعددة المستشعرات بـ 4.5 نقطة. بُني ببيانات محاكاة وطريقة تخزين مؤقت مسبق للرموز موفرة للكفاءة، فهو يعمم عبر أنواع الروبوتات ويتكيف مع العقبات غير المرئية.
2026-07-17
أبحاث الذكاء الاصطناعي
العائق الذي يعيق وكلاء الذكاء الاصطناعي ليس الاستكشاف، بل التقييم
ورقتان بحثيتان جديدتان من Hugging Face تعالجان نفس المشكلة الأساسية من اتجاهين متعاكسين: كيفية جعل وكلاء الذكاء الاصطناعي يقيمون أفعالهم بشكل موثوق. تبني AJ-Bench معيارًا لوكلاء القضاة المدركين للبيئة، بينما تجادل HeavySkill بأن أفضل قاضٍ يقع داخل معلمات النموذج نفسه.
2026-07-17
الذكاء الاصطناعي
علي بابا تنشر نموذجًا عالميًا مفتوح المصدر يتيح لوكلاء الذكاء الاصطناعي التدريب داخل محاكي
أطلق فريق Qwen التابع لشركة علي بابا نموذج Qwen-AgentWorld، وهو نموذج عالمي لغوي يحاكي بيئات الوكلاء عبر سبعة مجالات. خط أنابيبه الثلاثي المراحل، CPT، SFT، RL، ينتج محاكيًا يتفوق على GPT-5.4 في الدقة ويتيح للوكلاء التدريب عبر البروفة الذهنية بدلاً من عمليات النشر المكلفة في البيئة الحقيقية.
2026-07-16
البرمجة التنافسية
نوسكودر-14B يتحدى برمجة الأولمبياد بخط أنابيب تعزيز مفتوح
تطلق Nous Research نموذج NousCoder-14B، وهو نموذج برمجة تنافسية مبني على Qwen3-14B عبر التعلم المعزز. مجموعة كاملة مفتوحة المصدر: الأوزان والبيئة ومجموعة التقييم. يستهدف معايير البرمجة على مستوى الأولمبياد.
2026-07-16
الذكاء الاصطناعي
مينيماكس M3 وفن جعل نموذج الإثبات مقاومًا للاختراق
تشرح مينيماكس التفاصيل الهندسية وراء قدرات الإثبات لنموذج M3: مُحقق متعدد الطبقات اجتاز نمط فشل اختراق المكافآت الذي عانى منه دورة M2، وإطار MaxProof القائم على الاختبار عند وقت التشغيل على مستوى المجموعة، والذي يحول أخذ العينات إلى بحث موجه. في مسابقتَي IMO 2025 و USAMO 2026، يتجاوز نموذج M3 مع MaxProof عتبة الميدالية الذهبية البشرية.
2026-07-16
أدوات للتعلم المعزز
Tinker-atropos يربط تجارب التعلم المعزز بإطار عمل Atropos
تطلق Nous Research أداة tinker-atropos، وهي طبقة تكامل بين واجهة Tinker API وإطار عمل التعلم المعزز Atropos. تفصل خدمات المدرب، وجمع النتائج، والبيئة إلى مكونات قابلة للنشر بشكل مستقل لتجارب تعلم معزز أكثر مرونة.
2026-07-16