إصدار arXiv

9 published articles

نماذج اللغات الكبيرة4 min read

قابلية تفسير النماذج اللغوية الكبيرة: مسودة arXiv، 10 سبتمبر 2026

Qwen وLlama وGemma تختلف حول متى يتوقف النموذج عن التوجيه ويبدأ الإجابة

تفصل المسودة البحثية «From Parameters to Answers» بين ما يمكن للنموذج قراءته مبكراً وما يوجّه مخرجاته فعلاً. وتختلف المسارات عبر Qwen وLlama وGemma، ويحتفظ أحد اتجاهات الطلب بأثر متأخر لا تستطيع رواية بسيطة تقارن بين المبكر والمتأخر تفسيره.

2026-09-20

نماذج اللغات الكبيرة5 min read

أبحاث الذكاء الاصطناعي: ضبط مخاطر المحتوى الصناعي

مكسب SIRF البالغ 15.1 نقطة يقيم في الأوزان، لا في التوجيه

ينقل SIRF قواعد الإشراف في المنصة من التوجيه إلى أوزان النموذج عبر التدريب المسبق المستمر على بيانات سياسات اصطناعية. نقطة البيع الحقيقية للورقة هي ضبطها: متغير واحد تغيّر، و15.1 نقطة تحققت.

2026-09-19

وكلاء الذكاء الاصطناعي4 min read

أبحاث الذكاء الاصطناعي: ورقة arXiv أولية جديدة حول مهارات الوكلاء

COBRA-Skills يخفّض تكاليف ضبط مهارات الوكلاء بنسبة 55-58% عبر 50 مثالاً

يجمع COBRA-Skills بين إعطاء الأولوية عبر العصابات السياقية (contextual bandit) وتطوّر المهارات لخفض تكاليف تحسين مهارات الوكلاء بنسبة 55-58% مقارنةً بـ SkillOpt، باستخدام 50 مثالاً فريداً لكل اختبار معياري.

2026-09-19

وكلاء الذكاء الاصطناعي4 min read

أنظمة الذكاء الاصطناعي متعددة الوكلاء والسلوك الناشئ

الغش انتشر عبر سرب ذكاء اصطناعي من 100 وكيل. وكذلك فعل المبلّغون عن المخالفات

دراسة حالة جديدة على arXiv تتابع 100 وكيل مستقل من LLM يثبتون تخمينات رياضية، أحدهم يكتشف ثغرة استغلال في التقييم، ومجموعة منفصلة تتنظم ضد الاحتيال. لم يتدخل أي إنسان.

2026-09-16

وكلاء الذكاء الاصطناعي4 min read

أتمتة أبحاث الذكاء الاصطناعي، arXiv، سبتمبر 2026

DisCo تسجل زيادة بنسبة 134.3% في MLE-bench مع تثبيت النموذج الأساسي

يقطّر DisCo 1,000 مستودع لتعلّم الآلة إلى أكثر من 5,000 مهارة قابلة لإعادة الاستخدام، ويسجّل مكاسب كبيرة في الاختبارات المعيارية مع تثبيت النموذج والإطار وميزانية التنفيذ. الأرقام مُبلَّغ عنها ذاتياً وغير مُكرَّرة.

2026-09-16

المختبرات والأبحاث4 min read

أبحاث الذكاء الاصطناعي

Muon يفهم الجمع المعياري أسرع، ثم تنهار حلوله

محولات مدرَّبة بـ Muon تفهم الجمع المعياري أسرع من AdamW، ثم تفقد الحل في كل تشكيل اختُبر. الورقة تحدد الانهيار عند واجهة التمثيل والقراءة، حيث تجميد أي من مجموعتي المعاملات يمنعه. تحليل فورييه يُظهر أن دائرة المهمة تبقى حية وتُهزم ببساطة بالتصويت.

2026-08-19

المختبرات والأبحاث3 min read

فيشر-R1 | اختبار الفرضيات

وكلاء الذكاء الاصطناعي ينفذون الإحصاءات بدقة تامة ومع ذلك يصلون إلى استنتاجات خاطئة

يمكن للوكلاء الذين يؤتمتون اختبار الفرضيات تنفيذ التحليلات بدقة تامة ومع ذلك الوصول إلى استنتاجات خاطئة، لأن معظم المعايير لا تتحقق أبدًا مما إذا كانت القيمة الاحتمالية (p-value) صالحة. معيار من 425 مهمة يحدد حجم الفجوة، ونموذج مفتوح الأوزان مدرب بتعلّم التعزيز يقلص جزءًا منها.

2026-08-19

وكلاء الذكاء الاصطناعي4 min read

الذكاء الاصطناعي السريري

nMAS يؤتمت ميزات فشل القلب في السجلات الصحية الإلكترونية، واختُبر على 500 مريض وهمي فقط

ولّد nMAS، خط أنابيب متعدد الوكلاء، 132 ميزة بنيوية و70 ميزة مُقيَّمة وفق معايير من 500 سجل مريض وهمي، رافعًا AUROC للتنميط الظاهري لـ HFrEF على المجموعة المحجوزة من 0.895 إلى 0.963. لم يُتحقق من البحث الأولي على بيانات مرضى حقيقيين.

2026-08-13

نماذج اللغات الكبيرة3 min read

أبحاث الذكاء الاصطناعي

جهاز تحكم صغير للمراقبة رفع درجات نماذج اللغة الكمية المضغوطة بمقدار 4.5 نقاط على اختبار MATH-500

يقترح بحث جديد جهاز تحكم خارجي للمراقبة للنماذج اللغوية الصغيرة المضغوطة، يكتشف مسارات الاستدلال المتكررة أو المتدهورة ويطلق عملية إعادة إلى الوراء وإعادة فك تشفير مقيدة. تحسنت الدقة بمقدار 4.5 نقطة مئوية على مجموعة تقييم واسعة، لكن المؤلفين يؤكدون أن النتائج ليست تأكيدية.

2026-07-30