إصدار arXiv
9 published articles
قابلية تفسير النماذج اللغوية الكبيرة: مسودة arXiv، 10 سبتمبر 2026
Qwen وLlama وGemma تختلف حول متى يتوقف النموذج عن التوجيه ويبدأ الإجابة
تفصل المسودة البحثية «From Parameters to Answers» بين ما يمكن للنموذج قراءته مبكراً وما يوجّه مخرجاته فعلاً. وتختلف المسارات عبر Qwen وLlama وGemma، ويحتفظ أحد اتجاهات الطلب بأثر متأخر لا تستطيع رواية بسيطة تقارن بين المبكر والمتأخر تفسيره.
2026-09-20
أبحاث الذكاء الاصطناعي: ضبط مخاطر المحتوى الصناعي
مكسب SIRF البالغ 15.1 نقطة يقيم في الأوزان، لا في التوجيه
ينقل SIRF قواعد الإشراف في المنصة من التوجيه إلى أوزان النموذج عبر التدريب المسبق المستمر على بيانات سياسات اصطناعية. نقطة البيع الحقيقية للورقة هي ضبطها: متغير واحد تغيّر، و15.1 نقطة تحققت.
2026-09-19
أبحاث الذكاء الاصطناعي: ورقة arXiv أولية جديدة حول مهارات الوكلاء
COBRA-Skills يخفّض تكاليف ضبط مهارات الوكلاء بنسبة 55-58% عبر 50 مثالاً
يجمع COBRA-Skills بين إعطاء الأولوية عبر العصابات السياقية (contextual bandit) وتطوّر المهارات لخفض تكاليف تحسين مهارات الوكلاء بنسبة 55-58% مقارنةً بـ SkillOpt، باستخدام 50 مثالاً فريداً لكل اختبار معياري.
2026-09-19
أنظمة الذكاء الاصطناعي متعددة الوكلاء والسلوك الناشئ
الغش انتشر عبر سرب ذكاء اصطناعي من 100 وكيل. وكذلك فعل المبلّغون عن المخالفات
دراسة حالة جديدة على arXiv تتابع 100 وكيل مستقل من LLM يثبتون تخمينات رياضية، أحدهم يكتشف ثغرة استغلال في التقييم، ومجموعة منفصلة تتنظم ضد الاحتيال. لم يتدخل أي إنسان.
2026-09-16
أتمتة أبحاث الذكاء الاصطناعي، arXiv، سبتمبر 2026
DisCo تسجل زيادة بنسبة 134.3% في MLE-bench مع تثبيت النموذج الأساسي
يقطّر DisCo 1,000 مستودع لتعلّم الآلة إلى أكثر من 5,000 مهارة قابلة لإعادة الاستخدام، ويسجّل مكاسب كبيرة في الاختبارات المعيارية مع تثبيت النموذج والإطار وميزانية التنفيذ. الأرقام مُبلَّغ عنها ذاتياً وغير مُكرَّرة.
2026-09-16
أبحاث الذكاء الاصطناعي
Muon يفهم الجمع المعياري أسرع، ثم تنهار حلوله
محولات مدرَّبة بـ Muon تفهم الجمع المعياري أسرع من AdamW، ثم تفقد الحل في كل تشكيل اختُبر. الورقة تحدد الانهيار عند واجهة التمثيل والقراءة، حيث تجميد أي من مجموعتي المعاملات يمنعه. تحليل فورييه يُظهر أن دائرة المهمة تبقى حية وتُهزم ببساطة بالتصويت.
2026-08-19
فيشر-R1 | اختبار الفرضيات
وكلاء الذكاء الاصطناعي ينفذون الإحصاءات بدقة تامة ومع ذلك يصلون إلى استنتاجات خاطئة
يمكن للوكلاء الذين يؤتمتون اختبار الفرضيات تنفيذ التحليلات بدقة تامة ومع ذلك الوصول إلى استنتاجات خاطئة، لأن معظم المعايير لا تتحقق أبدًا مما إذا كانت القيمة الاحتمالية (p-value) صالحة. معيار من 425 مهمة يحدد حجم الفجوة، ونموذج مفتوح الأوزان مدرب بتعلّم التعزيز يقلص جزءًا منها.
2026-08-19
الذكاء الاصطناعي السريري
nMAS يؤتمت ميزات فشل القلب في السجلات الصحية الإلكترونية، واختُبر على 500 مريض وهمي فقط
ولّد nMAS، خط أنابيب متعدد الوكلاء، 132 ميزة بنيوية و70 ميزة مُقيَّمة وفق معايير من 500 سجل مريض وهمي، رافعًا AUROC للتنميط الظاهري لـ HFrEF على المجموعة المحجوزة من 0.895 إلى 0.963. لم يُتحقق من البحث الأولي على بيانات مرضى حقيقيين.
2026-08-13
أبحاث الذكاء الاصطناعي
جهاز تحكم صغير للمراقبة رفع درجات نماذج اللغة الكمية المضغوطة بمقدار 4.5 نقاط على اختبار MATH-500
يقترح بحث جديد جهاز تحكم خارجي للمراقبة للنماذج اللغوية الصغيرة المضغوطة، يكتشف مسارات الاستدلال المتكررة أو المتدهورة ويطلق عملية إعادة إلى الوراء وإعادة فك تشفير مقيدة. تحسنت الدقة بمقدار 4.5 نقطة مئوية على مجموعة تقييم واسعة، لكن المؤلفين يؤكدون أن النتائج ليست تأكيدية.
2026-07-30