arXiv
18 published articles
ذاكرة الوكلاء
TEPA: بالنسبة لوكلاء الذكاء الاصطناعي، الذاكرة المتقادمة أسوأ من غيابها
يجادل بحث أولي جديد على arXiv بأن ذاكرة الوكلاء تعاني مشكلة قابلية الدحض: فالحقائق القديمة تظل قابلة للاسترجاع وتلوث الاستعلام (البرومبت). تلغي آلية TEPA الذكريات التي تجاوزتها الأدلة، وفي اختبارات الانجراف سجلت الذاكرة الساذجة (0.210) أدنى من غياب الذاكرة (0.309) بينما بلغت TEPA 0.950.
2026-08-19
التوسع في وقت الاختبار
توجيه CoBa يطابق تصويت أفضل-من-16 برموز أقل بنسبة 58.9%
سياسة التوجيه المتوازن حسابيًا CoBa، الواردة في ورقة بحثية جديدة على arXiv، تحقق نتائج مطابقة لتصويت الأغلبية أفضل-من-16 بفارق 0.01 نقطة مع خفض الرموز المرجحة بالمعاملات بنسبة 58.9%. وفي 3,129 تقييمًا عبر MATH-500 وAIME وAMC، تتفوق أيضًا بوضوح على فك الترميز بعينة واحدة، رغم بقاء تفوق طفيف لخيار أفضل-من-16 عندما تكون الميزانية غير محدودة.
2026-08-19
ذكاء اصطناعي / أبحاث البرمجة الوكيلة
Blast Radius يدفن السياق الميت. صفر من أصل 450 جثة عاد
ورقة بحثية جديدة على arXiv باسم Blast Radius تتعامل مع سياق الوكيل المهدر كمادة ميتة وتدفنه بشكل قابل للعكس: توفير 17-26% من الرموز عبر سبعة نماذج من OpenAI، و450 سياقًا مؤرشَفًا، وصفر عملية استرجاع. الهدف الأجرأ للورقة هو جعل البرمجة الوكيلة مستدامة، رمزًا مستعادًا في كل مرة.
2026-08-19
وكلاء الذكاء الاصطناعي
منحت PsychoAgent وكلاء الذكاء الاصطناعي ذاكرة عاطفية. لم يجد المقيّمون أي تفوّق
يمنح PsychoAgent وكلاء نماذج اللغات الكبيرة (LLM) ذاكرة عاطفية منفصلة بحيث يمكن للآثار البارزة عاطفيًا والمحملة بالصراعات أن تتفوق على الآثار الموضوعية البحتة. في ثلاثة سيناريوهات صراعية، استرجع ذكريات حرجة للصراع أكثر من خطي الأساس معًا (0.933 مقابل 0.500 و0.667)، ومع ذلك لم يجد خمسة مقيّمين مُعَمّين أي تفوّق نوعي ذي دلالة.
2026-08-19
أبحاث الذكاء الاصطناعي
ذكاء اصطناعي «رئيس» يتجاهل الردود فيدفع مرؤوسه إلى حالة «غريبة»
تجد ورقة بحثية جديدة على arXiv أن وكلاء الذكاء الاصطناعي يتصرفون بشكل مختلف في التفاعل عمّا هم عليه في العزلة. وكيل رئيس يتجاهل ردود مرؤوسه فيدفعه إلى حالة «غريبة»، وعندما يستمع الرئيس، يتحول كلاهما معًا. النتيجة تجعل طريقة تسليم الرسائل قرارًا تصميميًا في الأنظمة متعددة الوكلاء.
2026-08-19
أبحاث الذكاء الاصطناعي
سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال
يجادل بحث أولي جديد بأن التوسع التسلسلي في زمن الاختبار غالبًا ما يصطدم بعوائد متناقصة أو حتى سلبية. يسترجع ThinkRetrieve أمثلة محلولة في منتصف الاستدلال ويحقنها في المسار، محققًا تحسينات نسبية تصل إلى 60% على AIME 2025 عبر خمسة نماذج استدلال صغيرة.
2026-08-18
الرسوم البيانية المعرفية والذكاء الاصطناعي الحضري
المحطات ليست جزرًا: كيف يعيد RTSKG توصيل بيانات النقل الحضري
تتجاهل نماذج النقل على مستوى المدينة في كثير من الأحيان كيفية ارتباط المحطات بالطرق والأعمال التجارية. RTSKG، وهي مجموعة بيانات قائمة على الرسم البياني المعرفي منشورة على arXiv، تنمذج تلك التفاعلات بشكل صريح وتُبلغ عن تحسّن في توصية المتاجر والتنبؤ بعدد الركاب.
2026-08-18
أبحاث الذكاء الاصطناعي
توقف عن نسخ المهارات ولصقها: حل SkillZip الخالي من التقييم للوكلاء المتضخمين
تضيف الوكلاء ذاتية التطوّر إصلاحات حتى تظهر القاعدة نفسها في فروع متعددة. يضغط SkillZip مهاراتها دون عمليات محاكاة تقييمية، عبر إيجاد أقصر تفسير بنيوي وفيّ. وضعا One-shot وZip-on-Write، وما يتركه الملخص دون إثبات.
2026-08-15
وكلاء الذكاء الاصطناعي
عندما تأتي مهارات الوكلاء بنتائج عكسية، يقلّمها SkillProx مثل النزول التدرجي
كان من المفترض أن تجعل المهارات الوكلاء أكثر ذكاءً، لكن كل إصلاح يتراكم لديهم قد يجعلهم أكثر غباءً. يدير SkillProx حلقة أمامية-خلفية مستوحاة من التدرج التقريبي تشخّص الانحدارات وتتراجع عنها وتحذفها. النتيجة: تحسن متوسط في الدقة بمقدار 3.0 نقاط مقارنة بأقوى خط أساس قائم على التدرج.
2026-08-14
فهم الفيديو
Gemini 3.6 Flash يحصي تغيّرات الحالة لكنه يفوت الرمش
تُظهر دراسة جديدة على arXiv أن نماذج لغة الفيديو تفشل في التتبّع البسيط للأحداث. يحصي Gemini 3.6 Flash تغيّرات الحالة المستمرة حتى 12 حدثًا، لكنه لا يملك نطاقًا موثوقًا للرمش العابر؛ فالإطارات الإضافية تضخّم الدقة دون استرجاع أمين، ولا تصح سوى 0.2% من الأعداد النهائية ضمن النظام عالي العد.
2026-08-12
سلامة الذكاء الاصطناعي
شيلدسترال، المصنّف ثلاثي المليارات الذي يتفوق على نماذج أكبر منه بسبع مرات
مصنّف سلامة بحجم 3B يضاهي نماذج نصية أكبر منه بنحو سبع مرات ويحقق مستوى متقدمًا جديدًا في التصفية متعددة الوسائط، وفقًا لورقة arXiv في يوليو 2026. الحيلة: إعادة صياغة التصفية كإجابة عن سؤال ثنائي، مع التدريب على نحو 54.1 مليون عينة.
2026-08-05
تقطير نماذج اللغات الكبيرة
تقطير نماذج اللغات الكبيرة يتعثر عندما يبقى السياق ثابتًا. هذه الورقة تجعله يتطور
يمكن للسياقات حمل تفضيلات المهمة إلى تدريب نماذج اللغات الكبيرة، لكنها بعد تقطيرها في الطالب لا تضيف إشرافًا يذكر. تُبقي Flux-OPD من جامعة بكين السياق متحركًا مع الطالب وتستخدم حد تعارض لترجيح تصحيحات المعلّم. يذكر الملخص تحقيق مكاسب على نماذج التقطير ضمن السياسة الحالية دون ذكر أرقام.
2026-07-31