arXiv

18 published articles

وكلاء الذكاء الاصطناعي4 min read

ذاكرة الوكلاء

TEPA: بالنسبة لوكلاء الذكاء الاصطناعي، الذاكرة المتقادمة أسوأ من غيابها

يجادل بحث أولي جديد على arXiv بأن ذاكرة الوكلاء تعاني مشكلة قابلية الدحض: فالحقائق القديمة تظل قابلة للاسترجاع وتلوث الاستعلام (البرومبت). تلغي آلية TEPA الذكريات التي تجاوزتها الأدلة، وفي اختبارات الانجراف سجلت الذاكرة الساذجة (0.210) أدنى من غياب الذاكرة (0.309) بينما بلغت TEPA 0.950.

2026-08-19

الذكاء الاصطناعي5 min read

التوسع في وقت الاختبار

توجيه CoBa يطابق تصويت أفضل-من-16 برموز أقل بنسبة 58.9%

سياسة التوجيه المتوازن حسابيًا CoBa، الواردة في ورقة بحثية جديدة على arXiv، تحقق نتائج مطابقة لتصويت الأغلبية أفضل-من-16 بفارق 0.01 نقطة مع خفض الرموز المرجحة بالمعاملات بنسبة 58.9%. وفي 3,129 تقييمًا عبر MATH-500 وAIME وAMC، تتفوق أيضًا بوضوح على فك الترميز بعينة واحدة، رغم بقاء تفوق طفيف لخيار أفضل-من-16 عندما تكون الميزانية غير محدودة.

2026-08-19

المختبرات والأبحاث5 min read

ذكاء اصطناعي / أبحاث البرمجة الوكيلة

Blast Radius يدفن السياق الميت. صفر من أصل 450 جثة عاد

ورقة بحثية جديدة على arXiv باسم Blast Radius تتعامل مع سياق الوكيل المهدر كمادة ميتة وتدفنه بشكل قابل للعكس: توفير 17-26% من الرموز عبر سبعة نماذج من OpenAI، و450 سياقًا مؤرشَفًا، وصفر عملية استرجاع. الهدف الأجرأ للورقة هو جعل البرمجة الوكيلة مستدامة، رمزًا مستعادًا في كل مرة.

2026-08-19

وكلاء الذكاء الاصطناعي4 min read

وكلاء الذكاء الاصطناعي

منحت PsychoAgent وكلاء الذكاء الاصطناعي ذاكرة عاطفية. لم يجد المقيّمون أي تفوّق

يمنح PsychoAgent وكلاء نماذج اللغات الكبيرة (LLM) ذاكرة عاطفية منفصلة بحيث يمكن للآثار البارزة عاطفيًا والمحملة بالصراعات أن تتفوق على الآثار الموضوعية البحتة. في ثلاثة سيناريوهات صراعية، استرجع ذكريات حرجة للصراع أكثر من خطي الأساس معًا (0.933 مقابل 0.500 و0.667)، ومع ذلك لم يجد خمسة مقيّمين مُعَمّين أي تفوّق نوعي ذي دلالة.

2026-08-19

المختبرات والأبحاث4 min read

أبحاث الذكاء الاصطناعي

ذكاء اصطناعي «رئيس» يتجاهل الردود فيدفع مرؤوسه إلى حالة «غريبة»

تجد ورقة بحثية جديدة على arXiv أن وكلاء الذكاء الاصطناعي يتصرفون بشكل مختلف في التفاعل عمّا هم عليه في العزلة. وكيل رئيس يتجاهل ردود مرؤوسه فيدفعه إلى حالة «غريبة»، وعندما يستمع الرئيس، يتحول كلاهما معًا. النتيجة تجعل طريقة تسليم الرسائل قرارًا تصميميًا في الأنظمة متعددة الوكلاء.

2026-08-19

المختبرات والأبحاث4 min read

أبحاث الذكاء الاصطناعي

سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال

يجادل بحث أولي جديد بأن التوسع التسلسلي في زمن الاختبار غالبًا ما يصطدم بعوائد متناقصة أو حتى سلبية. يسترجع ThinkRetrieve أمثلة محلولة في منتصف الاستدلال ويحقنها في المسار، محققًا تحسينات نسبية تصل إلى 60% على AIME 2025 عبر خمسة نماذج استدلال صغيرة.

2026-08-18

NLP والتعلم الآلي3 min read

الرسوم البيانية المعرفية والذكاء الاصطناعي الحضري

المحطات ليست جزرًا: كيف يعيد RTSKG توصيل بيانات النقل الحضري

تتجاهل نماذج النقل على مستوى المدينة في كثير من الأحيان كيفية ارتباط المحطات بالطرق والأعمال التجارية. RTSKG، وهي مجموعة بيانات قائمة على الرسم البياني المعرفي منشورة على arXiv، تنمذج تلك التفاعلات بشكل صريح وتُبلغ عن تحسّن في توصية المتاجر والتنبؤ بعدد الركاب.

2026-08-18

وكلاء الذكاء الاصطناعي4 min read

أبحاث الذكاء الاصطناعي

توقف عن نسخ المهارات ولصقها: حل SkillZip الخالي من التقييم للوكلاء المتضخمين

تضيف الوكلاء ذاتية التطوّر إصلاحات حتى تظهر القاعدة نفسها في فروع متعددة. يضغط SkillZip مهاراتها دون عمليات محاكاة تقييمية، عبر إيجاد أقصر تفسير بنيوي وفيّ. وضعا One-shot وZip-on-Write، وما يتركه الملخص دون إثبات.

2026-08-15

وكلاء الذكاء الاصطناعي4 min read

وكلاء الذكاء الاصطناعي

عندما تأتي مهارات الوكلاء بنتائج عكسية، يقلّمها SkillProx مثل النزول التدرجي

كان من المفترض أن تجعل المهارات الوكلاء أكثر ذكاءً، لكن كل إصلاح يتراكم لديهم قد يجعلهم أكثر غباءً. يدير SkillProx حلقة أمامية-خلفية مستوحاة من التدرج التقريبي تشخّص الانحدارات وتتراجع عنها وتحذفها. النتيجة: تحسن متوسط في الدقة بمقدار 3.0 نقاط مقارنة بأقوى خط أساس قائم على التدرج.

2026-08-14

الذكاء الاصطناعي4 min read

فهم الفيديو

Gemini 3.6 Flash يحصي تغيّرات الحالة لكنه يفوت الرمش

تُظهر دراسة جديدة على arXiv أن نماذج لغة الفيديو تفشل في التتبّع البسيط للأحداث. يحصي Gemini 3.6 Flash تغيّرات الحالة المستمرة حتى 12 حدثًا، لكنه لا يملك نطاقًا موثوقًا للرمش العابر؛ فالإطارات الإضافية تضخّم الدقة دون استرجاع أمين، ولا تصح سوى 0.2% من الأعداد النهائية ضمن النظام عالي العد.

2026-08-12

نماذج اللغات الكبيرةFeatured4 min read

سلامة الذكاء الاصطناعي

شيلدسترال، المصنّف ثلاثي المليارات الذي يتفوق على نماذج أكبر منه بسبع مرات

مصنّف سلامة بحجم 3B يضاهي نماذج نصية أكبر منه بنحو سبع مرات ويحقق مستوى متقدمًا جديدًا في التصفية متعددة الوسائط، وفقًا لورقة arXiv في يوليو 2026. الحيلة: إعادة صياغة التصفية كإجابة عن سؤال ثنائي، مع التدريب على نحو 54.1 مليون عينة.

2026-08-05

نماذج اللغات الكبيرة4 min read

تقطير نماذج اللغات الكبيرة

تقطير نماذج اللغات الكبيرة يتعثر عندما يبقى السياق ثابتًا. هذه الورقة تجعله يتطور

يمكن للسياقات حمل تفضيلات المهمة إلى تدريب نماذج اللغات الكبيرة، لكنها بعد تقطيرها في الطالب لا تضيف إشرافًا يذكر. تُبقي Flux-OPD من جامعة بكين السياق متحركًا مع الطالب وتستخدم حد تعارض لترجيح تصحيحات المعلّم. يذكر الملخص تحقيق مكاسب على نماذج التقطير ضمن السياسة الحالية دون ذكر أرقام.

2026-07-31

← PreviousPage 1 / 2 · 18 articlesNext →