وكلاء LLM

15 published articles

الذكاء الاصطناعي4 min read

الاستدلال طويل الأفق

إطار عمل جديد يساعد وكلاء الذكاء الاصطناعي على تذكر ما فعلوه قبل خمس دقائق

PRO-LONG هو إطار عمل بسيط يساعد وكلاء نماذج اللغات الكبيرة على الاحتفاظ بالمعلومات واسترجاعها عبر تسلسلات طويلة من الإجراءات. على معيار ARC-AGI-3، حسّن متوسط معدلات النجاح بمقدار 18 نقطة مئوية عبر النماذج الرائدة مع استخدام أقل بمقدار 4.2 إلى 5.8 مرات من الرموز المميزة مقارنة بالأدوات الحالية. مع نموذج Fable 5، حقق 97.4% best@2 بتكلفة استدلال إجمالية قدرها 1,750 دولارًا.

2026-07-24

الذكاء الاصطناعيFeatured3 min read

أبحاث الذكاء الاصطناعي

الحيلة المزعجة التي تمنع انهيار وكلاء LLM في الإنتاج

وكلاء LLM الحاليون ينهارون تحت عشوائية العالم الحقيقي. يعرضهم NoisyAgent لضوضاء محكومة أثناء التدريب، مما يحسن المتانة والأداء العام في المعايير. تشير الورقة إلى أن المجال كان يعاني من الإفراط في التكيف مع الظروف المثالية.

2026-07-17

نماذج اللغات الكبيرةFeatured3 min read

أبحاث الذكاء الاصطناعي

عامل الذكاء الاصطناعي الخاص بك اجتاز الاختبار بالصدفة. الآن هناك معيار لتقييم ذلك.

SkillCoach هو إطار معايير (rubric) ذاتي التطور يُقيّم ويُحسّن استخدام المهارات الوكيلية من خلال تحليل عمليات اختيار المهارات، واتباعها، وتركيبها، والتفكير فيها، مما يوفر إشرافًا أفضل من المقاييس القائمة على النتائج فقط.

2026-07-06

← PreviousPage 382 / 2 · 15 articlesNext →