تحقق
3 published articles
وكلاء LLM
ضريبة الانحدار: لماذا قد يؤدي تحميل وكلاء LLM بالمهارات إلى نتائج عكسية
دراسة جديدة تُظهر أن إضافة المهارات الإجرائية لوكلاء LLM لا تساعد دائمًا، بل قد تؤدي إلى انحدارات، حيث تفشل المهام التي كانت تُحل بدون مهارات بعد إضافة المهارات. يحدد البحث ثلاثة أسباب ويجادل بأن الموثوقية تعتمد على التأصيل والتحقق أكثر من اعتمادها على المهارة نفسها.
2026-08-03
الذكاء الاصطناعي
لماذا تفشل ذاكرة وكيل الذكاء الاصطناعي في المهام الطويلة
ورقة أكاديمية تقدم StructAgent، وهو إطار يركز على الحالة ويعيد هيكلة كيفية تتبع الوكلاء الرقميين لتقدم المهام. يحقق نتائج متطورة على OSWorld-Verified باستخدام نماذج مفتوحة المصدر، ويعمم على لعبة Minecraft. يحدد العمل أن سجل التفاعل الخام عنق زجاجة للمهام طويلة الأمد، ويقترح حالة منظمة وسير عمل مدعوم بمدقق كحل.
2026-07-22
أبحاث الذكاء الاصطناعي
العائق الذي يعيق وكلاء الذكاء الاصطناعي ليس الاستكشاف، بل التقييم
ورقتان بحثيتان جديدتان من Hugging Face تعالجان نفس المشكلة الأساسية من اتجاهين متعاكسين: كيفية جعل وكلاء الذكاء الاصطناعي يقيمون أفعالهم بشكل موثوق. تبني AJ-Bench معيارًا لوكلاء القضاة المدركين للبيئة، بينما تجادل HeavySkill بأن أفضل قاضٍ يقع داخل معلمات النموذج نفسه.
2026-07-17