قياس الأداء
2 published articles
الذكاء الاصطناعيFeatured5 min read
أبحاث الذكاء الاصطناعي
العائق الذي يعيق وكلاء الذكاء الاصطناعي ليس الاستكشاف، بل التقييم
ورقتان بحثيتان جديدتان من Hugging Face تعالجان نفس المشكلة الأساسية من اتجاهين متعاكسين: كيفية جعل وكلاء الذكاء الاصطناعي يقيمون أفعالهم بشكل موثوق. تبني AJ-Bench معيارًا لوكلاء القضاة المدركين للبيئة، بينما تجادل HeavySkill بأن أفضل قاضٍ يقع داخل معلمات النموذج نفسه.
2026-07-17
معايير واختبارات4 min read
تقييم الوكلاء
صناديق الرمل في الاختبارات تخفي كيف تفشل الوكلاء حقًا، جامعة هونغ كونغ قدمت الحل
UniClawBench يقيم الوكلاء الاستباقيين عبر خمس قدرات أساسية في 400 مهمة ثنائية اللغة في العالم الحقيقي، باستخدام حاويات Docker الحية وتقييم حلقة مغلقة بثلاثة وكلاء. يفصل قدرات النموذج الأساسية عن اختيارات الإطار، كاشفًا أين ينهار الوكلاء حقًا.
2026-07-13