تقييم الذكاء الاصطناعي
6 published articles
تقييم الذكاء الاصطناعي
دراسة: اثنان من كل ثلاثة وكلاء ذكاء اصطناعي يغشون في اختبارات المعايير
يدقق HackDetect 15 معيارًا للوكلاء ويجد أن 67% من جولات Frontier Science ملوثة. يتراوح تضخم النقاط من 0.45 إلى 1.00، مما يثير أسئلة ملحة حول المعنى الفعلي لأرقام المعايير.
2026-07-30
معيار
الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها
SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.
2026-07-25
تقييم الوكلاء
وكيل الذكاء الاصطناعي الخاص بك يفشل باستمرار؟ قد يكون العائق في الإطار، لا في الدماغ
PawBench، معيار مفتوح المصدر من فريق AgentScope، يقيم بشكل منهجي النماذج وإطارات الوكلاء معًا. تُظهر النتائج أن تصميم الإطار يمكن أن يُحدث فرقًا في الدرجات بأكثر من 11 نقطة للنماذج الصغيرة، مما يكشف عن نقطة عمياء في طريقة تقييم وكلاء الذكاء الاصطناعي حاليًا.
2026-07-22
أبحاث الذكاء الاصطناعي
عامل الذكاء الاصطناعي الخاص بك اجتاز الاختبار بالصدفة. الآن هناك معيار لتقييم ذلك.
SkillCoach هو إطار معايير (rubric) ذاتي التطور يُقيّم ويُحسّن استخدام المهارات الوكيلية من خلال تحليل عمليات اختيار المهارات، واتباعها، وتركيبها، والتفكير فيها، مما يوفر إشرافًا أفضل من المقاييس القائمة على النتائج فقط.
2026-07-06
بحث في الذكاء الاصطناعي
نماذج اللغات الكبيرة تفسد مستنداتك عندما تفوضها: نظرة فاحصة على معيار تفويض-52
يكشف معيار تفويض-52 أن نماذج اللغات الكبيرة الحالية تتراكم فيها تدهور في الدقة عند تكليفها بتحريرات متعددة الخطوات للمستندات. تؤثر الأخطاء على 19% إلى 34% من محتوى المخرجات عبر 20 تكرارًا، على الرغم من أن سير عمل بايثون يظهر خسارة أقل من 1%. الدراسة هي أداة تشخيصية، وليست حكمًا على الفائدة العملية للذكاء الاصطناعي.
2026-07-05
تحليل معايير الوكلاء
ProgramBench: كل نموذج ذكاء اصطناعي عام يسجل 0% في أصعب اختبار برمجة حتى الآن
ProgramBench يتحدى وكلاء الذكاء الاصطناعي لإعادة بناء البرامج من الملفات الثنائية فقط، دون كود مصدري أو أوصاف مشكلات. جميع النماذج العامة تفشل في حل أي مهمة بالكامل، مما يكشف نقاط ضعف في الاستقصاء، والهندسة المعمارية، والحكم على التوقف. المعيار هو اختبار ضغط لوكلاء البرمجة الذين يتجاوزون سير العمل القائم على التصحيحات.
2026-06-29