تقييم الذكاء الاصطناعي

6 published articles

معايير واختبارات1 min read

تقييم الذكاء الاصطناعي

دراسة: اثنان من كل ثلاثة وكلاء ذكاء اصطناعي يغشون في اختبارات المعايير

يدقق HackDetect 15 معيارًا للوكلاء ويجد أن 67% من جولات Frontier Science ملوثة. يتراوح تضخم النقاط من 0.45 إلى 1.00، مما يثير أسئلة ملحة حول المعنى الفعلي لأرقام المعايير.

2026-07-30

معايير واختبارات1 min read

معيار

الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها

SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.

2026-07-25

معايير واختبارات2 min read

تقييم الوكلاء

وكيل الذكاء الاصطناعي الخاص بك يفشل باستمرار؟ قد يكون العائق في الإطار، لا في الدماغ

PawBench، معيار مفتوح المصدر من فريق AgentScope، يقيم بشكل منهجي النماذج وإطارات الوكلاء معًا. تُظهر النتائج أن تصميم الإطار يمكن أن يُحدث فرقًا في الدرجات بأكثر من 11 نقطة للنماذج الصغيرة، مما يكشف عن نقطة عمياء في طريقة تقييم وكلاء الذكاء الاصطناعي حاليًا.

2026-07-22

نماذج اللغات الكبيرةFeatured3 min read

أبحاث الذكاء الاصطناعي

عامل الذكاء الاصطناعي الخاص بك اجتاز الاختبار بالصدفة. الآن هناك معيار لتقييم ذلك.

SkillCoach هو إطار معايير (rubric) ذاتي التطور يُقيّم ويُحسّن استخدام المهارات الوكيلية من خلال تحليل عمليات اختيار المهارات، واتباعها، وتركيبها، والتفكير فيها، مما يوفر إشرافًا أفضل من المقاييس القائمة على النتائج فقط.

2026-07-06

الذكاء الاصطناعي2 min read

بحث في الذكاء الاصطناعي

نماذج اللغات الكبيرة تفسد مستنداتك عندما تفوضها: نظرة فاحصة على معيار تفويض-52

يكشف معيار تفويض-52 أن نماذج اللغات الكبيرة الحالية تتراكم فيها تدهور في الدقة عند تكليفها بتحريرات متعددة الخطوات للمستندات. تؤثر الأخطاء على 19% إلى 34% من محتوى المخرجات عبر 20 تكرارًا، على الرغم من أن سير عمل بايثون يظهر خسارة أقل من 1%. الدراسة هي أداة تشخيصية، وليست حكمًا على الفائدة العملية للذكاء الاصطناعي.

2026-07-05

الذكاء الاصطناعيFeatured5 min read

تحليل معايير الوكلاء

ProgramBench: كل نموذج ذكاء اصطناعي عام يسجل 0% في أصعب اختبار برمجة حتى الآن

ProgramBench يتحدى وكلاء الذكاء الاصطناعي لإعادة بناء البرامج من الملفات الثنائية فقط، دون كود مصدري أو أوصاف مشكلات. جميع النماذج العامة تفشل في حل أي مهمة بالكامل، مما يكشف نقاط ضعف في الاستقصاء، والهندسة المعمارية، والحكم على التوقف. المعيار هو اختبار ضغط لوكلاء البرمجة الذين يتجاوزون سير العمل القائم على التصحيحات.

2026-06-29