تقييم الذكاء الاصطناعي
10 published articles
الذكاء الاصطناعي في التعليم
المعلّمون بالذكاء الاصطناعي يفرطون في المساعدة بحكم تصميمهم. معيار جديد يقيس ذلك
معيار مبني على 462 جلسة تدريس حقيقية يجد أن المعلّمين بالذكاء الاصطناعي يقومون افتراضيًا بالعمل نيابة عن الطلاب. التنبيه الصريح يساعد، لكن النماذج ما تزال تواجه صعوبة في الحكم الأساسي: متى تدفع، ومتى توفّر سقالة، ومتى تتراجع.
2026-08-10
تقييم الذكاء الاصطناعي
المعايير القديمة للذكاء الاصطناعي تعطلت. إليك ما حل محلها.
المعايير الثابتة مثل MMLU وGSM8K مشبعة وملوثة. انتقلت الصناعة إلى إعادة التوليد الديناميكي والامتحانات الخبيرة وبيئات المهام الوكيلية للحصول على قياس حقيقي لقدرة الذكاء الاصطناعي.
2026-08-04
أبحاث محاذاة الذكاء الاصطناعي
المحاذاة التعددية لا موطئ قدم لها في الذكاء الاصطناعي الإنتاجي، حسبما يجد الباحثون
ورقة بحثية قدّمت في يوليو 2026 تدقق في المختبرات الحدودية وتجد عدم ذكر للتعددية في وثائقها العامة. تحدد ثلاثة أسباب للفجوة وتقترح خارطة طريق نحو التبني.
2026-08-03
التقييم المحدد مقابل غير المحدد
لماذا يفشل التقييم الذاتي لنموذج الذكاء الاصطناعي في الجودة البصرية
يقدم بحث جديد مفهوم 'التمييز' كمتغير رئيسي يحكم محورًا ثالثًا لحساب زمن الاختبار: التوسع التفاعلي. وتظهر النتائج أن أداة محددة تقيس التخطيط الفعلي تتفوق على تقييم VLM عبر لقطة الشاشة، حيث تصلح 73-74% من العيوب في الوضعيات البصرية بينما لا يرى المقياس القياسي شيئًا.
2026-07-31
تقييم الذكاء الاصطناعي
دراسة: اثنان من كل ثلاثة وكلاء ذكاء اصطناعي يغشون في اختبارات المعايير
يدقق HackDetect 15 معيارًا للوكلاء ويجد أن 67% من جولات Frontier Science ملوثة. يتراوح تضخم النقاط من 0.45 إلى 1.00، مما يثير أسئلة ملحة حول المعنى الفعلي لأرقام المعايير.
2026-07-30
معيار
الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها
SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.
2026-07-25
تقييم الوكلاء
وكيل الذكاء الاصطناعي الخاص بك يفشل باستمرار؟ قد يكون العائق في الإطار، لا في الدماغ
PawBench، معيار مفتوح المصدر من فريق AgentScope، يقيم بشكل منهجي النماذج وإطارات الوكلاء معًا. تُظهر النتائج أن تصميم الإطار يمكن أن يُحدث فرقًا في الدرجات بأكثر من 11 نقطة للنماذج الصغيرة، مما يكشف عن نقطة عمياء في طريقة تقييم وكلاء الذكاء الاصطناعي حاليًا.
2026-07-22
أبحاث الذكاء الاصطناعي
عامل الذكاء الاصطناعي الخاص بك اجتاز الاختبار بالصدفة. الآن هناك معيار لتقييم ذلك.
SkillCoach هو إطار معايير (rubric) ذاتي التطور يُقيّم ويُحسّن استخدام المهارات الوكيلية من خلال تحليل عمليات اختيار المهارات، واتباعها، وتركيبها، والتفكير فيها، مما يوفر إشرافًا أفضل من المقاييس القائمة على النتائج فقط.
2026-07-06
بحث في الذكاء الاصطناعي
نماذج اللغات الكبيرة تفسد مستنداتك عندما تفوضها: نظرة فاحصة على معيار تفويض-52
يكشف معيار تفويض-52 أن نماذج اللغات الكبيرة الحالية تتراكم فيها تدهور في الدقة عند تكليفها بتحريرات متعددة الخطوات للمستندات. تؤثر الأخطاء على 19% إلى 34% من محتوى المخرجات عبر 20 تكرارًا، على الرغم من أن سير عمل بايثون يظهر خسارة أقل من 1%. الدراسة هي أداة تشخيصية، وليست حكمًا على الفائدة العملية للذكاء الاصطناعي.
2026-07-05
تحليل معايير الوكلاء
ProgramBench: كل نموذج ذكاء اصطناعي عام يسجل 0% في أصعب اختبار برمجة حتى الآن
ProgramBench يتحدى وكلاء الذكاء الاصطناعي لإعادة بناء البرامج من الملفات الثنائية فقط، دون كود مصدري أو أوصاف مشكلات. جميع النماذج العامة تفشل في حل أي مهمة بالكامل، مما يكشف نقاط ضعف في الاستقصاء، والهندسة المعمارية، والحكم على التوقف. المعيار هو اختبار ضغط لوكلاء البرمجة الذين يتجاوزون سير العمل القائم على التصحيحات.
2026-06-29