معايير واختبارات

مقارنات واختبارات أداء وتقييمات للنماذج.

23 published articles

Featured2 min read

تحليل معايير تقييم

HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا

أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.

2026-07-30

1 min read

تقييم الذكاء الاصطناعي

دراسة: اثنان من كل ثلاثة وكلاء ذكاء اصطناعي يغشون في اختبارات المعايير

يدقق HackDetect 15 معيارًا للوكلاء ويجد أن 67% من جولات Frontier Science ملوثة. يتراوح تضخم النقاط من 0.45 إلى 1.00، مما يثير أسئلة ملحة حول المعنى الفعلي لأرقام المعايير.

2026-07-30

Featured2 min read

تحليل المعايير

كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة

أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.

2026-07-29

Featured2 min read

تحليل المعايير

سيطر معيار MMLU على تقييم الذكاء الاصطناعي لسنوات. ثم بدأت النماذج في إتقان الإجابات

حدد MMLU جيلًا من تقييم الذكاء الاصطناعي، لكن تلوث بيانات التدريب ومفتاح إجابات معيب دفعا المختبرات الحدودية نحو بدائل ديناميكية مثل HLE و GPQA Diamond.

2026-07-28

4 min read

معيار

الفجوة بين نماذج اللغات الكبيرة والمنهج العلمي: معيار جديد يكتشف أن النماذج يمكنها وصف البيانات ولكنها لا تستطيع التفكير من خلالها

SDABench، وهو معيار جديد يركز على القدرات ويغطي ست مهارات أساسية في التفكير العلمي وخمسة مجالات، يختبر 15 نموذج لغوي كبير ويجد أن النماذج قوية في التحليل الوصفي ولكنها تنهار في المهام الاستدلالية والسببية. توفر الورقة إطارًا لتحليل الأخطاء من خمس مراحل لتحديد أماكن الفشل.

2026-07-25

3 min read

معايير واختبارات

نماذج تعلم الرسوم البيانية لا تُختبر على بيانات بهذا القبح. معيار جديد يغير ذلك

OpenRTAG، معيار من فريق أكاديمي، ينظم مشكلات جودة الرسوم البيانية المنسوبة إلى النص في تصنيف 3×3 يغطي تدهور النص والبنية والتسميات. يختبر شبكات GNN التقليدية، وشبكات GNN المحسنة بنماذج اللغة الكبيرة، ونماذج الرسوم البيانية الأساسية عبر تسع مجموعات بيانات، ويكشف أنماط حساسية مختلفة فاتتها الدراسات السابقة المجزأة.

2026-07-24

2 min read

تقييم الوكلاء

وكيل الذكاء الاصطناعي الخاص بك يفشل باستمرار؟ قد يكون العائق في الإطار، لا في الدماغ

PawBench، معيار مفتوح المصدر من فريق AgentScope، يقيم بشكل منهجي النماذج وإطارات الوكلاء معًا. تُظهر النتائج أن تصميم الإطار يمكن أن يُحدث فرقًا في الدرجات بأكثر من 11 نقطة للنماذج الصغيرة، مما يكشف عن نقطة عمياء في طريقة تقييم وكلاء الذكاء الاصطناعي حاليًا.

2026-07-22

Featured3 min read

البرمجة الوكيلة

كيف تقدّم Grok 4.5 في سباق SWE Marathon، وماذا يعني ذلك لوكلاء البرمجة

يقود Grok 4.5 الآن لوحة SWE Marathon متفوقاً على Claude 4 Opus وGPT-5. يختبر المعيار مهارات هندسة البرمجيات الحقيقية: إصلاح الأخطاء وإضافة الميزات وفهم الكود عبر المستودعات الحقيقية. تعيد النتيجة تشكيل المشهد التنافسي لوكلاء البرمجة بالذكاء الاصطناعي.

2026-07-20

4 min read

تقييم الوكلاء

صناديق الرمل في الاختبارات تخفي كيف تفشل الوكلاء حقًا، جامعة هونغ كونغ قدمت الحل

UniClawBench يقيم الوكلاء الاستباقيين عبر خمس قدرات أساسية في 400 مهمة ثنائية اللغة في العالم الحقيقي، باستخدام حاويات Docker الحية وتقييم حلقة مغلقة بثلاثة وكلاء. يفصل قدرات النموذج الأساسية عن اختيارات الإطار، كاشفًا أين ينهار الوكلاء حقًا.

2026-07-13

5 min read

معايير واختبارات

تريبل تكنولوجيز وهاجينج فيس تطلقان لوحة متصدرين FFASR للتعرف على الكلام في المجال البعيد

لوحة متصدرين FFASR الجديدة من تريبل تكنولوجيز وهاجينج فيس تقيم نماذج التعرف الآلي على الكلام عبر تسعة ظروف تشمل الصدى والضوضاء الخلفية ومسافة الميكروفون. تظهر التقديمات المبكرة أن معدل خطأ الكلمات في المجال البعيد عند نسبة الإشارة إلى الضوضاء المنخفضة أعلى بعدة مرات من أداء المجال القريب، مما يسلط الضوء على الحاجة إلى نماذج قوية صوتيًا.

2026-07-02

Featured3 min read

أداء

Gemma 4 يعمل أسرع بنحو 90 بالمائة في Ollama 0.31 مع التنبؤ متعدد الرموز

يقدم Ollama 0.31 التنبؤ متعدد الرموز لـ Gemma 4 على Apple Silicon، مما يحقق توليدًا أسرع بنسبة تقارب 90% للرموز في معايير البرمجة. يأتي التسريع من نموذج أولي مضبوط تلقائيًا ونواة MLX مخصصة تلغي قراءات الأوزان الزائدة.

2026-06-29

← PreviousPage 5 / 2 · 23 articlesNext →