معايير الذكاء الاصطناعي
15 published articles
تحليل قياس الأداء
5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها
يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.
2026-08-02
تحليل المعايير
في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%
يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.
2026-08-02
تحليل المعايير
تم تصميم GPQA Diamond ليكون 'مقاومًا لجوجل'، لكن النماذج الحدودية تتجاوز الآن 95% على أي حال
تم تصميم GPQA Diamond بحيث لا يستطيع البشر المجهزون بالبحث الإجابة بشكل موثوق على أسئلته العلمية من مستوى الخبراء. النماذج الحدودية الآن تتجاوز 89% إلى 96%، مما يدفع المعيار نحو نفس التشبع الذي أخرج MMLU من الاستخدام.
2026-08-01
تحليل المعايير
امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%
بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.
2026-07-31
تحليل معايير تقييم
HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا
أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.
2026-07-30
تحليل المعايير
ما أخطأت فيه ثلاثة معايير ذكاء اصطناعي بشأن الأداء في العالم الحقيقي
تُعتبر معايير الذكاء الاصطناعي مثل MMLU المعيار لمقارنة النماذج، لكن ثلاث حالات حديثة تُظهر أنها تفتقد أبعادًا حاسمة. يفتقر نموذج Nemotron-4 من Nvidia إلى التحقق المستقل، بينما يقايض Celeris-1 الدقة بالسرعة، وأفضل ذكاء اصطناعي لمراقبة مسببات الأمراض لا يتجاوز نصف المهام. تشير الأدلة إلى الحاجة إلى أطر تقييم تقيس ما يهم في الممارسة العملية.
2026-07-29
تحليل المعايير
كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة
أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.
2026-07-29
تحليل المعايير
سيطر معيار MMLU على تقييم الذكاء الاصطناعي لسنوات. ثم بدأت النماذج في إتقان الإجابات
حدد MMLU جيلًا من تقييم الذكاء الاصطناعي، لكن تلوث بيانات التدريب ومفتاح إجابات معيب دفعا المختبرات الحدودية نحو بدائل ديناميكية مثل HLE و GPQA Diamond.
2026-07-28
تحليل
المعايير، وليس الصفقات: مختبرات الذكاء الاصطناعي الصينية تصل إلى التكافؤ
أظهرت مختبرات الذكاء الاصطناعي الصينية: تشيوان، ديب سيك، ميني ماكس، وكيمي أنها تضاهي أو تتفوق على النماذج الحدودية الأمريكية في معايير الاستدلال والبرمجة وتحليل المستندات. بفضل التسعير القوي واستراتيجيات الأوزان المفتوحة، لم تعد مجرد بدائل رخيصة، بل أصبحت منافسين حقيقيين.
2026-07-27
الذكاء الاصطناعي مفتوح المصدر
Kimi K3 هو أكبر نموذج مفتوح على الإطلاق. لكنه ليس الأفضل بعد.
Kimi K3 هو أكبر نموذج مفتوح بـ 2.8 تريليون معامل، لكنه يفشل في التفوق على أفضل النماذج المملوكة في المعايير العامة. بينما يتفوق في مهام الترميز والوكالة المحددة، فإن الفجوة مع القادة الحدوديين مثل Claude Fable 5 و GPT 5.6 Sol تكشف حدود التوسع دون اختراقات معمارية وبياناتية.
2026-07-27
الذكاء الاصطناعي
أربعة وكلاء أفضل من واحد: ARCANA تحل ARC-AGI-2 بالتحاور الذاتي
باحثون من عدة مؤسسات يقترحون ARCANA، وهو نظام متعدد الوكلاء يحلل ألغاز ARC-AGI-2 إلى إدراك، توليد فرضيات، تنفيذ رمزي، وتحسين تأملي. بنيته المعيارية ووحدة التحكم الفوقية المُتعلمة تعزز كفاءة التفكير، لكن الورقة تترك أسئلة رئيسية حول التعميم وتكلفة الحوسبة دون إجابة.
2026-07-19
Orchestrator swap
بيربلكسيتي تجعل جروك 4.5 نموذج التنسيق الأعلى في كمبيوتر، متغلبًا على أوبوس 4.8 بنصف التكلفة
تقول بيربلكسيتي إن جروك 4.5 تفوق على خمسة تكوينات تنسيق أخرى في اختبار WANDR الداخلي، متجاوزًا كلود أوبوس 4.8 في الدقة بتكلفة تقارب النصف، وهو متاح الآن في "كمبيوتر" لمشتركي Pro وMax.
2026-07-14