معايير الذكاء الاصطناعي
19 published articles
ذكاء اصطناعي مفتوح المصدر: علي بابا تفتح فئة Max
Qwen 3.8-Max: نموذج علي بابا الأقوى أصبح الآن متاحًا للتحميل مجانًا
تفتح علي بابا المصدر لنموذجها الأقوى على الإطلاق Qwen 3.8-Max: نموذج MoE بمعاملات 2.4T يتفوق على GPT-5.6 Sol في SWE-bench Pro وPaperBench وIFBench. نحلل تحفظات هذه المعايير وما يعنيه نموذج رائد مفتوح بنشاط 95B للمطورين.
2026-08-16
الذكاء الاصطناعي مفتوح المصدر
Qwen3.8-Max يتفوق على 458 فريقًا بشريًا في 24 ساعة، وهو يعمل بمفرده
تفوق Qwen3.8-Max على 458 من أصل 526 فريقًا بشريًا في مسابقة استمرت 24 ساعة بينما كان يعمل بمفرده، وستفتح Alibaba مصدر أوزانه الأسبوع المقبل. كل رقم حتى الآن ورد من الشركة نفسها، وهذا تحديدًا هو السبب الذي يجعل ادعاءات الاستقلالية تستحق التدقيق.
2026-08-03
تقرير خاص: تقييم الذكاء الاصطناعي
حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها
جولة شاملة في مشهد قياس أداء الذكاء الاصطناعي لعام 2026: لماذا انهارت MMLU وGSM8K وHumanEval، وكيف حلت محلها المعايير الديناميكية والامتحانات الخبيرة مثل HLE وGPQA Diamond، وما يكشفه اختبار العوامل والذكاء المتعرج، وكيف تكمل الآن التفضيلات البشرية، ومحكمو نماذج اللغات الكبيرة، والمراقبة الإنتاجية مجموعة التقييم الكاملة.
2026-08-03
تحليل المعايير
LiveBench يرفض البقاء ثابتًا. هذا هو المغزى كله
يستبدل LiveBench مفتاح إجابة ثابت بمجموعة محدثة باستمرار من مشاكل البرمجة والمستودعات وأسئلة التوقع، متجاوزًا التلوث الذي قوض MMLU و GSM8K. إنه جزء من تحول أوسع نحو التقييم الديناميكي إلى جانب LiveCodeBench و ForecastBench و LLMEval-Fair.
2026-08-03
تحليل قياس الأداء
5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها
يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.
2026-08-02
تحليل المعايير
في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%
يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.
2026-08-02
تحليل المعايير
تم تصميم GPQA Diamond ليكون 'مقاومًا لجوجل'، لكن النماذج الحدودية تتجاوز الآن 95% على أي حال
تم تصميم GPQA Diamond بحيث لا يستطيع البشر المجهزون بالبحث الإجابة بشكل موثوق على أسئلته العلمية من مستوى الخبراء. النماذج الحدودية الآن تتجاوز 89% إلى 96%، مما يدفع المعيار نحو نفس التشبع الذي أخرج MMLU من الاستخدام.
2026-08-01
تحليل المعايير
امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%
بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.
2026-07-31
تحليل معايير تقييم
HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا
أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.
2026-07-30
تحليل المعايير
ما أخطأت فيه ثلاثة معايير ذكاء اصطناعي بشأن الأداء في العالم الحقيقي
تُعتبر معايير الذكاء الاصطناعي مثل MMLU المعيار لمقارنة النماذج، لكن ثلاث حالات حديثة تُظهر أنها تفتقد أبعادًا حاسمة. يفتقر نموذج Nemotron-4 من Nvidia إلى التحقق المستقل، بينما يقايض Celeris-1 الدقة بالسرعة، وأفضل ذكاء اصطناعي لمراقبة مسببات الأمراض لا يتجاوز نصف المهام. تشير الأدلة إلى الحاجة إلى أطر تقييم تقيس ما يهم في الممارسة العملية.
2026-07-29
تحليل المعايير
كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة
أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.
2026-07-29
تحليل المعايير
سيطر معيار MMLU على تقييم الذكاء الاصطناعي لسنوات. ثم بدأت النماذج في إتقان الإجابات
حدد MMLU جيلًا من تقييم الذكاء الاصطناعي، لكن تلوث بيانات التدريب ومفتاح إجابات معيب دفعا المختبرات الحدودية نحو بدائل ديناميكية مثل HLE و GPQA Diamond.
2026-07-28