معايير الذكاء الاصطناعي

19 published articles

Qwen / Alibaba5 min read

ذكاء اصطناعي مفتوح المصدر: علي بابا تفتح فئة Max

Qwen 3.8-Max: نموذج علي بابا الأقوى أصبح الآن متاحًا للتحميل مجانًا

تفتح علي بابا المصدر لنموذجها الأقوى على الإطلاق Qwen 3.8-Max: نموذج MoE بمعاملات 2.4T يتفوق على GPT-5.6 Sol في SWE-bench Pro وPaperBench وIFBench. نحلل تحفظات هذه المعايير وما يعنيه نموذج رائد مفتوح بنشاط 95B للمطورين.

2026-08-16

Qwen / AlibabaFeatured5 min read

الذكاء الاصطناعي مفتوح المصدر

Qwen3.8-Max يتفوق على 458 فريقًا بشريًا في 24 ساعة، وهو يعمل بمفرده

تفوق Qwen3.8-Max على 458 من أصل 526 فريقًا بشريًا في مسابقة استمرت 24 ساعة بينما كان يعمل بمفرده، وستفتح Alibaba مصدر أوزانه الأسبوع المقبل. كل رقم حتى الآن ورد من الشركة نفسها، وهذا تحديدًا هو السبب الذي يجعل ادعاءات الاستقلالية تستحق التدقيق.

2026-08-03

معايير واختباراتFeatured8 min read

تقرير خاص: تقييم الذكاء الاصطناعي

حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها

جولة شاملة في مشهد قياس أداء الذكاء الاصطناعي لعام 2026: لماذا انهارت MMLU وGSM8K وHumanEval، وكيف حلت محلها المعايير الديناميكية والامتحانات الخبيرة مثل HLE وGPQA Diamond، وما يكشفه اختبار العوامل والذكاء المتعرج، وكيف تكمل الآن التفضيلات البشرية، ومحكمو نماذج اللغات الكبيرة، والمراقبة الإنتاجية مجموعة التقييم الكاملة.

2026-08-03

معايير واختباراتFeatured2 min read

تحليل المعايير

LiveBench يرفض البقاء ثابتًا. هذا هو المغزى كله

يستبدل LiveBench مفتاح إجابة ثابت بمجموعة محدثة باستمرار من مشاكل البرمجة والمستودعات وأسئلة التوقع، متجاوزًا التلوث الذي قوض MMLU و GSM8K. إنه جزء من تحول أوسع نحو التقييم الديناميكي إلى جانب LiveCodeBench و ForecastBench و LLMEval-Fair.

2026-08-03

معايير واختباراتFeatured2 min read

تحليل قياس الأداء

5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها

يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.

2026-08-02

معايير واختباراتFeatured2 min read

تحليل المعايير

في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%

يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.

2026-08-02

معايير واختباراتFeatured2 min read

تحليل المعايير

تم تصميم GPQA Diamond ليكون 'مقاومًا لجوجل'، لكن النماذج الحدودية تتجاوز الآن 95% على أي حال

تم تصميم GPQA Diamond بحيث لا يستطيع البشر المجهزون بالبحث الإجابة بشكل موثوق على أسئلته العلمية من مستوى الخبراء. النماذج الحدودية الآن تتجاوز 89% إلى 96%، مما يدفع المعيار نحو نفس التشبع الذي أخرج MMLU من الاستخدام.

2026-08-01

معايير واختباراتFeatured2 min read

تحليل المعايير

امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%

بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.

2026-07-31

معايير واختباراتFeatured2 min read

تحليل معايير تقييم

HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا

أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.

2026-07-30

الذكاء الاصطناعيFeatured3 min read

تحليل المعايير

ما أخطأت فيه ثلاثة معايير ذكاء اصطناعي بشأن الأداء في العالم الحقيقي

تُعتبر معايير الذكاء الاصطناعي مثل MMLU المعيار لمقارنة النماذج، لكن ثلاث حالات حديثة تُظهر أنها تفتقد أبعادًا حاسمة. يفتقر نموذج Nemotron-4 من Nvidia إلى التحقق المستقل، بينما يقايض Celeris-1 الدقة بالسرعة، وأفضل ذكاء اصطناعي لمراقبة مسببات الأمراض لا يتجاوز نصف المهام. تشير الأدلة إلى الحاجة إلى أطر تقييم تقيس ما يهم في الممارسة العملية.

2026-07-29

معايير واختباراتFeatured2 min read

تحليل المعايير

كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة

أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.

2026-07-29

معايير واختباراتFeatured2 min read

تحليل المعايير

سيطر معيار MMLU على تقييم الذكاء الاصطناعي لسنوات. ثم بدأت النماذج في إتقان الإجابات

حدد MMLU جيلًا من تقييم الذكاء الاصطناعي، لكن تلوث بيانات التدريب ومفتاح إجابات معيب دفعا المختبرات الحدودية نحو بدائل ديناميكية مثل HLE و GPQA Diamond.

2026-07-28

← PreviousPage 1 / 2 · 19 articlesNext →