تقييم نماذج اللغة الكبيرة
12 published articles
تحليل قياس الأداء
5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها
يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.
2026-08-02
تحليل المعايير
في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%
يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.
2026-08-02
تحليل المعايير
تم تصميم GPQA Diamond ليكون 'مقاومًا لجوجل'، لكن النماذج الحدودية تتجاوز الآن 95% على أي حال
تم تصميم GPQA Diamond بحيث لا يستطيع البشر المجهزون بالبحث الإجابة بشكل موثوق على أسئلته العلمية من مستوى الخبراء. النماذج الحدودية الآن تتجاوز 89% إلى 96%، مما يدفع المعيار نحو نفس التشبع الذي أخرج MMLU من الاستخدام.
2026-08-01
بحوث الذكاء الاصطناعي
رغوة في سلسلة الأفكار: معيار جديد يكشف كيف تهدر LLMs الرموز في استدلال صحيح لكنه عديم الفائدة
غالبًا ما تولد LLMs سلاسل استدلال صحيحة ولكنها محشوة بخطوات غير ضرورية. يظهر معيار تشخيصي جديد وطريقة ضغط أن المقيمين الحاليين يغفلون تمامًا عن هذا عدم الكفاءة وأن نصف خطوات الاستدلال التي كتبها البشر قد تكون قابلة للضغط.
2026-07-31
تحليل المعايير
امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%
بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.
2026-07-31
تحليل معايير تقييم
HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا
أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.
2026-07-30
تحليل المعايير
كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة
أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.
2026-07-29
تحليل المعايير
سيطر معيار MMLU على تقييم الذكاء الاصطناعي لسنوات. ثم بدأت النماذج في إتقان الإجابات
حدد MMLU جيلًا من تقييم الذكاء الاصطناعي، لكن تلوث بيانات التدريب ومفتاح إجابات معيب دفعا المختبرات الحدودية نحو بدائل ديناميكية مثل HLE و GPQA Diamond.
2026-07-28
أسس الذكاء الاصطناعي
لماذا لا تستطيع الذكاء الاصطناعي تفسير نفسها بعد؟ إطار للتفكير في الصرامة العلمية
تقدم ورقة بحثية من جوجل ديب مايند إطارًا ثلاثي الأجزاء للتفكير في الصرامة في الذكاء الاصطناعي: المفاهيمية، والمعرفية، والتشغيلية. وتجادل بأن التقدم السريع للتعلم العميق جاء من إعطاء الأولوية للتكرار القائم على الأداء على الفهم العلمي، وأن سد الفجوات سيتطلب أكثر من مجرد معايير أفضل.
2026-07-20
تقييم الوكلاء
صناديق الرمل في الاختبارات تخفي كيف تفشل الوكلاء حقًا، جامعة هونغ كونغ قدمت الحل
UniClawBench يقيم الوكلاء الاستباقيين عبر خمس قدرات أساسية في 400 مهمة ثنائية اللغة في العالم الحقيقي، باستخدام حاويات Docker الحية وتقييم حلقة مغلقة بثلاثة وكلاء. يفصل قدرات النموذج الأساسية عن اختيارات الإطار، كاشفًا أين ينهار الوكلاء حقًا.
2026-07-13
أدوات
نموذج الذكاء الاصطناعي الخاص بك هو سلعة. خط الأنابيب هو المكان الذي تعيش فيه الميزة الحقيقية.
تحليل عملي خطوة بخطوة لبناء خط أنابيب للكتابة بالذكاء الاصطناعي في عام 2025: اختيار النموذج، تسلسل المطالبات (prompt chaining)، ومراقبة الجودة. لا ضجيج، فقط البنية التقنية المهمة.
2026-07-11
تقييم النماذج
أولمو-إيفال من Ai2 يمنح مطوري LLM ميكروسكوبًا لكل نقطة تفتيش
أولمو-إيفال من Ai2 يجلب الفروقات لكل سؤال والمعايير المعيارية المعيارية إلى تطوير LLM النشط، مما يساعد الباحثين على تمييز التقدم الحقيقي عن الضوضاء الإحصائية.
2026-07-06