تقييم نماذج اللغة الكبيرة

12 published articles

معايير واختباراتFeatured2 min read

تحليل قياس الأداء

5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها

يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.

2026-08-02

معايير واختباراتFeatured2 min read

تحليل المعايير

في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%

يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.

2026-08-02

معايير واختباراتFeatured2 min read

تحليل المعايير

تم تصميم GPQA Diamond ليكون 'مقاومًا لجوجل'، لكن النماذج الحدودية تتجاوز الآن 95% على أي حال

تم تصميم GPQA Diamond بحيث لا يستطيع البشر المجهزون بالبحث الإجابة بشكل موثوق على أسئلته العلمية من مستوى الخبراء. النماذج الحدودية الآن تتجاوز 89% إلى 96%، مما يدفع المعيار نحو نفس التشبع الذي أخرج MMLU من الاستخدام.

2026-08-01

نماذج اللغات الكبيرة4 min read

بحوث الذكاء الاصطناعي

رغوة في سلسلة الأفكار: معيار جديد يكشف كيف تهدر LLMs الرموز في استدلال صحيح لكنه عديم الفائدة

غالبًا ما تولد LLMs سلاسل استدلال صحيحة ولكنها محشوة بخطوات غير ضرورية. يظهر معيار تشخيصي جديد وطريقة ضغط أن المقيمين الحاليين يغفلون تمامًا عن هذا عدم الكفاءة وأن نصف خطوات الاستدلال التي كتبها البشر قد تكون قابلة للضغط.

2026-07-31

معايير واختباراتFeatured2 min read

تحليل المعايير

امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%

بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.

2026-07-31

معايير واختباراتFeatured2 min read

تحليل معايير تقييم

HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا

أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.

2026-07-30

معايير واختباراتFeatured2 min read

تحليل المعايير

كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة

أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.

2026-07-29

معايير واختباراتFeatured2 min read

تحليل المعايير

سيطر معيار MMLU على تقييم الذكاء الاصطناعي لسنوات. ثم بدأت النماذج في إتقان الإجابات

حدد MMLU جيلًا من تقييم الذكاء الاصطناعي، لكن تلوث بيانات التدريب ومفتاح إجابات معيب دفعا المختبرات الحدودية نحو بدائل ديناميكية مثل HLE و GPQA Diamond.

2026-07-28

الذكاء الاصطناعيFeatured5 min read

أسس الذكاء الاصطناعي

لماذا لا تستطيع الذكاء الاصطناعي تفسير نفسها بعد؟ إطار للتفكير في الصرامة العلمية

تقدم ورقة بحثية من جوجل ديب مايند إطارًا ثلاثي الأجزاء للتفكير في الصرامة في الذكاء الاصطناعي: المفاهيمية، والمعرفية، والتشغيلية. وتجادل بأن التقدم السريع للتعلم العميق جاء من إعطاء الأولوية للتكرار القائم على الأداء على الفهم العلمي، وأن سد الفجوات سيتطلب أكثر من مجرد معايير أفضل.

2026-07-20

معايير واختبارات4 min read

تقييم الوكلاء

صناديق الرمل في الاختبارات تخفي كيف تفشل الوكلاء حقًا، جامعة هونغ كونغ قدمت الحل

UniClawBench يقيم الوكلاء الاستباقيين عبر خمس قدرات أساسية في 400 مهمة ثنائية اللغة في العالم الحقيقي، باستخدام حاويات Docker الحية وتقييم حلقة مغلقة بثلاثة وكلاء. يفصل قدرات النموذج الأساسية عن اختيارات الإطار، كاشفًا أين ينهار الوكلاء حقًا.

2026-07-13

الأدوات والأطر5 min read

أدوات

نموذج الذكاء الاصطناعي الخاص بك هو سلعة. خط الأنابيب هو المكان الذي تعيش فيه الميزة الحقيقية.

تحليل عملي خطوة بخطوة لبناء خط أنابيب للكتابة بالذكاء الاصطناعي في عام 2025: اختيار النموذج، تسلسل المطالبات (prompt chaining)، ومراقبة الجودة. لا ضجيج، فقط البنية التقنية المهمة.

2026-07-11

نماذج اللغات الكبيرة3 min read

تقييم النماذج

أولمو-إيفال من Ai2 يمنح مطوري LLM ميكروسكوبًا لكل نقطة تفتيش

أولمو-إيفال من Ai2 يجلب الفروقات لكل سؤال والمعايير المعيارية المعيارية إلى تطوير LLM النشط، مما يساعد الباحثين على تمييز التقدم الحقيقي عن الضوضاء الإحصائية.

2026-07-06