تحليل قياس الأداء

5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها

يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.

Emmanuel Fabrice Omgbwa Yasse

2026-08-02 · قراءة 2 دقائق

5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها
المصادر : Évaluation et B…·LMSYS Chatbot A…·Chatbot Arena: …

يسأل Chatbot Arena، الذي يُدار على lmarena.ai، سؤالاً بسيطًا مرارًا وتكرارًا: عند عرض استجابتين مجهولتين لنموذجين لنفس المطالبة، أيهما تفضل؟ لا درجة، ولا معايير، مجرد تصويت. تغذي هذه الأصوات نظام تصنيف إيلو، وهو نفس الرياضيات المستخدمة لترتيب لاعبي الشطرنج، حيث أن التغلب على خصم قوي يكسب أكثر من التغلب على ضعيف وكل نتيجة تزيح تقييمات كلا النموذجين.

جاذبية هذا الإعداد هي أنه يقيس شيئًا لا تقيسه الامتحانات المغلقة: ما إذا كان الناس يحبون فعلاً استخدام النموذج. يمكن للنظام أن يتفوق في GPQA Diamond ومع ذلك يكتب استجابات يجدها المستخدمون الحقيقيون متصلبة أو مراوغة أو سيئة التنسيق. يلتقط Arena التفضيل مباشرة، على نطاق واسع، وبطريقة عمياء، وهو أمر يصعب تزويره ومكلف لتكراره بأي طريقة أخرى.

لوحة متصدرين لا يوجد بها أي فارق تقريبًا في القمة

مع تسجيل ما يقرب من خمسة ملايين صوت، فإن الترتيبات الحالية حسب المختبر ضيقة بشكل ملحوظ: Anthropic عند 1,503 إيلو، xAI عند 1,495، Google عند 1,494، OpenAI عند 1,481، Alibaba عند 1,449، وDeepSeek عند 1,424. تقع الطبقة العليا بأكملها داخل نطاق 25 نقطة، فجوة صغيرة بما يكفي لأن تحولاً متواضعاً في عينة التصويت يمكن أن يعيد ترتيبها. هناك نمطان أوسع تحت هذا التجميع: النماذج المغلقة والمملوكة تمتلك تقريباً أفضلية 3.3% على النماذج مفتوحة الأوزان، ومتوسط الفجوة بين أقوى المختبرات الأمريكية والصينية تقلص إلى حوالي 2.7%. لا توجد أي فجوة من النوع الذي يمكن لأي شخص أن يتوقع أن يستمر طويلاً.

الحكم خلف الحكم

التصويت البشري لا يتسع لكل اختلاف في المطالبات التي يريد المختبر اختبارها، لذا تعتمد معظم خطوط أنابيب التقييم الإنتاجية على طريقة ثانية: LLM-as-a-Judge، حيث يسجل نموذج حدودي مخرجات نماذج أخرى مقابل معايير منظمة بدلاً من قيام شخص بذلك. إنها سريعة ورخيصة، فالتقييم القائم على الحكم يعمل بتكلفة أقل من 500 إلى 5,000 مرة مقارنة بدفع رواتب المقيمين البشريين، ويتفق مع الحكم البشري بنسبة 80% إلى 90% من الوقت. بالنسبة لمعظم أعمال التقييم اليومية، هذا جيد بما يكفي لاستبدال لجنة بشرية بالكامل.

لكن النسبة 10% إلى 20% التي يختلف فيها ليست ضوضاء عشوائية. إنها تتجمع حول تحيزات محددة موثقة. تكافئ نماذج الحكم بشكل منهجي الإجابات الأطول والأكثر هيكلة تفصيلاً بغض النظر عما إذا كان الطول الإضافي يضيف معلومات، وهو نمط يسميه الباحثون انحياز الإسهاب. كما أنها تميل لتفضيل أي إجابة تظهر أولاً في المقارنة، وتصنف بشكل أكثر إيجابية أي استجابة تتماشى مع تأطير مطالبة الحكم نفسه، وهو مزيج من انحياز الموضع والتملق الذي يصعب تدريبه بالكامل.

ماذا يعني هذا لقراءة لوحة المتصدرين

تعد تصنيفات Elo في Arena والنتائج القائمة على الحكم مفيدة حقًا، وهي تقيس شيئًا لا تستطيع معايير الكتاب المغلقة ذات الإجابة الواحدة قياسه هيكليًا: كيف يؤدي النموذج في التبادلات الفوضوية مفتوحة النهاية التي يجريها الناس معه بالفعل. لكن فجوة Elo البالغة 20 نقطة بين مختبرين، أو فوز ضيق في تقييم يحكمه LLM، هي أقرب إلى رمي عملة مع ميل طفيف من كونها ترتيبًا نهائيًا. عامل قمة Chatbot Arena بالطريقة التي تعامل بها نهاية الصورة في سباق متقارب: مثيرة للاهتمام، وغنية بالمعلومات، ولا تستحق المخاطرة بالكثير على أنها دائمة.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.