LLM كمحكم

3 published articles

معايير واختباراتFeatured5 min read

تقييم الذكاء الاصطناعي

المعايير القديمة للذكاء الاصطناعي تعطلت. إليك ما حل محلها.

المعايير الثابتة مثل MMLU وGSM8K مشبعة وملوثة. انتقلت الصناعة إلى إعادة التوليد الديناميكي والامتحانات الخبيرة وبيئات المهام الوكيلية للحصول على قياس حقيقي لقدرة الذكاء الاصطناعي.

2026-08-04

معايير واختباراتFeatured8 min read

تقرير خاص: تقييم الذكاء الاصطناعي

حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها

جولة شاملة في مشهد قياس أداء الذكاء الاصطناعي لعام 2026: لماذا انهارت MMLU وGSM8K وHumanEval، وكيف حلت محلها المعايير الديناميكية والامتحانات الخبيرة مثل HLE وGPQA Diamond، وما يكشفه اختبار العوامل والذكاء المتعرج، وكيف تكمل الآن التفضيلات البشرية، ومحكمو نماذج اللغات الكبيرة، والمراقبة الإنتاجية مجموعة التقييم الكاملة.

2026-08-03

معايير واختباراتFeatured2 min read

تحليل قياس الأداء

5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها

يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.

2026-08-02