معايير واختبارات

مقارنات واختبارات أداء وتقييمات للنماذج.

23 published articles

4 min read

معيار الاستدلال المالي

نماذج اللغة الكبيرة تعرف الصيغ المحاسبية. FinIndices يُظهر أنها لا تستطيع تطبيقها

يمكن لنماذج اللغة الكبيرة أن تردد الصيغ المحاسبية، لكن FinIndices، وهو معيار مبني على بيانات مالية صينية حقيقية، يُظهر أنها تكافح لتطبيقها. انخفضت دقة Gemini-3.1-Pro من 70.70% إلى 38.22% عند إزالة تلميحات الصيغ، وكان توليد الجداول يضعف استدلال النماذج بشكل مباشر.

2026-08-20

5 min read

الذكاء الاصطناعي في التعليم

المعلّمون بالذكاء الاصطناعي يفرطون في المساعدة بحكم تصميمهم. معيار جديد يقيس ذلك

معيار مبني على 462 جلسة تدريس حقيقية يجد أن المعلّمين بالذكاء الاصطناعي يقومون افتراضيًا بالعمل نيابة عن الطلاب. التنبيه الصريح يساعد، لكن النماذج ما تزال تواجه صعوبة في الحكم الأساسي: متى تدفع، ومتى توفّر سقالة، ومتى تتراجع.

2026-08-10

5 min read

وكلاء الصوت

لماذا يتفوق Grok 4.1 Fast على النماذج الأذكى في المكالمات الهاتفية

الترتيبات العامة تختار نماذج LLM الخاطئة للمكالمات الصوتية. ترتيب BenchLM لعام 2026 يضع زمن الاستجابة أولاً: Grok 4.1 Fast يجيب في 0.54 ثانية بينما يحتاج Claude Opus 4.6، الأعلى تسجيلاً، إلى 1.78 ثانية. النماذج السريعة تتولى المحادثة؛ بينما تبقى نماذج التفكير لاستدعاءات الأدوات الخلفية.

2026-08-05

Featured5 min read

تقييم الذكاء الاصطناعي

المعايير القديمة للذكاء الاصطناعي تعطلت. إليك ما حل محلها.

المعايير الثابتة مثل MMLU وGSM8K مشبعة وملوثة. انتقلت الصناعة إلى إعادة التوليد الديناميكي والامتحانات الخبيرة وبيئات المهام الوكيلية للحصول على قياس حقيقي لقدرة الذكاء الاصطناعي.

2026-08-04

Featured8 min read

تقرير خاص: تقييم الذكاء الاصطناعي

حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها

جولة شاملة في مشهد قياس أداء الذكاء الاصطناعي لعام 2026: لماذا انهارت MMLU وGSM8K وHumanEval، وكيف حلت محلها المعايير الديناميكية والامتحانات الخبيرة مثل HLE وGPQA Diamond، وما يكشفه اختبار العوامل والذكاء المتعرج، وكيف تكمل الآن التفضيلات البشرية، ومحكمو نماذج اللغات الكبيرة، والمراقبة الإنتاجية مجموعة التقييم الكاملة.

2026-08-03

Featured3 min read

تقييم الأداء

نماذج الرؤية الذكية الرائدة تفشل في الإدراك الأساسي، وفقًا لمعيار جديد

يختبر PerceptionBench عشر قدرات بصرية ذرية عبر 3000 سؤال. لم ينجح أي نموذج رائد في تجاوز 60%، وتخفي الدرجات الإجمالية المتشابهة ملفات ضعف مختلفة للغاية.

2026-08-03

Featured2 min read

تحليل المعايير

LiveBench يرفض البقاء ثابتًا. هذا هو المغزى كله

يستبدل LiveBench مفتاح إجابة ثابت بمجموعة محدثة باستمرار من مشاكل البرمجة والمستودعات وأسئلة التوقع، متجاوزًا التلوث الذي قوض MMLU و GSM8K. إنه جزء من تحول أوسع نحو التقييم الديناميكي إلى جانب LiveCodeBench و ForecastBench و LLMEval-Fair.

2026-08-03

Featured2 min read

تحليل قياس الأداء

5 ملايين صوت، 25 نقطة إيلو: داخل لوحة متصدرين Chatbot Arena التي لا يمكن لأحد زعزعتها

يُصنف LMSYS Chatbot Arena النماذج حسب التفضيل البشري الأعمى على مقياس إيلو، مع ما يقرب من خمسة ملايين صوت الآن تزحم المختبرات الرائدة في نطاق 25 نقطة. تحمل طرق LLM-as-a-Judge التي توسع نطاق هذا النوع من التقييم تحيزاتها الموثقة تجاه الإسهاب والموضع.

2026-08-02

Featured2 min read

تحليل المعايير

في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%

يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.

2026-08-02

Featured2 min read

تحليل المعايير

تم تصميم GPQA Diamond ليكون 'مقاومًا لجوجل'، لكن النماذج الحدودية تتجاوز الآن 95% على أي حال

تم تصميم GPQA Diamond بحيث لا يستطيع البشر المجهزون بالبحث الإجابة بشكل موثوق على أسئلته العلمية من مستوى الخبراء. النماذج الحدودية الآن تتجاوز 89% إلى 96%، مما يدفع المعيار نحو نفس التشبع الذي أخرج MMLU من الاستخدام.

2026-08-01

3 min read

معايير

وكلاء سطح المكتب الذكاء الاصطناعي يفشلون في اختبار الترتيب القبلي-البعدي بنسبة 35%

يختبر DDB مهام الترتيب والمقارنات القبلية-البعدية عبر 2,013 حالة. حقق أفضل نموذج تطابقًا تامًا بنسبة 65.1% في التسلسلات بدون خداع و65.7% مع الخداع، مما يكشف فجوة في كيفية تحقق الوكلاء من تغييرات الحالة.

2026-08-01

Featured2 min read

تحليل المعايير

امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%

بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.

2026-07-31

← PreviousPage 1 / 2 · 23 articlesNext →