تقرير خاص: تقييم الذكاء الاصطناعي

حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها

جولة شاملة في مشهد قياس أداء الذكاء الاصطناعي لعام 2026: لماذا انهارت MMLU وGSM8K وHumanEval، وكيف حلت محلها المعايير الديناميكية والامتحانات الخبيرة مثل HLE وGPQA Diamond، وما يكشفه اختبار العوامل والذكاء المتعرج، وكيف تكمل الآن التفضيلات البشرية، ومحكمو نماذج اللغات الكبيرة، والمراقبة الإنتاجية مجموعة التقييم الكاملة.

Emmanuel Fabrice Omgbwa Yasse

2026-08-03 · قراءة 8 دقائق

حالة قياس أداء الذكاء الاصطناعي في عام 2026: انهيار الاختبارات الثابتة والأنظمة التي حلت محلها
المصادر : Évaluation et B…·Stanford HAI — …·Vellum — LLM Le…·Humanity's Last…·LMSYS Chatbot A…·SWE-bench — off…·Measuring Massi…·Training Verifi…·Evaluating Larg…·GPQA: A Graduat…·SWE-bench: Can …·Chatbot Arena: …·LiveBench: A Ch…

اسأل مختبر ذكاء اصطناعي عن مدى جودة أحدث نموذج له، وسيزودك بجدار من الأرقام: MMLU، GPQA Diamond، SWE-bench، تقييم Elo، رقم التكلفة لكل مليون رمز. قبل بضع سنوات، كانت تلك الأرقام تعني نفس الشيء تقريبًا للجميع. لم تعد كذلك الآن. أمضى المجال العامين الماضيين في اكتشاف، معيارًا تلو الآخر، أن اختبارًا ثابتًا بمفتاح إجابة عامة له فترة صلاحية، وأن فترة الصلاحية هذه أقصر من الفجوة بين إصدارين من النماذج.

ما يلي هو جولة في الأدوات التي تستخدمها الصناعة الآن لقياس القدرة الفعلية للنموذج، ولماذا تعطلت الأدوات القديمة، وما الذي لا يزال لا يعمل حتى في أحدثها.

أزمة المعايير الثابتة

لسنوات، ركزت ثلاثة اختبارات تقريبًا كل مقارنة للنماذج: MMLU للمعرفة العامة، GSM8K للتفكير الحسابي، وHumanEval لإنشاء الأكواد. كلها الآن تجاوزت نقطة الفائدة، لسببين منفصلين يتفاقمان معًا.

الأول هو التلوث. أسئلة المعايير العامة ينتهي بها المطاف مقتبسة في مجموعات التدريب المسبق، عن قصد أو بدون قصد، وبمجرد حدوث ذلك يمكن للنموذج أن ينجح عن طريق الاستدعاء بدلاً من التفكير. وجدت عمليات تدقيق مستقلة لمجموعات اختبار متعددة اللغات معدلات تلوث تصل إلى 91.8% في النماذج الكبيرة، مع زيادة الحفظ بشكل طردي مع عدد المعلمات. والثاني هو أن الاختبارات نفسها لم تكن أبدًا نظيفة كما تشير سمعتها: وجدت عمليات التدقيق أن حوالي 2% من أسئلة الرياضيات في MMLU كانت معطلة تمامًا، وما يصل إلى 42% من مجموعة عناصر GSM8K كانت غامضة أو خاطئة أو مصنفة بشكل خاطئ. النماذج الحدودية التي تتجاوز 88% إلى 90% في MMLU بدت وكأنها انتصار. كانت أقرب إلى أرضية قياس، مبنية جزئيًا على أسئلة معيبة لا يمكن لأحد الإجابة عليها بشكل صحيح بغض النظر عن المهارة.

استبدال مفتاح إجابة ثابت بآخر متحرك

لم يكن رد الصناعة هو تصحيح الاختبارات القديمة. بل كان التوقف عن استخدام مفاتيح الإجابة الثابتة تمامًا. LiveBench وشقيقه LiveCodeBench يسحبان مشاكل برمجة جديدة ومستودعات تم فتحها حديثًا على أساس أسبوعي متجدد، لذا فإن السؤال الذي تم إصداره هذا الأسبوع لا يمكن أن يكون قد لوث نموذجًا تم تدريبه قبل أشهر. ForecastBench و FutureX يتقدمان أكثر، حيث يطلبان من النماذج التنبؤ بنتائج أحداث مالية وجيوسياسية حقيقية لم تحدث بعد، أسئلة ليس لها إجابة تاريخية في أي مجموعة تدريب بطبيعتها.

هناك نهجان آخران يهاجمان نفس المشكلة من زوايا مختلفة. LLMEval-Fair يحتفظ بمخزن خاص مكون من 220,000 سؤال جامعي ويسحب مجموعة فرعية جديدة غير منشورة لكل جلسة تقييم، مقترنة باكتشاف الغش والتصنيف النسبي بدلاً من العتبات الثابتة. Flame يذهب أبعد من ذلك، حيث يقوم بتجميع أسئلة جديدة تمامًا عند الطلب من مواد مصدر أكاديمية والتحقق من منطقها بواسطة وكلاء فحص بدلاً من تخزين عناصر مكتوبة مسبقًا على الإطلاق. لا شيء من هذا مجاني: معيار يتغير أسبوعيًا يصعب إعادة إنتاجه، وتنتقل الثقة إلى من يحافظ على خط الإنتاج. لكنها المقايضة التي خلص إليها الباحثون بأنها ضرورية بمجرد أن أصبح واضحًا أن الشهرة والتلوث يصلا إلى نفس المعيار في نفس الوقت.

الاختبارات على مستوى الخبراء: HLE و GPQA Diamond

الرد الآخر على التشبع كان كتابة أسئلة صعبة بما يكفي بحيث يستغرق التشبع سنوات وليس أشهر للوصول. Humanity's Last Exam، الذي بناه مركز سلامة الذكاء الاصطناعي و Scale AI ونشر في Nature، بدأ مع GPT-4o الذي سجل 2.7% مقابل خط أساس خبراء بشري يبلغ حوالي 90%. بعد عامين، النموذج الرائد، Claude Opus 5، ارتفع إلى 64.7%، ولا يزال متأخرًا بـ 25 نقطة عن أداء الخبراء في اختبار مصمم بشكل صريح لمقاومة كل من البحث على الويب والحفظ.

GPQA Diamond يحكي قصة معاكسة تقريبًا. كتبه خبراء على مستوى الدكتوراه وتم التحقق من صحته مقابل غير خبراء مزودين بالبحث، وقد تم تصميمه ليكون مقاومًا تمامًا للاختصارات. لكن النماذج الحدودية الآن تتجاوز 89% إلى 96% عليه، مع تقدم Claude Sonnet 5 بنسبة 96.2%، مما يعني أن الاختبار ينفد من المساحة في الأعلى التي لا يزال HLE يمتلكها بكثرة. المعياران اللذان يجلسان في نهايتين متقابلتين لمنحنيات التشبع، يعملان جنبًا إلى جنب، هما في حد ذاته إشارة مفيدة: يخبرك أين تقع الحدود الحقيقية للصعوبة في الوقت الحالي.

التقييم الوكيل ومشكلة الذكاء المتعرج

المعايير الحوارية وأسلوب الامتحان تفتقد فئة كاملة من الفشل التي تظهر فقط عندما يتعين على النموذج التصرف، وليس مجرد الإجابة. SWE-bench هو أوضح مثال: النماذج التي تتجاوز 96% على مشكلات GitHub العامة المنسقة (SWE-bench Verified) تنهار إلى حوالي 23% على المستودعات الخاصة للمؤسسات التي تم إنشاؤها حديثًا (SWE-bench Pro)، وأكثر من ذلك، إلى 15% إلى 18%، على مجموعة احتياطية سرية تمامًا لا يمكن لأي مزود نموذج أن يكون قد رآها بشكل معقول.

بالإضافة إلى الأكواد، يختبر OSWorld الوكلاء على إدارة أنظمة تشغيل حقيقية من خلال الواجهة وسطر الأوامر؛ ارتفع متوسط الدقة هناك من 12% إلى 66.3% بين عامي 2024 و 2026، مقتربًا من خط الأساس البشري البالغ 72.4%. يقيس Browse

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.