تحليل المعايير

امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%

بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.

Emmanuel Fabrice Omgbwa Yasse

2026-07-31 · آخر تحديث: 2026-08-03 · قراءة 2 دقائق

امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%
المصادر : Évaluation et B…·Humanity's Last…·Humanity's Last…

عندما أُطلق امتحان البشرية الأخير (HLE) في أوائل عام 2025، سجل GPT-4o نسبة 2.7%. وسجل Claude 3.5 Sonnet نسبة 4.1%. ويبلغ خط الأساس البشري الخبير حوالي 90%. لم تكن تلك الفجوة نتيجة صدفة لاختبار ضعيف المعايرة، بل كانت هي الهدف. تم بناء HLE من قبل مركز سلامة الذكاء الاصطناعي وScale AI تحديدًا لأن MMLU توقف عن كونه صعبًا بما يكفي لكونه ذا معنى، وكان المشروع رسميًا بما يكفي لكونه منشورًا في Nature.

يحتوي الاختبار على 2500 سؤال، كتبها متخصصون عبر أكثر من مائة تخصص أكاديمي، وهو منظم لمقاومة الأمرين اللذين قتلا الجيل السابق من المعايير: البحث على الإنترنت وحفظ مجموعة التدريب. لا يوجد تنسيق مقالي للتمويه بحشو سلس. الإجابات إما قصيرة ودقيقة (76% من الأسئلة) أو اختيار من متعدد مع مشتتات متطورة بما يكفي لمعاقبة المطابقة السطحية للأنماط (24%). تتطلب 14% من العناصر قراءة رسم بياني أو مخطط أو صورة بجانب النص، لذلك لا يمكن للنموذج الاعتماد على اللغة فقط.

من أين تأتي الأسئلة

يخبرك توزيع الموضوعات بما يقدره الاختبار فعليًا: تشكل الرياضيات 41% من بنك الأسئلة، وعلم الأحياء والطب 11%، وعلوم الكمبيوتر والذكاء الاصطناعي 10%، والفيزياء 9%، والكيمياء 7%، والعلوم الإنسانية والاجتماعية 9%، والهندسة 4%، وباقي المجالات التخصصية المتنوعة. إنه اختبار كمي بشكل كبير حسب التصميم، أقرب إلى اختبار تأهيلي للدكتوراه منه إلى اختبار معرفة عامة.

المتصدرون الحاليون

وفقًا لأحدث النتائج المنشورة، يبدو المشهد كالتالي:

  • Claude Opus 5: 64.7%
  • Claude Mythos 5: 64.5%
  • Claude Opus 4.8: 57.9%
  • Claude Sonnet 5: 57.4%
  • Kimi K3: 56.0%
  • GLM 5.2: 54.7%
  • Claude Fable 5: 53.3%
  • Hy3 (Tencent): 53.2%
  • DeepSeek V4 Flash: 51.6%
  • GPT-5.6 Sol: 47.2%
  • Gemini 3.1 Pro: 44.4%
  • GPT-5.5 Pro: 43.1%

هناك أمران بارزان. أولاً، النماذج ذات أوضاع التفكير المخصصة، التي تقضي وقت استدلال إضافيًا في التخطيط والتحقق من عملها قبل الإجابة، تهيمن على قمة القائمة. توقف عدد المعاملات الخام عن أن يكون العامل الحاسم بمجرد أن أصبح HLE الاختبار المرجعي؛ ما يفصل بين درجة 65% ودرجة 45% يبدو بشكل متزايد هو ما إذا كان النموذج قادرًا على اكتشاف أخطائه أثناء الإجابة. ثانيًا، حتى المتصدر لا يزال متأخرًا بـ25 نقطة عن خط الأساس البشري الخبير، في اختبار صُمم صراحة ليكون من الصعب التلاعب به.

الاختبار لم يكن مثاليًا أيضًا

احتوت النسخة المبكرة من HLE نفسها على أخطاء، ووجد تدقيق تحت مبادرة HLE-Verified أن ما يصل إلى 30% من الأقسام الفرعية للكيمياء والأحياء تحتوي على مطالبات غامضة أو إجابات مرجعية غير صحيحة، مما استلزم مراجعة مكونًا تلو الآخر. بدلاً من السماح لذلك بتقويض المعيار بالطريقة التي قوضت بها الأخطاء غير المكتشفة MMLU وGSM8K، بنى المشروع HLE-Verified لإصلاحه وHLE-Rolling لإضافة أسئلة مدققة من المجتمع العلمي بشكل مستمر. هذه الرغبة في التدقيق وإعادة النشر، بدلاً من إصدار مجموعة ثابتة مرة واحدة والدفاع عنها إلى الأبد، هي جزء من سبب احتفاظ HLE بمكانتها كأصعب معيار عام في المجال بدلاً من اتباع سابقيها إلى التشبع.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.