امتحان البشرية الأخير
2 published articles
معايير واختباراتFeatured2 min read
تحليل المعايير
امتحان البشرية الأخير بدأ بنتيجة 2.7%. أفضل النماذج لا تزال عاجزة عن تجاوز 65%
بُني امتحان البشرية الأخير من قبل CAIS وScale AI ليحل محل MMLU كأصعب معيار عام لنماذج اللغة الكبيرة. بعد عامين، حتى النتيجة الرائدة لكلود أوبوس 5 البالغة 64.7% لا تزال أقل بكثير من خط الأساس البشري الخبير البالغ 90%.
2026-07-31
نماذج اللغات الكبيرة4 min read
أبحاث الذكاء الاصطناعي
أربع شخصيات، إجابة واحدة: لماذا هزم التفكير غير المتجانس أفضل ذكاء اصطناعي في أصعب اختبار للبشرية
PoTRE يقسّم الاستدلال إلى أربع وكلاء يعملون بالتوازي، ثم يوفق بين إجاباتهم ديناميكيًا. حقق 49.92% في اختبار البشرية الأخير، متغلبًا على أفضل نتيجة رسمية سابقة. يعمل النهج بعدد رموز أقل مقارنة بالخطوط الأساسية الموسعة.
2026-07-24