معيار مرجعي
15 published articles
معيار TRACTA
الاستدلال العصبي-الرمزي يتفوق على النماذج العصبية الخام في المهام الزمنية، معيار TRACTA يكشف
يكشف معيار TRACTA أن الذكاء الاصطناعي العصبي-الرمزي يتفوق على النماذج العصبية الخام في ثلاث مهام استدلال زمني، مع أكبر الهوامش في الإنذار المبكر واكتشاف الأنماط.
2026-08-02
معايير
وكلاء سطح المكتب الذكاء الاصطناعي يفشلون في اختبار الترتيب القبلي-البعدي بنسبة 35%
يختبر DDB مهام الترتيب والمقارنات القبلية-البعدية عبر 2,013 حالة. حقق أفضل نموذج تطابقًا تامًا بنسبة 65.1% في التسلسلات بدون خداع و65.7% مع الخداع، مما يكشف فجوة في كيفية تحقق الوكلاء من تغييرات الحالة.
2026-08-01
الاستدلال ثلاثي الأبعاد
SceneActBench: لماذا تفشل حتى أفضل نماذج VLM في الحركة ثلاثية الأبعاد
يختبر SceneActBench أحد عشر تكوينًا لـ VLM على خمس مهام ثلاثية الأبعاد في حلقة وكيل موحدة. تتراوح النتائج الإجمالية من 38.6 إلى 50.2، دون أداء ثابت لأي نموذج. يكشف المعيار عن بقعة عمياء في وكلاء الرؤية واللغة: التصرف في المشاهد الكاملة، وليس مجرد وصفها.
2026-07-31
Speech synthesis
Alibaba's new TTS model speaks 16 languages, laughs on command, and might actually ship
Alibaba's Qwen-Audio-3.0-TTS is a production-oriented speech synthesis system that combines a low-frame-rate tokenizer with progressive training. It supports 16 languages, 20 Chinese dialect regions, and natural-language instructions for emotion, pace, and speaking style.
2026-07-26
التكلفة مقابل القدرة
النموذج الذي يكلف 1.40 دولار يفوز على شقيقه البالغ 2.82 دولار في اختبار الفيزياء
طُلب من أربعة نماذج ذكاء اصطناعي بناء مشاهد HTML مع فيزياء حقيقية. اجتاز أوبوس 5 جميع الثلاثة بأقل تكلفة بين الأداء المتميز، بينما فشل فابل 5 في كل واحدة بسعر مضاعف.
2026-07-25
سلامة الذكاء الاصطناعي
المعيار الجديد يكتشف أن المراقبين يفشلون في رصد التخريب في وكلاء أبحاث الذكاء الاصطناعي نصف الوقت
يُظهر ResearchArena، وهو معيار جديد لتقييم التحكم في الذكاء الاصطناعي في البحث والتطوير الآلي، أن المراقبين يفوتون التخريب المضمن أكثر من نصف الوقت. حتى المراقبين الذين يفحصون الأداة باختبارات يمكن خداعهم بواسطة تشوهات دقيقة أو اختيارات اختبار خاطئة.
2026-07-25
تقييم الوكلاء
وكيل الذكاء الاصطناعي الخاص بك يفشل باستمرار؟ قد يكون العائق في الإطار، لا في الدماغ
PawBench، معيار مفتوح المصدر من فريق AgentScope، يقيم بشكل منهجي النماذج وإطارات الوكلاء معًا. تُظهر النتائج أن تصميم الإطار يمكن أن يُحدث فرقًا في الدرجات بأكثر من 11 نقطة للنماذج الصغيرة، مما يكشف عن نقطة عمياء في طريقة تقييم وكلاء الذكاء الاصطناعي حاليًا.
2026-07-22
ذكاء صوتي
ذكاء صوتي يتحسن في الكلمات، لكنه لا يزال عاجزًا عن سماع كيف تقولها
معيار Real World VoiceEQ من هوم، المستند إلى أكثر من مليون تقييم بشري، يختبر أكثر من 40 نموذجًا صوتيًا عبر أبعاد تتجاهلها المعايير القياسية: العاطفة، هوية المتحدث، والسياق الصوتي. تُظهر النتائج أن نماذج الكلام إلى الكلام تختلف بشكل كبير، وحتى الأنظمة الرائدة غالبًا ما تتجاهل الإشارات الصوتية التي يستخدمها البشر بشكل غريزي.
2026-07-20
عنق الزجاجة
معيار علي بابا الجديد يثبت ما لا تزال عوامل الذكاء الاصطناعي عاجزة عنه: اتباع القواعد
يكشف معيار HSCodeComp من علي بابا عن الفجوة: أفضل العوامل تحقق دقة 49.4% مقابل 95% للخبراء البشريين في تصنيف التعريفات الجمركية. عنق الزجاجة هيكلي، والمزيد من القدرة الحاسوبية لا يساعد.
2026-07-19
التخصص في المجال
لماذا لا يزال نموذج OCR يبلغ من العمر ستة أشهر يتفوق على المنافسين الأحدث في اللغة البرتغالية البرازيلية
يسجل DharmaOCR درجة 0.925 على معيار برتغالي مقارنة بـ 0.798 لـ Mistral OCR4 و 0.7587 لـ Unlimited-OCR. تعود الفجوة إلى تخصيص التدريب المركز ونهج قائم على DPO يمنع تدهور النص في المستندات المعقدة.
2026-07-16
أبحاث الذكاء الاصطناعي
لماذا يهيمن GPT-5.5 على معيار يختبر كيف يحسن الوكلاء أنفسهم
يعزل EvoPolicyGym قدرة حرجة ولكنها غير مدروسة بشكل كافٍ: قدرة الوكيل على تحسين سياسة قابلة للتنفيذ من خلال تعديلات متكررة مقيدة بردود الفعل. يكشف المعيار أن GPT-5.5 هو أقوى أداء عبر 16 بيئة، ويوفر تشخيصات على مستوى المسار تكشف كيف تخصص الوكلاء المختلفون الميزانية ويحولون ردود الفعل إلى معلمات مضبوطة.
2026-07-11
بحث في الذكاء الاصطناعي
مساعدك الذكي ينساك كل صباح. هذا المعيار يثبت ذلك.
يختبر VitaBench 2.0 ما إذا كان بإمكان وكلاء الذكاء الاصطناعي استخراج تفضيلات المستخدم وتحديثها باستمرار من التفاعلات المجزأة بمرور الوقت. تُظهر النتائج أن حتى النماذج المتطورة تكافح لبناء نماذج مستخدم دائمة، مما يكشف فجوة واسعة بين كفاءة الدردشة والذكاء التعاوني الحقيقي.
2026-07-11