معايير واختبارات3 min read
معايير
وكلاء سطح المكتب الذكاء الاصطناعي يفشلون في اختبار الترتيب القبلي-البعدي بنسبة 35%
يختبر DDB مهام الترتيب والمقارنات القبلية-البعدية عبر 2,013 حالة. حقق أفضل نموذج تطابقًا تامًا بنسبة 65.1% في التسلسلات بدون خداع و65.7% مع الخداع، مما يكشف فجوة في كيفية تحقق الوكلاء من تغييرات الحالة.
2026-08-01