تفكير ثلاثي الأبعاد
2 published articles
نماذج اللغات الكبيرة3 min read
الاستدلال ثلاثي الأبعاد
SceneActBench: لماذا تفشل حتى أفضل نماذج VLM في الحركة ثلاثية الأبعاد
يختبر SceneActBench أحد عشر تكوينًا لـ VLM على خمس مهام ثلاثية الأبعاد في حلقة وكيل موحدة. تتراوح النتائج الإجمالية من 38.6 إلى 50.2، دون أداء ثابت لأي نموذج. يكشف المعيار عن بقعة عمياء في وكلاء الرؤية واللغة: التصرف في المشاهد الكاملة، وليس مجرد وصفها.
2026-07-31
الذكاء الاصطناعي4 min read
المعيار
أداة GauntletBench من أكسفورد تختبر وكلاء الذكاء الاصطناعي في 100 مهمة حقيقية. لقد فشلوا في 81% منها.
تضع أداة GauntletBench من أكسفورد وكلاء الذكاء الاصطناعي أمام 100 مهمة صعبة من العالم الحقيقي. لا تتجاوز قدرة الأنظمة الحدودية 19.1% من النجاح، وهو أقل بكثير من الأداء البشري. يستهدف المعيار القدرات المهملة في الإدراك الزمني والفهم الرسومي والتفكير ثلاثي الأبعاد عبر خمسة تطبيقات مهنية.
2026-07-01