نموذج اللغة البصري
2 published articles
نماذج اللغات الكبيرة3 min read
الاستدلال ثلاثي الأبعاد
SceneActBench: لماذا تفشل حتى أفضل نماذج VLM في الحركة ثلاثية الأبعاد
يختبر SceneActBench أحد عشر تكوينًا لـ VLM على خمس مهام ثلاثية الأبعاد في حلقة وكيل موحدة. تتراوح النتائج الإجمالية من 38.6 إلى 50.2، دون أداء ثابت لأي نموذج. يكشف المعيار عن بقعة عمياء في وكلاء الرؤية واللغة: التصرف في المشاهد الكاملة، وليس مجرد وصفها.
2026-07-31
المختبرات والأبحاثFeatured3 min read
الانفتاحية ونماذج الرؤية واللغة
تجربة Picbreeder من Sakana AI تُظهر ما تفتقده نماذج الرؤية واللغة من الإبداع البشري
فريق بقيادة Sakana AI استبدل مستخدمي Picbreeder البشر بنماذج الرؤية واللغة ووجد أن الأرشيفات الاصطناعية تفتقر إلى الجرأة والتنوع في النسخ البشرية الأصلية. تجاربهم مع الضوضاء والذاكرة وآلاف الشخصيات المدعومة بالوعود تكشف كلاً من الوعد والقيود لاستخدام النماذج الكبيرة في الاكتشاف المفتوح.
2026-07-20