الذكاء الاصطناعي4 min read
التقييم المحدد مقابل غير المحدد
لماذا يفشل التقييم الذاتي لنموذج الذكاء الاصطناعي في الجودة البصرية
يقدم بحث جديد مفهوم 'التمييز' كمتغير رئيسي يحكم محورًا ثالثًا لحساب زمن الاختبار: التوسع التفاعلي. وتظهر النتائج أن أداة محددة تقيس التخطيط الفعلي تتفوق على تقييم VLM عبر لقطة الشاشة، حيث تصلح 73-74% من العيوب في الوضعيات البصرية بينما لا يرى المقياس القياسي شيئًا.
2026-07-31