نماذج اللغات الكبيرة5 min read
أبحاث الذكاء الاصطناعي
تدقيق جديد يكشف أن معظم ادعاءات المخاطر من رؤوس التعلم المعزز التوزيعي خاطئة
يُظهر تدقيق واسع النطاق أن وكلاء التعلم المعزز التوزيعي يُنتجون بشكل منهجي مقايضات مخاطر وهمية في الحالات التي من المرجح أن يثق بها الممارسون أكثر. عبر QR-DQN و C51 و IQN على MinAtar، لم يكن أي من أقوى الادعاءات قابلاً للتأكيد، وكان العمل بناءً على نصيحة CVaR للوكلاء يؤدي أحيانًا إلى أداء أسوأ بكثير من الصدفة.
2026-07-29