وكلاء الذكاء الاصطناعي3 min read
الذكاء الاصطناعي · سلامة الوكلاء
SafeEvolve يقلّص نجاح هجمات الوكلاء إلى الثلث عبر تطوير الأداة الوسيطة والنموذج معًا
SafeEvolve، ورقة على arXiv قُدّمت في 2 سبتمبر، تقرن تحديثات الأداة الوسيطة وقت التشغيل بتدريب السياسة، بحيث تقود مسارات الوكيل نفسها كلا الجانبين. وتُفيد بانخفاض بمقدار ثلاثة أضعاف في نجاح الهجوم على AgentDojo وتحسّن متواضع في الأداء الوظيفي.
2026-09-25