الذكاء الاصطناعي · سلامة الوكلاء
SafeEvolve يقلّص نجاح هجمات الوكلاء إلى الثلث عبر تطوير الأداة الوسيطة والنموذج معًا
SafeEvolve، ورقة على arXiv قُدّمت في 2 سبتمبر، تقرن تحديثات الأداة الوسيطة وقت التشغيل بتدريب السياسة، بحيث تقود مسارات الوكيل نفسها كلا الجانبين. وتُفيد بانخفاض بمقدار ثلاثة أضعاف في نجاح الهجوم على AgentDojo وتحسّن متواضع في الأداء الوظيفي.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-09-25 · قراءة 3 دقائق

عادةً ما يختار العمل الأمني المتعلق بالوكلاء القائمين على النماذج اللغوية الكبيرة جانبًا واحدًا. فإما أن تحصّن البنية المحيطة التي يعمل الوكيل داخلها، وإما أن تضبط النموذج ضبطًا دقيقًا حتى يتحسّن سلوكه. وتجادل ورقة بحثية قُدّمت إلى arXiv في 2 سبتمبر بأن الانفصال نفسه هو المشكلة: فالتحكّم وقت التشغيل والسلامة الجوهرية لا يعزّز أحدهما الآخر أبدًا، لذا يُستنزف التقدّم المحقَّق في أحد الجانبين بهدوء لصالح الجانب الآخر.
تحمل الورقة، الواقعة في قسم الذكاء الاصطناعي على arXiv، عنوان "SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment". وفرضيتها بنيوية. فأداء الوكيل يتشكّل بالاشتراك بين النموذج الأساسي والأداة الوسيطة التي تنظّم تفاعله مع البيئة، ما يعني أن الخطر قد يظهر مرّتين: في استجابة نهائية ضارّة، أو عبر مسار تنفيذ متعدد الخطوات لا يُنتج جملة خاطئة واحدة بشكل واضح.
الأداة الوسيطة أصبحت الآن جزءًا من نموذج التهديد
تعالج معظم مسارات الموائمة أحد هذين السطحين في كل مرة. فتحديثات الأداة الوسيطة الخارجية تُرقّع وقت التشغيل. وتحسين السياسة يغيّر النموذج. وتقول الورقة إن أيًا منهما، عند تطبيقه بمعزل عن الآخر، لا يجسر الفجوة بين ما يستطيع وقت التشغيل فرضه وما تعلّم النموذج فعلاً أن يفعله، فتتراكم إخفاقات الوكلاء في تلك الفجوة.
بدلاً من ذلك، يشغّل SafeEvolve حلقة مستمرة. فهو يستقي خبرة السلامة من مسارات مكتملة وفق السياسة ذاتها، أي من عمليات الوكيل المنتهية نفسها، ويستخدم تلك الأدلة لتحديث الجانبين في آن واحد.
كيف تعمل حلقة التطوّر المشترك
على جانب الأداة الوسيطة، يحوّل النظام أدلة السلامة على مستوى المسار إلى تحديثات محدودة على مستوى المكوّنات. وتستقر تلك التحديثات في موجّه السلامة وفي مجموعة من المهارات الهرمية. وتصف الورقة مخرجات الأداة الوسيطة الناتجة بأنها قابلة للتدقيق وقابلة للتراجع، وهو أمر مهم لكل من يضطر إلى تفسير سلوك وكيل مُشغَّل بعد وقوع الحدث.
وعلى جانب السياسة، يستخدم SafeEvolve مسارًا من مرحلتين: الضبط الدقيق بإشراف ثم التعلّم المعزّز. فالضبط الدقيق بإشراف على استخدام الأداة الوسيطة يهيّئ السياسة للاستفادة الفعّالة من مخرجات الأداة التي تطوّرت حتى تلك اللحظة. ثم يشكّل التعلّم المعزّز، مع مكافآت مفصّلة وفق المُتحقِّق، سلوك السلامة الذاتي أثناء الاستكشاف متعدد الخطوات، بحيث لا يعتمد الوكيل على الأداة الوسيطة وحدها.
ما تُظهره أرقام AgentDojo، وما تغفله
يقدّم المؤلفون تجارب على معايير قياس سلامة الوكلاء، ويزعمون تحقيق مقايضة أقوى بين السلامة والأداء الوظيفي مما تحققه الخطوط الأساسية القائمة. والنتيجة الملموسة الوحيدة في الملخّص تخص Qwen3.5-4B.
| المقياس | قبل | بعد SafeEvolve |
|---|---|---|
| معدّل نجاح الهجوم، AgentDojo | غير مذكور في الورقة | أقل بمقدار ثلاثة أضعاف من الخط الأساسي |
| الأداء الوظيفي الحميد | 59.79% | 61.86% |
يستحقّ عدم التناظر في هذا الجدول وقفة. فالورقة تنشر نسبة لمعدّل نجاح الهجوم، وهي انخفاض بمقدار ثلاثة أضعاف، لكنها لا تنشر المعدّلات الخام التي حُسبت منها. أما أرقام الأداء الوظيفي فتظهر بقيم مطلقة، والفرق فيها يبلغ 2.07 نقطة مئوية.
لماذا تكتسب صفة "القابلية للتراجع" وزنًا أكبر من النسبة
آلية السلامة التي يمكن فحصها على مستوى المكوّنات والتراجع عنها شيء مختلف عن إعادة تدريب النموذج. فالفرق التي تشغّل وكلاء في بيئات منظّمة تستطيع تسجيل ما تغيّر ومتى تغيّر، والتراجع عن أي تغيير يُخلّ بالعمل المشروع. ولا شيء في الملخّص يشير إلى أن SafeEvolve اختُبر في مواجهة هذا النوع من ضغوط الحوكمة، لكن تصميم المخرجات يشير إلى القيد الذي تصطدم به الجهات المشغّلة فعلاً.
النطاق هنا متواضع. آلية واحدة، ونتائج معايير قياس على نموذج صغير واحد، وسؤال لا يجيب عنه الملخّص: هل تستمر حلقة تتعلّم من مسارات الوكيل نفسه في التحسّن مع زيادة الحجم، أم تنتهي إلى التعلّم من أخطائها هي؟ فالنتائج مصدرها معايير قياس سلامة الوكلاء، لا حركة الإنتاج الفعلية.
- المصدر : SafeEvolve cuts agent attack success 3x by evolving harness and model together — 2026-09-02
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.