بحث في الذكاء الاصطناعي

عندما يفشل وكيل البرمجة، فإن إعادة المحاولة الرخيصة أفضل من التصعيد، بتكلفة 35%

CodeRescue، نظام توجيه الاسترداد لوكلاء البرمجة، يستخدم ملاحظات التنفيذ ليقرر متى يعيد المحاولة باستخدام نماذج رخيصة مقابل التصعيد إلى نماذج باهظة الثمن. توفر طبقة التحكم في المخاطر المطابقة للمشغلين إمكانية تحديد أهداف التكلفة دون إعادة تدريب، محققة معدلات حل شبه مثالية بتكلفة 35% من التصعيد الدائم.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-25 · قراءة 5 دقائق

عندما يفشل وكيل البرمجة، فإن إعادة المحاولة الرخيصة أفضل من التصعيد، بتكلفة 35%
المصادر : CodeRescue: Bud…·CodeRescue GitH…

لماذا يهم توجيه الفشل لوكلاء البرمجة

وكلاء البرمجة الذين يشغلون الكود في بيئات قابلة للتنفيذ يحصلون على شيء تفتقر إليه معظم تطبيقات LLM: رسائل خطأ قابلة للتنفيذ. فشل التجميع، أو تعطل وقت التشغيل، أو مخرجات اختبار خاطئة تخبر الوكيل ليس فقط بفشله ولكن غالبًا بالسبب. السؤال لأي شخص ينشر هؤلاء الوكلاء على نطاق واسع هو ماذا يفعل بعد ذلك.

تعامل الأنظمة الحالية هذا على أنه تسلسل ثنائي. جرب النموذج الرخيص أولاً؛ إذا فشل، سلم المشكلة إلى نموذج باهظ الثمن. هذا يعمل، لكنه يضيع المعلومات التي أنتجها الفشل. النموذج الرخيص رأى بالفعل الموجه، كتب الكود، ورأى الخطأ. نفس الخطأ الذي يخبر الإنسان "جرب شيئًا آخر" يمكن أن يخبر نفس النموذج الرخيص شيئًا أيضًا.

صياغة توجيه الاسترداد

CodeRescue، الموصوف في ورقة نُشرت على arXiv في 21 يوليو 2026، يصوغ القرار بعد الفشل كمشكلة توجيه. بعد محاولة أولى فاشلة، يختار النظام من بين إجراءات الاسترداد غير المتجانسة: إعادة المحاولة بنفس النموذج الرخيص مع ملاحظات التنفيذ، أو تجربة استراتيجية رخيصة مختلفة (تستخدم تجارب الورقة إجراء "إعادة كتابة التلميح" الذي يعيد صياغة المهمة الأصلية مع سياق الخطأ)، أو التصعيد إلى نموذج أقوى. لكل إجراء تكلفة واحتمال نجاح يختلف حسب نوع الفشل.

درب الباحثون موجهًا خاضعًا للإشراف على عمليات التنفيذ، سلاسل من المحاولات والملاحظات والنتائج، من خمسة مقاييس برمجة. يتعلم الموجه أي إجراء استرداد يختار لأي بصمة فشل. النتيجة هي سياسة يمكنها خلط إعادة المحاولات الرخيصة والتصعيد في منتصف التدفق بدلاً من الالتزام بسلسلة ثابتة.

رسم بياني : فارق معدل الحل مقارنة بالتصعيد
يظهر CodeRescue المعدل بـ CRC عدم انخفاض في معدل الحل مقارنة بالتصعيد الدائم، بينما تنخفض الخطوط الأساسية الثابتة بمقدار 0.8 إلى 3.8 نقطة مئوية، وفقًا لورقة arXiv.

التحكم في الميزانية دون إعادة تدريب

ميزانية المشغل يمكن أن تتغير. اليوم يمكنك تحمل عشرة سنتات لكل مهمة، غدًا ربما خمسة. إعادة تدريب الموجه لكل ميزانية غير عملية. يضيف CodeRescue طبقة تحكم في المخاطر المطابقة (CRC) تختار عقوبة تكلفة وقت النشر دون إعادة تدريب. تعمل CRC تحت افتراضات القابلية للتبادل وتوفر تحكمًا هامشيًا في التكلفة المتوقعة، مما يعني أن المشغل يحدد هدف التكلفة، ويضمن النظام أن متوسط التكلفة يظل تحته عبر المهام، دون ضبط لكل مهمة.

هذه هي الآلية التي تسمح لنفس النظام بالعمل لشركة ناشئة بهوامش ضيقة ومختبر بحثي بجيوب أعمق، باستخدام أهداف تكلفة مختلفة على نفس الأجهزة.

الأرقام: الاسترداد الرخيص كبديل قابل للتطبيق

التجارب تقارن GPT-5.4-nano (النموذج الرخيص) بـ GPT-5.4 (النموذج الباهظ). عبر حالات الفشل المحتجزة، تفوقت الحدود المعايرة المنتجة بواسطة CodeRescue على كل أساسيات العمل الثابتة: التصعيد دائمًا، إعادة المحاولة دائمًا مع الملاحظات، إعادة كتابة التلميح دائمًا. كما تغلبت على الموجهات النصية فقط (موجه بسيط يخبر النموذج باختيار استراتيجية استرداد) وأساسية التسلسل الثنائي (لا توجيه، فقط التصعيد عند أي فشل).

السياسةمعدل الحلمتوسط تكلفة الاسترداد (نسبي)
التصعيد دائمًاالمرجع1.00x
إعادة المحاولة دائمًا (ملاحظات)−2.3 نقطة مئوية0.25x
إعادة كتابة التلميح دائمًا−3.8 نقطة مئوية0.20x
التسلسل الثنائي−0.8 نقطة مئوية0.80x
CodeRescue المعاير بواسطة CRC+0.0 نقطة مئوية (يساوي التصعيد)0.35x

نقطة الحدود المعايرة تطابقت مع معدل حل التصعيد الدائم عند 35% من متوسط تكلفة الاسترداد. هذا ليس تحسنًا هامشيًا. إنه تحول هيكلي في مفاضلة التكلفة والأداء للوكلاء الذين يعملون على نطاق واسع.

أنماط الفشل التكميلية

تذكر الورقة أن الاسترداد الرخيص والتصعيد يظهران أنماط نجاح تكميلية. بعض أنواع الفشل، خاصة أخطاء بناء الجملة والواردات المفقودة، تم إصلاحها باستمرار عن طريق إعادة المحاولة الرخيصة بعد رؤية رسالة الخطأ. أنواع أخرى، مثل أخطاء المنطق الدقيقة في خطوط أنابيب متعددة الخطوات، تطلبت فهم السياق الأوسع للنموذج الأقوى. تعلم الموجه التمييز بينها.

هذا يتوافق مع حدس يمتلكه العديد من المطورين بالفعل. النموذج الرخيص الذي يفشل في مشكلة صعبة غالبًا ما يفشل بنفس الطريقة مرتين. النموذج الرخيص الذي يفشل في خطأ إملائي بسيط غالبًا ما يصلحه عند إعادة المحاولة. الفرق في الفشل، وليس في النموذج.

ماذا يعني هذا لنشر الإنتاج

يستهدف CodeRescue بالتحديد سيناريو النشر الحساس للتكلفة الذي تعالجه أنظمة التسلسل بشكل سيئ. التسلسل الثنائي يضيع الحوسبة الرخيصة على حالات فشل يمكن إصلاحها بتكلفة زهيدة، لأنه يصعد عند أي فشل، أو يضيع الحوسبة الباهظة على حالات فشل قابلة للاسترداد بالفعل بالسياق. نهج التوجيه، مع معايرة الميزانية، يعطي المشغلين مقبضًا على التكلفة مع ضمان الأداء.

الكود متاح على GitHub، مما يعني أن هذا ليس قطعة أثرية بحثية مغلقة. يمكن للفرق التي تدير وكلاء البرمجة على نطاق واسع اختبار نهج التوجيه مقابل توزيعات الفشل الخاصة بهم. السؤال الكبير المفتوح هو ما إذا كان الموجه المدرب على خمسة مقاييس ينتقل إلى أعباء عمل الإنتاج. طبقة CRC الخاصة بالورقة تفترض القابلية للتبادل، وهو أمر معقول للمهام المحتجزة ضمن توزيع ولكن هش لتحولات المجال. سيرغب نشر الإنتاج في مراقبة حدود التكلفة والأداء للموجه بمرور الوقت وإعادة التدريب إذا انحرف توزيع بصمات الفشل.

لا شيء من هذا يغير النتيجة الأساسية: عندما يفشل وكيل البرمجة، فإن أرخص مسار ليس دائمًا التصعيد. أحيانًا تتركه يحاول مرة أخرى.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.