وكلاء البرمجة المستقلون · مسودة arXiv البحثية
Harness-of-Harness يزعم تحقيق زيادة بنسبة 52.25% عبر تشغيل وكلاء برمجة آخرين
يلفّ HoH أُطر تشغيل وكلاء البرمجة القائمة في حلقات متكررة من التخطيط والبرمجة والاختبار، ويُبلغ عن متوسط زيادة نسبية قدرها 52.25% عبر ثلاث مجموعات اختبار مرجعية. يترك الملخص المقياس الأساسي وتكلفة الموارد والتوزيع بحسب كل نموذج دون تحديد.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-09-25 · قراءة 5 دقائق

نُشرت المسودة البحثية لـ Harness-of-Harness على arXiv في 1 سبتمبر 2026، وتطرح فصلًا تتجنبه معظم أوراق الوكلاء. فبدلاً من إطلاق وكيل برمجة، تلتفّ حول الوكلاء الموجودين بالفعل وتتولى مسؤولية ما يفعلونه بعد ذلك.
ينظّم HoH عمليات تشغيل إطار التشغيل في حلقات تخطيط وبرمجة واختبار، ثم يكرر تلك الحلقات بحيث تبدأ كل جولة من حيث انتهت التي قبلها. ويزعم الملخص أن هذه الطبقة الخارجية ترفع الأداء دون المساس بالنموذج الذي تحتها: متوسط زيادة نسبية قدره 52.25 بالمئة، وحد أقصى 82.86 بالمئة، قيست بعد ثلاث تكرارات.
الزعم: إطار تشغيل يحسّن أُطر تشغيل أخرى
يصف جزء كبير من الملخص ما يرفض HoH فعله. فهو يقيّد ما يُعد مخرَجاً قابلاً للتحقق بدلاً من أن يفرض كيف ينبغي أن يعمل الوكيل، ويضبط التطوير في زيادات صغيرة قابلة للفحص. ويُفصل الاختبار الذي يجري أثناء كتابة الشيفرة عن خطوة تقييم تعمل بمفردها.
ثم يأتي التوازن الذي يسلّط عليه المؤلفون الضوء: الإصلاح مقابل نمو القدرات. فحلقة تصلح العيوب فقط تُبقي المشروع حياً دون أن تدفعه إلى الأمام؛ وحلقة تضيف الميزات فقط تتراكم فيها الأعطال. ويُوصف HoH بأنه يُبقي كلا الجانبين في حالة توتر عبر التكرارات، ويكشف المخرجات والأدوات والمهارات تدريجياً بدلاً من كشفها كلها دفعة واحدة، ويحافظ على سجل مشروع مُصدَّر بالإصدارات بحيث يبقى السجل خلال التشغيل.
52.25 بالمئة من ماذا؟
قِيست المكاسب على GameCraft-Bench وFrontierSWE وProgramBench، مقابل إطار التشغيل نفسه عند تشغيله منفرداً. أنتجت ثلاث تكرارات المتوسط؛ وأنتج أحد الأزواج الحد الأقصى. وهنا يتوقف الملخص.
لا يسمّي أبداً المقياس الذي تحسّن. فزيادة نسبية بنسبة 52.25 بالمئة قد تكون معدل نجاح، أو عدد المهام المكتملة، أو مقياساً مركّباً عرّفه المؤلفون لهذه المناسبة، ولا يستطيع القارئ أن يميّز أياً منها من النص. كما لا تُقسَّم النتيجة بحسب إطار التشغيل أو النموذج أو المعيار، ما يترك المتوسط الرقم الوحيد المعروض. كلمة «نسبية» هي الكلمة الحاملة للثقل هنا: فالزيادة مقابل خط أساس منخفض هي تغيير مطلق أصغر مما تبدو عليه.
| الزعم في الملخص | ما يحدده النص فعلاً |
|---|---|
| متوسط زيادة نسبية قدره 52.25 بالمئة | عبر ثلاثة أزواج من إطار التشغيل والنموذج، بعد ثلاث تكرارات |
| حد أقصى للزيادة 82.86 بالمئة | الأفضل بين تلك الأزواج الثلاثة نفسها، بعد ثلاث تكرارات |
| تحسّن ثابت مقارنة بأُطر التشغيل المنفردة | مذكور لجميع الأزواج الثلاثة؛ دون أرقام لكل زوج |
| تطوير مستقل متعدد الأيام | مشروع واحد، أكثر من 70 تكراراً، لعبة تصويب من منظور الشخص الأول |
| التكلفة، ميزانية الرموز، الوقت الفعلي | غير مُبلغ عنها |
سبعون تكراراً، لعبة تصويب واحدة من منظور الشخص الأول
التطبيق العملي هو الجزء الذي سيصل أبعد. عبر أكثر من 70 تكراراً، يُقال إن HoH أنتج لعبة تصويب من منظور الشخص الأول بقصة متماسكة، وميكانيكا أساسية منفذة، وبناء قابل للعب البشري، و«مرئيات مصقولة وصوت مدمج».
لعبة التصويب تختبر أشياء لا تختبرها أداة سطر أوامر: الحالة في الزمن الحقيقي، ومعالجة المدخلات، والتصادم، وخط أصول ينجو من قيام وكيل بإعادة كتابة ملفات كتبها قبل ساعة. أما ما إذا كان بناء HoH يتجاوز هذا الحد، فهو مزعوم لا مقيس. ولا يقدم الملخص معدل الإطارات، ولا عدد اختبارات اللعب، ولا مقارنة بمشروع من صنع الإنسان بنطاق مشابه. كما أن «متعدد الأيام» ليس عدداً من الأيام، ولا يعطي النص أي رقم حوسبي أو عدد تدخلات بشرية خلال التشغيل.
النموذج مقابل إطار التشغيل
الأزواج الثلاثة هي Codex مع GPT-5.5، وOpenCode مع DeepSeek-V4-Pro، وPi مع MiniMax-M3. ثلاثة أُطر تشغيل على ثلاث عائلات نماذج هو الشكل الصحيح لورقة بحثية عن السقالات. ولو كانت الحلقة قد ساعدت فقط إطار التشغيل الذي صُممت حوله، لبدت الفكرة كلها وكأنها وصفة أوامر أُعيد تغليفها.
يقول الملخص إن HoH تفوّق في كل مرة على إطار التشغيل المنفرد المقابل، وهو أقوى زعم يمكن تقديمه دون نشر التقسيم. أما الجهد فهو ما لا يستطيع النص استبعاده. فالحلقة التكرارية التي تعمل مدة أطول، وتجرب متغيرات أكثر، وتطرح إخفاقات أكثر، ستميل إلى تحقيق نتيجة أعلى في أي معيار، ولا تظهر في الملخص أي ميزانية رموز أو رقم للوقت الفعلي أو محاسبة للتكلفة. ويبقى مفتوحاً مقدار ما يأتي من نسبة 52.25 بالمئة من جدولة أفضل ومقدار ما يأتي من إنفاق أكثر من كل شيء.
ما لا تُظهره الورقة
هذه مسودة بحثية قُدمت في 1 سبتمبر 2026، وكل رقم فيها ينتمي إلى مؤلفيها. ولا يُذكر أي تكرار مستقل. كما أن تسمية ثلاثة معايير عامة تثير مسألة التلوث المعتادة، لأن المجموعات التي تنتشر على نطاق واسع قد تنتهي في بيانات التدريب، والنص لا يتناول ذلك. وتغيب محاسبة الموارد عن العرض الأطول مدة، وهو العرض الذي يبدو الأكثر إثارة للإعجاب.
قد تصمد النتيجة بالفعل. لكنها الآن غير مُتحقق منها، وهذا هو الوضع المعتاد لأي مسودة بحثية جديدة، وسبب للتعامل مع نسبة 52.25 بالمئة بحذر حتى يكررها أحد.
حجة HoH الأكثر إثارة للاهتمام تقع تحت رقمه الرئيسي. فإذا كانت الحلقة حول وكيل البرمجة نفسها موضعاً محتملاً لتحقيق مكاسب، فإن المنافسة بين أُطر التشغيل لا تقل أهمية عن المنافسة بين النماذج. هذا الزعم هو ما سيحسمه التكرار، ولا يوجد الكثير منه لفحصه بعد.
- المصدر : Harness-of-Harness claims a 52.25% lift by running other coding agents — 2026-09-01
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.