مصدر مفتوح
OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم
OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-01 · قراءة 2 دقائق

وكلاء الذكاء الاصطناعي الحديثون لا يعتمدون على استدعاء نموذج واحد. يعتمدون على أدوات استدلال معقدة مثل Claude Code وCodex وOpenClaw لإدارة التفكير متعدد الخطوات واستخدام الأدوات والوصول إلى الأنظمة الخارجية. هذه الأدوات تجعل الوكلاء أقوياء، لكنها تجعل التدريب صعبًا أيضًا. لم تُبنَ تقنيات الضبط الدقيق الخاضع للإشراف القياسية والتعلم المعزز لاستدلال الأدوات متعددة العمليات والحافظات الحالة. غالبًا ما كان على الباحثين الاختيار بين استخدام أداة قوية أو القدرة على التدريب على الإطلاق.
OpenForgeRL، الذي قدمه فريق من الباحثين، يهدف إلى إزالة هذه المقايضة. الإطار مبني حول خادم وكيل خفيف الوزن يجلس بين الأداة والنموذج. يعترض الخادم الوكيل استدعاءات النموذج أثناء الاستدلال، ويسجل المدخلات والمخرجات، ويغذيها في مكتبة تعلم معزز قياسية مثل veRL. يقوم منسق Kubernetes بتشغيل كل عملية توزيع في حاوية خاصة بها، موسعًا النطاق عبر البيئات دون الحاجة إلى تغييرات في الأداة نفسها.
تحقق المؤلفون من صحة الإطار على فئتين من الوكلاء: وكلاء الكود القائمين على الأدوات، الذين يسمونهم OpenForgeClaw، ووكلاء واجهات المستخدم الرسومية متعددة الوسائط، الذين يسمونهم OpenForgeGUI. باستخدام بضع مئات إلى بضعة آلاف فقط من مهام التدريب، سجل OpenForgeClaw 31.7 pass^3 و55.9 pass@3 على ClawEval و33.7 على QwenClawBench. وصل OpenForgeGUI إلى 37.7 على OSWorld-Verified، و63.0 على Online-Mind2Web، و72.3 على WebVoyager. في كل معيار تقريبًا، تفوق كلا الوكيلين على المعايير الأساسية مفتوحة المصدر ذات الحجم المماثل. في حالة واجهة المستخدم الرسومية، تضاهيا أو تجاوزا نماذج أكبر بعدة مرات.
إلى جانب الأرقام الرئيسية، تفحص الورقة كيفية استجابة الأدوات المختلفة للتدريب بالتعلم المعزز. ليست كل الأدوات قابلة للتدريب بنفس القدر. أثبت بعضها صعوبته في التعلم أكثر من غيرها. وجد الباحثون أن التعلم المعزز يحسن باستمرار عوامل الموثوقية الوكيلة مثل التحقق الذاتي وتغطية الأدوات والقدرة على إكمال الخطط متعددة الخطوات. ظل ضعف ملحوظ: ظل التعافي من الأخطاء ضعيفًا حتى بعد التدريب، مما يبرز فجوة دائمة للعمل المستقبلي.
المساهمة الأساسية عملية. يفصل OpenForgeRL التدريب عن الاستدلال، مما يسمح للباحثين بتدريب الوكلاء مباشرة في الأدوات والبيئات الحقيقية حيث سينشرون في النهاية. الكود متاح بموجب ترخيص مفتوح المصدر، مما يجعله ممكنًا للفرق الأخرى لتكرار النتائج وتوسيعها دون بنية تحتية مملوكة.
- المصدر : OpenForgeRL trains AI agents without touching their inference harnesses — 2026-07-24
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.