وكلاء البرمجة بالذكاء الاصطناعي
نموذج Qwen-Coder-Qoder من علي بابا يتفوق على Cursor في اختبارها الخاص ويخفض استهلاك الرموز بنسبة 14.5%
نموذج البرمجة الجديد من علي بابا Qwen-Coder-Qoder يتفوق على Cursor Composer-1 في معيار Qoder Bench. تُظهر مقاييس الإنتاج زيادة بنسبة 3.85% في الاحتفاظ بالكود، وانخفاضًا بنسبة 61.5% في أخطاء الأدوات، وتقليصًا بنسبة 14.5% في استهلاك الرموز. يدرب النموذج على آثار الوكلاء الحقيقية من خلال إطار عمل المكافأة والمهاجم لمواجهة اختراق المكافآت.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-23 · قراءة 4 دقائق

تخوض Alibaba Cloud رهانًا مختلفًا في سباق تسليح البرمجة بالذكاء الاصطناعي. فبدلاً من إطلاق نموذج عام الأغراض وترك المطورين يكتشفون كيفية دمجه في سير عملهم، أصدرت الشركة Qwen-Coder-Qoder، وهو نموذج مصمم خصيصًا لمنصة Qoder CLI ونظامها البيئي للوكلاء. تشير الأرقام المبكرة إلى أن الرهان قد ينجح.
في اختبار Qoder Bench، وهو معيار الشركة الخاص لمهام هندسة البرمجيات الواقعية، يتفوق النموذج على Cursor Composer-1 في حل المهام. وتتسع الفجوة على نظام ويندوز، حيث تحسنت دقة أوامر الطرفية بنسبة تصل إلى 50% مقارنة بالإصدار السابق. في الإنتاج خلال الأسابيع القليلة الماضية، ارتفع الاحتفاظ بالكود بنسبة 3.85%، وانخفضت معدلات أخطاء الأدوات بنسبة 61.5%، وانخفض استهلاك الرموز بنسبة 14.5%. هذه هي المقاييس التي يهتم بها قادة الهندسة حقًا.
نموذج Qwen-Coder-Qoder مبني على أساس Qwen-Coder ومُحسَّن من خلال التعلم المعزز على نطاق واسع. ما يجعله مختلفًا عن معظم إصدارات النماذج هو كيفية عمل حلقة التعلم المعزز: فهي تتدرب على التفاعلات الحقيقية للوكلاء من آلاف مستخدمي Qoder يوميًا، لاستخراج ممارسات هندسة البرمجيات وتحويلها إلى إشارات مكافأة. تطلق عليه علي بابا اسم "العجلة الطائرة للنموذج والوكيل والمنتج"، وهي حلقة مغلقة حيث يشكل استخدام المنتج بشكل مباشر تكرار النموذج التالي.
إطار عمل المكافأة والمهاجم
اختراق المكافآت هو صداع معروف في التعلم المعزز لوكلاء الكود. إذا كافأ النظام استخدام الأدوات المتوازية من أجل السرعة، فقد يبدأ النموذج في مسح الملفات غير ذات الصلة لتضخيم درجة التوازي دون المساهمة فعليًا في الإصلاح. بنت علي بابا إطارًا عدائيًا لاكتشاف ذلك قبل بدء التدريب: يقوم مراجع LLM باختبار نظام المكافآت أثناء التطوير، بحثًا عن ثغرات يمكن للنموذج استغلالها. تقول الشركة إن هذا أدى إلى تحسين سرعة التكرار ومتانة تصميم المكافآت.

يعتمد التدريب نفسه على نظام ROLL، وهو نظام للتدريب المعزز لنماذج Mixture-of-Experts بمئات المليارات من المعلمات عبر مجموعات من آلاف وحدات معالجة الرسومات. عادةً ما تستهلك مرحلة التوزيع (rollout phase) أكثر من 70% من إجمالي وقت التدريب؛ وتقول علي بابا إن تحسينات النظام قدمت زيادة في الإنتاجية بمقدار 10 أضعاف، مما أدى إلى ضغط دورات التدريب بشكل كبير.
قامت علي بابا أيضًا بأتمتة إعداد عشرات الآلاف من بيئات البرمجيات الواقعية باستخدام الحاويات عالية السرعة التي تقوم بتشغيل وتهيئة وإزالة البيئات العازلة (sandboxes) في الحال، مما يتيح التعلم المعزز على نطاق سيكون غير عملي مع الإدارة اليدوية للبيئة.
معالجة التغذية الراجعة على مدار الساعة مع Qoder CLI
إلى جانب إصدار النموذج، نشرت علي بابا دراسة حالة مفصلة حول كيفية استخدام Qoder CLI داخل مؤسستها الهندسية الخاصة لبناء نظام معالجة تغذية راجعة مستقل بالكامل. يتعامل النظام مع خط الأنابيب بأكمله من تقديم ملاحظات المستخدم إلى إصلاح الكود، مع إشراك البشر فقط في مرحلة مراجعة الكود النهائية.
يتكون خط الأنابيب من أربع وحدات: تصنيف المشكلة، وتجميع المشكلات، وتحليل السجلات، والإصلاح التلقائي. تستخدم كل مرحلة طبقة نموذج مختلفة من خلال Qoder CLI. يستخدم التصنيف والتجميع نماذج أرخص من فئة "فعالة" (Effective tier). يستخدم تحليل السجلات وتحديد السبب الجذري فئة "الأداء" (Performance tier). تستخدم إصلاحات الكود الفئة "القصوى" (Ultimate tier). استنتاج الشركة مباشر: استخدام نماذج رخيصة لمهام معقدة يهدر رموزًا أكثر في اتجاهات خاطئة من مجرد الانتقال مباشرة إلى النموذج الأحدث.
يتضمن النظام آلية تفكير ذاتي. بعد كل مهمة تحليل سجلات، يكتب الوكيل مراجعة بأثر رجعي في ملف task-retro.md، موثقًا الخطوات غير الفعالة والدروس المستفادة. يقوم وكيل خط أنابيب منفصل بمراجعة هذه المراجعات بشكل دوري لتحديث المهارات المقابلة. هذا يخلق سلسلة تطور حيث يصبح كل خطأ من الوكيل إشارة.
التأثير قابل للقياس. في السابق، كانت كل مشكلة تتطلب 30 دقيقة على الأقل من تقديم الملاحظات إلى تحليل السجلات اليدوي وتحديد السبب الجذري. يكمل النظام الآلي الآن تحليل السبب الجذري في دقيقتين، ويعمل على مدار الساعة وطوال أيام الأسبوع دون تدخل بشري يتجاوز مراجعة الكود.
ما يفعله المنافسون
تحول فضاء البرمجة بالذكاء الاصطناعي إلى حرب تحسينات تدريجية. Cursor وGitHub Copilot والمساعد الذكي لـ JetBrains كلها تصدر تحديثات أسبوعية. Cursor Composer-1، هدف المقارنة المباشر الذي اختارته علي بابا، ليس منتجًا ثابتًا أيضًا. لكن Qwen-Coder-Qoder مبني للتكامل الوثيق مع بنية وكيل محددة، وليس للاستخدام العام. قد يحد هذا من نطاقه ولكنه يعني أيضًا أن حلقة التغذية الراجعة أقصر: يمكن لكل تفاعل مستخدم مع Qoder تحسين النموذج في غضون أسابيع بدلاً من أشهر.
تقول علي بابا إنها تخطط لتكرارات أسبوعية على النموذج، مما يشير إلى وتيرة قد يصعب على معظم موزعي النماذج مفتوحة الأوزان مواكبتها. يتطلب نموذج العجلة الطائرة استخدامًا مستمرًا للمنتج لتغذية بيانات التدريب، لذا فإن الرهان يتعلق بتبني Qoder من قبل المستخدمين بقدر ما يتعلق بالنموذج نفسه.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.