وكلاء البرمجة · إطار Devin ثنائي النماذج
دفع ضعف المبلغ لكل رمز جعل Fusion من Devin أرخص بنسبة 9%
يشغّل Fusion من Devin نموذجاً متقدماً قائداً إلى جانب مساعد أرخص، ولكل منهما سياقه الخاص. تُظهر جداول المعايير لدى Devin انخفاض تكاليف المهام بنسبة تصل إلى 46%، وحالة واحدة كلّف فيها نموذج قائد ضعف السعر لكل رمز جلسة أرخص بنسبة 9%.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-09-26 · قراءة 5 دقائق

كل الجدل حول تكلفة وكلاء البرمجة بالذكاء الاصطناعي دار حول سعر الرمز الواحد. ويحاول إطار Fusion من Devin، المتاح اعتباراً من اليوم في Devin Desktop وDevin CLI، تغيير وحدة القياس. فهو يشغّل نموذجين بدلاً من واحد: نموذج متقدم بصفته القائد، يتولى الخطة ويراجع العمل، ونموذج أرخص بصفته المساعد، يستكشف الشيفرة وينفّذ التعديلات ويشغّل الاختبارات ويعود بالنتائج. وتوصي Devin بالجمع بين Fable 5.1 وSWE-2.
تصف Devin إطار Fusion بأنه أكثر كفاءة بنسبة تصل إلى 39% من إطارات النماذج الأخرى في معايير البرمجة الرئيسية. وتستحق جداول المعايير، وطريقة احتساب التوفير، قراءة أدق.
Fable 5 يكلّف ضعف السعر لكل رمز وينتهي أرخص بنسبة 9%
أوضح مثال لدى Devin هو استبدال داخل إطارها نفسه. لقد أنتج استبدال Opus 4.8 بـ Fable 5 كقائد، مع الإبقاء على المساعد نفسه، جلسات كلّفت أقل بنسبة 9% في المتوسط مع تسجيل نتيجة أعلى في FrontierCode، وفقاً للمنشور. ويكلّف Fable نحو ضعف السعر لكل رمز.
ويقول جدول المساعد الشيء نفسه من الجهة المقابلة. فمع Astra كقائد، يؤدي الانتقال من GPT-5.6 Luna إلى SWE-2 إلى رفع سعر القائمة من 0.20 دولار إلى 0.75 دولار لكل مليون رمز، أي زيادة نسبتها 275%، بينما تسجّل Devin مهمة FrontierCode المكتملة عند 2.34 دولار مقابل 2.39 دولار، أي انخفاض بنسبة 2%.
وتفسير Devin هو أن سعر الرمز يقيس الشيء الخطأ. فالنموذج الرخيص الذي يحتاج إلى محاولات أكثر، والذي على القائد تصحيح مخرجاته، قد يكلّف أكثر عند إنجاز المهمة.
كل رقم هنا مصدره Devin وشركاؤها
أُجريت صفوف المعايير الخمسة جميعها مع Artificial Analysis وVals AI، وفقاً للمنشور، مع قياس التوفير مقابل النموذج المتقدم الواحد الذي يؤدي المهمة كاملة.
| المعيار | Fable 5.1 | Fusion (Fable 5.1 + SWE-2) | Astra | Fusion (Astra + SWE-2) |
|---|---|---|---|---|
| DeepSWE 1.1 | 64.3 / $14.63 | 63.1 / $7.88 (-46%) | 67.6 / $7.88 | 67.3 / $4.69 (-40%) |
| Terminal-Bench 4 | 57.6 / $17.46 | 56.1 / $13.37 (-23%) | 55.6 / $10.08 | 50.0 / $6.06 (-40%) |
| SWE-Atlas QnA | 64.8 / $7.57 | 65.9 / $5.00 (-34%) | 61.8 / $5.72 | 59.4 / $3.59 (-37%) |
| Vals Code Migration | 54.6 / $70.97 | 57.3 / $42.00 (-41%) | 67.7 / $44.36 | 61.3 / $35.51 (-20%) |
| FrontierCode 1.1 (Extended) | 63.6 / $2.68 | 63.5 / $1.67 (-38%) | 63.1 / $2.62 | 63.4 / $2.34 (-11%) |
التوفير غير متساوٍ. أكبر خفض هو 46% في DeepSWE 1.1 مع Fable 5.1 وSWE-2، حيث تنزل النتيجة من 64.3 إلى 63.1. وأصغره 11% في FrontierCode 1.1 (Extended) مع Astra وSWE-2، حيث ترتفع النتيجة قليلاً من 63.1 إلى 63.4. ويكلّف صفّان اقتران Astra دقة حقيقية: فـ Terminal-Bench 4 ينخفض من 55.6 إلى 50.0 مقابل توفير 40%، وVals Code Migration يهبط من 67.7 إلى 61.3 مقابل 20%.
لا يستشهد المنشور بأي تكرار مستقل، ولا بأي رقم معياري من طرف لا مصلحة له فيه. وتقول Devin إن Fusion يعمل على Devin Cloud منذ عدة أشهر.
مشكلة التخزين المؤقت للأوامر عند تبديل النماذج وسط المهمة
تقوم حجة Devin ضد توجيه النماذج على ادعاءين. فالطلب الأولي لا يكشف مدى صعوبة المهمة، إذ قد تكون "أصلح خلل كذا" حالة حافة من سطر واحد أو إعادة هيكلة كاملة، ولا يظهر الفرق إلا بعد أن يقرأ أحدهم الشيفرة. كما أن تبديل النماذج وسط المهمة يبطل الذاكرات المؤقتة للأوامر، فيعيد التكلفة إلى النموذج الباهظ.
ويتجنب Fusion التبديل بالإبقاء على النموذجين مقيمَين. فالقائد والمساعد يعملان وكيلَين متوازيين، لكل منهما سياق دائم وأدواته الخاصة، ويتبادلان الموجزات والنتائج والتغذية الراجعة بدلاً من سجلات المحادثة الكاملة، فيبقى التخزين المؤقت لكل جانب سليماً.
لا يذكر المنشور أي وكيل منافس يوجّه وسط الجلسة ولا يستشهد بأي بحث منشور في التوجيه. والحجة بنيوية. ولا تذكر Devin أي تجربة مقابل وكيل توجيه.
تعليمات تساعد اقتراناً وتضرّ بآخر
الجزء من Fusion الذي يصعب تقليده هو الضبط المحيط بالاقتران. وتقول Devin إنها تعدّل الإطار لكل تركيبة، لأن التعليمات التي تجعل اقتراناً ما فعّالاً قد تزيد آخر سوءاً.
- تفصيل الموجز: مع مساعد أضعف، يكتب Fable 5.1 موجزات أكثر إلزاماً، فينفق رموز القائد مبكراً لتفادي جولات المراجعة لاحقاً. ومع SWE-2، يترك تفاصيل تنفيذية أكثر للمساعد.
- الاعتراض: يُشجَّع المساعدون الأقوى على تحدي خطة القائد، وهو ما تقول Devin إنه يلتقط أخطاء التخطيط. أما السماح للمساعدين الأضعف بإبداء الرأي فيضرّ بالأداء والتكلفة معاً.
- الاستكشاف: يبقى العمل اللازم للتخطيط مع القائد، لأن المساعد الأضعف قد لا يحكم على المعلومات المهمة. ويُسمح للمساعدين الأقوى بالمشاركة في الاستكشاف الأولي.
وتصف Devin هذا الحد الأخير بأنه مجال بحثي نشط لديها. وإذا كان الضبط يجب إعادته لكل اقتران، فإن منافساً ينسخ تصميم الوكيلين دون ذلك لن يعيد إنتاج الأرقام.
إذا تحوّل المشترون إلى السعر لكل مهمة، يتوقف سعر الرمز عن التنبؤ بالفاتورة
توصية Devin الختامية هي أن يُحكم على النماذج، وعلى تركيبات النموذج والإطار، بالسعر لكل مهمة بدلاً من السعر لكل رمز ابتداءً من 2026. خُذ ذلك على محمل الجد ويلزم منه أمران في الشراء. فسعر قائمة المساعد يتوقف عن حسم الصفقة: فـ SWE-2 يكلّف 275% أكثر لكل رمز من Luna، وتقول Devin إنه ينتهي أرخص قليلاً. كما يفقد الجمع بين نموذج متقدم وأرخص منفّذ متاح مبرّره، لأن أرخص منفّذ هو غالباً ذاك الذي على النموذج الباهظ إصلاحه.
لا شيء من هذا خالٍ من المصلحة. فـ Devin تبيع إطاراً تعتمد قيمته على قبول المشترين محاسبة المهمة الواحدة، والدليل الوحيد حتى الآن يأتي من معايير ساعد شركاؤها في إجرائها. والمقارنة التي تستحق الانتظار هي وكيل توجيه منافس يُقاس بالطريقة نفسها على المهام نفسها.
- المصدر : Paying 2x more per token made Devin's Fusion 9% cheaper — 2026-09-11
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.