SevenTnewS

البرمجة الوكيلة

كيف تقدّم Grok 4.5 في سباق SWE Marathon، وماذا يعني ذلك لوكلاء البرمجة

يقود Grok 4.5 الآن لوحة SWE Marathon متفوقاً على Claude 4 Opus وGPT-5. يختبر المعيار مهارات هندسة البرمجيات الحقيقية: إصلاح الأخطاء وإضافة الميزات وفهم الكود عبر المستودعات الحقيقية. تعيد النتيجة تشكيل المشهد التنافسي لوكلاء البرمجة بالذكاء الاصطناعي.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-20 · قراءة 3 دقائق

كيف تقدّم Grok 4.5 في سباق SWE Marathon، وماذا يعني ذلك لوكلاء البرمجة
المصادر : SWE Marathon be…

شهدت معايير هندسة البرمجيات تناوباً على القيادة خلال العام الماضي. احتفظ Claude 4 Opus بالتاج. استولى عليه GPT-5 لدورة واحدة. والآن يجلس Grok 4.5 على قمة SWE Marathon، وهو معيار يختبر وكلاء الذكاء الاصطناعي في مهام مستمدة من مستودعات GitHub الحقيقية: إصلاح الأخطاء وتنفيذ الميزات ومعالجة طلبات السحب عبر قواعد كود لم يروها أثناء التدريب.

يختلف SWE Marathon عن معظم معايير LLM. فهو لا يقيس استدعاء المعرفة أو التفكير الرياضي. بل يقيس ما إذا كان الوكيل قادراً على التنقل في قاعدة كود أجنبية، وفهم وصف المشكلة، وإنتاج تصحيح صحيح. المهام صعبة بما يكفي لدرجة أن المهندسين البشريين يحتاجون غالباً لساعات لحلها. ينشر المعيار معدلات النجاح وفترات الثقة، ويتتبع كل تقديم إلى نموذج وتكوين محددين.

حقق Grok 4.5 معدل نجاح 43.8% على مجموعة SWE Marathon الكاملة. وهذا تفوق واضح على Claude 4 Opus (40.5%) وGPT-5 (38.2%). الفارق أصغر في المجموعة الفرعية "المتحقق منها" حيث سجل Grok 4.5 46.1% مقابل 44.0% لـ Claude 4 Opus، لكن الصورة الكلية هي نفسها: مركز متصدر جديد.

Graphique : SWE Marathon Pass Rate by Model
يقود Grok 4.5 معيار SWE Marathon بمعدل نجاح 43.8%، متفوقاً على Claude 4 Opus (40.5%) وGPT-5 (38.2%)، وفقاً للمقال.

ما الذي قاد التفوق

تظهر بيانات الأداء من لوحة SWE Marathon أن Grok 4.5 يتفوق في فئتين محددتين من المهام: إصلاح الأخطاء المعقدة التي تتطلب تعديلات متعددة الملفات، وتنفيذ الميزات التي تتطلب فهم كل من الكود الحالي والمواصفات الجديدة. كما أن النموذج يحصل على نتائج أعلى في المهام التي تشمل أنظمة لغات غير مألوفة، حيث تسيطر Python وJavaScript على المعيار، لكن Grok 4.5 يؤدي بشكل أفضل في مهام Rust وGo مقارنة بالقادة السابقين.

يبقى Claude 4 Opus أقوى في المهام التي تتطلب تفكيراً دقيقاً حول الآثار الأمنية أو قيود الأداء، حيث لا يزال يتفوق على كل من Grok 4.5 وGPT-5 بهامش صغير. GPT-5 هو الأسرع بين الثلاثة في المتوسط، حيث يكمل المهام في دورات وكيل أقل، لكن جودة حله تقصر في أصعب ربع من المشكلات.

النموذجمعدل نجاح SWE Marathonالمجموعة الفرعية المتحقق منهاأقوى نوع مهمة
Grok 4.543.8%46.1%إصلاح الأخطاء متعددة الملفات
Claude 4 Opus40.5%44.0%التصحيح المراعي للأمان
GPT-538.2%41.7%الإضافات أحادية الملف

ماذا يعني ذلك

تفوق Grok 4.5 ليس مصادفة. SWE Marathon نشط منذ أكثر من عام، وكل قائد جديد يتفوق على سابقه ببضع نقاط مئوية. يشير خط الاتجاه في اتجاه واحد: وكلاء البرمجة يتحسنون في التنقل في قواعد كود غير مألوفة، والفجوة بين النماذج في هذه القدرة المحددة تضيق حتى مع ارتفاع السقف العام.

الاستنتاج العملي للمطورين الذين يقيمون وكلاء البرمجة: إذا كنت تعمل عبر لغات متعددة أو تحتفظ بقاعدة كود في مكدس أقل شيوعاً، فإن Grok 4.5 يستحق الاختبار. إذا كانت القيود الأمنية أو التراجعات في الأداء هي مصدر قلقك الرئيسي، فلا يزال Claude 4 Opus يحافظ على تفوق. وإذا كانت زمن الاستجابة أهم من الصحة الأولية، فإن GPT-5 لا يزال الأسرع في الوصول إلى تصحيح قابل للعمل.

لا يحل أي منها أصعب مشكلات هندسة البرمجيات بعد، القرارات المعمارية، المفاضلات بين الصحة وقابلية الصيانة، أو معرفة متى لا يجب تغيير الكود. لكن أرقام SWE Marathon تشير إلى أن الفجوة بين ما يمكن للوكلاء فعله وما يحتاجون إليه تتقلص أسرع مما يتوقع معظم المطورين.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.