تحليل المعايير
في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%
يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.

يقوم SWE-bench بتقييم النموذج من خلال تسليمه تقرير خطأ فعلي أو طلب ميزة مستخرج من مستودع GitHub حقيقي، ثم التحقق مما إذا كان التصحيح الذي يكتبه ينجح في اجتياز مجموعة الاختبارات الموجودة في المستودع. لا دوال وهمية، ولا وثائق تعليمات مكتوبة لتكون سهلة. مجرد مشكلة، وقاعدة بيانات، وبوابة نجاح/فشل محددة باختبارات كانت موجودة بالفعل قبل ظهور النموذج.
على SWE-bench Verified، وهي مجموعة فرعية من المشكلات العامة مختارة ومدققة بشريًا، تبدو النتائج الآن شبه محلولة. GPT-5.6 Sol يحقق 96.2%. Claude Mythos 5 يصل إلى 95.5%. Claude Fable 5 يصل إلى 95.0%، GPT-5.6 Luna 93.0%، وحتى النماذج المتوسطة مثل Claude Opus 4.8 وKimi K3 تتراوح حول 88% إلى 89%. إذا قرئت هذه الأرقام بمعزل عن غيرها، فإنها تشير إلى أن النماذج الحدودية أتقنت بشكل أساسي إصلاح الأخطاء الواقعية.
ثم يأتي SWE-bench Pro
موجود SWE-bench Pro لاختبار الافتراض الذي تدعو إليه تلك الأرقام: هل هذا معمم، أم أن النماذج أصبحت جيدة جدًا في هذه المجموعة العامة المحددة والمألوفة؟ يستبدل Pro المشكلات من مستودعات مؤسسية خاصة ومنشأة حديثًا، قواعد بيانات ليس لديها فرصة للتسرب إلى بيانات ما قبل التدريب كما قد تفعل مشكلات GitHub العامة القديمة.
النتائج ليست قريبة من أرقام Verified. GPT-5 وClaude Opus 4.1، النماذج التي كانت تتصدر المخططات على SWE-bench العام، تنخفض إلى ما بين 23.1% و23.3% على SWE-bench Pro. إذا قيد الاختبار أكثر إلى مجموعة فرعية سرية تمامًا، مستودعات لا يمكن لأي مزود نموذج أن يكون قد رآها بأي شكل، ينخفض الأداء مرة أخرى إلى نطاق 14.9% إلى 17.8%.
ما الذي يقيسه فجوة الـ70 نقطة فعليًا
هذا ليس اختلافًا طفيفًا في المعايرة. إنها قدرة مختلفة. النموذج الذي يحل 96% من مشكلات GitHub العامة الموثقة جيدًا والتي تمت مناقشتها سابقًا و15% من المشكلات المؤسسية الخاصة ليس فاشلاً في البرمجة بمعنى مجرد، بل يكشف إلى أي مدى تشكلت مهارته الظاهرية من خلال التعرض المسبق للأنماط والمناقشات وحتى الإصلاحات السابقة المرتبطة بالمستودعات العامة. إذا جردت هذه الألفة، فما يتبقى هو مقياس أكثر خشونة لقدرة النموذج فعليًا على التفكير في قاعدة بيانات غير مألوفة.
هذا هو أوضح توضيح في المعايير الحالية لنمط يظهر في كل مكان بمجرد البحث عنه: الإتقان الظاهري في اختبار عام معروف لا يصمد غالبًا عند الاتصال بظروف خاصة جديدة تمامًا. لقادة الهندسة الذين يقررون ما إذا كانوا سيثقون في وكيل بقاعدة بيانات إنتاج حقيقية، فإن رقم SWE-bench Pro، وليس Verified، هو المهم. وهو أيضًا الرقم الأصعب بالنسبة لمختبر لوضعه على شريحة عرض.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.