SWE-bench

3 published articles

معايير واختباراتFeatured2 min read

تحليل المعايير

في SWE-bench Verified، النماذج العليا تحقق 96%. أما على الكود المؤسسي الخاص، فبالكاد تتجاوز 23%

يجعل SWE-bench Verified النماذج الحدودية تبدو قريبة من حل هندسة البرمجيات الواقعية، بأعلى الدرجات فوق 95%. أما SWE-bench Pro، الذي يُجرى على مستودعات مؤسسية خاصة، فيخفض نفس النماذج إلى 23% أو أقل، مما يكشف مدى اعتماد نتيجة Verified على التعرض للبيانات العامة.

2026-08-02

معايير واختباراتFeatured2 min read

تحليل معايير تقييم

HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا

أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.

2026-07-30

الذكاء الاصطناعيFeatured4 min read

نماذج الذكاء الاصطناعي

إصدار Laguna XS 2.1 من Poolside يحقق تحسنًا بمقدار 5 نقاط في معايير البرمجة بنفس العتاد

يعمل Laguna XS 2.1 من Poolside على تحسين SWE-bench متعدد اللغات بمقدار 5.4 نقاط ليصل إلى 63.1% مع الحفاظ على نفس بنية MoE (33B-3B). يتضمن الإصدار نقاط تفتيش كمية، ونماذج مسودة لفك الترميز التخميني، وترخيص OpenMDW-1.1، مما يجعل برمجة الذكاء الاصطناعي المحلية أكثر عملية.

2026-07-21