تحليل معايير تقييم
HumanEval قاس ما إذا كان الذكاء الاصطناعي يستطيع البرمجة. لم يسأل أبدًا ما إذا كان الكود عملًا حقيقيًا
أصبحت مشاكل إكمال الدوال الـ164 في HumanEval الاختبار القياسي لقدرة الذكاء الاصطناعي على البرمجة، لكن الحفظ والتذكر ونطاقها الضيق تركا فجوة واسعة بين اجتياز المعيار ومعالجة قاعدة كود حقيقية، وهي فجوة صُمم SWE-bench لكشفها.

يطلب HumanEval من النموذج إكمال دالة بايثون من نص توثيقي، ثم يتحقق من المخرجات مقابل اختبارات الوحدة. إنه إعداد نظيف: 164 مسألة، نجاح/فشل لا لبس فيه، لا حاجة لمقيم بشري. تلك النظافة هي السبب في أنه أصبح النقطة المرجعية لادعاءات "هل يمكن لهذا النموذج البرمجة" خلال الموجة الأولى من نماذج اللغة المولدة للكود.
هذا أيضًا هو السبب في أنه توقف عن كونه مفيدًا. المسائل قصيرة ومكتفية بذاتها وقديمة بما يكفي لتكون قد نُسخت ونوقشت وحُلّت في المستودعات العامة آلاف المرات. وجدت الأبحاث حول حفظ النماذج للكود علاقة مباشرة بين حجم النموذج والقدرة على إعادة إنتاج الحلول المعروفة حرفيًا، نفس نمط التلوث الذي قوض MMLU وGSM8K، لكنه طُبق على الكود بدلاً من المعلومات العامة. يمكن للنموذج اجتياز HumanEval عن طريق حفظ متغيرات قريبة من هذه المسائل الـ164 بالضبط، دون أن تنتقل تلك المهارة إلى سطر واحد من الكود لم يره من قبل.
الفجوة الحقيقية: دوال الألعاب مقابل المستودعات الحقيقية
القضية الأعمق ليست التلوث، مع ذلك. إنها النطاق. مسائل HumanEval هي من النوع الذي تراه في مقابلة برمجة مبكرة: اكتب دالة تعكس سلسلة نصية، اكتب دالة تتحقق مما إذا كان الرقم أوليًا. كتابة البرمجيات بشكل احترافي لا تشبه ذلك إطلاقًا. يعني ذلك فهم قاعدة كود موجودة، تتبع خطأ عبر ملفات متعددة، احترام واجهة برمجة تطبيقات صممها شخص آخر، وعدم كسر اختبارات لم تكتبها أنت.
SWE-bench بُنِيَ لسد تلك الفجوة بالضبط، حيث قام بتقييم النماذج على مشكلات GitHub حقيقية بدلاً من الدوال الاصطناعية. لم تكن النتائج لطيفة مع سردية عصر HumanEval. النماذج التي بدت قوية في إكمال الدوال المنعزلة انهارت معدلات نجاحها بمجرد طلب حل تذكرة فعلية في مستودع فعلي، خاصة على قواعد الكود الخاصة والمنشأة حديثًا حيث لا يمكن للحفظ أن يساعد. بينما تتجاوز النماذج العليا 70% إلى 95% في مسائل SWE-bench العامة الموثقة، ينخفض نفس المستوى من النماذج إلى حوالي 23% في المستودعات الخاصة لـ SWE-bench Pro، وأكثر من ذلك في مجموعة الاحتفاظ السرية الخاصة به. هذا الانهيار هو القصة الحقيقية التي لم يُبنَ HumanEval أبدًا ليرويها.
ما زال HumanEval مفيدًا لـ
كاختبار دخان مدته خمس دقائق، لا يزال يعمل: إذا لم يتمكن النموذج من إكمال دالة عكس سلسلة نصية، فهناك خطأ كبير. ولكن كدليل على أنه يمكن الوثوق بنموذج مع قاعدة كود إنتاجية، لم يقم أبدًا بقياس الشيء الذي افترض الجميع أنه يقيسه. تحول الصناعة نحو SWE-bench، ونحو معايير وكيلية تختبر استخدام الأدوات وتحرير الملفات المتعددة بدلاً من إكمال دالة واحدة، هو اعتراف ضمني بأن HumanEval أجاب على سؤال أضيق بكثير من السؤال الذي كان الناس يطرحونه.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.