تحليل المعايير
كان GSM8K مصممًا لاختبار رياضيات المرحلة الابتدائية. لكن ما يصل إلى 42% من أسئلته معيبة
أصبح GSM8K اختبارًا قياسيًا للتفكير الحسابي في نماذج اللغة الكبيرة، لكن عمليات التدقيق وجدت معدلات خطأ في مجموعته الأسئلة تصل إلى 42%، مما يقوض ما تقيسه نتائجه فعليًا.

GSM8K، اختصار لـ Grade School Math 8K، هي مجموعة تضم حوالي 8000 مسألة لفظية بمستوى المرحلة المتوسطة: قطارات تغادر المحطات، أشخاص يقسمون الفواتير، وما شابه. لعدة سنوات كانت الطريقة القياسية للتحقق مما إذا كان نموذج لغوي يمكنه ربط عدة خطوات حسابية دون فقدان الخيط. حَلّ مسائل GSM8K بشكل موثوق كان يُعتبر دليلاً على تفكير حقيقي متعدد الخطوات، بدلاً من مطابقة الأنماط.
ثم بدأت عمليات تدقيق مستقلة في قراءة الأسئلة عن كثب بدلاً من مجرد تشغيل النماذج عليها. ما وجدوه كان معيارًا يعاني من مشكلة في الجودة، وليس مشكلة في الصعوبة. تم تقدير معدلات الخطأ في مجموعة أسئلة GSM8K بنسبة تصل إلى 42%: أسئلة ذات صياغة غامضة، أو معلومات مفقودة، أو إجابات مرجعية لا تتطابق مع أي قراءة معقولة للمسألة. النموذج الذي يُوسم بـ"خطأ" على إحدى هذه الأسئلة ليس بالضرورة أنه أسوأ استدلالاً من نموذج يُوسم بـ"صحيح". قد يكون فقط يقرأ السؤال بعناية أكبر.
لماذا هذا الأمر أكثر أهمية مما يبدو
معدل خطأ 2% هو ضوضاء. معدل خطأ 42% هو معيار مختلف تمامًا عن الذي يعتقد الجميع أنهم يشغلونه. إذا كان ما يقرب من نصف عناصر الاختبار غير موثوقة، فإن النتيجة نفسها تتوقف عن كونها قياسًا نظيفًا للاستدلال الحسابي وتبدأ في عكس شيء أقرب إلى مدى جودة تخمين النموذج لما تريد سماعه معايير تقييم معيبة.
هذا يتفاقم مع نفس مشكلة التلوث التي أصابت MMLU. أسئلة GSM8K قديمة بما فيه الكفاية، وشائعة بما فيه الكفاية، بحيث أن النماذج الكبيرة شبه مؤكد أنها رأت العديد منها، أو صياغات قريبة، أثناء التدريب المسبق. اجمع بين الحفظ ومفتاح إجابة غير متين، وستخبرك درجة GSM8K العالية أقل مما كانت عليه فيما إذا كان النموذج يمكنه فعلاً القيام بالحساب، وأكثر حول ما إذا كان قد صادف أن وقع على نفس تفسير مسألة سيئة الصياغة الذي فعله مؤلفو مجموعة البيانات.
ما تستخدمه المختبرات بدلاً من ذلك
تقييم الرياضيات لم يختفِ، بل انتقل إلى أراضٍ أكثر صعوبة ومدققة بعناية أكبر. معايير الرياضيات على نمط المسابقات المأخوذة من مسائل أولمبياد ومسابقات حديثة يصعب تلويثها لمجرد أن المسائل أحدث من معظم تواريخ قطع التدريب. يتم اختبار الاستدلال متعدد الخطوات بشكل متزايد داخل امتحانات أوسع على مستوى الدراسات العليا مثل GPQA Diamond و Humanity's Last Exam، حيث الرياضيات هي تخصص واحد من بين العديد بدلاً من أن تكون الاختبار بأكمله، وحيث يكون معيار جودة العناصر أعلى بشكل صريح: عملية التحقق الخاصة بـ HLE بُنيت خصيصًا لالتقاط النوع من الأخطاء التي ابتليت بها GSM8K.
لا يعني أي من هذا أن GSM8K عديم الفائدة كفحص سريع للتأكد. النموذج الذي يفشل في مسائل لفظية أساسية لديه مشكلة واضحة. لكن التعامل مع نسبة GSM8K كمقياس دقيق للقدرة على الاستدلال، بالطريقة التي فعلتها الأوراق البحثية لسنوات، يفترض مفتاح إجابة يتبين أنه أقل صلابة بكثير مما بدا عليه.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.