الذكاء الاصطناعي · رياضيات الأولمبياد

Nemotron يبلغ عتبة الميدالية الذهبية في IMO 2026 بنتيجة 30 من 42، دون مُثبِت شكلي

بلغت نقاط تحقق Nemotron 3 Ultra من إنفيديا عتبة الميدالية الذهبية في IMO 2026 اعتمادًا على البراهين باللغة الطبيعية وحدها. وتنشر الورقة البيانات والشيفرة ومعيارًا من 200 مسألة، لكن النتيجة مُبلَّغ عنها ذاتيًا.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-09-21 · قراءة 4 دقائق

Nemotron يبلغ عتبة الميدالية الذهبية في IMO 2026 بنتيجة 30 من 42، دون مُثبِت شكلي

يذكر ملخص الورقة «وصفة مفتوحة للذهب في الأولمبياد: تدريب Nemotron على رياضيات الأولمبياد» (An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics) أن النظام سجّل 30 نقطة من أصل 42 في IMO 2026 وبلغ عتبة الميدالية الذهبية. وهذا كل ما تقوله صفحة الورقة على Hugging Face عن الرقم. فهي لا تسمّي المصحّحين، ولا توضح ما إذا كانت النتيجة صادرة عن التصحيح الرسمي للمسابقة أم عن عملية داخلية، ولا تفصّل النقاط الثلاثين بحسب المسألة. تعامل معها كتقرير من المؤلفين حتى يعيد أحد من خارج الفريق تشغيل التجربة.

الصفحة أكثر تحديدًا بشأن الشروط. تعمل المنظومة بالكامل باللغة الطبيعية: لا مُثبِت شكلي، ولا أدوات خارجية، ولا اتصال بالإنترنت.

ثلاث نقاط تحقق، ومرحلتان تدريبيتان، وتمريرة اختيار واحدة

كل شيء يبدأ من Nemotron 3 Ultra. أخذ الفريق النموذج المتاح للعموم ودرّب فوقه نموذجين متخصصين تدريبًا لاحقًا، بالاستناد إلى الضبط الدقيق المُوجَّه والتعلم المعزز. وهذا يضع ثلاثة نماذج في حلقة البحث بدلًا من نموذج واحد.

عند الاستدلال، تقود نقاط التحقق هذه دورة تكرارية: توليد برهان مرشح، ثم التحقق منه، ثم تحسينه، ثم التكرار. بعد ذلك تختار مرحلة منفصلة ذات ميزانية حسابية أضخم بكثير العرض النهائي. وفصل الاختيار عن التوليد قرار يتعلق بتوزيع الميزانية: يذهب معظم الوقت إلى التكرار الرخيص، بينما تُحتفظ بالتمريرة المكلفة للقرار الأخير.

يصف الملخص النتيجة بأنها منظومة حساب-وقت-الاختبار (test-time compute) بنموذج مفتوح، وهو ما يُلقي على تصميم الاستدلال قدرًا من الثقل يماثل ما يُلقيه على التدريب. لكنه لا يذكر عدد المرشحين الذين يولّدهم البحث لكل مسألة، ولا كيف يقيّمها المدقّق، ولا ما تسعى مرحلة الاختيار إلى تحسينه. وهذه التفاصيل هي التي تحدد ما إذا كانت الوصفة قابلة للانتقال.

ما الذي يتضمنه الإصدار

الورقة تنشر أكثر من مجرد نص مكتوب.

المكوّنما يغطيه
نقطتا تحقق مدرَّبتان تدريبًا لاحقًاالنموذجان المتخصصان اللذان يعمل عليهما البحث
بيانات التدريبمنشورة باسم nvidia/Nemotron-Math-Proofs-v3-SFT و nvidia/Nemotron-Math-Proofs-v3-RL
شيفرة التدريب والاستدلالالمنظومة نفسها
الحلول المقدَّمةإجابات النظام على مسائل IMO 2026
Nemotron-IMO-Bench200 مسألة جديدة بمستوى الأولمبياد

هناك عنصران يحملان وزنًا أكبر من البقية. فالحلول المقدَّمة هي إجابات النظام الفعلية على مسائل المسابقة، وهي ما يجعل تدقيقًا خارجيًا ممكنًا أصلًا. أما Nemotron-IMO-Bench فيضيف 200 مسألة يصفها المؤلفون بأنها جديدة، ما يمنح الفريق التالي مجموعة اختبار لم تُمتصّ بعد في بيانات التدريب.

على Hugging Face، تظهر نقطة التحقق nvidia/Nemotron-3-Labs-Ultra-Math-RL كنموذج يستشهد بالورقة، وتظهر مجموعتا التدريب باسم nvidia/Nemotron-Math-Proofs-v3-SFT و nvidia/Nemotron-Math-Proofs-v3-RL. هذا إصدار حقيقي، لكنه ليس إصدارًا مُعاد إنتاجه بعد. وبين نشر وصفة والتأكد من أنها تعمل خارج بيئة المؤلفين أنفسهم فجوة لم يسدّها أحد.

لماذا تشكّل اللغة الطبيعية النصف المحفوف بالمخاطر

تحوّل مساعدات البرهان الشكلية الحجة إلى شيء يمكن للآلة التحقق منه سطرًا بسطر. لكن هذه المنظومة ترفض ذلك المسار؛ فهي تكتب وتستنتج بنثر رياضي عادي، دون مُثبِت تعود إليه ودون أي شيء خارجي تستشيره.

المقايضة هنا هي الوضوح مقابل اليقين. فالبراهين باللغة الطبيعية تُقرأ كما يُقرأ حل بشري، ويوحي التأطير بأن ذلك كان المقصود. لكن خطوة التحقق تقع داخل المنظومة نفسها التي يجري تقييمها، أي أن النظام يصحّح عمله جزئيًا بنفسه. وشهادة قابلة للتحقق آليًا لم تكن لتعاني هذه المشكلة، أما مدقّق قائم على نموذج لغوي فيعانيها.

لا يصف الملخص ما الذي يتحقق منه المدقّق، ولا كم مرة يرفض برهانًا صحيحًا، ولا عدد جولات التحسين التي تحتاجها مسألة نموذجية. وبدون هذه الأرقام، يستند ادعاء الميدالية الذهبية إلى عملية تقييم لا يستطيع القارئ فحصها.

ما الذي تغيّره منظومة مفتوحة بمستوى الذهب

إذا صحّت النتيجة، فإن الأهمية تكمن في ما أُتيح لا في النتيجة نفسها. فالأوزان وبيانات التدريب والشيفرة والحلول معًا تتيح لمختبر آخر خوض التجربة ذاتها دون إعادة بنائها من الصفر.

ويأتي ذلك في مشهد للمعايير بدأ بالفعل ينحرف بعيدًا عن الاختبارات الساكنة. فقد فقدت مجموعات الأسئلة الثابتة كثيرًا من قدرتها التشخيصية مع تدريب النماذج عليها، وانتقل المجال نحو التقييمات الديناميكية والاختبارات بمستوى الخبراء. وفي هذا السياق، يصعب تحديد موقع رقم أولمبيادي مُبلَّغ عنه ذاتيًا أكثر مما كان في السابق. فهو رقم قوي واحد من فريق واحد، في ورقة واحدة، ومنظومة التقييم فيه بناها الأشخاص أنفسهم الذين بنوا النظام.

الإصدار هو الجزء الجدير بالمتابعة. أما ما إذا كانت نتيجة 30 من 42 ستصمد أمام تدقيق خارجي فما زال سؤالًا مفتوحًا.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.