MiniCPM5-2B من OpenBMB: 2.52 مليار معلمة وطموحات بحجم 4 مليارات

نموذج بحجم 2.52 مليار معلمة يتفوق على منافسين بحجم 4 مليارات، في مجموعة اختبارات أجراها مطوّره بنفسه

نموذج برخصة Apache-2.0 بحجم 2.52 مليار معلمة يتجاوز نماذج مفتوحة أكبر حجمًا في البرمجة واستخدام الأدوات والسياق الطويل، مع جدول اختبارات تقول OpenBMB إنه يمزج بين اختبارات داخلية وأخرى من أطراف ثالثة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-09-22 · قراءة 4 دقائق

نموذج بحجم 2.52 مليار معلمة يتفوق على منافسين بحجم 4 مليارات، في مجموعة اختبارات أجراها مطوّره بنفسه

يسرد جدول الاختبارات الخاص بـ OpenBMB لنموذج MiniCPM5-2B أمورًا ليس من المفترض أن يكون نسخة بأوزان بحجم 2.5 مليار معلمة بارعًا فيها. فهو يحقق 69.1 في LiveCodeBench v6، و46.4 في SWE-bench Verified، و66.6 في BFCL v4، وهو اختبار استدعاء الدوال. ويحمل النموذج نفسه نحو 2.52 مليار معلمة، منها حوالي 1.98 مليار معلمة غير تضمينية.

هذا الحجم هو جوهر الأمر. فـ OpenBMB، الذراع مفتوحة المصدر المرتبطة بـ ModelBest، تطرح MiniCPM5-2B كشيء يمكن لهاتف أو حاسوب محمول أو جهاز طرفي استضافته، لا كشيء يخدمه عنقود من وحدات معالجة الرسوميات. وما إذا كانت الفوارق المنشورة ستصمد أمام اختبارات مستقلة فهو السؤال المفتوح، ومواد الإصدار تجعل طرح هذا السؤال أمرًا سهلًا.

ما طرحته OpenBMB فعليًا

MiniCPM5-2B نموذج كثيف وليس مزيجًا من الخبراء، ويصدر برخصة Apache-2.0. وهو الإصدار الثاني في سلسلة MiniCPM5، بعد MiniCPM5-1B. ويمتد السياق الأصلي إلى 131,072 رمزًا.

البنية المعمارية عادية عن قصد، وهو أمر يُعد ميزة بهذا الحجم. فهي تستخدم تصميم LlamaForCausalLM القياسي: 42 طبقة مع آلية الانتباه المجمّع للاستعلامات، و16 رأس استعلام و2 رأس مفتاح/قيمة. ولأن لا شيء في المخطط مخصص، يمكن لمحركات الاستدلال السائدة تحميل الأوزان دون تعريف نموذج معدّل أو نواة مكتوبة يدويًا.

متوسط 53.9 ومن أجرى الاختبار

عبر مجموعة المقارنة التي تضم 34 اختبارًا لدى OpenBMB، يحقق MiniCPM5-2B متوسطًا قدره 53.9. وهذا يضعه أمام عدة نماذج مفتوحة أكبر حجمًا في الجدول نفسه، بينها Qwen3.5-4B بمتوسط 51.1 وgranite-4.2-3B بمتوسط 42.7. أما النماذج المماثلة في الحجم مثل LFM2.5-2.6B وQwen3.5-2B فتحل في مرتبة أدنى.

مصدر الأرقام هو الجزء الذي يستحق التمهل. فـ OpenBMB تفصل بين الصفوف المستمدة من Artificial Analysis والصفوف التي أعادت إنتاجها داخليًا، حتى يستطيع القراء التمييز بين نوعي الأرقام. والمتوسط المدمج ليس الادعاء نفسه الذي يقدمه متوسط خارجي بالكامل، وينبغي قراءة 53.9 في ضوء هذا التقسيم لا فوقه.

الاختبارMiniCPM5-2BQwen3.5-4B
متوسط 34 اختبارًا53.951.1
LiveCodeBench v669.156.4
SWE-bench Verified46.433.6
NoLiMa (السياق الطويل)68.143.5
MMLU-Pro70.878.0

الأرقام كما نشرتها OpenBMB، مستمدة من صفوف أعاد المطوّر إنتاجها وصفوف Artificial Analysis.

حيث يتفوق نموذج بحجم 2B على 4B، وحيث لا يفعل

تتركز الانتصارات في العمل الوكيلي. فيسجل LiveCodeBench v6 نسبة 69.1 مقابل 56.4 لمرجع Qwen بحجم 4B، وSWE-bench Verified 46.4 مقابل 33.6، واسترجاع السياق الطويل في NoLiMa 68.1 مقابل 43.5. كما تذكر OpenBMB أن τ²-Bench Telecom بلغ 97.1 وBFCL v4 بلغ 66.6.

أما الصفوف المعتمدة على المعرفة فتروي النصف الآخر من القصة. فيصل MMLU-Pro إلى 70.8 لدى MiniCPM5-2B مقابل 78.0 لنموذج Qwen الأكبر، وهي فجوة تسير في الاتجاه المعاكس. ويطابق تمركز OpenBMB البيانات: رفيق مدمج للعمل الوكيلي والبرمجة لا عملاق معرفة عامة.

الخبراء الـ16 وراء القفزة

يمر التدريب اللاحق عبر مسار تسميه OpenBMB الإدارة المتدرجة UltraData. يبدأ بضبط دقيق موجّه للتفكير العميق على نحو 400 مليار رمز، يليه معلّمون متخصصون في التعلم المعزز للرياضيات والبرمجة والوكلاء والكتابة، مدربون بخوارزمية قائمة على الناقد يسميها المختبر JustRL II. والخطوة الأخيرة هي التقطير على السياسة الذي يدمج 16 خبيرًا في التعلم المعزز، خمسة منهم وكيليون، في الطالب الواحد الذي يُطرح.

وتنسب OpenBMB متوسط مكاسب يبلغ نحو 10.96 نقطة في مجموعات الاستدلال والاختبارات العامة، و6.96 نقطة في المجموعات الوكيلية، إلى مرحلة التعلم المعزز والتقطير تلك. وبدلًا من مطالبة القراء بقبول الادعاء دون دليل، نشرت نسخًا وسيطة من نقاط الحفظ Base وMidtrain وSFT-only، ما يتيح لأي شخص قياس مساهمة كل منها على حدة.

على ماذا يمكنك تشغيله فعليًا

تشمل تغطية بيئات التشغيل vLLM وSGLang وTransformers وllama.cpp وOllama وLM Studio وMLX وLiteRT وبنى FlagOS متعددة الشرائح. وتستهدف حزم GGUF وMLX وGPTQ المساعدين المحليين الذين يحتاجون إلى استدعاء الأدوات والسياق الطويل دون وحدة معالجة رسوميات في مركز بيانات. كما نُشرت مجموعات بيانات UltraData المستخدمة في التدريب، والتي تغطي الويب والبرمجة والرياضيات وعينات الضبط الدقيق والتعلم المعزز للوكلاء.

إن نشر الأوزان والبيانات ونقاط الحفظ الوسيطة والبنى المكمّمة في إصدار واحد يخفض كلفة التحقق من العمل، وهو أمر نادر بما يكفي ليستحق الذكر صراحة.

سيجري الاقتباس من متوسط 53.9. لكن الرقم الذي يحدد ما إذا كان MiniCPM5-2B مهمًا أضيق نطاقًا: كم من التفوق في البرمجة واستدعاء الأدوات على نماذج مفتوحة بحجم 4B سيصمد عندما يشغّل شخص آخر منصة الاختبار. وقد سلّمت OpenBMB ما يلزم لمعرفة ذلك.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.