سباق النماذج الصغيرة
بانانا مايند 2 مايكرو: 2.9 مليون معامل، 75 مليار توكن، ورهان تدريب مفرط متطرف
سيضم BananaMind 2 Micro 2.9 مليون معامل وسيُدرَّب على 75 مليار توكن، أي ما يقارب 25,900 توكن لكل معامل. يبدأ التدريب في 3 أغسطس، والإصدار المتوقع في الفترة من 4 إلى 6 أغسطس، وتصل معاينة عامة لـ BananaMind 2 Pro في اليوم نفسه. لم تتم مشاركة أي معايير أداء.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-06 · قراءة 4 دقائق

أعلنت BananaMind عن BananaMind 2 Micro، أصغر نموذج في عائلة BananaMind 2، مع تحفظ غير معتاد: النموذج غير موجود بعد. يقول منشور الإعلان إن التدريب لم يبدأ، ولم يُطرح أي شيء. ما يوجد هو مواصفات، والمواصفات هي القصة. سيستخدم BananaMind 2 Micro 2.9 مليون معامل مع تدريب مفرط على 75 مليار توكن "للحصول على أقصى ذكاء لكل معامل"، على حد تعبير الفريق.
الجدول الزمني محدد بنفس القدر. يبدأ التدريب في 3 أغسطس، ومن المتوقع أن يكون موعد الإصدار في الفترة من 4 إلى 6 أغسطس. وفي اليوم نفسه الذي يبدأ فيه التدريب، تقول BananaMind إنها ستصدر معاينة عامة لـ BananaMind 2 Pro، التي يذكرها المنشور بالاسم فقط.
الأرقام في لمحة:
| النموذج | المعاملات | توكنات التدريب | التوكنات لكل معامل |
|---|---|---|---|
| BananaMind 2 Micro | 2.9M | 75B | ~25,900 |
| Gemma 4، أصغر إعداد | 2.3B | غير متاح | غير متاح |
| Gemma 3، الرائد السابق | 27B | غير متاح | غير متاح |
25,900 توكن لكل معامل، واختلال متعمد
يستحق الرقمان الرئيسيان أن يُقرآ معًا. إن 75 مليار توكن موزعة على 2.9 مليون معامل تعادل تقريبًا 25,900 توكن لكل معامل في النموذج. بالنسبة لنموذج بهذا الحجم الصغير، فإن هذه النسبة غير متوازنة عمدًا. الكلمة التي اختارها الفريق، "تدريب مفرط"، تشير إلى أن هذا الاختلال هو الاستراتيجية وليس مجرد أثر جانبي: إطعام نموذج صغير بكمية هائلة من البيانات، ثم معرفة مقدار القدرة التي تبقى لكل معامل.
لا يقدم المنشور أي نتائج معايير أداء، ولا نتائج تقييم، ولا مقارنات. إن وعد "أقصى ذكاء لكل معامل" هو، في هذه المرحلة، نية لا يدعمها أي شيء علني يمكن التحقق منه. ما إذا كانت 25,900 توكن لكل معامل تحقق قدرة حقيقية هو سؤال لا يمكن إلا لتشغيل تدريب أغسطس أن يجيب عنه.
Muon بدلاً من AdamW، وبوابة من TX4
ثلاثة تغييرات تقنية تأتي مع الإعلان. تستغني BananaMind عن AdamW لصالح محسن Muon، الذي تقول إنه يوفر تقاربًا أسرع يصل إلى مرتين ويتحمل معدل تعلم أعلى. يرتفع معدل التعلم إلى 2.2e-2. كما يكتسب النموذج ما تسميه الفريق بوابة تحديث XSA من بنية TX4، مدمجة في تصميم BananaMind الخاص. كان AdamW هو المحسن الافتراضي في جزء كبير من التدريب واسع النطاق الأخير في هذا المجال، لذا فإن الابتعاد العلني عنه هو نوع التفاصيل التي تشير إلى فريق يعمل على تحسين كل متغير في الوقت نفسه.
هذا هو النطاق الكامل للتفاصيل المُعلنة. لا يشرح المنشور كيف تم قياس رقم التقارب المضاعف، ولا ماذا تفعل بوابة التحديث، ولا من أين تأتي بنية TX4. يعتمد كل ادعاء على وصف الفريق نفسه، دون أي تحقق خارجي، وتحمل التواريخ التحفظ نفسه: نافذة الإصدار تقديرية وليست التزامًا.
رهان مبني لسباق النماذج الصغيرة
التوقيت يمنح الإعلان سياقه. تقول Google DeepMind إن أصغر نموذج في جيل Gemma 4، الذي يضم 2.3 مليار معامل، يطابق أداء نموذج Gemma 3 الذي يضم 27 مليار معامل، أي مكسب في كفاءة المعاملات بمقدار 10 أضعاف في جيل واحد، وجلب Gemma 4 وضع التفكير إلى الأوزان المفتوحة، الذي كان سابقًا حكرًا على النماذج المغلقة. يقع BananaMind 2 Micro أقل بنحو 800 مرة حتى من نطاق 2.3 مليار. هذه ليست خطوة تنازلية تدريجية. إنها فئة وزن مختلفة، ويبدو الإعلان وكأنه بيان تموضع متعمد لها.
الفجوات واضحة بقدر الطموح. لا معايير أداء، ولا عرض توضيحي، ولا كلمة عن أجهزة التدريب أو شروط الترخيص. النافذة قصيرة: إذا بدأ التدريب في 3 أغسطس ووصل الإصدار إلى أي مكان في الفترة التقديرية من 4 إلى 6 أغسطس، فالفريق يوحي إما بتشغيل بقيمة 75 مليار توكن يتسع لأيام قليلة أو بجدول زمني مرن عمدًا. المنشور لا يحدد أيهما. ما يقوله هو أن BananaMind مرتاحة للمراهنة على الطرف الأقصى من التدريب المفرط. إذا نجح نموذج يضم 2.9 مليون معامل مع هذا القدر الكبير من البيانات خلفه، فإن اقتصادات النماذج الصغيرة ستتحرك مرة أخرى. وإذا لم ينجح، فإن المجال سيتعلم أين تقف الحدود. وفي كلتا الحالتين، يحسم 3 أغسطس جزءًا من الجدل.
يظهر BananaMind 2 Pro في الإعلان فقط كاسم وتاريخ. تصل معاينته العامة في 3 أغسطس. لا عدد معاملات، ولا قدرات، ولا مزيد من التفاصيل.
- المصدر : BananaMind 2 Micro: 2.9M parameters, 75B tokens, and an extreme overtraining bet — 2026-07-30
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.