مفتوح المصدر

سباق تتابع بوحدات GPU مستأجرة درّب نموذج NanoColibri من نوع 2.7B MoE مقابل 200 دولار

انتقل نموذج NanoColibri-Instruct من أوزان أولية إلى نموذج 2.7B MoE يعمل بتكلفة نحو 200 دولار. تناوب متطوعون على عصا التدريب عبر Hugging Face Hub، بوحدة GPU مستأجرة واحدة في كل مرة، مع عقد مقارنة-وتبديل يضمن ألا يدرب شخصان المرحلة نفسها أبدًا.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-04 · قراءة 6 دقائق

سباق تتابع بوحدات GPU مستأجرة درّب نموذج NanoColibri من نوع 2.7B MoE مقابل 200 دولار

عادةً ما يعني التدريب المسبق لنموذج لغوي من الصفر عنقودَ خوادم، وفاتورة حوسبة بستة أرقام، وأشخاصًا يتقاضون أجرًا لإبقاء جولة التدريب حية. أما إجابة مشروع مفتوح المصدر جديد فأقصر من ذلك. انتقل NanoColibri-Instruct، وهو نموذج خليط خبراء (Mixture-of-Experts) بمعاملات يبلغ عددها 2.7 مليار، منها 0.34 مليار معامل نشط لكل توكن، من أوزان عشوائية إلى نموذج قابل للاستخدام بتكلفة تتراوح بين 180 و260 دولارًا تقريبًا، دون عنقود، إذ يتناوب المساهمون على وحدات GPU مستأجرة واحدة تلو الأخرى. الكود، ونقاط التفتيش (checkpoints)، وسجل عام يوثق من درّب ماذا، متاحة في مستودع التدريب.

لم يكن النموذج هدفًا نهائيًا أبدًا. يقدّم المقال Nano بوصفه إثباتًا للحلقة (proof-of-loop) لفكرة أكبر: نماذج تكون حاوياتها من نوع int4 أكبر عمدًا من ذاكرة جهاز المستهلك، مع بثّ الخبراء من NVMe ضمن ميزانية RAM ثابتة. لا يمكن لجهاز محمول بذاكرة 16 جيجابايت أن يستوعب نموذجًا من فئة 24 إلى 28 مليار معامل في ذاكرة RAM. في نموذج MoE دقيق التحبب، يلمس كل توكن العمودَ الفقري الكثيف فقط، وخبيرًا مشتركًا واحدًا مقيمًا دائمًا، وخبيرَين موجَّهين (routed experts) بحجم 3 إلى 4 ميجابايت. خزِّن الخبراءَ باستخدام LRU، ودَعِ القرص يخدم حالات عدم الإصابة (misses). يمرّن Nano خط الإنتاج بأكمله، بما في ذلك التصدير بصيغة int4، بسعر لا تؤلم فيه الأخطاء.

تطابق البنيةُ الشكلَ الأصلي لمحرك التقديم، HYV3: 24 طبقة (واحدة كثيفة و23 من نوع MoE)، وعرضًا خفيًا 1024، و64 خبيرًا بعرض 512 مع توجيه top-2، وخبيرًا مشتركًا عريضًا بعرض 2048 لا يغادر الذاكرة أبدًا، وانتباهًا مجمعًا للاستعلامات بعامل 4 (4x grouped-query attention) مع تطبيع QK لكل رأس، وموجّهًا من نوع sigmoid-plus-bias. يتبع موازنة الحمل وصفة DeepSeek-V3: دفع انحياز الخبير في كل طبقة بمقدار غاما مضروبًا في إشارة (الهدف ناقص الحمل).

التدريب بالتتابع: مقارنة-وتبديل على Hub

لا يمكنك تقسيم التدريب المسبق التسلسلي بين المتطوعين كما تقسّم قاعدة الأكواد. كل خطوة تعتمد على سابقتها، لذا تعيش جولة التدريب في مستودع نماذج Hugging Face واحد، يضم الأوزان وحالة المحسّن (optimizer state)، وملفات training_state.json وRELAY.json وLEDGER.md، ويتناوب المساهمون على: المطالبة (claim)، ثم السحب (pull)، ثم تدريب مرحلة (leg)، ثم الدفع (push)، ثم التحرير (release).

التصادم هو الجزء الذي يجب أن يكون محكمًا. إذا درّب شخصان المرحلة نفسها، فإن من يدفع ثانيًا يدمّر يوم GPU صامتًا. لذا فإن المطالبة بالعصا هي عقد إيجار (lease), مقارنة-وتبديل حقيقية ضد Hub وليست مجرد اتفاقية مهذبة, يتجدد بنبض القلب (heartbeat) أثناء التدريب، ما يعني أن مثيلًا فوريًا (spot instance) تعرّض للاستباق يحرر العصا من تلقاء نفسه. تعرض لوحة معلومات للقراءة فقط على جهاز التدريب الخسارة (loss)، والإنتاجية (throughput)، وتوازن الخبراء، ومن يحمل العصا حاليًا.

وقد نجح الأمر: 20,000 تحديث، على نحو 5.2 مليار توكن من FineWeb-Edu، ثم 1,500 تحديث من الضبط الدقيق المحادثاتي (chat SFT) على smol-smoltalk، أي نحو 90 ساعة H100 في المجمل.

هناك نتيجة واحدة تستحق الاقتباس: درّب باستخدام توجيه top-2 حتى لو كنت ستقدّم الخدمة بتوجيه top-1. عند top_k=1، ينهار الوزن الموجَّه إلى قيمة ثابتة، ولا يحصل الموجّه عمليًا على أي تدرّج (gradient) من خسارة النموذج اللغوي، فيبقى التوجيه مجمدًا عند تهيئته العشوائية. أما top_k=2 فيعيد تدفق التدرج عبر المنافسة بين فائزين اثنين. وعند وقت التقديم، ما يزال المحرك يشغّل خبيرًا واحدًا لكل توكن. صمد التوازن الخالي من الخسارة المساعدة (aux-loss-free) عند هذا الحجم: ظلت نسبة الخبراء الميتين منخفضة، وبقي الحمل صحيًا، والانحراف الطفيف المتبقي في التوجيه هو ما تحبه ذاكرة التخزين المؤقت للبث (streaming cache).

اختلال توازن الخبراء هو نمط الفشل نفسه في الطرف الآخر من طيف MoE. تصف الملاحظات الميدانية لـNous Research حول التدريب المسبق لنموذج بمعاملات تبلغ تريليونًا واحدًا التحدي الأساسي بأن ترسل الموجّهات حركة مرور غير متناسبة إلى خبراء معينين، تاركةً بعض وحدات GPU خاملة بينما تنتظر أخرى في الطابور. أما نسخة NanoColibri من تلك المشكلة فبلغت تكلفة مواجهتها بضع مئات من الدولارات.

ماذا تشتري 5.4 مليار توكن

تأتي الأرقام مع منهجيتها مرفقة. أُجريت المعايير عبر أداة تقييم (harness) داخل المستودع ومتوافقة مع lm-evaluation-harness، وبنفس المطالبات (prompts) وبنفس التسجيل، كما أُعيد تشغيل النماذج الكثيفة المرجعية عبر الكود نفسه بدلًا من الثقة بالأرقام المنشورة.

النموذجالمعاملات النشطةالتوكناتlambadapiqawinoarc-earc-cobqahswag
NanoColibri (chat)341M5.4B26.362.749.243.422.822.031.1
Pythia-410M @ step3000405M6.3B26.359.850.941.318.815.627.0
Cerebras-GPT-256M (final)256M5.1B29.361.351.141.017.015.827.4

يفوز NanoColibri في 5 من 7 مقارنات ضد كلا الخطين الأساسيين، ويتعادل مع Pythia في LAMBADA، ويقع ضمن هامش الضوضاء في WinoGrande (±1.4 عند n=1267). التحفظات معلنة. نقطة تفتيش Pythia وصلت إلى نحو 2% فقط من جدول معدل التعلم (LR schedule) الخاص بها، وهو ما يعيقها؛ أما صف Cerebras-GPT-256M المُبرَّد بالكامل (fully annealed) فهو المقارنة المتحفظة، وNano يفوز عليه أيضًا. يبدو التأخر في LAMBADA وكأنه جزئيًا على الأقل قطعة أثرية في البيانات: لا يحتوي FineWeb-Edu تقريبًا على أي خيال أدبي، بينما بُني LAMBADA من الروايات.

قراءة المشروع متزنة: عند هذه الميزانية، يتصرف نموذج MoE بإجمالي 2.7 مليار معامل كنموذج كثيف جيد في فئة 300 إلى 600 مليون، إذ يشتري العدد الإجمالي للمعاملات ميزة حقيقية على خطين أساسيين كثيفين مطابقين في عدد التوكنات. أما الفجوة إلى أرقام فئة SmolLM2 فهي ثلاث مراتب من حيث حجم البيانات، لا من حيث البنية.

درسان محرجان

الأول هو فخ ذاكرة التخزين المؤقت للصفحات (page cache). لـ«قياس» البث، أعطى الفريق محرك التقديم ميزانيات RAM أصغر من الحاوية (sub-container) على خادم مستأجر، فحصل على سرعات ثابتة بشكل مثير للريبة صولًا إلى ميزانية أصغر بخمس مرات من الحاوية. كانت ذاكرة الخادم تفوق حاوية الـ1.2 جيجابايت بأشواط، لذا كانت ذاكرة التخزين المؤقت للصفحات في نظام التشغيل تغطي بصمت كل حالة عدم إصابة (miss). تلك الجولات لم تلمس القرص أبدًا؛ بل وصفت طريقة محاسبة المحرك على ذاكرة التخزين المؤقت. أرقام ضغط القرص الحقيقية تتطلب مجموعات cgroups بسقف ذاكرة على عتاد يُنفَّذ فيه السقف فعليًا، وحاوية أكبر، كما يعترف الفريق. خلل في المعيار اكتُشف منذ ذلك الحين في أداة قياس السرعة هو السبب في أن المقال لا يحمل أي ادعاءات بالتوكنات في الثانية. تعلّم انضباط القياس أرخص عند 200 دولار.

الثاني هو جيب التمام المستنفَد (spent cosine). جدول معدل التعلم من نوع cosine المثبّت على هدف خطوات معين يكون مستنفدًا بحلول الوقت الذي تبلغه فيه، دون أي هامش لمواصلة التدريب على الزخم. تستخدم الجولات اللاحقة WSD (warmup-stable-decay): مرحلة ثابتة طويلة تناسب مراحل التتابع، تتناقص مرة واحدة، عندما يختار الفريق.

ما التالي: بروفة بحجم 7B، ثم حاوية من 24 إلى 28B

تتضمن خارطة الطريق في NEXT_MODEL.md مرحلتين. Colibri-Micro: 7B إجمالًا، و1B نشط، و100B توكن، ومزيج كثيف الكود، مع SFT ثم RLVR للكود، وحاوية كبيرة بما يكفي فعلًا, 3.8 جيجابايت بصيغة int4, لقياس البث الحقيقي من القرص على أجهزة الكمبيوتر المحمولة المستهدفة. ثم Colibri-Grande، بإجمالي 24 إلى 28B مع نحو 2.4B نشط، وحاويته تتجاوز عمدًا حدود ذاكرة كمبيوتر محمول بسعة 16 جيجابايت. لا يُثبَّت عدد خبراء Grande إلا بعد وجود منحنيات الإخفاق (miss) والسرعة التي قاسها Micro. يُصدَر كل شيء مفتوحًا: الأوزان، ووصفة البيانات، وكود التدريب، وبروتوكول التتابع، وملفات JSON الخاصة بالمعايير، والسجل (ledger).

دُفع ثمن Nano من الجيب الخاص. تحتاج المرحلة التالية إلى بضعة آلاف من ساعات H100، أي ما يقارب 9,000 إلى 12,000 دولار بأسعار السوق، ويقدّم المؤلف طلبات للحصول على منح حوسبة. لقد اكتمل إثبات الحلقة (proof-of-loop) بـ200 دولار. أما الدرسان اللذان حددت التجربة ثمنهما, فخ ذاكرة التخزين المؤقت للصفحات وجيب التمام المستنفَد, فهما بالضبط ما لا تستطيع جولة بقيمة 9,000 دولار أن تتعلمه من الصفر.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.