DeepSeek-V4.1-Flash يصل إلى حزمة vLLM الخاصة بـCambricon

نموذج بـ552 مليار معامل، وربع ذاكرة HBM، ونقل إلى Cambricon في اليوم الأول

وصل DeepSeek-V4.1-Flash إلى مسرعات Cambricon في اليوم الأول عبر vLLM. وما يقوله هذا النقل عن النموذج أقل مما يقوله عن السرعة التي تستطيع بها شركات الرقائق الصينية الآن متابعة إطار استدلال عام.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-09-22 · قراءة 4 دقائق

نموذج بـ552 مليار معامل، وربع ذاكرة HBM، ونقل إلى Cambricon في اليوم الأول

نشرت DeepSeek نقطة التحقق الخاصة بـDeepSeek-V4.1-Flash، وتقول Cambricon إن النموذج عمل على مسرعاتها في اليوم نفسه. وكان هدف الدمج هو vLLM، حزمة الاستدلال مفتوحة المصدر التي يعتمدها المشغلون بالفعل معيارًا، لا تفرعًا خاصًا منها.

تصل أخبار كهذه في ثياب أخبار النماذج. لكن الادعاء الذي يستحق الاختبار أضيق نطاقًا: أن بائع رقائق سلّم مسار خدمة عاملًا في يوم الإطلاق، ووصف مكوناته بتفصيل يكفي للحكم عليه هندسيًا لا بلغة الإعلانات.

ما سلّمته Cambricon فعليًا من أجل DeepSeek-V4.1-Flash

المُخرَج هو مكتبة عوامل مدمجة، ومجموعة نوى مكتوبة يدويًا، وإعدادات خدمة. استخدم مهندسو Cambricon أداة Torch-MLU-Ops لتسريع بنيتين تسميهما الشركة Engram وCompressor، وكتبوا نوى BangC محسّنة للانتباه المتناثر والمضغوط. وداخل vLLM، تقول Cambricon إن مسارها يدعم توازيًا مختلطًا خماسي الأبعاد عبر أبعاد الموترات والخطوط الأنبوبية والتسلسل والبيانات والخبراء، مع تداخل الاتصالات مع الحوسبة، إضافة إلى التكميم منخفض الدقة وفصل مرحلتي الملء المسبق وفك الترميز. وتستند المنظومة كاملة إلى NeuWare، منصة البرمجيات العريقة لشركة Cambricon.

يغطي ذلك الأجزاء من حزمة الخدمة التي تحدد ما إذا بقي العنقود مشغولًا. لكنه لا يتضمن أي رقم. فلا يحمل الإعلان رقمًا للإنتاجية ولا لزمن الاستجابة ولا مقارنة بمسرع آخر، ما يجعل التوافر في اليوم نفسه ادعاءً يتعلق بالجدولة لا بالأداء.

وكانت Cambricon قد انضمت قبل أيام إلى مؤسسة PyTorch كعضو بلاتيني، ما يضعها في مجلس الإدارة إلى جانب مساهمين آخرين من مجالي العتاد والسحابة. وقراءة ذلك مع النقل في اليوم صفر تشير إلى استثمار في المشروع الأصلي لا إلى رقعة لمرة واحدة.

حسابات الذاكرة وراء النقل في اليوم نفسه

DeepSeek-V4.1-Flash هو أصغر أفراد عائلة معمارية DeepSeek الأحدث. وهو نموذج خليط خبراء بـ552 مليار معامل، ينشّط نحو 8 مليارات معامل في جانب الإدخال و16 مليارًا في جانب الإخراج، ويتعامل مع الرؤية أصالةً. والتخطيط هو Causal-Encoder-Decoder.

الضغط هو ما يهم بائعي المسرعات. تقول DeepSeek إن ضغط ذاكرة KV يخفض الطلب على HBM إلى نحو الربع والطلب على SSD إلى نحو الثمن مقارنة بالجيل السابق، مع وصف حجم الذاكرة المؤقتة بأنه أصغر بمئات المرات من تصميم الجيل الأول.

المؤشرDeepSeek-V4.1-Flash مقابل الجيل السابق
الطلب على HBMنحو الربع
الطلب على SSDنحو الثمن
حجم ذاكرة KV المؤقتةيوصف بأنه أصغر بمئات المرات من تصميم الجيل الأول

في عقدة خدمة كثيفة، تحدد ذاكرة KV المؤقتة عدد التسلسلات المتزامنة التي تتسع لها الذاكرة، وهذه العقد تُرهق أصلًا ميزانيات HBM. وتوفير ثلاثة أرباعها يعني إما مزيدًا من المستخدمين لكل بطاقة أو بطاقات أقل لكل عملية نشر، ولهذا يظهر الحجم الأصغر للذاكرة المؤقتة أولًا كحماسة لدى بائعي الرقائق. وهذه أرقام DeepSeek، مذكورة للنموذج لا مقيسة على عتاد Cambricon، ولم يُنشر أي تحقق مستقل منها.

خمس عائلات نماذج، ووصفة واحدة

تُدرج Cambricon دعم الاستدلال في اليوم صفر أو في الإنتاج عبر خمس عائلات نماذج صينية: GLM من Zhipu AI، وDeepSeek، وQwen من علي بابا، وKimi من Moonshot AI، وMiniMax.

الصياغة تعلن أقل مما تبدو. عبارة "اليوم صفر أو الإنتاج" تشمل الجاهزية يوم الإطلاق ودعمًا أُلحق بنماذج صدرت قبل أشهر، والقائمة لا تفصل بين الحالتين.

عائلة النماذجالمطوّرالحالة المعلنة من Cambricon
GLMZhipu AIدعم استدلال في اليوم صفر أو في الإنتاج
DeepSeekDeepSeekدعم استدلال في اليوم صفر أو في الإنتاج
Qwenعلي بابادعم استدلال في اليوم صفر أو في الإنتاج
KimiMoonshot AIدعم استدلال في اليوم صفر أو في الإنتاج
MiniMaxMiniMaxدعم استدلال في اليوم صفر أو في الإنتاج

بالنسبة لمشغلي العناقيد، هذا التمييز هو كل قيمة الادعاء. النقل يوم الإطلاق يعني وجود وصفة موثقة عند صدور نقطة التحقق. أما التعديل اللاحق فيعني انتظار البائع ليلحق بالركب بعد وقوع الأمر.

التفرعات المغلقة مقابل الأطر العامة

أشارت Caixin Global إلى التمكين في اليوم نفسه كعلامة على تقصّر حلقات الربط البرمجي بين النماذج والرقائق محليًا، من عمليات نقل خاصة تستغرق شهورًا إلى جاهزية يوم الإطلاق على أطر عامة يشغلها المشغلون بالفعل. والقِصر المقيس هنا برمجي لا سيليكوني. فالبائع القادر على متابعة إصدارات vLLM الأصلية يحمل عبئًا دعميًا أقل كلفة من بائع يحتفظ بتفرع مغلق لكل نموذج يخدمه.

ما يتركه الإعلان مفتوحًا هو ما إذا كان النمط قابلًا للتوسع. فـDeepSeek-V4.1-Flash هو أصغر أفراد عائلته، وتشير صياغة Cambricon نفسها إلى الاختبار التالي: نسخ DeepSeek الأكبر وتوليفات خدمة متعددة الوسائط. نقل النموذج الصغير في يوم واحد مؤشر جيد. لكنه ليس بعد دليلًا على أن الفريق نفسه يستوعب نقطة تحقق أكبر، أو عبئًا يخدم الرؤية والنص معًا، وفق الجدول الزمني ذاته.

أصبح "اليوم صفر" ادعاءً يستطيع عدة بائعين تقديمه. أما من يواصل تقديمه كلما كبرت نقاط التحقق فهو الجدير بالمتابعة.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.