أبحاث الذكاء الاصطناعي مفتوحة المصدر

سياق مليون رمز بعُشر ذاكرة KV: رهان DeepSeek-V4 على الكفاءة

تجمع معاينة V4 من DeepSeek بين نموذج Pro بمعاملات 1.6T ونسخة Flash بمعاملات 284B، وكلاهما بسياق من مليون رمز. تدّعي الورقة أن النموذج يستهلك 27% من عمليات FLOPs للاستدلال و10% من ذاكرة KV الخاصة بـ V3.2، وهي الأرقام التي تجعل تقديم هذا السياق فعالًا من حيث التكلفة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-06-22 · آخر تحديث: 2026-08-02 · قراءة 4 دقائق

سياق مليون رمز بعُشر ذاكرة KV: رهان DeepSeek-V4 على الكفاءة

لم يكن الجزء المكلف من سياق مليون رمز هو الرموز نفسها، بل الذاكرة التي تشغلها. كل رمز في النافذة يستقر في ذاكرة KV، وتنمو هذه الذاكرة مع طول التسلسل، ولهذا حمل تقديم السياقات الطويلة ثمنًا باهظًا. تستهدف معاينة V4 من DeepSeek منحنى التكلفة هذا مباشرة.

نموذجان، مليون رمز واحد

نشرت DeepSeek سلسلة V4 كمعاينة تقنية، مع نقاط تفتيش (checkpoints) على Hugging Face. تضم التشكيلة نموذجي Mixture-of-Experts. يعمل DeepSeek-V4-Pro بـ 1.6 تريليون معامل، بواقع 49 مليارًا نشطًا لكل رمز. أما DeepSeek-V4-Flash فهو الخيار الأخف: 284 مليار معامل، بواقع 13 مليارًا نشطًا. وكلاهما يدعم نافذة سياق من مليون رمز.

النموذجالمعاملاتالنشط لكل رمزنافذة السياق
DeepSeek-V4-Pro1.6T49B1M رمز
DeepSeek-V4-Flash284B13B1M رمز

ادعاء الكفاءة

أرقام الكفاءة هي العنوان الحقيقي. عند سياق مليون رمز، تقول الورقة إن DeepSeek-V4-Pro لا يحتاج سوى 27% من عمليات FLOPs للاستدلال لرمز واحد و10% من ذاكرة KV مقارنة بـ DeepSeek-V3.2. عمليات FLOPs الأقل تعني توليدًا أسرع. عُشر ذاكرة KV يعني أن ميزانية الذاكرة نفسها تتسع لنحو عشرة أضعاف من الجلسات المتزامنة ذات السياق الطويل، قبل أن يتدخل أي عنق زجاجة آخر. هذا الحساب هو ما يجعل ادعاء الورقة بأنها «تدعم بشكل روتيني سياقات من مليون رمز» قابلًا للتصديق.

كيف تصل البنية إلى ذلك

ثلاثة تغييرات بنيوية تتحمل العبء. الأول تصميم انتباه هجين يقسم العمل بين الانتباه المتناثر المضغوط (CSA) والانتباه المضغوط بشدة (HCA). يُبقي الانتباه المتناثر الرموز البعيدة التي تحتاجها فعلًا في متناول اليد؛ بينما يُبقي المسار المضغوط بشدة بصمة الذاكرة لكل ما عداها تحت السيطرة. الثاني هو الوصلات الفائقة المقيَّدة بالمتشعب (mHC)، وهي ترقية للوصلات المتبقية التقليدية. الثالث هو مُحسِّن Muon، الذي تنسب إليه الورقة تقاربًا أسرع واستقرارًا أكبر في التدريب. دُرِّب النموذجان مسبقًا على أكثر من 32 تريليون رمز، ثم خضعا لخط أنابيب موسّع لما بعد التدريب يهدف إلى إطلاق قدراتهما وتوسيعها.

Pro-Max وسباق الأوزان المفتوحة

تصف DeepSeek أيضًا V4-Pro-Max، وهو وضع أقصى جهد استدلالي لنموذج Pro. تقول الورقة إنه «يعيد تعريف أحدث ما وصلت إليه النماذج المفتوحة» ويتفوق على أسلافه في المهام الأساسية. لا تتضمن المعاينة جداول معايير (benchmarks)، لذا لا يوجد خلف هذا الادعاء أرقام منشورة تتجاوز أرقام الكفاءة. تعامل معه كبيان يحتاج إلى تحقق بمجرد ظهور نتائج مستقلة.

يأتي التوقيت في خضم مرحلة مزدحمة بالأوزان المفتوحة. تغطيتنا لنموذج Gemma 4 من Google DeepMind، وهو نموذج MoE بـ 26 مليار معامل يهدف إلى الاستدلال عبر قواعد الشيفرات الكاملة والنصوص الطويلة متعددة الساعات، تُظهر السباق نفسه نحو السياق الطويل في النماذج مفتوحة الأوزان. تحمل نماذج Gemma الكثيفة الأصغر نوافذ من 256,000 رمز. تَعِد DeepSeek بمليون رمز كامل في نسختَي V4 معًا. الفجوة أكثر أهمية بالنسبة لحالة الاستخدام التي تشير إليها الورقة: المهام طويلة الأفق التي كانت تُجبر المطورين سابقًا على بناء خطوط تجزئة واسترجاع، وهو ما يضيف زمن استجابة وتعقيدًا فوق ما يمكن أن يقدمه النموذج.

ما الذي لا يزال بحاجة إلى إثبات

تصلح المعاينة أيضًا كاختبار لما إذا كان السوق يعامل الكفاءة كميزة رئيسية. نقاط التفتيش متاحة للجميع لتشغيلها، والانقسام إلى نموذجين يمنح DeepSeek طبقة Pro للمهام الثقيلة وطبقة Flash يشير عدد معاملاتها النشطة إلى تقديم أرخص. لا تضع الورقة نموذج Flash في موضع محدد بشكل صريح، فتعامل مع ذلك كقراءة وليس كمواصفة. أما بالنسبة للمطورين الذين يقدمون أعباء عمل ذات سياق طويل، فالسؤال العملي أبسط: إذا صمدت أرقام 27% و10% خارج الورقة، فإن تكلفة تذكُّر مليون رمز تتوقف عن كونها السبب في البناء حول الاسترجاع بدلًا من السياق.

لا يحسم أي من هذا ما إذا كان النموذج جيدًا. الكفاءة نصف المعادلة، وجودة السياق الطويل القوية لم تكن يومًا مجرد مشكلة ذاكرة. تمنح المعاينة النقاد هدفًا واضحًا: تشغيلات مستقلة لإعداد مليون رمز، وهو الإعداد الدقيق الذي بُنيت البنية من أجله، مع تدقيق أرقام التكلفة مقارنة بـ V3.2. وحتى تظهر تلك النتائج، تقدم السلسلة حجة قوية حول أين تتجه تكاليف السياق الطويل، مدعومة بنموذج يمكن للناس تنزيله فعلًا.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.