أبحاث الذكاء الاصطناعي
Memory Decoder: ذاكرة إضافية بحجم 6.9 مليار معلمة تجعل نموذجًا بحجم 410 ملايين يتفوق على Pythia-12B
يفصل Memory Decoder at Scale الذاكرة طويلة المدى عن الاستدلال في نماذج اللغة الكبيرة. ذاكرة مُدرَّبة مسبقًا بحجم 6.9 مليار معلمة رفعت Pythia-410M فوق Pythia-12B على 17 معيارًا مع معلمات أقل بنسبة 39%؛ وأضافت ذاكرات مجالية بحجم 1.7 مليار معلمة أكثر من 9 نقاط إلى Qwen3 Base على كل مقياس تم اختباره.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-31 · آخر تحديث: 2026-08-02 · قراءة 3 دقائق

الرقم الأكثر فائدة في ورقة Memory Decoder at Scale، المنشورة على arXiv في 30 يوليو، ليس نتيجة معيارية. إنه 39، أي النسبة المئوية من إجمالي المعلمات التي لم تعد بحاجة إليها على ما يبدو إذا توقفت عن إنفاق ميزانيتك بالكامل على نموذج أساسي أكبر وأنفقت جزءًا منها على وحدة ذاكرة مُدرَّبة مسبقًا بدلًا من ذلك.
يجادل المؤلفون بأن نماذج اللغة القائمة على وحدة فك الترميز فقط (decoder-only) تدمج الذاكرة طويلة المدى والاستدلال في مجموعة معلمات واحدة، وهو ما يجعل من الصعب توسيع سعة الذاكرة بشكل مستقل. Memory Decoder، وهي وحدة ذاكرة معلمية طويلة المدى من عمل سابق، تفصل بين الاثنين. غير أن النسخة السابقة دُرست على نطاق صغير فقط. الورقة الجديدة توسّع نطاقها: وحدات ذاكرة يصل حجمها إلى 6.9 مليار معلمة، مُدرَّبة مسبقًا على 300 مليار رمز، ملحقة بنماذج أساسية تتراوح من 410 ملايين إلى 14 مليار معلمة.
نموذج بحجم 410 ملايين معلمة مع ترقية ذاكرة يتفوق على نموذج بحجم 12 مليار معلمة
النتيجة الرئيسية هي إقران قاتل العمالقة. على 17 معيارًا، ترفع وحدة ذاكرة عامة بحجم 6.9 مليار معلمة ملحقة بـ Pythia-410M متوسط درجته من 29.86 إلى 37.34. أما Pythia-12B، النموذج الأكبر بكثير، فيبلغ متوسطه 37.24. ويتقدم نموذج الـ 410 ملايين المزود بالذاكرة بإجمالي معلمات يبلغ نحو 7.3 مليار مقابل 12 مليارًا لـ Pythia-12B، وهو فارق تصفه الورقة بأنه معلمات أقل بنسبة 39%.
الفارق هو 0.10 نقطة، وهو ليس رقمًا ضئيلًا على متوسط 17 معيارًا، والعبرة تقع على جانب التكلفة: فاتورة المعلمات الإجمالية الأصغر تشتري درجات مساوية أو أفضل.
يتكرر النمط مع عائلة مختلفة. بالنسبة لنماذج Qwen3 Base التي تتراوح من 0.6 مليار إلى 14 مليار معلمة، حسّنت ذاكرات مجالية بحجم 1.7 مليار معلمة متوسط الدرجات عبر المجالات الثلاثة بأكثر من 9 نقاط على كل مقياس تم اختباره. مهما كان حجم النموذج الأساسي، كان شراء الذاكرة أفضل عائدًا من شراء المعلمات.
جدار الاسترجاع
يتوقف توسيع الذاكرة عن كونه مسألة معلمات خالصة بمجرد أن تصل عملية التدريب المسبق إلى 300 مليار رمز. يكتب المؤلفون أن التكلفة المشتركة للفهرسة والبحث تجعل خط معالجة Faiss القياسي غير عملي عند هذا المقياس من البيانات. الحل الذي يقدمونه هو خط معالجة موزع لفهرسة واسترجاع Faiss، مقترنًا بتحميل متفرق وعلى دفعات لتوزيعات kNN.
تفصيل البنية التحتية هذا يستحق التوضيح لأنه الثمن الحقيقي لهذه البنية المعمارية. وحدة الذاكرة لا تحسّن النموذج إلا إذا استطاع الاسترجاع مواكبتها. أي فريق يريد إعادة إنتاج النتائج، أو البناء عليها، يرث هذا التحدي الهندسي بدلًا من مسار بسيط يتمثل في تنزيل مزيد من المعلمات.
الأرقام في مكان واحد
إليك المقارنة الأساسية التي تعتمد عليها الورقة:
| الإعداد | متوسط الدرجات (17 معيارًا) | إجمالي المعلمات |
|---|---|---|
| Pythia-410M وحده | 29.86 | 0.41B |
| Pythia-410M + ذاكرة 6.9B | 37.34 | ~7.3B |
| Pythia-12B | 37.24 | 12B |
رقم ~7.3B هو ناتج حسابي من أرقام الورقة نفسها: 0.41B للنموذج الأساسي زائد 6.9B للذاكرة، وهذا هو السبب تحديدًا الذي يجعل الورقة قادرة على الادعاء بمعلمات أقل بنسبة 39% مقارنة بـ 12B.
ما يعنيه ذلك لميزانيات التوسيع
الادعاء الأوسع معماري: لا ينبغي للذاكرة والاستدلال أن يتنافسا على المعلمات نفسها. إذا أمكن تدريب ذاكرة كبيرة مسبقًا مرة واحدة وإعادة استخدامها عبر نماذج أساسية أصغر، فإن تحسين نموذج يصبح مسألة ترقية للذاكرة بدلًا من إعادة بناء الحزمة بأكملها. أرقام Qwen3 تدعم هذا التفسير، إذ حسّنت ذاكرات بحجم 1.7 مليار معلمة كل نموذج أساسي أُرفقت به.
الأسئلة المفتوحة أكثر من الإجابات. تتوقف وحدات الذاكرة عند 6.9 مليار معلمة وتتوقف عملية التدريب المسبق عند 300 مليار رمز، لذا فإن ما إذا كانت المقايضة ستستمر في تفضيل الذاكرة بعد تلك الحدود أمر غير مُختبر. الدرجات هي متوسطات عبر 17 معيارًا، وهو ما قد يخفي الأماكن التي تساعد فيها الذاكرة والأماكن التي لا تساعد فيها. كما يحمل النموذج المزود بذاكرة بنية تحتية للاسترجاع لا تلتقطها أعداد المعلمات، وهي تكلفة نشر لا تظهر إلا في الإنتاج.
نُشرت الورقة على arXiv في 30 يوليو، وحظيت صفحة مشروعها بـ 48 صوتًا مؤيدًا على HuggingFace، وهي إشارة مجتمعية متواضعة على أن مجتمع التوسيع قد انتبه. لا شيء من هذا ينهي توسيع النموذج الأساسي. إنه يمنح المختبرات مقبض تحكم ثانيًا، وتشير أرقام الورقة إلى أن هذا المقبض كان مُقوَّمًا بأقل من قيمته.
- المصدر : Memory Decoder: a 6.9B bolt-on memory makes a 410M model beat Pythia-12B — 2026-07-30
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.