التقنيات العميقة

التوجيه المشترك عبر الطبقات يعطي الانتباه المتناثر تسريعًا بمقدار 7 أضعاف دون التأثير على الجودة

تستخدم CLSA تمريرة توجيه واحدة لكل تسلسل بدلاً من تمريرة واحدة لكل طبقة، مما يقلل حمل KV-cache مع الحفاظ على انتقائية مستوى الرمز. تُظهر المقاييس تحسنًا في الإنتاجية بمقدار 17.1 ضعفًا في سياق 128 ألف رمز.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-26 · قراءة 5 دقائق

التوجيه المشترك عبر الطبقات يعطي الانتباه المتناثر تسريعًا بمقدار 7 أضعاف دون التأثير على الجودة
المصادر : CLSA: You Only …

الانتباه لا يزال عنق الزجاجة. كل رمز إضافي من السياق في محول يعني المزيد من المفاتيح والقيم لتخزينها والبحث فيها، وفك تشفير سلسلة تفكير طويلة يمكن أن يتعطل حتى على الأجهزة عالية الأداء. يحاول الانتباه المتناثر إصلاح ذلك بتجاهل الأجزاء غير ذات الصلة من الذاكرة المخبأة، لكن الإصلاح غالبًا ما يكلف الدقة (متناثر كتلة) أو السرعة (متناثر رمز، حيث اختيار الرموز الصحيحة لكل طبقة هو عنق الزجاجة الخاص بها).

ورقة بحثية جديدة، CLSA: You Only Index Once، تجادل بأن كلا المشكلتين لهما سبب جذري واحد: كل طبقة تدير توجيهها الخاص بشكل مستقل. يقترح المؤلفون مشاركة مؤشر التوجيه عبر الطبقات في بنية مشاركة ذاكرة التخزين المؤقت KV، بحيث يتم تشغيل عملية top-k المكلفة مرة واحدة وتُعاد استخدام النتيجة. تُبلغ التجارب عن تسريع فك التشفير بما يصل إلى 7.6 أضعاف وتحسين الإنتاجية الإجمالية بمقدار 17.1 ضعفًا عند 128 ألف رمز، مع دقة تطابق الانتباه الكامل على المعايير القياسية.

إنها حالة نادرة حيث يعمل الإصلاح المعماري على تحسين كل من الكفاءة وجودة النموذج في نفس الوقت، بدلاً من المقايضة بين أحدهما والآخر.

كيف يعمل CLSA

تبني الطريقة على بنى الانتباه المهجنة التي تشارك ذاكرات التخزين المؤقت KV عبر طبقات فك التشفير المتقاطعة، عائلة YOCO على سبيل المثال. في تلك النماذج، تُعاد استخدام ذاكرة التخزين المؤقت KV بالفعل، لكن كل طبقة فك تشفير متقاطعة لا تزال تدير توجيه top-k الخاص بها عبر ذاكرة التخزين المؤقت الكاملة. يضيف CLSA طبقة مفهرسة مشتركة واحدة: تحسب درجات الانتباه مرة واحدة، وتختار رموز top-k، وتمرر نفس المؤشر إلى كل طبقة لاحقة.

تستبدل تلك التمريرة الواحدة تمريرات التوجيه N، حيث N هو عدد طبقات فك التشفير المتقاطعة. يصبح التوجيه نفسه تكلفة ثابتة بدلاً من تكلفة خطية في عدد الطبقات، وهو أمر يزداد أهمية مع نمو النماذج بشكل أعمق وزيادة طول السياقات.

الحركة الأساسية هي الحفاظ على تناثر مستوى الرمز، الاختيار الدقيق الذي يجعل الدقة عالية، مع استهلاك العبء الإضافي الذي يجعله بطيئًا عادة. تتخطى طرق الكتلة المتناثرة صفحات الذاكرة بأكملها من أجل السرعة لكنها تفقد الرموز ذات الصلة داخل الكتل المتخطاة. تتجنب CLSA ذلك بالحفاظ على دقة كل رمز ودفع ثمنها مرة واحدة بالضبط.

Schéma : CLSA: Shared Routing Across Layers
تستخدم CLSA طبقة مفهرسة واحدة لحساب مؤشر توجيه top-k مشترك، والذي يحل محل تمريرات توجيه N المنفصلة عبر طبقات فك التشفير المتقاطعة، مما يحقق تسريع فك التشفير بما يصل إلى 7.6 أضعاف.

من أين تأتي السرعة

تقيس الورقة ثلاث مراحل استدلال: التعبئة المسبقة (معالجة المطالبة)، تخزين KV-cache (بصمة الذاكرة للمفاتيح والقيم المخزنة مؤقتًا)، وفك التشفير الذاتي (توليد الرموز واحدًا تلو الآخر). تتحسن الثلاثة في وقت واحد:

المقياسالتحسين مقابل الانتباه الكامل
سرعة فك التشفير (سياق 128 ألف)7.6x
الإنتاجية الإجمالية (سياق 128 ألف)17.1x
ذاكرة KV-cacheمتناسبة مع نسبة تناثر top-k (عادة 5، 20% من الكامل)

تأتي هذه الأرقام من نموذج بنافذة سياقية تبلغ 128 ألف رمز. تسريع فك التشفير وحده، 7.6x، يعني أن التوليد الذي يستغرق 8 ثوانٍ مع الانتباه الكامل ينتهي في ما يزيد قليلاً عن ثانية واحدة مع CLSA. مكاسب الإنتاجية أكبر لأن النموذج يمكنه تجميع المزيد من الطلبات مع تقليل بصمة الذاكرة.

الدقة ثابتة

على معيار RULER للسياق الطويل (المتوسط عبر خمسة قوالب تحفيز وأطوال متعددة)، تطابق CLSA الانتباه الكامل ضمن 0.5 نقطة. في مهام السياق القصير، MMLU، ARC-Challenge، HellaSwag، الفرق أقل من 0.3 نقطة. هذا يعتبر ضوضاء بشكل أساسي. على GSM8K (الاستدلال الرياضي) تتسع الفجوة إلى حوالي 1.2 نقطة، وهو ما يعزوه المؤلفون إلى حقيقة أن التحديدات الصغيرة للرموز يمكن أن تفوت أرقامًا حرجة في السلاسل الحسابية.

مع ذلك، المفاضلة غير عادية: طريقة تحقق تسريعًا بمقدار 7 أضعاف مع فقدان أقل من 1.5 نقطة في أي معيار نادرة بين مقترحات الانتباه المتناثر. طرق الكتلة المتناثرة تفقد عادة 3، 5 نقاط في نفس المهام لسرعة مماثلة.

ينبع استقرار الدقة من حقيقة أن مؤشر التوجيه يُحسب مرة واحدة باستخدام درجات الانتباه من طبقة المفهرسة، التي ترى نفس حالة الاستعلام والذاكرة المخبأة مثل كل طبقة أخرى. مجموعة top-k لطبقة واحدة هي وكيل قوي لمجموعة top-k لجميع الطبقات في بنية ذاكرة مخبأة مشتركة.

التكلفة: حدود التوافق

CLSA ليس بديلاً جاهزًا لأي محول. يتطلب بنية أساسية لمشاركة KV-cache (YOCO، أو النماذج المبنية بطبقات فك التشفير المتقاطعة) لتعمل. محول قياسي فقط لفك التشفير لا يشارك ذاكرات التخزين المؤقت عبر الطبقات لن يستفيد من التوجيه المشترك، لأن ذاكرة التخزين المؤقت KV لكل طبقة مختلفة والمؤشر سيشير إلى إدخالات قديمة.

الممارسون الذين يستخدمون فك التشفير التخميني للاستدلال بالسياق الطويل قد يجدون CLSA مكملاً، يمكن للنموذج الأولي استخدام نفس التوجيه المشترك للسرعة، بينما يعمل النموذج المستهدف بالانتباه الكامل للتحقق. لا تستكشف الورقة هذا المزيج، ولكن البنى متوافقة.

الحد الآخر هو عدد اختيارات top-k الثابتة. تستخدم الورقة k=512 رمزًا من أصل ذاكرة تخزين مؤقت 128 ألف، حوالي كثافة 0.4%. للمهام التي تتطلب انتباهًا كثيفًا جدًا، مثل فحص كل رمز من عقد مالي للتحقق من الامتثال، قد يفوت هذا التناثر العدواني التفاصيل حتى لو كان مؤشر التوجيه دقيقًا. يقترح المؤلفون أن طبقة المفهرسة يمكنها ضبط k ديناميكيًا، ولكن هذا يُترك كعمل مستقبلي.

ما يعنيه للاستدلال بالسياق الطويل

أقوى ادعاء في الورقة هو أن المفاضلة بين الكفاءة والدقة ليست حتمية، إنها نتاج للتوجيه المستقل لكل طبقة. تمريرة توجيه مشتركة واحدة تحل كلا الجانبين: تظل الدقة عالية لأن الاختيار على مستوى الرمز، وتتحسن السرعة لأن تكلفة التوجيه تُستهلك عبر الطبقات.

في سياق 128 ألف، مكسب الإنتاجية بمقدار 17x يعني أن وحدة معالجة رسومية واحدة يمكنها خدمة ما يقرب من 17x طلبًا متزامنًا للسياق الطويل أكثر من الانتباه الكامل. لمقدمي الاستدلال السحابي، هذا يقلل بشكل مباشر من تكلفة كل رمز. للأجهزة ذات النماذج مفتوحة الوزن، يقلل الفجوة في الذاكرة والكمون بين تشغيل المطالبات القصيرة والطويلة.

لا تزال هناك أسئلة مفتوحة: كيف يتصرف CLSA بعد 128 ألف (تختبر الورقة حتى هذه النقطة)؛ ما إذا كان اختيار k الديناميكي يمكنه سد الفجوة <1.5 نقطة في مهام الاستدلال الحسابي؛ ومدى قابلية الطريقة للتوسع لنماذج المعلمات 70B+ حيث يصبح مؤشر التوجيه نفسه بنية بيانات كبيرة. ولكن كحل لعنق الزجاجة المحدد الذي يجعل الاستدلال بالسياق الطويل مكلفًا، فإنه يعالج عنق الزجاجة المناسب بطريقة مبدئية.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.