الذكاء الاصطناعي

لماذا يضيع نموذج الذكاء الاصطناعي الرموز في سلسلة أفكاره، وكيف يصلح التوقف الأمثل ذلك

يقترح باحثو MIT أداة OS-Pruner، وهي إضافة إضافية توقف تفكير سلسلة الأفكار ديناميكيًا عندما لا تستحق التكلفة الحسابية الرموز الإضافية. تظهر الاختبارات تقليل الطول بنسبة 20-60% مع تضحية ضئيلة بالدقة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-29 · قراءة 4 دقائق

لماذا يضيع نموذج الذكاء الاصطناعي الرموز في سلسلة أفكاره، وكيف يصلح التوقف الأمثل ذلك
المصادر : OS-Pruner: Prun…

في كل مرة يحل نموذج لغوي كبير مسألة رياضية أو يكتب كودًا، ينتج سلسلة من الأفكار، سلسلة من خطوات التفكير التي قد تمتد لآلاف الرموز. لكن ليست كل هذه الرموز تخدم الإجابة النهائية. النماذج عادة ما تُفكر بشكل مفرط: إعادة صياغة الاستنتاجات، التحقق من نقاط سبق حلها، أو ملاحقة طرق مسدودة. التكلفة حقيقية: زمن استجابة أعلى، فواتير استدلال أعلى، وأحيانًا دقة أقل.

التفكير المفرط كضريبة حسابية

الظاهرة موثقة جيدًا. DeepSeek-R1، الذي صُمم لتوسيع نطاق زمن الحساب عبر مسارات تفكير طويلة، غالبًا ما يستمر في التوليد بعد فك تشفير الحل الصحيح. يظهر السلوك نفسه في GPT-OSS-20B والنماذج المقطرة مثل DeepSeek-R1-Distill-Qwen-7B. أظهرت دراسات O1-Pruner و DRPO أن ما يصل إلى 60% من الرموز المولدة يمكن أن تكون زائدة عن الحاجة.

المحاولات السابقة لتقليم هذا الهدر تنقسم إلى ثلاث فئات. الطرق من جانب النموذج مثل O1-Pruner و DRPO تعيد تدريب النموذج الأساسي لإنتاج مسارات أقصر، فعالة لكنها باهظة الثمن، وتخاطر بتدهور الأداء في المهام خارج التوزيع. طرق التحكم في الميزانية مثل فرض الميزانية في s1 تفرض حدًا ثابتًا للرموز خارجيًا، متجاهلة أن بعض المشكلات تحتاج فعليًا إلى تفكير أكثر. والمصنفات المبكرة القائمة على التدريب مثل HALT-CoT و Answer Convergence و FlashThink تعالج التوقف كحد ثقة، مما يفوت الطبيعة التسلسلية للقرار.

OS-Pruner يعيد صياغة المشكلة

يجادل فريق MIT وراء OS-Pruner بأن الصياغة القياسية خاطئة. من ورقتهم: "نحن نجادل بأن تقليم CoT هو بطبيعته مشكلة قرار تسلسلي." رؤيتهم الأساسية هي أنه بعد كل خطوة تفكير، يواجه النظام اختيارًا بين إجراءين: التوقف الآن وإنتاج إجابة نهائية، أو الاستمرار في التفكير ودفع المزيد من الرموز أملًا في التحسين. هذه مسألة توقف أمثل، وليست مسألة تصنيف.

يتعلم الإطار رأس سياسة خفيف الوزن، مجرد طبقة خطية مع ضبط دقيق للطبقتين المحولتين الأخيرتين، الذي يربط كل بادئة تفكير باحتمالية التوقف. وظيفة المكافأة تقايض صراحة بين الدقة والطول: "r(y≤i|x) = A(y≤i|x) - λL(y≤i)". تتحكم قيمة عددية واحدة λ في عدوانية التقليم، مما يتيح للمستخدمين ضبط نقطة التشغيل المطلوبة على حدود الدقة-الكفاءة.

لماذا تفشل طرق التصنيف

توفر الورقة أسبابًا نظرية وتجريبية. يثبت المؤلفون نظرية 1: التصنيف القائم على الحدود يمكن أن يفقد قيمة كبيرة بشكل تعسفي مقارنة بالتوقف الأمثل. الحدس هو أن سلسلتي تفكير جزئيتين مع نفس الصحة المقدرة يمكن أن يكون لهما قيم استمرارية مختلفة جدًا، قد تكون إحداهما على وشك اختراق، والأخرى عالقة في حلقة. المصنف يعاملهما بشكل متطابق؛ التوقف الأمثل يرى الفرق.

على معايير عبر DeepSeek-R1-Distill-Qwen-7B و GPT-OSS-20B و DRPO-7B، حيث الأخير مُحسَّن بالفعل للإيجاز عبر ضغط من جانب النموذج، يتفوق OS-Pruner باستمرار على الطرق الأساسية في درجة الكفاءة الدقيقة (AES). أكبر المكاسب تكون في المشكلات الأسهل حيث يكون التفكير المفرط أكثر انتشارًا: تقليل الطول بنسبة 59.3% على GSM8K، و 52.8% على MATH-500، مع تغييرات في الدقة بنسبة -0.7% و +2.7% على التوالي.

كفاءة التدريب كأساس تصميمي

نظرًا لأن النموذج الأساسي مجمد، يمكن لـ OS-Pruner حساب المكافآت مسبقًا عن طريق إنهاء التفكير عند كل حد فقرة والتحقق مما إذا كانت الإجابة صحيحة. لا حاجة لعمليات دفع باهظة الثمن أثناء التدريب. رأس السياسة يعالج كل بادئة بشكل متوازٍ أثناء الاستدلال، ويتم استدعاؤه فقط عند حدود الفقرات، وهو خيار تصميم متوافق مع أطر الخدمة الحديثة مثل vLLM.

الجدول التدريبي التدريجي يعالج تحديًا عمليًا: لقيم λ المنخفضة، يعلق التدريب الساذج في حد أدنى محلي تافه حيث لا تتوقف السياسة أبدًا. البدء بقيمة λ عالية وتبريدها دوريًا ينتج حدود دقة-طول باريتو نظيفة.

تأثيرات على النشر

الطبيعة الإضافية لـ OS-Pruner تعني أنه يمكن إضافته إلى أي نموذج تفكير مجمد، حتى لو كان قد تم ضغطه بالفعل. اختبر المؤلفون على DRPO-7B، وهو نموذج مدرب صراحة لكفاءة الطول، وسجلوا تحسنًا متوسطًا بنسبة 20% في AES، مع 17% تحديدًا على AIME.

للممارسين الذين يديرون خطوط أنابيب استدلال عالية الحجم، توفير الرموز ليس هامشيًا. تقليل بنسبة 50% في الرموز المولدة بدقة مماثلة تقريبًا يخفض تكاليف البنية التحتية وزمن الاستجابة إلى النصف. معلمة λ توفر رافعة معايرة: اجعلها عالية للتطبيقات الحساسة لزمن الاستجابة، ومنخفضة لمتطلبات الدقة عالية المخاطر.

القيود والأسئلة المفتوحة

يركز العمل الحالي على معايير التفكير الرياضي. يعترف المؤلفون أن التوسع إلى البرمجة والتفكير العلمي والنماذج الحدودية فوق 20 مليار معلمة يظل عملًا مستقبليًا. تكشف دراسة الاجتثاث أيضًا قيدًا رئيسيًا: النماذج ذات ضعف اتباع التعليمات قد تستمر في التفكير في قسم "الإجابة" بعد التوقف القسري، مما يقوض التقليم. GPT-OSS-20B يتعامل مع هذا جيدًا؛ DeepSeek-R1-Distill-Qwen-7B لا يفعل.

مع ذلك، يقدم OS-Pruner حجة مقنعة بأن عنوان الورقة، "تقليم سلاسل أفكار نماذج التفكير عبر التوقف الأمثل"، هو أكثر من مجرد مساهمة منهجية. إنها أداة عملية لعصر حيث كل رمز يحسب.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.