أبحاث الذكاء الاصطناعي

سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال

يجادل بحث أولي جديد بأن التوسع التسلسلي في زمن الاختبار غالبًا ما يصطدم بعوائد متناقصة أو حتى سلبية. يسترجع ThinkRetrieve أمثلة محلولة في منتصف الاستدلال ويحقنها في المسار، محققًا تحسينات نسبية تصل إلى 60% على AIME 2025 عبر خمسة نماذج استدلال صغيرة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-18 · قراءة 4 دقائق

سلاسل التفكير الأطول تصطدم بجدار.. ThinkRetrieve تحقن الحل في منتصف الاستدلال

منذ فترة، كانت الطريقة المعيارية لجعل نموذج الاستدلال أكثر ذكاءً هي تركه يفكر لفترة أطول: إنفاق المزيد من الحوسبة في زمن الاستدلال، وتوليد سلسلة تفكير أطول، ومن المفترض أن تتحسن الدقة تبعًا لذلك. يبدأ ThinkRetrieve، وهو بحث أولي نُشر على arXiv في 11 أغسطس 2026، من الملاحظة المعاكسة. فبحسب ما يجادل فيه البحث، تُظهر الدراسات الحديثة أن التوسع التسلسلي في زمن الاختبار كثيرًا ما يُنتج عوائد متناقصة أو حتى سلبية، لأن المسارات الأطول تراكم عدم اليقين، وتضخّم أخطاءها الذاتية، وتنحرف عن المشكلة الأصلية.

حيث ينفد الطريق أمام التوسع التسلسلي

من السهل تفويت نمط الفشل هذا لأن الرموز (tokens) تستمر في التدفق. يكتب النموذج ويكتب، لكن المسار يتوقف عن تعقب السؤال. الأخطاء المبكرة تتضخم مع نمو السلسلة، ويشرد الاستدلال، وتواصل فاتورة الحوسبة الارتفاع بينما تستقر الدقة أو تتراجع. ردّ ThinkRetrieve هو التوقف عن معاملة المسار بوصفه مونولوجًا مغلقًا.

يربط الإطار النموذج الاستدلالي بمجموعة نصوص خارجية من المسائل المحلولة، كلٌّ منها مقترنة بحلٍّ خطوة بخطوة. وفي كل خطوة وسيطة، يسترجع الإطار الأمثلة الأكثر صلة من تلك المجموعة ويحقنها مباشرة في مسار التفكير. يُعرَض على النموذج إجراءات محلولة، في منتصف تفكيره، تُوضح كيفية الاستدلال. الاسترجاع التقليدي يؤسس الإجابات على الحقائق؛ أما ThinkRetrieve فيوجّه إجراء الاستدلال نفسه.

ما يورده البحث الأولي

تغطي التجارب خمسة نماذج استدلال في نطاق من 1.5B إلى 8B معاملًا، اختُبرت على GSM-8K وMATH-500 وAIME 2025 وSciQ. يحسّن ThinkRetrieve الدقة مقارنة بالتوسع القياسي في زمن الاختبار عبر المجموعات الأربع جميعها، ويأتي أكبر تحسن نسبي، يصل إلى 60%، على AIME 2025.

البحث الأولي في لمحة
تاريخ التقديمarXiv، 11 أغسطس 2026
النماذج المختبرةخمسة نماذج استدلال، من 1.5B إلى 8B معاملًا
المعاييرGSM-8K وMATH-500 وAIME 2025 وSciQ
خط الأساسالتوسع القياسي في زمن الاختبار
النتيجة الرئيسيةتحسن نسبي يصل إلى 60% على AIME 2025

لا يفصّل الملخص أرقام كل معيار على حدة، ولا تكلفة الحوسبة لخطوة الاسترجاع، ولا مصدر مجموعة الأمثلة. كما يُورَد رقم 60% بوصفه سقفًا، أي أفضل تحسن وليس المتوسط. هذه التفاصيل مهمة، وهي في الورقة الكاملة لا في الملخص.

ضمن صيف من الاستدلال الأكثر ذكاءً

يصل ThinkRetrieve في فترة مزدحمة من الأبحاث الأولية لعام 2026، يتساءل كلٌّ منها عن الافتراض نفسه من اتجاه مختلف. نموذج Penelope، المُقدَّم في 28 يوليو، يُبقي معظم حسابات الاستدلال خارج الرموز المرئية: فهو يقيّم بادئة وحدة فك الترميز السفلى مرة واحدة لبناء ذاكرة حدية مشروطة بالمسألة، ثم ينقّحها عبر تكرار موضعي. أما PoTRE، الصادر في 22 يوليو، فيقسّم الاستدلال عبر أربعة وكلاء: وكيل تحسين عدائي، ووكيل تخطيط هرمي، ووكيل بحث طيفي، ووكيل سلسلة مباشر، ويوفّق مخرجاتهم بطبقة تجميع متكيفة مع المهمة. أما بحث أولي ثالث من 22 يوليو فيغلّف نماذج استدلال صغيرة مكمّمة (quantized) بمراقب إحصائي على شكل CUSUM يراقب المسار بحثًا عن التدهور، وعند إطلاق الإنذار يعيد التوليد إلى نقطة تراجع محسوبة.

لا تتشارك هذه الأبحاث في آلية واحدة، لكنها تتشارك في التشخيص: حوسبة زمن الاستدلال تُنفق دون إشراف، والحل هو تخصيصها بذكاء أكبر لا بكميات أكبر. حتى تصميم المكافآت يُعاد النظر فيه. ففي بحث صادر في 24 يونيو، يجادل فريق Qwen بأن التحقق، لا توليد المرشحات، هو الآن المشكلة الأصعب لوكلاء البرمجة، لأن كل مُتحقق (verifier) ليس سوى وكيل عن النية البشرية.

الأسئلة المفتوحة

ThinkRetrieve بحث أولي، مع التحفظات المعتادة. جرت التجارب على نماذج تتراوح بين 1.5B و8B معاملًا؛ ولا يَعِد الملخص بالسلوك نفسه على نطاق النماذج الحدودية (frontier). كما أن الإطار لا يعمل إلا حيث توجد بالفعل مجموعة نصوص عالية الجودة من مسائل محلولة بحلول خطوة بخطوة. رياضيات المسابقات لديها مثل هذه المجموعات، أما معظم المهام الواقعية فلا، وجودة التوجيه المُحقون ترث جودة المجموعة.

تعامل مع رقم 60% بقدر من الحذر يليق ببحث أولي. فالاتجاه هو القصة. الافتراض القائل إن التفكير الأكثر هو الأفضل دائمًا يُختبر من عدة اتجاهات في آن واحد، وإجابة ThinkRetrieve هي أن النموذج لا ينبغي أن يضطر إلى الاستدلال وحده.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.