التوسع في وقت الاختبار
توجيه CoBa يطابق تصويت أفضل-من-16 برموز أقل بنسبة 58.9%
سياسة التوجيه المتوازن حسابيًا CoBa، الواردة في ورقة بحثية جديدة على arXiv، تحقق نتائج مطابقة لتصويت الأغلبية أفضل-من-16 بفارق 0.01 نقطة مع خفض الرموز المرجحة بالمعاملات بنسبة 58.9%. وفي 3,129 تقييمًا عبر MATH-500 وAIME وAMC، تتفوق أيضًا بوضوح على فك الترميز بعينة واحدة، رغم بقاء تفوق طفيف لخيار أفضل-من-16 عندما تكون الميزانية غير محدودة.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-19 · قراءة 5 دقائق

يمتلك التوسع في وقت الاختبار نمطًا افتراضيًا: إنفاق المزيد من القدرة الحاسوبية في الاستدلال والثقة في أن الإجابة ستتحسن. توليد المزيد من الحلول، أو تمديد مسار التفكير، أو جلب مُقيِّم أقوى. ورقة بحثية قُدِّمت إلى arXiv في 7 أغسطس 2026 ترى أن هذه الأدوات الثلاث تتنافس فيما بينها، وأن السؤال المثير للاهتمام ليس مقدار القدرة الحاسوبية التي ينفقها النظام، بل كيف يقرر أين تذهب الوحدة التالية. الإجابة المقترحة هي CoBa، وهي سياسة توجيه متوازن حسابيًا، ونتيجتها الرئيسية صريحة: دقة مطابقة بتكلفة رموز تبلغ نصف التكلفة تقريبًا.
الورقة البحثية، بعنوان "CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing"، تعيد صياغة الاستدلال في وقت الاختبار كمسألة تخصيص للقدرة الحاسوبية. في كل خطوة، يجب على النظام الاختيار بين التوليد أو التحقق أو التوقف. تميل الاستراتيجيات الحالية إلى الالتزام بمحور واحد وضخ القدرة الحاسوبية في مرحلة واحدة. تبدأ CoBa من ملاحظة معاكسة: في ظل ميزانية ثابتة، يؤدي الإنفاق على محور واحد إلى تجويع المحاور الأخرى.
لماذا يصطدم التوسع أحادي المحور بجدار
لا تُعد CoBa العمل الوحيد الأخير الذي يشكك في منطق "أنفق أكثر". ورقة ThinkRetrieve المصاحبة على arXiv، بتاريخ 11 أغسطس 2026، تشير إلى أن التوسع المتسلسل في وقت الاختبار غالبًا ما يحقق عوائد متناقصة أو حتى سلبية، إذ تتراكم حالة عدم اليقين في مسارات التفكير الأطول، وتتضاعف الأخطاء، ويحدث انحراف عن المسألة الأصلية. وفي الفترة نفسها، يرى بحث "The Verification Horizon" أن الافتراض القديم القائل إن التحقق أسهل من الإنتاج قد انقلب بالنسبة لوكلاء البرمجة: ففحص مرشح بشكل موثوق أصبح الآن هو المسألة الأصعب، وكل مُتحقِّق ليس سوى وكيل عن النية البشرية.
تدفع الورقتان نحو فرضية CoBa: المكاسب الناتجة عن تخصيص أذكى قد تفوق المكاسب الناتجة عن المزيد من القدرة الحاسوبية. إطار PoTRE الصادر في يوليو 2026 يحقق أداءً محسّنًا في الاستدلال مع عدد مماثل أو أقل من رموز الاستدلال مقارنة بالخطوط الأساسية المتجانسة الموسّعة بكثافة. أما Penelope، الذي قُدِّم في 28 يوليو 2026، فيُحدِّد الحوسبة المتكررة محليًا لتجنب مسارات التفكير المرئية الطويلة. ويظهر التحول نفسه في جانب الاستدلال، حيث تتعامل أعمال مثل DSpark مع التسريع كمسألة جدولة وتخصيص موارد وليس مجرد تحسين للنموذج. يتقارب المجال نحو التخصيص بدلًا من القوة الغاشمة.
كيف توجّه CoBa القدرة الحاسوبية
تعمل CoBa عبر مستويين. أولًا تولّد مجموعة صغيرة من المرشحين، وتطبّق تحققًا رخيصًا على جميعهم، ثم توجّه المرشحين غير المؤكدين أو ذوي القيمة العالية إلى تحقق أقوى. تعمل المُتحقِّقات الضعيفة على استبعاد الإخفاقات الواضحة بتكلفة منخفضة؛ أما التحقق القوي فيُنفق فقط حيث يمكنه تغيير النتيجة.
تم تقييم النظام على 3,129 تقييمًا لمولّد أمثلة، تغطي MATH-500 وAIME 2024 و2025 وAMC 2023 والاستدلال الرمزي الإجرائي. تشمل هذه المعايير الرياضيات التنافسية والمهام الرمزية المنظمة، وهي المجال الذي تُختبر فيه عادةً ادعاءات التوسع في وقت الاختبار.
أرقام الكفاءة المهمة
يصل CoBa-Routed-Strong إلى دقة كلية تبلغ 85.13%، مطابقًا إحصائيًا لوكيل التصويت المرجح بالتقييم الذاتي عند 85.20% مع استخدام رموز مرجحة بالمعاملات أقل بنسبة 49.1%. أما أمام القوة الغاشمة فالنتيجة أوضح: يحقق مطابقة لتصويت الأغلبية أفضل-من-16 بفارق 0.01 نقطة دقة كلية مع استخدام رموز مرجحة بالمعاملات أقل بنسبة 58.9%، رغم أن الاختبارات المزدوجة تُبقي تفوقًا طفيفًا لخيار أفضل-من-16 بتكلفة أعلى بكثير.
تحسب الرموز المرجحة بالمعاملات عمل كل رمز وفقًا لحجم النموذج الذي أنتجه، لذا تغطي المقارنة طول المخرجات وحجم النموذج معًا. الحساب يستحق أن يُجرى: رموز أقل بنسبة 58.9% تعني أن CoBa تعمل بتكلفة تبلغ نحو 41% من تكلفة أفضل-من-16، أي أرخص بنحو 2.4 مرة. يستهلك وكيل التقييم الذاتي ما يقارب ضعف ميزانية CoBa.
تؤكد اختبارات bootstrap المزدوجة مكاسب كبيرة مقارنة بفك الترميز بعينة واحدة. لا توفر CoBa الرموز فحسب مع الحفاظ على الجودة؛ بل تتفوق على الخط الأساسي الأرخص وتطابق الخطوط الأساسية المكلفة.
| الطريقة | الدقة الكلية | التكلفة مقابل CoBa |
|---|---|---|
| CoBa-Routed-Strong | 85.13% | خط أساس |
| وكيل التصويت المرجح بالتقييم الذاتي | 85.20% | ~2x رموز CoBa |
| تصويت الأغلبية أفضل-من-16 | ضمن 0.01 نقطة من CoBa | ~2.4x رموز CoBa |
| فك الترميز بعينة واحدة | أقل بشكل ملحوظ (اختبارات مزدوجة) | الأدنى |
| أوراكل المجموعة | أعلى؛ لم يُبلَغ | حد أعلى |
أين لا تزال CoBa قاصرة
الورقة صريحة بشأن القيود. يحتفظ خيار أفضل-من-16 بتفوق صغير لكنه معنوي في الاختبارات المزدوجة: عندما تكون كل نقطة دقة مهمة وتتوفر الميزانية، لا يزال تصويت القوة الغاشمة يتقدم قليلًا. كما يبقى أوراكل المجموعة، الذي يختار دائمًا أفضل مرشح على الطاولة، بعيد المنال. تُوصف الفجوة إلى الأوراكل بأنها هامش لتوجيه أدق، وهو ما يعني أن طبقة التحقق الرخيصة ما تزال تخطئ في تصنيف مرشحين كان من الممكن أن تلتقطهم جولة تحقق أقوى.
تعتمد النتائج أيضًا على عائلة معايير محددة. تكافئ الرياضيات التنافسية والاستدلال الرمزي الإجابات القابلة للتحقق والمحددة جيدًا. أما ما إذا كانت اقتصاديات التوجيه نفسها تصمد في المهام الوكيلية المفتوحة أو الإبداعية فلم تثبتها هذه الورقة.
ماذا يعني ذلك للأنظمة المحلية ومحدودة الميزانية
تختتم الورقة بالآثار الأكثر أهمية للنشر على الأجهزة وفي البيئات المقيدة التكلفة: بالنسبة لأنظمة الاستدلال المحلية، يتحول التوسع في وقت الاختبار إلى سؤال حول أين تكون الحوسبة التالية أكثر قيمة. عندما يحمل كل رمز ثمنًا، فإن سياسة توجّه بدلًا من أن تولّد عينات ليست مجرد ترف. إنها الفرق بين تقنية تناسب الميزانية وتقنية لا تناسبها.
يكشف هذا التأطير أيضًا الافتراض الذي تستند إليه CoBa: التحقق الرخيص يلتقط معظم الإخفاقات. تحذير ورقة The Verification Horizon ينطبق هنا أيضًا. تقلل سياسات التوجيه من تكلفة التحقق، لكنها لا تلغي حقيقة أن المُتحقِّق مجرد وكيل. مكسب الكفاءة حقيقي. الخطر المعرفي لا يختفي.
- المصدر : CoBa routing matches best-of-16 voting with 58.9% fewer tokens — 2026-08-07
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.