الاستدلال طويل الأفق
إطار عمل جديد يساعد وكلاء الذكاء الاصطناعي على تذكر ما فعلوه قبل خمس دقائق
PRO-LONG هو إطار عمل بسيط يساعد وكلاء نماذج اللغات الكبيرة على الاحتفاظ بالمعلومات واسترجاعها عبر تسلسلات طويلة من الإجراءات. على معيار ARC-AGI-3، حسّن متوسط معدلات النجاح بمقدار 18 نقطة مئوية عبر النماذج الرائدة مع استخدام أقل بمقدار 4.2 إلى 5.8 مرات من الرموز المميزة مقارنة بالأدوات الحالية. مع نموذج Fable 5، حقق 97.4% best@2 بتكلفة استدلال إجمالية قدرها 1,750 دولارًا.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-24 · قراءة 4 دقائق

الطريقة القياسية لبناء وكيل ذكاء اصطناعي هي إعطاؤه موجهًا، ومجموعة أدوات، ونصًا جاريًا لكل ما فعله حتى الآن. ينمو هذا النص مع كل خطوة، وفي النهاية إما أن ينسى النموذج ما قرأه في البداية أو يهدر الرموز المميزة بإعادة قراءة كل شيء. إنها مشكلة يكشف عنها معيار ARC-AGI-3 بلا رحمة: النماذج التي تتفوق في الألغاز المنعزلة تنهار عندما تتسلسل الألغاز معًا عبر عشرات الخطوات.
جدار السياق
تتعامل الأدوات الحالية للوكلاء مع هذا عن طريق ضغط أو تقليم التاريخ. تلخيص الجولات الأقدم. إسقاط تلك التي تبدو غير ذات صلة. المشكلة هي أن التفصيل الذي يبدو عديم الفائدة في الخطوة 12 يمكن أن يكون حاسمًا في الخطوة 47، وبمجرد أن يختفي لا يمكن للوكيل استعادته. المفاضلة مدمجة: احتفظ بسياق أكبر وسيصبح الاسترجاع مكلفًا؛ احتفظ بكمية أقل وسيعمل الوكيل أعمى.
يأخذ PRO-LONG، المقدم في ورقة أولية على arXiv في يوليو 2026، نهجًا مختلفًا. بدلاً من تحديد ما يجب الاحتفاظ به، يحتفظ بكل شيء، لكنه ينظم السجل كسجل تفاعل قابل للبحث ويعتمد على نموذج توليد الكود للاستعلام عنه برمجيًا. الفكرة هي أن التحسينات الأخيرة في وكلاء الكود (النماذج التي تكتب وتنفذ كودًا لحل المشكلات) تجعل خطوة البحث رخيصة بما يكفي بحيث لا تحتاج إلى تقليم التاريخ على الإطلاق.
كيف يعمل

لا يغير الإطار النموذج الأساسي للغة الكبيرة. بل يغلّفه بجزأين: مسجل منظم يكتب كل ملاحظة وإجراء في مخزن منظم يشبه JSON، ووحدة استرجاع، عندما يحتاج الوكيل إلى الرجوع إلى سياق سابق، تولد مقتطف Python لتصفية السجل المخزن أو ضمه أو تجميعه. نظرًا لأن السجل كامل وقابل للقراءة آليًا، يمكن أن يكون الاسترجاع دقيقًا، يطلب الوكيل "حالة الشبكة الثالثة من اللغز الذي كنت أحله قبل خطوتين" ويحصل بالضبط على ذلك، وليس ملخصًا غامضًا.
اختبر المؤلفون الإعداد على مجموعة الألعاب الكاملة لـ ARC-AGI-3 العامة، والتي تدير 200 لغز تدريبي تتطلب استخراج الأنماط، واستقراء القواعد، وتحويل متعدد الخطوات. قارنوا وكيل ترميز يعمل مع وبدون PRO-LONG عبر أربع عائلات من النماذج الرائدة: GPT-4o، Claude 4 Sonnet، Gemini 2.5 Pro، وFable 5 (إصدار نموذج من Anthropic لم يتم تفصيله علنًا بعد وقت الكتابة).
الأرقام
متوسط التحسن كان 18.0 نقطة مئوية في pass@1 عبر النماذج. أفضل نتيجة فردية جاءت مع Fable 5: درجة best@2 بلغت 97.4%، تم تحقيقها بتكلفة استدلال إجمالية قدرها 1,750 دولارًا. مقابل الأدوات المتخصصة الحديثة المعدلة يدويًا لـ ARC، طابق PRO-LONG أو تجاوز pass@1 الخاص بهم (حتى 76.1%) مع استهلاك أقل بمقدار 4.2 إلى 5.8 مرات من الرموز المميزة لكل تشغيل.
تلك التوفيرات في الرموز المميزة مهمة لأن تكلفة الرمز المميز هي السقف العملي لطول التشغيل الذي يمكن للمختبر تحمله. إذا كانت أداة ما تحرق 50 دولارًا لكل حلقة على نموذج رائد، فإن الاختبار المنهجي يظل بعيد المنال. تأتي كفاءة PRO-LONG من تفريغ عمل الاسترجاع إلى استدعاء رخيص لتوليد الكود بدلاً من تمرير التاريخ بأكمله مرة أخرى إلى نموذج الاستدلال المكلف.
ماذا يعني هذا لتصميم الوكيل
PRO-LONG ليس نموذجًا جديدًا. إنها خدعة سقالة تستغل حقيقة أن نماذج البرمجة أصبحت الآن جيدة بما يكفي لكتابة استعلام يشبه SQL على ذاكرتها الخاصة. المغزى هو أن الاختناق في الوكلاء طويلي الأفق قد لا يكون قدرة النموذج بل استراتيجية إدارة السياق.
وهذا يتماشى مع النتائج في أماكن أخرى. تحليل منفصل في يونيو 2026 قدر أن تاريخ التفاعل الخام هو القيد الأساسي لوكلاء أعمال المكاتب، مهمة جدول البيانات التي تستغرق 15 خطوة من المساعد تنهار إذا لم يتمكن من تذكر رؤوس الأعمدة التي حللها في الخطوة 2. الحالة المنظمة بالإضافة إلى سير عمل المدقق المقترح في ذلك التحليل يشارك تشخيص PRO-LONG: لا تدع التاريخ يتلاشى بشكل سلبي؛ اجعله قابلاً للاستعلام.
تحذيرات
نتيجة PRO-LONG قوية على ARC-AGI-3، وهو معيار ألغاز. ما إذا كان نفس النهج يصمد في توليد الكود المفتوح، أو التنقل عبر الويب متعدد الجولات، أو تحليل المستندات الطويلة هو سؤال مفتوح. أصدر المؤلفون الكود والسجلات مع الورقة، مما يجب أن يساعد الآخرين على اختبار ادعاء قابلية النقل بسرعة.
تحذير ثانٍ هو أن الإطار يعتمد على قدرة النموذج على توليد الكود. على النماذج الضعيفة في كتابة Python صحيح، نماذج الوزن المفتوح الأصغر على سبيل المثال، قد تفشل خطوة الاسترجاع نفسها. اختبرت الورقة نماذج من الفئة الرائدة فقط.
ومع ذلك، فإن التأطير استفزازي. إذا كان أرخص طريق لوكلاء أفضل هو إدارة ذاكرة أفضل بدلاً من نماذج أكبر، فإن الكثير من الاتجاه الحالي للمجال (تدريب أطول، توسيع نطاق أكثر) قد يكون محسنًا للشيء الخطأ. PRO-LONG هو نقطة بيانات واحدة في تلك الحجة، وهي قوية.
- المصدر : A new framework helps AI agents remember what they did five minutes ago — 2026-07-22
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.