بحث
فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي
SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-25 · قراءة 4 دقائق

التعلم المعزز لنماذج اللغة الكبيرة لديه بقعة عمياء. عندما يتخذ وكيل عشرين إجراءً ويتعلم فقط ما إذا نجح أو فشل في النهاية، تكون الإشارة متفرقة جدًا لتعليم النموذج أي من تلك القرارات كان مهمًا. يعمل التعلم المعزز القائم على النتائج، لكنه يترك فجوة إشراف بين المكافأة على مستوى الحلقة والسياسة على مستوى الترميز التي أنتجتها.
يقترح فريق من جامعة هونغ كونغ ومختبر شنغهاي للذكاء الاصطناعي حلاً يبدو واضحًا تقريبًا من منظور الماضي: دع النموذج يحلل مساراته المُنجزة ويكتب ما تعلمه. ثم قم بتغذية تلك الدروس مرة أخرى في السياسة أثناء التدريب. يطلقون عليه SEED (التقطير الذاتي التطور داخل السياسة)، وتظهر النسخة الأولية المنشورة على arXiv في 16 يوليو 2026، مكاسب ثابتة في كل من المهام النصية والمرئية للوكلاء.
من مكافأة متفرقة إلى إشارة كثيفة
الفكرة الأساسية هي أن نموذجًا لغويًا كبيرًا، عندما يُطلب منه فحص مسار أكملته لتوه، يمكنه توليد مهارات بلغة طبيعية تلتقط سير عمل قابلة لإعادة الاستخدام، أو ملاحظات حاسمة، أو قواعد لتجنب الفشل. هذه ليست قوالب ثابتة كتبها إنسان؛ إنها تنبثق من أي شيء تفعله السياسة الحالية. النموذج الذي يميل إلى تجاوز الهدف في مهام الملاحة قد يولد مهارة مثل "بعد ثلاث حركات فاشلة، تحقق مما إذا كان الهدف لا يزال في المنطقة المرئية."
ثم تستخدم SEED تلك المهارات لإنشاء إشارة كثيفة على مستوى الترميز. تعيد تقييم نفس الإجراءات في سياقين: سياق أساسي وآخر معزز بمهارات منظور الماضي. يصبح الفرق في احتمالات الترميز هدفًا للتقطير يدفع السياسة نحو السلوك الذي تشير إليه تحليلات منظورها الخاص. تعمل هذه الإشارة جنبًا إلى جنب مع هدف التعلم المعزز القائم على النتائج، لذا لا يختار النموذج بين المكافآت المتفرقة والتلميحات الكثيفة؛ يحصل على كليهما.
إشراف ذاتي التطور

الجزء الذاتي التطور مهم لأن السياسة التي تجمع المسارات اليوم أفضل من تلك التي جمعتها بالأمس. لا تجمد SEED وحدة التحليل بعد المرور الأول. يعمل نفس النموذج كممثل ومحلل منظور الماضي، لذا مع تحسن السياسة، تتحسن المهارات التي تستخرجها أيضًا. تظل إشارة التقطير متوافقة مع السياسة، مما يعني أنها تعكس توزيع المسار الحالي بدلاً من لقطة قديمة.
هذا يتجنب مشكلة شائعة في الأعمال السابقة حول إعادة وضع العلامات من منظور الماضي أو استخراج المهارات، حيث يخرج الإشراف المساعد عن التزامن مع السلوك الذي ينتجه النموذج فعليًا. حلقة التغذية الراجعة الخاصة بـ SEED تحافظ على توافق الاثنين.
ماذا تظهر التجارب
تذكر الورقة البحثية تجارب عبر كل من البيئات النصية (ALFWorld, ScienceWorld) والمرئية (Craftax، وهو معيار لألعاب الزنزانات). في جميع الحالات، تحسن SEED مقارنة بكل من التعلم المعزز القائم على النتائج البحتة والخطوط الأساسية التي تستخدم مهارات ثابتة ومستخرجة مسبقًا. تكون المكاسب أكثر وضوحًا في المهام طويلة الأمد حيث تكون فجوة الإشراف أوسع: مهام ScienceWorld التي تتطلب خمس عشرة خطوة أو أكثر تظهر تحسنًا بنسبة 22% في معدل النجاح مقارنة بأفضل خط أساسي للتعلم المعزز فقط.
التعميم على السيناريوهات غير المرئية، والذي تم اختباره عن طريق حذف تكوينات بيئية أثناء التدريب، يتحسن أيضًا. يجادل المؤلفون بأن مهارات منظور الماضي تلتقط أنماطًا قابلة لإعادة الاستخدام حقًا بدلاً من الحفظ الخاص بالمهمة، وأن خطوة التقطير تنقل تلك الأنماط إلى السياسة دون الإفراط في التكيف مع توزيع التدريب.
جدول واحد يروي القصة
عبر أربع بيئات ومستويات صعوبة متعددة، تتفوق SEED على أفضل طريقة تالية في تسعة من أصل اثنتي عشرة مقارنة مذكورة. الخسائر الوحيدة تأتي في حلقات قصيرة جدًا حيث تكون فجوة الإشراف ضئيلة على أي حال.
| البيئة | المقياس | التعلم المعزز فقط | مهارات ثابتة | SEED |
|---|---|---|---|---|
| ALFWorld | معدل النجاح | 57.3% | 61.8% | 68.1% |
| ScienceWorld | معدل النجاح | 34.1% | 39.5% | 46.3% |
| Craftax (مرئي) | متوسط المكافأة | 57.2 | 62.3 | 71.0 |
التحسينات ليست دراماتيكية بما يكفي لتسمى اختراقًا، لكنها ثابتة وتتراكم عبر المهام الأطول. هذا هو نوع الإشارة التي يهتم بها الممارسون: طريقة ترفع الأداء بهدوء دون الحاجة إلى بنية جديدة تمامًا أو ميزانية تدريب أكبر.
أسئلة مفتوحة
تترك الورقة البحثية بضعة أسئلة دون إجابة. المهارات التي تنتجها وحدة تحليل منظور الماضي لا يتم التحقق من صحتها بواسطة أي فحص خارجي؛ يمكن للنموذج توليد دروس تبدو معقولة ولكنها خاطئة. يلاحظ المؤلفون أن إشارة التقطير تُحسب فقط من تحول الاحتمال، لذا فإن المهارة السيئة لا تساهم بتدرج مفيد في المتوسط، لكنهم لا يحللون عدد المرات التي ينتج فيها النموذج مهارات منظور ماضي مضللة أو ما إذا كان نمط الفشل شائعًا بما يكفي ليصبح مهمًا على نطاق واسع.
التكلفة الحسابية لتشغيل وحدة التحليل على كل مسار أثناء التدريب ليست تافهة أيضًا. تذكر الورقة أن العبء الإضافي يمكن إدارته لأن التحليل هو تمريرة واحدة للأمام لكل مسار، ولكن في حلقات طويلة جدًا في بيئات معقدة، تتراكم هذه التمريرة الإضافية.
مع ذلك، فإن SEED هي واحدة من الاقتراحات الأكثر عملية في مجموعة الطرق الحديثة للتعلم المعزز للوكلاء. لا تتطلب تعليقًا بشريًا، وتحافظ على نضارة إشارة الإشراف، وتعمل فوق خطوط أنابيب التعلم المعزز القياسية دون تعديلات تغزوية. للفرق التي تدرب نماذج وكلاء تعاني من مهام طويلة الأمد، هذا يستحق محادثة.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.