بحث في الذكاء الاصطناعي
علي بابا تطلق Qwen-AgentWorld: جعلت نمذجة العالم مشكلة لغوية
Qwen-AgentWorld هو نموذج عالم لغوي أصلي يحاكي بيئات الوكيل عبر سبعة مجالات. من خلال جعل نمذجة البيئة هدف التدريب من البداية، يقدم بديلاً لنماذج العالم القائمة على الفيديو والمحاكيات الخاصة بالمجال للذكاء الاصطناعي المجسد.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-19 · قراءة 4 دقائق

أصدر فريق Qwen في علي بابا نموذج Qwen-AgentWorld، وهو نموذج عالم قائم على اللغة يحاكي بيئات الوكيل عبر سبعة مجالات: بروتوكول MCP النصي، والبحث، والطرفية، ومهام هندسة البرمجيات. بدلاً من إضافة نمذجة العالم إلى نموذج لغوي عام الغرض كفكرة لاحقة، جعل الفريق محاكاة البيئة الهدف التدريبي الأساسي من مرحلة ما قبل التدريب المستمر عبر الضبط الدقيق الخاضع للإشراف والتعلم المعزز. OPID يمنح وكلاء اللغة إشارة مكافأة كثيفة بما يكفي…
الإصدار هو انفصال متعمد عن النهج السائد في الذكاء الاصطناعي المجسد، حيث تُبنى نماذج العالم عادةً فوق توليد الفيديو أو المحاكيات الفيزيائية الخاصة بالمجال. يعالج Qwen-AgentWorld البيئة نفسها كلغة، وهي خطوة يقول الفريق إنها توفر تعميماً أفضل مع تعقيد معماري أقل. Fast-LeWM: التنبؤ بالبادئة الموازية للأفعال يقلل من…
لغة البيئات
معظم نماذج العالم اليوم تقع في إحدى فئتين. نماذج توليد الفيديو العامة مثل Sora تتعلم مسبقات بصرية غنية ولكنها تكافح لنمذجة الفيزياء المجسدة. المحاكيات الخاصة بالمجال دقيقة ولكنها ضيقة: محاكي التلاعب لا يمكنه تقييم وكيل بحث، والعكس صحيح. يتجنب Qwen-AgentWorld هذا التوتر تمامًا عن طريق ترميز البيئة كسلسلة من الرموز، بنفس الطريقة التي يرمز بها نموذج لغوي جملة أو قاعدة شيفرات. الاختناق الحقيقي في وكلاء سطح المكتب المعتمدين على…
لأن النموذج يُدرَّب للتنبؤ بالحالة التالية للبيئة، أي ما يحدث بعد إجراء ما، يمكنه محاكاة أي مجال يمكن التعبير عنه كتحولات حالة. نفس الأوزان التي تحاكي تفاعل وكيل بحث مع فهرس ويب يمكنها أيضًا محاكاة جلسة طرفية أو تفاعل مستودع شيفرات.
تحقق الفريق من النهج عبر جميع المجالات السبعة، على الرغم من عدم نشر أرقام مرجعية مفصلة في المنشور. يدعون أن نموذجًا واحدًا يحقق أداءً تنافسيًا ضد المحاكيات الخاصة بالمجال دون أي ضبط خاص بالمجال. أفق التحقق: لماذا أصبح التحقق من وكلاء البرمجة أصعب من…
صلة حزمة الروبوت
إصدار AgentWorld يتبع عن كثب حزمة Qwen-Robot Suite، وهي ثلاثية من النماذج الأساسية، Qwen-RobotNav وQwen-RobotManip وQwen-RobotWorld، التي تستهدف الذكاء المجسد. يربط منشور المدونة صراحة بين الجهدين، مما يشير إلى أن AgentWorld يوفر العمود الفقري للمحاكاة لتدريب وتقييم الوكلاء الروبوتيين داخل الحزمة.
الحزمة أظهرت بالفعل تكاملًا ملحوظًا: Qwen-Omni يلاحظ مشهدًا ماديًا، ويقترح عشوائيًا مهام تلاعب عبر الكلام، ويقيم التنفيذ في الوقت الفعلي. مكون RobotManip يكمل بعد ذلك تلك المهام على الفور دون قائمة مهام محددة مسبقًا. يمكن لنموذج AgentWorld أن يعمل كطبقة محاكاة حيث يتم تدريب اتباع التعليمات مفتوح النهاية قبل النشر على الأجهزة المادية. كيف تقوم نماذج الذكاء الاصطناعي المحلية مثل Gemma و…
هذا الخط الأنابيب، المحاكاة باللغة، النشر في العالم المادي، هو إجابة الفريق على الاختناق الذي يحددونه صراحة: "الرؤية ليست فعلاً." الفجوة بين الإدراك البصري والتحكم المادي لا تزال دون حل في معظم الأنظمة المجسدة، ويتعامل Qwen-AgentWorld مع تلك الفجوة كمشكلة ترجمة: من الملاحظة البصرية إلى الحالة اللغوية إلى الفعل.
الآثار على المجال
إذا ثبتت ادعاءات الأداء عبر تقييم طرف ثالث، يمثل Qwen-AgentWorld تبسيطًا كبيرًا لمكدس المحاكاة لأبحاث الذكاء الاصطناعي المجسد. تتطلب الأساليب الحالية من الباحثين لصق نموذج رؤية ومحرك فيزياء ومخطط مهام معًا، لكل منها أنماط فشل خاصة به. نموذج لغوي واحد يتعامل مع الأدوار الثلاثة جميعها من شأنه أن يقلل من مساحة الأخطاء المتتالية. أولمو-إيفال من Ai2 يمنح مطوري LLM ميكروسكوبًا لكل نقطة تفتيش
النهج يثير أيضًا أسئلة حول ضرورة نماذج العالم القائمة على الفيديو للمهام المجسدة. إذا كانت المحاكاة على المستوى اللغوي كافية لتدريب وكلاء يمكنهم لاحقًا العمل في العالم المادي، فإن الاستثمار الحسابي الثقيل في نماذج توليد الفيديو قد يكون غير مخصص لهذا التطبيق المحدد.
ومع ذلك، تظل حدود النهج غير واضحة. المجالات السبعة المختبرة كلها نصية أو رمزية: بروتوكولات MCP، استعلامات البحث، أوامر الطرفية، مستودعات الشيفرات. ليس من الواضح أن نفس المحاكاة القائمة على اللغة ستنتقل إلى مهام تتطلب تفكيرًا فيزيائيًا دقيقًا، مثل التلاعب بأشياء قابلة للتشوه أو التنقل في تضاريس غير مستوية. قد تملأ مكونات Nav وManip من حزمة Qwen-Robot Suite تلك الفجوة، لكن التكامل بين النظامين لم يتم قياسه بشكل علني.
أسئلة مفتوحة
منشور المدونة لا يحدد تاريخ إصدار لأوزان النموذج أو واجهات برمجة التطبيقات، تاركًا المجتمع ينتظر الوصول إلى الشيفرات قبل تشغيل المعايير المستقلة. حتى ذلك الحين، يظل الادعاء المركزي، أن نماذج العالم اللغوية يمكن أن تعمم عبر المجالات حيث لا تستطيع نماذج الفيديو والمحاكيات الفيزيائية، فرضية قوية مدعومة بالتحقق الداخلي. IFBench: المعيار الجديد لاختبار اتباع الذكاء الاصطناعي…
إذا تم إثبات الفرضية، قد يتجاوز التأثير الذكاء الاصطناعي المجسد. أي مجال يمكن نمذجته كعملية قرار ماركوف، والتعبير عنه باللغة، يصبح قابلاً للمحاكاة بواسطة نموذج واحد. يشمل ذلك المحاكاة الاقتصادية، وبيئات الألعاب، وبروتوكولات الشبكة، وربما التجارب العلمية. Qwen-AgentWorld هو رهان أن اللغة تمثيل عالمي بما يكفي لالتقاطها جميعًا.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.