وكلاء الواجهات الرسومية

وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة

يدّعي Qwen-UI-Agent من مختبر علي بابا تونغي تحقيق نتائج رائدة في الهواتف المحمولة (97.5% على AndroidDaily) ونتائج تنافسية في استخدام الكمبيوتر مقابل Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol. وتسجّل نتائجه على معيار الأجهزة الحقيقية أعلى من نتائجه في بيئة الاختبار المعزولة، في حين يمثّل التقدّم الجزئي البالغ 40% على OSWorld-v2 الحدّ الصادق.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-31 · آخر تحديث: 2026-08-02 · قراءة 3 دقائق

وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة

يسجّل Qwen-UI-Agent نتائج أعلى على الهواتف الحقيقية مقارنة بمعيار الاختبار المعزول المجاور له. يورد تقرير فني من مختبر تونغي (Tongyi Lab) التابع لعلي بابا، قُدّم في 30 يوليو 2026، نسبة 92.2% على MobileWorld-Real، وهو اختبار الأجهزة الحقيقية، مقابل 82.1% على MobileWorld. لا تشرح الورقة الفجوة، وقد لا تكون المهمتان بنفس درجة الصعوبة. وعلى أي حال، فإن هذا الاتجاه هو جوهر عرض المشروع: وكيل واجهات رسومية مبني لأجهزة موجودة فعلًا.

يقدّم التقرير Qwen-UI-Agent بوصفه «وكيلًا أساسيًا للواجهات الرسومية يتمحور حول العالم الحقيقي». ويغطي الهواتف المحمولة واستخدام الكمبيوتر والويب وبيئة DeepSearch. هذا ليس روبوت محادثة يصف ما سيفعله؛ بل النموذج يشغّل الشاشة فعليًا. ويدمج فضاء الإجراءات الموحّد عمليات الواجهة الرسومية مع تنفيذ سطر الأوامر، ويولّد إجراءات مجمّعة في دورة نموذج واحدة، بحيث يخطط النموذج لعدة خطوات دفعة واحدة بدلًا من جولة ذهاب وإياب عند كل نقرة. وتضيف طبقة ربط خفيفة الوزن سير عمل ذا حالة وما تسميه الورقة «البدء الاستباقي للخدمات».

تفتتح الورقة برؤية لوكلاء الواجهات الرسومية بوصفهم «منفّذًا عامًا للأجهزة الرقمية القائمة». والقائمة المرتبطة بتلك الرؤية محدّدة: العمل بموثوقية على الأجهزة الحقيقية، وتنفيذ سير العمل عبر المنصات، والجمع بين التفاعل عبر الواجهة الرسومية وسطر الأوامر (CLI)، وإنجاز المهام طويلة الأفق، وبدء خدمات مفيدة بشكل استباقي، والتحسّن بأقل جهد بشري. اقرأ التصميم بوصفه قائمة تحقّق مقابل تلك القائمة. فبيئة التشغيل على الأجهزة الحقيقية تجيب عن شرط الموثوقية، وبيئات الاختبار المعزولة المتعددة تجيب عن شرط التغطية، وفضاء الإجراءات الموحّد يجيب عن شرط الجمع بين الواجهة الرسومية وسطر الأوامر، وطبقة الربط تجيب عن العمل الاستباقي، والحدافة تجيب عن التحسين الذاتي.

رسم بياني: نتائج معايير Qwen-UI-Agent
نتائج المعايير الواردة في التقرير الفني لـ Qwen-UI-Agent، وكلها كنسب مئوية.

وكيل واحد، أربع بيئات

إعداد التدريب لا يقل أهمية عن النتائج. تعتمد حدافة بيانات بأسلوب AutoResearch على وكلاء يبنون المهام والبيئات، ويشخّصون الإخفاقات، ويخططون للتكرارات اللاحقة. ويتدرّب التعلم المعزز عبر الإنترنت على مسارات تتجاوز 100 خطوة، مع أكثر من 10,000 بيئة متزامنة تسرّع عملية التوليد. والعمل طويل الأفق, أي الإمساك بهدف عبر مئة خطوة نموذجية أو أكثر, هو النظام الذي بُني هذا الإعداد من أجله.

النتائج

الجدول أدناه مأخوذ من صفحة مشروع Qwen-UI-Agent. والهواتف المحمولة هي المجال الذي يدّعي التقرير فيه نتائج رائدة؛ في حين يصف استخدام الكمبيوتر والمتصفح بأنه تنافسي في مواجهة النماذج الحدودية، مسميًا Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol.

نتائج المعايير الواردة في التقرير الفني لـ Qwen-UI-Agent
المعيارالمجالالنتيجة
MobileWorldالهواتف المحمولة82.1%
MobileWorld-Realالهواتف المحمولة، جهاز حقيقي92.2%
AndroidDailyالهواتف المحمولة97.5%
OSWorld-Verifiedالكمبيوتر79.5%
OSWorld-v2الكمبيوترتقدّم جزئي 40.0%
WebArenaالمتصفح73.6%
ScreenSpot-Proإسناد الواجهات الرسومية81.5%

سطر OSWorld يستحق نظرة ثانية. على OSWorld-Verified يسجّل الوكيل 79.5%. وعلى OSWorld-v2 يورد التقرير نتيجة تقدّم جزئي بنسبة 40.0%. يختلف الاختباران، وفجوة بهذا الحجم هي الفرق بين وكيل يحل مهام سطح المكتب ووكيل يصل إلى منتصف الطريق. إذا قرأت رقمًا واحدًا في هذا التقرير، فاقرأ هذا الرقم. إنه الحدّ الصادق للنظام الحالي.

ما يستحق المتابعة

الادعاءات المقارنة, نتائج رائدة على الهواتف المحمولة، وتنافسية على سطح المكتب, صادرة عن المؤلفين أنفسهم. لم يُتحقَّق من أي شيء هنا بشكل مستقل بعد، وقد جمع المشروع 278 صوتًا مؤيدًا على Hugging Face، وهو رقم متواضع لورقة تدّعي أفضل النتائج. وتثير الحدافة أيضًا سؤالًا واضحًا: عندما يبني الوكلاء المهام والبيئات التي يتدرّبون عليها، فكم من النتيجة يعود إلى القدرة الفعلية، وكم منها حلقة مضبوطة على ما تكافئه المعايير؟ والفجوة غير المفسَّرة بين MobileWorld-Real وMobileWorld تشير في الاتجاه نفسه.

لا شيء من هذا يجعل التقرير عرضًا تجريبيًا. يُدخل Qwen-UI-Agent أجهزة حقيقية في حلقة التدريب، ونسبة 97.5% على AndroidDaily هي النوع من الأرقام التي سترغب المختبرات المنافسة في التحقق منها. فجوة سطح المكتب هي ما يجب مراقبته. سدّها، وسيبدأ ادعاء العالم الحقيقي في الصمود على أجهزة سطح المكتب كما على الهواتف.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.