SevenTnewS

GUI智能体

阿里巴巴的Qwen-UI-Agent在真实手机上的得分高于沙盒环境

阿里巴巴通义实验室的Qwen-UI-Agent声称取得了最先进的移动端得分(AndroidDaily上97.5%),并在计算机使用结果上与Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol相比具备竞争力。其在真实设备基准上的得分高于沙盒得分,而OSWorld-v2上40%的部分进展则是其诚实的极限。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-31 · 最后更新:2026-08-02 · 阅读需 3 分钟

阿里巴巴的Qwen-UI-Agent在真实手机上的得分高于沙盒环境

Qwen-UI-Agent在真实手机上的得分高于其旁的沙盒基准。阿里巴巴通义实验室2026年7月30日提交的技术报告列出,真实设备测试MobileWorld-Real的得分为92.2%,而MobileWorld为82.1%。论文没有解释这一差距,且两个任务的难度可能并不相同。无论如何,这一方向正是该项目的核心卖点:一个为真实存在的设备而构建的GUI智能体。

报告将Qwen-UI-Agent定位为“以真实世界为中心的基座GUI智能体”。它覆盖移动端、计算机使用、网页以及DeepSearch环境。这不是一个描述自己会做什么的聊天机器人;该模型直接操作屏幕。其统一动作空间将GUI操作与命令行执行交错在一起,并在单个模型回合中生成批量动作,因此模型可一次规划多个步骤,而不是每次点击都来回往返。一个轻量级的harness层增加了有状态工作流以及论文所称的主动服务启动。

论文开篇提出了GUI智能体的愿景:作为“现有数字设备上的通用执行器”。与这一愿景相关的列表很具体:在真实设备上可靠运行、跨平台执行工作流、将GUI交互与CLI结合、完成长程任务、主动启动有用的服务,并以最少的人力投入改进。可以把这一设计看作针对该列表的清单:真实设备运行时对应可靠性,跨环境沙盒对应覆盖范围,统一动作空间对应GUI加CLI需求,harness对应主动工作,飞轮对应自我改进。

图表 : Qwen-UI-Agent 基准测试得分
Qwen-UI-Agent 技术报告中的基准测试得分,均为百分比。

一个智能体,四个环境

训练设置与得分同样值得关注。一个AutoResearch风格的数据飞轮让智能体构建任务和环境、诊断失败,并规划后续迭代。在线强化学习在超过100轮的轨迹上进行训练,超过10,000个并发环境加速了轨迹生成。长程工作, , 在100个或更多模型回合中保持一个目标, , 正是该设置所针对的训练场景。

得分

下表来自Qwen-UI-Agent项目页面。报告声称移动端取得了最先进的结果;计算机和浏览器使用则被描述为与前沿模型相比具备竞争力,并点名了Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol。

Qwen-UI-Agent技术报告中报告的基准测试结果
基准测试领域得分
MobileWorld移动端82.1%
MobileWorld-Real移动端,真实设备92.2%
AndroidDaily移动端97.5%
OSWorld-Verified计算机79.5%
OSWorld-v2计算机40.0%部分进展
WebArena浏览器73.6%
ScreenSpot-ProGUI定位81.5%

OSWorld这一行值得再看一眼。在OSWorld-Verified上,该智能体取得79.5%。在OSWorld-v2上,报告列出40.0%的部分进展得分。这两个测试不同,如此大的差距正是“能完成桌面任务的智能体”和“只能完成一部分的智能体”之间的区别。如果你想从这份报告中读一个数字,请读这个。它是当前系统诚实的边界。

值得关注之处

关于最先进移动端和具有竞争力的桌面端的比较声明来自作者。这里没有任何内容经过独立验证,而且该项目在Hugging Face上获得了278个赞,对于一篇声称登顶的论文来说,这个数字并不算高。飞轮还提出了一个显而易见的问题:当智能体构建它们训练所用的任务和环境时,得分中有多少是能力,又有多少是经过调整、迎合基准测试奖励的循环?MobileWorld-Real和MobileWorld之间无法解释的差距也指向同一方向。

这些都不意味着这份报告只是一场演示。Qwen-UI-Agent将真实硬件引入了训练循环,而AndroidDaily上97.5%的成绩是竞争对手实验室会想要验证的那种数字。桌面端的差距是值得关注的点。缩小这一差距,现实世界的说法就不仅适用于手机,也适用于桌面。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。