GUI智能体
阿里巴巴的Qwen-UI-Agent在真实手机上的得分高于沙盒环境
阿里巴巴通义实验室的Qwen-UI-Agent声称取得了最先进的移动端得分(AndroidDaily上97.5%),并在计算机使用结果上与Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol相比具备竞争力。其在真实设备基准上的得分高于沙盒得分,而OSWorld-v2上40%的部分进展则是其诚实的极限。

Qwen-UI-Agent在真实手机上的得分高于其旁的沙盒基准。阿里巴巴通义实验室2026年7月30日提交的技术报告列出,真实设备测试MobileWorld-Real的得分为92.2%,而MobileWorld为82.1%。论文没有解释这一差距,且两个任务的难度可能并不相同。无论如何,这一方向正是该项目的核心卖点:一个为真实存在的设备而构建的GUI智能体。
报告将Qwen-UI-Agent定位为“以真实世界为中心的基座GUI智能体”。它覆盖移动端、计算机使用、网页以及DeepSearch环境。这不是一个描述自己会做什么的聊天机器人;该模型直接操作屏幕。其统一动作空间将GUI操作与命令行执行交错在一起,并在单个模型回合中生成批量动作,因此模型可一次规划多个步骤,而不是每次点击都来回往返。一个轻量级的harness层增加了有状态工作流以及论文所称的主动服务启动。
论文开篇提出了GUI智能体的愿景:作为“现有数字设备上的通用执行器”。与这一愿景相关的列表很具体:在真实设备上可靠运行、跨平台执行工作流、将GUI交互与CLI结合、完成长程任务、主动启动有用的服务,并以最少的人力投入改进。可以把这一设计看作针对该列表的清单:真实设备运行时对应可靠性,跨环境沙盒对应覆盖范围,统一动作空间对应GUI加CLI需求,harness对应主动工作,飞轮对应自我改进。

一个智能体,四个环境
训练设置与得分同样值得关注。一个AutoResearch风格的数据飞轮让智能体构建任务和环境、诊断失败,并规划后续迭代。在线强化学习在超过100轮的轨迹上进行训练,超过10,000个并发环境加速了轨迹生成。长程工作, , 在100个或更多模型回合中保持一个目标, , 正是该设置所针对的训练场景。
得分
下表来自Qwen-UI-Agent项目页面。报告声称移动端取得了最先进的结果;计算机和浏览器使用则被描述为与前沿模型相比具备竞争力,并点名了Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol。
| 基准测试 | 领域 | 得分 |
|---|---|---|
| MobileWorld | 移动端 | 82.1% |
| MobileWorld-Real | 移动端,真实设备 | 92.2% |
| AndroidDaily | 移动端 | 97.5% |
| OSWorld-Verified | 计算机 | 79.5% |
| OSWorld-v2 | 计算机 | 40.0%部分进展 |
| WebArena | 浏览器 | 73.6% |
| ScreenSpot-Pro | GUI定位 | 81.5% |
OSWorld这一行值得再看一眼。在OSWorld-Verified上,该智能体取得79.5%。在OSWorld-v2上,报告列出40.0%的部分进展得分。这两个测试不同,如此大的差距正是“能完成桌面任务的智能体”和“只能完成一部分的智能体”之间的区别。如果你想从这份报告中读一个数字,请读这个。它是当前系统诚实的边界。
值得关注之处
关于最先进移动端和具有竞争力的桌面端的比较声明来自作者。这里没有任何内容经过独立验证,而且该项目在Hugging Face上获得了278个赞,对于一篇声称登顶的论文来说,这个数字并不算高。飞轮还提出了一个显而易见的问题:当智能体构建它们训练所用的任务和环境时,得分中有多少是能力,又有多少是经过调整、迎合基准测试奖励的循环?MobileWorld-Real和MobileWorld之间无法解释的差距也指向同一方向。
这些都不意味着这份报告只是一场演示。Qwen-UI-Agent将真实硬件引入了训练循环,而AndroidDaily上97.5%的成绩是竞争对手实验室会想要验证的那种数字。桌面端的差距是值得关注的点。缩小这一差距,现实世界的说法就不仅适用于手机,也适用于桌面。
- 来源 : Alibaba's Qwen-UI-Agent scores higher on real phones than in sandboxes — 2026-07-30
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。