阿里巴巴Qwen-UI-Agent在移动GUI基准测试中超越GPT和Claude
阿里巴巴已于8月20日正式发布Qwen-UI-Agent,进军GUI代理领域。这款新的基础模型不仅仅是另一个参与者——它正在设定步伐。覆盖移动、桌面、网页和深度搜索环境,Qwen-UI-Agent已经在关键基准测试中匹配或超越了多个行业巨头。
移动端精通
在移动端,Qwen-UI-Agent是一股不可忽视的力量。它在MobileWorld基准测试中获得了82.1%的优异成绩,分别领先GPT-5.6Sol和Claude Opus4.8达12和14.6个百分点。但这还不是全部。在真实世界的MobileWorld-Real基准测试中,它达到了92.2%,超越了Gemini3.1Pro、Claude Opus4.8和GPT-5.6Sol。在AndroidDaily上,它几乎满分,得分97.5%——离完美仅一步之遥。
桌面和网页实力
桌面和浏览器任务也不甘示弱。Qwen-UI-Agent在OSWorld-Verified上取得了79.5%的成绩,超越了GPT-5.5和Gemini3.1Pro。在WebArena上,它以73.6%的得分在所有对比模型中名列前茅。即使在GUI接地测试如ScreenSpot-Pro中,它也获得了81.5%的分数,并在其他四个评估基准上创下了新纪录。

从模拟到现实
GUI代理最大的障碍之一是弥合模拟环境与真实世界使用之间的差距。Qwen-UI-Agent通过构建一个包含超过100部真实智能手机和150多个应用的真实移动环境,用于任务创建、轨迹收集、模型训练和评估,正面解决了这一问题。它还推出了自己的真实设备基准测试MobileWorld-Real,包含超过100个应用中的400多个任务。除了传统的点击操作,该模型还支持直接命令行输入,并能在一次决策中输出多个动作——约40%的桌面任务动作以这种方式批量处理。

安全与长周期任务
安全贯穿于Qwen-UI-Agent任务执行的每一步。如果遇到非法或高风险请求,它会直接拒绝并终止任务。对于支付、数据删除或隐私授权等敏感场景,它会在关键时刻暂停并通知用户。该模型还支持在超过100步的超长轨迹上进行在线强化学习,同时约10,000个并发环境并行运行。这种持续的训练循环帮助它应对日益复杂的长期任务。
关键点
- 基准测试主导地位: Qwen-UI-Agent在MobileWorld(82.1%)、MobileWorld-Real(92.2%)、AndroidDaily(97.5%)、OSWorld-Verified(79.5%)和WebArena(73.6%)上领先。
- 真实设备训练: 使用100多部真实智能手机和150多个应用构建,并新增了包含400多个任务的MobileWorld-Real基准测试。
- 高效动作: 支持批量输出多个动作,约40%的桌面动作以批量方式处理。
- 安全第一: 拒绝非法请求,并在支付或数据删除等敏感操作时暂停。
- 长周期学习: 在100多步轨迹上进行在线强化学习,并拥有10,000个并发环境。