跳转到主要内容

阿里巴巴的Qwen-UI-Agent:弥合AI与现实世界任务之间的差距

阿里巴巴已正式开源Qwen-UI-Agent,这是一个旨在现实世界中运行的GUI代理基础模型。该模型覆盖移动、桌面、Web和深度搜索环境,旨在摆脱传统模拟测试的限制,实现在复杂真实设备上的无缝操作。

Image

超越行业标准的性能

Qwen-UI-Agent在各种权威测试和现实场景中展示了令人印象深刻的能力:

  • 移动性能:在MobileWorld测试中取得了82.1%的显著成绩,超越了多个国际主要旗舰模型。在其自建的基准测试MobileWorld-Real中,涉及超过100台真实设备,成功率高达92.2%。在Android Daily基准测试中也表现近乎完美。
  • 桌面性能:在OSWorld-Verified上得分79.5%,并且在多个任务中相比基线模型显著减少了执行步骤。
  • Web和通用能力:在WebArena Web测试中在所有比较模型中排名第一。其通用和代理能力完全超越了训练基础模型,轻松处理长尾需求。

从模拟到真实设备

为了弥合模拟与现实之间的最后差距,Qwen-UI-Agent构建了一个真实的移动环境,包括超过100部真实手机和150多个应用程序,用于任务构建、轨迹收集和模型训练。团队还引入了MobileWorld-Real基准测试,包含超过400个任务,允许开发者根据真实设备成功率进行精确选择。

Image

高效指令与安全控制

在功能方面,该模型不仅支持常规的GUI界面操作,还可以直接执行命令行操作。它在单次决策中输出批量操作,显著缩短了执行轨迹并提高了效率。同时,它全程具有全面的安全判断机制:当面临非法或高风险请求时,它会直接拒绝并终止任务;当涉及支付、数据删除和隐私授权等敏感场景时,它会在关键步骤停止并等待用户确认后再继续。

此外,该模型支持在超过100步的轨迹上进行在线强化学习训练,结合自适应课程学习,持续应对具有挑战性的长期任务。

关键要点

  • 现实世界焦点:Qwen-UI-Agent专为真实设备而构建,而不仅仅是模拟,拥有超过100部手机和150多个应用的专用环境。
  • 顶级性能:它在移动、桌面和Web基准测试中领先,真实设备测试成功率达92.2%。
  • 安全第一:该模型包含强大的安全保护措施,拒绝风险请求,并在敏感操作中暂停等待用户确认。
  • 效率提升:它可以执行命令行操作和批量操作,减少执行步骤并提高速度。

项目主页:https://tongyi-mai.github.io/Qwen-UI-Agent/