跳转到主要内容

阿里巴巴的Qwen-UI-Agent:弥合模拟与现实之间的差距

阿里巴巴已正式发布Qwen-UI-Agent,这是一个专注于真实世界的GUI代理基础模型。这不仅仅是另一个模拟玩具——它旨在处理移动、桌面、网络和深度搜索环境,力求摆脱传统测试的限制。目标是什么?让模型能够无缝地在复杂的真实设备上运行。

超越大牌

在正面测试中,Qwen-UI-Agent展现出了强大的实力。在MobileWorld基准测试中,它获得了令人印象深刻的82.1%的分数,击败了多个国际旗舰模型。但关键在于:在它自己的真实设备基准测试MobileWorld-Real上,该测试涉及超过100部真实手机,它的成功率达到了92.2%。而在Android Daily上,它几乎完美无缺。

桌面性能同样强劲,在OSWorld-Verified上获得了79.5%的分数,并且还减少了各种任务所需的执行步骤。在网络方面,它在WebArena中排名第一。它的一般能力和代理能力已经完全超越了其训练基础模型,轻松处理长尾需求。

从模拟到现实

AI开发中最大的障碍之一是模拟环境与混乱、不可预测的真实世界之间的差距。Qwen-UI-Agent通过构建一个包含超过100部真实手机和150多个应用的真实移动环境来进行任务创建、轨迹收集和训练,从而正面解决了这个问题。他们还引入了MobileWorld-Real,这是一个包含超过400个任务的基准测试,允许开发者根据真实设备的成功率进行微调。

Image

智能、安全、高效

这个模型的独特之处不仅在于它的性能——还在于它如何处理指令和安全。除了常规的GUI操作,它还可以直接执行命令行命令。它在一次决策中输出批量操作,这缩短了执行轨迹并提高了效率。但它并不止步于此。

安全是一个大问题。该模型在整个过程中拥有全面的安全判断机制。如果遇到非法或高风险请求,它会拒绝并终止任务。对于支付、数据删除或隐私授权等敏感场景,它会在关键步骤暂停并等待用户确认后再继续。这是一个贴心的设计。

持续学习

Qwen-UI-Agent还支持在超过100步的轨迹上进行在线强化学习,并结合自适应课程学习。这意味着它不断应对具有挑战性的长期任务,随着时间的推移变得更好。

Image

关键要点

  • 真实世界聚焦:Qwen-UI-Agent专为真实设备设计,而不仅仅是模拟,拥有专用的真实移动环境。
  • 顶级性能:它在MobileWorld(82.1%)、MobileWorld-Real(92.2%)和OSWorld-Verified(79.5%)等基准测试中领先。
  • 安全第一:它包含强大的安全检查,拒绝高风险任务,并在敏感操作中暂停等待用户确认。
  • 高效操作:支持批量操作和命令行执行,减少步骤并提高效率。
  • 持续改进:使用在线强化学习和自适应课程学习来处理长期任务。

更多详情,请查看项目主页:https://tongyi-mai.github.io/Qwen-UI-Agent/