跳转到主要内容

阿里巴巴的Qwen-UI-Agent:一款真正实用的现实世界GUI模型

阿里巴巴刚刚发布了一款新的开源模型,引起了AI社区的关注。它就是Qwen-UI-Agent,一个为现实世界构建的GUI代理基础模型。与许多在受控模拟中表现出色但在实际使用中却步履蹒跚的模型不同,这款模型旨在处理真实设备上混乱、不可预测的特性——从智能手机、桌面电脑到网页浏览器和深度搜索场景。

从模拟到现实:重大飞跃

长期以来,与图形用户界面(GUI)交互的AI模型都是在模拟环境中训练和测试的。但模拟无法捕捉现实生活中的混乱:意外的弹窗、缓慢的加载时间或古怪的应用布局。Qwen-UI-Agent旨在弥合这一差距。其背后的团队建立了一个真实的移动测试场,包含100多部真实手机和150多个应用,收集数据并训练模型来导航它们。他们还引入了一个名为MobileWorld-Real的新基准,包含真实设备上的400多个任务,使他们能够根据实际成功率对模型进行微调。

全面出色的成绩

那么,它的表现如何呢?根据基准测试,相当不错。在MobileWorld测试中,它获得了令人印象深刻的82.1%的分数,超过了几个主要的国际模型。但真正的亮点是它在真实设备上的表现:在MobileWorld-Real上成功率为92.2%,在Android Daily上几乎完美。桌面性能同样强劲,在OSWorld-Verified上得分79.5%,并且与基线模型相比,它甚至减少了完成任务所需的步骤数。在网页方面,它在WebArena测试中排名第一,其通用和代理能力已完全超越其训练基础模型,轻松处理长尾请求。

效率与安全:深思熟虑的设计

Qwen-UI-Agent的与众不同之处不仅在于其性能,还在于它的操作方式。该模型可以直接执行命令行操作,而不仅仅是点击按钮。它在单次决策中输出批量操作,缩短了执行轨迹并提高了效率。但能力越大,责任越大。该模型内置了安全机制,在整个过程中都会启动。如果遇到非法或高风险请求,它会拒绝并终止任务。对于支付、数据删除或隐私授权等敏感操作,它会在关键步骤暂停,并等待用户确认后再继续。这种深思熟虑的设计确保了模型虽然强大,但也安全且尊重用户边界。

持续学习与未来潜力

另一个有趣的特点是它能够通过在线强化学习学习超过100步的轨迹,并结合自适应课程学习。这意味着该模型可以随着时间的推移处理越来越复杂的长期任务,不断提高其技能。它不仅仅是一个静态模型;它被设计为不断进化。

为什么这很重要

你可能想知道:我为什么要关心?想象一下,有一个AI助手能像你一样无缝地操作你的手机或电脑——甚至可能更好。它可以自动化重复性任务,帮助你更快地找到信息,或协助复杂的工作流程。通过开源这个模型,阿里巴巴邀请开发者和研究人员在此基础上进行构建,可能加速实用AI助手在现实世界中的发展。

关键要点

  • 现实世界聚焦:Qwen-UI-Agent在真实设备上进行训练和测试,而不仅仅是模拟。
  • 顶级性能:在MobileWorld上得分82.1%,在MobileWorld-Real上得分92.2%,在OSWorld-Verified上得分79.5%。
  • 高效且安全:执行批量操作,支持命令行,并包含强大的安全检查。
  • 开源:可供开发者探索和构建。
  • 持续学习:支持在线强化学习,以改善长期任务。

Image

Image

更多详情,请查看项目主页:https://tongyi-mai.github.io/Qwen-UI-Agent/