发生了什么
阿里巴巴于 8 月 21 日推出以真实世界为中心的 GUI 智能体基座模型 Qwen-UI-Agent,并正式开源。该模型旨在打破传统模拟测试的局限,让模型具备在复杂真实设备上无缝操作应用的能力,覆盖移动端、电脑端、网页端与深度搜索环境。
性能数据方面,该模型在 MobileWorld 测试中斩获 82.1% 高分,领先多个国际旗舰模型;在自建百台真机基准 MobileWorld-Real 上成功率高达 92.2%;电脑端 OSWorld-Verified 取得 79.5% 成绩;WebArena 网页测试位列所有对比模型第一。
- 团队搭建了覆盖 100 多台真实手机、150 多个应用的真机移动环境,用于任务构建、轨迹采集及模型训练
- 推出包含 400 多个任务的 MobileWorld-Real 真机基准
- 支持 GUI 界面操作与命令行操作,单次决策可批量输出动作以提升效率
为什么重要
GUI 智能体被认为是 AI 从对话走向实际执行的关键路径。Qwen-UI-Agent 的开源,为「模拟到真实」的最后一公里提供了可复用的模型与基准,企业可在内部系统自动化、软件测试、客服操作等领域基于其构建具体应用。
安全机制方面,该模型面对违法或高风险请求直接拒绝终止;涉及支付、数据删除等敏感场景时主动停手等待用户确认。此外支持超 100 步超长轨迹在线强化学习训练,配合自适应课程学习攻克长程任务。
仍待观察
需要留意的是,92.2% 的成功率是在受控条件下取得的,日常使用中 App 更新、系统弹窗、网络波动等变量都可能影响实际表现。模型开源后社区的真实反馈,才是检验其实用性的关键标尺。

