阿里巴巴推出Qwen-UI-Agent GUI智能体基座模型,MobileWorld基准达82.1%
本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。
8月20日,阿里巴巴正式推出Qwen-UI-Agent,这是一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索环境。该模型在多项GUI基准测试中达到相应成绩。
在移动端基准MobileWorld上,Qwen-UI-Agent达到82.1%,领先GPT-5.6 Sol 12.0个百分点,领先Claude Opus 4.8 14.6个百分点。在真机基准MobileWorld-Real上达到92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8和GPT-5.6 Sol。在AndroidDaily上达到97.5%。
电脑端方面,在OSWorld-Verified上达到79.5%,超越GPT-5.5和Gemini 3.1 Pro。浏览器与深度搜索方面,在WebArena上达到73.6%,位列所有对比模型第一。GUI Grounding方面,在ScreenSpot-Pro上达到81.5%,其余4个评测基准也刷新SOTA。
Qwen-UI-Agent搭建了覆盖100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建MobileWorld-Real真机基准,包含400多项任务和100多款应用。模型还能直接执行命令行操作,并在单次决策中批量输出多个动作,其中电脑任务中CLI动作占比近半,约40%动作以批量形式输出。安全机制方面,模型将安全判断贯穿任务执行全过程,面对违法或高风险请求直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,在关键步骤主动停手并向用户说明情况。模型还支持在超过100步的超长轨迹上进行在线强化学习训练,配合约10000个并发环境同时rollout。