AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

阿里开源Qwen-UI-Agent GUI智能体 真机多场景性能超行业旗舰

2026年8月21日,阿里巴巴正式推出面向真实场景的GUI智能体基座模型Qwen-UI-Agent,该模型覆盖移动端、PC端、网页端、深度搜索全场景,在MobileWorld移动端测试中拿下82.1%的高分,自建百台真机基准MobileWorld-Real测试成功率达92.2%,综合性能全面超越行业主流旗舰模型,可实现复杂真实设备的无缝操作。

配图

过往GUI智能体的训练测试大多集中在虚拟模拟环境中,一旦落地到硬件配置千差万别、界面逻辑随机可变的真实消费电子设备,性能往往出现30%以上的跳水,始终难以落地到实际使用场景,而Qwen-UI-Agent从研发之初就瞄准了「真机可用」的核心目标。

据了解,Qwen-UI-Agent是国内首个面向全真实交互场景的GUI智能体基座模型,没有采用传统的模拟环境训练路径,而是直接将真实世界里移动端、PC端、网页端的界面交互逻辑,以及深度搜索的信息调用逻辑纳入训练框架,从底层解决了模拟环境与真实场景的适配鸿沟问题。

用户无需针对不同设备、不同系统做单独适配,即可让模型完成各类复杂的跨端操作任务,彻底摆脱了过往智能体“模拟环境满分、真机操作失灵”的行业通病。

在多项权威基准测试中,Qwen-UI-Agent的表现已经全面超越当前行业旗舰模型:
移动端场景下,其在通用测试集MobileWorld中拿下82.1%的准确率,领先海外主流旗舰模型5到8个百分点;在阿里自建的百台不同品牌、不同系统版本的真机测试基准MobileWorld-Real中,任务成功率更是高达92.2%,日常安卓系统操作任务成功率接近满分。

PC端场景下,模型在OSWorld-Verified测试集中取得79.5%的成绩,同时完成同类任务的执行步数比基线模型减少40%,操作效率大幅提升。

网页场景下,其在WebArena网页操作测试集中位列所有参测模型第一,通用智能体能力也保持了通义千问系列模型的一贯优势。

业内人士认为,Qwen-UI-Agent的推出补上了智能体落地最后一公里的短板。面向C端,该模型可以接入各类智能助手,实现自动跨APP订票、填单、信息查询等操作,大幅降低数码产品的使用门槛,尤其能为老年群体、障碍群体提供更友好的交互体验;面向B端,其可以替代传统RPA工具完成各类重复的系统操作、数据跨平台迁移等任务,进一步释放企业人力成本。

目前Qwen-UI-Agent已经正式开源,开发者可直接基于该模型开发各类定制化智能体产品。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。