问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月20日阿里巴巴正式发布GUI智能体基座模型Qwen-UI-Agent,该模型覆盖移动端、电脑端、网页端、深度搜索全场景,在MobileWorld基准测试中获82.1%的得分,分别领先GPT-5.6Sol、Claude Opus4.8达12.0、14.6个百分点,多项核心指标超越行业旗舰模型,刷新GUI智能体性能天花板。

与此前市场上多数停留在文本交互阶段的智能体不同,GUI智能体的核心能力是直接识别、理解各类电子设备的图形用户界面元素,自主规划操作路径完成用户指令,无需依赖应用开放的API接口,被视为下一代人机交互的核心载体。
本次发布的Qwen-UI-Agent在全场景基准测试中均拿出了超行业预期的成绩,其中移动端表现尤为突出。在行业通用的MobileWorld基准测试中拿到82.1%的得分,分别比GPT-5.6Sol、Claude Opus4.8高出12.0个百分点和14.6个百分点;在更贴近用户真实使用场景的MobileWorld-Real基准中,得分达到92.2%,同时超越Gemini3.1 Pro等头部竞品;而在针对日常高频操作场景的AndroidDaily基准中,得分更是高达97.5%,接近满分水平。
在电脑端与浏览器场景下,该模型在OSWorld-Verified基准中也拿到了79%的得分,同样处于行业第一梯队,可覆盖多数办公、网页操作需求。
过去两年,全球科技企业对大模型的竞争已经从通用文本生成能力,延伸到垂直场景的落地能力,而GUI智能体因为可直接适配现有软硬件生态、无需重构应用底层接口,被公认为落地速度最快的AI方向之一。
此前OpenAI、Anthropic、谷歌均已发布过各自的GUI智能体相关技术,但受限于多模态理解能力、操作路径规划能力的短板,在复杂操作场景的准确率始终难以突破80%的商用门槛,本次阿里Qwen-UI-Agent的跑分突破,也意味着国内厂商在该赛道首次拿到了全球领先的技术话语权。
据了解,Qwen-UI-Agent目前已经在阿里内部多个业务线启动灰度测试,包括钉钉的自动化办公流程、淘宝的智能导购助手、支付宝的便民服务操作等场景,预计最快2026年第四季度就会向企业客户开放API调用接口。
业内分析认为,该模型落地后,不仅可以降低老年群体、残障群体的电子设备操作门槛,也可为企业大幅降低重复性操作的人力成本,仅国内办公自动化、智能客服两个赛道,每年就可撬动超千亿的市场空间。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。