问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
微软研究院近期正式推出开源浏览器操作智能体系列Fara1.5,涵盖4B、9B、27B三种不同参数规模,在业界权威的Online-Mind2Web基准测试中拿到72%的得分,性能全面超越OpenAI Operator与谷歌Gemini 2.5 Computer Use两款同类产品,为端侧浏览器自动化场景落地提供了全新的开源可选方案。
长期以来,网页交互的非标准化属性一直是AI智能体落地的核心阻碍:不同网站的DOM结构差异巨大,动态加载的元素识别难度高,此前多数主流浏览器操作智能体都需要依赖大算力运行,很难下沉到普通用户的端侧设备。这次微软放出的全系列开源方案,直接打破了闭源产品在该赛道的垄断格局。
最近两年AI Agent落地场景快速扩容,浏览器自动操作的需求持续走高:从企业级的批量网页数据爬取、表单自动填报,到C端用户的跨站信息聚合、无障碍网页辅助,都需要能精准识别网页元素、稳定执行点击和输入操作的智能体。
此前市面上表现最好的两款产品分别是OpenAI推出的Operator智能体,以及谷歌旗下Gemini 2.5 Computer Use能力,两者均为闭源服务,企业用户很难基于自身需求做定制化二次开发,部署成本长期居高不下。
这次推出的Fara1.5系列直接覆盖从边缘端到云端的全场景部署需求,4B参数版本可以在8GB显存的普通消费级GPU上流畅运行,甚至可以经过轻量化适配后直接嵌入浏览器插件运行。
在业界通用的Online-Mind2Web测试基准上,Fara1.5最高拿到72%的综合得分,比OpenAI Operator高出7个百分点,比Gemini 2.5 Computer Use高出4个百分点,是当前公开可获取的开源浏览器操作智能体中的最高性能水平。
据公开技术细节显示,该系列模型没有采用主流的“截图+多模态识别”路线,而是直接对网页DOM结构做语义化解析,大幅降低了推理所需的算力消耗,响应速度比同类多模态方案提升32%。
全系列权重开源的属性,意味着中小开发者不需要投入海量算力从零训练智能体,仅需要少量场景微调,就能快速搭建适配特定业务需求的浏览器自动化工具。
行业分析认为,微软此次推出Fara1.5,也是为后续Edge浏览器的Copilot能力升级铺路,后续不排除将该智能体直接集成到浏览器底层,实现无需用户手动操作的一站式网页任务执行,进一步巩固微软在消费级AI端侧生态的竞争力。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。