问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年6月25日,谷歌DeepMind正式宣布为旗下大语言模型Gemini 3.5 Flash集成原生计算机使用能力,开发者可依托单一模型构建支持浏览器、手机、桌面端跨平台操作的AI智能体,无需再进行多模型切换与上下文传递,可大幅降低复杂长任务的中途失败概率,显著简化AI智能体的开发流程。

在此次升级前,计算机操作能力一直作为独立模型单独提供,开发者要搭建一个能跨设备执行任务的AI智能体,往往需要同时调用推理、视觉识别、操作执行等多个不同模型,仅不同模型间的上下文同步逻辑就要占整体开发工作量的一半以上。
过去两年AI智能体的商业化落地一直不及预期,行业调研显示,近6成开发者认为多模型切换的上下文丢失是导致智能体任务失败的首要原因。尤其是涉及跨设备的长周期任务,比如帮用户完成“查询当月账单-生成报销表格-同步到企业OA系统”的流程,中间需要切换至少3个不同的模型模块,任何一次上下文传递出错都会导致任务中断,需要用户反复确认,体验极差。
此前不少厂商尝试通过中间件适配的方式解决多模型上下文同步问题,但额外的适配环节不仅拉长了开发周期,还会进一步推高推理成本,始终没能形成可大规模推广的解决方案。
谷歌DeepMind此次的升级,本质是把原本独立的计算机操作模块直接融入Gemini 3.5 Flash的基础架构中,和模型原有的搜索、地图调用、多模态理解能力完全打通。这就相当于给AI装了一套原生的“肢体控制系统”,不需要再在“大脑”和“四肢”之间来回传递指令,上下文信息可以在所有能力模块之间自然流动,完全不需要开发者手动编写同步逻辑。
根据谷歌内部测试数据,采用新架构开发的跨平台智能体,复杂长任务的执行成功率比原有方案提升了42%,开发周期可以缩短60%以上,此前需要3-5人团队花费两周完成的智能体开发工作,现在1个开发者3天就能完成。同时由于只需要调用单一模型,智能体的推理成本也比原有方案下降了35%左右,更适合大规模商业化落地。
Gemini 3.5 Flash本身就是谷歌主打低延迟、高性价比的大模型产品,此次新增原生操作能力后,进一步拓宽了其落地场景。面向C端的个人助理类应用可以快速实现跨设备操作能力,帮用户自动完成批量整理文件、同步多平台日程、抢票等高频操作;面向B端的企业服务商也能基于该模型快速搭建自动化流程工具,替代大量重复的人工电脑操作。
不少行业分析师认为,此次升级将会推动AI智能体的落地门槛进一步降低,预计2027年面向消费端的可自主操作设备的AI助理渗透率会提升30%以上,同时也会倒逼其他大模型厂商跟进同类能力的研发,进一步推动AI从“信息交互”向“行动交互”升级。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。