在2026年谷歌I/O开发者大会上,谷歌正式推出新一代多模态模型Gemini Omni及配套AI创作工具升级包。该模型可无缝整合文本、图像、音频、视频四类输入源,支持自然语言对话式编辑视频内容,可将常规内容后期制作效率提升70%以上,推动AI创作工具从单次生成工具向智能协作伙伴转型。

做过短视频创作的人都有体会:一段3分钟的成品视频,往往需要耗费少则3小时多则数天的后期剪辑时间,调整角色、修改光影、切换风格每一项操作都要反复拖拽时间轴。而谷歌在本届I/O大会上带来的技术升级,正在彻底改变这一现状。
近年来短视频、品牌定制内容、互动媒体的市场规模持续攀升,据行业统计,2025年全球数字内容市场规模突破12万亿美元,但是专业后期制作人才的缺口超过2000万,普通创作者往往受制于专业软件的操作门槛,很难产出高质量的多模态内容。
此前市面上的AI生成工具大多只能实现单次生成,一旦内容不符合用户预期,修改成本甚至高于人工制作,这也成为AI创作工具普及的核心阻碍。
本次谷歌推出的Gemini Omni是其Gemini模型家族的最新迭代产品,核心能力在于实现了全模态输入输出的无缝打通:用户可以同时上传文本脚本、参考图片、配音音频和粗剪视频素材,模型可以直接整合所有信息生成符合要求的完整视频。
更重要的是,本次升级新增的对话式编辑功能,彻底改变了AI创作的交互逻辑:用户不需要掌握专业剪辑术语,只用自然语言就能提出修改需求,比如“把视频30秒处的背景换成夏日的海边,把背景音乐换成更轻快的民谣风格,整体亮度调高10%”,模型可以在几秒内完成修改,还能支持多轮反复调整,完全匹配人工协作的沟通习惯。
据谷歌官方测试数据,使用升级后的AI创作工具,普通创作者完成一支5分钟短视频的时间可以从平均12小时缩短到2小时以内,效率提升超70%。目前这一能力已经同步集成到谷歌旗下的YouTube Create、Workspace等创作产品中,7月1日起面向全球用户开放灰度测试。
谷歌本次技术升级的信号意义远大于产品本身:此前AI创作工具的定位一直是“替代人工的生成器”,要求用户尽可能给出精准的提示词才能得到可用的结果,而Gemini Omni的落地,标志着AI创作工具开始转向“辅助创意的协作伙伴”,可以理解用户的模糊需求,承接反复调整的细碎工作,把创作者从机械的后期操作中解放出来,把更多精力放在创意本身。
有行业分析师指出,随着多模态模型理解和编辑能力的进一步提升,未来3年内,个人创作者独立制作长视频、动画甚至影视剧的门槛会下降90%,整个内容生产行业的分工逻辑都会发生重构。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。