2026年7月8日,谷歌宣布为Google Photos上线全新生成式AI工具“视频混音”,该功能由Gemini Omni处理器提供算力支持,普通用户无需专业剪辑技能,即可在数秒内完成电影级视频调整与风格化处理。该功能首批面向十余个国家的Google AI Plus、Pro用户开放,是谷歌深化消费级生成式AI布局、对抗行业竞争对手的最新动作。

对于没有系统学习过剪辑软件的普通用户而言,想要把手机里随手拍的生活片段调整为有电影质感的内容,往往需要花费大量时间摸索调光、滤镜、背景处理等操作,而谷歌新推出的这项功能,直接把专业剪辑师的能力打包成了一键操作的轻量化工具。
用户进入Google Photos的“创建”标签页即可直接调用“视频混音”工具,无需跳转至第三方应用。依托Gemini Omni的强模态多媒体处理能力,该工具可实现三类核心操作:一键应用电影级重新照明算法提亮昏暗画面,针对逆光、夜间拍摄的素材优化效果尤为明显;智能识别并替换纯色背景,满足用户自制短综、卡点视频的创意需求;还可将整段视频批量转化为水彩、素描、油画等艺术风格,全程耗时仅需数秒。该功能发布当日即面向美国、印度、日本、韩国、巴西等十余个国家的符合条件的Google AI Plus、Pro用户开放测试。
此次谷歌把生成式AI能力集成到用户基数庞大的相册应用中,本质是对现有生态用户粘性的进一步强化。当前消费级内容创作AI赛道的竞争已经进入白热化阶段:苹果在iOS系统内置的相册应用中推出了AI自动剪辑、智能调色功能,Adobe面向普通用户推出的Express系列工具已经覆盖移动端全场景AI编辑需求,OpenAI旗下的Sora等视频生成工具也在逐步开放C端使用权限,谷歌此次功能更新正是对上述竞争对手的直接回应。
值得注意的是,此次“视频混音”功能的核心算力来自搭载于端侧的Gemini Omni处理器,无需全程上传素材至云端处理,既降低了用户的等待时长,也大幅提升了内容隐私安全性。随着大模型轻量化技术的持续迭代,过去只能在专业工作站上实现的高性能AI处理能力,正在快速下放到普通消费级电子设备中,未来普通用户的内容创作门槛还将进一步降低,UGC内容的整体质感也将迎来整体性提升。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。