问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
谷歌AI近期正式推出多模态大模型更新版本Gemini Omni 1.1 Flash,面向视频生成场景新增三项核心能力:最长40秒的智能场景扩展、生成内容首尾帧自定义控制,以及原生4K分辨率超分处理,所有能力均已通过Gemini API面向开发者开放。该版本是谷歌在生成式AI视频赛道布局的重要产品,将大幅降低专业内容创作的技术门槛。

过去半年来,生成式AI视频工具的市场需求持续爆发,从UGC短视频创作到商业影视后期场景,从业者对生成内容的时长、可控性、清晰度的要求不断提升。此前多数商用视频生成模型最多支持20秒左右的输出,且帧级控制能力有限,分辨率大多停留在1080P级别,难以满足专业生产的标准化需求。
此次推出的Gemini Omni 1.1 Flash,核心升级全部围绕视频生成的痛点展开。
首先是40秒智能场景扩展,用户仅需上传一段3-5秒的短视频素材,模型就能基于原有内容的画风、叙事逻辑自动延展生成最长40秒的连贯内容,无需输入复杂的提示词做额外引导。
其次是首尾帧自定义控制,创作者可以提前指定生成视频的第一帧和最后一帧画面,模型会自动补全中间的过渡动画,大幅提升了内容的可控性,特别适合广告、动画等有固定叙事要求的创作场景。
最后是原生4K超分能力,无论是模型生成的视频内容还是用户上传的低清素材,都可以通过Gemini API一键实现无损4K分辨率升级,无需额外接入第三方超分工具,进一步简化了创作流程。
谷歌相关团队透露,后续Gemini Omni系列还会进一步优化视频生成的时长上限,同时增加动态镜头控制、多语言语音同步生成等功能,面向B端创作者推出更多定制化服务。
业内分析认为,此次更新意味着谷歌正式把视频生成能力纳入Gemini的核心商用矩阵,将和OpenAI的Sora系列、国内多模态大模型产品展开直接竞争,未来1-2年内生成式视频的商用成本将下降至少60%,普及速度会远超此前的文本生成类AI工具。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。