AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

谷歌发布Gemini Omni 1.1 Flash 升级视频生成三大核心能力

谷歌AI近期正式推出多模态大模型更新版本Gemini Omni 1.1 Flash,面向视频生成场景新增三项核心能力:最长40秒的智能场景扩展、生成内容首尾帧自定义控制,以及原生4K分辨率超分处理,所有能力均已通过Gemini API面向开发者开放。该版本是谷歌在生成式AI视频赛道布局的重要产品,将大幅降低专业内容创作的技术门槛。

配图

过去半年来,生成式AI视频工具的市场需求持续爆发,从UGC短视频创作到商业影视后期场景,从业者对生成内容的时长、可控性、清晰度的要求不断提升。此前多数商用视频生成模型最多支持20秒左右的输出,且帧级控制能力有限,分辨率大多停留在1080P级别,难以满足专业生产的标准化需求。

此次推出的Gemini Omni 1.1 Flash,核心升级全部围绕视频生成的痛点展开。

首先是40秒智能场景扩展,用户仅需上传一段3-5秒的短视频素材,模型就能基于原有内容的画风、叙事逻辑自动延展生成最长40秒的连贯内容,无需输入复杂的提示词做额外引导。

其次是首尾帧自定义控制,创作者可以提前指定生成视频的第一帧和最后一帧画面,模型会自动补全中间的过渡动画,大幅提升了内容的可控性,特别适合广告、动画等有固定叙事要求的创作场景。

最后是原生4K超分能力,无论是模型生成的视频内容还是用户上传的低清素材,都可以通过Gemini API一键实现无损4K分辨率升级,无需额外接入第三方超分工具,进一步简化了创作流程。

谷歌相关团队透露,后续Gemini Omni系列还会进一步优化视频生成的时长上限,同时增加动态镜头控制、多语言语音同步生成等功能,面向B端创作者推出更多定制化服务。

业内分析认为,此次更新意味着谷歌正式把视频生成能力纳入Gemini的核心商用矩阵,将和OpenAI的Sora系列、国内多模态大模型产品展开直接竞争,未来1-2年内生成式视频的商用成本将下降至少60%,普及速度会远超此前的文本生成类AI工具。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。