问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
谷歌日前正式发布新一代跨模态大模型Gemini Omni,作为Gemini家族的全新迭代产品,该模型首次实现了文本、图像、音频、视频四类模态的全链路原生推理,支持用户通过自然对话完成视频的生成与全流程编辑,首发同步上线的轻量化版本Omni Flash,推理速度较前代Gemini Ultra提升2.7倍,大幅降低多模态视频生成的部署门槛。
过去两年AI视频生成赛道的产品迭代速度飞快,但绝大多数工具始终绕不开“模态拼接”的先天缺陷:生成的视频经常出现音频口型不对齐、画面逻辑和文字描述矛盾、动态物体动作崩坏等问题,背后的核心原因,是不同模态的生成过程彼此独立,缺乏统一的底层逻辑协调。
此前全球头部科技厂商推出的多模态大模型,大多采用“组合式架构”:语言模态输出交给大语言模型,图像生成调用独立的扩散模型,音频内容再转交给专属的语音生成模块,最终通过调度层把不同模块的输出拼接在一起。
这种架构虽然能快速搭建出多模态交互的雏形,但也带来了推理延迟高、模态间逻辑冲突概率大、部署成本居高不下等问题,始终无法支撑普通用户实时生成高清短视频的需求,全模态原生统一表征的大模型,成为整个行业等待突破的核心方向。
Gemini Omni是业内首款实现文本、图像、音频、视频四类模态统一原生表征的量产大模型,所有模态的输入输出都在同一个神经网络框架内完成推理,不需要外挂任何独立的生成插件。
普通用户只需要上传一张手绘草稿、输入一段旁白录音,再配上几句简单的文字描述,就能在十几秒内生成一段逻辑连贯、音画完全匹配的高清视频,还可以随时通过对话调整视频里的人物动作、背景色调甚至台词内容,不需要跳转多个编辑工具。首发同步推出的轻量化版本Omni Flash,专门面向ToB的实时生成场景,推理速度比上一代旗舰模型Gemini Ultra快270%,同时视频生成的帧率一致性提升超过40%。
谷歌Gemini产品线核心产品负责人表示,此次公开的视频生成能力只是Gemini Omni的基础功能,后续迭代版本还会开放实时多模态交互能力,用户可以用摄像头、麦克风直接和模型互动,实现零延迟的内容共创。
业内AI产业分析师认为,全链路原生多模态模型的普及,将会彻底打破专业视频生产的技术壁垒,未来个人创作者不需要掌握复杂的剪辑、后期、配音工具,仅靠自然语言对话就能完成全流程内容生产,整个泛内容产业的生产效率将会迎来量级级的提升。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。