AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

谷歌推出全新多模态模型Gemini Omni 原生打通图文音视频生成链路

谷歌日前正式发布新一代跨模态大模型Gemini Omni,作为Gemini家族的全新迭代产品,该模型首次实现了文本、图像、音频、视频四类模态的全链路原生推理,支持用户通过自然对话完成视频的生成与全流程编辑,首发同步上线的轻量化版本Omni Flash,推理速度较前代Gemini Ultra提升2.7倍,大幅降低多模态视频生成的部署门槛。

过去两年AI视频生成赛道的产品迭代速度飞快,但绝大多数工具始终绕不开“模态拼接”的先天缺陷:生成的视频经常出现音频口型不对齐、画面逻辑和文字描述矛盾、动态物体动作崩坏等问题,背后的核心原因,是不同模态的生成过程彼此独立,缺乏统一的底层逻辑协调。

此前全球头部科技厂商推出的多模态大模型,大多采用“组合式架构”:语言模态输出交给大语言模型,图像生成调用独立的扩散模型,音频内容再转交给专属的语音生成模块,最终通过调度层把不同模块的输出拼接在一起。
这种架构虽然能快速搭建出多模态交互的雏形,但也带来了推理延迟高、模态间逻辑冲突概率大、部署成本居高不下等问题,始终无法支撑普通用户实时生成高清短视频的需求,全模态原生统一表征的大模型,成为整个行业等待突破的核心方向。

Gemini Omni是业内首款实现文本、图像、音频、视频四类模态统一原生表征的量产大模型,所有模态的输入输出都在同一个神经网络框架内完成推理,不需要外挂任何独立的生成插件。
普通用户只需要上传一张手绘草稿、输入一段旁白录音,再配上几句简单的文字描述,就能在十几秒内生成一段逻辑连贯、音画完全匹配的高清视频,还可以随时通过对话调整视频里的人物动作、背景色调甚至台词内容,不需要跳转多个编辑工具。首发同步推出的轻量化版本Omni Flash,专门面向ToB的实时生成场景,推理速度比上一代旗舰模型Gemini Ultra快270%,同时视频生成的帧率一致性提升超过40%。

谷歌Gemini产品线核心产品负责人表示,此次公开的视频生成能力只是Gemini Omni的基础功能,后续迭代版本还会开放实时多模态交互能力,用户可以用摄像头、麦克风直接和模型互动,实现零延迟的内容共创。
业内AI产业分析师认为,全链路原生多模态模型的普及,将会彻底打破专业视频生产的技术壁垒,未来个人创作者不需要掌握复杂的剪辑、后期、配音工具,仅靠自然语言对话就能完成全流程内容生产,整个泛内容产业的生产效率将会迎来量级级的提升。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。