AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

黑森林实验室发布Flux3 原生多模态模型实现20秒音画同步生成

2026年7月24日,德国AI初创企业黑森林实验室正式发布多模态基础模型Flux3,该模型基于自研Self-Flow架构打造,是全球首个支持原生音频生成的多模态基础模型,可一次性生成20秒音画同步内容,在720p分辨率10秒片段生成测试中,对Luma Ray3.2、Runway Gen-4.5的胜率分别达93%、77%,性能领跑全球同类型产品。

长期以来,AI生成音视频内容始终存在“音视分离”的痛点:大部分模型仅支持视频生成,用户输出视频后还需单独匹配音频素材、手动校对时间轴,不仅拉长了内容生产流程,还经常出现口型错位、音效与画面动作不匹配等问题,大幅拉低了生成内容的可用度。

Flux3的核心突破,在于首次将音频生成能力整合进多模态模型的原生底座中,而非采用此前行业普遍的“视频模型+音频模型拼接”的方案。

其搭载的Self-Flow架构同时配备了专用的图像、视频、音频及动作编解码器,实现了对物理世界与数字环境的统一理解与生成,输出内容时无需经过跨模型对齐,从根源上解决了音画不同步的问题。

目前Flux3可支持文本、图像、视频转视频,基于关键帧的转场,以及多角色对话生成等多种能力,单次即可输出最长20秒的音视频同步片段,无需额外后期加工。

从早期公开的盲测数据来看,Flux3的生成质量已经超过当前市面主流的多模态生成产品。在720p分辨率、10秒片段的测试设置下,Flux3对Luma Ray3.2的胜率达到93%,对Runway Gen-4.5的胜率也达到77%,测试维度涵盖画面流畅度、音画同步度、内容与prompt匹配度三个核心指标。

不少内容创作者已经在测试中尝试使用Flux3生产短视频素材、动画分镜、产品宣传片等内容,原本需要数小时完成的音视频初稿,现在仅需十几秒即可生成,内容生产效率提升超80%。

Flux3的发布也为多模态大模型的发展指明了新的路径。过去行业的多模态产品大多为不同模态模型的“组合式”方案,不同模态的理解与生成逻辑彼此独立,很难实现深度协同。

而原生融合的多模态基础模型,将不同模态的感知、生成能力整合到同一底座中,未来还可进一步拓展动作捕捉、3D生成、甚至触觉信号模拟等更多能力,最终实现对真实世界的全方位复刻与创作。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。