问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月24日,德国AI初创企业黑森林实验室正式发布多模态基础模型Flux3,该模型基于自研Self-Flow架构打造,是全球首个支持原生音频生成的多模态基础模型,可一次性生成20秒音画同步内容,在720p分辨率10秒片段生成测试中,对Luma Ray3.2、Runway Gen-4.5的胜率分别达93%、77%,性能领跑全球同类型产品。
长期以来,AI生成音视频内容始终存在“音视分离”的痛点:大部分模型仅支持视频生成,用户输出视频后还需单独匹配音频素材、手动校对时间轴,不仅拉长了内容生产流程,还经常出现口型错位、音效与画面动作不匹配等问题,大幅拉低了生成内容的可用度。
Flux3的核心突破,在于首次将音频生成能力整合进多模态模型的原生底座中,而非采用此前行业普遍的“视频模型+音频模型拼接”的方案。
其搭载的Self-Flow架构同时配备了专用的图像、视频、音频及动作编解码器,实现了对物理世界与数字环境的统一理解与生成,输出内容时无需经过跨模型对齐,从根源上解决了音画不同步的问题。
目前Flux3可支持文本、图像、视频转视频,基于关键帧的转场,以及多角色对话生成等多种能力,单次即可输出最长20秒的音视频同步片段,无需额外后期加工。
从早期公开的盲测数据来看,Flux3的生成质量已经超过当前市面主流的多模态生成产品。在720p分辨率、10秒片段的测试设置下,Flux3对Luma Ray3.2的胜率达到93%,对Runway Gen-4.5的胜率也达到77%,测试维度涵盖画面流畅度、音画同步度、内容与prompt匹配度三个核心指标。
不少内容创作者已经在测试中尝试使用Flux3生产短视频素材、动画分镜、产品宣传片等内容,原本需要数小时完成的音视频初稿,现在仅需十几秒即可生成,内容生产效率提升超80%。
Flux3的发布也为多模态大模型的发展指明了新的路径。过去行业的多模态产品大多为不同模态模型的“组合式”方案,不同模态的理解与生成逻辑彼此独立,很难实现深度协同。
而原生融合的多模态基础模型,将不同模态的感知、生成能力整合到同一底座中,未来还可进一步拓展动作捕捉、3D生成、甚至触觉信号模拟等更多能力,最终实现对真实世界的全方位复刻与创作。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。