问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
德国AI初创黑森林实验室于2026年7月23日正式推出多模态基础模型Flux3,该模型基于自研Self-Flow架构打造,是全球首款支持原生音频生成的多模态模型,可一次性输出20秒音视频同步片段,在720p分辨率生成测试中对Luma Ray3.2胜率达93%、对Runway Gen-4.5胜率达77%,标志着生成式音视频技术落地进入全新阶段。
很长一段时间里,生成式视频领域始终面临两大痛点:一是音画同步需要后期二次加工,效率低下;二是可生成的高清视频时长普遍偏短,难以满足商用需求。这一僵局在2026年7月23日迎来破局,德国AI初创黑森林实验室发布的新一代多模态模型,直接把行业天花板抬到了新高度。
本次发布的Flux3基于自研的Self-Flow架构打造,配备了专门的图像、视频、音频、动作四大编解码器,实现了对物理世界和数字场景的统一理解与生成。官方公布的720p分辨率、10秒片段生成测试采用行业通用的盲测评分机制,由20名资深内容创作者和AI技术专家共同打分,数据可信度较高:Flux3对比Luma Ray3.2的胜率达到93%,对比Runway Gen-4.5的胜率达到77%,即便是对标Seedance2.0、Gemini Omni Flash等顶尖多模态模型,也保持着稳定的微弱优势。
除了生成质量领先,Flux3还支持多样化的生成任务,涵盖文本转视频、图像转视频、视频转视频、关键帧驱动转场、多语言对话交互等功能,适配不同场景的使用需求。
Flux3最受行业关注的突破,是成为全球首款支持原生音频生成的多模态基础模型。此前市面上的生成式视频产品,大多需要先生成无声视频,再通过单独的音频生成工具配音,不仅多了一道工序,还经常出现口型对不上、音效和画面动作不同步等问题,仅后期调整就需要占用创作者近40%的制作时间。
而Flux3可以一次性输出最长20秒的音视频同步片段,全程无需后期拼接调整,不少从业者测试后表示,Flux3生成的20秒片段中,背景音效、人物语音和画面动作的匹配度几乎没有可感知的误差,达到了专业剪辑师的人工调整水平,直接把生成式视频的落地效率提升了一个层级。
除了内容创作领域的应用,黑森林实验室还联合机器人公司Mimic Robotics,开发了适配机器人交互场景的Flux3定制版本,可通过生成仿真动作视频指导机器人完成复杂操作,大幅降低机器人的训练成本。
内容创作端的落地则更为直接,短视频制作、影视项目分镜预演、广告素材生成、虚拟人直播内容生产等场景,都能借助Flux3的原生音视频生成能力,大幅降低制作门槛和时间成本。据了解,黑森林实验室预计将于8月开放Flux3的API调用权限,后续还将迭代支持更长时长的音视频生成功能。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。