AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

德国黑森林实验室发布Flux3多模态模型 首次支持原生音视频生成

2026年7月24日,德国AI初创企业黑森林实验室正式发布多模态基础模型Flux3。该模型基于自研Self-Flow架构打造,首次实现原生音频生成,可一次性输出20秒音视频同步片段。在720P 10秒生成测试中,Flux3以93%胜率超越Luma Ray3.2、77%胜率碾压Runway Gen-4.5,目前已布局机器人领域专用动作模型研发。

此前全球主流音视频生成模型普遍存在“音画分离”的行业痛点:用户生成视频后需要额外调用音频工具匹配音效、配音,不仅流程繁琐,还容易出现口型错位、音效滞后、场景音不匹配等同步问题,行业始终期待能原生整合音视频生成能力的底层模型出现。

此次公开的第三方盲测数据显示,在10秒720P分辨率视频生成任务中,Flux3以93%的测试胜率超越Luma Ray3.2,以77%的测试胜率碾压Runway Gen-4.5,即便与Seedance2.0、Gemini Omni Flash等顶尖多模态模型对标,也在音画同步、画面流畅度两个核心指标上保持微弱优势。

除了原生音频生成能力外,Flux3还覆盖文本转视频、图像转视频、现有视频扩展生成、关键帧控制转场、多语言交互对话等多元功能,可一次性输出最长20秒的720P音视频同步片段,无需用户进行后期音轨对齐调整。

Flux3的性能突破核心来自黑森林实验室自研的Self-Flow架构,该架构配套了专用的图像、视频、音频、动作四大编解码器,打破了传统多模态模型分模块处理不同类型数据、后期再拼接整合的路径,实现了物理与数字环境信息的统一理解与生成。

技术人士指出,这种统一架构的优势在于,模型生成音视频时可以同时计算画面内容与对应的音效、语音节奏,从底层避免了音画错位的问题,生成效率也比“先出视频后配音频”的传统路径提升40%以上。

除了面向内容创作领域的通用版本外,黑森林实验室还联合机器人公司Mimic Robotics开发了专用的视频动作模型Flux-mimic,该模型可将视觉输入的视频内容直接转化为机器人可执行的动作指令,相当于为具身智能机器人配备了“视觉-动作”的转化中枢。

据了解,黑森林实验室将采取分阶段开放的策略:本月底率先向企业级客户开放Flux3的API接口,个人用户的免费试用通道预计将于今年第四季度上线,面向机器人领域的Flux-mimic模型则将于明年开启内测。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。