问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月24日,Black Forest Labs(黑森林实验室)正式以Early Access模式上线FLUX3多模态基础模型,该模型基于Self-Flow自监督流匹配框架开发,支持单次生成最长20秒同步音视频,在10秒720P带声视频人工评测中,对Grok Imagine Video胜率达69%,对Seedance 2.0、Gemini Omni Flash胜率均为52%,多模态能力全面领先前代及同类竞品。

不少AIGC创作者都曾遭遇生成视频音画不同步、时长上限短、跨模态调用繁琐的痛点,而黑森林实验室最新推出的FLUX3,直接从底层架构层面给出了解决方案。此前该实验室推出的FLUX1、FLUX2系列图像生成模型,已经凭借生成质量稳定、细节还原度高的优势,成为商用场景使用率最高的图像生成模型之一。
和多数厂商拼接不同模态模型的方案不同,FLUX3采用统一架构联合学习图像、视频、音频三类数据,基于Self-Flow自监督流匹配框架同步完成三类模态的训练,不需要额外接入音频生成模型做后期对齐,从底层解决了音画不同步的行业通病。
目前FLUX3已经支持文生视频、图生视频、视频生视频、输入音视频续写、关键帧转视频、多语言对话、多镜头串联等七种创作模式,覆盖了短视频制作、影视分镜预演、广告创意输出等多数内容创作场景的核心需求,单次生成最高可输出20秒同步音视频,时长上限超过多数同类产品。
在官方公布的人工盲测数据中,针对10秒720P带声视频的生成效果,FLUX3对比xAI旗下的Grok Imagine Video达到69%的胜率,对比字节跳动的Seedance 2.0、谷歌的Gemini Omni Flash两款主流产品,胜率也均达到52%,在画面清晰度、内容匹配度、音频同步性三个核心维度的表现均超过竞品。
据了解,此次评测采用双盲对照方式,由120名来自内容创作、影视制作、AI技术领域的专业评审打分,排除了品牌偏好对评测结果的干扰,数据参考性较强。
目前FLUX3仅面向受邀客户开放Early Access测试资格,后续将逐步开放公开API接口和个人用户试用通道。行业分析师认为,FLUX3的出现将进一步降低专业音视频内容的制作门槛,中小创作者无需掌握复杂的剪辑和音频处理技能,即可快速生成符合商用要求的音视频素材。
未来随着模型迭代,FLUX系列还有望进一步延长生成时长、提升分辨率,甚至支持完整的短剧、广告片全流程生成,给内容生产行业带来更深度的变革。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。