AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

火山引擎发布豆包音频生成模型1.0 单指令生成影视级完整音频

2026年6月23日,字节跳动旗下云服务品牌火山引擎正式发布豆包音频生成模型1.0(Doubao-Seed-Audio 1.0)。该模型支持文本、音频多模态输入,可通过单条Prompt同步生成对白、音效、背景音乐全要素音频内容,角色声音连续10分钟不串戏,彻底替代传统音频制作多轨剪辑流程,大幅降低专业内容产出门槛。

配图

有声内容创作者林默最近刚赶完一档品牌定制播客的样片,放在过去,单是15分钟内容的配音、音效对位、多轨混音就要耗掉她2天时间,这次她只用了不到1小时就完成了全部内容生产——支撑这一效率跃升的,正是火山引擎刚推出的这款音频大模型。

过去多年,音频内容生产始终是重人力、重专业的领域:一段符合上线标准的有声剧、播客、影视配音或品牌音频,需要经过台词录制、音效素材匹配、多轨对齐、混音调整等多个环节,重度依赖专业后期人员的技术能力,单人单天产出的成品内容通常不超过30分钟。

据国内音频内容行业协会的统计数据,2025年国内音频内容市场规模同比增长27%,但专业后期制作人才缺口已突破12万,供需错配直接限制了音频内容的供给规模,也推高了专业音频内容的生产成本。

豆包音频生成模型1.0的核心创新,是实现了全音频要素的端到端同步生成,彻底打破了传统音频生产“分环节制作、多轨剪辑”的工作流。

用户只需要输入一条Prompt指令,就可以同时定义多个角色的台词、语气、情绪、口音甚至停顿、叹息等细节,模型会自动匹配对应的环境音效和适配情绪的背景音乐,输出即可直接上线使用,完全省去了手动对齐、多轨混音的复杂后期环节。用户相当于直接扮演“音频导演”的角色,不需要掌握任何专业剪辑技能,就能拿到可直接上线的成片。

针对长音频生成场景普遍存在的角色音色漂移、音效衔接断层等行业通病,该模型通过优化长序列特征对齐能力,实现了连续10分钟以上长音频的角色特征稳定输出,哪怕是多角色交叉对话的长篇内容,也不会出现角色声音“串戏”的问题。此外,该模型还支持文本、音频双模态输入,用户可以上传已有音色样本来定制专属角色音,进一步满足个性化内容生产需求。

据了解,目前豆包音频生成模型1.0已经在有声书、播客、影视后期、虚拟人配音等多个场景开启内测,首批接入的十余家内容团队反馈显示,其音频内容产出效率平均提升超过85%,生产成本平均降低70%。

有行业分析师指出,随着这类端到端音频生成模型的成熟落地,未来普通用户也可以通过简单指令快速完成专业级音频作品,整个音频内容生产的门槛将被进一步拉低,甚至可能催生全新的UGC音频内容生态——用户可以自己生成定制化的有声内容、专属播客节目甚至个人配音的影视片段,音频内容的供给形态也将更加多元。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。