问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日,AIGC领域头部企业Stability AI正式推出新一代音频生成模型系列Stable Audio 3。该系列基于快速潜扩散技术架构,采用开源权重开放模式,最高可支持生成时长6分20秒的高保真立体声内容,在生成速度、音频质量、编辑自由度三个维度均实现较前代的大幅提升,为内容创作、影视配音等场景提供了高性价比的技术方案。
这次发布是Stability AI在音频赛道的第三次重要迭代,距离上一代Stable Audio 2发布仅过去8个月,而技术参数的提升幅度远超行业预期。
近年来,短视频、播客、独立游戏等内容赛道的高速增长,带动定制化音频需求年增速超过70%。但此前行业内的音频生成工具始终存在明显短板:闭源商用工具生成上限多在3分钟以内,且API调用成本居高不下;开源模型则普遍存在音质差、生成速度慢、不支持编辑功能的问题,难以满足专业创作者的实际需求。
Stable Audio 3的核心突破来自对快速潜扩散模型架构的深度优化。官方公布的参数显示,该系列模型最高可生成44.1kHz采样率、6分20秒时长的立体声内容,覆盖背景音乐、自然音效、人声配音等几乎所有常见音频创作场景。
和前代产品相比,Stable Audio 3的生成速度提升了32%,同时新增了局部音频编辑功能,创作者仅需输入文本指令即可修改指定时间段的音频风格、内容,无需重新生成整段音频,大幅降低了创作的时间成本。
尤为值得关注的是,Stable Audio 3延续了Stability AI的开源传统,全系列权重均免费开放给开发者下载使用,个人和中小团队可直接本地部署,无需支付额外的API调用费用。
作为靠Stable Diffusion打开AIGC图像市场的头部企业,Stability AI近年来一直在加速多模态领域的布局,先后推出了视频生成、3D生成等多条产品线。本次Stable Audio 3的发布,补全了其在音频赛道的技术短板,也为后续跨模态生成工具的落地打下了基础。
行业分析认为,随着音频生成技术的成熟,AIGC对内容创作行业的改造将从视觉领域延伸到听觉领域,未来普通创作者仅靠文本指令即可完成视频、音频、配音的全流程制作,内容生产的门槛将进一步降低。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。