AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Stability AI推出Stable Audio 3 刷新开源长音频生成纪录

近日,AIGC领域头部企业Stability AI正式推出新一代音频生成模型系列Stable Audio 3。该系列基于快速潜扩散技术架构,采用开源权重开放模式,最高可支持生成时长6分20秒的高保真立体声内容,在生成速度、音频质量、编辑自由度三个维度均实现较前代的大幅提升,为内容创作、影视配音等场景提供了高性价比的技术方案。

这次发布是Stability AI在音频赛道的第三次重要迭代,距离上一代Stable Audio 2发布仅过去8个月,而技术参数的提升幅度远超行业预期。

近年来,短视频、播客、独立游戏等内容赛道的高速增长,带动定制化音频需求年增速超过70%。但此前行业内的音频生成工具始终存在明显短板:闭源商用工具生成上限多在3分钟以内,且API调用成本居高不下;开源模型则普遍存在音质差、生成速度慢、不支持编辑功能的问题,难以满足专业创作者的实际需求。

Stable Audio 3的核心突破来自对快速潜扩散模型架构的深度优化。官方公布的参数显示,该系列模型最高可生成44.1kHz采样率、6分20秒时长的立体声内容,覆盖背景音乐、自然音效、人声配音等几乎所有常见音频创作场景。

和前代产品相比,Stable Audio 3的生成速度提升了32%,同时新增了局部音频编辑功能,创作者仅需输入文本指令即可修改指定时间段的音频风格、内容,无需重新生成整段音频,大幅降低了创作的时间成本。

尤为值得关注的是,Stable Audio 3延续了Stability AI的开源传统,全系列权重均免费开放给开发者下载使用,个人和中小团队可直接本地部署,无需支付额外的API调用费用。

作为靠Stable Diffusion打开AIGC图像市场的头部企业,Stability AI近年来一直在加速多模态领域的布局,先后推出了视频生成、3D生成等多条产品线。本次Stable Audio 3的发布,补全了其在音频赛道的技术短板,也为后续跨模态生成工具的落地打下了基础。

行业分析认为,随着音频生成技术的成熟,AIGC对内容创作行业的改造将从视觉领域延伸到听觉领域,未来普通创作者仅靠文本指令即可完成视频、音频、配音的全流程制作,内容生产的门槛将进一步降低。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。