AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

MiniMax发布Music3音乐模型 可生成5分钟专业级完整歌曲

2026年8月14日,通用人工智能公司MiniMax正式推出新一代音乐生成模型MiniMax-Music3,用户仅需输入歌词与风格描述即可生成最长5分钟的完整歌曲,输出32kHz、16-bit立体声WAV文件。该模型采用分层自回归架构,基于Qwen3-8B初始化的8B全局LLM搭配0.6B局部LLM,兼顾长程结构把控与声学细节还原。

配图

很长一段时间里,AI生成音乐始终逃不开“片段化”“结构崩”的通病:大多数模型生成上限仅为1-2分钟,一旦拉长时长就会出现曲风跑偏、人声突变、段落逻辑混乱等问题,始终无法满足专业创作的基本需求。而MiniMax此次发布的Music3,正是瞄准这一行业痛点给出的解决方案。

此次Music3的核心创新就是分层自回归架构,摒弃了单一模型兼顾结构与细节的传统路线,将生成任务拆分给两个参数规模差异极大的模型:其中8B参数的全局LLM由Qwen3-8B初始化而来,负责逐帧预测首个RVQ码本,专门把控歌曲的长程语义与结构逻辑,能让生成内容在5分钟时长内始终保持主题、节奏、人声身份的一致性,完整覆盖前奏、主歌、预副歌、桥段等流行音乐全段落结构。

另一个0.6B参数的局部LLM则负责预测每帧剩余的声学码本,填充音色、编曲、音效等细粒度声学细节,二者分工协作既保证了生成质量,也控制了推理成本,避免了单一超大模型带来的算力消耗问题。

不同于多数AI音乐模型仅输出低音质采样文件的设定,Music3的输出标准为32kHz、16-bit立体声WAV格式,无需二次转码即可直接用于内容生产场景。

对于独立音乐人而言,仅需要输入歌词和模糊的风格描述,就能快速生成完整的歌曲Demo,大幅降低前期试错成本;对于短视频创作者、播客主等内容生产者而言,也可以快速定制专属BGM,规避商用版权风险。目前5分钟的生成时长已经覆盖绝大多数流行歌曲、商用BGM的需求。

此前AIGC音乐始终停留在“娱乐化工具”的定位,核心瓶颈就是长时序生成稳定性不足、音质达不到商用标准。MiniMax此次通过大小模型分工的技术路线,在没有大幅提升算力消耗的前提下解决了这两个核心痛点,也为整个AIGC音乐行业的技术迭代提供了新的参考方向。

随着技术成熟度持续提升,未来AI音乐将进一步渗透到专业创作、版权生产、个性化定制等多个场景,整个音乐内容生产的门槛将被进一步拉低,普通用户也能轻松实现音乐创作的需求。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。