问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年8月14日,通用人工智能公司MiniMax正式推出新一代音乐生成模型MiniMax-Music3,用户仅需输入歌词与风格描述即可生成最长5分钟的完整歌曲,输出32kHz、16-bit立体声WAV文件。该模型采用分层自回归架构,基于Qwen3-8B初始化的8B全局LLM搭配0.6B局部LLM,兼顾长程结构把控与声学细节还原。

很长一段时间里,AI生成音乐始终逃不开“片段化”“结构崩”的通病:大多数模型生成上限仅为1-2分钟,一旦拉长时长就会出现曲风跑偏、人声突变、段落逻辑混乱等问题,始终无法满足专业创作的基本需求。而MiniMax此次发布的Music3,正是瞄准这一行业痛点给出的解决方案。
此次Music3的核心创新就是分层自回归架构,摒弃了单一模型兼顾结构与细节的传统路线,将生成任务拆分给两个参数规模差异极大的模型:其中8B参数的全局LLM由Qwen3-8B初始化而来,负责逐帧预测首个RVQ码本,专门把控歌曲的长程语义与结构逻辑,能让生成内容在5分钟时长内始终保持主题、节奏、人声身份的一致性,完整覆盖前奏、主歌、预副歌、桥段等流行音乐全段落结构。
另一个0.6B参数的局部LLM则负责预测每帧剩余的声学码本,填充音色、编曲、音效等细粒度声学细节,二者分工协作既保证了生成质量,也控制了推理成本,避免了单一超大模型带来的算力消耗问题。
不同于多数AI音乐模型仅输出低音质采样文件的设定,Music3的输出标准为32kHz、16-bit立体声WAV格式,无需二次转码即可直接用于内容生产场景。
对于独立音乐人而言,仅需要输入歌词和模糊的风格描述,就能快速生成完整的歌曲Demo,大幅降低前期试错成本;对于短视频创作者、播客主等内容生产者而言,也可以快速定制专属BGM,规避商用版权风险。目前5分钟的生成时长已经覆盖绝大多数流行歌曲、商用BGM的需求。
此前AIGC音乐始终停留在“娱乐化工具”的定位,核心瓶颈就是长时序生成稳定性不足、音质达不到商用标准。MiniMax此次通过大小模型分工的技术路线,在没有大幅提升算力消耗的前提下解决了这两个核心痛点,也为整个AIGC音乐行业的技术迭代提供了新的参考方向。
随着技术成熟度持续提升,未来AI音乐将进一步渗透到专业创作、版权生产、个性化定制等多个场景,整个音乐内容生产的门槛将被进一步拉低,普通用户也能轻松实现音乐创作的需求。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。