问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年3月19日,小米正式发布自研语音合成大模型MiMo-V2-TTS,该模型依托小米自研音频分词器与多码本语音-文本联合建模架构,经上亿小时语音数据预训练,具备情感精细化调节、多类方言生成、高质量歌声合成等能力,实现了语音合成技术从机械复读到情感共鸣的质的跨越。
如果你曾吐槽过智能设备的语音播报像“机械念稿”、导航语音情绪永远平得像白开水,小米这次的新模型或许能彻底改变这种固有印象。3月19日小米相关活动现场放出的演示视频里,MiMo-V2-TTS生成的语音既能模仿长辈唠家常的松弛感,也能一秒切换成播音腔念新闻,甚至能模仿喜剧演员的语气耍宝,表现效果几度超出现场观众预期。
和上一代语音合成模型普遍依赖单一文本-语音映射逻辑不同,MiMo-V2-TTS采用了小米自研的Audio Tokenizer音频分词器与多码本语音-文本联合建模架构,这一设计让模型不再是简单的“拼字发音”,而是能捕捉到人类语音里的韵律、停顿、情绪起伏等隐性细节。
上亿小时多来源语音数据的预训练,更是让模型积累了覆盖不同年龄、地域、场景的人类语音样本库,为多风格、高精度的语音生成打下了坚实基础。
目前公开的测试结果显示,MiMo-V2-TTS的能力已经覆盖“演、说、唱”三大核心场景,实用性远超行业现有同类型产品。
在日常对话场景中,它支持从整体定调到局部情绪的精准调节,甚至能实现同一句话内的语气自然转折,比如带着笑意说一句吐槽的话,委屈感里带点不服气的回应,这些过去AI语音很难实现的细腻表达,现在都能稳定输出。
除了说话,该模型的歌声合成能力也达到了商用级别,能精准匹配歌曲的音高、节奏,唱腔自然不生硬,不需要额外的后期调校就能产出符合使用标准的音频内容。
针对国内用户的使用需求,MiMo-V2-TTS还内置了多地方言支持,覆盖东北话、四川话、河南话、粤语、台湾腔等常用地域口音,即便是方言内容也能保留对应的情绪表达,不会出现“方言念稿子”的违和感。
在业内人士看来,MiMo-V2-TTS的落地意味着语音合成技术已经跨过了“清晰准确”到“有共情力”的门槛。接下来该模型大概率会率先接入小米旗下的智能音箱、手机语音助手、车载导航等IoT设备,大幅提升全场景的人机交互体验。除此之外,该模型在有声书制作、虚拟主播、内容配音等领域也有广阔的商业化空间。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。