英伟达发布30B参数Audex大模型 原生融合音文双模态能力

2026年7月,英伟达正式推出300亿参数混合专家架构音文统一大模型Audex(全称Nemotron-Labs-Audex-30B-A3B)。该模型在保留原有Nemotron系列骨干大模型成熟文本推理能力的基础上,首次实现音频理解、音频生成能力的原生集成,解决了此前跨模态模型能力偏科、多模块调用成本高的行业痛点,目前相关模型权重已面向开发者开放。

配图

作为近年来语音AI领域呼声最高的技术方向之一,端到端音文统一大模型的落地一直面临技术瓶颈。过去两年多模态大模型的落地主要集中在图文领域,音文交互场景长期依赖“ASR语音识别-文本大模型推理-TTS语音生成”的多模块拼接方案。

这套方案不仅部署成本高、响应延迟长,还容易出现上下文衔接偏差、风格不统一的问题:比如智能客服回复的语音情绪和文本内容不匹配,有声书生成需要手动调整多轮参数才能符合文本情感,行业一直期待端到端的音文统一大模型出现。

这次英伟达推出的Audex采用300亿参数的MoE混合专家架构,和过往在文本大模型外挂音频模块的方案不同,研发团队在预训练阶段就将音频信号和文本信号纳入同一向量空间训练,从底层实现了两种模态能力的协同。

在新增音频理解、音频生成能力的同时,完全保留了Nemotron骨干大模型的文本推理水平,第三方测试数据显示其通用文本问答、逻辑推理等核心指标下降幅度不到1%,几乎可以完全替代原有纯文本大模型的使用场景。

目前该模型的开源权重已经面向全球开发者开放,可直接下载部署,非商用场景完全免费,商用场景也仅需极低成本的授权即可使用。

据行业人士测算,端到端的音文统一大模型可将播客生成、有声书制作的平均流程缩短60%以上,创作者只需输入核心文本,即可同时获得内容润色、章节大纲、多风格音频生成的全套输出,无需在多个工具之间跳转。

在智能交互场景中,该模型可将语音交互的响应延迟降低40%,同时大幅提升语义理解的准确率。后续英伟达还计划基于同一架构推出12B参数的端侧版本,以及70B参数的高性能云侧版本,覆盖从消费级设备到企业级服务的多元需求。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。