我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?
2026年7月8日,英伟达正式发布统一音频-文本大语言模型Nemotron-Labs-Audex-30B-A3B(简称Audex)。该模型基于纯文本MoE(混合专家模型)架构搭建,采用单一Transformer解码器,训练数据涵盖1574亿音频token与3205亿文本token,解决了此前多模态模型音频能力升级时文本逻辑下降的行业痛点,可实现音频理解与文本能力的高效平衡。

近两年多模态大模型的迭代主要集中在图文领域,音频交互能力的升级始终存在明显短板。行业普遍的开发逻辑是在原有纯文本大模型的基础上,额外新增独立的音频编码器模块接入,这种方案看似快速实现了音频理解能力,但往往会挤占原有文本模型的参数资源,导致模型的文本推理、逻辑表达能力出现明显下滑,语音助手“听得懂指令却答不出合理内容”的问题频频出现,也让智能座舱、实时翻译等强语音交互场景的落地效果大打折扣。
本次英伟达推出的Audex模型,跳出了传统多模态模型“额外加模块”的开发思路,核心采用纯文本MoE架构+单一Transformer解码器的设计,直接将量化后的音频token投影到已有的文本嵌入空间,无需新增独立音频处理模块,从架构根源上避免了音频能力增强对文本能力的损耗。
为了保障双模态能力的精度,英伟达研究团队为Audex准备了超大规模的训练数据集,其中包含1574亿音频token、3205亿文本token,覆盖日常对话、专业内容播报、环境音识别等多个细分音频场景。更值得关注的是,该架构可直接与现有LLM基础设施无缝兼容,企业无需对现有部署框架做大幅改造即可快速接入,大幅降低了落地成本。
从落地场景来看,Audex的能力刚好匹配了当下多个高速增长的交互需求。在智能座舱场景中,语音助手可以在准确识别用户口语化指令的同时,输出逻辑严谨的操作方案或内容回答;在内容生产领域,该模型可同时完成播客转写、核心内容提炼、多语言翻译等全流程工作,无需多个模型串联调度。
据了解,英伟达后续将逐步开放Audex的API调用权限,面向开发者提供轻量化的接入方案,推动更多语音交互场景的体验升级。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。