问小创

您好,我是AI助手

我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

我会根据您的需求,智能推荐站内收录的AI工具
猜您想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI助手: 我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

英伟达推出Audex统一音频文本大模型 破解多模态能力失衡痛点

2026年7月8日,英伟达正式发布统一音频-文本大语言模型Nemotron-Labs-Audex-30B-A3B(简称Audex)。该模型基于纯文本MoE(混合专家模型)架构搭建,采用单一Transformer解码器,训练数据涵盖1574亿音频token与3205亿文本token,解决了此前多模态模型音频能力升级时文本逻辑下降的行业痛点,可实现音频理解与文本能力的高效平衡。

配图

近两年多模态大模型的迭代主要集中在图文领域,音频交互能力的升级始终存在明显短板。行业普遍的开发逻辑是在原有纯文本大模型的基础上,额外新增独立的音频编码器模块接入,这种方案看似快速实现了音频理解能力,但往往会挤占原有文本模型的参数资源,导致模型的文本推理、逻辑表达能力出现明显下滑,语音助手“听得懂指令却答不出合理内容”的问题频频出现,也让智能座舱、实时翻译等强语音交互场景的落地效果大打折扣。

本次英伟达推出的Audex模型,跳出了传统多模态模型“额外加模块”的开发思路,核心采用纯文本MoE架构+单一Transformer解码器的设计,直接将量化后的音频token投影到已有的文本嵌入空间,无需新增独立音频处理模块,从架构根源上避免了音频能力增强对文本能力的损耗。

为了保障双模态能力的精度,英伟达研究团队为Audex准备了超大规模的训练数据集,其中包含1574亿音频token、3205亿文本token,覆盖日常对话、专业内容播报、环境音识别等多个细分音频场景。更值得关注的是,该架构可直接与现有LLM基础设施无缝兼容,企业无需对现有部署框架做大幅改造即可快速接入,大幅降低了落地成本。

从落地场景来看,Audex的能力刚好匹配了当下多个高速增长的交互需求。在智能座舱场景中,语音助手可以在准确识别用户口语化指令的同时,输出逻辑严谨的操作方案或内容回答;在内容生产领域,该模型可同时完成播客转写、核心内容提炼、多语言翻译等全流程工作,无需多个模型串联调度。

据了解,英伟达后续将逐步开放Audex的API调用权限,面向开发者提供轻量化的接入方案,推动更多语音交互场景的体验升级。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。