AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

英伟达AI发布三模式大语言模型 推理Token效率较Qwen3-8B提升六倍

近日英伟达AI正式开源发布全新三模态大语言模型Nemotron-Labs-Diffusion,该模型创新性融合自回归AR、扩散生成、自投机解码三大核心技术,单步前向推理可输出Token数达到5.99倍,相比通义千问Qwen3-8B的推理效率实现近6倍跃升,或将彻底改变端侧与云端大模型高吞吐部署的现有行业格局。

过去一年大语言模型的吞吐效率瓶颈始终是行业落地的核心堵点——主流7B-8B参数级开源模型单步前向仅能输出1个Token,高并发场景下动辄需要数倍的算力堆叠才能满足需求,极大拉高了中小开发者的调用成本。

当前开源大模型赛道的竞争已经从参数规模比拼转向效率优化,阿里达摩院推出的Qwen3-8B凭借均衡的性能表现已经成为绝大多数端侧部署场景的首选基准模型,但其单步生成1Token的固有架构限制,还是让高吞吐服务场景的算力成本居高不下,行业普遍期待能在不损失生成质量的前提下,推出支持多Token并行生成的全新架构方案。

英伟达AI推出的Nemotron-Labs-Diffusion首次将三类完全不同的生成范式整合到同一个大语言模型架构中,单步前向传播即可完成最高5.99个Token的生成,效率达到现有Qwen3-8B基准的近6倍。
不同于此前单一采用投机解码的效率优化方案,这套模型同时融合了原生自回归生成的内容可控性、扩散模型的并行生成优势,搭配自研的自投机解码调度机制,不需要额外加载辅助小模型就能实现多Token的稳定输出,从根源上规避了投机解码带来的匹配损耗问题。

目前英伟达已经同步在开源社区开放了该模型的测试权重与推理部署代码,开发者无需对现有推理框架进行大规模改造,就能直接在NVIDIA RTX系列消费级显卡、H系列计算卡上完成部署。
业内分析认为,这套新架构的推出很可能会重构接下来开源大模型的性能评判标准,此前围绕单步1Token架构优化的各类微调、量化方案,都会向适配三模式生成范式的方向转移,进一步拉高大模型服务的性价比天花板。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。