问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日英伟达AI正式开源发布全新三模态大语言模型Nemotron-Labs-Diffusion,该模型创新性融合自回归AR、扩散生成、自投机解码三大核心技术,单步前向推理可输出Token数达到5.99倍,相比通义千问Qwen3-8B的推理效率实现近6倍跃升,或将彻底改变端侧与云端大模型高吞吐部署的现有行业格局。
过去一年大语言模型的吞吐效率瓶颈始终是行业落地的核心堵点——主流7B-8B参数级开源模型单步前向仅能输出1个Token,高并发场景下动辄需要数倍的算力堆叠才能满足需求,极大拉高了中小开发者的调用成本。
当前开源大模型赛道的竞争已经从参数规模比拼转向效率优化,阿里达摩院推出的Qwen3-8B凭借均衡的性能表现已经成为绝大多数端侧部署场景的首选基准模型,但其单步生成1Token的固有架构限制,还是让高吞吐服务场景的算力成本居高不下,行业普遍期待能在不损失生成质量的前提下,推出支持多Token并行生成的全新架构方案。
英伟达AI推出的Nemotron-Labs-Diffusion首次将三类完全不同的生成范式整合到同一个大语言模型架构中,单步前向传播即可完成最高5.99个Token的生成,效率达到现有Qwen3-8B基准的近6倍。
不同于此前单一采用投机解码的效率优化方案,这套模型同时融合了原生自回归生成的内容可控性、扩散模型的并行生成优势,搭配自研的自投机解码调度机制,不需要额外加载辅助小模型就能实现多Token的稳定输出,从根源上规避了投机解码带来的匹配损耗问题。
目前英伟达已经同步在开源社区开放了该模型的测试权重与推理部署代码,开发者无需对现有推理框架进行大规模改造,就能直接在NVIDIA RTX系列消费级显卡、H系列计算卡上完成部署。
业内分析认为,这套新架构的推出很可能会重构接下来开源大模型的性能评判标准,此前围绕单步1Token架构优化的各类微调、量化方案,都会向适配三模式生成范式的方向转移,进一步拉高大模型服务的性价比天花板。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。