问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月2日,英伟达正式发布Nemotron-Labs-TwoTower离散扩散语言模型,相关权重已在Huggingface开源。该60B参数双塔架构模型解决了传统大模型逐token生成速度慢的痛点,文本生成吞吐速度提升2.42倍的同时,综合能力保留原版Nemotron模型的98.7%,且可复用预训练权重降低开发成本。

当前大模型的规模化落地始终受限于推理效率瓶颈:长文本生成场景下,传统逐token串行输出的模式往往需要用户等待数秒甚至数十秒,高并发场景下的算力成本更是居高不下,行业一直在探索不损失效果的效率优化方案,此次英伟达推出的新架构模型正是该方向的突破性成果。
不同于传统大模型逐token串行输出的推理逻辑,Nemotron-Labs-TwoTower采用创新的双塔分工设计:总参数量60B,拆分为两座30B独立神经网络协同工作,每塔仅激活3B参数,同时搭载128个可路由专家模块动态调度算力。其中上下文塔固定冻结,负责留存全文语义信息避免上下文丢失;去噪塔单独针对性训练,依靠扩散机制实现并行文本生成,两塔通过交叉注意力模块实时互通数据。
多类行业基准测试结果显示,该架构在大幅拉高推理吞吐量的同时完全兼顾输出效果:文本生成吞吐速度较同参数级别的传统大模型提升2.42倍,综合能力留存原版Nemotron基础模型的98.7%,几乎没有性能损失。
除了性能层面的突破,该模型的落地门槛也远低于同类自研大模型。据官方介绍,Nemotron-Labs-TwoTower基于现有Nemotron骨干网络改造,可直接复用已经完成的预训练权重,无需从零开始完整训练,能够大幅降低开发侧的算力投入和时间成本。
目前该模型的全部权重已经上传至Huggingface开源平台,中小开发者和企业无需负担千万级别的预训练成本,即可直接部署使用高吞吐的文本生成能力,尤其适配长文本创作、实时代码生成、多轮客服对话等对响应速度要求较高的场景。
此次英伟达推出的双塔离散扩散模型,也为大模型的效率优化提供了新的技术路径。此前离散扩散机制已经在AI图像生成领域验证了并行生成的效率优势,而本次将该机制与大语言模型的混合专家架构、双塔分工设计结合,打破了此前行业“堆参数提性能”的固有思路,证明架构创新能够带来质的效率提升。
后续随着更多开发者参与优化,类似的高效推理架构有望进一步降低大模型的推理成本,推动大模型在端侧设备、实时交互场景的规模化落地。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。