AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

英伟达开源60B双塔离散扩散大模型 文本生成效率提升2.42倍

2026年7月2日,英伟达正式发布Nemotron-Labs-TwoTower离散扩散语言模型,相关权重已在Huggingface开源。该60B参数双塔架构模型解决了传统大模型逐token生成速度慢的痛点,文本生成吞吐速度提升2.42倍的同时,综合能力保留原版Nemotron模型的98.7%,且可复用预训练权重降低开发成本。

配图

当前大模型的规模化落地始终受限于推理效率瓶颈:长文本生成场景下,传统逐token串行输出的模式往往需要用户等待数秒甚至数十秒,高并发场景下的算力成本更是居高不下,行业一直在探索不损失效果的效率优化方案,此次英伟达推出的新架构模型正是该方向的突破性成果。

不同于传统大模型逐token串行输出的推理逻辑,Nemotron-Labs-TwoTower采用创新的双塔分工设计:总参数量60B,拆分为两座30B独立神经网络协同工作,每塔仅激活3B参数,同时搭载128个可路由专家模块动态调度算力。其中上下文塔固定冻结,负责留存全文语义信息避免上下文丢失;去噪塔单独针对性训练,依靠扩散机制实现并行文本生成,两塔通过交叉注意力模块实时互通数据。

多类行业基准测试结果显示,该架构在大幅拉高推理吞吐量的同时完全兼顾输出效果:文本生成吞吐速度较同参数级别的传统大模型提升2.42倍,综合能力留存原版Nemotron基础模型的98.7%,几乎没有性能损失。

除了性能层面的突破,该模型的落地门槛也远低于同类自研大模型。据官方介绍,Nemotron-Labs-TwoTower基于现有Nemotron骨干网络改造,可直接复用已经完成的预训练权重,无需从零开始完整训练,能够大幅降低开发侧的算力投入和时间成本。

目前该模型的全部权重已经上传至Huggingface开源平台,中小开发者和企业无需负担千万级别的预训练成本,即可直接部署使用高吞吐的文本生成能力,尤其适配长文本创作、实时代码生成、多轮客服对话等对响应速度要求较高的场景。

此次英伟达推出的双塔离散扩散模型,也为大模型的效率优化提供了新的技术路径。此前离散扩散机制已经在AI图像生成领域验证了并行生成的效率优势,而本次将该机制与大语言模型的混合专家架构、双塔分工设计结合,打破了此前行业“堆参数提性能”的固有思路,证明架构创新能够带来质的效率提升。

后续随着更多开发者参与优化,类似的高效推理架构有望进一步降低大模型的推理成本,推动大模型在端侧设备、实时交互场景的规模化落地。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。