AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

英伟达发布开源扩散语言模型TwoTower 基于300亿参数Nemotron底座

全球算力巨头英伟达于近期推出全新开源权重扩散语言模型Nemotron-Labs-TwoTower,该模型以冻结的自回归架构Nemotron-3-Nano-30B-A3B为底座研发,兼顾了自回归大模型的语言理解能力与扩散模型的生成稳定性,将为AIGC开发者、AI Agent研发团队提供更低门槛的模型选型方案。

配图

就在生成式AI行业普遍陷入“参数规模堆料边际效益递减”的瓶颈期时,英伟达此次推出的混合架构大模型,为行业技术迭代给出了新的可能。

当前主流生成式大模型普遍采用自回归架构,虽然通用语言理解、指令遵循能力表现优异,但在长文本生成、结构化内容输出、逻辑链较长的推理场景下,容易出现事实幻觉、前后逻辑矛盾、格式错误等问题。而扩散模型虽然生成一致性、可控性更高,却普遍存在语言理解能力短板,难以适配复杂的自然语言指令需求。

过去一年,全球头部AI厂商、科研机构都在探索两种架构的融合路径,试图打破现有技术瓶颈。

此次发布的Nemotron-Labs-TwoTower采用了独特的双塔设计,底座沿用了英伟达此前推出的300亿参数自回归模型Nemotron-3-Nano-30B-A3B,且底座权重处于冻结状态,开发者不需要额外进行二次预训练即可直接调用。在此基础上新增的扩散模块,能够在生成环节对输出内容做实时一致性校验,官方测试数据显示,该模型既保留了原底座95%以上的语言理解与指令遵循能力,又将长文本生成的事实错误率降低了42%,结构化输出的格式准确率提升至98%。

和此前英伟达多数闭源商用的大模型不同,此次TwoTower的全部权重对学术研究、非商用场景免费开放,商用场景也仅需获得英伟达的简易授权即可使用,远低于同类大模型的授权门槛。

据英伟达透露,后续还将基于该双塔架构推出更大参数规模的版本,适配多模态生成、AI Agent动态决策等更多高需求场景。

行业分析认为,此次英伟达推出融合架构的开源大模型,将推动整个行业加速探索自回归+扩散的混合架构路线,未来2-3年内,融合架构大模型的市场占比有望从当前的不足5%提升至30%以上,成为AIGC、通用人工智能赛道的主流技术选型。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。