问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
7月9日英伟达正式发布全新大语言模型Nemotron-Labs-3-Puzzle-75B-A9B,该模型基于原有Nemotron-3-Super通过迭代拼图压缩技术研发,采用混合MoE架构,在用户吞吐量完全匹配的前提下实现2.03倍服务器端吞吐量提升,大幅降低大模型推理成本,为企业级AI应用规模化落地提供了更高性价比的算力底座选项。

在当前大模型商业化竞速阶段,推理算力成本已经占到AI企业运营成本的60%以上,如何在不损失用户响应速度、输出质量的前提下提升算力效率,是全行业共同攻坚的核心命题。英伟达此次推出的新模型,正是瞄准这一行业痛点给出的针对性方案。
过去两年大模型参数规模的快速扩张,直接推高了部署端的算力门槛。对面向C端的对话AI、AIGC工具而言,峰值期的用户请求往往需要调用数倍于平日的服务器资源,闲置算力的浪费进一步拉高了平均成本;对ToB的企业级AI服务、智能体应用而言,高频次的推理调用成本,已经成为不少中小企业落地大模型的最大阻碍。
此前英伟达推出的Nemotron-3-Super大模型,已经凭借优秀的多任务能力成为不少企业的首选底座,但其75B以上的参数规模,也对部署端的算力提出了很高要求。
此次发布的Nemotron-Labs-3-Puzzle-75B-A9B,核心是采用了英伟达自研的迭代拼图(Iterative Puzzle)压缩技术,在保留原有Nemotron-3-Super 95%以上性能表现的前提下,完成了模型参数的高效压缩。
同时该模型采用混合MoE(混合专家模型)架构,能够根据推理请求的复杂程度动态调用不同的参数模块,避免了全参数激活带来的算力浪费。官方测试数据显示,在用户吞吐量完全匹配、输出质量无明显差异的前提下,新模型的服务器端吞吐量达到原有版本的2.03倍,相当于同等算力资源下能够承载的用户请求量直接翻倍。
这一效率提升的直接价值,是大模型部署成本的大幅下降。据行业测算,推理效率翻倍意味着单用户的推理成本可以降低45%以上,原本难以承受高频调用成本的智能客服、企业知识库、Agent智能体等应用,规模化落地的门槛将大幅降低。
另有行业分析师指出,英伟达此次推出的压缩混合MoE技术路线,也为大模型行业指明了新的发展方向:此前行业普遍追求参数规模的扩张,未来兼顾性能和效率的压缩优化、架构创新,将成为厂商竞争的核心赛道。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。