问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日,英伟达正式推出开源混合专家(MoE)大模型Nemotron 3.5 Lightning与配套路由组件NeMo Switchyard。该模型总参数规模达30B,运行时仅激活3B参数,在保障推理效果接近同规模稠密模型的前提下,大幅降低算力消耗,为企业级AI应用开发、智能体落地提供了更高性价比的开源基座选项,引发AI开发社区广泛关注。

就在全球AI开发者还在为大模型“性能与成本不可兼得”的痛点头疼时,英伟达这次的新品直接踩中了行业最核心的需求:既开放权重支持二次开发,又把推理成本压到了中小团队也能负担的水平。
过去两年,MoE架构凭借“多专家并行、按需激活”的特性,已经成为大模型性能突破的核心方向之一,但市面上主流的开源MoE模型普遍存在激活参数过高、路由效率不足的问题:不少30B以上规模的MoE模型激活参数普遍在8B以上,单卡推理成本仍然偏高,而闭源MoE模型的API调用成本更是让大量垂直行业企业望而却步。
据行业调研数据显示,超过6成的AI开发团队将“推理成本”列为大模型落地的第一阻碍,轻量化高性能开源基座的需求已经连续四个季度保持同比200%以上的增长。
本次发布的Nemotron 3.5 Lightning最核心的优势就是30B总参数规模下仅激活3B参数,相当于用不到7B级稠密模型的推理成本,就能实现接近30B级稠密模型的效果。相比同级别开源MoE模型,其推理速度提升2.7倍,单位token生成成本降低62%。
和模型同步推出的NeMo Switchyard路由组件,则解决了传统MoE模型常见的路由分配不均、部分专家闲置的问题,进一步把模型运行效率提升了15%。同时该组件完全兼容英伟达NeMo开发框架生态,开发者可以直接复用现有的微调、部署工具链,无需额外做适配开发,大幅降低了迁移成本。而且整套方案完全开源,企业可以根据自身需求对模型权重、路由逻辑做二次修改,不用支付额外的版权费用。
从英伟达的产品定位来看,Nemotron 3.5 Lightning的目标场景非常明确:一是AI智能体(Agentic AI)开发,二是垂直行业定制大模型部署。低推理成本、高性能的特性,刚好匹配智能体多轮调用、高并发的需求,而开源开放的特性也方便企业在其基础上训练行业专属模型,适配客服、工业质检、企业知识库、边缘端AI应用等场景。
目前该模型已经正式上线Hugging Face等开源平台,发布不到48小时就已经获得了超过2000次星标,不少开发者已经放出了测试结果:其在代码生成、多轮对话、常识推理等任务上的表现,和主流70B级开源MoE模型的差距不到8%,推理速度却是后者的3倍以上。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。