我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?
AI开发工具厂商Cursor近日宣布开源名为Mixture-of-Kittens(简称MoK)的确定性混合专家(MoE)训练大内核,该项目采用Apache-2.0开源协议,专为英伟达GB300 NVL72机架设计,在MXFP8精度场景下训练效率较现有方案提升2.37倍,解决了此前大规模MoE模型训练的一致性波动与算力浪费问题,为大模型厂商训练超大规模稀疏模型提供了高性价比的底层工具选择。

从2025年下半年开始,英伟达GB300芯片就陆续交付给全球头部大模型厂商,不少厂商斥资数十亿采购的整机柜集群,实际运行MoE训练任务时的算力利用率却始终低于40%,这一痛点直到Cursor的新开源项目发布才迎来了突破性的解决方案。
混合专家(MoE)架构已经成为当前超大规模大模型的主流技术路线,OpenAI GPT-4o、Anthropic Claude 3.5 Opus等头部产品均采用了该架构,通过激活部分参数的方式降低推理和训练成本。但长期以来,MoE训练的底层内核始终存在两大核心问题:一是路由调度的随机性导致训练结果不可复现,同一份数据、同一套参数多次训练得到的模型效果存在差异,极大提升了调参难度;二是主流内核未能适配最新的硬件架构,尤其是GB300 NVL72机架高达3.6TB/s的NVLink互联带宽,传统内核根本无法跑满,造成了大量的算力浪费。
此次开源的MoK内核正是针对上述两大痛点设计,核心优势集中在确定性与极致性能两个维度。
首先是全链路确定性设计,MoK通过固定的专家路由调度逻辑、统一的多卡通信时序,实现了训练过程的完全可复现,哪怕训练任务中途中断重启,续跑后的梯度更新、最终模型效果也和连续训练的结果完全一致,解决了困扰行业多年的MoE训练不可控问题。
其次是针对GB300 NVL72的深度适配,MoK作为专门为新一代整机柜集群设计的大内核,重构了多卡通信、专家负载均衡的逻辑,把跨卡通信损耗降到了5%以内,实测在MXFP8精度的万亿参数MoE训练场景下,性能达到现有主流内核的2.37倍,相当于直接将集群的有效训练能力提升了一倍以上。
值得注意的是,MoK采用了商业友好的Apache-2.0开源协议,企业用户可以直接修改、集成到自己的训练框架中,不需要支付任何版权费用,也不需要开放自己的修改代码。
作为一家以AI代码编辑器为核心产品的厂商,Cursor此次开源底层训练内核,本质是其内部大模型训练过程中的技术溢出。此前这类底层算力优化工具大多由云厂商或者英伟达这类硬件企业推出,要么不开源,要么需要绑定自身的云服务,MoK的出现给了大模型厂商一个中立、免费、高性能的新选择。
据行业测算,MoK普及后,超大规模MoE模型的训练成本将下降40%左右,原本只有头部厂商能负担的万亿参数模型研发,未来中小创业公司也可以通过采购GB300集群加MoK内核的方式实现,有望进一步加速大模型技术的迭代速度。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。