问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
Meta AI近期发布自研全新RDMA传输协议MetaRoCE,该协议采用从零搭建的原生架构,专门适配超大规模AI训练场景下的以太网集群需求,在1%网络丢包环境下仍可保持86%的传输吞吐量,大幅缓解AI集群的网络传输瓶颈,为下一代万卡级AI训练集群的部署提供了新的底层网络技术路径。

随着大模型参数规模突破万亿级,万卡甚至十万卡级的分布式训练集群已经成为头部AI厂商的标配,但算力扩容的背后,跨节点的参数传输效率已经成为制约整体算力释放的核心瓶颈。
RDMA(远程直接内存访问)是当前AI集群普遍采用的底层传输技术,它可以绕过操作系统内核直接实现不同服务器内存间的数据传输,相比传统TCP协议拥有更低的延迟和更高的带宽利用率。但长期以来,适配以太网的RoCE标准协议对网络丢包容忍度极低,仅0.1%的丢包就会导致吞吐量下降50%以上,1%丢包场景下几乎无法正常工作。
为了保障传输稳定性,不少头部厂商选择成本高出以太网数倍的InfiniBand专用网络,这也大幅拉高了万卡级集群的部署门槛,行业始终在寻找能适配通用以太网的高性能RDMA方案。
此次Meta AI推出的MetaRoCE没有沿用传统RoCE的技术框架,而是采用从零构建的全新架构,针对AI训练场景下的大流传输、批量同步等典型流量特征做了全链路优化。
官方测试数据显示,在1%的网络丢包环境下,MetaRoCE仍能保持86%的有效吞吐量,表现是传统RoCE v2协议的3倍以上,同时端到端传输延迟也降低了40%。这意味着AI集群无需再为了追求极低丢包率采购溢价极高的网络硬件,通用以太网也能承载超大规模AI训练的传输需求。
作为全球AI开源生态的重要贡献者,Meta此前推出的PyTorch框架、LLaMA系列大模型都已成为产业通用基础设施,业内预计MetaRoCE后续也将开放给全行业使用。
如果该方案实现规模落地,将大幅降低中小AI厂商、智算中心部署大规模训练集群的网络成本,推动万卡级AI算力从头部厂商专属变成行业普惠资源,也会加速以太网标准向AI场景适配的迭代进程。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。