AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Meta AI推出MetaRoCE 专为AI规模以太网打造的RDMA传输方案

Meta AI近期发布自研全新RDMA传输协议MetaRoCE,该协议采用从零搭建的原生架构,专门适配超大规模AI训练场景下的以太网集群需求,在1%网络丢包环境下仍可保持86%的传输吞吐量,大幅缓解AI集群的网络传输瓶颈,为下一代万卡级AI训练集群的部署提供了新的底层网络技术路径。

配图

随着大模型参数规模突破万亿级,万卡甚至十万卡级的分布式训练集群已经成为头部AI厂商的标配,但算力扩容的背后,跨节点的参数传输效率已经成为制约整体算力释放的核心瓶颈。

RDMA(远程直接内存访问)是当前AI集群普遍采用的底层传输技术,它可以绕过操作系统内核直接实现不同服务器内存间的数据传输,相比传统TCP协议拥有更低的延迟和更高的带宽利用率。但长期以来,适配以太网的RoCE标准协议对网络丢包容忍度极低,仅0.1%的丢包就会导致吞吐量下降50%以上,1%丢包场景下几乎无法正常工作。

为了保障传输稳定性,不少头部厂商选择成本高出以太网数倍的InfiniBand专用网络,这也大幅拉高了万卡级集群的部署门槛,行业始终在寻找能适配通用以太网的高性能RDMA方案。

此次Meta AI推出的MetaRoCE没有沿用传统RoCE的技术框架,而是采用从零构建的全新架构,针对AI训练场景下的大流传输、批量同步等典型流量特征做了全链路优化。

官方测试数据显示,在1%的网络丢包环境下,MetaRoCE仍能保持86%的有效吞吐量,表现是传统RoCE v2协议的3倍以上,同时端到端传输延迟也降低了40%。这意味着AI集群无需再为了追求极低丢包率采购溢价极高的网络硬件,通用以太网也能承载超大规模AI训练的传输需求。

作为全球AI开源生态的重要贡献者,Meta此前推出的PyTorch框架、LLaMA系列大模型都已成为产业通用基础设施,业内预计MetaRoCE后续也将开放给全行业使用。

如果该方案实现规模落地,将大幅降低中小AI厂商、智算中心部署大规模训练集群的网络成本,推动万卡级AI算力从头部厂商专属变成行业普惠资源,也会加速以太网标准向AI场景适配的迭代进程。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。