内容提要
Meta推出MetaRoCE,一种面向AI工作负载的RDMA传输协议,颠覆标准RoCE,将有损网络、乱序交付和多路径作为默认机制,智能下沉至网卡。在1%丢包率下仍保持86%吞吐量,仅需交换机支持ECN和ECMP。规范、合规套件及参考实现将于2026年10月OCP峰会发布。
延伸解读
设计理念的转变
MetaRoCE 的核心变化在于将网络视为有损,并把排序、路径选择和恢复全部下沉到网卡。这与传统 RoCE 依赖无损网络和 PFC 的做法截然不同。这种设计更适应大规模集群中多路径和动态故障的场景,但也意味着网卡需要承担更多智能处理,对硬件能力提出了更高要求。
实际应用与限制
目前 MetaRoCE 尚未正式发布,规范、参考实现和合规套件预计在 2026 年 10 月 OCP 峰会上推出。硬件支持仍处于早期,仅在 AMD Pensando 可编程网卡上完成验证。因此,对于大多数用户而言,现在更多是关注其技术方向,而非立即部署。
对网络基础设施的要求
MetaRoCE 仅要求交换机支持 ECN 和 ECMP,这降低了部署门槛,甚至可以在云厂商网络上运行。但这也意味着网络设备需要正确配置这些功能,否则可能影响性能。对于网络管理员来说,理解并确保这些基础能力是发挥 MetaRoCE 优势的前提。
Q&A
MetaRoCE是什么?
MetaRoCE是Meta推出的一种全新的RDMA传输协议,专为在通用以太网上运行的AI工作负载设计。它颠覆了标准RoCE的假设,将有损网络、乱序交付和多路径作为默认机制,智能下沉到网卡端。
MetaRoCE与标准RoCE有何不同?
标准RoCE期望网络按序交付每一帧,依赖PFC(优先级流控),并抑制数据包喷洒;而MetaRoCE把网络视为有损的,没有PFC和暂停帧,将排序、路径选择和恢复全部下沉到网卡,支持乱序交付和多路径。
MetaRoCE如何实现高吞吐量?
MetaRoCE通过将数据包喷洒到多条路径并允许乱序到达,直接写入内存,避免了重排缓冲和队头阻塞;同时,每条路径独立维护拥塞窗口和RTT估算,能够区分拥塞与故障,并进行显式再平衡。在1%丢包率下仍能保持约86%的吞吐量。
MetaRoCE对网络设备有什么要求?
MetaRoCE只要求网络设备支持ECN标记和ECMP,这两项是每台交换机都具备的能力。它不要求数据包修剪、网内遥测、基于信用的流控或交换机侧喷洒,因此可以运行在云厂商等不受控制的网络上。
MetaRoCE的拥塞控制是如何工作的?
MetaRoCE采用发送端驱动的基于ECN的AIMD(加性增乘性减)与接收端驱动的公平份额速率提示相结合。接收端在每个确认包中返回分配给发送端的入站带宽份额,使发送端直接以正确速率逼近,从而快速解决Incast问题。
MetaRoCE的规范何时发布?
MetaRoCE的规范、合规套件和参考实现(libsoftmetaroce)预计在2026年10月的OCP全球峰会上发布。
MetaRoCE在哪些硬件上完成了验证?
Meta在AMD Pensando可编程网卡上完成了MetaRoCE的验证,并在运行RCCL集合通信的64节点AMD GPU集群上进行了测试。其他厂商的实现也在推进中。