MetaRoCE:为AI规模以太网构建的新型RDMA传输协议

MetaRoCE:为AI规模以太网构建的新型RDMA传输协议

💡 原文英文,约1700词,阅读约需6分钟。
📝

内容提要

Meta发布MetaRoCE,一种为AI工作负载设计的全新RDMA传输协议,基于以太网,支持百万GPU规模。它通过端点智能、原生多路径、乱序交付和丢包容忍,提升吞吐量并降低延迟。Meta已开放规范、软件实现和合规套件,并计划在2026年OCP峰会上发布更多内容。

🔎

延伸解读

设计哲学:把智能从网络移到端点

MetaRoCE的核心思路是让网络设备保持简单,把智能放到网卡(NIC)上。传统RoCE依赖交换机保证无损和有序,而MetaRoCE让端点感知每条路径的实时状态(如RTT、ECN、利用率),从而支持乱序交付、多路径和丢包容忍。这种设计降低了交换机的要求,只需支持ECN和ECMP,就能在多种拓扑和云环境中运行,体现了“端点智能”的现代网络趋势。

性能数据:丢包下的优雅降级

在64节点AMD GPU集群上,MetaRoCE相比RoCEv2在all-reduce和all-to-all操作中持续获得更高吞吐和更低流完成时间。关键亮点是:在1%丢包率下仍保持约86%吞吐,即使10%极端丢包也能继续工作,而不是崩溃。这得益于其选择性确认和逐路径重传机制,使网络在故障时能自动恢复,无需人工干预。

开放生态:推动行业标准化

Meta将MetaRoCE规范、参考实现和合规套件贡献给OCP,旨在建立开放的多厂商生态。这延续了OCP的ESUN倡议,将开放理念从网络层扩展到传输层。通过提供软件参考实现(libsoftmetaroce)和合规测试,硬件厂商可以验证其实现是否符合规范,从而促进互操作性,加速AI基础设施的创新。

未来方向:从数据中心到跨地域

MetaRoCE当前聚焦数据中心内的规模扩展,但Meta已规划三大方向:优化机架内短消息的快速路径;支持跨建筑甚至跨地域的“scale-across”场景,处理毫秒级RTT和路径差异;以及应对存储和KV缓存场景中的incast问题,利用接收端速率提示动态调节入站速率。这些方向将扩展MetaRoCE的适用距离和场景。

Q&A

MetaRoCE是什么?它主要解决什么问题?

MetaRoCE是Meta开发的一种全新的RDMA传输协议,专为AI工作负载设计,基于以太网,目标是支持百万GPU规模的集群。它通过将智能从网络交换机转移到端点(NIC),实现原生多路径、乱序交付和丢包容忍,从而提升吞吐量、降低延迟,并简化运维。

MetaRoCE与标准RoCE有何不同?

标准RoCE依赖网络提供无损传输(如PFC)和按序交付,而MetaRoCE将智能放在端点,支持乱序交付、原生多路径和丢包容忍,不使用PFC。它通过每个路径独立的窗口和RTT估计,能更好地区分拥塞和故障,并在丢包时快速恢复。

MetaRoCE如何实现高吞吐和低延迟?

MetaRoCE通过原生多路径(将数据包分散到多条路径)、乱序交付(无需重排缓冲)和丢包容忍(无需PFC)来提升吞吐和降低延迟。它利用ECMP和ECN,每个路径独立控制窗口,并采用接收端驱动的速率提示,快速响应拥塞,从而在高负载下保持性能。

MetaRoCE在丢包情况下表现如何?

MetaRoCE在1%丢包率下仍能保持约86%的吞吐量,即使在10%的极端丢包率下也能继续提供有效带宽,而不是性能崩溃。这得益于其丢包容忍设计和精确的丢包重传机制。

MetaRoCE是否兼容现有的RDMA软件?

是的,MetaRoCE设计为与现有RDMA Verbs API和软件栈兼容,应用程序无需修改即可运行。对于增强功能(如多平面支持),通过扩展API提供。

MetaRoCE的开放性和生态支持如何?

MetaRoCE通过OCP开放规范,提供参考软件实现和合规测试套件。它支持多种NIC架构(可编程和固定功能),并已在AMD Pensando硬件上验证,其他厂商的实现也在进行中。这有助于推动行业采用和互操作性。

MetaRoCE在测试中相比RoCEv2有哪些优势?

在64节点AMD GPU集群上,使用RCCL进行all-reduce和all-to-all测试,MetaRoCE相比RoCEv2持续提供更高的吞吐量和更低的流完成时间。在丢包条件下,MetaRoCE性能下降更平缓,而RoCEv2会显著退化。

MetaRoCE未来的发展方向是什么?

MetaRoCE的未来工作包括:优化机架内短消息的快速信令路径(scale-up)、支持跨建筑物数千公里的作业(scale-across)、以及改进存储和KV缓存场景下的接收端速率控制。这些方向旨在覆盖AI基础设施的不同距离和延迟需求。

🏷️

标签

➡️

继续阅读