Atlassian将RDMA网络、Lustre存储、GPU调度与验证整合为统一平台以支持分布式AI训练。此前RDMA静默回退TCP导致多节点性能减半且难察觉,改造后训练吞吐提升2.04倍,中位步时从12.36秒降至6.07秒。核心经验是网络、存储、调度与验证须作为整体系统设计。
Meta推出MetaRoCE,一种面向AI工作负载的RDMA传输协议,颠覆标准RoCE,将有损网络、乱序交付和多路径作为默认机制,智能下沉至网卡。在1%丢包率下仍保持86%吞吐量,仅需交换机支持ECN和ECMP。规范、合规套件及参考实现将于2026年10月OCP峰会发布。
Meta发布MetaRoCE,一种为AI工作负载设计的全新RDMA传输协议,基于以太网,支持百万GPU规模。它通过端点智能、原生多路径、乱序交付和丢包容忍,提升吞吐量并降低延迟。Meta已开放规范、软件实现和合规套件,并计划在2026年OCP峰会上发布更多内容。
本文介绍RoCE、Soft RoCE与InfiniBand三种RDMA网络的配置与测试方法。RoCE需无损以太网并开启PFC,通过GID选择通信地址;Soft RoCE用软件模拟,适合开发但性能低;InfiniBand依赖子网管理器,性能最高。文中详述了安装工具、查看设备及使用ib_write_bw/lat进行带宽和延迟测试的步骤。
本文介绍SPDK NVMe-oF传输层:RDMA与TCP两种传输的机制差异、默认轮询模型及v26.01新增的RDMA中断驱动模式。轮询适合高吞吐,中断模式降低低负载CPU开销。选型需匹配网络与运维能力,中断模式要求所有组件支持事件模型,否则无效。
本文介绍SPDK用户态存储栈中NVMe-oF Initiator(主机端)的三种路径:SPDK host、内核initiator及多路径。SPDK host通过统一API连接远端盘,内核initiator用nvme-cli管理块设备。多路径支持可达性与负载分布,但不提供数据冗余。安全特性如TLS需单独评估。选型取决于应用场景:SPDK流水线用SPDK host,传统文件系统用内核initiator。
本文介绍SPDK NVMe-oF target如何将本地bdev导出给远端主机。核心要点:namespace直接绑定bdev;配置顺序为transport→subsystem→NS→listener;普通I/O在单poll group线程无锁完成,管理命令通过subsystem pause协调;访问控制依赖host NQN与listener配置;RDMA支持零拷贝。文章还对比了与内核nvmet的差异,强调配置面、线程模型和块设备来源三方面的概念对齐。
CXL和RDMA技术突破了传统操作系统对本地资源的假设,实现了远程内存的共享与管理。资源解耦提高了资源利用率,CXL 3.0支持内存池化和多主机共享。LegoOS将操作系统拆分为独立组件,以适应新内存层次。面临的挑战包括延迟、一致性和安全性,未来方向是数据中心级内存管理和新的内存放置策略。
一次几乎全自动的库开发实验:从一份 PRD 出发,15 个 issue 串成流水线,让 Agent 一路 实现 → 审查 → 记录 → 发布,最后我只在真机上验证。本文复盘整个过程,验证了Loo
用 Go 写 RDMA,到底能有多简单?又能有多快?这篇带你从零跑到 400 Gb/s。
本文回顾了将RDMA开发库移植到Go语言的过程,涉及15个问题的管理,实际花费239元。通过Loop Engineering方法逐步实现功能,并在真实环境中验证代码。尽管初步实现顺利,但后续审查发现多个编译和逻辑错误,强调了审查的重要性。最终项目在Linux环境下成功运行,展示了开发的复杂性和成本。
本文介绍了gordma,一个用Go语言封装的RDMA网络库,旨在简化高性能网络编程。RDMA技术通过直接内存访问实现低延迟和高吞吐量,适用于AI训练和金融交易等场景。gordma提供易用的API,支持不同性能需求,用户可选择简单的net风格接口或底层API以获得更高性能。实测数据显示,gordma在400G网络环境下的吞吐量可达392 Gb/s,展示了其强大的性能和灵活性。
共享内存数据库因RDMA和CXL技术的出现而重新受到关注。RDMA降低了跨机访问延迟,提升了数据库性能,CXL则提供了硬件级一致性。研究项目如FaRM、NAM-DB和Sundial展示了这些技术在分布式事务处理中的应用。未来,结合RDMA和CXL的架构可能会在数据库设计中发挥重要作用,推动更高效的共享内存模型。
bluespec-lsp是一个基于Rust的AI自主开发项目,旨在为Bluespec SystemVerilog提供更好的IDE支持,具备常量自动展开和代码导航等功能。项目欢迎Rust社区和硬件工程师参与,并将于2026年4月30日举办线上Talk,介绍项目详情及入门问题。该项目是open-rdma生态的一部分,关注RDMA软件栈的开发。
英特尔与忆联推出企业级网络存储解决方案,结合RDMA与NVMe技术,提升AI训练与推理效率。忆联UH812a SSD具备高带宽、低延迟,顺序读写速度可达14900 MB/s,并支持多种容量选择。双方将继续深化合作,探索存储最佳实践。
在PD分离部署中,异构显卡会增加跨机通信压力。通过RDMA设备加速kvcache传输,降低FTTL。安装驱动后可选择标准或兼容模式,兼容模式支持更多应用。性能测试显示eRDMA速度接近25.0 Gbps。配置和测试过程包括安装工具、查看设备信息及启动容器环境。
云计算正在经历架构转变,传统的“无共享”设计效率低,无法满足现代应用的弹性需求。Murat Demirbas指出,行业正快速采用解耦架构,以独立扩展计算和存储,提升故障隔离和操作简化。新技术如RDMA和CXL推动了这一转变,促进了数据库设计的创新。
RDMA技术优化了兼容S3的存储,提升了NVIDIA网络和计算效率,降低了企业AI工作负载的存储成本。预计到2028年,企业年产生近400泽字节数据,其中90%为非结构化数据。RDMA加速对象存储,提供更高吞吐量和更低延迟,支持AI训练和推理,助力企业灵活运行AI工作负载。
机器之心数据服务现已上线,提供高效稳定的数据获取服务,帮助用户轻松获取所需数据。
GPU 是人工智能的核心,但在大规模训练中,网络通信速度限制了性能。RDMA 和 GPUDirect 技术通过绕过 CPU 实现 GPU 直接通信,降低延迟。InfiniBand 性能高但成本高,RoCEv2 更经济灵活,适合现有以太网环境。选择应基于预算和性能需求。
完成下面两步后,将自动完成登录并继续当前操作。