小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
为分布式AI训练构建可靠的云原生基础

Atlassian将RDMA网络、Lustre存储、GPU调度与验证整合为统一平台以支持分布式AI训练。此前RDMA静默回退TCP导致多节点性能减半且难察觉,改造后训练吞吐提升2.04倍,中位步时从12.36秒降至6.07秒。核心经验是网络、存储、调度与验证须作为整体系统设计。

为分布式AI训练构建可靠的云原生基础

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-09-11T11:00:00Z
Meta AI推出MetaRoCE:专为AI规模以太网打造的全新RDMA传输协议

Meta推出MetaRoCE,一种面向AI工作负载的RDMA传输协议,颠覆标准RoCE,将有损网络、乱序交付和多路径作为默认机制,智能下沉至网卡。在1%丢包率下仍保持86%吞吐量,仅需交换机支持ECN和ECMP。规范、合规套件及参考实现将于2026年10月OCP峰会发布。

Meta AI推出MetaRoCE:专为AI规模以太网打造的全新RDMA传输协议

实时互动网 实时互动网 · 2026-08-26T02:26:11Z
MetaRoCE:为AI规模以太网构建的新型RDMA传输协议

Meta发布MetaRoCE,一种为AI工作负载设计的全新RDMA传输协议,基于以太网,支持百万GPU规模。它通过端点智能、原生多路径、乱序交付和丢包容忍,提升吞吐量并降低延迟。Meta已开放规范、软件实现和合规套件,并计划在2026年OCP峰会上发布更多内容。

MetaRoCE:为AI规模以太网构建的新型RDMA传输协议

Engineering at Meta Engineering at Meta · 2026-08-24T18:02:29Z

本文介绍RoCE、Soft RoCE与InfiniBand三种RDMA网络的配置与测试方法。RoCE需无损以太网并开启PFC,通过GID选择通信地址;Soft RoCE用软件模拟,适合开发但性能低;InfiniBand依赖子网管理器,性能最高。文中详述了安装工具、查看设备及使用ib_write_bw/lat进行带宽和延迟测试的步骤。

RDMA 运维

陈少文的博客 陈少文的博客 · 2026-08-22T00:00:00Z

本文介绍SPDK NVMe-oF传输层:RDMA与TCP两种传输的机制差异、默认轮询模型及v26.01新增的RDMA中断驱动模式。轮询适合高吞吐,中断模式降低低负载CPU开销。选型需匹配网络与运维能力,中断模式要求所有组件支持事件模型,否则无效。

【SPDK 用户态存储】NVMe-oF 传输层:RDMA vs TCP,轮询与 v26.01 中断模式

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-13T00:00:00Z

本文介绍SPDK用户态存储栈中NVMe-oF Initiator(主机端)的三种路径:SPDK host、内核initiator及多路径。SPDK host通过统一API连接远端盘,内核initiator用nvme-cli管理块设备。多路径支持可达性与负载分布,但不提供数据冗余。安全特性如TLS需单独评估。选型取决于应用场景:SPDK流水线用SPDK host,传统文件系统用内核initiator。

【SPDK 用户态存储】Initiator 与互通:SPDK host、内核 nvme-rdma/tcp 与多路径边界

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-13T00:00:00Z

本文介绍SPDK NVMe-oF target如何将本地bdev导出给远端主机。核心要点:namespace直接绑定bdev;配置顺序为transport→subsystem→NS→listener;普通I/O在单poll group线程无锁完成,管理命令通过subsystem pause协调;访问控制依赖host NQN与listener配置;RDMA支持零拷贝。文章还对比了与内核nvmet的差异,强调配置面、线程模型和块设备来源三方面的概念对齐。

【SPDK 用户态存储】NVMe-oF Target:subsystem、listener 与 namespace→bdev

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-13T00:00:00Z

CXL和RDMA技术突破了传统操作系统对本地资源的假设,实现了远程内存的共享与管理。资源解耦提高了资源利用率,CXL 3.0支持内存池化和多主机共享。LegoOS将操作系统拆分为独立组件,以适应新内存层次。面临的挑战包括延迟、一致性和安全性,未来方向是数据中心级内存管理和新的内存放置策略。

【操作系统百科】可拆分 OS

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-07-09T00:00:00Z

一次几乎全自动的库开发实验:从一份 PRD 出发,15 个 issue 串成流水线,让 Agent 一路 实现 → 审查 → 记录 → 发布,最后我只在真机上验证。本文复盘整个过程,验证了Loo

Loop Engineering 实践:我把 RDMA 开发库移植到 Go 语言,花费 239 块钱

鸟窝 鸟窝 · 2026-06-16T20:00:24Z

用 Go 写 RDMA,到底能有多简单?又能有多快?这篇带你从零跑到 400 Gb/s。

傻瓜式RDMA高性能网络开发:从零跑到 400 Gb每秒

鸟窝 鸟窝 · 2026-06-16T20:00:24Z
Loop Engineering 实践:我把 RDMA 开发库移植到 Go 语言,花费 239 块钱

本文回顾了将RDMA开发库移植到Go语言的过程,涉及15个问题的管理,实际花费239元。通过Loop Engineering方法逐步实现功能,并在真实环境中验证代码。尽管初步实现顺利,但后续审查发现多个编译和逻辑错误,强调了审查的重要性。最终项目在Linux环境下成功运行,展示了开发的复杂性和成本。

Loop Engineering 实践:我把 RDMA 开发库移植到 Go 语言,花费 239 块钱

鸟窝 鸟窝 · 2026-06-16T20:00:24Z
傻瓜式RDMA高性能网络开发:从零跑到 400 Gb每秒

本文介绍了gordma,一个用Go语言封装的RDMA网络库,旨在简化高性能网络编程。RDMA技术通过直接内存访问实现低延迟和高吞吐量,适用于AI训练和金融交易等场景。gordma提供易用的API,支持不同性能需求,用户可选择简单的net风格接口或底层API以获得更高性能。实测数据显示,gordma在400G网络环境下的吞吐量可达392 Gb/s,展示了其强大的性能和灵活性。

傻瓜式RDMA高性能网络开发:从零跑到 400 Gb每秒

鸟窝 鸟窝 · 2026-06-16T20:00:24Z

共享内存数据库因RDMA和CXL技术的出现而重新受到关注。RDMA降低了跨机访问延迟,提升了数据库性能,CXL则提供了硬件级一致性。研究项目如FaRM、NAM-DB和Sundial展示了这些技术在分布式事务处理中的应用。未来,结合RDMA和CXL的架构可能会在数据库设计中发挥重要作用,推动更高效的共享内存模型。

【数据库研究前沿】共享内存数据库复兴:RDMA/CXL 下的分布式事务

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-05-12T00:00:00Z

bluespec-lsp是一个基于Rust的AI自主开发项目,旨在为Bluespec SystemVerilog提供更好的IDE支持,具备常量自动展开和代码导航等功能。项目欢迎Rust社区和硬件工程师参与,并将于2026年4月30日举办线上Talk,介绍项目详情及入门问题。该项目是open-rdma生态的一部分,关注RDMA软件栈的开发。

[开源]bluespec-lsp:一个100%用AI开发的LanguageServer项目,欢迎携带各自的Agent加入开发

Rust.cc Rust.cc · 2026-04-25T05:51:39Z
英特尔与忆联推出企业级网络存储解决方案白皮书

英特尔与忆联推出企业级网络存储解决方案,结合RDMA与NVMe技术,提升AI训练与推理效率。忆联UH812a SSD具备高带宽、低延迟,顺序读写速度可达14900 MB/s,并支持多种容量选择。双方将继续深化合作,探索存储最佳实践。

英特尔与忆联推出企业级网络存储解决方案白皮书

全球TMT-美通国际 全球TMT-美通国际 · 2026-02-02T15:10:47Z

在PD分离部署中,异构显卡会增加跨机通信压力。通过RDMA设备加速kvcache传输,降低FTTL。安装驱动后可选择标准或兼容模式,兼容模式支持更多应用。性能测试显示eRDMA速度接近25.0 Gbps。配置和测试过程包括安装工具、查看设备信息及启动容器环境。

阿里云 eRDMA 测试及 PD 分离应用部署

陈少文的博客 陈少文的博客 · 2026-01-17T00:00:00Z
拨云见日:Murat Demirbas在2025年QCon SF上探讨解耦系统的崛起

云计算正在经历架构转变,传统的“无共享”设计效率低,无法满足现代应用的弹性需求。Murat Demirbas指出,行业正快速采用解耦架构,以独立扩展计算和存储,提升故障隔离和操作简化。新技术如RDMA和CXL推动了这一转变,促进了数据库设计的创新。

拨云见日:Murat Demirbas在2025年QCon SF上探讨解耦系统的崛起

InfoQ InfoQ · 2025-11-19T11:00:00Z
如何通过RDMA技术解锁兼容S3的加速AI存储性能

RDMA技术优化了兼容S3的存储,提升了NVIDIA网络和计算效率,降低了企业AI工作负载的存储成本。预计到2028年,企业年产生近400泽字节数据,其中90%为非结构化数据。RDMA加速对象存储,提供更高吞吐量和更低延迟,支持AI训练和推理,助力企业灵活运行AI工作负载。

如何通过RDMA技术解锁兼容S3的加速AI存储性能

NVIDIA Blog NVIDIA Blog · 2025-11-14T16:00:54Z

机器之心数据服务现已上线,提供高效稳定的数据获取服务,帮助用户轻松获取所需数据。

网络顶会获奖!华为提出端网协同RDMA传输架构,解决大规模AI集群网络可扩展性问题

机器之心 机器之心 · 2025-09-16T13:06:26Z
InfiniBand 与 RoCEv2:为大规模 AI 选择合适的网络

GPU 是人工智能的核心,但在大规模训练中,网络通信速度限制了性能。RDMA 和 GPUDirect 技术通过绕过 CPU 实现 GPU 直接通信,降低延迟。InfiniBand 性能高但成本高,RoCEv2 更经济灵活,适合现有以太网环境。选择应基于预算和性能需求。

InfiniBand 与 RoCEv2:为大规模 AI 选择合适的网络

实时互动网 实时互动网 · 2025-08-07T09:52:55Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码