5分钟完成机器人纳管、10秒启动跨集群任务,清华大学联合无问芯穹开源具身智能云原生平台RLark

5分钟完成机器人纳管、10秒启动跨集群任务,清华大学联合无问芯穹开源具身智能云原生平台RLark

💡 原文中文,约5300字,阅读约需13分钟。
📝

内容提要

清华大学与无问芯穹开源具身智能云原生纳管平台RLark,统一管理机器人、相机等设备与云端算力,支持任务级跨集群通信。实测设备纳管从1小时缩短至5分钟,任务10秒内启动,并完成跨地域采集—训练—真机验证闭环,通信吞吐显著提升。

🔎

延伸解读

从“单机”到“机群”:具身智能的纳管挑战

文章以“塔台”比喻具身智能的协同需求:一项任务涉及机器人、相机、云端算力、训练与推理程序以及通信环境。随着设备增多,传统逐一接入、分别部署、反复配置网络的方式成本高昂。RLark 旨在统一组织这些分散资源,让设备像 GPU 一样被申请、调度和复用,从而降低协同复杂度。

实测数据:效率提升与闭环验证

RLark 在测试中实现设备纳管从 1 小时缩短至约 5 分钟,任务提交后 10 秒内启动。跨地域实验连续运行约 36 分钟,完成 323 个全局训练步骤,跑通采集—训练—真机验证闭环。通信专项测试显示,受限网络下大包单流吞吐较 VPN 方案提升约 49%,小包提升约 14%,高带宽环境下大包单流吞吐接近 2 Gbps。

技术核心:任务级跨集群通信与声明式编排

RLark 采用控制面与数据面分离架构,通过自研具身设备运行时将机器人、相机转化为可调度资源。其任务级跨集群网络互联技术利用虚拟地址、gVisor 用户态网络栈和 SSH 隧道,解耦实例地址与部署位置,并由通信域控制访问。声明式任务编排以 Job、Task、Worker 三层模型描述实验,用户通过一份配置即可部署训练、推理和真机交互角色。

开源与演进:降低门槛,共建生态

RLark 将用户界面、API、后端服务、任务编排、跨集群互联和具身设备运行时等能力开源,旨在降低具身基础设施使用门槛。文章指出,具身智能硬件与环境快速变化,新设备接入、网络条件验证、规模扩大后的调度与异常恢复等问题仍需持续解决。RLark 计划完善设备与芯片适配、轻量运行时、跨域通信和任务异常恢复,并欢迎社区参与共建。

Q&A

RLark是什么?由谁开源?

RLark是清华大学与无问芯穹共同打造并开源的面向具身智能的云原生纳管平台,旨在统一管理机器人、相机等具身设备与云端算力,支持任务级跨集群通信。

RLark平台的核心技术有哪些?

RLark的核心技术包括:自研的具身设备运行时(embodied-runtime)和任务级跨集群网络互联技术。前者通过统一硬件抽象将机器人、相机等设备转化为可调度资源;后者通过虚拟地址、SSH安全隧道和gVisor用户态网络栈实现跨集群通信优化。

RLark在设备纳管和任务启动方面的性能提升如何?

设备纳管从传统的1小时缩短至约5分钟;任务提交后可在10秒内启动运行。

RLark如何实现跨集群任务通信优化?

RLark通过虚拟寻址、gVisor用户态网络栈与SSH安全隧道为执行实例建立通信通道,由平台统一维护路由、隧道与转发关系。结合RLinf框架的分布式通信方式,优化数据流转,减少不必要的跨域传输。在受限网络环境下,大包单流吞吐较VPN方案提升约49%,小包单流吞吐提升约14%;高带宽环境下大包单流吞吐接近2 Gbps。

RLark的声明式任务编排是如何工作的?

RLark通过自定义任务类型,用Job、Task和Worker三层模型描述具身实验:Job代表整项任务,Task描述训练、推理、真机交互等执行角色,Worker是实际执行实例。用户通过一份配置声明各角色所需资源、实例数量和部署位置,任务提交后控制面将配置下发至相应集群,由Agent创建Worker并回传状态,平台持续调协使实际状态与配置一致。

RLark在真机实验中的验证结果如何?

团队将RLark与RLinf结合,在广东云端GPU集群与北京机器人现场之间完成跨地域真机实测。实验连续运行约36分钟,训练推进至323个全局训练步骤,完整跑通了设备申请、跨集群调度、真机数据回传、云端训练和策略更新全链路,实现了采集—训练—真机验证闭环。

🏷️

标签

➡️

继续阅读