无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA

无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA

💡 原文中文,约3300字,阅读约需8分钟。
📝

内容提要

无问芯穹联合清华、上海交大开源具身智能端侧推理引擎APXInf,支持RTX 4090、Jetson Orin、Thor等平台,首发适配PI 0.5与WALL-OSS模型。通过端到端优化,Thor上PI 0.5 FP8延迟从278ms降至26ms内,兼顾低延迟、低功耗与稳定运行,并衔接RLinf训练框架,打通从训练到本体部署的完整链路。

🔎

延伸解读

端侧推理:具身智能规模化的关键瓶颈

文章指出,具身模型从云端迁移到机器人本体时,首要挑战并非模型智能程度,而是推理系统能否满足实时性要求。云端聊天机器人几百毫秒延迟或许可接受,但机器人需要持续感知与实时控制,延迟会导致动作迟滞、轨迹不连贯甚至任务失败。同时,规模化落地还需考虑算力成本、功耗和硬件利用率。因此,简单移植云端推理框架行不通,需要专门面向端侧场景设计的推理系统。

APXInf 的性能突破与实测数据

APXInf 通过 Pipeline、Graph、Kernel 及量化等多层端到端优化,在 Jetson Thor 平台上将 PI 0.5 FP8 的端到端推理延迟从 278ms 降至 26ms 以内,频率可达 38.46 Hz,实现约 10.7 倍的延迟下降。这一提升为机器人实时感知与控制提供了更充足的响应空间,使具身模型有机会在真实机器人上进入更实时的工作状态。

稳定性与工程效率的平衡设计

机器人端侧推理需长时间稳定运行,难以接受抖动、异常或中断。APXInf 采用 Rust 构建极简运行时,并提供 Python 易用接口,兼顾性能与稳定性,同时降低开发门槛。此外,它从设计之初就适配 Agentic Engineering 流程,通过冗余特性、功能隔离和工具箱模型等方法,提升新模型接入与优化的敏捷性,面向 Agentic Native 持续演进。

与 RLinf 衔接:训练到部署的完整链路

APXInf 与无问芯穹此前开源的强化学习训练框架 RLinf 衔接,将能力从模型训练与评测延伸至端侧推理与部署。作为 RLinf 生态中的端侧推理项目首发,开发者可沿同一技术生态完成从模型训练、效果验证到本体部署与真实机器人运行的完整流程,补上具身智能规模化落地的关键一环。

Q&A

APXInf是什么?由哪些机构开源?

APXInf是由无问芯穹联合清华大学、上海交通大学共同开源的具身智能端侧推理引擎,旨在解决具身模型在机器人本体上部署的推理问题。

APXInf支持哪些硬件平台和具身模型?

APXInf支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台,并首发适配PI 0.5和WALL-OSS两款具身模型。

APXInf在性能优化方面有哪些具体成果?

在Jetson Thor上,APXInf将PI 0.5 FP8的端到端推理延迟从278ms降至26ms以内,频率可达38.46 Hz,实现了10.7倍的延迟下降,达到性能SOTA。

APXInf如何保证机器人端侧推理的稳定性?

APXInf采用Rust系统语言构建极简运行时,结合Python易用接口,强调真实部署环境中的可预测性和持续运行能力,避免抖动、异常和中断。

APXInf与RLinf训练框架有什么关系?

APXInf衔接RLinf训练框架,将RLinf的能力从模型训练与评测延伸至机器人端侧推理与部署,作为RLinf开源生态中的端侧推理项目首发,打通从训练到本体部署的完整链路。

APXInf在工程效率方面有哪些优势?

APXInf面向Agentic Engineering设计,通过冗余特性、功能隔离、工具箱模型等方法,降低新模型接入与优化成本,提升研发效率,使Token更高效转化为生产力。

🏷️

标签

➡️

继续阅读