全球首个可仿真的人–场景交互重建框架 HSImul3R:让人类视频真正成为机器人技能来源

全球首个可仿真的人–场景交互重建框架 HSImul3R:让人类视频真正成为机器人技能来源

💡 原文中文,约3900字,阅读约需10分钟。
📝

内容提要

大晓机器人联合南洋理工大学等发布HSImul3R,这是首个面向稀疏视角、可仿真的人–场景交互重建框架,已被ECCV 2026接收。该框架提出物理闭环双向优化,将重力、接触与交互稳定性纳入标准,并构建HSIBench。其交互稳定率显著高于HSfM,穿模率从69.51%降至22.90%,还实现动作迁移至Unitree G1,打通视频到真实机器人执行链路。

🔎

延伸解读

从视觉正确到物理可执行:评价标准的转变

传统三维重建以几何准确和视觉对齐为核心,但HSImul3R指出,视觉上成立的人–场景交互进入物理仿真后可能立即失效,如椅子结构缺失或人体穿模。该研究将重力稳定性、真实接触和交互稳定性纳入评价标准,推动重建从“看起来像”转向“物理上能成立”。这一转变对具身智能尤为重要,因为机器人面对的是由重力、碰撞和摩擦决定的真实物理世界。

物理闭环双向优化:仿真器成为主动监督者

HSImul3R提出物理闭环双向优化框架,让仿真器从最终检验工具变为重建过程中的主动监督者。正向通过面向场景的强化学习优化人体运动,确保动作既物理可行又保持与场景的正确接触;反向通过直接仿真奖励优化(DSRO)利用交互后的仿真反馈修正三维场景。这种双向机制解决了传统方法中“人动错了”或“场景没重建对”难以区分的问题,使重建结果真正可仿真。

HSIBench与量化结果:交互稳定率显著提升

团队构建了HSIBench,包含19个场景物体、超过50段人体动作序列和300个独立交互实例,以交互稳定性为核心指标。实验显示,HSImul3R在Easy、Medium、Hard三档任务中的交互稳定率分别达53.68%、30.56%和13.92%,显著高于HSfM的10.52%、4.50%和2.66%;穿模率从69.51%降至22.90%。这些数据表明,物理闭环优化能有效提升重建结果在仿真中的可用性。

从人类视频到机器人技能:Sim-to-Real链路打通

HSImul3R将优化后的人体动作重定向至Unitree G1人形机器人,并以这些动作作为先验训练全身控制策略,最终部署到真实机器人上。这打通了从日常视频到三维重建、物理仿真优化、动作迁移再到真实执行的完整链路。该路径意味着互联网上大量人类行为视频可能不再只是视觉数据,而能转化为机器人可学习、可执行的物理技能资产,尽管复杂交互和动态环境仍是早期挑战。

Q&A

HSImul3R是什么?它由哪些机构联合发布?

HSImul3R是由大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布的人–场景交互重建框架,已被ECCV 2026接收。它是首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并支持单目视频输入。

HSImul3R如何解决三维重建中“视觉正确但物理不可行”的问题?

HSImul3R提出物理闭环(Physics-in-the-Loop)双向优化框架,将物理仿真器从最终检验工具变为重建过程中的主动监督者。正向通过面向场景的强化学习优化人体运动,使其物理可行且与场景稳定交互;反向通过直接仿真奖励优化(DSRO)利用仿真反馈优化三维场景。评价标准从“视觉正确”推进到“物理成立”,纳入重力稳定性、真实接触和交互稳定性。

HSImul3R在交互稳定率和穿模率上的具体表现如何?

在Easy、Medium、Hard三档任务中,HSImul3R的人–场景交互稳定率分别达到53.68%、30.56%和13.92%,显著高于HSfM的10.52%、4.50%和2.66%;人–场景三维穿模率从HSfM的69.51%降至22.90%。

HSIBench是什么?它和传统三维重建基准有何不同?

HSIBench是团队构建的面向人–场景交互的基准,包含19个场景物体、超过50段人体动作序列和300个独立交互实例,由3名参与者完成,每个案例从16个视角同步采集。与传统基准关注几何误差不同,HSIBench将人–场景交互稳定性(Stability-HSI)作为核心指标,要求物体在重力下稳定、交互后保持稳定并保留有意义的人–物接触。

HSImul3R如何实现从人类视频到真实机器人执行的完整链路?

HSImul3R将优化后的人体运动重定向至Unitree G1人形机器人,再以这些动作作为先验,在仿真环境中训练全身控制策略,最终部署到真实G1上,使机器人能在现实中复现相应的人–场景交互。这打通了日常图像/视频→三维人–场景交互重建→物理仿真优化→人形机器人动作迁移→真实机器人执行的完整链路。

HSImul3R这项研究的意义和未来方向是什么?

HSImul3R推动三维重建从“视觉正确”走向“物理可执行”,让人类视频中的交互经验转化为可仿真、可学习、可执行的机器人技能资产。互联网上大量人类行为视频若能被持续重建、物理验证并迁移到不同机器人本体,将成为机器人学习真实物理技能的重要来源。但该路线仍处早期,复杂交互、多物体场景和动态环境仍存在大量挑战。

🏷️

标签

➡️

继续阅读