这个世界模型训练完就“退场”,机器人反而更能干了

这个世界模型训练完就“退场”,机器人反而更能干了

💡 原文中文,约4400字,阅读约需11分钟。
📝

内容提要

光象科技联合清华发布物理原生世界模型ActEffect,训练时预测动作后果并优化策略,执行时退出部署以降低成本。在LIBERO等基准测试中成功率领先,已用于汽车制造场景,验证了稳定性和效率。

🔎

延伸解读

训练与执行分离的部署逻辑

ActEffect将世界模型限制在训练阶段,执行时仅保留轻量策略头,直接降低在线推理的时延与算力开销。在工业场景中,多一层模型推理会转化为产线成本,尤其当方案复制到几十个工位时,额外显卡与功耗会显著放大。这种设计将“多想”留给训练,执行链路更短,契合工业部署对稳定性和成本的要求。

后果反馈如何提升策略质量

传统模仿学习只要求动作接近示范,但数值相近的动作在物理世界中可能结果迥异。ActEffect让策略生成三份完整动作提案,由受控世界模型预测各自后果,并与真实未来比较,通过排序损失引导策略优化。梯度截断防止差提案靠变得更差来衬托好提案,确保反馈信号始终推动策略向正确结果靠近。

从仿真到真机的验证差距

ActEffect在LIBERO、LIBERO-PLUS和RoboCasa-GR1等基准上表现领先,但仿真成功率高不等于产线可靠。光象科技已在汽车制造场景中验证Phi-Bot X1连续运行21.5小时零失误,但那是整套系统,新模型仍需在真实产线上接受节拍、精度、故障率等验收考验。算法成绩要落地,还需硬件、部署与维护的协同。

Q&A

ActEffect世界模型的核心创新点是什么?

ActEffect的核心创新在于将世界模型从执行阶段移到训练阶段。训练时,它预测动作后果并优化策略;执行时,模型退出部署,机器人无需在线展开未来,从而降低推理成本。

ActEffect在LIBERO基准测试上的成功率是多少?

ActEffect在LIBERO基准测试上的平均成功率为98.8%,比DiT4DiT的98.6%高出0.2个百分点。

ActEffect如何利用动作后果来优化机器人策略?

ActEffect让策略生成三份动作提案(前馈提案、粗提案、精提案),然后由受控世界模型预测每份提案的未来状态,并与真实未来比较,通过排序损失鼓励精提案优于粗提案、粗提案优于前馈提案,从而将后果反馈融入策略优化。

为什么ActEffect要在执行阶段移除世界模型?

为了降低部署成本。在真实工业场景中,每一步推理都对应时延、算力和成本,移除世界模型可以保持执行链路轻量,避免额外的计算开销,同时不影响性能。

ActEffect在真实工业场景中的应用情况如何?

光象科技已将ActEffect应用于汽车制造场景,如焊接上下料和移动质检。在2026ATC展会上,Phi-Bot X1在蔚来汽车焊接上下料场景连续运行3天,累计作业21.5小时,零失误、零中断。

ActEffect在RoboCasa-GR1任务上的表现如何?

在RoboCasa-GR1任务中,ActEffect需要控制GR-1人形机器人在29维动作空间完成24项桌面操作,平均成功率达到67.5%,比第二名ABot-M0高9.2个百分点。

ActEffect的消融实验揭示了哪些关键组件的重要性?

消融实验显示,去掉后果反馈后LIBERO成功率从98.8%降至97.0%;将DINOv3特征空间换成VLM表示后成绩为97.3%;拿掉排序损失后为98.1%。这表明后果反馈和DINOv3特征空间对性能提升有重要作用。

🏷️

标签

➡️

继续阅读