该论文提出w-0模型,联合预测未来视觉与全身动作,解决人形机器人并发运动操作难题。在11个家庭任务上优于9种基线,发布40小时w-HOME数据集。模型分三阶段训练,结合VLM与V-JEPA,支持多视角输入。局限是硬件耦合、延迟高、缺安全机制,未来需验证跨平台泛化。
完成下面两步后,将自动完成登录并继续当前操作。