Flex-π 是华盛顿大学与英伟达提出的 60 亿参数世界-动作模型,旨在调和 VLA 与 WAM 之争。它用单一冻结 VAE 同时编码 RGB 与 3D 点图,用 DINOv3 提供物体语义,经 Mixture-of-Transformers 融合。训练时随机掩蔽视觉流并施加跨模态强制,使单一权重在推理时可灵活选择快慢路径,兼顾实时性与泛化,无需额外传感器或重训先验。
ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。
在红杉AI Ascent 2026大会上,Jim Fan宣布VLA和遥操作已不再适用,未来将依赖世界动作模型(WAM)和人类传感器数据。新范式通过模拟物理世界状态和动作微调,结合强化学习,推动机器人技术进步。EgoScale和Dream Zero等新策略将提升机器人在各种任务中的灵活性和自主性,预示着机器人行业的重大变革。
完成下面两步后,将自动完成登录并继续当前操作。