小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Flex-π——比Fast-WAM更快的多流世界-动作模型:可按需融合RGB和“从RGB中获取的3D pointmap和DINO语义”,联合生成潜在的未来视觉特征和动作

Flex-π 是华盛顿大学与英伟达提出的 60 亿参数世界-动作模型,旨在调和 VLA 与 WAM 之争。它用单一冻结 VAE 同时编码 RGB 与 3D 点图,用 DINOv3 提供物体语义,经 Mixture-of-Transformers 融合。训练时随机掩蔽视觉流并施加跨模态强制,使单一权重在推理时可灵活选择快慢路径,兼顾实时性与泛化,无需额外传感器或重训先验。

Flex-π——比Fast-WAM更快的多流世界-动作模型:可按需融合RGB和“从RGB中获取的3D pointmap和DINO语义”,联合生成潜在的未来视觉特征和动作

结构之法 算法之道 结构之法 算法之道 · 2026-10-01T10:31:38Z
ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。

ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

结构之法 算法之道 结构之法 算法之道 · 2026-08-10T03:44:48Z
VLA死了,遥操也死了!英伟达机器人一号位说的

在红杉AI Ascent 2026大会上,Jim Fan宣布VLA和遥操作已不再适用,未来将依赖世界动作模型(WAM)和人类传感器数据。新范式通过模拟物理世界状态和动作微调,结合强化学习,推动机器人技术进步。EgoScale和Dream Zero等新策略将提升机器人在各种任务中的灵活性和自主性,预示着机器人行业的重大变革。

VLA死了,遥操也死了!英伟达机器人一号位说的

量子位 量子位 · 2026-05-09T06:24:18Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码