Flex-π——比Fast-WAM更快的多流世界-动作模型:可按需融合RGB和“从RGB中获取的3D pointmap和DINO语义”,联合生成潜在的未来视觉特征和动作

Flex-π——比Fast-WAM更快的多流世界-动作模型:可按需融合RGB和“从RGB中获取的3D pointmap和DINO语义”,联合生成潜在的未来视觉特征和动作

💡 原文中文,约6300字,阅读约需15分钟。
📝

内容提要

Flex-π 是华盛顿大学与英伟达提出的 60 亿参数世界-动作模型,旨在调和 VLA 与 WAM 之争。它用单一冻结 VAE 同时编码 RGB 与 3D 点图,用 DINOv3 提供物体语义,经 Mixture-of-Transformers 融合。训练时随机掩蔽视觉流并施加跨模态强制,使单一权重在推理时可灵活选择快慢路径,兼顾实时性与泛化,无需额外传感器或重训先验。

🔎

延伸解读

VLA与WAM的路线之争

文章指出,VLA主张端到端从图像直接映射动作,推理快,适合高频实时控制;WAM则强调先推演物理世界变化再行动,泛化潜力更强。但WAM落地时面临推理延迟与算力开销,传统WAM每预测一帧高分辨率画面需数十步扩散去噪,端侧耗时数百毫秒甚至数秒,难以满足10Hz–50Hz的控制频率。Flex-π试图兼容两者,将范式之争转化为同一模型权重内的快慢路径选择。

Flex-π如何避免额外成本

Flex-π在不增加传感器、不重新训练视觉先验、不牺牲推理速度的前提下,引入3D点图和物体语义监督。点图由Depth Anything 3从同一张RGB图像提取,语义由DINOv3提供,两者都是即取即用的预训练模型。RGB和点图共享一个冻结的Wan-2.2 VAE编码到同一潜在空间,再通过Mixture-of-Transformers融合。部署时可丢弃任意视觉模态,模型仍受益于训练时的额外监督。

训练策略与推理灵活性

训练时,Flex-π随机掩蔽部分视觉输入流,并施加跨模态强制:无论某模态是否作为输入被观测到,都要生成其未来流。这使得单个训练好的checkpoint在推理时能灵活选择输入与输出子集,实践者可在速度–性能折中曲线上自行定位,既可选VLA-style仅动作输出,也可选WAM-style联合RGB、3D和DINO。作者称这种掩蔽策略迫使模型从其他模态内化每种视觉表征,从而提升策略性能。

❓

Q&A

Flex-π 是什么?它主要想解决什么问题?

Flex-π 是华盛顿大学与英伟达提出的 60 亿参数世界-动作模型(WAM),旨在调和 VLA 与 WAM 之争。它让 WAM 兼容 VLA,将范式之争转化为同一模型权重内部的快慢路径选择,从而兼顾实时性与泛化能力。

Flex-π 如何在不增加额外传感器和推理延迟的情况下,利用 3D 几何和物体语义信息?

Flex-π 从同一张 RGB 图像中提取 3D 点图(通过 Depth Anything 3)和物体语义(通过 DINOv3),无需额外传感器。它使用一个预训练视频生成模型的单一冻结 VAE 将 RGB 和 3D 点图编码到同一潜在空间,并用 DINOv3 提供语义 token。训练时随机掩蔽视觉流并施加跨模态强制,使推理时可丢弃任意视觉模态而不增加延迟。

Flex-π 在推理时如何实现计算灵活性?用户可以选择哪些模式?

Flex-π 在训练时对输入和输出视觉流同时进行掩蔽,并施加跨模态强制,使得单个训练好的 checkpoint 在推理时支持任意组合的输入与输出流。用户可以选择 VLA-style(仅动作)进行快速部署,也可以选择 WAM-style(RGB + 3D + DINO)进行更全面的预测,从而在时延与性能之间进行权衡。

Flex-π 与 Fast-WAM 等现有 WAM 相比,主要区别是什么?

现有通用 WAM(如 Fast-WAM)通常只预测未来的 RGB 潜变量,而 Flex-π 会联合去噪 RGB 潜变量、表示物体语义的 DINO 特征以及 3D 点图,从而将 WAM 训练监督扩展到几何与语义两方面。此外,Flex-π 通过随机掩蔽和跨模态强制,使单一模型在推理时能灵活选择快慢路径,而无需训练部署两套权重。

Flex-π 的训练目标是什么?它如何联合生成未来视觉特征和动作?

Flex-π 的训练目标是联合预测未来的 RGB 观测、3D 点图和物体级语义,同时生成动作。它使用来自预训练视频生成模型的单一冻结 VAE 编码 RGB 和 3D 点图,用 DINOv3 提供语义 token,每种模态形成一条 token 流,通过 Mixture-of-Transformers 主干网络融合。动作专家对视觉流进行交叉注意,生成动作片段,从而实现联合生成。

Flex-π 在训练中使用的跨模态强制是什么?它有什么作用?

跨模态强制是指在训练时随机丢弃部分视觉输入流,但要求模型无论某个模态是否作为输入被观测到,都要生成其未来流。这种做法迫使模型从其他模态中内化每一种视觉表征,从而提升策略性能,并使单一 checkpoint 在推理时能灵活处理任意可用视觉输入与输出子集。

🏷️

标签

➡️

继续阅读