时隔十年,AI大牛署名新论文

时隔十年,AI大牛署名新论文

💡 原文中文,约4500字,阅读约需11分钟。
📝

内容提要

任少卿团队提出MM-Future多模式世界—动作联合模型,可一次生成多组场景—动作假设并共同演化,再筛选最优轨迹。该模型通过MM-Tokens压缩视觉特征、Best-of-Many监督和专属未来评分器,在NAVSIM上PDMS达94.0,验证了多模式联合建模能稳定提升规划指标,但计算开销与隐式表征仍待解决。

🔎

延伸解读

多模式联合建模的增益来源

消融实验显示,仅生成动作且单模式时PDMS为84.1,动作候选增至32种后升至92.3;加入场景—动作联合生成后,单模式为85.1,32模式达92.9;评分器读取配对未来后进一步升至93.3。这表明模式数量是主要增益来源,联合生成和配对未来评分依次叠加提升,且多模式训练收敛更快,32模式达到0.80验证PDM分数约需3.8k步,单模式需17.5k步。

计算开销与实时性权衡

论文主模型一次采样64组场景—动作候选,在单张NVIDIA H800、batch size为1、bf16条件下,端到端前向延迟约233ms。16种候选的延迟与单模式方案接近,增至32种后延迟明显提高。这说明多模式联合建模虽提升规划指标,但候选覆盖范围与计算成本需平衡,实时部署可能需针对模式数量进行裁剪或优化。

闭环测试与极端场景的局限

在HUGSIM闭环测试中,MM-Future未继续微调,436个场景上平均HD-Score为32.3,高于Latent-WAM的28.9和UniAD的28.6,但平均Route Completion为44.5,略低于Latent-WAM的45.9;Extreme难度下HD-Score仅8.6,远低于Latent-WAM的18.1。这表明模型在极端场景下的稳定性仍有不足,闭环表现与开环指标存在差距。

隐式表征与可解释性挑战

MM-Tokens将多摄像头、多时间帧视觉特征压缩为面向规划的紧凑表示,不重建RGB图像或完整BEV,注意力可视化显示其关注道路结构、路口、前车及周围交通参与者等区域。但论文指出,MM-Tokens属于隐式场景表征,模型保留哪些规划信息仍难直接观察。作者计划增加辅助感知模块,可视化规划相关场景结构,以提升透明度并辅助故障诊断。

❓

Q&A

MM-Future是什么?它要解决自动驾驶中的什么问题?

MM-Future是任少卿团队提出的多模式世界—动作联合模型,旨在解决同一驾驶场景下系统需要处理多种可能未来和轨迹的问题。它让模型一次生成多组场景—动作假设,并让轨迹与未来场景共同演化,最后筛选最优轨迹。

MM-Future如何实现多模式联合建模?

MM-Future通过三项设计实现:1)在动作端使用Gaussian Mixture Noise、场景端使用独立噪声,并加入Best-of-Many监督来产生多样性;2)使用MM-Tokens压缩多摄像头多时间帧视觉特征,控制计算成本;3)使用modality-aware Transformer让动作流和场景流共同演化,最后用Future-Conditioned Proposal Scorer筛选最优轨迹。

MM-Future在NAVSIM基准上的表现如何?

在NAVSIM-v1 navtest上,MM-Future获得94.0 PDMS,高于DriveFuture的90.7和DrivoR的93.7;在NAVSIM-v2上获得91.5 EPDMS,高于UniTeD的90.1和DriveFuture的89.9。消融实验显示,增加模式数量、联合生成场景与动作、以及配对未来参与评分均能提升指标。

MM-Future有哪些局限性或待解决的问题?

MM-Future存在计算开销较大(64组候选时前向延迟约233ms)、隐式场景表征难以解释、闭环测试中极端场景稳定性不足(如HUGSIM上Extreme难度HD-Score仅8.6)等问题。作者计划增加辅助感知模块提升透明度。

MM-Future与现有的World-Action Model方案有何不同?

现有方案分为级联式和联合式:级联式先生成候选轨迹再预测未来场景,信息单向传递;联合式虽能双向交互但通常只生成单组结果。MM-Future同时生成多组场景—动作假设,每组内部场景和动作共同演化,实现了多模式与双向交互的结合。

MM-Future对自动驾驶世界模型的发展意味着什么?

MM-Future表明世界模型正从未来预测走向规划,模型不仅估计场景变化,还比较不同动作对应的不同场景结果。多模式定义从“可以走哪几条轨迹”扩展到“采取不同轨迹后环境分别可能怎样变化”,世界模型开始承担动作后果建模的一部分功能。

🏷️

标签

➡️

继续阅读