内容提要
LightNav-0是一种基于Qwen3-VL-4B构建的紧凑通用具身导航模型,无需任务特定预测头。它通过双通道指向接口(可供性点与物体点)表达空间意图,并利用残差向量量化动作分词器将意图映射为10个SE(2)航点,实现精确连续控制。模型采用时间感知视觉历史压缩、具身推理中期训练、监督微调与强化学习,单一模型即可支持指令跟随、开放词汇物体导航和视觉跟踪,训练数据覆盖2K+场景、4K+小时。
延伸解读
双通道指向:统一空间意图的轻量接口
LightNav-0 用可供性点和物体点两个图像网格 token 表达空间意图,分别指示可行方向与任务目标。这种设计不依赖任务标识或额外预测头,使同一接口能支持指令跟随、开放词汇物体导航和视觉跟踪。读者可关注其如何复用 VLM 预训练的视觉落地能力,而非替换它,从而在保持模型紧凑的同时实现跨任务泛化。
RVQ 动作分词器:兼顾精度与可训练性
模型将 10 个 SE(2) 航点用三层残差向量量化编码为三个 token,由原始语言模型头输出。这样既保留了连续控制的几何精度,又使策略梯度可直接基于 token 对数概率计算,无需扩散规划器或独立动作头。其代价是动作空间被量化,但文章认为三个 token 的短轨迹足以平衡精度与 rollout 成本。
时间感知压缩:在有限预算内保留长短期信息
视觉历史按时间新近性压缩:近期观测采样更密、分辨率更高,远期观测则更稀疏、更聚合。该机制在 256K 至 1M 像素预算下分配 token,避免历史帧无限增长。读者需注意,这种慢-快分配依赖时间戳 token 维持顺序,其效果受采样率与池化步幅参数影响,文章未给出具体调参细节。
训练策略与泛化边界
LightNav-0 采用具身推理中期训练、结合 DAgger 的监督微调及在线强化学习,分阶段对齐感知、推理与控制。训练语料覆盖 2K+ 场景和 4K+ 小时数据,但文章未披露具体任务分布或真实机器人测试结果。其泛化能力主要来自共享 token 接口和单目 RGB 输入,实际部署时仍需验证不同本体与环境的迁移表现。
Q&A
LightNav-0 是什么?它和传统导航系统有什么不同?
LightNav-0 是一种基于 Qwen3-VL-4B 构建的紧凑通用具身导航模型,无需任务特定的预测头。与传统导航系统不同,它不依赖针对特定任务或形体设计的组件,而是通过统一 token 接口(双通道指向和 RVQ 动作分词器)将感知、推理与行动整合在单一模型中,支持指令跟随、开放词汇物体导航和视觉跟踪。
LightNav-0 如何实现空间意图的表达和动作控制?
LightNav-0 通过双通道指向接口表达空间意图:可供性点指示可行方向或自由空间航路点,物体点定位任务目标。然后利用残差向量量化(RVQ)动作分词器将意图映射为 10 个 SE(2) 航点,实现精确连续控制。整个过程中,指向前缀和动作 token 均由原始语言模型头解码,无需额外预测头。
LightNav-0 支持哪些导航任务?
LightNav-0 在单一模型中支持三种导航任务:指令跟随(VLN)、开放词汇物体导航和视觉跟踪导航。任务语义完全由指令和监督格式指定,不引入任务标识 token。
LightNav-0 的训练过程包括哪些阶段?
LightNav-0 的训练包括四个阶段:具身推理中期训练(ER 中期训练)、监督微调(结合 DAgger)、在线强化学习,以及时间感知视觉历史压缩。训练数据覆盖 2K+ 场景和 4K+ 小时的具身导航数据。
LightNav-0 如何处理长时程视觉历史以控制 token 数量?
LightNav-0 采用时间感知的视觉历史压缩机制,遵循艾宾浩斯遗忘曲线:近期观测获得更高采样率和更精细空间分辨率,较早观测采样更稀疏且聚合更粗糙。通过帧采样和分层自适应池化,在 256K、576K 和 1M 像素预算下分配 token,从而在有限预算内保留近期细节和长时程上下文。
LightNav-0 的强化学习后训练有什么特点?
LightNav-0 使用残差向量量化(RVQ)接口,每个决策步的轨迹由三个 RVQ token 构成,这些 token 由与生成语言相同的 head 输出,因此对数概率精确,可直接应用基于组的相对策略优化(如 GRPO),无需辅助 MDP、去噪重构或单独 critic。同时解码仍能恢复 10 个连续 SE(2) 航点,兼顾了精确动作和易处理的概率分布。