小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
LightNav-0——激发VLM的空间智能实现跨本体通用:基于单目RGB与统一token接口,结合时间感知历史压缩、两阶段课程与GRPO在线强化

LightNav-0是一种基于Qwen3-VL-4B构建的紧凑通用具身导航模型,无需任务特定预测头。它通过双通道指向接口(可供性点与物体点)表达空间意图,并利用残差向量量化动作分词器将意图映射为10个SE(2)航点,实现精确连续控制。模型采用时间感知视觉历史压缩、具身推理中期训练、监督微调与强化学习,单一模型即可支持指令跟随、开放词汇物体导航和视觉跟踪,训练数据覆盖2K+场景、4K+小时。

LightNav-0——激发VLM的空间智能实现跨本体通用:基于单目RGB与统一token接口,结合时间感知历史压缩、两阶段课程与GRPO在线强化

结构之法 算法之道 结构之法 算法之道 · 2026-09-15T12:18:26Z
NavFoM——打造VLN基础模型:通过安装在机器人上的摄像头和人类下达的指令,预测移动轨迹(可跨任务、跨本体)

本文介绍了NavFoM,一个跨任务和跨形态的具身导航基础模型。该模型通过处理自我视角视频和语言指令来预测导航轨迹,经过八百万个样本的训练,采用时序-视角指示符token和预算感知时序采样策略,以提升模型的泛化能力和实用性。研究者强调开源和分享对技术影响力的重要性。

NavFoM——打造VLN基础模型:通过安装在机器人上的摄像头和人类下达的指令,预测移动轨迹(可跨任务、跨本体)

结构之法 算法之道 结构之法 算法之道 · 2025-09-26T16:50:36Z

本文介绍了NavA3框架,旨在解决具身导航中的高层次指令理解与空间定位问题。该框架包括全局策略和局部策略,利用视觉语言模型解析指令并确定目标位置,随后通过NaviAfford模型实现精确导航。研究表明,NavA3在真实环境中的长时导航任务中表现优异,展现出强大的跨载体能力。

NavA3——双VLM架构下的先“推理解析”后“定位导航”:理解任意指令,导航至任意地点,查找任意目标

结构之法 算法之道 结构之法 算法之道 · 2025-08-21T09:35:25Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码