本文介绍了一种名为NavGPT的导航代理,基于大语言模型,能够执行视觉和语言导航任务。实验表明,NavGPT在复杂环境中具备出色的推理和规划能力,能够将指令分解为子目标并适应特殊情况。此外,研究还提出了多机器人合作导航框架Co-NavGPT和基于视频的导航模型NaVid,均在导航性能上优于现有模型,为未来导航研究奠定了基础。
完成下面两步后,将自动完成登录并继续当前操作。