本文提出了一种新型导航框架,结合大型语言模型和视觉语言技术,应用于视觉导航任务。框架包括指令解析、视觉-语言地图构建、定位和动作预测等组件。实验结果表明,该方法在真实环境中优于现有基线,显示出在多机器人协作和工业异常检测等领域的潜力,显著提高了模型的性能和准确率。
完成下面两步后,将自动完成登录并继续当前操作。