该论文提出了一种新的自主导航系统中目标导航的方法,称为深度推理终止代理(DITA),通过将监督模型与强化学习相结合来隐式推断目标的深度并决定结束。评估显示该方法在各个房间类型上取得了9.3%的成功率提升,并在长期轨迹环境上取得了51.2%的改进。
完成下面两步后,将自动完成登录并继续当前操作。