Uni-NaVid: A Video-Based Vision-Language-Action Model for Unifying Embodied Navigation Tasks

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种新的视频基础视觉-语言-动作模型Uni-NaVid,旨在克服现有导航模型的局限性,实现多种导航任务的无缝执行。实验结果表明,Uni-NaVid在多个基准测试中表现优异,具备良好的通用性。

🏷️

标签

➡️

继续阅读