把Agent放进真实尺度香港,上交大/新加坡国立大学/美团等提出UrbanGround,测试多模态模型城市探索能力

把Agent放进真实尺度香港,上交大/新加坡国立大学/美团等提出UrbanGround,测试多模态模型城市探索能力

💡 原文中文,约4300字,阅读约需11分钟。
📝

内容提要

该文章介绍了一项关于多模态大语言模型(MLLM)在城市导航中能力的研究。研究团队构建了基于香港真实地理数据的URBANGROUND交互环境,评测了GPT-5.5等模型。结果显示,模型具备局部空间识别和短距离导航能力,但长距离导航和动态环境适应能力不足,难以将局部感知转化为持续可靠的城市行动。

🔎

延伸解读

评测设计:从静态识别到动态闭环

URBANGROUND 将城市导航拆解为空间锚定、持久性和适应性三个层面,并设计了五级评测体系。与静态图片或预设路线评测不同,该环境要求智能体在真实尺度的香港中持续移动,形成“观察—决策—行动—再观察”的闭环。这种设计更贴近真实导航场景,能更全面地暴露模型在长距离和动态环境中的不足。

关键发现:局部能力与全局行动脱节

实验显示,当前多模态大模型在局部空间识别上表现较好,但方向判断常接近随机猜测。更值得注意的是,即使模型能正确识别目标,也可能横穿道路或无法处理障碍物。长距离导航成功率随距离增加而下降,但失败轨迹中超过一半的终点比起点更接近目标,说明模型具备局部正确行动能力,却难以维持整体路线和任务进度。

环境变化下的适应性短板

当天气、能见度或道路状态改变时,模型的表现并不一致。部分模型在雨雾等低能见度条件下空间问答准确率下降,但短距离导航成功率变化趋势不明显,表明导航失败不仅源于视觉识别,还与路线状态维护和动作执行有关。道路关闭或出现移动行人时,模型常做出局部合理的动作,却未能及时重建有效路线,凸显了动态适应能力的不足。

Q&A

URBANGROUND是什么?它由哪些机构联合提出?

URBANGROUND是一个基于香港真实地理数据的城市级交互环境,用于评测多模态大语言模型(MLLM)在城市导航中的能力。它由上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学和牛津大学联合研究团队构建。

URBANGROUND使用了哪些地理数据来构建仿真环境?

URBANGROUND使用了香港地政总署发布的3D Digital Map中的两类数据:3D Visualisation Map(三维可视化地图)和3D Pedestrian Network(三维行人网络)。前者提供覆盖香港全境的纹理三维网格,后者描述行人空间的连接关系。

URBANGROUND评测了哪些多模态大模型?

URBANGROUND评测了多个当代MLLM,包括GPT-5.5、GPT-5.4、GPT-5.2,Claude-Opus-5、Claude-Opus-4.6,Gemini-3.6-Flash、Gemini-3.1-Pro,以及Doubao-Seed-2.0-Pro、GLM-5V-Turbo和Kimi-K3等。

URBANGROUND的评测体系分为哪几个级别?

URBANGROUND的评测体系分为五级:第一级考察视觉识别、方向判断和主动探索;第二至第四级逐步加入短距离与长距离导航、指令式导航、目的地推断和多站点规划;第五级则改变时间、天气、道路和行人状态,检验模型的适应能力。

URBANGROUND评测的主要结论是什么?

评测结果显示,当前MLLM具备较好的局部空间理解能力和短距离导航能力,但长距离导航和动态环境适应能力不足,难以将局部感知转化为持续可靠的城市行动。

URBANGROUND中智能体的交互流程是怎样的?

智能体在每一步交互中接收当前第一人称相机生成的RGB图像、任务指令和文本交互历史,可以选择移动、调整视角、跳跃或打开地图等动作。动作执行后,系统根据新位置和环境状态生成下一次观察,形成“观察—决策—行动—再观察”的闭环。

URBANGROUND中模型在方向判断上的表现如何?

在方向判断任务中,模型表现明显变差。一些模型能正确识别地标,却无法稳定判断其相对自身朝向的位置,部分模型在四选一方向问题上的表现接近随机猜测。

URBANGROUND中模型在长距离导航中的表现如何?

在长距离导航中,模型成功率迅速下降,几乎难以完整完成。轨迹分析显示,超过一半失败轨迹的终点比起点更接近目标,说明模型能完成局部正确行动,但难以长期维持对整体路线和任务进度的判断。

🏷️

标签

➡️

继续阅读