2026年北京国际汽车展览会以“领时代 智未来”为主题,展示汽车行业智能化转型的新趋势。新车型如理想L9 Livis和小鹏GX通过“具身智能”和“物理AI”技术提升了车辆的感知与服务能力。智能驾驶系统从“能用”向“可信”转变,强调安全性和可靠性。跨国车企如宝马、奔驰等开始本土化布局,推动智能化进程,未来竞争将聚焦于系统能力与安全性。
本文研究了如何将视觉-语言模型(VLMs)整合到驾驶系统中,以增强泛化能力和与用户互动。通过建立图结构推理的问答对模型,提出了Graph VQA任务,模拟人类推理过程。实验证明Graph VQA为驾驶场景提供了简单和有原则的框架,DriveLM-Data为任务提供了具有挑战性的基准。DriveLM-Agent在端到端自动驾驶方面表现出竞争力,尤其在零样本评估时效果显著。希望这项工作能为将VLMs应用于自动驾驶提供新的启示。
本文研究了如何将视觉-语言模型(VLMs)整合到驾驶系统中,以增强泛化能力和与用户的互动。通过建立图结构推理的问答对模型,提出了Graph VQA任务,模拟人类的推理过程。构建了基于nuScenes和CARLA的数据集(DriveLM-Data),并提出了基于VLM的基准方法(DriveLM-Agent)。实验证明Graph VQA为驾驶场景的推理提供了简单和有原则的框架,DriveLM-Data为这一任务提供了具有挑战性的基准。DriveLM-Agent在端到端自动驾驶方面表现出竞争力,尤其在未见过的对象或传感器配置上进行零样本评估时效果显著。希望这项工作能为将VLMs应用于自动驾驶提供新的启示。
本研究将视觉-语言模型整合到驾驶系统中,以增强泛化能力和与用户互动。通过建立图结构推理的问答对模型,提出了Graph VQA任务。实验证明Graph VQA为驾驶场景的推理提供了简单和有原则的框架。希望这项工作能为将VLMs应用于自动驾驶提供新的启示。
本文研究了将视觉-语言模型整合到驾驶系统中的方法,以增强泛化能力和与用户的互动。通过建立图结构推理的问答对模型,提出了Graph VQA任务。实验证明Graph VQA为驾驶场景的推理提供了简单和有原则的框架。希望这项工作能为将VLMs应用于自动驾驶提供新的启示。
完成下面两步后,将自动完成登录并继续当前操作。