自动驾驶大模型开始统一看懂、建图和规划

自动驾驶大模型开始统一看懂、建图和规划

💡 原文中文,约2000字,阅读约需5分钟。
📝

内容提要

Qwen发布Qwen-Drive-1.0,以Qwen3.5-4B为骨干,外接BEV感知头与规划专家,用流匹配生成未来5秒轨迹,训练数据283万条,驾驶问答均分69.43。其核心是让感知、解释与规划共享表示并保留可检查接口,但文本与轨迹一致性不足,距量产尚远,需独立复现与闭环验证。

🔎

延伸解读

共享表示与可检查接口的价值

文章指出,驾驶大模型的关键进步不是让语言模型直接控制车辆,而是让感知、解释与规划共享表示,同时保留可检查的中间接口。Qwen-Drive-1.0通过外接BEV感知头和规划专家,使工程师能检查模型是否看漏车辆或认错路缘,而不是只等最终轨迹出错。这种设计将端到端系统从完全黑箱改造成带探针的共享主干,便于定位错误发生在哪一层。

评测成绩的解读边界

Qwen-Drive-1.0-SFT在驾驶问答评测中平均分为69.43,但文章强调这仅是作者设定评测中的问答成绩,不能等同于道路安全率。开放环、伪闭环和闭环模拟成绩也不能替代真实道路对长尾事件、传感器故障和法规责任的验证。此外,代码页写的是“将提供”,不应据此声称项目已可完整复现。官方也承认文字推理与生成轨迹之间的一致性仍需加强。

短期适用场景与量产距离

文章认为,该模型短期内更适合作为研究底座、仿真规划器或驾驶数据分析工具,而非直接成为量产控制器。真正上车还需经过传感器冗余、实时性、故障降级和当地法规认证。对开发者而言,这种架构允许分别评测感知、问答、规划与跨模块一致性;对普通人,潜在价值不是车更会聊天,而是系统更容易解释它看到了什么以及为何给出某条轨迹。

独立复现与长尾风险

所有核心结果主要来自发布团队,尚需独立复现。公开数据集可能低估雨雪、施工、罕见交通参与者和地区交通规则差异,闭环模拟也可能存在仿真器偏差。即使模型平均成绩更好,极少数高后果错误仍可能决定系统能否部署。因此,在代码与权重真正开放前,应把官方结果视作待复现基线,并建立遮挡、逆光、传感器缺失等长尾场景集进行验证。

Q&A

Qwen-Drive-1.0是什么?它的核心架构是怎样的?

Qwen-Drive-1.0是Qwen团队于2026年9月10日发布的自动驾驶大模型。它以原生多模态的Qwen3.5-4B为主干,不改预训练VLM架构,外接两个模块:BEV感知头负责三维目标检测、语义占用预测和鸟瞰地图分割;Planning Expert读取共享表示,用流匹配生成车辆未来轨迹。

Qwen-Drive-1.0的训练数据和评测成绩如何?

训练数据全部来自公开数据集,共283万条样本;规划输出覆盖未来5秒、频率10Hz。Qwen-Drive-1.0-SFT在其驾驶问答评测中的平均分为69.43。

为什么Qwen-Drive-1.0要保留BEV感知头?

BEV把多摄像头画面投到统一鸟瞰坐标,显式表示车、道路、占用区域和可行驶空间。它像一块中间白板,工程师可以检查模型是否看漏车辆、是否把路缘认错,而不是只等最终轨迹出错。保留BEV是为了让感知、解释与规划共享表示,同时保留可检查的中间接口。

Qwen-Drive-1.0的Planning Expert是如何生成轨迹的?

Planning Expert是面向动作的扩散Transformer。它不是逐字写一段“左转理由”,而是在共享视觉语义表示上,通过流匹配逐步生成一组未来轨迹点。分阶段训练再把不同数据集的标签和轨迹格式统一,并混入通用视觉语言数据,降低只会驾驶题、却遗忘通用理解能力的风险。

Qwen-Drive-1.0目前有哪些局限和风险?

官方承认文字推理与生成轨迹之间的一致性仍需加强。69.43只是作者设定评测中的驾驶问答成绩,不能写成道路安全率;开放环、伪闭环和闭环模拟成绩,也不能替代真实道路里对长尾事件、传感器故障和法规责任的验证。代码页写的是“将提供”,不应据此声称项目已经可完整复现。所有核心结果主要来自发布团队,尚需独立复现。公开数据集可能低估雨雪、施工、罕见交通参与者和地区交通规则差异。闭环模拟也可能存在仿真器偏差。

Qwen-Drive-1.0对开发者和普通人有什么影响?

对开发者,这种架构把“端到端”从完全黑箱改造成带探针的共享主干。数据团队可以统一多数据集标签,评测团队可以分别测感知、问答、规划与跨模块一致性。对普通人,潜在价值不是车更会聊天,而是系统更容易解释“它看到了什么、为何给出这条轨迹”。短期内,它更适合作为研究底座、仿真规划器或驾驶数据分析工具,而不是直接成为量产控制器。

🏷️

标签

➡️

继续阅读