小鹏新版 VLA 9 月实装:记住过去 30 秒,预判未来 6 秒,开始在「时间里」开车

小鹏新版 VLA 9 月实装:记住过去 30 秒,预判未来 6 秒,开始在「时间里」开车

💡 原文中文,约3600字,阅读约需9分钟。
📝

内容提要

小鹏发布第二代VLA智驾系统,赋予汽车“时间感知”能力,可回溯30秒路况、预判未来6秒,实现更拟人化的驾驶决策。新版本扩大模型参数3.5倍,提升复杂场景处理能力,并计划应用于L4 Robotaxi。小鹏借此转型“物理AI企业”,强调汽车与机器人共享同一技术底座,推动智驾从规则驱动迈向模型驱动。

🔎

延伸解读

时间感知如何改变驾驶决策

传统智驾系统基于单帧图像做决策,而小鹏第二代VLA通过记忆过去30秒路况和预判未来6秒,让车辆能理解持续发生的行为,如前方车辆掉头。这种时间维度的感知使决策更拟人化,减少因信息不足导致的误判,提升复杂场景下的安全性和流畅度。

大模型与规则系统的本质差异

小鹏强调,依赖固定规则的系统难以应对未知场景,而大模型通过扩大参数量和数据训练,旨在处理从未见过的corner case。例如,面对悬空树枝,模型能主动减速并寻找通过空间,而非简单停在原地。这种泛化能力是规则系统难以企及的,也是智驾向模型驱动转型的核心。

数据闭环与仿真验证的重要性

小鹏构建了数据、模型、仿真的闭环:真实数据提供训练素材,仿真系统对模型进行多场景验证,暴露的问题再反馈到数据库形成“错题集”。这种机制能持续提升模型能力,每日仿真验证的新模型数量增长290%,为量产推送提供保障。

汽车与机器人的技术同源

小鹏将汽车定义为“物理AI”的载体,与机器人共享同一套基座模型。这种技术同源意味着汽车和机器人可以复用感知、决策和执行能力,降低研发成本,并为未来L4 Robotaxi和具身智能铺路。但这一转型也需持续投入和量产验证,才能兑现技术愿景。

Q&A

小鹏第二代VLA智驾系统的主要特点是什么?

小鹏第二代VLA智驾系统的主要特点是具备“时间感知”能力,能够记住过去30秒的路况,并预判未来6秒可能发生的情况,从而实现更拟人化的驾驶决策。

小鹏第二代VLA如何实现时间感知?

小鹏第二代VLA通过三个关键技术实现时间感知:Infini-VLA负责记住过去30秒的路况;Streaming Inference(流式自回归推理)实现边获取输入边推理,提升决策速度300%;X-Foresight结合Flow Matching预判未来6秒的多种可能轨迹,并选择更合适的动作。

小鹏第二代VLA的推送计划是怎样的?

全新VLA 6.3.0版本将于9月开始面向所有Ultra和Ultra SE车型推送,小鹏G9L Ultra与Ultra SE将首发搭载;单图灵芯片Max车型将在9月获得第二代VLA Lite蒸馏版,G9L Max也会首发搭载。

小鹏第二代VLA相比上一代在模型参数上有何变化?

小鹏第二代VLA将模型参数量扩大了3.5倍,以提升处理复杂场景的能力。

小鹏第二代VLA在复杂场景中表现如何?

在演示中,测试车在轮渡码头无清晰车道线的情况下自主找到入口并开上轮渡;在狭窄山路遇到悬空树枝时,主动减速观察并寻找通过空间,而不是简单停车或直接冲过。这些表现体现了模型对非常规场景的理解能力。

小鹏如何通过数据和仿真提升模型能力?

小鹏建立了向量化的数据检索系统,从用户上报或测试问题中提取语义相似的场景组成“错题集”;模型训练后通过仿真系统对车型、天气、光照和视角进行变化反复验证。从6月到沟通会前两周,每日仿真验证的新模型数量提升了290%。

小鹏第二代VLA与特斯拉FSD在极端案例中的表现有何不同?

文章提到特斯拉FSD在公寓停车楼中试图朝顶层金属铁丝网方向寻找通路,而小鹏VLA在类似场景中能理解那是不是一条路,做出不同判断。这体现了小鹏VLA对道路语义的理解能力。

小鹏如何将VLA技术应用于L4 Robotaxi?

小鹏计划将同一套架构和模型用于L2驾驶辅助与L4 Robotaxi。其Robotaxi内测已完成超过2000单,搭载第二代VLA的Robotaxi近日获得广州市智能网联汽车远程测试资质,可开展主驾无安全员道路测试。

小鹏为何将自己定义为“物理AI企业”?

小鹏认为汽车和机器人共享同一技术底座,感知环境、记忆、理解意图、执行动作等能力是通用的。小鹏展示了车辆与机器人使用同一套基座模型,并强调“汽车即机器人”,因此将自己定义为“物理AI企业”。

🏷️

标签

➡️

继续阅读