2024自动驾驶(多模态)大模型综述:从DriveGPT4、DriveMLM到DriveLM、DriveVLM
内容提要
本文解读了四篇paper,其中包括使用大模型进行可解释的端到端自动驾驶的研究。作者使用BDD-X数据集进行训练,该数据集包含视频和标签,用于预测车辆行为。为了增加多样性,作者还创建了自己的数据集,并使用ChatGPT作为教师生成更多关于自车的对话。最终,他们收集了56K视频-文本指令跟随样本,包括16K BDD-X问答和40K由ChatGPT生成的问答。DriveGPT4是一种多功能的多模态大型语言模型,能够处理各种输入类型,包括视频和文本。
延伸解读
数据生成策略:混合真实与合成
文章指出,DriveGPT4的训练数据结合了BDD-X的真实标注和ChatGPT生成的合成对话。BDD-X提供约2万样本,包含动作描述、理由和控制信号;而ChatGPT基于YOLOv8检测结果、真实控制信号和字幕,生成了4万条多轮对话。这种混合策略旨在增加数据多样性,防止模型过拟合固定问答模式,但合成数据的质量依赖于教师模型和特权信息的准确性。
模型架构:统一处理视频、文本与控制信号
DriveGPT4采用多模态LLM架构,视频经采样和tokenizer转换为文本域token,与文本指令一同输入LLaMA 2。其创新点在于借鉴RT-2,使用相同的文本de-tokenizer解码控制信号,将速度和转向角视为一种语言,使LLM能直接输出低级控制。这种设计简化了输出接口,但控制信号的精度和连续性可能受文本token化限制。
可解释性:从黑箱到自然语言理由
文章强调,传统端到端自动驾驶缺乏可解释性,限制其可信度。DriveGPT4通过生成自然语言解释车辆行为及其理由(如“汽车停下,因为红灯”),提升了透明度。这种可解释性不仅有助于调试和验证,还可能增强用户信任,为商业化铺路。然而,解释的准确性和可靠性仍需进一步评估,避免生成看似合理但错误的理由。
Q&A
DriveGPT4是什么类型的模型?
DriveGPT4是一种多功能的多模态大型语言模型,能够处理视频和文本等多种输入类型。
BDD-X数据集包含哪些信息?
BDD-X数据集包含约20,000个样本,提供车辆动作描述、动作理由和控制信号数据。
如何生成用于训练的问答对?
通过生成同义问题集,并使用BDD-X标签作为答案,形成问答对以训练大模型。
ChatGPT在DriveGPT4的训练中起什么作用?
ChatGPT被用作教师生成关于自车的对话,帮助创建多样化的数据集。
DriveGPT4如何处理视频输入?
视频被均匀采样为固定数量的图像,并使用视频tokenizer将视频帧转换为文本tokens。
端到端自动驾驶的目标是什么?
端到端自动驾驶旨在基于视觉输入直接预测车辆路径和控制信号。