小红花·文摘

本文解读了四篇paper，其中包括使用大模型进行可解释的端到端自动驾驶的研究。作者使用BDD-X数据集进行训练，该数据集包含视频和标签，用于预测车辆行为。为了增加多样性，作者还创建了自己的数据集，并使用ChatGPT作为教师生成更多关于自车的对话。最终，他们收集了56K视频-文本指令跟随样本，包括16K BDD-X问答和40K由ChatGPT生成的问答。DriveGPT4是一种多功能的多模态大型语言模型，能够处理各种输入类型，包括视频和文本。