BEV-CLIP: 复杂场景下自动驾驶的多模态 BEV 检索方法

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

我们提出了一种多模式Bird's-Eye View(BEV)检索方法BEV-CLIP。它利用描述性文本作为输入来检索相应的场景,并结合语言模型和知识图的信息来提高语义丰富性和嵌入的多样性。在实验中,我们的方法在NuScenes数据集上达到了87.66%的准确率。

🏷️

标签

➡️

继续阅读