BEV-CLIP: 复杂场景下自动驾驶的多模态 BEV 检索方法
原文中文,约300字,阅读约需1分钟。
📝
内容提要
我们提出了一种多模式Bird's-Eye View(BEV)检索方法BEV-CLIP。它利用描述性文本作为输入来检索相应的场景,并结合语言模型和知识图的信息来提高语义丰富性和嵌入的多样性。在实验中,我们的方法在NuScenes数据集上达到了87.66%的准确率。
🏷️