使用内存高效稀疏卷积的自动驾驶实时三维语义占位预测

💡 原文中文,约1700字,阅读约需4分钟。
📝

内容提要

本文介绍了全稀疏全景占用网络(SparseOcc),通过稀疏实例查询和时间建模实现自主驾驶的占用预测,达到26.0的平均交并比(mIoU)和25.4 FPS的实时推理速度。此外,提出了多种基于传感器的语义定位算法和自监督学习方法SelfOcc,显著提高了3D占用预测的准确性和效率。

🔎

延伸解读

稀疏卷积如何提升实时性

SparseOcc采用全稀疏表示,通过稀疏实例查询和掩模引导的稀疏采样,避免了对空白区域的冗余计算。结合前8帧的时间建模融合,在Occ3D-nus数据集上实现了25.4 FPS的实时推理速度,同时保持26.0 mIoU的精度。这种设计表明,稀疏卷积和时序融合可以在不牺牲性能的前提下,显著提升自动驾驶占用预测的实时性。

自监督学习降低标注依赖

SelfOcc利用视频序列进行自监督学习,仅需图像即可学习3D占用表示,无需昂贵的3D标注。在SemanticKITTI和Occ3D上,单帧输入相比之前最佳方法SceneRF提升了58.7%,并首次在Occ3D上为环视摄像头生成合理的3D占用。这为降低自动驾驶感知系统的数据标注成本提供了可行路径。

多传感器语义定位的精度与存储优势

文章提出基于多传感器的语义定位算法,融合车道、交通标志和车辆动态信息,在贝叶斯滤波框架下实现鲁棒定位。相比传统基于几何和LiDAR强度的方法,所需存储空间降低数个数量级,并在312公里公路数据集上达到0.05米横向精度和1.12米纵向精度。这表明语义信息可以大幅压缩地图存储,同时保持高定位精度。

❓

Q&A

SparseOcc网络的主要功能是什么?

SparseOcc网络通过稀疏实例查询和时间建模实现自主驾驶的占用预测。

SparseOcc在Occ3D-nus数据集上的表现如何?

SparseOcc在Occ3D-nus数据集上达到了26.0的平均交并比(mIoU)和25.4 FPS的实时推理速度。

SelfOcc自监督学习方法的优势是什么?

SelfOcc通过使用视频序列学习3D占用情况,显著提升了预测性能,并在多个数据集上达到了最先进的结果。

如何提高3D占用预测的准确性和效率?

通过提出基于多个传感器的语义定位算法,可以显著提高3D占用预测的准确性和效率。

SparseOcc网络的基础模块是什么?

SparseOcc网络的基础模块是轻量级的Sparse Point-Voxel Convolution模块。

SparseOcc如何处理时间建模?

SparseOcc通过融合先前8帧的数据进行时间建模。

🏷️

标签

➡️

继续阅读