ECCV 2024 - 基于文本到图像扩散模型的开放词汇3D语义分割

ECCV 2024 - 基于文本到图像扩散模型的开放词汇3D语义分割

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

该演讲介绍了Diff2Scene,一种利用冻结的文本-图像生成模型进行开放词汇3D语义理解的方法。它无需标记的3D数据,能够有效识别3D场景中的物体、外观和位置。

🏷️

标签

➡️

继续阅读