小红花·文摘

本文介绍了Point-Bind和Point-LLM两个模型，Point-Bind是一个多模态模型，将三维点云与二维图像、语言、音频和视频对齐，实现了许多有前景的应用。Point-LLM是第一个遵循三维多模态指令的三维大型语言模型，通过将Point-Bind的语义注入到预训练的LLM中，实现了出色的三维和多模态问答能力。希望这些模型可以为扩展三维点云到多模态应用的社区提供帮助。

ImageBind-LLM：多模态指令调整

BriefGPT - AI 论文速递 ·

Point-Bind是一种多模态模型，可以将三维点云与二维图像、语言、音频和视频对齐。通过引入ImageBind，构建了三维和多模态之间的联合嵌入空间，实现了许多有前景的应用。此外，还提出了Point-LLM，是第一个遵循三维多模态指令的三维大型语言模型。通过参数高效的微调技术，将Point-Bind的语义注入到预训练的LLM中，具有出色的三维和多模态问答能力。希望这项工作可以为扩展三维点云到多模态应用的社区提供帮助。

点绑定与点 LLM：用于三维理解、生成和指令跟随的点云多模态对齐

BriefGPT - AI 论文速递 ·