几何图像扩散:快速且数据高效的文本到3D变换与基于图像的表面表示

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

本文介绍了一种新方法,通过结合3D几何控制和视觉提示,利用扩展的扩散模型生成高质量的3D图像。该方法包括PI3D框架和3DTopia系统,能够快速生成一致且真实的3D模型,并在几分钟内优化纹理。实验结果表明,该方法在3D生成领域具有显著优势。

🔎

延伸解读

技术演进:从2D扩散到3D生成的融合

文章梳理了2023年至2024年文本到3D生成的技术发展脉络,从早期利用法线贴图微调2D扩散模型,到GeoDream结合3D几何先验与2D扩散先验,再到BiDiff双向扩散框架将生成时间从3.4小时缩短至20分钟。这一演进显示,融合2D扩散模型的丰富纹理与3D数据的几何真实性,是提升生成质量与效率的关键路径。

PI3D框架:高效生成与泛化能力

PI3D通过将预训练的2D扩散模型微调为3D扩散模型,继承了2D模型的泛化能力,并利用分数蒸馏抽样快速提升3D形状质量。其效率体现在几秒内采样多样3D模型,几分钟内改进。混合训练伪图像与真实图像的策略进一步增强了泛化性,为文本到3D生成提供了有前景的方向。

3DTopia系统:两阶段生成流程

3DTopia采用两阶段生成:第一阶段从3D扩散先验中快速采样粗糙3D样本,用于快速原型设计;第二阶段利用2D扩散先验优化纹理,包括潜在空间和像素空间优化。整个流程在5分钟内生成高质量通用3D资产。为训练系统,作者利用视觉语言模型和大型语言模型清洗并标注Objaverse数据集,提升了数据质量。

Direct3D:原生3D生成的新范式

Direct3D是一种直接的3D生成模型,无需多视图扩散或SDS优化,可扩展到野外输入图像。其核心包括D3D-VAE和D3D-DiT:D3D-VAE将高分辨率3D形状编码为紧凑的三平面潜在空间,并通过半连续表面采样直接监督几何;D3D-DiT建模潜在分布并融合位置信息。该模型在大规模3D数据集上预训练,在生成质量和泛化能力上优于以往图像到3D方法。

Q&A

什么是PI3D框架,它的主要功能是什么?

PI3D框架利用预训练的文本到图像扩散模型,在几分钟内生成高质量的3D形状,并通过微调提高生成能力。

3DTopia系统是如何生成高质量3D资产的?

3DTopia系统通过两阶段生成流程,使用混合扩散先验在5分钟内生成高质量的通用3D资产。

该方法在3D生成领域的优势是什么?

实验结果表明,该方法在快速生成一致且高质量的3D模型方面具有显著优势。

如何提高生成的3D模型的质量?

通过将预训练的2D扩散模型微调为3D扩散模型,并利用分数蒸馏抽样快速提高采样的3D形状的质量。

GeoDream方法的特点是什么?

GeoDream方法结合三维几何先验和二维扩散先验,能够生成具有一致的三维几何结构的文本到三维模型。

本文提出的图像编辑技术有什么创新之处?

该技术可以在单幅图像上进行三维操作,如物体旋转和平移,突破了单幅图像三维感知编辑的局限。

🏷️

标签

➡️

继续阅读