PerlDiff: 使用透视布局扩散模型实现可控街景合成

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

Control3Diff 是一种结合扩散模型和 3D GAN 的 3D 扩散模型,能够快速生成高质量的 3D 图像。通过引入几何约束,生成的图像更加逼真,并在下游任务中表现优异。研究还探讨了利用生成对抗网络进行三维图像合成的方法,以提升计算机视觉任务中的图像生成能力。

🔎

延伸解读

几何约束如何提升生成质量

文章指出,在训练生成模型时引入几何约束以强制透视准确性,能使输出图像更逼真,并提升下游模型性能。主观实验显示,使用该约束的潜在扩散模型在70%的情况下优于Stable Diffusion V2。此外,在KITTI测试集上,用生成图像微调的单目深度估计模型DPT和PixelFormer,其零样本迁移的RMSE和SqRel指标甚至超过用真实图像训练的原始模型,最高分别提升7.03%和19.3%。这表明几何约束不仅改善视觉效果,还能增强生成数据的实用价值。

BEVControl:两阶段生成与评估

针对街景合成中前景和背景细节不准确的问题,BEVControl采用两阶段生成方法,在BEV分割布局指导下生成准确的前景和背景内容,并支持手绘风格输入,便于人工编辑。文章还提出了多级评估协议,公平比较生成场景、前景对象和背景几何的质量。实验表明,BEVControl在前景分割mIoU上从BEVGen的5.89提升到26.80,且用其生成图像训练下游感知模型,平均NDS分数提高1.29。这显示了生成数据对自动驾驶感知任务的潜在增益。

DetDiffusion:统一生成与感知

DetDiffusion首次将生成模型和感知模型统一,通过引入感知感知损失(P.A.损失)和感知感知属性(P.A.属性),在生成过程中利用分割信息改善图像质量和可控性,并进行自定义数据增强。在目标检测任务上,该方法在布局引导生成方面达到新的最先进水平,且生成的合成图像能有效增强训练数据,显著提升下游检测性能。这为解决感知模型依赖资源密集型数据集的问题提供了新思路。

❓

Q&A

Control3Diff 是什么?

Control3Diff 是一种结合扩散模型和 3D GAN 的 3D 扩散模型,能够快速生成高质量的 3D 图像。

引入几何约束对生成图像有什么影响?

引入几何约束后,生成的图像更加逼真,并提高了下游模型的性能。

DrivingDiffusion 框架的主要应用是什么?

DrivingDiffusion 框架用于在复杂城市场景中生成大规模、逼真的多相机自动驾驶视频。

DetDiffusion 是如何增强图像生成能力的?

DetDiffusion 统一了生成模型和感知模型,增强了图像生成能力,并显著提高了下游检测性能。

BEVControl 方法的创新之处是什么?

BEVControl 是一种两阶段生成方法,能够生成准确的前景和背景内容,显著提升前景分割性能。

研究中提到的无监督方法有什么优势?

无监督方法允许从原始图像中解开简单场景的隐含三维因素,生成与视角或物体姿势变化一致的场景。

🏷️

标签

➡️

继续阅读