SatSynth: 针对航空语义分割的扩充图像 - 掩膜对的扩散模型
内容提要
本文提出了一种基于去噪扩散生成模型的语义分割方法,利用条件DDPM生成高质量图像,并通过“attn2mask”实现无监督训练。实验结果表明,该方法在多个数据集上显著提高了分割性能,减少了对真实标注的依赖。
延伸解读
扩散模型作为掩模先验的价值
文章指出,简单地将扩散模型集成到语义分割中可能不够,甚至因扩散过程设计不佳导致性能下降。而将扩散模型建模的掩模先验用于提升现有判别方法,在ADE20K和Cityscapes上取得了较高的定量和定性性能。这表明扩散模型在分割任务中的有效应用需要精心设计,而非直接套用。
无监督分割的可行路径
通过attn2mask方法,利用文本-图像扩散模型的交叉注意力作为监督伪掩码,实现了不依赖真实图像或手动标注的语义分割训练。在PASCAL VOC上取得了满意结果,并展现出对更多类别场景(如ImageNet分割)的扩展性,以及基于LoRA微调迁移到Cityscapes等遥远领域的能力。这为减少标注依赖提供了新思路。
合成数据缓解标注与类别失衡
文章提及多个工作利用扩散模型生成合成图像及高质量注释,如RADiff生成射电源合成图像以解决类别失衡,DatasetDM仅需少于1%手动标记图像即可生成无限注释数据集。这些方法在语义分割和实例分割上达到最先进结果,表明合成数据能有效缓解数据收集和标注负担,并在有限标注下提升性能。
Q&A
SatSynth方法如何提高语义分割的质量?
SatSynth方法通过使用去噪扩散生成模型的掩模先验来提高语义分割质量,结合条件DDPM生成高质量图像。
attn2mask方法的主要优势是什么?
attn2mask方法实现了无监督训练,消除了对真实图像或手动标注的依赖,并在多个数据集上表现出良好的扩展性。
RADiff模型如何解决类别失衡问题?
RADiff模型通过生成不同形态的射电源合成图像来扩充数据集,从而有效解决类别失衡问题。
DatasetDM的功能是什么?
DatasetDM是一个通用的数据集生成模型,可以生成各种合成图像和高质量感知注释,训练仅需少于1%的手动标记图像。
该研究在ADE20K和Cityscapes数据集上的表现如何?
该研究的方法在ADE20K和Cityscapes数据集上达到了较高的定量和定性性能。
如何利用合成图像缓解数据标注的负担?
通过合成图像与真实数据集提供的语义掩码结合,可以生成丰富的训练图像,从而减轻数据收集和标注的负担。