内容提要
本文介绍2019年Song与Ermon提出的基于分数的生成建模框架。该方法不直接学习数据分布,而是学习其分数(对数密度梯度),通过分数匹配训练噪声条件分数网络(NCSN),并用退火朗之万动力学从噪声中采样。多级高斯噪声扰动解决了流形假设和低密度区域问题,在CIFAR-10上取得先进结果,为现代扩散模型奠定基础。
延伸解读
核心思想:从学习分布到学习梯度
本文提出了一种生成建模的新视角:不直接学习数据分布,而是学习其分数函数(对数密度的梯度)。这一转变使得模型只需关注局部方向,而非全局概率,从而避免了计算归一化常数的难题。通过分数匹配训练神经网络,再结合朗之万动力学采样,实现了稳定且灵活的生成过程。这一思想为后续扩散模型的发展奠定了重要基础。
多级噪声扰动的关键作用
针对流形假设和低密度区域问题,本文引入多级高斯噪声扰动。噪声不仅使数据分布充满整个空间,满足分数匹配的数学条件,还填充了低密度区域,为网络提供有效学习信号。通过噪声条件分数网络(NCSN)学习不同噪声水平下的分数,并采用退火朗之万动力学逐步去噪,实现了从粗到细的生成过程。这一策略显著提升了采样稳定性和样本质量。
实验验证与性能对比
在MNIST、CelebA和CIFAR-10上的实验表明,该方法生成的样本质量可与当时的GAN和基于似然的模型相媲美,在CIFAR-10上取得了当时最先进的Inception Score(8.87)和具有竞争力的FID(25.32)。消融实验证实了多噪声训练和退火采样策略的必要性。此外,模型还展示了图像修复能力,表明其学习到的分数场蕴含丰富的结构信息。
Q&A
什么是基于分数的生成建模?
基于分数的生成建模是一种生成模型范式,它不直接学习数据分布,而是学习数据分布的对数密度梯度(即分数)。通过分数匹配训练神经网络来估计分数,然后使用朗之万动力学从噪声中采样生成新样本。
为什么直接学习分数在真实数据上会失败?
直接学习分数在真实数据上失败有两个主要原因:一是流形假设,真实图像位于高维空间中的低维流形上,导致流形外的分数无定义;二是低密度区域,这些区域训练数据稀少,分数估计不准确,且朗之万动力学在这些区域混合缓慢。
噪声条件分数网络(NCSN)是如何解决分数估计问题的?
NCSN通过向数据添加多个级别的高斯噪声,使数据分布充满整个空间,从而解决流形假设问题。同时,多级噪声使得低密度区域也有训练样本,改善了分数估计。NCSN是一个条件网络,根据噪声级别学习对应的分数函数。
退火朗之万动力学在采样中起什么作用?
退火朗之万动力学通过从高噪声级别开始,逐步降低噪声,在每个级别使用对应的分数进行朗之万采样。这解决了低密度区域混合慢的问题,使得采样过程更稳定,能够正确恢复不同模式的比例。
论文中使用了哪些分数匹配方法?它们有何区别?
论文讨论了三种分数匹配方法:原始分数匹配、去噪分数匹配(DSM)和切片分数匹配(SSM)。原始分数匹配需要计算雅可比矩阵的迹,计算成本高;DSM通过添加噪声简化了目标,计算高效;SSM使用随机投影近似迹,但计算量约为DSM的四倍。论文最终选择DSM作为主要训练方法。
论文在CIFAR-10上取得了什么量化结果?
论文在CIFAR-10上取得了当时最先进的Inception Score 8.87,以及FID 25.32,表明基于分数的生成模型无需对抗训练即可与GAN和似然模型竞争。
NCSN除了图像生成还能做什么?
NCSN还可以用于图像修复(inpainting)。通过修改退火朗之万动力学,在采样过程中保持已知像素不变,可以重建任意形状的缺失区域,且无需像自回归模型那样固定生成顺序。