MSRA:视觉生成六大技术问题

💡 原文中文,约3600字,阅读约需9分钟。
📝

内容提要

微软亚洲研究院的研究员古纾旸认为,视觉信号拆分是视觉生成的核心问题。目前常见的拆分方式包括图像块拆分、深度拆分、噪声强度拆分和可学习拆分,但这些方式都无法保证等变性。文章还讨论了视觉信号拆分问题、大语言模型的成功原因、扩散模型是否是最大似然模型以及扩散模型的scaling law等问题。文章提出了一些解决方案,但仍然存在挑战。

🔎

延伸解读

等变性:视觉生成的核心挑战

文章指出,视觉信号拆分是视觉生成的核心问题,而现有拆分方式(图像块、深度、噪声强度、可学习)均无法保证等变性。等变性意味着不同子任务的学习目标一致,从而能共享模型参数。缺乏等变性导致任务冲突,若共享参数则难以拟合,若不共享则参数量爆炸。这一分析为理解视觉生成模型的根本困难提供了新视角。

扩散模型并非最大似然:训练与评估的偏差

尽管DDPM从最大似然角度推导,但实际训练中损失函数权重不满足单调关系,且测试时采用Classifier-free guidance,使得优化目标偏离最大似然。直接用NLL评估生成质量并不准确。作者从等变性角度解释:不同噪声强度的去噪任务难度不同,中等噪声水平学习困难,而引导可视为对学习不佳的似然函数的矫正。

平衡噪声步冲突:调整采样频率更有效

扩散模型中不同噪声步的任务存在冲突。理论上,调整损失函数权重ω(λ)或采样频率P(λ)是等价的,但实际训练中,改变ω(λ)相当于改变学习率,而改变P(λ)则给重要任务分配更多计算量(Flops),往往更有效。近期工作“Improved Noise Schedule for Diffusion Training”经验性地给出了解决方案。

扩散模型的Scaling Law:评估指标的选择是关键

扩散模型是否存在scaling law取决于评估指标。文章分析了三种做法:用任务难度系数加权损失,但可能与人类偏好不一致;用FID等指标,但存在偏差且与人类偏好有差异;直接人工标注,能对齐人类偏好但需大量人力。选择何种指标将直接影响对scaling law的结论。

❓

Q&A

视觉信号拆分的核心问题是什么?

视觉信号拆分是视觉生成的核心问题,涉及将复杂信号拆分为多个简单分布拟合问题。

常见的视觉信号拆分方式有哪些?

常见的视觉信号拆分方式包括图像块拆分、深度拆分、噪声强度拆分和可学习拆分。

为什么大语言模型能取得成功?

大语言模型的成功源于文本信号拆分的等变性,使得模型可以同时解决多个相关性高的任务。

扩散模型是否是最大似然模型?

扩散模型并非最大似然模型,训练中损失函数权重不满足单调关系。

如何平衡扩散模型中不同噪声步间的冲突?

可以通过调整损失函数或采样频率来平衡扩散模型中不同噪声步间的冲突。

扩散模型是否存在scaling law?

扩散模型是否存在scaling law取决于评估模型质量的指标选择。

🏷️

标签

➡️

继续阅读