TinySR:面向真实世界图像超分辨率的轻量级扩散模型

TinySR:面向真实世界图像超分辨率的轻量级扩散模型

💡 原文中文,约5800字,阅读约需14分钟。
📝

内容提要

TinySR是一种面向真实世界图像超分辨率的轻量级扩散模型,通过深度剪枝、动态块间激活和扩张-腐蚀策略,实现比教师模型快5.68倍、参数减少83%的加速。同时轻量化VAE,移除时间与提示模块并预缓存。实验显示其在保持画质的同时,推理速度和成本优势明显,适合移动端部署。

🔎

延伸解读

轻量化不只是减参数

TinySR 强调,移动端部署的瓶颈往往不在 FLOPs,而在算子友好度、访存效率和硬件映射。因此,除了压缩主干网络,它还通过通道剪枝、移除注意力模块、引入深度可分离卷积来轻量化 VAE,并预缓存调制参数。这些设计更贴近真实端侧优化逻辑,提醒我们评估模型时需考虑整条推理链路的运行效率。

剪枝策略的可学习化

传统剪枝常依赖人工经验,容易误删关键层。TinySR 引入可学习的概率 mask,让模型在训练中自行判断哪些结构单元在剪除后仍能恢复性能,并通过动态块间激活和扩张-腐蚀策略实现渐进式结构调整。这种方法旨在找到压缩与画质间的平衡,而非单纯追求剪枝比例。

专用化设计更利于落地

TinySR 移除了时间步和文本提示等条件模块,因为对于一步式真实世界超分任务,这些模块贡献有限却增加开销。消融实验显示,移除后质量指标变化很小,但参数量、MACs 和时延显著下降。这体现了专用模型比通用模型更容易在端侧部署,因为每一份预算都用在刀刃上。

Q&A

TinySR是什么?它主要解决什么问题?

TinySR是一种面向真实世界图像超分辨率的轻量级扩散模型,由浙江大学、vivo BlueImage Lab和之江实验室提出。它主要解决扩散模型在移动端部署时模型笨重、推理开销高、端侧落地难的问题,通过深度剪枝、动态块间激活、扩张-腐蚀策略、VAE轻量化、移除时间与提示模块以及预缓存等技术,在保持画质的同时实现显著加速和参数减少。

TinySR相比教师模型TSD-SR在性能上有哪些提升?

TinySR相比教师模型TSD-SR,实现了最高5.68倍的推理加速,参数量减少83%,MACs降低84%。在DIV2K-Val等基准上,LPIPS、DISTS、FID、NIQE、MUSIQ、CLIPIQA等指标表现有竞争力,在自然纹理、结构完整性和感知质量之间取得更均衡的效果。

TinySR的深度剪枝策略有什么特点?

TinySR的深度剪枝策略不是依赖人工经验,而是通过可学习的概率mask,让模型在训练中自动判断哪些层值得保留,哪些层可以删除。它更关注在压缩约束下如何保住效果,而不是单纯追求剪枝比例。同时,通过动态块间激活(Dynamic Inter-block Activation)和扩张-腐蚀策略(Expansion-Corrosion Strategy),使剪枝过程更灵活、更稳定。

TinySR是如何轻量化VAE的?

TinySR对VAE进行了三方面优化:一是对VAE做通道剪枝,将最大通道宽度压缩到适合部署的规模;二是移除高开销的attention模块;三是在编码器中引入轻量级的depthwise separable convolution(SepConv)。这些改动使轻量化VAE在重建质量接近教师模型的同时,实现了约10倍推理加速和约22倍MACs降低。

TinySR为什么移除时间与提示相关模块?

TinySR移除时间与提示相关模块是因为它面向一步式真实世界超分任务,这些条件模块对当前任务贡献有限,却引入额外参数和计算开销。消融实验显示,移除后质量指标只有很小幅度变化,但能显著减少参数量、MACs和时延,使模型更专用、更易落地。

TinySR的预缓存(pre-caching)技术是什么?有什么作用?

预缓存技术是指将训练后趋于稳定且不再依赖输入的modulation参数预先计算并缓存,推理时直接加载使用。这样可以避免重复计算和数据搬运,压缩真实运行时延,让纸面加速更接近用户感知加速。

TinySR在移动端部署方面有哪些优势?

TinySR在移动端部署的优势包括:模型更小、推理更快、计算成本更低,适合手机相册增强、拍后即时清晰化、视频帧超分等场景。它通过全链路轻量化设计,考虑了算子支持、缓存复用、量化适配、模块耦合度等实际部署因素,更适合作为端侧前置模型,改善交互体验。

🏷️

标签

➡️

继续阅读