ResULIC:语义残差编码与压缩感知扩散的超低码率图像压缩 | ICML 2025

ResULIC:语义残差编码与压缩感知扩散的超低码率图像压缩 | ICML 2025

💡 原文中文,约4600字,阅读约需11分钟。
📝

内容提要

本文介绍ResULIC框架,用于超低码率图像压缩,结合潜在特征、语义残差和扩散模型。核心模块包括语义残差编码(SRC)减少文本冗余,和压缩感知扩散模型(CDM)自适应匹配码率。实验显示,相比PerCo,LPIPS和FID分别节省80.7%和66.3%的BD-rate,提升感知质量与重建一致性。

🔎

延伸解读

语义残差:减少文本冗余的关键

ResULIC的核心创新在于只传输原图与初步重建图之间的语义差异,而非完整文本描述。这种设计避免了压缩潜在特征已包含信息的重复编码,尤其在极低码率下,能显著节省比特开销。实验表明,语义残差检索(Srr)能根据码率动态调整文本与潜在特征的信息分配,低码率时文本补充更多,高码率时文本开销降低,从而提升整体率失真性能。

码率与扩散步数的自适应匹配

压缩感知扩散模型(CDM)观察到压缩退化程度与扩散加噪程度存在对应关系:码率越低,压缩特征越接近高噪声状态。因此,CDM根据码率选择不同的扩散起点,使生成过程与压缩强度对齐。这不仅提升了重建一致性,还显著减少了解码步数,实验中仅需3到4步即可完成重建,相比传统扩散采样大幅降低计算复杂度。

生成式压缩的忠实性挑战

生成式压缩方法常面临“好看但不够像”的问题,即生成结果自然但与原图存在语义或结构偏差。ResULIC通过语义残差编码和感知保真优化(Pfo)来缓解这一挑战:前者补充压缩丢失的关键语义,后者通过可微提示词优化提升文本条件与目标图像的一致性。实验显示,ResULIC在LPIPS和FID上相比PerCo分别节省80.7%和66.3%的BD-rate,表明其在感知质量与重建一致性上取得了更好平衡。

Q&A

ResULIC是什么?它主要解决什么问题?

ResULIC是一个面向超低码率图像压缩的残差引导框架,由ICML 2025提出。它结合潜在特征压缩、语义残差编码和扩散模型,旨在解决极低码率下传统方法过度平滑、生成模型重建不一致的问题,实现感知真实度与重建一致性的平衡。

ResULIC中的语义残差编码(SRC)是如何工作的?

SRC通过多模态大模型分别提取原图和压缩初步重建图的语义描述,再利用大语言模型比较差异,只编码原图中存在但重建图中缺失或错误的语义信息,从而避免传输完整文本描述带来的冗余比特开销。

压缩感知扩散模型(CDM)如何与码率自适应匹配?

CDM观察到压缩退化程度与扩散加噪程度对应:码率越低,压缩特征保留信息越少,更接近高噪声状态;码率越高,则从较低噪声时间步开始恢复。因此,CDM根据码率选择不同的扩散起点,使扩散过程与压缩强度对齐,从而提升重建一致性并减少采样步数。

ResULIC相比PerCo在性能上有哪些提升?

在CLIC-2020数据集上,ResULIC相比PerCo在LPIPS和FID指标上分别实现了80.7%和66.3%的BD-rate节省,意味着在更低码率下能达到相近甚至更优的视觉质量。

感知保真优化(Pfo)的作用是什么?

Pfo通过可微提示词优化,将文本token映射到CLIP嵌入空间,搜索更适合当前压缩框架的文本提示,以提升重建一致性。它结合扩散去噪损失和感知一致性约束,优化后的提示词以离散token形式保存,可被编码传输,进一步降低文本码率。

ResULIC在极低码率下如何平衡感知真实度和重建一致性?

ResULIC通过三个模块协同:压缩潜在特征保留基础结构,语义残差编码补充关键语义,压缩感知扩散模型从与码率匹配的状态开始生成。这样既利用生成模型补全细节,又通过语义残差和码率感知的扩散起点确保重建与原图一致,从而兼顾感知真实度和重建一致性。

🏷️

标签

➡️

继续阅读