通过深度低秩残差蒸馏锁定预训练权重

通过深度低秩残差蒸馏锁定预训练权重

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

本文提出DLR-Lock方法,通过将预训练MLP替换为深度低秩残差网络,利用自动微分的推理-训练不对称性,增加微调时的激活内存和计算开销,并造成架构不匹配,从而有效防御自适应攻击者修改权重,同时保持模型原有性能。实验验证了该方法的有效性。

🔎

延伸解读

防御思路:利用自动微分的推理-训练不对称性

DLR-Lock的核心创新在于利用自动微分在推理和训练阶段的不对称性。在推理时,模型前向传播的计算开销与普通网络相当,但在微调(训练)时,由于深度低秩残差网络的结构,反向传播需要存储更多的激活值,导致内存和计算开销显著增加。这种不对称性使得攻击者即使知道防御策略,也难以在有限资源下进行有效的微调,从而保护了预训练权重不被轻易修改。

架构不匹配带来的微调困难

除了增加计算开销,DLR-Lock还通过引入深度低秩残差网络造成架构上的不匹配。这种不匹配使得标准微调方法的优化景观变得复杂,攻击者难以通过常规的梯度下降方法找到有效的更新方向。实验表明,这种架构上的障碍比单纯的计算开销更能有效阻止自适应攻击者,因为攻击者需要重新设计优化策略才能绕过防御。

保持模型性能与防御效果的平衡

DLR-Lock在防御权重修改的同时,通过模块级蒸馏技术训练DLR-Net,确保替换后的模型保持原有性能。实验验证了该方法在LLM上的有效性,表明防御措施并未显著损害模型的能力。这为模型发布者提供了一种可行的方案,在开放权重的同时,限制未经授权的微调,兼顾了开放性与安全性。

Q&A

DLR-Lock方法的核心思想是什么?

DLR-Lock通过将预训练模型中的每个MLP替换为深度低秩残差网络(DLR-Net),利用自动微分在推理和训练之间的不对称性,增加微调时的激活内存和计算开销,并造成架构不匹配,从而防御自适应攻击者修改权重,同时保持模型原有性能。

DLR-Lock如何防御自适应攻击者?

DLR-Lock通过增加微调时的激活内存和计算开销,以及造成架构不匹配,使攻击者难以通过优化修改权重。攻击者即使知道防御策略,也会因这些障碍而难以成功。

DLR-Net是如何训练的?

DLR-Net通过模块级蒸馏(module-wise distillation)进行高效训练。

DLR-Lock对模型原有性能有何影响?

DLR-Lock在防御权重修改的同时,能够保持模型原有的能力,即不损害模型在原始任务上的性能。

DLR-Lock方法在什么场景下应用?

DLR-Lock适用于防止预训练权重被未经授权修改的场景,例如保护开源模型不被恶意微调或用于不当用途。

DLR-Lock方法的主要创新点是什么?

主要创新点在于利用自动微分的推理-训练不对称性作为防御轴,通过深度低秩残差网络增加微调成本,并造成架构不匹配,从而有效抵御自适应攻击者。

🏷️

标签

➡️

继续阅读