通过伪标记成员的微调增强训练数据曝光
内容提要
该文综述大语言模型微调的隐私风险:成员推断攻击可判断用户数据是否用于微调,无过拟合模型亦难幸免;微调会泄露训练及预训练阶段的个人身份信息。不同调参方式风险各异,微调头部风险最高,适配器较低。研究还提出隐私保护语言模型、对抗训练等防御方法。
延伸解读
微调方式与隐私风险差异
文章指出,不同微调方法带来的记忆化风险并不相同。全模型微调、模型头微调和适配器微调中,微调头部的风险最高,而微调较小的适配器则较不容易受到已知提取攻击的影响。这意味着在实际部署中,若需平衡性能与隐私,可优先考虑适配器等参数高效微调方式,但需注意其防护效果并非绝对。
无过拟合模型亦难幸免
传统观点认为成员推断攻击主要针对过拟合模型,但文章提到,即使模型没有过拟合,也可能泄露训练数据是否被使用。基于自校准概率变异的成员推断攻击(SPV-MIA)表明,严格微调且无过拟合的模型仍存在隐私风险。这提醒我们,不能仅靠避免过拟合来防御成员推断攻击。
预训练数据泄露的连锁效应
文章强调,微调模型不仅会泄露微调阶段使用的数据,还可能泄露预训练阶段记忆的个人身份信息。通过微调模型进行预训练数据的遗忘和泄露,会使新的数据点变得容易被提取。这对使用大语言模型提供服务的公司构成重大的隐私和法律问题,需要跨学科讨论并制定相应政策。
防御思路与局限
文章提及了隐私保护语言模型(PPLM)和对抗训练等防御方法。PPLM通过注入领域知识保护数据隐私,而对抗训练则优化适配器并使用混合数据训练,以提高泛化性并避免性能下降。然而,这些方法各有局限,例如限制单个用户的微调样本数量虽可减少攻击效果,但也会降低微调数据总量,影响模型效用。
Q&A
什么是成员推断攻击?它如何威胁大语言模型的隐私?
成员推断攻击是一种隐私攻击方法,攻击者通过少量用户样本和黑盒访问微调后的LLM,推断用户数据是否被用于微调。即使模型没有过拟合,这种攻击也能泄露隐私。
大语言模型微调会泄露哪些类型的隐私信息?
微调会泄露训练数据中的个人可识别信息(PII),如电子邮件和电话号码。此外,精调模型不仅会泄露其训练数据,还会泄露在预训练阶段记忆的预训练数据(和PII)。
不同的微调方法(如全模型微调、模型头微调、适配器微调)在隐私风险上有何差异?
微调头部的风险最高,而微调较小的适配器则较不容易受到已知提取攻击的影响。
有哪些防御方法可以保护大语言模型微调中的隐私?
防御方法包括隐私保护语言模型(PPLM)、对抗训练等。PPLM通过注入特定领域知识来保护数据隐私,涉及语料库整理、基于惩罚性失真的训练损失和基于指令的微调等技术。对抗训练机制通过优化fine-tuned adapters并使用混合数据训练神经网络,提高泛化性和预测性能。
什么是隐私保护语言模型(PPLM)?它如何工作?
隐私保护语言模型(PPLM)通过有效注入特定领域知识来保护数据隐私。其技术包括语料库整理、基于惩罚性失真的训练损失和基于指令的微调。正负样本指令微调是一种有潜力的方法,可以在增强模型知识的同时保护私人数据。
微调后的模型是否会泄露预训练阶段的数据?
是的,研究表明精调模型不仅会泄露其训练数据,还会泄露在预训练阶段记忆的预训练数据(和PII)。通过精调模型来进行预训练数据的遗忘和泄露使新的数据点变得容易被提取。