研究表明,会员推断攻击对大型语言模型(LLMs)构成严重隐私风险。攻击者可以通过模型输出判断特定数据是否用于训练。细调模型因其强记忆能力更易受到攻击。为此,提出了一种新方法EZ MIA,通过分析模型错误预测位置的概率变化来评估记忆泄露风险。研究发现,使用LoRA细调可显著降低隐私泄露风险。
该研究探讨了机器学习中的会员推断攻击,提出了抽样攻击技术及防御方法,发现输出微扰技术能有效保护隐私。同时分析了数据代表性、模型偏见及公平性,提出了新型样本采样算法“SMOTE-RUS-NC”,以提高分类性能,并提出降低标注成本的方法,提升准确性。
本文研究了机器学习模型上的会员推断攻击的有效性和成功的统计量,并提供了对统计量的上下界。攻击的准确性与样本数量和学习模型的其他参数有关,可以根据数据集进行估计。
本文揭示了机器学习模型上的会员推断攻击可以暴露个人敏感信息,推导了攻击的有效性与成功的统计量,并提供了对统计量的上下界。
完成下面两步后,将自动完成登录并继续当前操作。