文本分类器的对抗攻击的约束执行奖励
内容提要
本文提出了一种基于强化学习的对抗性样本生成方法,成功欺骗IMDB情感分类和AG新闻分类模型,同时保持文本语义。研究还探讨了多语言分类器的对抗性攻击,提出了ParaphraseSampler样本采样技术,显示出更高的攻击成功率。此外,分析了神经机器翻译系统的缺陷,并提出了改进对抗样本质量的R&R框架,显著提高了攻击成功率。
延伸解读
对抗攻击的语义保持挑战
文章强调,成功的对抗样本不仅要欺骗分类器,还需保持原始文本的语义。基于强化学习的方法在IMDB和AG新闻任务上实现了这一点,但人类生成的对抗样本在自然性和语法上并不优于最佳算法,说明自动方法在语义保持方面已具竞争力,但自然性仍是挑战。
多语言与句子级攻击的进展
针对多语言分类器,通过微调多语言释义模型,攻击算法在查询效率上优于基准。ParaphraseSampler采用句子级改写,在6个数据集上误分类率更高,表明句子级威胁模型能提升攻击成功率,为多语言场景提供了新思路。
从攻击到防御:提升鲁棒性
文章不仅关注攻击,还提出防御方法。正则化Transformer编码器微调通过对比学习获得噪声不变表示,两种对抗训练方法在表示空间缩小对抗距离或重构原始样本,实验证明能有效提高模型抗打击能力,且不显著影响语义表示。
R&R框架与翻译系统缺陷
R&R框架通过优化批判分数结合流畅度、相似性和错分类度量,在5个数据集和3种架构上使攻击成功率提升12.8%至16.2%。对神经机器翻译系统的攻击实验表明,基于强化学习的方法能生成稳定且保留含义的对抗样本,暴露了RNN-search和Transformer架构的缺陷。
Q&A
什么是基于强化学习的对抗性样本生成方法?
基于强化学习的对抗性样本生成方法能够在黑盒设置中成功欺骗文本分类模型,同时保持原始文本的语义。
ParaphraseSampler样本采样技术的作用是什么?
ParaphraseSampler通过句子级别的改写,能够提高对抗攻击的成功率,实验证明其效果优于基线方法。
如何提高对抗样本的质量?
通过rewrite and rollback(R&R)框架优化批判分数,可以提高对抗样本的质量,显著增加攻击成功率。
研究中提到的对抗性攻击算法有什么特点?
该算法通过对多语言释义模型进行微调,能够有效生成对抗性样本,并在查询效率上优于现有基准模型。
人类生成的对抗样本与算法生成的样本相比如何?
人类生成的对抗样本在自然性、情感及语法方面的表现不高于最佳算法,但生成效率更高。
新提出的对抗训练方法有哪些?
新方法包括缩小原始样本与对抗样本的距离,同时扩大与不同标记样本的距离,以及在对抗性表示下重构原始样本。