BriefGPT - AI 论文速递 · 2024-12-18T00:00:00Z Mitigating Adversarial Attacks in Large Language Models through Defensive Suffix Generation 💡 原文英文,约100词,阅读约需1分钟。 📝 内容提要 本研究提出了一种基于梯度的防御后缀生成算法,提升大型语言模型在自然语言处理中的鲁棒性,实验结果表明攻击成功率降低了11%。 🏷️ 标签 models 后缀生成 攻击成功率 梯度 防御 鲁棒性 阅读原文 生成长图 分享链接 已复制链接