本研究提出了一种新的协调提示-RAG攻击(PR-攻击),旨在提高检索增强生成(RAG)在大型语言模型中的安全性。通过双层优化框架,PR-攻击能够引入少量被污染文本和后门触发器,生成预设响应,同时保持正常行为。实验结果表明,PR-攻击在有效性和隐蔽性上优于现有攻击方法。
本研究探讨了黑盒后门攻击的实施可能性,攻击者可以在不知模型结构的情况下,通过设计后门触发器进行攻击。实验结果表明,该方法在黑盒场景中的成功率高,并能有效规避现有防御措施。此外,研究提出了一种基于知识蒸馏的去偏差框架,能够有效降低模型的偏差和安全风险,强调了对抗性防御机制的重要性。
本文提出了一种可变大小的后门触发器,克服了视点与对象距离的干扰,并介绍了恶意对抗训练方法以提高后门攻击成功率。研究表明,实体后门攻击对依赖关键特征的系统影响显著,且能够规避现有防御。文章还探讨了物理攻击的特性及防御策略,揭示了自动驾驶车辆面临的后门威胁,旨在提升安全性。
完成下面两步后,将自动完成登录并继续当前操作。