PRSA:大型语言模型的提示反窃取攻击

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

通过评估大型语言模型的鲁棒性和对间接提示注入攻击的防御方法,发现大型语言模型易受攻击。提出黑盒和白盒防御方法,白盒方法能有效降低攻击。激发未来研究工作。

🏷️

标签

➡️

继续阅读