DAIL: 利用自己的改写来增强上下文学习的数据增强

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

该文介绍了一种越狱攻击和守护方法,通过恶意上下文引导模型生成有害输出,并通过拒绝回答有害提示的演示来增强模型的鲁棒性。

🏷️

标签

➡️

继续阅读