模型吸附攻击:针对 LLMs 的提取攻击

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

该文介绍了一种新型的提取攻击——Model Leeching,可以从大型语言模型中提取特定任务知识到一个减少参数的模型。作者通过从ChatGPT-3.5-Turbo中提取任务能力来证明攻击的有效性,精确匹配相似度达到73%。

🏷️

标签

➡️

继续阅读