Can Adversarial Attacks on Large Language Models Be Attributed?

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本文探讨了在对抗环境中,大语言模型(LLMs)输出归因的挑战。研究表明,由于语言类别的不可识别性和模型输出的重叠,无法从有限的文本样本中准确归因于特定LLM,强调了降低风险的必要性。

🏷️

标签

➡️

继续阅读