大型语言模型上的用户推理攻击

💡 原文中文,约500字,阅读约需2分钟。
📝

内容提要

本研究探讨了预训练语言模型(LLM)侵犯个人隐私的问题,并构建了真实Reddit个人资料数据集。研究发现,LLM能够推断出地点、收入和性别等个人属性,匿名化和模型对齐等措施无效。研究呼吁对LLM隐私影响展开更广泛的讨论,力求实现更广泛的隐私保护。

🏷️

标签

➡️

继续阅读