迫使语言模型(LLMs)做和透露(几乎)任何事惠

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本文揭示了攻击者使用视觉对抗样本来影响与大型语言模型连接的用户资源的机密性和完整性。研究发现,这些攻击可以以接近真实语法的方式操控语言模型调用工具,同时保持与原始图像的高相似度。这些攻击对用户与语言模型之间的对话没有显著影响。

🏷️

标签

➡️

继续阅读