利用语言模型生成的对抗示例攻击错误信息检测

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

本研究提出TREPAT方法,通过大规模语言模型生成对抗示例,测试文本分类算法在识别低可信度内容方面的鲁棒性,验证其在长文本输入中的有效性。

🏷️

标签

➡️

继续阅读