SALAD-Bench: 大型语言模型的分层与综合安全评估基准

💡 原文中文,约600字,阅读约需2分钟。
📝

内容提要

该研究介绍了JADE模糊平台,通过增强种子问题的语言复杂性破坏了三类LLM。JADE生成了三个安全基准,包含高风险的不安全问题。该研究认为当前的LLM无法识别恶意,因为人类语言的复杂性导致了无限的句法结构。

🏷️

标签

➡️

继续阅读