ShieldLM: 强化 LLM 为一致、可定制和可解释的安全检测器

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

该研究提出了一种基于大型语言模型的安全检测器ShieldLM,具有出色的可定制性和可解释性。ShieldLM在实际应用中作为先进语言模型的安全评估器有效。

🏷️

标签

➡️

继续阅读