内容提要
红帽AI安全团队用统一基准测试了九种护栏配置。提示注入任务中,小型DeBERTa分类器以89.01%准确率几乎追平大型LLM评审模型,延迟仅54毫秒,远快于后者。内容安全任务则相反,决策模型Jev以86.20%领先,专用分类器落后约六分。开源替代方案表现接近Jev,且策略措辞会显著改变结果。红帽结论:定义明确的风险仍适合小型分类器,宽泛策略才值得用零样本模型或LLM评审。
延伸解读
延迟优势与网络影响
红帽测试显示,DeBERTa分类器在提示注入任务上延迟仅54.1毫秒,远低于Qwen的312.5毫秒和Jev的348.1毫秒。由于测试从英国发起,托管模型每次请求至少增加56毫秒跨大西洋网络延迟。即使扣除该影响,Qwen中位延迟仍约256毫秒,是DeBERTa的数倍。DeBERTa在笔记本CPU上运行,而大模型使用专用GPU,因此分类器的速度优势在考虑网络后依然成立。
策略措辞对结果的影响
红帽发现策略措辞会显著改变模型表现。用自定义风险定义替换NVIDIA默认定义后,Nemotron提示注入准确率从69.37%跃升至84.84%。Laya在内容安全任务上,经策略调优后从57.87%升至75.20%,但同一调优策略使Jev的准确率从86.20%降至82.53%。这表明单一排行榜位置难以直接采信,策略与模型的匹配度至关重要。
开源替代方案削弱Jev优势
开源模型表现接近甚至超越Jev。DiffusionGemma在内容安全上仅落后Jev 0.67个百分点,在提示注入上以87.72%对86.35%胜出。Laya在笔记本CPU上运行,提示注入达85.44%。Nemotron在内容安全上落后Jev 1.13个百分点但响应更快。这些开源选项降低了选择Jev的必要性,尤其当团队可自行调优策略时。
适用场景与局限
红帽结论指出,定义明确且标注数据充足的风险适合小型分类器;宽泛策略则值得用零样本决策模型或LLM评审。但测试仅限英文数据集,多语言场景下准确率可能不同。此外,决策模型并未一致超越分类器或LLM评审,其优势高度依赖策略设计。团队需权衡延迟、成本与策略适配,而非默认采用某类方案。
Q&A
红帽AI安全团队测试了哪些护栏配置?
红帽AI安全团队测试了九种护栏配置,涵盖三种方法:专用分类器(如DeBERTa、Granite Guardian)、LLM评审模型(如Qwen3.6-35B)和决策模型(如Jev、DiffusionGemma、Laya)。
在提示注入任务中,小型分类器和大型LLM评审模型的准确率和延迟对比如何?
在提示注入任务中,小型DeBERTa分类器准确率达89.01%,几乎追平大型LLM评审模型Qwen3.6-35B的89.31%;但延迟仅54.1毫秒,远快于Qwen的312.5毫秒和Jev的348.1毫秒。
内容安全任务中哪种方法表现最好?
在内容安全任务中,决策模型Jev以86.20%的准确率领先,开源模型DiffusionGemma以85.53%紧随其后,LLM评审模型Qwen为85.47%,而专用分类器Granite Guardian仅80.27%,落后约六分。
策略措辞对护栏模型的表现有多大影响?
策略措辞会显著改变结果。例如,将NVIDIA默认风险定义替换为红帽自己的定义后,Nemotron的提示注入准确率从69.37%跃升至84.84%;Laya在内容安全上从57.87%提升至75.20%,但同一调整后的策略使Jev的准确率从86.20%降至82.53%。
红帽对护栏选择的最终建议是什么?
红帽建议:对于定义明确、有充足标注数据的风险,小型专用分类器仍是更好的默认选择;对于更宽泛的策略且缺乏强分类器时,零样本决策模型或LLM评审模型才值得其额外开销。
延迟测试中网络因素如何影响结果?
由于基准测试从英国运行,所有托管模型都承受了跨大西洋网络跳转,红帽估计每次请求至少增加56毫秒。即使扣除该估计,Qwen的中位延迟仍约256毫秒,是DeBERTa(54.1毫秒)的数倍,而DeBERTa在笔记本CPU上运行,速度优势依然明显。