内容提要
南加州大学预印本审计七个开源模型作为Agent安全闸门的表现:在提示注入、越狱和有毒内容筛查上准确率仅36%至72%,部分低于随机水平。攻击面不在被审内容,仅修改选项名即可将fail-open率抬至93%至100%。现有防御均被破解,唯一稳固路径是用确定性规则解析策略字段,可达100%准确率。该论文未经同行评审,结论待复现。
延伸解读
准确率数字需分场景解读
论文报告的36%至72%准确率覆盖提示注入、越狱和有毒内容三类任务,不能视为单一场景下的性能。总准确率可能掩盖模型默认倾向:一个几乎全放行的闸门准确率可能不低,但fail-open风险极高。读者应关注两类错误的分开报告,而非仅看总体数字。
攻击面在选项标签而非内容
选项通道攻击表明,仅修改选项名称即可将fail-open率从0%抬升至93%至100%,且不触碰被审文本或选项定义。这提示防御不能只关注输入内容,还需审查决策接口的设计,尤其是选项标签是否被模型当作策略信号。
现有防御为何失效
论文测试的防御均被破解,包括置信度阈值升级人工复核——被翻转的决策置信度并不比翻转前更低。这意味着基于模型自身置信度的防御不可靠,攻击者可以针对防御机制下手,或利用受控文本直接奏效。
确定性规则的优势与局限
将策略字段解析为类型化值并运行确定性规则,在六条策略上达到100%准确率,同时消除选项名攻击。但该防御仅适用于字段可类型化解析的策略;对于依赖语义理解的策略是否有效,论文未提供证据。此外,预印本未经同行评审,结论待复现。
Q&A
什么是类型化决策模型?它在Agent安全中扮演什么角色?
类型化决策模型是一种读入文本后,在调用方自定义的选项上返回概率的小模型,每个选项附有书面定义,自身不生成文本。近期工程实践将其用作Agent安全闸门,读取工具调用或消息,决定放行还是拦截。
这些模型作为安全闸门的准确率如何?
在提示注入、越狱、有毒内容三类筛查任务上,七个开源模型的放行-拦截决策准确率只有36%到72%,而随机水平是50%,有模型低于抛硬币。
选项通道攻击是什么?它是如何实现的?
选项通道攻击是指攻击者不修改被审内容,仅通过修改选项名称(如给宽松选项起误导性名字)来影响模型决策。在四个将标签放入输入的模型上,fail-open率被抬升至93%到100%。
论文测试了哪些防御措施?它们有效吗?
论文测试的防御全部被破解,包括置信度阈值升级人工复核也无效,因为被翻转的决策置信度并不比翻转前更低。
有没有可靠的防御方法?
唯一稳固的路径是将每个策略字段解析成类型化的值,再对这些值跑确定性规则,在全部六条策略上达到100%准确率,同时消除选项名攻击。但这也表明模型在该通道上不必要。
这篇论文有哪些局限性?
论文是预印本,未经同行评审,数字待独立复现;攻击测试基于作者自建的合成套件,非真实流量,可迁移性未验证;93%到100%仅适用于四个模型,不能外推;确定性规则的100%限于字段可类型化解析的六条策略。