南加州大学预印本审计七个开源模型作为Agent安全闸门的表现:在提示注入、越狱和有毒内容筛查上准确率仅36%至72%,部分低于随机水平。攻击面不在被审内容,仅修改选项名即可将fail-open率抬至93%至100%。现有防御均被破解,唯一稳固路径是用确定性规则解析策略字段,可达100%准确率。该论文未经同行评审,结论待复现。
完成下面两步后,将自动完成登录并继续当前操作。