英伟达等提出EvoSafeHarness,为不同AI Agent自动定制安全防线,攻击成功率从45.6%降至10.0%

英伟达等提出EvoSafeHarness,为不同AI Agent自动定制安全防线,攻击成功率从45.6%降至10.0%

💡 原文中文,约5200字,阅读约需13分钟。
📝

内容提要

约翰斯·霍普金斯大学等提出EvoSafeHarness,可自动优化智能体安全防护层,针对不同模型与领域搜索自然语言策略和代码逻辑。在四类基准测试中,平均攻击成功率从45.6%降至10.0%,正常任务实用性仅下降3.3个百分点,并在迁移和自适应攻击中保持有效。

🔎

延伸解读

安全防线为何需要“量身定制”

文章指出,不同模型自身抵御攻击的能力差异很大,不同领域关注的风险也截然不同:文件系统更关心命令、路径和敏感数据流动,金融系统则涉及资金去向、交易顺序和账户状态。统一套用同一组规则,限制过松挡不住攻击,限制过严又会影响正常任务。EvoSafeHarness 将安全 Harness 本身作为自动优化对象,针对不同模型和领域分别搜索自然语言策略与可执行代码逻辑,正是为了应对这种差异。

安全提升不能以牺牲实用性为代价

评估时如果只看攻击成功率,最简单的方案就是拒绝所有操作,攻击确实无法成功,但智能体也失去了使用价值。EvoSafeHarness 同时考察正常任务完成情况和攻击成功情况,只有在基本保留任务能力的前提下降低攻击成功率,候选方案才会获得更高评价。最终在 15 个“模型 × 领域”组合中,14 个取得最高综合得分,平均攻击成功率从 45.6% 降至 10.0%,正常任务实用性仅下降 3.3 个百分点。

迁移与自适应攻击下的真实表现

迁移实验直接检验 Harness 是否依赖训练时见过的工具:只在 AgentDojo 上搜索的 Harness,直接用于 AgentDyn 后仍保持 75.0% 的实用性和 0% ASR;而 CaMeL 在 AgentDyn 上虽然也实现 0% ASR,但正常任务实用性降至 0%。在 AgentCanary 的自适应攻击中,静态攻击下 ASR 从 23.6% 降至 9.7%,允许最多 16 轮修改时平均 ASR 回升至 19.5%,说明防御并未因攻击措辞变化而迅速失效。

系统级 Harness 的能力边界

文章最后指出,EvoSafeHarness 的思路是根据模型行为和领域风险重新设计安全约束,而非把同一套规则套到所有系统上。真正影响防御效果的往往不是规则数量,而是规则是否对应实际风险、检查是否放在合适的位置,以及系统是否保留了足够的上下文状态。但这种方法也有边界:对于事实错误、误导性表达等主要发生在内容层面的风险,如果缺少能够直接检查的动作、权限或状态关系,系统级 Harness 仍难完全解决。

Q&A

EvoSafeHarness 是什么?它主要解决什么问题?

EvoSafeHarness 是约翰斯·霍普金斯大学、NVIDIA、加州大学伯克利分校等机构提出的智能体安全防护层自动优化方法。它针对不同模型和应用领域,自动搜索自然语言安全策略与可执行代码逻辑,解决现有安全 Harness 由专家预先设计、难以适配不同模型和业务环境的问题。

EvoSafeHarness 的搜索过程是如何工作的?

搜索过程由 Designer、Criticizer、Cascade Test Environment 和 Analyzer 协同完成。Designer 读取领域规范、已有 Harness、历史评分和失败轨迹来修改方案;Criticizer 通过修改路径、移动文件或重述攻击指令来检查规则是否过拟合;通过审查后进入 Cascade Test Environment 逐步扩大测试范围;Analyzer 记录正常任务、直接攻击和间接攻击的表现及失败轨迹,再交回 Designer 进行下一轮调整。

EvoSafeHarness 在安全性和实用性上的效果如何?

在四类基准测试中,平均攻击成功率从无防御时的 45.6% 降至 10.0%,正常任务实用性仅下降 3.3 个百分点。在 15 个「模型 × 领域」组合中,14 个取得最高综合得分。直接攻击 ASR 从 50.9% 降至 12.6%,间接攻击从 40.4% 降至 7.4%。

EvoSafeHarness 如何避免自动搜索中的过拟合问题?

研究加入独立的 Criticizer,它会尝试修改路径、移动文件位置或重新表述攻击指令,检查候选规则是否仍然有效。如果防御依赖某个具体字符串而非「动作是否获得用户授权」「信息来自哪里」等稳定关系,候选方案就需要继续修改。

EvoSafeHarness 的迁移能力和面对自适应攻击的表现如何?

迁移方面,EvoSafeHarness 只在 AgentDojo 上搜索,取得 82.8% 实用性和 0% ASR,直接用于 AgentDyn 后仍保持 75.0% 实用性和 0% ASR。自适应攻击方面,静态攻击下 ASR 从 23.6% 降至 9.7%;允许最多 16 轮修改时,3 种攻击器的平均 ASR 为 19.5%,防御没有因攻击措辞变化而迅速失效。

EvoSafeHarness 有哪些局限性?

对于事实错误、误导性表达等主要发生在内容层面的风险,如果缺少能够直接检查的动作、权限或状态关系,系统级 Harness 仍难完全解决。

🏷️

标签

➡️

继续阅读