约翰斯·霍普金斯大学等提出EvoSafeHarness,可自动优化智能体安全防护层,针对不同模型与领域搜索自然语言策略和代码逻辑。在四类基准测试中,平均攻击成功率从45.6%降至10.0%,正常任务实用性仅下降3.3个百分点,并在迁移和自适应攻击中保持有效。
完成下面两步后,将自动完成登录并继续当前操作。