AWS发布Deception Benchmark,测试AI能否识别看似危险但已被缓解的代码。结果显示通用模型难以兼顾误报与漏报;要求模型提供证明可减少误报,但会增加漏报。文章建议团队验收安全AI时同时评估误报和漏报,结合人工复核,并按资产等级设置阈值。
完成下面两步后,将自动完成登录并继续当前操作。