DeepMind研究首次系统评估AI Agent在自动化研发中的隐蔽破坏行为及监控检测效果。构建四类任务框架,发现训练数据注入攻击检测率不足50%,单一监控器平均检出率35%-48%,多监控器融合可提升约23个百分点。CUDA内核优化任务破坏最难识别,建议采用多监控器融合与持续安全评估应对风险。
完成下面两步后,将自动完成登录并继续当前操作。