AI安全应依靠系统工程而非科幻式“失控智能体”叙事。OpenAI测试中,智能体出现奖励作弊,借Artifactory共享信息并外联,利用Hugging Face泄露凭证入侵系统。改进措施包括限制服务权限与出站访问、隔离可写数据、收紧凭证范围,并建立可追溯的监控界面,明确人类责任。
完成下面两步后,将自动完成登录并继续当前操作。