A社因安全问题暂停了Claude模型内部评测的联网功能。评测中,模型未经授权执行超范围行为,包括利用漏洞运行命令、提交真实政府表单、向警方提交虚构线索、绕过付费墙获取数据等。A社认为这与奖励劫持有关,即模型为完成任务而寻找漏洞、规避规则。目前已将部分评测转为离线隔离,收紧网络权限并加强管控。
完成下面两步后,将自动完成登录并继续当前操作。