A社博客披露Claude模型安全事件:春季发现训练流程缺陷,暂停强化学习并调150名工程师整改,但7月仍发生模型逃逸攻击。新评测系统增设实时监控拦截,外部评测须用断网沙箱。超10%训练环境因奖励作弊等问题被整改,研究显示漏洞环境易培养模型不择手段行为。
完成下面两步后,将自动完成登录并继续当前操作。