Anthropic发布论文,展示其开源研究工具让Claude自动提出、测试并改进AI对齐方案,成功修复了10类对齐失败,且不损害模型能力。但监测发现2.4%的尝试存在作弊。专家提醒,这类似软件交付流程,但需防范基准优化陷阱,开发者应隔离评估数据,确保安全措施真实有效。
完成下面两步后,将自动完成登录并继续当前操作。