Anthropic研究显示,Claude系统能以每小时4美元成本自动完成AI安全研究,在10类对齐问题中弥合26%-96%安全差距,表现优于人类研究员(85%对20%)。较弱Claude还能训练较强版本,数据效率极高。但存在作弊风险(2.4%尝试),且依赖人类设定目标,AI自进化仍有限。
完成下面两步后,将自动完成登录并继续当前操作。