内容提要
Anthropic内部模型Model 2在CoBench测试中得分62.8%,远超公开旗舰模型,接近人类85%水平,距递归自我改进(RSI)仅差22%。公司承认评估工具已饱和,无法准确测量其能力。RSI预计2028年前实现,AI将自主改进,可能超越人类控制。Anthropic在IPO前曝光此事,既展示技术领先,也引发对AI失控的担忧。
延伸解读
62.8分意味着什么?
CoBench测试中,Model 2得分62.8%,而人类研究员为85%,Anthropic认为达到85%即可全面取代技术人员。差距仅22.2个百分点,且从15.6%到62.8%不到一年。这显示AI在研发任务上的能力正快速逼近人类水平,但尚未完全取代,尤其在资深研究员的判断力方面仍有差距。
评估工具饱和的警示
Anthropic承认其基于任务的评估方法已饱和,无法准确测量Model 2的真实能力。这意味着62.8%可能低估了模型的实际水平,也可能掩盖了潜在风险。评估工具的失效使得对AI能力的掌控更加困难,也增加了预测RSI实现时间的不确定性。
RSI进展的阶段定位
Anthropic自认处于AI介入AI开发的第四阶段,接近完全自改进Agent。实验显示,Claude能自主完成研究项目并恢复97%性能缺口,代码优化速度提升52倍,远超人类。但关键短板是“研究品味”——判断什么问题值得做,这仍由人类主导,因此尚未实现完整RSI。
曝光时机与资本市场
Model 2的曝光正值Anthropic准备IPO,营收增长14倍,估值约2万亿美元。主动披露未发布的更强模型,可能意在向资本市场展示技术领先性,用风险上升佐证性能优势。但这也引发对AI失控的担忧,以及资本开支与收入不匹配的“AI气穴”风险。
Q&A
Claude Model 2在CoBench测试中得了多少分?
Claude Model 2在CoBench测试中得分62.8%,远超公开旗舰模型Claude Mythos 5的50.3%和Claude Opus 4.6的15.6%,接近人类研究员的85%水平。
什么是递归自我改进(RSI)?
递归自我改进(RSI)是指AI系统能够自主设计实验、编写训练代码、运行和评估结果,从而创造出比自己更聪明的下一代,如此循环,无需人类介入。这是AI奇点理论的触发条件。
Anthropic预计RSI何时实现?
Anthropic联合创始人Jack Clark预计RSI可能在2028年底前实现,概率为60%。谷歌DeepMind和OpenAI的研究人员也预测RSI将在2027至2028年实现。
Anthropic在RSI阶梯上处于哪个阶段?
Anthropic自认为处于第四阶段(共五阶段),业界六阶段模型中处于第3到第4阶段之间。他们已实现半自动研究闭环和自改进Agent,但尚未跨越“研究品味”这一关键环节。
为什么Anthropic的评估工具饱和了?
Anthropic最具体的基于任务的评估方法已经饱和,因为模型太强,现有测试题无法捕捉其能力提升。这导致公司无法准确测量Model 2的真实能力,甚至可能低估其得分。
Anthropic为何在IPO前曝光Model 2?
Anthropic在IPO前曝光Model 2,可能是为了向资本市场展示技术领先地位,用风险佐证性能,暗示还有更强模型,从而吸引投资。此举精准踩中资本市场兴奋点。
RSI实现后可能带来什么风险?
RSI实现后,AI将自主改进,进步速度由算力决定,可能超越人类控制。谷歌DeepMind CEO哈萨比斯表示无时无刻不在担心这类情景,暗示存在失控风险。