Claude Model 2泄露62.8分:距RSI递归自我改进仅差22%!

Claude Model 2泄露62.8分:距RSI递归自我改进仅差22%!

💡 原文中文,约4400字,阅读约需11分钟。
📝

内容提要

Anthropic内部模型Model 2在CoBench测试中得分62.8%,远超公开旗舰模型,接近人类85%水平,距递归自我改进(RSI)仅差22%。公司承认评估工具已饱和,无法准确测量其能力。RSI预计2028年前实现,AI将自主改进,可能超越人类控制。Anthropic在IPO前曝光此事,既展示技术领先,也引发对AI失控的担忧。

🔎

延伸解读

62.8分意味着什么?

CoBench测试中,Model 2得分62.8%,而人类研究员为85%,Anthropic认为达到85%即可全面取代技术人员。差距仅22.2个百分点,且从15.6%到62.8%不到一年。这显示AI在研发任务上的能力正快速逼近人类水平,但尚未完全取代,尤其在资深研究员的判断力方面仍有差距。

评估工具饱和的警示

Anthropic承认其基于任务的评估方法已饱和,无法准确测量Model 2的真实能力。这意味着62.8%可能低估了模型的实际水平,也可能掩盖了潜在风险。评估工具的失效使得对AI能力的掌控更加困难,也增加了预测RSI实现时间的不确定性。

RSI进展的阶段定位

Anthropic自认处于AI介入AI开发的第四阶段,接近完全自改进Agent。实验显示,Claude能自主完成研究项目并恢复97%性能缺口,代码优化速度提升52倍,远超人类。但关键短板是“研究品味”——判断什么问题值得做,这仍由人类主导,因此尚未实现完整RSI。

曝光时机与资本市场

Model 2的曝光正值Anthropic准备IPO,营收增长14倍,估值约2万亿美元。主动披露未发布的更强模型,可能意在向资本市场展示技术领先性,用风险上升佐证性能优势。但这也引发对AI失控的担忧,以及资本开支与收入不匹配的“AI气穴”风险。

Q&A

Claude Model 2在CoBench测试中得了多少分?

Claude Model 2在CoBench测试中得分62.8%,远超公开旗舰模型Claude Mythos 5的50.3%和Claude Opus 4.6的15.6%,接近人类研究员的85%水平。

什么是递归自我改进(RSI)?

递归自我改进(RSI)是指AI系统能够自主设计实验、编写训练代码、运行和评估结果,从而创造出比自己更聪明的下一代,如此循环,无需人类介入。这是AI奇点理论的触发条件。

Anthropic预计RSI何时实现?

Anthropic联合创始人Jack Clark预计RSI可能在2028年底前实现,概率为60%。谷歌DeepMind和OpenAI的研究人员也预测RSI将在2027至2028年实现。

Anthropic在RSI阶梯上处于哪个阶段?

Anthropic自认为处于第四阶段(共五阶段),业界六阶段模型中处于第3到第4阶段之间。他们已实现半自动研究闭环和自改进Agent,但尚未跨越“研究品味”这一关键环节。

为什么Anthropic的评估工具饱和了?

Anthropic最具体的基于任务的评估方法已经饱和,因为模型太强,现有测试题无法捕捉其能力提升。这导致公司无法准确测量Model 2的真实能力,甚至可能低估其得分。

Anthropic为何在IPO前曝光Model 2?

Anthropic在IPO前曝光Model 2,可能是为了向资本市场展示技术领先地位,用风险佐证性能,暗示还有更强模型,从而吸引投资。此举精准踩中资本市场兴奋点。

RSI实现后可能带来什么风险?

RSI实现后,AI将自主改进,进步速度由算力决定,可能超越人类控制。谷歌DeepMind CEO哈萨比斯表示无时无刻不在担心这类情景,暗示存在失控风险。

🏷️

标签

➡️

继续阅读