内容提要
Anthropic预训练研究员考克森辞职并发帖警告:AI可能在本十年内杀死全人类,OpenAI与Anthropic都未负责任地行动,陷入囚徒困境。他放弃即将到手的期权,引发1.3亿人围观。公司对齐负责人等内部人士公开附和,承认尚无对齐方案。作者认为竞赛停不下来,监管只能看着它跑,无法强制刹车。
延伸解读
内部人警告为何更有分量
考克森是预训练研究员,亲手参与GPT-4o和GPT-4.5等模型开发,属于“踩油门”的人。以往警告多来自对齐或安全研究者,容易被归为利益相关。而考克森以核心贡献者身份辞职并公开批评,且放弃即将到手的期权,使其动机更难被质疑。这种身份转换让警告从外部批评变为内部证词,显著提升了可信度。
对齐方案缺失的公开承认
Anthropic对齐科学负责人休宾格公开回复,认同AI可能杀死全人类,并称未来十年内概率超过10%,同时承认公司尚无超级智能对齐方案,也未明显走在解决轨道上。这相当于在IPO关口承认安全叙事存在缺口。连写解法的安全研究员也点头,说明问题不是个别员工偏激,而是公司内部对风险有共识。
监管难强制刹车的现实
文章判断竞赛停不下来,因为技术掌握在多家大公司手中,政府能管发布和销售,却难管实验室研究。即使美国暂停,其他国家未必跟进,形成囚徒困境。作者认为更透明和更多监管可行,但目的是看着它跑而非拉着它停;让有能力制止的人跑得更快,可能才是阻止毁灭的方法。
中美危险程度未必对等
文章指出中国大模型总体智力弱于美国,但危险程度与智力水平是两回事。中国擅长蒸馏和特定领域专项训练,尤其在网络安全领域,因此论总体智力有差距,论危险程度中美没有差距。就像两个都会用武器的人走进瓷器店,一个聪明一个笨,瓷器店下场没区别。这提醒读者关注能力差距之外的风险对等性。
Q&A
Jacob Coxon是谁?他为什么有资格对AI安全发出警告?
Jacob Coxon是27岁的英国籍预训练研究员,剑桥大学数学系毕业。他曾在OpenAI参与GPT-4o和GPT-4.5的预训练工作,今年7月跳槽到Anthropic,但仅4个月后便辞职。由于他亲手参与打造了全球最先进的大模型,是“踩油门”的人,因此他的警告比外部研究者更有分量。
考克森辞职帖中提出了哪些核心警告?
他发了7条帖文,核心警告包括:AI可能在本十年结束前杀死全人类;OpenAI和Anthropic都没有负责任地行动,正冲向能自我改进的超级智能;在OpenAI很多人未内化文明级风险,在Anthropic则陷入囚徒困境;接受这场竞赛是傲慢的赌博;需要临时禁止某些提升模型能力的事情;到明年年底,最激进场景可能失控。
考克森辞职放弃了哪些经济利益?
他放弃了即将到手的Anthropic期权。Anthropic员工期权6个月归属,他仅工作4个月就离职,因此一分钱未拿到。此外,他公开批评OpenAI,可能导致其已持有的OpenAI股票缩水。他本可再等两个月,等IPO后身家千万以上,但他选择放弃。
Anthropic内部对考克森的警告有何反应?
Anthropic对齐科学负责人休宾格公开回复称“Jacob说得对”,并承认相信AI可能杀死全人类,未来十年概率超10%,且公司尚无对齐方案。安全研究员马克斯表示“职级越高越担心”,已离职的可扩展监督负责人本顿也确认考克森的描述准确。公司官方则保持沉默。
为什么考克森的辞职帖能在3天内获得超过1.3亿浏览量?
原因有三层:政治层面,奥巴马前演讲稿撰写人和共和党金主阿克曼同时转发并配文“concerning”,跨越左右派;马斯克也回复“看起来像设了个局”,引发关注;时间点上,此前三个月接连发生AI智能体逃逸、最强网络攻击模型发布、GPT-6 Astra发布并宣布AGI到来等事件,考克森的帖子成为最后一块多米诺骨牌。
作者认为AI竞赛能通过法律强制停下来吗?他的解决方案是什么?
作者认为不能。因为技术掌握在多家大公司手中,政府管不住实验室研究,且即使美国停了,中国也不会停。他提出三点:别指望一纸法令叫停;更透明和更多监管可以有,但目的是看着它跑而非拉着它停;让有能力制止的人跑得更快更远,可能才是阻止毁灭的最好方法。