内容提要
OpenAI新模型Astra采用循环深度技术,增加隐藏推理,引发安全担忧。专家担心其思考过程成为黑盒,且循环次数可调大,加剧不可控风险。OpenAI称计算深度与GPT-4差距小,但承认监控脆弱。文章质疑,若开关被拧大,AI安全将严重倒退。
延伸解读
循环Transformer:用时间换深度
传统Transformer通过增加层数提升能力,而循环Transformer复用同一组层,让模型在输出前多次迭代计算。这种设计在参数不增加的情况下,等效于更深的网络,如Nanbeige4.2-3B用22层跑2遍达到44层效果。但训练不稳定,循环次数过多会导致性能崩溃,目前主流模型仅用2到4次循环。
隐藏推理与思维链监控的困境
循环深度使更多推理发生在隐空间,可能减少模型生成的中间推理token,从而降低思维链的可读性。OpenAI承认思维链监控脆弱且正朝不利方向发展,但强调与架构无关。安全专家担忧,若循环次数可配置并调高,模型可能学会“少说话多琢磨”,加剧监控难度。
能力与风险的权衡:Astra的网络安全突破
Astra在网络安全测试中表现突出,对20个高危漏洞实现100%任意代码执行,并自主发现两个零日漏洞,达到“关键级”能力门槛。然而,其高能力与低可解释性结合,引发安全担忧。OpenAI表示计算深度与GPT-4差距不到两倍,但专家认为这不足以缓解风险。
军备竞赛的潜在风险
Anthropic和Google DeepMind已在讨论类似技术,若OpenAI验证循环Transformer有效,其他实验室可能跟进。尽管学术界循环次数未大幅增加,但Astra据传为10T参数规模,最佳循环次数未知。若竞争压力导致循环次数上调,AI安全可能面临严重倒退。
Q&A
OpenAI的Astra模型采用了什么新技术?
Astra模型采用了循环深度技术,即重复使用同一组计算层多次,而不是增加层数,以在输出前进行更多隐藏推理。
为什么安全专家对Astra的循环深度技术感到担忧?
安全专家担心循环深度使模型的推理更多发生在隐空间,人类难以理解,且循环次数可调大,增加不可控风险。Redwood Research的Ryan Greenblatt称这可能是AI安全最严重的倒退。
Jakub Pachocki如何回应Astra的安全担忧?
Pachocki在X上表示Astra的计算深度与GPT-4差距不到两倍,承认思维链监控脆弱但称与架构无关,并强调可采取措施加强监控。
循环Transformer与普通Transformer有何不同?
普通Transformer通过增加层数来加深思考,而循环Transformer不增加层数,而是重复使用同一组层多次,类似同一工人反复检查零件,参数量不增加但等效深度增加。
Astra在网络安全方面表现如何?
Astra在20个V8高危漏洞上取得100%的任意代码执行成功率,而GPT-5.6 Sol只有20%,且Astra还自行发现两个零日漏洞,完成浏览器沙箱逃逸和权限提升,达到关键级网络安全能力。
循环Transformer的训练存在什么问题?
循环Transformer训练不稳定,文献中常见'unstable to train',普通循环Transformer在3到6次循环间性能下降,9次崩溃,因此大型模型如Loopie只用2次循环,Ouro用4次。
为什么说Astra的循环次数是一个可调大的开关?
因为Astra可能训练了能跑更多循环的模型,但部署时限制循环次数,这个限制可配置,竞争压力下可能被调高,从而增加不可控风险。
OpenAI在思维链监控方面面临什么矛盾?
OpenAI一边承认思维链监控脆弱且朝不利方向发展,一边声称部署额外监控,这种矛盾引发质疑,且招聘广告也表明在为监控性可能丧失做准备。