内容提要
OpenAI Astra采用“循环深度”技术,通过重复使用参数提升计算深度,使3B小模型达到50B效果,但引发AI安全争议。该技术减少可见思维链,增加监控难度。开源Nanbeige模型应用此技术未受关注,而闭源Astra因规模大、透明度低遭担忧。核心问题在于模型越强越难监控,竞赛或致人类无法理解AI推理。
延伸解读
循环深度:用时间换空间的技术权衡
循环Transformer通过重复使用同一组参数来增加计算深度,而不增加模型大小。Nanbeige的实验表明,两轮循环是最佳平衡点,超过三轮收益微乎其微,且训练成本飙升。这种“用时间换空间”的策略,在参数不变的情况下提升能力,但边际递减明显,并非循环越多越好。
开源与闭源的透明度差异
同样的循环深度技术,开源模型Nanbeige未引发恐慌,而闭源的Astra却遭安全界强烈担忧。核心差异在于透明度:开源模型可自行测试和验证,闭源模型只能依赖OpenAI的承诺。规模越大,透明度越低,公众的信任风险越高。
思维链监控的脆弱性
循环深度可能减少可见的思维链痕迹,但Raschka指出,复用层本身不会压制思维链,只是将更多计算转移到隐藏状态。安全专家的担忧在于,如果OpenAI大幅增加循环次数,可能彻底摧毁思维链的可监测性,使安全审计失效。
技术中性,但竞赛加剧风险
循环Transformer本身是中性技术,但闭源大规模应用可能引发“竞相降低标准”的竞赛。Zvi Mowshowitz甚至建议用法律阻止。技术没变,变的是规模和透明度,当模型强到能在隐藏状态完成推理,人类可能无法理解其思考过程。
Q&A
OpenAI Astra 模型采用了什么技术,使其小模型能达到大模型的效果?
OpenAI Astra 模型采用了“循环深度”技术,即循环 Transformer。该技术通过重复使用同一组参数来增加计算深度,使得一个 3B 参数的小模型能达到 50B 参数模型的效果。
循环 Transformer 技术是如何工作的?
循环 Transformer 技术通过将同一组 Transformer 层重复计算多次来增加有效深度,而不增加参数量。例如,一个 22 层的模型循环两次,等效于 44 层的计算深度,但参数不变,计算量翻倍。
为什么 AI 安全专家对 OpenAI Astra 使用循环深度技术表示担忧?
安全专家担忧的是,循环深度技术可能减少可见的思维链,使推理过程更多发生在隐藏状态中,从而增加监控难度。他们担心如果 OpenAI 进一步推进该技术,可能会彻底摧毁思维链的可监测性,使人类无法理解 AI 的推理过程。
开源模型 Nanbeige4.2-3B 与闭源模型 Astra 在应用循环 Transformer 技术上有何不同?
Nanbeige4.2-3B 是一个开源的 3B 参数模型,使用了循环 Transformer 技术,但因其规模小且完全开源,未引起广泛关注。Astra 是一个闭源的 10T 参数模型,同样使用该技术,但因规模大、透明度低,引发了安全担忧。
循环 Transformer 技术是否必然导致思维链消失?
不一定。Sebastian Raschka 指出,复用层本身不会压制可见的思维链,它只是在输出下一个 token 之前,在隐藏状态里多算了几轮。Astra 对这项技术的使用是“有限的”,思维链仍然预计可读。
循环 Transformer 技术有哪些潜在的风险?
潜在风险包括:减少可见思维链,增加监控难度;模型越强越有能力隐藏推理,可能导致安全审计和思维链监控失效;可能引发 AI 实验室之间竞相降低标准的竞赛,甚至需要法律干预。