内容提要
OpenAI Astra的“48层循环两次”虽未证实,但揭示了循环Transformer趋势:通过复用物理层增加计算深度,而非堆参数。DeepLoop解决训练稳定性,Looped-MoE结合专家路由提升扩展性,early exit实现动态计算。核心变化是分离参数规模与计算量,使模型按需投入计算,重塑AI发展路径。
延伸解读
“48层循环两次”为何只是猜测
文章明确指出,OpenAI并未公开证实Astra采用“48层循环两次”的结构,这仅是外界基于其采用循环深度(recurrent depth)的推测。首席科学家Jakub Pachocki仅表示当前前沿模型的计算图深度与GPT-4相比在两倍以内,并未透露具体层数或循环次数。因此,读者应区分“有效计算深度”与“物理层数”,避免将未经证实的细节当作事实。
循环Transformer的代价:训练稳定性
循环Transformer通过权重共享复用同一组参数,虽能增加计算深度而不增加参数量,但同一参数被多次访问会导致梯度累积,可能破坏训练稳定性。DeepLoop研究指出,此时残差缩放规律需从传统DeepNorm的1/4次方调整为1/2次方,以控制更新冲击。实验表明,这种调整仅在开启循环时带来收益,说明循环架构需要专门的训练配方,而非简单套用传统方法。
循环与MoE结合:突破表达瓶颈
稠密循环模型在扩展时性能提升有限,而将循环与混合专家(MoE)结合可缓解此问题。Looped-MoE通过在不同循环轮次激活不同专家,使共享物理层产生多样化计算路径,从而增强表达能力。实验显示,在3B和9B规模下,LoopMoE在多数基准上优于匹配的Vanilla MoE,表明循环与稀疏专家结合可能带来规模化优势,但具体机制仍需进一步验证。
动态计算:重新定义模型大小
循环架构支持提前退出(early exit),模型可在循环边界检查输出质量,简单任务少算几轮,复杂任务多算几轮,使计算量按需分配。这打破了“模型大小”与“计算量”的固定关联,参数规模与推理计算成为独立旋钮。文章提醒,这种动态计算虽更高效,但“何时停止循环”的临界点尚无统一答案,部分研究显示模型在边界输出已接近最终结果后继续循环仍可能改变答案,需更多实验明确。
Q&A
OpenAI Astra的“48层循环两次”说法是否得到官方证实?
目前没有得到OpenAI公开资料的直接证实,只是外界基于Astra采用循环深度(recurrent depth)技术的推测。OpenAI首席科学家Jakub Pachocki仅表示,包括Astra在内的前沿模型计算图深度与GPT-4相比在两倍以内,并未确认具体层数和循环次数。
循环Transformer与传统Transformer在增加深度方面有何不同?
传统Transformer通过堆叠更多层来增加深度,每层有独立参数,导致参数和训练成本上升。循环Transformer则复用同一组物理层,反复计算多次,从而增加有效计算深度,但参数数量不随循环次数线性增加,实现了权重共享。
DeepLoop研究解决了循环Transformer的什么问题?
DeepLoop解决了循环Transformer中同一参数被重复访问导致的训练不稳定问题。它提出将深度缩放规律从传统DeepNorm的指数1/4调整为1/2,以控制多次更新叠加带来的影响,从而稳定训练。
Looped-MoE如何结合循环和专家混合来提升模型性能?
Looped-MoE在循环Transformer的每一轮中,通过路由器为同一token选择不同的专家,使得共享物理层在不同轮次执行不同计算,产生路由发散(routing divergence),从而增加表达空间。实验表明,在3B和9B规模下,LoopMoE在多个基准上优于匹配的Vanilla MoE,显示出规模化优势。
循环Transformer如何实现动态计算?
循环Transformer天然具有循环边界,可以在每轮结束后检查输出质量,若已足够好则提前退出(early exit),否则继续循环。这样简单任务少算几轮,困难任务多算几轮,实现按需分配计算量。
循环架构对硬件优化有何潜在影响?
循环Transformer复用同一组物理层,使得热数据可能更长时间驻留在高速缓存中,减少重复加载权重的成本,为硬件优化提供了方向。但具体能否实现寄存器级优化取决于模型规模、算子形状等因素,目前仍是工程猜测。
循环Transformer改变了哪些关于模型大小的传统观念?
循环架构使“模型有多大”和“模型算多久”分离:参数量不随循环次数线性增加,但计算量可调。模型可以拥有紧凑参数,在困难任务上投入更多计算,简单任务则提前停止,更接近人类解题方式。