循环MoE架构深度解析,稠密Transformer之外第三条大模型路线

循环MoE架构深度解析,稠密Transformer之外第三条大模型路线

💡 原文中文,约6400字,阅读约需16分钟。
📝

内容提要

循环MoE架构将MoE与循环Transformer结合,参数与算力比值虽与稠密模型相同,但行为迥异。MoE横向动态路由专家,循环机制纵向增加计算深度,二者叠加使知识容量与思考深度解耦,并可将显存瓶颈转为算力瓶颈。但训练难度大,存在路由坍缩、循环次数难定、梯度不稳等问题,实际部署尚少。

🔎

延伸解读

循环MoE与稠密Transformer的本质区别

循环MoE将MoE的横向动态路由与循环Transformer的纵向深度叠加,使每个token的计算路径动态变化,而稠密Transformer路径固定。这导致两者在参数量和算力比值相同时,行为却截然不同:循环MoE实现了知识容量与思考深度的解耦,并能将显存瓶颈转化为算力瓶颈。

循环MoE的硬件优势与瓶颈转移

在硬件层面,循环MoE通过让激活的专家权重常驻SRAM,避免每次循环从HBM重复搬运,从而将显存带宽瓶颈转化为算力瓶颈。而稠密Transformer每处理一个token都需搬运全部权重,普通MoE则因路由不确定导致缓存收益有限。这种优化使循环MoE在相同参数量和FLOPs下可能获得数倍加速。

训练挑战与部署现状

循环MoE训练难度大,面临路由坍缩、循环次数难定、梯度不稳等问题。路由器离散决策需近似求导,循环次数固定或动态均难训练,权重共享易致梯度爆炸或消失。因此实际部署产品少,工业界主流仍是稠密Transformer加普通MoE,如GPT-4等被猜测为MoE但未大规模引入循环机制。

未来潜力与未解之谜

随着推理模型受关注,循环架构因能底层支持“让模型多想一会儿”而被重新审视。一个未公开的实验显示,将稠密70B模型改造为循环MoE,在GSM8K上可能领先15个百分点以上,但无严格对照数据。若属实,过去两年稠密模型的推理评测前提可能错误,这仍是开放问题。

Q&A

循环MoE架构是什么?它和稠密Transformer、普通MoE有什么区别?

循环MoE是将MoE层与循环Transformer结合的新型架构。稠密Transformer每层参数不同,路径固定;普通MoE在同一层内动态选择专家,但深度不变;循环MoE让向量反复穿过同一个MoE层,每次动态选择专家,实现横向和纵向双重动态性。

循环MoE如何实现知识容量和思考深度的解耦?

在循环MoE中,专家数量决定知识容量,循环次数决定思考深度。增加专家可以扩充知识而不影响计算深度,增加循环次数可以加深思考而不增加参数。两者独立调节,使模型能灵活适应不同任务。

循环MoE在硬件层面有什么优势?为什么能提升推理速度?

循环MoE可将激活专家的权重保留在SRAM中,循环时无需重复从HBM搬运,从而将显存带宽瓶颈转化为算力瓶颈。现代GPU算力富裕,因此能大幅提升推理速度,同等参数量和FLOPs下可能比稠密模型快数倍。

训练循环MoE面临哪些主要挑战?

主要挑战包括:路由器离散决策难训练,易导致专家坍缩;循环次数难以确定,动态停止机制难设计;权重共享导致梯度爆炸或消失。这些困难使得实际部署的产品很少。

循环MoE适合哪些应用场景?

适合需要多步推理的任务,如数学解题、逻辑推理、状态追踪和算法推理。也可用于构建推理模型,让模型根据问题难度动态调整思考时间,类似OpenAI o1和DeepSeek R1的思路。

循环MoE目前在实际产品中应用多吗?为什么?

实际部署很少。虽然架构在纸面上早已提出,但训练难度大,存在路由坍缩、循环次数难定、梯度不稳等问题。工业界主流仍是稠密Transformer加普通MoE,如GPT-4、Claude、Gemini等均未大规模引入循环机制。

🏷️

标签

➡️

继续阅读