GPT-6带火循环Transformer,阿里早已布局

GPT-6带火循环Transformer,阿里早已布局

💡 原文中文,约5600字,阅读约需14分钟。
📝

内容提要

阿里团队针对循环Transformer的计算冗余问题,提出两篇论文:MeSH通过动态记忆缓冲和路由器解决循环空转,提升零样本准确率;SpiralFormer通过多分辨率序列压缩,实现从全局到局部的计算,降低计算量并提升性能。两篇论文分别被ICLR和EMNLP接收,为高效大模型提供新思路。

🔎

延伸解读

循环Transformer的“摸鱼”问题

文章指出,循环Transformer虽然能通过共享参数减少模型规模,但存在“计算冗余”问题:后续循环对hidden state的更新幅度迅速减小,表示趋于相似且低维,导致算力浪费。阿里团队通过分析发现,这源于“计算无分化”和“信息过载”,即共享网络缺乏分工,且hidden state需同时承载原始输入和历史信息。

MeSH:动态记忆与路由

MeSH通过引入动态记忆缓冲区和路由器,让每轮循环能按需读写信息,缓解了信息过载和计算无分化问题。实验显示,在Pythia-1.4B规模下,MeSH在减少约33%非嵌入参数的同时,零样本准确率反而提升1.06个百分点,而新增参数和计算开销极低,体现了“花小钱办大事”的效果。

SpiralFormer:多分辨率循环

SpiralFormer通过逐步压缩和恢复序列长度,让模型从全局到局部处理信息,降低计算量并提升性能。在Pythia-1.4B规模下,计算量从14.08T FLOPs降至13.13T,5-shot准确率提升2.44个百分点。注意力分析证实,模型确实学会了先关注全局再聚焦局部,且这种分工需要多分辨率设计驱动,而非自动出现。

循环架构的潜力与局限

文章强调,循环Transformer提供了一种用计算深度换参数规模的新思路,但并非“白捡算力”,省下的是参数而非计算。阿里团队的研究为循环架构补上了“分工”的关键拼图,但该路线能否成为下一代高效大模型的主流,仍需更多验证。作者持谨慎乐观态度,认为“让子弹再飞一会儿”。

Q&A

循环Transformer是什么?为什么它能减少模型参数?

循环Transformer是一种让同一组Transformer层反复运行的架构,通过权重共享,用较少的参数实现更深的计算。例如,8层参数跑3遍可以完成24层深度的计算,从而减少模型参数。

阿里团队针对循环Transformer的计算冗余问题提出了哪两篇论文?它们分别被哪些会议接收?

阿里团队提出了MeSH和SpiralFormer两篇论文。MeSH被ICLR 2026接收,SpiralFormer被EMNLP 2026接收。

MeSH是如何解决循环Transformer中的“循环空转”问题的?

MeSH通过引入动态记忆缓冲(Memory Buffer)和路由器来解决循环空转。记忆缓冲将历史信息分流,使hidden state专注于当前轮次;路由器为每轮循环动态分配读写权重,促进网络分工,减少重复计算。

SpiralFormer如何降低计算量并提升性能?

SpiralFormer通过多分辨率序列压缩,在每轮循环前将序列压缩为更短的表示,从全局到局部逐步处理,减少了Attention的计算量。在实验中,计算量从14.08T FLOPs降至13.13T,5-shot下游平均准确率从51.93%提高到54.37%。

循环Transformer在计算上存在哪些冗余问题?阿里团队发现了哪些证据?

循环Transformer存在计算冗余,表现为后续循环的增量更新减小。阿里团队通过分析发现三个证据:后续循环的hidden state变化幅度减小、相邻轮次表示高度相似、hidden state的奇异值谱显示表示逐渐低维化。

MeSH和SpiralFormer分别解决了循环Transformer的什么问题?

MeSH解决了循环内部信息管理问题,即每轮循环“拿什么算”;SpiralFormer解决了循环之间计算粒度问题,即每轮循环“以什么粒度算”。两者共同补上了循环Transformer的分工问题。

循环Transformer相比传统Transformer有哪些潜在优势?

循环Transformer通过权重共享减少参数,同时利用计算深度提升能力,为高效大模型提供了新思路。它可以在不增加参数的情况下增加计算深度,有望用更少的参数实现更强的性能。

🏷️

标签

➡️

继续阅读