本研究解决了变换器中信号传播和梯度消失/爆炸的问题,分析了softmax注意力机制初始状态下的传播问题。通过随机矩阵方法,提出消除谱间隙的方法解决宽度上的秩崩溃,并通过实验验证其有效性。
该文介绍了一种实现信号在无量纲变压器中可信传播的方法,通过设计参数初始化、偏差矩阵和位置相关的重缩放的组合。该方法能够使深度无量纲变压器在大约 5 倍的迭代次数后达到与标准变压器相同的性能。
完成下面两步后,将自动完成登录并继续当前操作。