均值上下文嵌入的范数决定其方差
本研究探讨了上下文嵌入的变化与均值嵌入的范数和方差之间的关系。实验结果显示,随着Transformer模型层数增加,嵌入远离原点,类间方差减小,类内方差增大。
原文中文,约2200字,阅读约需6分钟。
本研究探讨了上下文嵌入的变化与均值嵌入的范数和方差之间的关系。实验结果显示,随着Transformer模型层数增加,嵌入远离原点,类间方差减小,类内方差增大。