本文提出了一种创新的大规模语言模型压缩方法,通过降阶建模和重参数化,在内存和时间限制下逐层压缩十亿级模型。该方法结合低秩分解和结构化剪枝,显著提高了训练和推理速度,适用于BERT模型的微调,表现优于现有技术。
完成下面两步后,将自动完成登录并继续当前操作。