本文提出一种集成式“扩大-剪枝”流水线,用于生成式语言模型预训练。该方法将扩大模型训练、剪枝和恢复整合到单一余弦退火学习率计划中,并引入迭代结构化剪枝,以缓解知识损失并优化神经元容量分配。实验表明,在将2.8B模型压缩至1.3B(预训练达2T tokens)时,该方法提升了剪枝模型的性能,并揭示了扩大预训练的token效率优势。
完成下面两步后,将自动完成登录并继续当前操作。