使用预训练模型的不断学习:调查

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

本研究使用不同的持续学习算法对语言模型进行增量预训练,保留早期知识并提高下游任务性能。采用基于蒸馏的方法最有效,同时提高知识转移和时态泛化能力。

🏷️

标签

➡️

继续阅读