Pre-training Warm-up: Unlocking General Reasoning in Resource-Limited Environments

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种两阶段训练策略,通过预热和强化学习,解决了大型语言模型在高质量训练数据稀缺情况下的推理能力问题,显著提升了模型的推理能力和样本效率。

🏷️

标签

➡️

继续阅读