GaLore 2: Large-Scale LLM Pre-training via Gradient Low-Rank Projection

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出GaLore 2,利用梯度低秩投影技术解决大语言模型训练中的内存瓶颈,支持高达5000亿个训练标记的预训练,展示了其实际应用潜力。

🏷️

标签

➡️

继续阅读