七月论文审稿GPT第4.2版:通过15K条paper-review数据微调Llama2 70B(含各种坑)
原文中文,约7600字,阅读约需19分钟。
📝
内容提要
本文记录了作者在微调LLaMA2 70B模型过程中遇到的报错信息及解决方法,包括GPU占用和数据截断等问题。作者成功微调了5K条数据,并进行了推理,结果超过了GPT4-1106模型。作者计划使用更大的15K数据集进行微调。
❓
Q&A
在微调LLaMA2 70B模型时遇到了哪些主要问题?
主要问题包括GPU占用过高和数据截断错误。
作者是如何解决显存不足的问题的?
作者使用了DeepSpeed Zero-3优化训练,降低了显存占用。
微调5K条数据的结果如何?
推理结果显示5K数据的效果超过了GPT4-1106模型。
作者计划如何提高数据质量?
作者计划使用更大的15K数据集进行微调,以提高数据质量。
在微调过程中,如何处理数据中的错误?
作者通过二分法定位并剔除引发异常的数据,最终成功使用5089条数据完成训练。
训练过程中显存的最高占用是多少?
训练过程中显存的最高占用为570GB。
🏷️