从零实现Transformer的简易版与强大版:从300多行到3000多行
原文中文,约6000字,阅读约需15分钟。
📝
内容提要
本文介绍了从零实现transformer和通过transformer库微调LLM的方法,以及加速模型训练和调优的技巧。第一部分包括输入处理和transformer block,重点讲解了multi-head attention。第二部分介绍了Trainer类的关键方法和训练过程。第三部分还在更新中。
🏷️