从零实现Transformer的简易版与强大版:从300多行到3000多行

💡 原文中文,约6000字,阅读约需15分钟。
📝

内容提要

本文介绍了从零实现transformer和通过transformer库微调LLM的方法,以及加速模型训练和调优的技巧。第一部分包括输入处理和transformer block,重点讲解了multi-head attention。第二部分介绍了Trainer类的关键方法和训练过程。第三部分还在更新中。

🏷️

标签

➡️

继续阅读