微软开源“原生1bit”三进制LLM:2B参数,0.4GB内存/单CPU就能跑,性能与同规模全精度开源模型相当

💡 原文中文,约2900字,阅读约需7分钟。
📝

内容提要

微软开源的三进制LLM BitNet b1.58 2B4T,参数达到2B,内存仅需0.4GB,能在单CPU上高效运行。该模型采用三元值{-1, 0, 1}存储权重,计算效率高,解码延迟仅29ms,能耗低至0.028J,性能优于同类模型。

🔎

延伸解读

三进制模型的优势

BitNet b1.58 2B4T采用三元值{-1, 0, 1}存储权重,相比传统的16位浮点数,显著降低了内存需求。这种创新使得模型在资源有限的设备上也能高效运行,适合边缘计算和移动设备的应用场景。

训练过程的创新

BitNet的训练过程包括大规模预训练、监督微调和直接偏好优化,特别是在低精度模型的收敛方面进行了优化。这种方法不仅提高了模型的性能,还降低了计算成本,适合需要高效推理的实际应用。

与其他模型的比较

在数学推理和常识推理任务中,BitNet的准确率明显优于同类模型,如Llama和Qwen。这表明,尽管参数量相似,BitNet在设计和训练策略上具有明显的优势,值得关注其在实际应用中的表现。

Q&A

BitNet b1.58 2B4T模型的参数规模是多少?

该模型的参数规模为2B。

BitNet b1.58 2B4T在内存使用上有什么优势?

该模型仅需0.4GB内存,显著低于同类全精度模型的内存需求。

BitNet b1.58 2B4T的解码延迟是多少?

解码延迟为29ms。

BitNet b1.58 2B4T采用了什么样的权重存储方式?

该模型采用三元值{-1, 0, 1}存储权重。

BitNet b1.58 2B4T在数学推理任务中的表现如何?

在GSM8K数学推理任务中,BitNet的准确率为58.38,超越了同类模型。

微软在1 bit LLM的研究上有哪些基础?

微软早在2023年就有相关研究,并提出了BitNet模型。

🏷️

标签

➡️

继续阅读