AFPQ: 非对称浮点量化用于 LLMs

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

该文介绍了一种高效的仅权重量化方法,以减少大型语言模型在实际应用中的内存需求和推断成本。该方法适用于混合专家模型和密集模型,并且无需额外的微调。通过自适应的量化粒度进行解决,展示了该方法的有效性。

🏷️

标签

➡️

继续阅读