小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

为了解决大型语言模型的内存需求和推断成本问题,提出了一种高效的仅权重量化方法。通过减少内存消耗和加速推断,使用预训练模型的模型权重来确保最小质量降低。适用于混合专家模型和密集模型,无需额外微调。通过自适应的量化粒度解决量化大型语言模型的挑战和问题。实现了高效的GPU矩阵乘法和解量化算法,支持不同激活和权重的乘法。在大规模开源模型上评估,展示了最小的准确性损失和高吞吐量。

EasyQuant: 一种高效无数据量化算法用于 LLMs

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-03-05T00:00:00Z

该研究提出了一种高效的权重量化方法,减少大型语言模型的内存消耗和推断成本。通过使用预训练模型的权重和自适应的量化粒度,该方法在混合专家模型和密集模型上展示了有效性。研究还实现了高效的GPU矩阵乘法和解量化算法,支持不同类型的激活和权重。在评估中,该方法展示了最小的准确性损失,并实现了高吞吐量。

可部署的 LLM 压缩加速之无

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-11-16T00:00:00Z

为了解决大型语言模型的内存需求和推断成本问题,提出了一种高效的仅权重量化方法。通过减少内存消耗和加速推断,采用启发式方法来确保最小质量降低。适用于混合专家模型和密集模型,无需额外微调。通过自适应的量化粒度解决挑战和问题,展示了方法的有效性。实现了高效的GPU矩阵乘法和解量化算法,支持不同激活和权重的乘法。在大规模开源模型上评估,展示了最小的准确性损失和高吞吐量。

规范微调:大型语言模型的高性能低位量化

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-09-06T00:00:00Z

本文介绍了一种新颖的权重量化方法,用于训练量化神经网络(QNNs)以避免低精度累加器溢出问题。该方法通过受权重归一化启发的公式,限制模型权重的L1范数,促进非结构化权重稀疏性以避免溢出。实验结果表明,该方法可以训练适用于低精度累加器的QNNs,并在FPGA上部署模型时提高资源效率。

A2Q: 累加器感知量化与溢出保护

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-08-25T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码