小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
不同显寸对应的可运行的模型大小 - 蝈蝈俊

在有限显存下,运行大型语言模型需平衡模型规模、量化精度和上下文长度。显存需求受模型参数、上下文缓存和系统开销影响,增加上下文长度会迅速消耗显存。选择合适的量化格式可提升性能。

不同显寸对应的可运行的模型大小 - 蝈蝈俊

蝈蝈俊 蝈蝈俊 · 2025-12-12T08:39:00Z

本文介绍了一种名为norm tweaking的技术,旨在提高大型语言模型的量化精度和效率。研究表明,通过改进权重和激活的量化方法,在低比特量化情况下,模型性能可与浮点模型相当。此外,自适应通道重组和混合精度量化方法显著提升了模型的准确率和计算效率,为未来AI硬件设计提供了新思路。

针对大型语言模型的通道级混合精度量化

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-16T00:00:00Z

该论文介绍了一种新的 Winograd 算法,扩展了其在复数领域的应用,并提出了优化方法以提高效率。研究设计了基于整数的过滤器缩放方案,减少模型大小并加快推理速度。比较不同卷积实现方式后发现,FFT 实现通常优于 Winograd 方法。此外,提出了实时数据无需模型压缩的框架 SQuant,显著提高了量化精度。

SFC:在低精度算术下实现准确快速卷积

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-03T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码