小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文介绍量化和剪枝两种模型压缩技术,用于减小大语言模型体积、降低成本并提升推理速度。量化降低权重精度(如4位),剪枝删除冗余权重。文中详述五种方法:bitsandbytes、GPTQ、AWQ、SparseGPT和Wanda,并建议先剪枝后量化,根据需求选择合适方法,以在保持性能的同时实现高效部署。

量化和剪枝方法,让你的大语言模型更精简

KDnuggets KDnuggets · 2026-08-28T12:00:55Z
Pi Agent + Qwen 3.8 27B 深度优化

作者在懒猫AI算力舱X5上部署Qwen 3.8 27B模型,通过真实项目测试,发现其性能良好。经MTP投机解码和NVFP8优化,速度从13.9提升至30.8 Tokens,但关闭思考模式会降低代码推理准确度。开启思考模式后,实际速度稳定在26.47 Tokens,若计入思考阶段,可达35.23 Tokens/s。未来计划进一步优化draft engine以提升速度。

Pi Agent + Qwen 3.8 27B 深度优化

Andy Stewart Andy Stewart · 2026-08-24T16:00:00Z
两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

阿里开源Qwen3.8-27B模型,270亿参数,支持262K上下文,性能接近闭源旗舰。社区实测在双RTX 3090上达105 tok/s,通过量化、MTP加速等技术实现。模型Apache 2.0协议,48小时下载86万次。但速度受场景、配置影响大,多卡未必更快,且长上下文需量化KV缓存牺牲质量。

两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

极道 极道 · 2026-08-17T04:23:00Z
128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测

LFM2.5-2.6B是面向端侧部署的轻量级AI推理模型,支持128K长上下文和智能体工具调用,性能可与大4倍参数模型竞争。在Apple M5 Max上推理速度达220 tok/s,AMD Ryzen CPU上113 tok/s,内存占用低于2.5GB,平衡了轻量化与高性能。HyperAI官网已上线该模型,并提供相关数据集、教程和百科词条更新。

128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测

HyperAI超神经 HyperAI超神经 · 2026-08-15T08:16:23Z
Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。

Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

极道 极道 · 2026-08-14T21:45:00Z
AMD买taalas把模型刻进硅片:推理速度干掉英伟达48倍

AMD收购Taalas公司,其技术将AI模型直接固化在芯片上,推理速度比英伟达快48倍,每秒生成近1.7万token。但模型无法更换,需重新流片,成本高昂。该技术主要面向模型固定、流量大的头部厂商,如OpenAI等,可大幅降低推理成本,但小公司难以承受,通用与专用芯片路线将分化。

AMD买taalas把模型刻进硅片:推理速度干掉英伟达48倍

极道 极道 · 2026-08-06T21:34:00Z
Cohere推出硬件感知的动态推测解码:推理速度翻倍

Cohere推出了动态推测解码技术,能够根据显卡状态实时调整猜字数量,从而解决了固定数量导致的速度瓶颈。该技术在不同批次大小下优化性能,提升推理速度,特别是在强化学习和大模型服务中表现突出。动态方案确保在各种环境下的稳定性,避免了传统方法的速度波动问题,并已整合进vLLM框架,用户可直接受益。

Cohere推出硬件感知的动态推测解码:推理速度翻倍

极道 极道 · 2026-07-12T00:56:00Z
全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!

蚂蚁灵波发布了LingBot-VA 2.0,这是全球首个具身原生的预训练VA模型。该模型通过预判能力提升机器人在复杂任务中的表现,如桌面整理和轻柔抓取。LingBot-VA 2.0采用新一代VAE、因果预训练和稀疏MoE架构,显著提高了推理速度和实时控制能力,标志着机器人技术进入新阶段。

全球首个「具身原生」预训练模型发布,从物理世界出发为机器人造大脑!

量子位 量子位 · 2026-07-10T08:01:00Z
50FPS、成本打掉70%,魔芯MoWorld把世界模型带进产业时代

魔芯科技与华为等合作推出MoWorld,这是首个基于国产NPU的实时交互世界模型,推理速度超过50FPS,成本仅为同规模GPU的30%。MoWorld支持用户实时交互,适用于机器人和自动驾驶等领域,推动世界模型的产业化应用。

50FPS、成本打掉70%,魔芯MoWorld把世界模型带进产业时代

量子位 量子位 · 2026-07-08T13:29:44Z

BGE-M3是一款全能型嵌入模型,支持密集、稀疏和多向量检索,覆盖100多种语言,最大输入长度为8192词元。其量化版bge-m3-q8_0在GPUNexus平台上线,显存占用减少,推理速度提升,适合RAG系统和多语言知识库。2026年第三季度可免费试用。

【免费用3月】BGE-M3 全能多粒度嵌入模型:三合一检索、百种语言、超长上下文,量化版上线算纽GPUNexus

Rust.cc Rust.cc · 2026-07-07T05:50:31Z
梁文锋署名的DSpark,看懂这10个点就够了!

DeepSeek的新论文DSpark提出了一种通过系统工程和模型协同设计来提升大模型推理速度的方法。该方法利用GPU的特性进行连续批处理,结合小模型的快速猜测和大模型的验证,显著提高推理效率。DSpark通过优化草稿模型和动态调整验证长度,实现了端到端的性能提升,并已开源相关代码供开发者使用。

梁文锋署名的DSpark,看懂这10个点就够了!

量子位 量子位 · 2026-06-28T08:06:04Z
DeepSeek又变强了:发布DSpark框架 推理速度提升超60%

DeepSeek团队与北京大学联合发布了《DSpark》研究论文,提出了一种加速大模型推理的新方法。该技术在保持文本生成质量的同时,显著提升了推理速度,单用户生成速度提高85%。DSpark采用“半自回归生成”架构和置信度调度验证机制,优化了生成过程,减少了计算资源浪费,并已在DeepSeek-V4系统中应用,提升了推理效率。

DeepSeek又变强了:发布DSpark框架 推理速度提升超60%

TechWeb 全站精华 TechWeb 全站精华 · 2026-06-28T01:33:52Z
DeepSeek DSpark加速推理:猜词游戏中玩出创新

DeepSeek的研究表明,通过让AI模型先“猜测”后续内容,再进行验证,可以显著提高推理速度。这种“猜测-验证”机制减少了计算量,并提高了准确率。与美国公司的保密技术不同,中国公司通过开源技术降低了AI模型的成本,使其更为普及。这一变化可能导致AI服务价格大幅下降,影响投资者对AI公司的预期。

DeepSeek DSpark加速推理:猜词游戏中玩出创新

极道 极道 · 2026-06-27T23:04:00Z
论文周报 | DeepMind D4RT统一动态4D重建,推理速度飙升300倍;打破AGI通用幻想,哥大等提出SAI理论重塑AI演进目标...速览一周AI前沿论文

Google DeepMind与牛津大学及UCL的研究团队提出了D4RT模型,旨在高效重建动态视频中的4D场景。该模型通过单次视频输入,利用灵活的查询机制,独立获取任意点的三维状态,显著提高了推理速度和效率,刷新了多项基准测试记录,为未来的4D视觉感知提供了新的范式。

论文周报 | DeepMind D4RT统一动态4D重建,推理速度飙升300倍;打破AGI通用幻想,哥大等提出SAI理论重塑AI演进目标...速览一周AI前沿论文

HyperAI超神经 HyperAI超神经 · 2026-06-18T09:38:58Z
实测小米最快1T大模型:吞吐量每秒1000+ Tokens,Vibe Coding七秒交付

小米推出了MiMo-V2.5-Pro-UltraSpeed模型,具备1T参数和1000+ TPS的推理速度,突破了GPU的性能限制。该模型在全栈开发任务中表现优异,能够快速生成高质量的复杂应用,推动了大模型的商业化进程。

实测小米最快1T大模型:吞吐量每秒1000+ Tokens,Vibe Coding七秒交付

量子位 量子位 · 2026-06-11T01:18:16Z
小米MiMo-v2.5-Pro-UltraSpeed推理速度达每秒一千token

小米MiMo-v2.5-Pro-UltraSpeed模型的推理速度达到每秒1000词,改变了人机互动方式。快速的AI提升了用户的对话和协作效率,而慢速模型则会导致思维中断,影响体验。未来,速度将成为AI智能的重要维度。

小米MiMo-v2.5-Pro-UltraSpeed推理速度达每秒一千token

极道 极道 · 2026-06-08T22:37:00Z
阶跃Step 3.7 Flash登顶AA榜:速度、性价比、端到端三项第一

阶跃星辰推出的Step 3.7 Flash模型在速度和成本上表现优异,推理速度超过400 tokens/s,单任务成本仅为Claude Opus 4.6的1/9,适合企业级应用,推动AI商业化进程。

阶跃Step 3.7 Flash登顶AA榜:速度、性价比、端到端三项第一

量子位 量子位 · 2026-06-05T06:12:16Z
JetBrains开源Mellum2,以超越Claude Code的局限

JetBrains发布了Mellum2,这是一个开源的12B参数编码模型,专注于AI系统的基础设施层。Mellum2支持更广泛的任务,如模型协调和子代理工作负载,采用混合专家架构以提升推理速度。该模型在代码生成任务中表现优异,但在广泛推理和知识评估方面略逊于其他模型。目前已在Hugging Face上发布,企业可选择自我托管。

JetBrains开源Mellum2,以超越Claude Code的局限

The New Stack The New Stack · 2026-06-01T20:47:26Z
大语言模型速度基准:指标与基础设施指南

本文讨论了大语言模型(LLM)推理速度的关键指标及其对用户体验的影响,强调选择合适模型和优化指标的重要性。介绍了TTFT、TTFAT、输出速度等六个性能指标,并提到语义缓存技术可以减少推理瓶颈,提高响应速度和降低成本。Redis作为实时数据平台,支持语义缓存和向量搜索,适合构建高效的GenAI应用。

大语言模型速度基准:指标与基础设施指南

Redis Blog Redis Blog · 2026-05-10T00:00:00Z
一分钟读论文:《用扩散语言模型统一多模态理解与生成》

蚂蚁集团的论文《LLaDA2.0-Uni》提出了一种离散扩散语言模型,旨在统一视觉理解和图像生成。该模型通过将图像压缩为离散语义token,并利用混合专家架构实现文本和视觉token的并行处理,显著提升推理速度。LLaDA2.0-Uni在视觉理解和图像生成任务上表现优异,展现出理解与生成的连续交互能力。

一分钟读论文:《用扩散语言模型统一多模态理解与生成》

Micropaper Micropaper · 2026-04-26T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码