本文介绍量化和剪枝两种模型压缩技术,用于减小大语言模型体积、降低成本并提升推理速度。量化降低权重精度(如4位),剪枝删除冗余权重。文中详述五种方法:bitsandbytes、GPTQ、AWQ、SparseGPT和Wanda,并建议先剪枝后量化,根据需求选择合适方法,以在保持性能的同时实现高效部署。
作者在懒猫AI算力舱X5上部署Qwen 3.8 27B模型,通过真实项目测试,发现其性能良好。经MTP投机解码和NVFP8优化,速度从13.9提升至30.8 Tokens,但关闭思考模式会降低代码推理准确度。开启思考模式后,实际速度稳定在26.47 Tokens,若计入思考阶段,可达35.23 Tokens/s。未来计划进一步优化draft engine以提升速度。
阿里开源Qwen3.8-27B模型,270亿参数,支持262K上下文,性能接近闭源旗舰。社区实测在双RTX 3090上达105 tok/s,通过量化、MTP加速等技术实现。模型Apache 2.0协议,48小时下载86万次。但速度受场景、配置影响大,多卡未必更快,且长上下文需量化KV缓存牺牲质量。
LFM2.5-2.6B是面向端侧部署的轻量级AI推理模型,支持128K长上下文和智能体工具调用,性能可与大4倍参数模型竞争。在Apple M5 Max上推理速度达220 tok/s,AMD Ryzen CPU上113 tok/s,内存占用低于2.5GB,平衡了轻量化与高性能。HyperAI官网已上线该模型,并提供相关数据集、教程和百科词条更新。
阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。
AMD收购Taalas公司,其技术将AI模型直接固化在芯片上,推理速度比英伟达快48倍,每秒生成近1.7万token。但模型无法更换,需重新流片,成本高昂。该技术主要面向模型固定、流量大的头部厂商,如OpenAI等,可大幅降低推理成本,但小公司难以承受,通用与专用芯片路线将分化。
Cohere推出了动态推测解码技术,能够根据显卡状态实时调整猜字数量,从而解决了固定数量导致的速度瓶颈。该技术在不同批次大小下优化性能,提升推理速度,特别是在强化学习和大模型服务中表现突出。动态方案确保在各种环境下的稳定性,避免了传统方法的速度波动问题,并已整合进vLLM框架,用户可直接受益。
蚂蚁灵波发布了LingBot-VA 2.0,这是全球首个具身原生的预训练VA模型。该模型通过预判能力提升机器人在复杂任务中的表现,如桌面整理和轻柔抓取。LingBot-VA 2.0采用新一代VAE、因果预训练和稀疏MoE架构,显著提高了推理速度和实时控制能力,标志着机器人技术进入新阶段。
魔芯科技与华为等合作推出MoWorld,这是首个基于国产NPU的实时交互世界模型,推理速度超过50FPS,成本仅为同规模GPU的30%。MoWorld支持用户实时交互,适用于机器人和自动驾驶等领域,推动世界模型的产业化应用。
BGE-M3是一款全能型嵌入模型,支持密集、稀疏和多向量检索,覆盖100多种语言,最大输入长度为8192词元。其量化版bge-m3-q8_0在GPUNexus平台上线,显存占用减少,推理速度提升,适合RAG系统和多语言知识库。2026年第三季度可免费试用。
DeepSeek的新论文DSpark提出了一种通过系统工程和模型协同设计来提升大模型推理速度的方法。该方法利用GPU的特性进行连续批处理,结合小模型的快速猜测和大模型的验证,显著提高推理效率。DSpark通过优化草稿模型和动态调整验证长度,实现了端到端的性能提升,并已开源相关代码供开发者使用。
DeepSeek团队与北京大学联合发布了《DSpark》研究论文,提出了一种加速大模型推理的新方法。该技术在保持文本生成质量的同时,显著提升了推理速度,单用户生成速度提高85%。DSpark采用“半自回归生成”架构和置信度调度验证机制,优化了生成过程,减少了计算资源浪费,并已在DeepSeek-V4系统中应用,提升了推理效率。
DeepSeek的研究表明,通过让AI模型先“猜测”后续内容,再进行验证,可以显著提高推理速度。这种“猜测-验证”机制减少了计算量,并提高了准确率。与美国公司的保密技术不同,中国公司通过开源技术降低了AI模型的成本,使其更为普及。这一变化可能导致AI服务价格大幅下降,影响投资者对AI公司的预期。
Google DeepMind与牛津大学及UCL的研究团队提出了D4RT模型,旨在高效重建动态视频中的4D场景。该模型通过单次视频输入,利用灵活的查询机制,独立获取任意点的三维状态,显著提高了推理速度和效率,刷新了多项基准测试记录,为未来的4D视觉感知提供了新的范式。
小米推出了MiMo-V2.5-Pro-UltraSpeed模型,具备1T参数和1000+ TPS的推理速度,突破了GPU的性能限制。该模型在全栈开发任务中表现优异,能够快速生成高质量的复杂应用,推动了大模型的商业化进程。
小米MiMo-v2.5-Pro-UltraSpeed模型的推理速度达到每秒1000词,改变了人机互动方式。快速的AI提升了用户的对话和协作效率,而慢速模型则会导致思维中断,影响体验。未来,速度将成为AI智能的重要维度。
阶跃星辰推出的Step 3.7 Flash模型在速度和成本上表现优异,推理速度超过400 tokens/s,单任务成本仅为Claude Opus 4.6的1/9,适合企业级应用,推动AI商业化进程。
JetBrains发布了Mellum2,这是一个开源的12B参数编码模型,专注于AI系统的基础设施层。Mellum2支持更广泛的任务,如模型协调和子代理工作负载,采用混合专家架构以提升推理速度。该模型在代码生成任务中表现优异,但在广泛推理和知识评估方面略逊于其他模型。目前已在Hugging Face上发布,企业可选择自我托管。
本文讨论了大语言模型(LLM)推理速度的关键指标及其对用户体验的影响,强调选择合适模型和优化指标的重要性。介绍了TTFT、TTFAT、输出速度等六个性能指标,并提到语义缓存技术可以减少推理瓶颈,提高响应速度和降低成本。Redis作为实时数据平台,支持语义缓存和向量搜索,适合构建高效的GenAI应用。
蚂蚁集团的论文《LLaDA2.0-Uni》提出了一种离散扩散语言模型,旨在统一视觉理解和图像生成。该模型通过将图像压缩为离散语义token,并利用混合专家架构实现文本和视觉token的并行处理,显著提升推理速度。LLaDA2.0-Uni在视觉理解和图像生成任务上表现优异,展现出理解与生成的连续交互能力。
完成下面两步后,将自动完成登录并继续当前操作。