小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
TinySR:面向真实世界图像超分辨率的轻量级扩散模型

TinySR是一种面向真实世界图像超分辨率的轻量级扩散模型,通过深度剪枝、动态块间激活和扩张-腐蚀策略,实现比教师模型快5.68倍、参数减少83%的加速。同时轻量化VAE,移除时间与提示模块并预缓存。实验显示其在保持画质的同时,推理速度和成本优势明显,适合移动端部署。

TinySR:面向真实世界图像超分辨率的轻量级扩散模型

实时互动网 实时互动网 · 2026-09-03T02:49:14Z
如何在不显著降低智能水平的前提下缩小语言模型

本文介绍了三种压缩大型语言模型的技术:量化、剪枝和知识蒸馏,它们能在不显著降低智能水平的前提下减小模型规模。这些技术可叠加使用,但各有取舍,如量化可能损失细微理解力,剪枝影响复杂逻辑,蒸馏可能缺乏原创性。选择哪种技术取决于模型的具体应用目标。

如何在不显著降低智能水平的前提下缩小语言模型

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-09-01T15:30:41Z

本文介绍量化和剪枝两种模型压缩技术,用于减小大语言模型体积、降低成本并提升推理速度。量化降低权重精度(如4位),剪枝删除冗余权重。文中详述五种方法:bitsandbytes、GPTQ、AWQ、SparseGPT和Wanda,并建议先剪枝后量化,根据需求选择合适方法,以在保持性能的同时实现高效部署。

量化和剪枝方法,让你的大语言模型更精简

KDnuggets KDnuggets · 2026-08-28T12:00:55Z
Qdrant与Minima联合优化,每GPU小时智能体RAG任务量提升2.92倍

Qdrant与Minima联合优化智能体RAG,通过混合检索、重排序和模型压缩,将每GPU小时成功任务数从1081提升至3158,提升2.92倍。首轮检索成功率增至87%,上下文减少56%,延迟从21.3秒降至7.7秒,同时保持任务质量,显著降低推理成本。

Qdrant与Minima联合优化,每GPU小时智能体RAG任务量提升2.92倍

Qdrant - Vector Database Qdrant - Vector Database · 2026-08-13T00:00:00Z
大模型如何教会小模型变聪明

知识蒸馏是一种训练小型模型模仿大型模型行为的方法,与模型压缩不同,它生成独立模型。通过软标签传递更多信息,学生模型能超越原始数据学习。主要方法包括输出蒸馏、特征蒸馏和合成数据蒸馏,其中合成数据蒸馏最常用。蒸馏在窄任务上表现优异,但受限于教师模型能力、容量差距和架构影响,且可能传递非预期特征。自动化蒸馏正减少人工干预。

大模型如何教会小模型变聪明

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-05T15:30:28Z
MacStudio跑KimiK3:剪枝干掉73%专家 瘦身到350GB

该文章介绍PipeNetwork的kimi-k3-mlx项目,将Moonshot AI的2.8T参数MoE模型Kimi K3转换为苹果芯片MLX格式,通过流式转换和REAP剪枝技术删除73%专家,将模型从1.6TB压缩至350GB,使Mac Studio等大内存设备能本地运行,展示了巨型模型个人化的工程路径。

MacStudio跑KimiK3:剪枝干掉73%专家 瘦身到350GB

极道 极道 · 2026-07-30T03:48:00Z
Kimi K3本地使用版(1.56TB → 594GB),由Unsloth压缩并发布

Unsloth团队将Kimi K3模型从1.56TB压缩至594GB,体积缩小近三倍,最小版本保留78.9%准确率。量化技术降低参数存储位数,使顶级模型可在个人电脑运行。文章还讨论剪枝技术、显存焦虑及低成本部署梦想,推动压缩技术发展,让AI从奢侈品变为消费品。

Kimi K3本地使用版(1.56TB → 594GB),由Unsloth压缩并发布

极道 极道 · 2026-07-29T23:21:00Z

2026年企业AI部署转向小型语言模型(SLM),因其成本低、延迟小且满足隐私要求。文章推荐五份关键资源:从零训练SLM的GitHub指南、arXiv压缩技术综述、NVIDIA关于SLM在代理AI中优势的论文、Pioneer AI微调实践指南,以及Hugging Face的模型概览,覆盖架构、策略到部署全流程。

掌握小型语言模型的5篇必读资源

KDnuggets KDnuggets · 2026-07-29T12:00:22Z
一万五刀跑通7530亿参数GLM-5.2:开源模型量化压缩技术全解析

开源社区通过REAP修剪专家、GGUF量化、混合精度等技术,将7530亿参数的GLM-5.2模型压缩至消费级硬件可运行,体积削减80%,成本从7万美元降至1.5万美元,智商保留82%。KV缓存优化提升上下文至74万token,Moet方案实现2位权重运行。开源创新推动AI模型个人化,挑战高价硬件垄断。

一万五刀跑通7530亿参数GLM-5.2:开源模型量化压缩技术全解析

极道 极道 · 2026-07-22T22:13:00Z
智谱GLM 5.2量化算法革命:滑铁卢实习生三个月干翻英伟达

滑铁卢大学的实习生Joshua Hill在三个月内开发出一种新型量化算法,显著提升了大模型的压缩效率和性能,超越了英伟达的ModelOpt。该算法通过全局优化模型层的依赖关系,缩短搜索时间,提高压缩率,解决了量化中的信息损失问题。这一突破将降低AI服务成本,提高用户体验,推动行业进步。

智谱GLM 5.2量化算法革命:滑铁卢实习生三个月干翻英伟达

极道 极道 · 2026-07-13T23:37:00Z

Cloudflare宣布与Ensemble AI团队合作,旨在提升AI基础设施,帮助开发者高效运行大型AI模型。Ensemble AI专注于模型压缩和高效推理,开发了NdLinear等新技术,以降低运行成本和计算需求。Cloudflare的全球网络和无服务器架构将使AI应用更易于部署,改善推理经济性,支持开发者在全球范围内运行强大的AI工作负载。

通过Ensemble AI的人才壮大Cloudflare AI团队

The Cloudflare Blog The Cloudflare Blog · 2026-06-15T13:00:00Z
新技术使人工智能模型在学习过程中更加精简和快速

麻省理工学院等研究团队开发的CompreSSM方法在训练过程中压缩人工智能模型,避免了传统方法的性能损失。该方法通过控制理论识别模型的重要部分,提前剔除无用组件,使模型训练更小更快。研究显示,压缩模型在图像分类任务中保持了接近原始模型的准确性,训练速度提高了1.5倍。CompreSSM为现代状态空间模型的压缩提供了理论基础,未来有望成为标准方法。

新技术使人工智能模型在学习过程中更加精简和快速

MIT News - Computer Science and Artificial Intelligence Laboratory (CSAIL) MIT News - Computer Science and Artificial Intelligence Laboratory (CSAIL) · 2026-04-09T13:00:00Z
有团队将智谱GLM-5从1.65TB压缩到241GB 256GB(内存+显存)即可在本地跑模型

智谱GLM-5模型已从1.65TB压缩至241GB,需256GB内存即可本地运行,支持256GB统一内存的Mac或24GB显存的PC。该模型在编码和聊天方面表现优异,提供更大的上下文窗口。

有团队将智谱GLM-5从1.65TB压缩到241GB 256GB(内存+显存)即可在本地跑模型

蓝点网 蓝点网 · 2026-02-13T05:50:31Z
轻量化 JavaScript 行为框架:简化 HTML 交互过程 | 开源日报 No.743

Skip 是一款用于简化 iOS 和 Android 应用开发的转译器,支持多模块管理,并与 Xcode 和 Android Studio 集成。Efficient-Computing 提供高效计算方法,支持模型压缩和自监督学习。nodejieba 是高效的中文分词库,支持多种算法。

轻量化 JavaScript 行为框架:简化 HTML 交互过程 | 开源日报 No.743

开源服务指南 开源服务指南 · 2025-09-29T07:35:34Z
演讲:大规模生成AI:它的应用、成本及如何减轻负担

马克·库尔茨讨论了大规模生成AI的现状与挑战,强调大语言模型(LLMs)在文本生成中的应用及其对企业的影响。他指出,尽管许多公司在探索LLMs,但只有少数原型能投入生产。通过使用vLLM等优化工具和模型压缩,企业可以降低成本并提高效率。成功部署依赖于准确性、速度和成本的平衡。

演讲:大规模生成AI:它的应用、成本及如何减轻负担

InfoQ InfoQ · 2025-09-08T13:30:00Z
“超级权重”:单个参数如何决定大型语言模型的行为

苹果研究人员的论文指出,少量“超级权重”在大型语言模型(LLM)中对功能影响显著。识别这些权重有助于模型压缩,提升资源受限设备的性能。研究表明,保留超级权重和激活可显著改善压缩质量,推动未来研究。

“超级权重”:单个参数如何决定大型语言模型的行为

Apple Machine Learning Research Apple Machine Learning Research · 2025-08-21T00:00:00Z
关于信息几何与模型压缩中的迭代优化:操作因子分解

深度学习模型参数不断增加,需要有效的压缩技术以适应资源有限的设备。本文探讨信息几何在模型压缩中的应用,重点分析操作因子分解。我们认为,许多成功的压缩方法隐含近似信息散度。在压缩预训练模型时,信息散度对提高零-shot准确率至关重要,而在微调时,模型的可训练性更为重要。我们证明了在软秩约束下,迭代奇异值阈值化的收敛性,并展示了通过软秩降低对现有方法的简单修改可以在固定压缩率下提高性能。

关于信息几何与模型压缩中的迭代优化:操作因子分解

Apple Machine Learning Research Apple Machine Learning Research · 2025-07-25T00:00:00Z

本研究提出了一种结构化代理蒸馏框架,旨在将大型语言模型压缩为较小的学生模型,同时保持推理准确性和一致性。实验结果显示,该方法在多个基准测试中优于传统蒸馏和模仿学习,显著提高了模型压缩率并保持了性能。

Structured Agent Distillation of Large Language Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-20T00:00:00Z

本研究提出了两种高效框架,利用模型压缩技术降低持续学习中的推理复杂度,平衡稳定性与适应性。实验结果表明,这些框架在准确性与复杂度之间取得了良好平衡,具有实际应用潜力。

Low-Complexity Inference in Continual Learning via Compressed Knowledge Transfer

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-13T00:00:00Z

本研究提出了一种安全驱动的量化框架,解决了资源受限设备上深度神经网络的模型压缩与性能保留问题。通过权重修剪和量化,优化模型复杂度,使模型大小减少60%,同时测试准确率提高2.5%。

Optimizing Deep Neural Networks with Secure Guided Self-Compression

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-01T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码