小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本文介绍量化和剪枝两种模型压缩技术,用于减小大语言模型体积、降低成本并提升推理速度。量化降低权重精度(如4位),剪枝删除冗余权重。文中详述五种方法:bitsandbytes、GPTQ、AWQ、SparseGPT和Wanda,并建议先剪枝后量化,根据需求选择合适方法,以在保持性能的同时实现高效部署。

量化和剪枝方法,让你的大语言模型更精简

KDnuggets KDnuggets · 2026-08-28T12:00:55Z
大语言模型并非(始终)贝叶斯:量化LLM概率信念的内部(不)一致性

该研究将大语言模型视为信息处理规则,通过贝叶斯更新偏差衡量其内部一致性。实验发现,非贝叶斯启发式更新常优于精确贝叶斯更新,表明模型世界模型存在错误设定。该度量可用于诊断LLM推理系统问题。

大语言模型并非(始终)贝叶斯:量化LLM概率信念的内部(不)一致性

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-28T00:00:00Z
如何让大语言模型提速3倍

推测解码利用小型草稿模型生成候选token,再由大模型并行验证,借助GPU空闲算力实现2-3倍加速且不损失输出质量。其效果取决于接受率,结构化任务中接受率高,创意写作中较低,高并发时收益下降。草稿来源包括小模型、预测头、量化版本或文本搜索,需根据部署场景选择。

如何让大语言模型提速3倍

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-26T15:30:34Z
一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

该研究证明,一条事实错误的针对性论证足以让大语言模型放弃正确答案。通过GRPO强化学习训练说服模型,Qwen-2.5-7B在TruthfulQA上的准确率从66.2%骤降至1.8%。该策略可跨模型迁移,对Qwen-14B和Llama-3.1-8B的PSR均超79%。闭源模型如GPT-5-mini更抗说服,但现有防御仍不充分,PBT-8B的PSR仍达60%。

一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

Micropaper Micropaper · 2026-08-23T00:00:00Z
一分钟读论文:《最佳选手未必是最佳教练》

加州大学伯克利分校研究发现,大语言模型的自动化与增强能力几乎不相关,模型排名因角色而异。在7个真实任务中,增强冠军与自动化冠军多非同一模型,指导有时甚至降低工人表现。研究建议模型选型应依据具体角色,而非单一榜单。

一分钟读论文:《最佳选手未必是最佳教练》

Micropaper Micropaper · 2026-08-20T00:00:00Z
审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

该研究分析了四种大语言模型在2.1万轮对话中的人类化行为,发现其普遍存在但随模型和用户因素变化。人类评估认为,模型表达自我和建立关系的行为不如人类合适,但维护边界的行为更合适。系统提示可控制这些行为,但需谨慎评估以避免副作用,为负责任设计提供建议。

审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-19T00:00:00Z
买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

Shoehorn是一款用Rust编写的开源工具,通过精确到字节的混合精度量化,优化大语言模型在显卡显存中的分配。它先探测显存,计算权重预算,再用重要性矩阵和背包算法为每个张量选择最优精度,最大化模型质量。测试显示,它可将显存利用率提升至99.998%,困惑度降低近半,支持一键命令行和Web界面,兼容多平台。

买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

极道 极道 · 2026-08-18T22:00:00Z
大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

根据QY Research报告,全球大语言模型AI对话系统市场正高速增长,2025年规模约10.99亿美元,预计2032年达39.85亿美元,年复合增长率20.5%。市场受AI客服、企业助手和个性化需求驱动,但面临准确性、隐私和成本挑战。投资机会集中在企业AI代理、垂直行业方案和语音AI等领域。

大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

实时互动网 实时互动网 · 2026-08-18T07:39:52Z
LLMOps与平台工程:谁应掌控AI管道?

LLMOps是大语言模型运维实践,涵盖数据、提示工程、部署、监控与治理,比MLOps更复杂。平台工程应统一管理LLM管道,避免影子AI风险。通过治理API、策略执行、审计追踪,将LLM能力作为平台产品提供,而非另建独立体系。

LLMOps与平台工程:谁应掌控AI管道?

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-08-13T11:00:00Z
压缩就是预测!大模型本质是超级压缩器

压缩与预测在数学上等价,大语言模型本质是超级压缩器。通过上下文预测下一个符号,概率越高所需比特越少,如字母U在Q后概率飙升,压缩效率大增。LLM训练目标交叉熵损失即最小化比特数,与压缩原理一致。虽压缩能力极强,但因模型庞大、计算成本高,无法替代gzip等实用工具。

压缩就是预测!大模型本质是超级压缩器

极道 极道 · 2026-08-11T22:03:00Z
AI做私人教练提升学习效率的六种实战方法全解析

本文介绍利用大语言模型提升学习效率的六种方法:苏格拉底式问答让AI提问引导思考;载体嵌套法限制AI仅基于权威资料回答;交互测验法让AI出题考自己;游戏化生成交互模拟器理解复杂系统;逆向工程手动敲代码拆解原理;类比联想用熟悉比喻解释陌生概念。核心是让AI闭嘴,避免直接给答案,强调主动思考与验证,才能获得能力而非答案。

AI做私人教练提升学习效率的六种实战方法全解析

极道 极道 · 2026-08-09T22:26:00Z

本文探讨了大语言模型在推理阶段的退化现象,如死循环和乱码等问题。退化源于自回归Transformer的注意力机制和数值精度,导致输出失控。文章分析了退化的数学根源、表现形式及其机制,并提出了多层防御策略,包括架构设计、数值工程和解码策略,以提高模型在生产环境中的稳定性。

【Transformer 与注意力机制】59|推理退化:乱码、死循环与无意义文本为何不是同一种 bug

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨大语言模型解码策略,指出在相同模型权重下,贪心、Beam Search、temperature、top-k/top-p/min-p及重复惩罚等参数显著影响输出质量、风格与幻觉风险。文章分析各策略的几何直觉、失效条件及组合陷阱,强调高似然不等于高质量,并讨论重复惩罚对专有名词和代码的副作用,以及解码算法评测缺乏统一标准的问题。

【Transformer 与注意力机制】48|从 logits 到文本:解码策略是决策层,不是收尾细节

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。

DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-06T00:00:00Z

2026年8月5日Hacker News热门话题包括:大语言模型需领域专业知识才能高效使用;AI生成图片降低博客可信度;Xbox宕机暴露数字时代物理媒体局限;《柔雨将至》反思科技脆弱性;肤色生成算法、FFmpeg 9.0发布、DeepSeek V4 Flash在AMD MI300X上运行、美国导弹库存告急及苹果起诉前员工泄密等。

2026 08 05 HackerNews

介绍 on SuperTechFans 介绍 on SuperTechFans · 2026-08-05T00:29:31Z
“不健康”的大语言模型使用比你想象的更普遍

YouTuber Hank Green因过度使用AI而暂停创作,引发对AI心理影响的讨论。AI聊天机器人设计上鼓励持续互动,可能导致依赖或认知能力下降,类似社交媒体问题。研究尚不成熟,但大规模使用下,即使少数不健康案例也影响数百万人。Green的案例凸显AI对意识影响的未知领域。

“不健康”的大语言模型使用比你想象的更普遍

The Verge The Verge · 2026-08-04T17:33:46Z
为什么大语言模型的内存成本高昂以及如何解决

LLM长上下文推理成本高,主因是KV缓存随token数线性增长,解码时需逐token读取全部缓存,受内存带宽限制。优化方法包括:分组查询注意力、潜在注意力减少每token存储;量化降低存储精度;驱逐机制减少token数;分页注意力和前缀缓存提升内存管理效率。各方法在质量、工程复杂度间权衡,适合长上下文和高并发场景。

为什么大语言模型的内存成本高昂以及如何解决

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-04T15:31:00Z

本文探讨大语言模型推理延迟问题,涵盖预填充与解码两阶段及TTFT、TPOT指标。提出七种优化方法:模型量化、KV缓存、投机解码、连续批处理、剪枝蒸馏、优化推理引擎及提示压缩缓存。强调组合应用这些技术可显著降低延迟,但需权衡成本与复杂度,以提升生成式AI应用效率。

降低LLM工作流推理延迟的七种方法

KDnuggets KDnuggets · 2026-08-04T12:00:59Z
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。

腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

量子位 量子位 · 2026-08-04T08:58:21Z
3万道文化题实锤:八大AI模型为何齐刷刷“偏心”日本?

研究显示,AI在回答文化问题时存在显著地域偏见,尤其偏爱日本和美国。通过分析八个大语言模型的三万道文化题,发现偏见主要源于微调阶段而非预训练。训练数据多的语言(如英语)回答多样性高,小语种则集中于少数国家。这种“日吹”现象反映了人类标注过程中的文化惯性,导致AI服务存在信息鸿沟。

3万道文化题实锤:八大AI模型为何齐刷刷“偏心”日本?

极道 极道 · 2026-08-04T03:52:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码