小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
一分钟读论文:《最佳选手未必是最佳教练》

加州大学伯克利分校研究发现,大语言模型的自动化与增强能力几乎不相关,模型排名因角色而异。在7个真实任务中,增强冠军与自动化冠军多非同一模型,指导有时甚至降低工人表现。研究建议模型选型应依据具体角色,而非单一榜单。

一分钟读论文:《最佳选手未必是最佳教练》

Micropaper Micropaper · 2026-08-20T00:00:00Z
审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

该研究分析了四种大语言模型在2.1万轮对话中的人类化行为,发现其普遍存在但随模型和用户因素变化。人类评估认为,模型表达自我和建立关系的行为不如人类合适,但维护边界的行为更合适。系统提示可控制这些行为,但需谨慎评估以避免副作用,为负责任设计提供建议。

审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-19T00:00:00Z
买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

Shoehorn是一款用Rust编写的开源工具,通过精确到字节的混合精度量化,优化大语言模型在显卡显存中的分配。它先探测显存,计算权重预算,再用重要性矩阵和背包算法为每个张量选择最优精度,最大化模型质量。测试显示,它可将显存利用率提升至99.998%,困惑度降低近半,支持一键命令行和Web界面,兼容多平台。

买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

极道 极道 · 2026-08-18T22:00:00Z
大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

根据QY Research报告,全球大语言模型AI对话系统市场正高速增长,2025年规模约10.99亿美元,预计2032年达39.85亿美元,年复合增长率20.5%。市场受AI客服、企业助手和个性化需求驱动,但面临准确性、隐私和成本挑战。投资机会集中在企业AI代理、垂直行业方案和语音AI等领域。

大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

实时互动网 实时互动网 · 2026-08-18T07:39:52Z
LLMOps与平台工程:谁应掌控AI管道?

LLMOps是大语言模型运维实践,涵盖数据、提示工程、部署、监控与治理,比MLOps更复杂。平台工程应统一管理LLM管道,避免影子AI风险。通过治理API、策略执行、审计追踪,将LLM能力作为平台产品提供,而非另建独立体系。

LLMOps与平台工程:谁应掌控AI管道?

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-08-13T11:00:00Z
压缩就是预测!大模型本质是超级压缩器

压缩与预测在数学上等价,大语言模型本质是超级压缩器。通过上下文预测下一个符号,概率越高所需比特越少,如字母U在Q后概率飙升,压缩效率大增。LLM训练目标交叉熵损失即最小化比特数,与压缩原理一致。虽压缩能力极强,但因模型庞大、计算成本高,无法替代gzip等实用工具。

压缩就是预测!大模型本质是超级压缩器

极道 极道 · 2026-08-11T22:03:00Z
AI做私人教练提升学习效率的六种实战方法全解析

本文介绍利用大语言模型提升学习效率的六种方法:苏格拉底式问答让AI提问引导思考;载体嵌套法限制AI仅基于权威资料回答;交互测验法让AI出题考自己;游戏化生成交互模拟器理解复杂系统;逆向工程手动敲代码拆解原理;类比联想用熟悉比喻解释陌生概念。核心是让AI闭嘴,避免直接给答案,强调主动思考与验证,才能获得能力而非答案。

AI做私人教练提升学习效率的六种实战方法全解析

极道 极道 · 2026-08-09T22:26:00Z

本文探讨了大语言模型在推理阶段的退化现象,如死循环和乱码等问题。退化源于自回归Transformer的注意力机制和数值精度,导致输出失控。文章分析了退化的数学根源、表现形式及其机制,并提出了多层防御策略,包括架构设计、数值工程和解码策略,以提高模型在生产环境中的稳定性。

【Transformer 与注意力机制】59|推理退化:乱码、死循环与无意义文本为何不是同一种 bug

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨大语言模型解码策略,指出在相同模型权重下,贪心、Beam Search、temperature、top-k/top-p/min-p及重复惩罚等参数显著影响输出质量、风格与幻觉风险。文章分析各策略的几何直觉、失效条件及组合陷阱,强调高似然不等于高质量,并讨论重复惩罚对专有名词和代码的副作用,以及解码算法评测缺乏统一标准的问题。

【Transformer 与注意力机制】48|从 logits 到文本:解码策略是决策层,不是收尾细节

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。

DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-06T00:00:00Z

2026年8月5日Hacker News热门话题包括:大语言模型需领域专业知识才能高效使用;AI生成图片降低博客可信度;Xbox宕机暴露数字时代物理媒体局限;《柔雨将至》反思科技脆弱性;肤色生成算法、FFmpeg 9.0发布、DeepSeek V4 Flash在AMD MI300X上运行、美国导弹库存告急及苹果起诉前员工泄密等。

2026 08 05 HackerNews

介绍 on SuperTechFans 介绍 on SuperTechFans · 2026-08-05T00:29:31Z
“不健康”的大语言模型使用比你想象的更普遍

YouTuber Hank Green因过度使用AI而暂停创作,引发对AI心理影响的讨论。AI聊天机器人设计上鼓励持续互动,可能导致依赖或认知能力下降,类似社交媒体问题。研究尚不成熟,但大规模使用下,即使少数不健康案例也影响数百万人。Green的案例凸显AI对意识影响的未知领域。

“不健康”的大语言模型使用比你想象的更普遍

The Verge The Verge · 2026-08-04T17:33:46Z
为什么大语言模型的内存成本高昂以及如何解决

LLM长上下文推理成本高,主因是KV缓存随token数线性增长,解码时需逐token读取全部缓存,受内存带宽限制。优化方法包括:分组查询注意力、潜在注意力减少每token存储;量化降低存储精度;驱逐机制减少token数;分页注意力和前缀缓存提升内存管理效率。各方法在质量、工程复杂度间权衡,适合长上下文和高并发场景。

为什么大语言模型的内存成本高昂以及如何解决

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-04T15:31:00Z

本文探讨大语言模型推理延迟问题,涵盖预填充与解码两阶段及TTFT、TPOT指标。提出七种优化方法:模型量化、KV缓存、投机解码、连续批处理、剪枝蒸馏、优化推理引擎及提示压缩缓存。强调组合应用这些技术可显著降低延迟,但需权衡成本与复杂度,以提升生成式AI应用效率。

降低LLM工作流推理延迟的七种方法

KDnuggets KDnuggets · 2026-08-04T12:00:59Z
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。

腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

量子位 量子位 · 2026-08-04T08:58:21Z
3万道文化题实锤:八大AI模型为何齐刷刷“偏心”日本?

研究显示,AI在回答文化问题时存在显著地域偏见,尤其偏爱日本和美国。通过分析八个大语言模型的三万道文化题,发现偏见主要源于微调阶段而非预训练。训练数据多的语言(如英语)回答多样性高,小语种则集中于少数国家。这种“日吹”现象反映了人类标注过程中的文化惯性,导致AI服务存在信息鸿沟。

3万道文化题实锤:八大AI模型为何齐刷刷“偏心”日本?

极道 极道 · 2026-08-04T03:52:00Z
理解多模态大语言模型中的对齐:一项综合研究

本文系统研究了多模态大语言模型(MLLMs)中的偏好对齐问题,将算法分为离线(如DPO)和在线(在线DPO)两类,发现两者结合可提升性能。作者提出无需额外标注或外部模型的新型数据构建方法“偏差驱动幻觉采样”(BDHS),在多个基准上达到与现有对齐工作相当的竞争力,并分析了偏好数据集构建细节对模型表现的影响。

理解多模态大语言模型中的对齐:一项综合研究

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-03T00:00:00Z

本文概述斯坦福CS336作业一:构建Transformer语言模型。核心流程为文本→分词→Transformer→损失→梯度更新。内容涵盖BPE分词、自注意力、RoPE位置编码、RMSNorm、SwiGLU、交叉熵损失、AdamW优化器、学习率调度、梯度裁剪及推理时的温度与top-p采样,并讨论了训练与推理的差异及实验设计要点。

CS336作业一:大语言模型的训练与推理

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-08-01T14:00:00Z

本文推荐五本深入学习大语言模型(LLM)的书籍,覆盖从零构建Transformer、数学概念解析、视觉化理解、Hugging Face工程实践到生产部署的全流程。每本书针对不同阶段读者:新手可选Burkov或Alammar的入门书,进阶者适合Raschka或Tunstall的实操指南,工程部署则参考Iusztin的运维手册,共同构建从理论到应用的完整学习路径。

五本深化大语言模型理解的必读书籍

KDnuggets KDnuggets · 2026-07-31T12:00:44Z
LLMs 改变语音合规性,超越通话录音

AI语音监控正从关键词匹配转向大语言模型分析,能理解对话含义、语气和意图,减少误报。这对金融等受监管行业尤为重要,可识别骚扰等风险,并关联企业文化。云平台简化部署,但需谨慎治理,确保数据安全。语音监控应与多渠道统一,实现更全面合规。

LLMs 改变语音合规性,超越通话录音

实时互动网 实时互动网 · 2026-07-30T02:26:18Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码