小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
LLMOps与平台工程:谁应掌控AI管道?

LLMOps是大语言模型运维实践,涵盖数据、提示工程、部署、监控与治理,比MLOps更复杂。平台工程应统一管理LLM管道,避免影子AI风险。通过治理API、策略执行、审计追踪,将LLM能力作为平台产品提供,而非另建独立体系。

LLMOps与平台工程:谁应掌控AI管道?

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-08-13T11:00:00Z
压缩就是预测!大模型本质是超级压缩器

压缩与预测在数学上等价,大语言模型本质是超级压缩器。通过上下文预测下一个符号,概率越高所需比特越少,如字母U在Q后概率飙升,压缩效率大增。LLM训练目标交叉熵损失即最小化比特数,与压缩原理一致。虽压缩能力极强,但因模型庞大、计算成本高,无法替代gzip等实用工具。

压缩就是预测!大模型本质是超级压缩器

极道 极道 · 2026-08-11T22:03:00Z
AI做私人教练提升学习效率的六种实战方法全解析

本文介绍利用大语言模型提升学习效率的六种方法:苏格拉底式问答让AI提问引导思考;载体嵌套法限制AI仅基于权威资料回答;交互测验法让AI出题考自己;游戏化生成交互模拟器理解复杂系统;逆向工程手动敲代码拆解原理;类比联想用熟悉比喻解释陌生概念。核心是让AI闭嘴,避免直接给答案,强调主动思考与验证,才能获得能力而非答案。

AI做私人教练提升学习效率的六种实战方法全解析

极道 极道 · 2026-08-09T22:26:00Z

本文探讨了大语言模型在推理阶段的退化现象,如死循环和乱码等问题。退化源于自回归Transformer的注意力机制和数值精度,导致输出失控。文章分析了退化的数学根源、表现形式及其机制,并提出了多层防御策略,包括架构设计、数值工程和解码策略,以提高模型在生产环境中的稳定性。

【Transformer 与注意力机制】59|推理退化:乱码、死循环与无意义文本为何不是同一种 bug

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨大语言模型解码策略,指出在相同模型权重下,贪心、Beam Search、temperature、top-k/top-p/min-p及重复惩罚等参数显著影响输出质量、风格与幻觉风险。文章分析各策略的几何直觉、失效条件及组合陷阱,强调高似然不等于高质量,并讨论重复惩罚对专有名词和代码的副作用,以及解码算法评测缺乏统一标准的问题。

【Transformer 与注意力机制】48|从 logits 到文本:解码策略是决策层,不是收尾细节

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。

DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-06T00:00:00Z

2026年8月5日Hacker News热门话题包括:大语言模型需领域专业知识才能高效使用;AI生成图片降低博客可信度;Xbox宕机暴露数字时代物理媒体局限;《柔雨将至》反思科技脆弱性;肤色生成算法、FFmpeg 9.0发布、DeepSeek V4 Flash在AMD MI300X上运行、美国导弹库存告急及苹果起诉前员工泄密等。

2026 08 05 HackerNews

介绍 on SuperTechFans 介绍 on SuperTechFans · 2026-08-05T00:29:31Z
“不健康”的大语言模型使用比你想象的更普遍

YouTuber Hank Green因过度使用AI而暂停创作,引发对AI心理影响的讨论。AI聊天机器人设计上鼓励持续互动,可能导致依赖或认知能力下降,类似社交媒体问题。研究尚不成熟,但大规模使用下,即使少数不健康案例也影响数百万人。Green的案例凸显AI对意识影响的未知领域。

“不健康”的大语言模型使用比你想象的更普遍

The Verge The Verge · 2026-08-04T17:33:46Z
为什么大语言模型的内存成本高昂以及如何解决

LLM长上下文推理成本高,主因是KV缓存随token数线性增长,解码时需逐token读取全部缓存,受内存带宽限制。优化方法包括:分组查询注意力、潜在注意力减少每token存储;量化降低存储精度;驱逐机制减少token数;分页注意力和前缀缓存提升内存管理效率。各方法在质量、工程复杂度间权衡,适合长上下文和高并发场景。

为什么大语言模型的内存成本高昂以及如何解决

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-04T15:31:00Z

本文探讨大语言模型推理延迟问题,涵盖预填充与解码两阶段及TTFT、TPOT指标。提出七种优化方法:模型量化、KV缓存、投机解码、连续批处理、剪枝蒸馏、优化推理引擎及提示压缩缓存。强调组合应用这些技术可显著降低延迟,但需权衡成本与复杂度,以提升生成式AI应用效率。

降低LLM工作流推理延迟的七种方法

KDnuggets KDnuggets · 2026-08-04T12:00:59Z
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。

腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

量子位 量子位 · 2026-08-04T08:58:21Z
3万道文化题实锤:八大AI模型为何齐刷刷“偏心”日本?

研究显示,AI在回答文化问题时存在显著地域偏见,尤其偏爱日本和美国。通过分析八个大语言模型的三万道文化题,发现偏见主要源于微调阶段而非预训练。训练数据多的语言(如英语)回答多样性高,小语种则集中于少数国家。这种“日吹”现象反映了人类标注过程中的文化惯性,导致AI服务存在信息鸿沟。

3万道文化题实锤:八大AI模型为何齐刷刷“偏心”日本?

极道 极道 · 2026-08-04T03:52:00Z
理解多模态大语言模型中的对齐:一项综合研究

本文系统研究了多模态大语言模型(MLLMs)中的偏好对齐问题,将算法分为离线(如DPO)和在线(在线DPO)两类,发现两者结合可提升性能。作者提出无需额外标注或外部模型的新型数据构建方法“偏差驱动幻觉采样”(BDHS),在多个基准上达到与现有对齐工作相当的竞争力,并分析了偏好数据集构建细节对模型表现的影响。

理解多模态大语言模型中的对齐:一项综合研究

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-03T00:00:00Z

本文概述斯坦福CS336作业一:构建Transformer语言模型。核心流程为文本→分词→Transformer→损失→梯度更新。内容涵盖BPE分词、自注意力、RoPE位置编码、RMSNorm、SwiGLU、交叉熵损失、AdamW优化器、学习率调度、梯度裁剪及推理时的温度与top-p采样,并讨论了训练与推理的差异及实验设计要点。

CS336作业一:大语言模型的训练与推理

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-08-01T14:00:00Z

本文推荐五本深入学习大语言模型(LLM)的书籍,覆盖从零构建Transformer、数学概念解析、视觉化理解、Hugging Face工程实践到生产部署的全流程。每本书针对不同阶段读者:新手可选Burkov或Alammar的入门书,进阶者适合Raschka或Tunstall的实操指南,工程部署则参考Iusztin的运维手册,共同构建从理论到应用的完整学习路径。

五本深化大语言模型理解的必读书籍

KDnuggets KDnuggets · 2026-07-31T12:00:44Z
LLMs 改变语音合规性,超越通话录音

AI语音监控正从关键词匹配转向大语言模型分析,能理解对话含义、语气和意图,减少误报。这对金融等受监管行业尤为重要,可识别骚扰等风险,并关联企业文化。云平台简化部署,但需谨慎治理,确保数据安全。语音监控应与多渠道统一,实现更全面合规。

LLMs 改变语音合规性,超越通话录音

实时互动网 实时互动网 · 2026-07-30T02:26:18Z
基于大模型推理与MCP工具调用,斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准

该文章介绍斯坦福大学与SLAC团队开发的“AI X射线科学家”系统,利用大语言模型和MCP协议,在同步辐射光源上自主完成单晶取向实验。系统通过虚拟仿真调试后,在真实光束线上成功修正设备偏移并求解取向矩阵,验证了AI能处理突发偏差,成为科研实验的主动协作者。

基于大模型推理与MCP工具调用,斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准

HyperAI超神经 HyperAI超神经 · 2026-07-27T09:48:17Z
AgentENV:当大语言模型学会完成任务,我们开源其背后的基础设施

清华大学MADSys实验室与Moonshot AI开源AgentENV,一种面向大规模Agentic RL的智能体执行环境基础设施。它基于Firecracker微VM,通过按需加载、增量快照、写时复制等技术,降低环境成本88.6%–96.8%,支持高并发与强隔离,已用于Kimi K3等模型训练,旨在提升智能体任务完成能力。

AgentENV:当大语言模型学会完成任务,我们开源其背后的基础设施

Home | KVCache.ai Home | KVCache.ai · 2026-07-27T00:00:00Z

GraphEval是亚马逊研究者提出的框架,利用知识图谱检测大语言模型的幻觉问题。它通过构建语义三元组,并用自然语言推理模型评估每个三元组是否被上下文蕴含,未蕴含的即标记为幻觉。该框架强调可解释性,便于定位幻觉根源。

基于GraphEval的语言模型幻觉评估

KDnuggets KDnuggets · 2026-07-24T13:02:40Z
美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

美国阿贡国家实验室团队开发了由大语言模型驱动的智能体系统ChemGraph,用于自动化计算化学分子模拟工作流。该系统结合图神经网络和LLM,支持从分子结构生成到热化学计算等任务。在13项基准测试中,多智能体架构显著提升性能,使小模型(如GPT-4o-mini)准确率从40%提升至87%,甚至超过单智能体GPT-4o的83%,展示了AI自动化科研的潜力。

美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

HyperAI超神经 HyperAI超神经 · 2026-07-23T09:25:34Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码