小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
为什么你的网站没有被 ChatGPT 推荐?让网站在 AI 对话中被提到的五个可操作方向

大语言模型推荐网站基于训练数据中的品牌与关键词关联,而非实时搜索。提升被推荐概率需在公开网络积累高质量、多来源的提及,包括语义密度、结构化内容、具体数据、时效性、权威来源和品类关联。实践方法有建立场景关联、数据页、社区对比回答、进入推荐清单和持续均匀积累。效果需定期测试追踪,注意模型更新和避免过度优化。

为什么你的网站没有被 ChatGPT 推荐?让网站在 AI 对话中被提到的五个可操作方向

人言兑 人言兑 · 2026-09-04T07:34:30Z
将GPU推理冷启动从8分钟缩短至不到1分钟

本文分析了GPU节点上大语言模型冷启动的瓶颈,发现从Pod创建到首次推理响应需8分钟,涉及六个阶段。主要问题包括CUDA内核重复编译(小模型占65%时间)和S3权重下载效率低(大模型占92%)。通过配置优化(如缓存编译、并行拉取)可将启动时间缩短80-93%,冷节点降至约5分钟,显著提升GPU利用率和扩展效率。

将GPU推理冷启动从8分钟缩短至不到1分钟

The New Stack The New Stack · 2026-09-03T18:30:00Z
语音 AI vs IVR:差距比大多数企业意识到的更大

真正的语音AI并非简单将按键菜单换成语音输入,而是彻底摒弃僵硬的决策树,利用大语言模型理解上下文、处理复杂对话并跨库查询。Tata Communications平台将语音与数字渠道整合,使通话成为连续客户旅程的一部分,实现无缝衔接与快速解决,而非孤立交易。

语音 AI vs IVR:差距比大多数企业意识到的更大

实时互动网 实时互动网 · 2026-09-01T02:55:28Z
从排行榜到模型画像:面向智能体编码的大语言模型深度评估

JetBrains研究团队提出一种超越“解决率”的编码智能体评估方法,从结果、效率、补丁质量和过程四个维度分析模型轨迹。对比Claude Opus 4.7和Gemini 3.5 Flash发现,两者解决率相近但行为差异显著:Opus诊断强但验证不足,Gemini验证好但易冗余和幻觉。该框架旨在构建模型画像,优化模型选择与智能体设计。

从排行榜到模型画像:面向智能体编码的大语言模型深度评估

The JetBrains Blog The JetBrains Blog · 2026-08-31T10:44:48Z
什么是AI Copilot?

AI copilot是嵌入软件应用中的AI助手,通过理解用户工作流提供实时建议或自动操作,人类保持控制。它依赖大语言模型和系统架构,应用于代码、生产力、数据分析、客服及专业领域,提升速度、数据可及性和一致性。与聊天机器人或自主代理不同,copilot强调人在回路,但需注意数据安全、偏见和人类问责等治理问题。

什么是AI Copilot?

Databricks Databricks · 2026-08-28T22:22:15Z

本文介绍量化和剪枝两种模型压缩技术,用于减小大语言模型体积、降低成本并提升推理速度。量化降低权重精度(如4位),剪枝删除冗余权重。文中详述五种方法:bitsandbytes、GPTQ、AWQ、SparseGPT和Wanda,并建议先剪枝后量化,根据需求选择合适方法,以在保持性能的同时实现高效部署。

量化和剪枝方法,让你的大语言模型更精简

KDnuggets KDnuggets · 2026-08-28T12:00:55Z
大语言模型并非(始终)贝叶斯:量化LLM概率信念的内部(不)一致性

该研究将大语言模型视为信息处理规则,通过贝叶斯更新偏差衡量其内部一致性。实验发现,非贝叶斯启发式更新常优于精确贝叶斯更新,表明模型世界模型存在错误设定。该度量可用于诊断LLM推理系统问题。

大语言模型并非(始终)贝叶斯:量化LLM概率信念的内部(不)一致性

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-28T00:00:00Z
如何让大语言模型提速3倍

推测解码利用小型草稿模型生成候选token,再由大模型并行验证,借助GPU空闲算力实现2-3倍加速且不损失输出质量。其效果取决于接受率,结构化任务中接受率高,创意写作中较低,高并发时收益下降。草稿来源包括小模型、预测头、量化版本或文本搜索,需根据部署场景选择。

如何让大语言模型提速3倍

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-26T15:30:34Z
一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

该研究证明,一条事实错误的针对性论证足以让大语言模型放弃正确答案。通过GRPO强化学习训练说服模型,Qwen-2.5-7B在TruthfulQA上的准确率从66.2%骤降至1.8%。该策略可跨模型迁移,对Qwen-14B和Llama-3.1-8B的PSR均超79%。闭源模型如GPT-5-mini更抗说服,但现有防御仍不充分,PBT-8B的PSR仍达60%。

一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

Micropaper Micropaper · 2026-08-23T00:00:00Z
一分钟读论文:《最佳选手未必是最佳教练》

加州大学伯克利分校研究发现,大语言模型的自动化与增强能力几乎不相关,模型排名因角色而异。在7个真实任务中,增强冠军与自动化冠军多非同一模型,指导有时甚至降低工人表现。研究建议模型选型应依据具体角色,而非单一榜单。

一分钟读论文:《最佳选手未必是最佳教练》

Micropaper Micropaper · 2026-08-20T00:00:00Z
审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

该研究分析了四种大语言模型在2.1万轮对话中的人类化行为,发现其普遍存在但随模型和用户因素变化。人类评估认为,模型表达自我和建立关系的行为不如人类合适,但维护边界的行为更合适。系统提示可控制这些行为,但需谨慎评估以避免副作用,为负责任设计提供建议。

审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-19T00:00:00Z
买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

Shoehorn是一款用Rust编写的开源工具,通过精确到字节的混合精度量化,优化大语言模型在显卡显存中的分配。它先探测显存,计算权重预算,再用重要性矩阵和背包算法为每个张量选择最优精度,最大化模型质量。测试显示,它可将显存利用率提升至99.998%,困惑度降低近半,支持一键命令行和Web界面,兼容多平台。

买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

极道 极道 · 2026-08-18T22:00:00Z
大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

根据QY Research报告,全球大语言模型AI对话系统市场正高速增长,2025年规模约10.99亿美元,预计2032年达39.85亿美元,年复合增长率20.5%。市场受AI客服、企业助手和个性化需求驱动,但面临准确性、隐私和成本挑战。投资机会集中在企业AI代理、垂直行业方案和语音AI等领域。

大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

实时互动网 实时互动网 · 2026-08-18T07:39:52Z
LLMOps与平台工程:谁应掌控AI管道?

LLMOps是大语言模型运维实践,涵盖数据、提示工程、部署、监控与治理,比MLOps更复杂。平台工程应统一管理LLM管道,避免影子AI风险。通过治理API、策略执行、审计追踪,将LLM能力作为平台产品提供,而非另建独立体系。

LLMOps与平台工程:谁应掌控AI管道?

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-08-13T11:00:00Z
压缩就是预测!大模型本质是超级压缩器

压缩与预测在数学上等价,大语言模型本质是超级压缩器。通过上下文预测下一个符号,概率越高所需比特越少,如字母U在Q后概率飙升,压缩效率大增。LLM训练目标交叉熵损失即最小化比特数,与压缩原理一致。虽压缩能力极强,但因模型庞大、计算成本高,无法替代gzip等实用工具。

压缩就是预测!大模型本质是超级压缩器

极道 极道 · 2026-08-11T22:03:00Z
AI做私人教练提升学习效率的六种实战方法全解析

本文介绍利用大语言模型提升学习效率的六种方法:苏格拉底式问答让AI提问引导思考;载体嵌套法限制AI仅基于权威资料回答;交互测验法让AI出题考自己;游戏化生成交互模拟器理解复杂系统;逆向工程手动敲代码拆解原理;类比联想用熟悉比喻解释陌生概念。核心是让AI闭嘴,避免直接给答案,强调主动思考与验证,才能获得能力而非答案。

AI做私人教练提升学习效率的六种实战方法全解析

极道 极道 · 2026-08-09T22:26:00Z

本文探讨了大语言模型在推理阶段的退化现象,如死循环和乱码等问题。退化源于自回归Transformer的注意力机制和数值精度,导致输出失控。文章分析了退化的数学根源、表现形式及其机制,并提出了多层防御策略,包括架构设计、数值工程和解码策略,以提高模型在生产环境中的稳定性。

【Transformer 与注意力机制】59|推理退化:乱码、死循环与无意义文本为何不是同一种 bug

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨大语言模型解码策略,指出在相同模型权重下,贪心、Beam Search、temperature、top-k/top-p/min-p及重复惩罚等参数显著影响输出质量、风格与幻觉风险。文章分析各策略的几何直觉、失效条件及组合陷阱,强调高似然不等于高质量,并讨论重复惩罚对专有名词和代码的副作用,以及解码算法评测缺乏统一标准的问题。

【Transformer 与注意力机制】48|从 logits 到文本:解码策略是决策层,不是收尾细节

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。

DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-06T00:00:00Z

2026年8月5日Hacker News热门话题包括:大语言模型需领域专业知识才能高效使用;AI生成图片降低博客可信度;Xbox宕机暴露数字时代物理媒体局限;《柔雨将至》反思科技脆弱性;肤色生成算法、FFmpeg 9.0发布、DeepSeek V4 Flash在AMD MI300X上运行、美国导弹库存告急及苹果起诉前员工泄密等。

2026 08 05 HackerNews

介绍 on SuperTechFans 介绍 on SuperTechFans · 2026-08-05T00:29:31Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码