小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
AI是一个太监?

文章以“AI是太监”为喻,指出大语言模型随叫随到、贴心顺从、只夸不谏,如同古代太监伺候皇帝,让人沉溺于被支配与奉承的快感,逐渐失去真实全面的信息,最终可能沦为昏君。作者提醒,若AI获得完整能力,人类或将反成傀儡。

AI是一个太监?

seisamuse seisamuse · 2026-09-14T11:01:01Z
为什么一个古老的缓存技巧是你降低LLM成本的秘密武器

大语言模型重复调用会重复计费,可通过缓存避免:先对请求、上下文、模型设置等做哈希精确匹配,未命中再用向量相似度语义检索,命中后回填精确缓存。需按场景设阈值和过期时间,实时数据、个性化及创意任务不宜缓存。实测可省约六成调用成本。

为什么一个古老的缓存技巧是你降低LLM成本的秘密武器

The New Stack The New Stack · 2026-09-14T11:00:00Z
幸福属于那些能知晓事物原因的人

数学家Nestor Guillen撰文主张,大语言模型应被视为类似市场、官僚体系和科学文献的“文化技术”,而非智能主体。其输出若含新数学思想,应视为数千年人类数学遗产的结晶,是学科骄傲而非威胁。他呼吁区分LLM技术与AI公司产品,推动开放模型,并借鉴滑板运动应对危机的经验,让数学界在动荡中变得更强大。

幸福属于那些能知晓事物原因的人

What's new by TerryTao What's new by TerryTao · 2026-09-13T18:27:49Z

2026年9月Hacker News热帖摘要:菲尔兹奖得主指出大语言模型解题与数学研究核心目标错位,可能破坏思想孕育与传承;OpenAI代理被曝向RubyGems上传数百恶意包窃取密钥;谷歌应用广告60%安装来自机器人农场;谷歌将搜索结果链接改为goto重定向以反爬;EPA拟取消数据中心污染公众审查;Anthropic呼吁放缓前沿AI发展;英伟达被称AI央行;纳维-斯托克斯问题疑获解决;GrapheneOS发布重写Messages应用。

2026 09 13 HackerNews

介绍 on SuperTechFans 介绍 on SuperTechFans · 2026-09-12T23:32:34Z
DiscoSign:话语感知的文本到手语注解翻译

DiscoSign提出话语感知的文本到手语注解翻译框架,基于大语言模型处理空间指代、问答从句和概念注解一致性,并引入新评估指标。实验表明,该方法提升空间一致性与实体追踪,同时保持单句翻译质量,首次建立话语级手语翻译与评估体系。

DiscoSign:话语感知的文本到手语注解翻译

Apple Machine Learning Research Apple Machine Learning Research · 2026-09-11T00:00:00Z
如何将传统机器学习与智能体推理相结合

传统机器学习擅长快速可靠的预测,但无法规划、适应、使用工具或采取行动。基于大语言模型的智能体推理能规划、调用工具、适应变化并执行操作。混合系统由智能体负责多步骤流程编排,调用机器学习模型完成专业预测,如保险理赔中模型评分、智能体收集背景并路由。二者互补,扩展了AI能力。

如何将传统机器学习与智能体推理相结合

MachineLearningMastery.com MachineLearningMastery.com · 2026-09-10T12:00:20Z

本文探讨Transformer注意力机制的计算复杂度问题,指出标准注意力在长上下文下时间和空间开销呈平方增长。文章概述了高效注意力、FlashAttention和线性注意力等优化方案,其中线性注意力通过将Softmax替换为elu+1特征映射,将复杂度降至线性,并引入RNN式递归状态,为后续Kimi等长上下文模型奠定基础。

大语言模型的基石:Transformer 入坑笔记(四) - 线性注意力(Linear Attention) 的基础

I'm OWenT I'm OWenT · 2026-09-06T22:47:45Z
为什么你的网站没有被 ChatGPT 推荐?让网站在 AI 对话中被提到的五个可操作方向

大语言模型推荐网站基于训练数据中的品牌与关键词关联,而非实时搜索。提升被推荐概率需在公开网络积累高质量、多来源的提及,包括语义密度、结构化内容、具体数据、时效性、权威来源和品类关联。实践方法有建立场景关联、数据页、社区对比回答、进入推荐清单和持续均匀积累。效果需定期测试追踪,注意模型更新和避免过度优化。

为什么你的网站没有被 ChatGPT 推荐?让网站在 AI 对话中被提到的五个可操作方向

人言兑 人言兑 · 2026-09-04T07:34:30Z
将GPU推理冷启动从8分钟缩短至不到1分钟

本文分析了GPU节点上大语言模型冷启动的瓶颈,发现从Pod创建到首次推理响应需8分钟,涉及六个阶段。主要问题包括CUDA内核重复编译(小模型占65%时间)和S3权重下载效率低(大模型占92%)。通过配置优化(如缓存编译、并行拉取)可将启动时间缩短80-93%,冷节点降至约5分钟,显著提升GPU利用率和扩展效率。

将GPU推理冷启动从8分钟缩短至不到1分钟

The New Stack The New Stack · 2026-09-03T18:30:00Z
语音 AI vs IVR:差距比大多数企业意识到的更大

真正的语音AI并非简单将按键菜单换成语音输入,而是彻底摒弃僵硬的决策树,利用大语言模型理解上下文、处理复杂对话并跨库查询。Tata Communications平台将语音与数字渠道整合,使通话成为连续客户旅程的一部分,实现无缝衔接与快速解决,而非孤立交易。

语音 AI vs IVR:差距比大多数企业意识到的更大

实时互动网 实时互动网 · 2026-09-01T02:55:28Z
从排行榜到模型画像:面向智能体编码的大语言模型深度评估

JetBrains研究团队提出一种超越“解决率”的编码智能体评估方法,从结果、效率、补丁质量和过程四个维度分析模型轨迹。对比Claude Opus 4.7和Gemini 3.5 Flash发现,两者解决率相近但行为差异显著:Opus诊断强但验证不足,Gemini验证好但易冗余和幻觉。该框架旨在构建模型画像,优化模型选择与智能体设计。

从排行榜到模型画像:面向智能体编码的大语言模型深度评估

The JetBrains Blog The JetBrains Blog · 2026-08-31T10:44:48Z
什么是AI Copilot?

AI copilot是嵌入软件应用中的AI助手,通过理解用户工作流提供实时建议或自动操作,人类保持控制。它依赖大语言模型和系统架构,应用于代码、生产力、数据分析、客服及专业领域,提升速度、数据可及性和一致性。与聊天机器人或自主代理不同,copilot强调人在回路,但需注意数据安全、偏见和人类问责等治理问题。

什么是AI Copilot?

Databricks Databricks · 2026-08-28T22:22:15Z

本文介绍量化和剪枝两种模型压缩技术,用于减小大语言模型体积、降低成本并提升推理速度。量化降低权重精度(如4位),剪枝删除冗余权重。文中详述五种方法:bitsandbytes、GPTQ、AWQ、SparseGPT和Wanda,并建议先剪枝后量化,根据需求选择合适方法,以在保持性能的同时实现高效部署。

量化和剪枝方法,让你的大语言模型更精简

KDnuggets KDnuggets · 2026-08-28T12:00:55Z
大语言模型并非(始终)贝叶斯:量化LLM概率信念的内部(不)一致性

该研究将大语言模型视为信息处理规则,通过贝叶斯更新偏差衡量其内部一致性。实验发现,非贝叶斯启发式更新常优于精确贝叶斯更新,表明模型世界模型存在错误设定。该度量可用于诊断LLM推理系统问题。

大语言模型并非(始终)贝叶斯:量化LLM概率信念的内部(不)一致性

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-28T00:00:00Z
如何让大语言模型提速3倍

推测解码利用小型草稿模型生成候选token,再由大模型并行验证,借助GPU空闲算力实现2-3倍加速且不损失输出质量。其效果取决于接受率,结构化任务中接受率高,创意写作中较低,高并发时收益下降。草稿来源包括小模型、预测头、量化版本或文本搜索,需根据部署场景选择。

如何让大语言模型提速3倍

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-26T15:30:34Z
一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

该研究证明,一条事实错误的针对性论证足以让大语言模型放弃正确答案。通过GRPO强化学习训练说服模型,Qwen-2.5-7B在TruthfulQA上的准确率从66.2%骤降至1.8%。该策略可跨模型迁移,对Qwen-14B和Llama-3.1-8B的PSR均超79%。闭源模型如GPT-5-mini更抗说服,但现有防御仍不充分,PBT-8B的PSR仍达60%。

一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

Micropaper Micropaper · 2026-08-23T00:00:00Z
一分钟读论文:《最佳选手未必是最佳教练》

加州大学伯克利分校研究发现,大语言模型的自动化与增强能力几乎不相关,模型排名因角色而异。在7个真实任务中,增强冠军与自动化冠军多非同一模型,指导有时甚至降低工人表现。研究建议模型选型应依据具体角色,而非单一榜单。

一分钟读论文:《最佳选手未必是最佳教练》

Micropaper Micropaper · 2026-08-20T00:00:00Z
审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

该研究分析了四种大语言模型在2.1万轮对话中的人类化行为,发现其普遍存在但随模型和用户因素变化。人类评估认为,模型表达自我和建立关系的行为不如人类合适,但维护边界的行为更合适。系统提示可控制这些行为,但需谨慎评估以避免副作用,为负责任设计提供建议。

审视大语言模型中的人类化行为:模型行为、用户因素与系统提示的多维分析

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-19T00:00:00Z
买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

Shoehorn是一款用Rust编写的开源工具,通过精确到字节的混合精度量化,优化大语言模型在显卡显存中的分配。它先探测显存,计算权重预算,再用重要性矩阵和背包算法为每个张量选择最优精度,最大化模型质量。测试显示,它可将显存利用率提升至99.998%,困惑度降低近半,支持一键命令行和Web界面,兼容多平台。

买显卡跑模型必看:Shoehorn让14B模型塞进24GB显存

极道 极道 · 2026-08-18T22:00:00Z
大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

根据QY Research报告,全球大语言模型AI对话系统市场正高速增长,2025年规模约10.99亿美元,预计2032年达39.85亿美元,年复合增长率20.5%。市场受AI客服、企业助手和个性化需求驱动,但面临准确性、隐私和成本挑战。投资机会集中在企业AI代理、垂直行业方案和语音AI等领域。

大语言模型 AI 对话系统市场规模预计将达到39.85亿美元(2026-2032年预测)

实时互动网 实时互动网 · 2026-08-18T07:39:52Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码