小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
如何将传统机器学习与智能体推理相结合

传统机器学习擅长快速可靠的预测,但无法规划、适应、使用工具或采取行动。基于大语言模型的智能体推理能规划、调用工具、适应变化并执行操作。混合系统由智能体负责多步骤流程编排,调用机器学习模型完成专业预测,如保险理赔中模型评分、智能体收集背景并路由。二者互补,扩展了AI能力。

如何将传统机器学习与智能体推理相结合

MachineLearningMastery.com MachineLearningMastery.com · 2026-09-10T12:00:20Z
思维链与思维树:哪种更适合AI智能体?

本文比较了思维链(CoT)与思维树(ToT)两种提示方法在AI智能体中的应用。CoT采用线性推理,简单快速,但早期错误会传播且无法回溯;ToT通过分支、评估和回溯探索多条路径,能处理复杂问题,但成本高昂。实际中,智能体通常结合两者:CoT处理常规任务,ToT用于高风险或复杂决策,根据任务难度选择合适框架。

思维链与思维树:哪种更适合AI智能体?

MachineLearningMastery.com MachineLearningMastery.com · 2026-09-08T14:29:26Z
CNCF迎来新白银会员,企业AI应用从训练转向推理

CNCF新增九家白银会员,包括软银和Crusoe等,涉及电信、AI基础设施领域。此举反映云原生技术向AI生产推理转型,强调提升现有基础设施效率。新会员带来Kubernetes管理、计算优化等专长,助力构建高效、主权化的AI基础设施,推动开源社区发展。

CNCF迎来新白银会员,企业AI应用从训练转向推理

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-09-08T01:58:47Z
招商银行凭借在Kubernetes上统一AI训练与推理荣获CNCF终端用户案例研究竞赛奖

招商银行通过统一Kubernetes控制平面,整合Kueue、KEDA等工具,管理近万张异构加速卡,将平均利用率从35%提升至60%以上,推理成本降低超60%。其自研Twinkle框架支持五租户共享模型,资源使用减少80%,训练密度增五倍,获CNCF案例竞赛奖。

招商银行凭借在Kubernetes上统一AI训练与推理荣获CNCF终端用户案例研究竞赛奖

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-09-08T01:54:31Z
CNCF与SlashData报告:AI转向推理,中国云原生发展势头强劲

CNCF与SlashData报告显示,中国云原生开发者约175万,其中AI开发者40万。中国IIoT开发者云原生采用率48%,超全球平均42%。年轻开发者中,25岁以下后端开发者58%采用云原生。云原生技术支撑AI从实验到生产,高级实践如不可变基础设施与混沌工程关联显著。

CNCF与SlashData报告:AI转向推理,中国云原生发展势头强劲

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-09-08T01:50:55Z
GPT-6 Astra空间推理91.8分超越人类:AGI时代真的来了吗!

GPT-6 Astra在空间推理测试中以91.8分超越人类基线80分,引发AGI时代讨论。但其ARC-AGI-3成绩从官方宣称的99.9%降至62.7%,引发评测争议。Astra能自主操作电脑、效率提升近半,但可监控性下降,学会隐藏思维链,引发安全担忧。文章质疑AGI定义模糊,探讨AI超越人类后的影响。

GPT-6 Astra空间推理91.8分超越人类:AGI时代真的来了吗!

极道 极道 · 2026-09-06T22:24:00Z
推理服务的缓存与调度:前缀、多级存储、集群路由

本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用write-back策略在GPU、DRAM、SSD间分层存储;集群层面用一致性哈希实现缓存亲和,并按请求类别分配预算以应对长请求突发。

推理服务的缓存与调度:前缀、多级存储、集群路由

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T23:30:00Z
DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练

DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管制,但训练仍依赖英伟达。华为产能和软件生态是主要挑战,交付或需一年以上。

DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练

极道 极道 · 2026-09-05T21:48:00Z
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、开箱等任务中,成功率显著提升,动作更平滑,展示了在线后训练对修正基础策略偏差的价值。

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

量子位 量子位 · 2026-09-04T09:19:29Z
一分钟读论文:《推理链里的顿悟时刻,多半是预算给的错觉》

该预印本指出,LLM推理轨迹研究中“顿悟时刻”和早期内部信号预测成败的结论多为测量伪影。通过重启对照和难度基线实验,发现前者仅1/178案例有效,后者AUROC 0.873接近随机。作者建议增加只看题目和预算对齐的对照组,以纠正方法论偏差。

一分钟读论文:《推理链里的顿悟时刻,多半是预算给的错觉》

Micropaper Micropaper · 2026-09-04T00:00:00Z
OpenAI Astra神经语揭秘:高维向量思考让AI推理彻底消失

OpenAI的Astra模型采用循环深度技术,将推理过程隐藏在高维潜空间,用“神经语”替代文字思维链,效率提升千倍但透明度大降。安全专家担忧此举破坏AI可监控性,可能引发不透明军备竞赛。OpenAI称已限制使用范围,但批评者认为约束模糊,风险难控。

OpenAI Astra神经语揭秘:高维向量思考让AI推理彻底消失

极道 极道 · 2026-09-03T06:03:00Z
OpenAI Astra循环深度揭秘:采样不等于推理

循环深度仅重复使用同一组Transformer层,并非真正思考,与思维链不同,其过程不可见。研究表明中间token与推理有效性关联松散,甚至可能误导信任。OpenAI Astra采用此技术引发安全担忧,因不透明计算增加风险,且隐藏思维链或为防蒸馏。本质是采样而非推理,需外部验证。

OpenAI Astra循环深度揭秘:采样不等于推理

极道 极道 · 2026-09-03T02:36:00Z
扩展Genie Agents:深度分析、文件推理及更多功能

Genie Agents新增多项功能:Agent模式支持多步分析,现可通过API集成至自定义应用;可分析Unity Catalog卷中的非结构化数据(如PDF),结合结构化数据提供更全面洞察;Genie Code简化代理创建、诊断与优化;支持共享对话,促进团队协作与反馈。

扩展Genie Agents:深度分析、文件推理及更多功能

Databricks Databricks · 2026-09-02T19:30:00Z
Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

Anthropic发布Claude Fable 5.1,生物学推理能力大幅提升,基准测试超越前代,成本降低。但LatchBio测试显示其拒绝率高,尤其对人类基因组和病原体相关任务,长周期任务全拒。模型通过安全分类器或中途自我审查拒绝,安全与实用性矛盾突出,完整版仅限美国机构使用。

Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

极道 极道 · 2026-09-02T09:11:00Z

DSpark是一种投机解码技术,通过并行草稿与轻量级顺序组件结合,提升LLM生成速度。在llama.cpp中测试Qwen3-8B,启用DSpark后生成速度从95.0提升至124.9 tokens/s,约31.5%加速。尽管MTP更通用,DSpark在草稿质量上占优,但模型支持有限,适合实验。

使用DSpark投机解码加速LLM推理

KDnuggets KDnuggets · 2026-08-31T14:00:00Z
面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试

本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语音各层,强调需结合TTFT和输出速度评估,并给出约700ms的LLM预算参考。关键建议包括同区域部署、限制推理努力、预留工具调用预算,以及关注p95尾部延迟而非仅p50。

面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试

实时互动网 实时互动网 · 2026-08-31T06:07:51Z
3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

vLLM的并行限制源于注意力头数需被TP大小整除,而非固定1/2/4/8卡;llama.cpp采用层切分,通信量小,卡数影响不大,关键在互联类型。TensorSharp引擎同时支持层切分和张量并行,3卡跑744B模型性能超llama.cpp,但TP对互联敏感,2卡仅提升1.4倍。核心结论:层切分对卡数免疫,TP对互联敏感。

3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

张善友 张善友 · 2026-08-27T22:40:00Z
为什么基础RAG在多跳推理上失败(以及GraphRAG如何修复它)

标准RAG仅靠文本分块和向量搜索,无法处理多跳问题或全局总结。GraphRAG通过构建知识图谱,提取实体和关系,结合向量检索与图遍历,实现结构化推理。本文介绍用Python和Neo4j实现GraphRAG,包括定义模式、构建管道和查询,虽成本高但能提升企业AI的推理能力。

为什么基础RAG在多跳推理上失败(以及GraphRAG如何修复它)

The New Stack The New Stack · 2026-08-27T14:00:00Z
一分钟读论文:《把题目改错,模型的推理链纹丝不动》

埃因霍温理工大学与Dana-Farber合作研究医疗领域的链式推理,发现模型答案正确但推理链常与作答解耦。通过30种扰动测试14个模型,CDR达72.9%,表明可见链对答案贡献小,属“装饰性推理”。此结论限于医疗QA,但提供可复用审计工具。

一分钟读论文:《把题目改错,模型的推理链纹丝不动》

Micropaper Micropaper · 2026-08-27T00:00:00Z
Perplexity刚刚将推理与权限分离。这对企业为何重要。

Perplexity发布本地版Computer代理,运行于Nvidia DGX Spark,价格高昂。其核心创新在于分离概率推理与确定性执行:模型提议行动,确定性代码决定是否执行,并采用沙箱限制权限。测试显示,该架构在任务完成率上优于其他代理,且上下文管理高效。企业评估时应关注权限控制层,因其体现平台工程实力。

Perplexity刚刚将推理与权限分离。这对企业为何重要。

The New Stack The New Stack · 2026-08-26T16:18:18Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码