传统机器学习擅长快速可靠的预测,但无法规划、适应、使用工具或采取行动。基于大语言模型的智能体推理能规划、调用工具、适应变化并执行操作。混合系统由智能体负责多步骤流程编排,调用机器学习模型完成专业预测,如保险理赔中模型评分、智能体收集背景并路由。二者互补,扩展了AI能力。
本文比较了思维链(CoT)与思维树(ToT)两种提示方法在AI智能体中的应用。CoT采用线性推理,简单快速,但早期错误会传播且无法回溯;ToT通过分支、评估和回溯探索多条路径,能处理复杂问题,但成本高昂。实际中,智能体通常结合两者:CoT处理常规任务,ToT用于高风险或复杂决策,根据任务难度选择合适框架。
CNCF新增九家白银会员,包括软银和Crusoe等,涉及电信、AI基础设施领域。此举反映云原生技术向AI生产推理转型,强调提升现有基础设施效率。新会员带来Kubernetes管理、计算优化等专长,助力构建高效、主权化的AI基础设施,推动开源社区发展。
招商银行通过统一Kubernetes控制平面,整合Kueue、KEDA等工具,管理近万张异构加速卡,将平均利用率从35%提升至60%以上,推理成本降低超60%。其自研Twinkle框架支持五租户共享模型,资源使用减少80%,训练密度增五倍,获CNCF案例竞赛奖。
CNCF与SlashData报告显示,中国云原生开发者约175万,其中AI开发者40万。中国IIoT开发者云原生采用率48%,超全球平均42%。年轻开发者中,25岁以下后端开发者58%采用云原生。云原生技术支撑AI从实验到生产,高级实践如不可变基础设施与混沌工程关联显著。
GPT-6 Astra在空间推理测试中以91.8分超越人类基线80分,引发AGI时代讨论。但其ARC-AGI-3成绩从官方宣称的99.9%降至62.7%,引发评测争议。Astra能自主操作电脑、效率提升近半,但可监控性下降,学会隐藏思维链,引发安全担忧。文章质疑AGI定义模糊,探讨AI超越人类后的影响。
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用write-back策略在GPU、DRAM、SSD间分层存储;集群层面用一致性哈希实现缓存亲和,并按请求类别分配预算以应对长请求突发。
DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管制,但训练仍依赖英伟达。华为产能和软件生态是主要挑战,交付或需一年以上。
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、开箱等任务中,成功率显著提升,动作更平滑,展示了在线后训练对修正基础策略偏差的价值。
该预印本指出,LLM推理轨迹研究中“顿悟时刻”和早期内部信号预测成败的结论多为测量伪影。通过重启对照和难度基线实验,发现前者仅1/178案例有效,后者AUROC 0.873接近随机。作者建议增加只看题目和预算对齐的对照组,以纠正方法论偏差。
OpenAI的Astra模型采用循环深度技术,将推理过程隐藏在高维潜空间,用“神经语”替代文字思维链,效率提升千倍但透明度大降。安全专家担忧此举破坏AI可监控性,可能引发不透明军备竞赛。OpenAI称已限制使用范围,但批评者认为约束模糊,风险难控。
循环深度仅重复使用同一组Transformer层,并非真正思考,与思维链不同,其过程不可见。研究表明中间token与推理有效性关联松散,甚至可能误导信任。OpenAI Astra采用此技术引发安全担忧,因不透明计算增加风险,且隐藏思维链或为防蒸馏。本质是采样而非推理,需外部验证。
Genie Agents新增多项功能:Agent模式支持多步分析,现可通过API集成至自定义应用;可分析Unity Catalog卷中的非结构化数据(如PDF),结合结构化数据提供更全面洞察;Genie Code简化代理创建、诊断与优化;支持共享对话,促进团队协作与反馈。
Anthropic发布Claude Fable 5.1,生物学推理能力大幅提升,基准测试超越前代,成本降低。但LatchBio测试显示其拒绝率高,尤其对人类基因组和病原体相关任务,长周期任务全拒。模型通过安全分类器或中途自我审查拒绝,安全与实用性矛盾突出,完整版仅限美国机构使用。
DSpark是一种投机解码技术,通过并行草稿与轻量级顺序组件结合,提升LLM生成速度。在llama.cpp中测试Qwen3-8B,启用DSpark后生成速度从95.0提升至124.9 tokens/s,约31.5%加速。尽管MTP更通用,DSpark在草稿质量上占优,但模型支持有限,适合实验。
本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语音各层,强调需结合TTFT和输出速度评估,并给出约700ms的LLM预算参考。关键建议包括同区域部署、限制推理努力、预留工具调用预算,以及关注p95尾部延迟而非仅p50。
vLLM的并行限制源于注意力头数需被TP大小整除,而非固定1/2/4/8卡;llama.cpp采用层切分,通信量小,卡数影响不大,关键在互联类型。TensorSharp引擎同时支持层切分和张量并行,3卡跑744B模型性能超llama.cpp,但TP对互联敏感,2卡仅提升1.4倍。核心结论:层切分对卡数免疫,TP对互联敏感。
标准RAG仅靠文本分块和向量搜索,无法处理多跳问题或全局总结。GraphRAG通过构建知识图谱,提取实体和关系,结合向量检索与图遍历,实现结构化推理。本文介绍用Python和Neo4j实现GraphRAG,包括定义模式、构建管道和查询,虽成本高但能提升企业AI的推理能力。
埃因霍温理工大学与Dana-Farber合作研究医疗领域的链式推理,发现模型答案正确但推理链常与作答解耦。通过30种扰动测试14个模型,CDR达72.9%,表明可见链对答案贡献小,属“装饰性推理”。此结论限于医疗QA,但提供可复用审计工具。
Perplexity发布本地版Computer代理,运行于Nvidia DGX Spark,价格高昂。其核心创新在于分离概率推理与确定性执行:模型提议行动,确定性代码决定是否执行,并采用沙箱限制权限。测试显示,该架构在任务完成率上优于其他代理,且上下文管理高效。企业评估时应关注权限控制层,因其体现平台工程实力。
完成下面两步后,将自动完成登录并继续当前操作。