小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

Microsoft has released a reference architecture for routing agent traffic on Azure Kubernetes Service. It breaks down the issue into three key choices: which model answers a call, how the call is...

Microsoft Three-Layer LLM Routing Architecture for AI Agents on AKS

InfoQ
InfoQ · 2026-07-29T12:00:00Z

当 LLM 从离线批处理变成在线运行时组件,超时预算、按 token 计费、非确定性输出与多轮 Agent 编排必须进入架构的一等公民。本文从依赖语义差异出发,衔接弹性与过载保护,讨论网关成本治理、结构化输出与人审闸门、checkpoint 恢复与隐私友好的可观测,并划定与 RAG、向量引擎及训练基础设施的分工边界。

【系统架构设计】AI 原生架构:LLM 时代的系统设计

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-07-29T00:00:00Z
Token-budget-aware LLM reasoning: cut costs in 2026

Reasoning models think before they answer, and those reasoning tokens are usually part of what you pay for. They're billed as output tokens, the expensive kind, and a single request can generate a...

Token-budget-aware LLM reasoning: cut costs in 2026

Redis Blog
Redis Blog · 2026-07-28T00:00:00Z

自从 Karpathy 提出 llm-wiki 这套理念,我就一直想自己动手搭一个 AI 知识库——用它记录笔记、学习知识,也试着让它指引生活。 几经拖延,最后先让 AI 帮我把 llm-wiki 的生态通盘调研了一遍。结果出乎意料地详实:llm-wiki...

LLM-Wiki:让知识像花园一样持续生长

Seven's blog
Seven's blog · 2026-07-26T16:00:00Z
Python 潮流周刊#160:AI 智能体与 LLM 推理

分享了 12 篇文章,12 个开源项目

Python 潮流周刊#160:AI 智能体与 LLM 推理

豌豆花下猫 | Python猫
豌豆花下猫 | Python猫 · 2026-07-25T00:00:00Z
从一键部署到 AI 洞察:基于 Serverless 架构与 LLM 的压测与分析平台 Load Testing Pilot

性能测试是保障系统稳定性的关键环节,然而分布式压测环境搭建复杂、客户端指标与服务端基础设施指标割裂、测试结果分析高度依赖专家经验,仍是许多团队面临的共性挑战。本文介绍 Load Testing Pilot——一个专为亚马逊云科技中国区域设计,通过单一 Amazon CloudFormation 模板实现一键部署的 Serverless 分布式压测与智能分析平台。平台支持多压测引擎与 LLM...

从一键部署到 AI 洞察:基于 Serverless 架构与 LLM 的压测与分析平台 Load Testing Pilot

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-24T09:29:04Z
opencodex:让 Codex 和 Claude Code 跑在任意 LLM 上

opencodex 是一个本地代理,把 Codex 的 Responses API 翻译成任意 LLM provider 的协议。你可以在 Codex CLI、Codex App、SDK 里用 Claude、Gemini、DeepSeek、Grok、GLM、Qwen 甚至本地 Ollama 模型——也能在 Claude Code...

opencodex:让 Codex 和 Claude Code 跑在任意 LLM 上

ISLAND
ISLAND · 2026-07-22T00:00:00Z
Why goodput matters more than throughput for LLM serving

When we benchmark an LLM serving setup, the number almost everyone reaches for first is throughput: how many requests per second the system can push through. It is easy to measure, easy to...

Why goodput matters more than throughput for LLM serving

Cloud Native Computing Foundation
Cloud Native Computing Foundation · 2026-07-20T11:00:00Z
LLM 与信息熵

LLM 不是许愿机,而是一台概率机;高质量的上下文与持续的反馈,决定了它能否从「最可能」走向「真正可用」。

LLM 与信息熵

sjdhome blog
sjdhome blog · 2026-07-18T16:00:00Z

By AI Platform’s Model Runtime team and Inference teamIntroductionMost organizations consume LLMs through hosted APIs. Netflix went further — we run the full stack ourselves, from model deployment...

In-House LLM Serving at Netflix

Netflix TechBlog
Netflix TechBlog · 2026-07-17T21:32:39Z
ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

ABot-AgentOS是一种通用机器人智能体操作系统,旨在解决具身智能中的推理与执行、泛化和持久记忆等挑战。该系统结合多模态感知、记忆和推理,支持机器人在物理世界中的长期交互。通过边缘-云协同架构,ABot-AgentOS能够高效执行任务并优化技能,其多模态记忆系统确保机器人持续学习和利用经验,提升智能体整体能力。

ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

结构之法 算法之道
结构之法 算法之道 · 2026-07-17T07:56:33Z
在Kubernetes中使用vLLM运行自托管的大型语言模型(LLM)

本文介绍了在Kubernetes环境中自托管大型语言模型(LLM)的设置,使用vLLM作为推理引擎,LINSTOR提供持久存储。自托管可降低成本、提高控制力,并满足数据合规要求。通过创建持久卷声明和密钥,部署vLLM推理服务器,确保模型权重缓存以加快重启速度,支持高并发请求,适合混合AI应用。

在Kubernetes中使用vLLM运行自托管的大型语言模型(LLM)

Cloud Native Computing Foundation
Cloud Native Computing Foundation · 2026-07-16T11:00:00Z
基于回归的因果推断的产品实验:使用Python和statsmodels估计LLM特征影响

本文讨论了随机A/B测试中的回归分析,强调随机化的重要性。通过随机分配用户,回归模型能够提供无偏的因果估计。文章介绍了使用OLS回归分析任务完成率变化的方法,包括添加协变量、聚类稳健标准误差和交互效应模型。同时指出在实验不干净时需采用其他方法处理潜在的混杂因素。

基于回归的因果推断的产品实验:使用Python和statsmodels估计LLM特征影响

freeCodeCamp.org
freeCodeCamp.org · 2026-07-15T15:25:14Z
Scikit-Ollama用于Scikit-LLM/Ollama集成

本文介绍了scikit-ollama如何将scikit-learn接口与本地Ollama模型结合,实现零-shot文本分类,无需云API。用户可以使用本地Llama 3模型加载电影评论情感数据集,并创建情感预测分类器,从而简化传统机器学习流程,避免数据隐私问题和订阅费用。

Scikit-Ollama用于Scikit-LLM/Ollama集成

MachineLearningMastery.com
MachineLearningMastery.com · 2026-07-15T12:00:34Z
领域特定语言(DSL)促进大型语言模型(LLM)的可靠使用

本文探讨了领域特定语言(DSL)与大型语言模型(LLM)的结合。LLM在DSL的约束环境中表现出色,能够根据自然语言生成代码。DSL提供明确的语法和语义模型,帮助开发者设计和实现复杂系统。文章介绍了Tickloom框架,展示了如何利用DSL简化分布式系统的开发与测试。LLM在设计阶段作为头脑风暴伙伴,在DSL建立后则作为自然语言接口,提升开发效率。

领域特定语言(DSL)促进大型语言模型(LLM)的可靠使用

Martin Fowler
Martin Fowler · 2026-07-14T12:51:00Z
LLM评估框架比较:如何实际衡量您的模型表现

本文比较了三种主流开源LLM评估框架:RAGAS、DeepEval和Promptfoo,探讨了它们的用途和应用场景。文章指出了LLM作为评判者的偏见问题,包括位置偏见、自我偏好偏见和冗长偏见,并提供了检测和缓解这些偏见的方法。最后,建议团队结合使用多个工具,以确保评估的准确性和可靠性。

LLM评估框架比较:如何实际衡量您的模型表现

MachineLearningMastery.com
MachineLearningMastery.com · 2026-07-14T12:00:29Z

DoorDash details the architecture behind Ask DoorDash, its AI-powered conversational shopping assistant, combining LLMs, specialized AI agents, MCP-based tooling, and an intelligence layer with...

How DoorDash Built an AI Shopping Assistant That Doesn’t Rely on the LLM Alone

InfoQ
InfoQ · 2026-07-13T14:08:00Z
用 LLM + 语义聚类,把海量用户评论提炼成四级 VOC 标签体系

本文介绍了一种将非结构化用户评论转化为四级VOC标签体系的方法。该方法通过三阶段流程,结合LLM和语义聚类技术,提炼出清晰、可复用的标签结构,以分析用户反馈。每个阶段均可调参数,确保标签的准确性和一致性,最终生成的标签树可用于量化用户意见,提升产品改进效率。

用 LLM + 语义聚类,把海量用户评论提炼成四级 VOC 标签体系

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-13T02:26:16Z
[MAF预定义的AIContextProvider-05]CompactionProvider——采用多种策略压缩对话历史 - Artech

为了解决LLM调用的无状态问题,需要将消息历史作为上下文发送给LLM。随着对话的进行,消息历史不断增长,可能超出LLM的上下文窗口限制,导致响应质量下降。因此,压缩对话历史是必要的。MAF提供了多种压缩策略,CompactionProvider支持摘要、折叠、删除和替换等策略,有效压缩消息历史,保留核心信息。

[MAF预定义的AIContextProvider-05]CompactionProvider——采用多种策略压缩对话历史 - Artech

Artech
Artech · 2026-07-13T01:34:00Z

Harness 是一个通过工程手段提升 LLM 工作效率和任务执行能力的系统,包含工具管理、权限管理、任务系统、子代理、技能系统、上下文压缩和记忆模块。它还引入多团队协作机制和工作隔离,确保团队成员独立高效地完成任务。

AI in Harness(四)——Harness 的本质与模块总览:让 LLM 在受控循环中工作

犀利豆的博客
犀利豆的博客 · 2026-07-10T21:12:17Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码