小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
阻止Token流失:构建高效Token的多代理系统

本文探讨了AI代理系统中隐藏的Token成本问题,指出模型并非最大开销,而是重复检索、冗余提示和低效架构。通过引入意图路由、语义缓存、上下文预算管理、自适应检索和模型选择等优化技术,可显著降低成本和延迟。核心原则是重新设计工作流,让LLM成为最终操作而非首选,仅生成必要Token,实现高效可扩展的AI系统。

阻止Token流失:构建高效Token的多代理系统

The New Stack The New Stack · 2026-08-20T14:00:00Z
ReAct代理详解:概念与实践应用

ReAct代理通过“推理-行动”循环调用工具并基于反馈迭代,适用于客服、编程和研究场景,但随步骤增加,上下文重复发送导致成本和延迟呈二次方增长。管理记忆分层(提示、线程、长期)和语义缓存可优化性能,Redis Iris提供实时上下文服务,降低推理成本并提升效率。

ReAct代理详解:概念与实践应用

Redis Blog Redis Blog · 2026-08-18T00:00:00Z

PromptCache是一个用Go编写的LLM语义缓存网关,通过向量相似度双阈值判定(高阈值直接命中、低阈值未命中、灰区用廉价模型仲裁)缓存重复请求,支持OpenAI兼容接口、多提供商热切换和持久化存储。它降低token成本和延迟,但存在语义误判、忽略上下文、多租户隔离不足及暴力扫描性能瓶颈等风险。

PromptCache:LLM 语义缓存网关的架构与实现

阁子 阁子 · 2026-08-12T02:40:05Z
推理延迟:衡量什么及为何变化

本文讨论LLM推理延迟的复杂性,指出其分为首字延迟、总响应时间和代理全链路时间等指标,受队列、防护、冷启动及RAG检索影响。优化需按场景选择指标:聊天重首字,代理重总耗时,批处理重成本。语义缓存可跳过模型调用,显著降延迟和成本,Redis Iris等工具支持此优化。

推理延迟:衡量什么及为何变化

Redis Blog Redis Blog · 2026-08-06T00:00:00Z

多智能体AI系统中,令牌使用量易激增,导致成本高和延迟。本文介绍四种节省令牌策略:静态指令缓存、语义缓存、即时工具加载和任务升级路由。通过示例代码展示语义缓存与模型路由结合,优化资源,降低成本。

多智能体AI节省令牌使用指南

KDnuggets KDnuggets · 2026-08-03T14:00:25Z
使用Redis将AI代理连接到数据源

本文介绍Redis Iris作为AI代理的实时上下文引擎,解决连接数据源后的三大挑战:系统碎片化、数据陈旧和权限治理。它提供语义缓存、代理记忆、数据同步等服务,确保代理获取新鲜、相关且受控的上下文,提升响应速度与准确性,适用于生产级代理工作负载。

使用Redis将AI代理连接到数据源

Redis Blog Redis Blog · 2026-08-03T00:00:00Z
令牌预算感知的LLM推理:2026年削减成本

本文介绍如何通过“令牌预算感知推理”降低AI推理成本。核心方法包括:在提示中设定推理令牌预算(如TALE技术),使用简洁思维链,以及架构级优化——语义缓存(如Redis LangCache)减少重复查询,复杂度路由将简单问题分配给便宜模型,持久化代理记忆避免重复推理。这些手段可显著节省输出令牌费用,提升响应速度。

令牌预算感知的LLM推理:2026年削减成本

Redis Blog Redis Blog · 2026-07-28T00:00:00Z
为什么在AI网络中监控延迟很重要

文章探讨了AI应用中延迟对回答质量的影响,指出延迟不仅是速度指标,更是质量指标,因为系统超时会降级检索或推理,导致答案质量下降。延迟分布在检索、模型执行和服务间跳转等阶段,需按阶段监控百分位数。Redis Iris通过语义缓存和低延迟向量搜索减少检索延迟,从而帮助维持回答质量。

为什么在AI网络中监控延迟很重要

Redis Blog Redis Blog · 2026-07-27T00:00:00Z
上下文组装:构建模型实际看到的提示词

本文介绍上下文工程在AI应用中的重要性,强调组装指令、知识、工具、记忆和状态对模型回答质量的影响。文章指出上下文顺序、令牌预算和新鲜度是关键,常见失败模式包括上下文腐烂和缺失输入。Redis Iris作为实时上下文引擎,提供低延迟检索、记忆和语义缓存,帮助优化组装层,提升响应速度和降低成本。

上下文组装:构建模型实际看到的提示词

Redis Blog Redis Blog · 2026-07-22T00:00:00Z
为什么仅靠更便宜的模型无法节省你的人工智能预算

随着智能代理的发展,工程师面临代币消耗过高的问题。复杂任务可能消耗数十万代币。为降低成本,团队探索了三种策略:压缩上下文、将任务分配给更便宜的模型,以及使用语义缓存以避免冗余计算。通过优化这些流程,组织可以显著降低代币消耗。

为什么仅靠更便宜的模型无法节省你的人工智能预算

The New Stack The New Stack · 2026-07-04T12:02:30Z
动态批处理:实用指南

动态批处理通过实时组合多个推理请求,提高GPU利用率并减少延迟。语义缓存在请求到达推理队列前识别并重用相似查询的响应,从而降低成本和延迟。Redis为AI工作负载提供高效的实时数据平台,优化推理性能。

动态批处理:实用指南

Redis Blog Redis Blog · 2026-06-21T00:00:00Z
人工智能中的上下文窗口:为何每个令牌都是预算决策

Redis Iris 提供实时上下文管理,优化大语言模型(LLM)的性能。通过精简上下文窗口,减少不必要的令牌使用,降低成本并提高推理质量。使用 LangCache 进行语义缓存,显著降低推理费用,Redis 的快速存储确保上下文检索高效,适用于多种应用场景。

人工智能中的上下文窗口:为何每个令牌都是预算决策

Redis Blog Redis Blog · 2026-06-10T00:00:00Z
智能系统中的缓存:内部、分布式和语义

本文讨论了智能系统中缓存的重要性,重点介绍了Java应用的内部、分布式和语义缓存实现。内容包括使用Caffeine进行低延迟的内部缓存,利用Redisson和Valkey进行分布式缓存,以及通过向量相似性搜索实现语义缓存,以降低延迟和成本。

智能系统中的缓存:内部、分布式和语义

insidejava insidejava · 2026-05-18T00:00:00Z
大语言模型速度基准:指标与基础设施指南

本文讨论了大语言模型(LLM)推理速度的关键指标及其对用户体验的影响,强调选择合适模型和优化指标的重要性。介绍了TTFT、TTFAT、输出速度等六个性能指标,并提到语义缓存技术可以减少推理瓶颈,提高响应速度和降低成本。Redis作为实时数据平台,支持语义缓存和向量搜索,适合构建高效的GenAI应用。

大语言模型速度基准:指标与基础设施指南

Redis Blog Redis Blog · 2026-05-10T00:00:00Z
上下文修剪:在不损失质量的情况下减少LLM令牌

上下文修剪是从大型语言模型(LLM)输入中去除低价值内容,以降低成本并提高输出质量。它属于提示压缩,旨在减少输入长度和提高处理效率。修剪方法包括标记级、句子级和基于注意力的修剪。研究表明,适度修剪可以改善LLM性能,尤其与语义缓存结合使用时效果更佳。

上下文修剪:在不损失质量的情况下减少LLM令牌

Redis Blog Redis Blog · 2026-05-09T00:00:00Z

文章讨论了Percona的“与AI共建”竞赛,旨在推动创新,以及Redis的语义缓存技术,该技术能显著降低成本并提高应用速度。

我会功夫

Percona Database Performance Blog Percona Database Performance Blog · 2026-05-04T12:43:46Z
预填充与解码:大型语言模型推理阶段解析

本文讨论了大型语言模型(LLM)请求的两个阶段:预填充和解码。预填充阶段处理整个提示,受限于计算能力;解码阶段逐个生成令牌,受限于内存带宽。优化策略需根据这两个阶段的特性进行调整,以提高响应速度。使用Redis的语义缓存可以在缓存命中时绕过推理过程,消除预填充和解码的成本。

预填充与解码:大型语言模型推理阶段解析

Redis Blog Redis Blog · 2026-04-28T00:00:00Z
大语言模型推理缓存完整指南

本文介绍了大语言模型中的推理缓存技术,强调其基本概念和重要性。推理缓存通过存储计算结果,减少重复计算,从而降低成本和延迟。主要有三种缓存类型:键值缓存(KV缓存)、前缀缓存和语义缓存。合理选择和组合这些缓存策略,可以显著提升生产系统的效率。

大语言模型推理缓存完整指南

MachineLearningMastery.com MachineLearningMastery.com · 2026-04-17T12:00:46Z
语义缓存与路由:向量分类的两种强大模式

Redis的向量数据类型实现了毫秒级的无监督分类,支持语义缓存和语义路由优化。语义缓存通过向量数学判断缓存命中,语义路由则能快速在多标签中分类输入。这两种模式提升了系统性能,降低了成本,适用于多种应用场景。

语义缓存与路由:向量分类的两种强大模式

Redis Blog Redis Blog · 2026-03-13T00:00:00Z
穆罕默德·阿基尔:生产环境中的pg_semantic_cache:标签、驱逐、监控与Python集成

本文介绍了PostgreSQL中的语义缓存,强调如何将其应用于生产环境。通过标签组织缓存条目、监控缓存健康状况和实施驱逐策略,确保数据的新鲜度和有效性。示例展示了如何在Python应用中集成语义缓存,以提高查询效率和降低API调用成本。

穆罕默德·阿基尔:生产环境中的pg_semantic_cache:标签、驱逐、监控与Python集成

Planet PostgreSQL Planet PostgreSQL · 2026-03-03T04:20:12Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码