内容提要
调查显示,97%的受访者认为复合智能至关重要,但仅4%已实现。复合智能指智能体通过存储、反思和检索过往经验来改进决策,无需重训模型,其核心是记忆与上下文管理,但面临延迟、数据污染和治理挑战。Redis Iris提供会话与长期记忆、语义缓存及上下文检索服务,支持智能体高效运行。
延伸解读
复合智能的落地差距
调查显示,94%的基础设施领导者认为复合智能对生产级成熟度至关重要,但仅4%达到该阶段。这一巨大差距表明,多数团队仍停留在演示阶段,尚未建立有效的记忆与上下文管理机制。复合智能的核心在于通过存储、反思和检索过往经验来改进决策,而无需重训模型。实现这一目标需要系统性地设计记忆层,并确保其与现有工作负载匹配。
记忆类型与遗忘机制
智能体记忆通常分为四类:情景记忆、语义记忆、程序性记忆和工作记忆。每种类型在存储和检索上各有特点。遗忘机制同样重要,若无设计,记忆库将无限增长,增加检索成本并引入噪声。Redis Agent Memory采用双层模型:会话记忆存储有序事件并自动摘要,长期记忆保存持久文本和向量嵌入,通过后台进程自动提升重要事实,确保关键信息在会话结束后仍可用。
上下文长度与性能权衡
长上下文并不总是更好。测试显示,GPT-3.5-Turbo在相关段落位于中间时准确率下降超20%;GPT-4o在32K token下准确率从99.3%降至69.7%。因此,需通过压缩、按需检索、工具选择等策略来精选上下文。精选上下文不仅能提升准确性,还能降低成本与延迟。语义缓存可复用相似查询结果,但需注意命中率与多轮对话的匹配问题。
记忆层的风险与治理
记忆层若延迟高、易损坏或缺乏治理,复合智能可能适得其反。实验显示,云延迟下智能体冗余调查次数从0增至7.2次;摘要可能丢失关键信息,如“对花生过敏”变为“过敏”。未治理的数据访问易受攻击且不准确,如智能体在原始数据库上查询准确率仅11.4%。因此,需采用受控访问机制,如Redis Context Retriever,通过MCP工具提供安全的数据访问。
Q&A
什么是复合智能?
复合智能是指智能体通过存储、反思和检索过往经验来改进未来决策,而无需重新训练模型权重。它强调将相关数据整合,层层叠加新见解,使知识不断积累,而不是每次会话都重置。
复合智能的实现步骤有哪些?
复合智能的实现包括四个步骤:存储经验、反思经验、检索相关经验,以及利用检索到的经验指导行动。反思是将存储的经验转化为学习循环的关键步骤,没有反思,检索只能返回历史事件,无法判断其有效性或如何调整。
复合智能面临哪些挑战?
复合智能面临三大挑战:延迟、数据污染和治理。延迟会导致智能体重复工作;数据污染可能因压缩或恶意指令而丢失关键信息或改变行为;治理问题包括数据访问不受控,可能导致智能体出错或被利用。
Redis Iris 提供哪些服务来支持智能体?
Redis Iris 提供会话与长期记忆、语义缓存和上下文检索服务。具体包括 Redis Agent Memory(会话记忆和长期记忆)、Redis LangCache(语义缓存)和 Redis Context Retriever(上下文检索),这些服务帮助智能体高效运行。
为什么长上下文会导致智能体性能下降?
长上下文会导致性能下降,因为模型在长上下文中难以关注到相关信息,尤其是当相关信息位于上下文中间时。例如,GPT-3.5-Turbo 在相关段落位于中间时准确率下降超过20%,GPT-4o 在32K token 下准确率从99.3%降至69.7%。
如何解决长上下文带来的问题?
解决方案包括压缩(总结对话并开启新窗口)、即时检索(按需检索记忆而非预加载)、工具选择(只选择相关工具定义)和上下文隔离(将子任务交给子代理处理)。这些方法为模型提供精选的上下文,提高准确性。
语义缓存如何降低成本和延迟?
语义缓存通过存储提示和响应的向量嵌入,当新提示与缓存中的提示足够相似时,直接返回缓存响应,避免调用模型。Redis LangCache 在重复工作负载下可降低高达73%的推理成本,响应速度提升15倍。
复合智能的实证效果如何?
实证效果不一。Reflexion 在 ALFWorld 任务中报告了22%的绝对改进,但在 WebShop 上无改进;另一个编码基准中,技能库使最佳通过率提升14.6个百分点,但其他研究未能复制。高级记忆系统并不总能优于简单的 RAG 基线。