Codex项目近期合并多项PR,放弃上下文压缩机制,改为通过历史记录和持久笔记继续任务。模型可主动开启新窗口,丢弃旧内容,新窗口通过笔记恢复任务状态,需细节时查询历史。此举避免压缩导致的信息丢失和算力浪费,提升长任务执行效率,但功能仍在开发中。
论文发现长程AI代理在上下文压缩时,安全规则与日志同比例被摘要,导致规则保真度骤降,称“压缩悬崖”。提出Knowledge Triage框架,用确定性算子按类型保留知识,显著提升规则保留率,并在医疗、零售等基准上表现更优,同时开源相关语料与实现。
FrontierAgent是Apodex开源的agent运行时,针对长程agent失败的两个量化问题:上下文压缩触发过晚导致子agent被端点拒绝,以及压缩后模型重复发送相同搜索。解决方案包括投影下一次请求大小触发压缩,以及通过观察者回滚重复工具调用。文章还涉及任务板、路径授权等细节,强调基于真实失败数据设计机制。
本文介绍Hermes Agent的长会话架构,核心是稳定Prompt前缀以命中缓存、分层压缩上下文(保留头尾总结中段)、用SessionDB存储快照,并通过SQLite租约机制防止多进程并发写坏历史。压缩失败时有回退或暂停策略,确保长期会话的可靠性与可恢复性。
OpenAI发现GPT-5.6 Sol在ARC-AGI-3基准测试中得分低,源于官方框架丢弃推理和滚动截断,而非模型能力不足。启用推理保留和上下文压缩后,得分从7.8%升至38.3%,输出token减少六倍。这揭示基准测试测的是框架记忆管理,而非模型智商,建议评估应使用更贴近实际场景的设置。
本文介绍了CompactionRL,一种将上下文压缩机制融入强化学习的方法。该方法通过联合优化任务执行和摘要生成,帮助长程Agent在复杂任务中有效管理信息,提升性能。实验结果表明,CompactionRL在多个基准上表现优异,并成功应用于GLM-5.2模型的生产级训练,展示了其在工业界的实用性和可扩展性。
Headroom 是一款针对 AI Agent 的上下文压缩工具,通过内容感知压缩减少 token 使用量,保持回答质量。它在请求发往 LLM 前剥离冗余内容,显著降低成本。使用 Headroom 可在长会话中节省 60% 至 92% 的 token,提升效率。
文章讨论了上下文压缩在长时间任务中的重要性,指出随着会话历史的增加,代理可能会遗忘之前的信息,导致性能下降。上下文压缩通过将会话内容浓缩为结构化表示,帮助代理在保持性能的同时继续工作。文章介绍了可逆压缩和有损摘要等不同压缩策略,并强调了Redis Iris在实时上下文管理中的作用,提供高效的内存、检索和数据集成解决方案。
Claude Code采用五层级联结构进行上下文压缩,以应对复杂编码会话中的信息过载。通过控制数据输入、缓存微压缩、基于时间的压缩、会话记忆压缩和完整压缩等策略,系统在减少信息损失的同时降低成本,旨在降低用户困扰。
Claude Code 通过五层级联系统优化上下文压缩,旨在降低延迟和成本。系统控制数据量,采用磁盘存储、缓存编辑和会话记忆等方法,逐步减少信息损失。只有在压缩失败时,才使用昂贵的 LLM 摘要,设计强调尊重缓存,以确保高效性和低成本。
本文讨论了Claude代码的上下文压缩策略,重点在于如何处理用户消息中的工具结果。通过迭代替换过长的工具结果为预览,确保消息总长度不超过设定上限。同时,文章提到在上下文过大时进行自动压缩,以保持有效的上下文窗口。
本文讨论了Claude代码的上下文压缩策略,重点在于如何处理用户消息中的工具结果,以避免字符限制超标。通过迭代替换较长的工具结果为预览,确保每条消息的字符数不超过设定上限。同时,文章提到在上下文过大时进行自动压缩,以维持有效的对话状态。
Anthropic发布了Claude Opus 4.6,采用动态编排技术,解决了长时间工作中的上下文退化和过度思考问题。新版本引入自适应思维控制和上下文压缩,支持更深的思维链。Opus 4.6在多个云平台上可用,最大输出128K令牌,1M令牌的上下文窗口提升了性能。尽管在某些任务上表现不佳,但在多个评估中仍取得领先成绩。
Anthropic推出Claude Sonnet 4.6,性能接近Opus 4.6,但价格更低。该模型在办公和编码任务中表现优异,成为开发者的首选,并支持上下文压缩和自适应思维,现为claude.ai的默认模型。
上下文工程是优化大型语言模型(LLM)性能的学科,专注于输入设计与组织,通过提供丰富的上下文信息来提高模型输出的准确性和相关性。关键技术包括系统提示优化、提示组合和上下文压缩。尽管面临延迟和工具互操作性等挑战,掌握上下文构建将是提升模型智能的关键。
RAG(检索增强生成)系统通过上下文压缩技术提高检索效率和答案准确性。上下文压缩包括选择性保留、摘要和句子抽取三种方式,能有效减少无关信息。通过预处理、向量化、压缩和生成答案,RAG系统优化文档处理,节省内存并加快推理速度。
本研究探讨了一种基于要点的上下文压缩方法,以提升大语言模型处理长上下文的能力。尽管在某些任务中表现良好,但在合成回忆等方面仍面临挑战。为此,提出了细粒度自编码和段落令牌重要性评估两种策略。
本研究探讨大型语言模型的压缩技术,提出二元评价指标(ERE和SRE),表明GPT-4能够有效压缩文本并保留语义。研究涵盖量化、修剪等方法,介绍LLM-KICK评估协议,分析压缩对推理效率的影响,并提出新型上下文压缩方法,显著降低内存和计算开销,提升模型性能。
本文探讨了大型语言模型(LLM)在处理长篇内容时的性能提升方法,包括查询引导压缩器(QGC)和上下文压缩技术。这些方法显著降低了推理成本和时间,同时提高了模型的准确性和效率。新技术LLoCO和LeanContext使LLM在长上下文问答任务中表现优异,减少了内存占用和计算成本,为未来研究提供了重要见解。
本文介绍了一种新型上下文压缩方法,适用于Transformer语言模型,能够将上下文压缩至原来的五分之一,同时保持性能。该方法利用Infini-attention技术和语义压缩,显著提高推理效率,减少内存和时间开销,特别适合长文本任务。实验结果表明,该方法在问答和摘要等任务中表现优异,提升了大型语言模型的处理能力。
完成下面两步后,将自动完成登录并继续当前操作。