小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Opus 4.6和Sonnet 4.6现已普遍提供100万上下文窗口

Claude Opus 4.6和Sonnet 4.6现已在Claude平台上推出,提供完整的100万上下文窗口。Opus 4.6的定价为每百万标记5美元/25美元,Sonnet 4.6为3美元/15美元。新版本支持更高的请求量和更长的上下文,提升了准确性,用户可以直接加载大量数据,保持对话完整。

Opus 4.6和Sonnet 4.6现已普遍提供100万上下文窗口

Claude Claude · 2026-09-09T14:27:33Z
GPT-6不再收取超过272K部分超额费用 开发者可以在Codex里直接启用1M窗口

OpenAI调整GPT-6 Astra在Codex中的计费政策:使用该模型时,1M上下文窗口内超出272K部分不再额外收费,全部按标准费率计费,且缓存输入免费。但此优惠仅限GPT-6 Astra与Codex组合,其他模型如GPT-5.4/5.5/5.6超长部分仍按1.5-2倍费率收费。

GPT-6不再收取超过272K部分超额费用 开发者可以在Codex里直接启用1M窗口

蓝点网 蓝点网 · 2026-09-04T02:41:55Z
Claude Fable/Mythos 5.1发布 能力显著提升 缓存价格暴降75%

A社发布Claude Fable/Mythos 5.1模型,支持1M上下文窗口和128K输出,能力显著提升,尤其在科学和编程领域。API价格不变,但缓存读取价格暴降75%。Mythos 5.1放宽安全限制,仅限认证机构使用。

Claude Fable/Mythos 5.1发布 能力显著提升 缓存价格暴降75%

蓝点网 蓝点网 · 2026-09-02T05:30:11Z
Qwen 3.8 Flash 现已在 AI Gateway 上线

阿里发布Qwen 3.8 Flash模型,现已在AI Gateway上线。该模型支持文本和图像输入,上下文窗口达100万token,输出可达65k token,适用于编码、工具调用和多步代理工作流。用户可通过AI SDK设置模型,或连接Claude Code等编码代理使用。AI Gateway提供统一API、成本追踪、重试和故障转移等功能,且无加价和平台费用。

Qwen 3.8 Flash 现已在 AI Gateway 上线

Vercel News Vercel News · 2026-08-26T00:00:00Z
语言模型中管理小上下文窗口的策略

本文介绍管理大语言模型小上下文窗口的三种实用策略:滑动窗口截断法,通过FIFO队列保留最近对话,控制token使用;令牌预算结合检索增强生成,按比例分配上下文空间,确保只纳入最相关信息;以及滚动摘要、提示压缩和观察掩蔽等进阶方法。文章强调小上下文窗口能降低成本、减少延迟,并避免“迷失在中间”问题。

语言模型中管理小上下文窗口的策略

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-18T12:00:20Z
[指南] Codex可以通过配置文件开启1M上下文窗口 但配额消耗会更快

Codex现支持通过修改config.toml配置文件启用GPT-5.6模型的1M上下文窗口,默认272K,可在900K时自动压缩。但技术经理建议不修改,因1M窗口会更快消耗配额,当前配置已是最佳。ChatGPT订阅用户现也可体验此功能。

[指南] Codex可以通过配置文件开启1M上下文窗口 但配额消耗会更快

蓝点网 蓝点网 · 2026-08-17T03:47:17Z
AI并非在思维上胜过数学家,而是在记忆力上胜过他们

AI在数学竞赛中胜出,并非因推理更强,而是依靠近乎无限的上下文窗口,即外部工作记忆。人类数学受限于短期记忆容量,AI则能存储海量中间步骤,避免遗忘。其优势在封闭、可符号化的数学领域显著,但在开放日常推理中受限。本质是记忆碾压,而非深度思考超越。

AI并非在思维上胜过数学家,而是在记忆力上胜过他们

极道 极道 · 2026-08-16T09:07:00Z
深度求索发布DeepSeek-V4-Pro-0813 该模型从预览版正式进入GA阶段

深度求索发布DeepSeek-V4-Pro-0813版,从预览版正式进入GA阶段,模型ID不变,API定价暂未调整。该模型支持1M上下文窗口,提供Responses和Anthropic API,价格未变但已预告将涨价。目前未开源,基准测试数据待完善,内部数据显示多项测试较预览版大幅提升,编码、数学等核心任务保持开源领先,接近前沿闭源模型水平。

深度求索发布DeepSeek-V4-Pro-0813 该模型从预览版正式进入GA阶段

蓝点网 蓝点网 · 2026-08-13T05:30:30Z
Grok 4.6现已在AI Gateway上线

SpaceXAI推出Grok 4.6模型,现已在AI Gateway上线。该模型支持50万token上下文窗口,可处理文本和图像输入,提供低、中、高、超高四种推理级别,默认高。用户可通过AI SDK设置模型参数,或使用编码代理工具连接。AI Gateway提供统一API、成本追踪、重试和故障转移等功能,且无加价和平台费用。

Grok 4.6现已在AI Gateway上线

Vercel News Vercel News · 2026-08-12T00:00:00Z

本文面向重度使用Claude Code/Codex的工程师,解析上下文窗口、压缩与缓存三概念及其因果链。上下文是模型单次可见的输入输出总和,有硬上限且随token增多质量下降;压缩在窗口将满时用摘要替换历史,会永久丢失细节;缓存通过精确前缀匹配复用计算,失效仅增加成本与延迟,不影响正确性。实践建议:会话开头定好模型,中途只追加不修改,任务间用/clear,压缩趁缓存热时进行。

上下文、压缩与缓存:大模型使用者必须搞懂的三个概念

碎碎念 碎碎念 · 2026-08-02T14:50:00Z
AI代理中持久记忆与状态的五种架构模式

AI代理的持久记忆与状态设计有五种架构模式:工作缓冲处理短期执行,检查点实现容错暂停,语义记忆存储跨会话知识,事件日志记录历史反思,多范围隔离保障企业隐私。核心是区分状态快照与记忆机制,避免上下文窗口过载,并注意事实失效、安全隔离及存储增长管理。

AI代理中持久记忆与状态的五种架构模式

MachineLearningMastery.com MachineLearningMastery.com · 2026-07-27T12:00:46Z
AI 内存别只当概念看:它其实是状态管理问题

AI内存并非概念,而是工程化的状态管理问题,涉及上下文窗口、会话摘要、向量库等层次,核心难点在于数据边界、删除、隔离和回滚。小团队应保守实现,优先可解释、可删除、可观测的小记忆,并监控检索命中率和成本,避免模型沿旧信息误导。

AI 内存别只当概念看:它其实是状态管理问题

mongona news mongona news · 2026-07-19T22:39:08Z

Visual Studio的新模型选择器简化了模型的选择和比较,用户可以固定常用模型,查看详细规格,监控上下文窗口的使用情况,以避免对话超出限制。这些更新旨在提升工作效率,让用户更专注于项目构建。

选择、管理并充分利用您的模型

Visual Studio Blog Visual Studio Blog · 2026-07-15T14:28:43Z
GPT-6八月发布?150万上下文窗口真相

GPT-6预计在八月发布,参数规模可能达到10万亿,支持150万token的上下文窗口。然而,爆料人Lumina指出,超过25万到50万token后模型表现不佳,引发争议。AI行业面临效率与规模的挑战,单纯增加算力已不再有效,政治因素也影响发布进度。

GPT-6八月发布?150万上下文窗口真相

极道 极道 · 2026-07-12T23:16:00Z
长期运行代理的上下文窗口管理:策略与权衡

本文介绍了五种管理长期运行AI代理的上下文窗口策略,包括滑动窗口、递归摘要、结构化状态管理、基于RAG的短期上下文和动态上下文路由。每种策略都有其优缺点,如信息丢失、检索盲点和维护复杂性。成功的自主代理应用应关注智能架构,而非追求无限记忆。

长期运行代理的上下文窗口管理:策略与权衡

MachineLearningMastery.com MachineLearningMastery.com · 2026-06-30T12:00:17Z
上下文窗口不是记忆:AI代理开发者需要理解的内容

本文探讨了AI代理的上下文窗口与记忆的区别。上下文窗口类似于无状态的草稿纸,无法持久保存信息。通过检索增强生成、压缩和摘要等技术,代理可以更有效地管理信息。真正的记忆持久性需要代理作为数据库管理员,而非数据库本身。理解这些概念有助于优化AI代理的性能。

上下文窗口不是记忆:AI代理开发者需要理解的内容

MachineLearningMastery.com MachineLearningMastery.com · 2026-06-24T12:00:18Z
智谱开源GLM-5.2登顶榜首:本地运行需1.5TB显存门槛极高

GLM-5.2是一个7530亿参数的开源大模型,具有百万token的上下文窗口和创新架构。其完整权重为1.51TB,普通硬件无法支持。最佳本地运行选择为256GB内存的Mac Studio,生成速度为每秒3-9个token。大多数用户应选择云GPU租用或API调用,以降低成本和技术门槛。

智谱开源GLM-5.2登顶榜首:本地运行需1.5TB显存门槛极高

极道 极道 · 2026-06-19T03:06:00Z
如何应对RAG系统中的小上下文窗口限制

检索增强生成(RAG)是一种通过检索相关材料并将其整合到模型提示中以提升回答质量的方法。文章探讨了RAG在小上下文窗口下的局限性,并提出通过文档摘要、块摘要和原始块的层次化索引来优化检索过程的解决方案。关键在于使用摘要进行检索,使用原始块进行回答,并通过上下文预算管理信息量,从而在资源有限的情况下提高RAG系统的可靠性和可调试性。

如何应对RAG系统中的小上下文窗口限制

freeCodeCamp.org freeCodeCamp.org · 2026-06-18T00:09:31Z
GLM 5.2现已在AI Gateway上线

GLM 5.2现已在AI Gateway上线,适用于长期任务,支持更大上下文窗口(1M tokens),提高了任务执行的可靠性和一致性。用户可通过AI SDK使用该模型,享受无额外费用的API调用服务。

GLM 5.2现已在AI Gateway上线

Vercel News Vercel News · 2026-06-16T00:00:00Z
Nvidia最新模型现已上线

Nvidia发布了Nemotron 3 Ultra模型,拥有5500亿参数,支持高达100万标记的上下文窗口。该模型速度显著提升,能节省用户30%的成本。尽管在某些基准测试中落后于中国模型,但在处理复杂任务和多语言支持方面表现出色。模型的权重和数据集将公开。

Nvidia最新模型现已上线

The New Stack The New Stack · 2026-06-04T16:12:33Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码