小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
推理服务的缓存与调度:前缀、多级存储、集群路由

本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用write-back策略在GPU、DRAM、SSD间分层存储;集群层面用一致性哈希实现缓存亲和,并按请求类别分配预算以应对长请求突发。

推理服务的缓存与调度:前缀、多级存储、集群路由

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T23:30:00Z
Claude Fable/Mythos 5.1发布 能力显著提升 缓存价格暴降75%

A社发布Claude Fable/Mythos 5.1模型,支持1M上下文窗口和128K输出,能力显著提升,尤其在科学和编程领域。API价格不变,但缓存读取价格暴降75%。Mythos 5.1放宽安全限制,仅限认证机构使用。

Claude Fable/Mythos 5.1发布 能力显著提升 缓存价格暴降75%

蓝点网 蓝点网 · 2026-09-02T05:30:11Z

Cloudflare实习生Aashi Patel开发了Cache Transcoding系统,利用Zstandard压缩算法在Pingora中编码缓存资产,将可压缩文本平均缩小至原大小的三分之一。该系统以少量CPU开销换取存储和带宽节省,测试中处理了超百万请求,验证了架构可行性,未来将优化压缩级别和参数。

我们如何利用Zstandard和Pingora节省PB级缓存存储

The Cloudflare Blog The Cloudflare Blog · 2026-09-01T12:59:00Z
AI聊天机器人在按下回车与输出首个词之间发生了什么?

AI聊天机器人从按下回车到输出首个词之间,经历约十几个阶段:组装包含系统提示、工具定义、记忆和对话历史的文档,进行输入安全检查,将文本分词,排队与其他请求共享硬件,然后分预填充和解码两阶段生成。长对话因重新处理全部历史而变慢变贵,缓存和流式技术优化了性能,工具调用则形成循环。

AI聊天机器人在按下回车与输出首个词之间发生了什么?

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-31T15:31:20Z
我给网站加了CDN缓存,结果反而更慢了。这是我本该先算的账。

在静态网站前添加CDN缓存后,网站反而变慢,慢页面从38个增至75个。原因是缓存未命中时CDN处理更耗时,且爬虫总是冷请求,命中率极低。计算发现需67%命中率才能持平,但实际接近零。建议部署前先计算盈亏平衡命中率,并诚实评估真实命中率。

我给网站加了CDN缓存,结果反而更慢了。这是我本该先算的账。

freeCodeCamp.org freeCodeCamp.org · 2026-08-27T18:58:19Z

Cloudflare通过五项优化,将1.1.1.1 DNS缓存每条目内存占用从953字节降至420字节,节省约100TB内存。优化包括用Box替代Vec、合并列表、省略重复所有者、装箱枚举及存储原始数据,同时提升插入吞吐量43%和降低查找延迟19%。

我们如何通过优化1.1.1.1的DNS缓存节省了100TB内存

The Cloudflare Blog The Cloudflare Blog · 2026-08-27T17:02:35Z

作者在博客缓存优化中遇到问题:修改文章后页面迟迟不更新。排查发现,Apollo的InMemoryCache在ssrMode下将network-only策略静默转为cache-first,导致请求被内存缓存拦截,LruLink缓存层形同虚设。改用no-cache策略后修复,并补充回归测试防止复发。

缓存复仇记:挡在我完美缓存前面的,是那个更傻的缓存

九仞之行 九仞之行 · 2026-08-27T01:36:00Z
Yac 2.4.0发布 - 小值读取性能提升64%

Yac 2.4.0发布,主要改进包括:内嵌小值到指针槽位,避免占用values内存,提升读取性能64%;用LZ4替换FastLZ压缩,解压更快;get()支持$default参数区分未命中与假值;dump()支持分页及元信息。实际测试中内存占用从23.5M降至12.4M,吞吐显著提升,适合WordPress缓存场景。

Yac 2.4.0发布 - 小值读取性能提升64%

风雪之隅 风雪之隅 · 2026-08-26T04:43:10Z
用Yac给WordPress做缓存:比Memcached快19%

作者用自研PHP扩展Yac替换WordPress的Memcached对象缓存,实测吞吐提升约19%,延迟降低15%。Yac将缓存存于FPM共享内存,免去网络往返,优势恒定。文章提供安装配置方法,并指出单机场景最适合,多机集群仍需Memcached/Redis。

用Yac给WordPress做缓存:比Memcached快19%

风雪之隅 风雪之隅 · 2026-08-20T12:04:11Z

作者优化博客缓存与性能:合并四个GraphQL请求,耗时从1100ms降至446ms;发现WPGraphQL默认限制100条数据,改用分页拉取;开发LruLink缓存机制,实现SWR自动补货、分级TTL和用户隔离。最后并行开发三个功能分支,并预告下篇关于MC皮肤吉祥物的故事。

我的缓存会自己补货:LruLink 与三个并行功能分支

九仞之行 九仞之行 · 2026-08-19T08:03:00Z
选择与集成LLM API:实用指南

本文介绍LLM API调用工程化实践:需权衡延迟、质量、成本与数据合规,选择合适访问模式;通过提示缓存和语义缓存降低成本,用指数退避处理限流,并以外置会话存储弥补API无状态缺陷。Redis Iris提供语义缓存、代理记忆等托管服务,构建AI上下文层,优化调用性能与成本。

选择与集成LLM API:实用指南

Redis Blog Redis Blog · 2026-08-17T00:00:00Z
DeepSeek API 全面涨价,8月17日起,最高12倍涨幅

DeepSeek官网公布API新价格,deepseek-v4-flash与pro模型全面涨价,其中高峰时段pro模型命中缓存价格从0.025涨至0.30,涨幅达12倍。新价格自8月17日起生效。

DeepSeek API 全面涨价,8月17日起,最高12倍涨幅

小众软件 小众软件 · 2026-08-14T05:29:21Z
DeepSeek API涨价也震惊国外开发者 原以为最多翻倍没想到是好几倍

DeepSeek API宣布自2026年8月17日起大幅涨价,分闲时和高峰时段定价,高峰时段为每日9-12点和14-18点。以V4 Pro为例,命中缓存高峰涨幅达1100%,输出涨幅350%。此前开发者预期最多翻倍,实际涨幅远超预期,引发竞争力下降担忧。

DeepSeek API涨价也震惊国外开发者 原以为最多翻倍没想到是好几倍

蓝点网 蓝点网 · 2026-08-14T03:56:29Z

本文深入解析Ceph BlueStore的读路径,涵盖onode缓存查找、extent_map展开、blob解引用及BlockDevice读取,并详述解压与checksum验证流程。重点探讨2Q缓存算法如何抵抗扫描污染,以及checksum失败时的分层处理与检测边界。同时讨论压缩数据读取的性能瓶颈和缓存设计中的争议点。

【Ceph RADOS】BlueStore 读路径:onode、blob、缓存与 checksum 失败模式

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-14T00:00:00Z
提示缓存与微调:成本与延迟决策框架

本文探讨了提示缓存与微调在降低AI代理系统成本与延迟方面的差异及选择框架。提示缓存通过存储重复提示结果减少计算开销,适合静态文档和重复查询;微调通过LoRA等技术训练模型提升特定任务效率,适合格式一致性和个性化需求。混合策略可兼顾两者优势,实现高效架构。

提示缓存与微调:成本与延迟决策框架

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-10T12:00:54Z
当前缀缓存遇见KDA:Mooncake如何为Kimi K3实现Day-0支持

Kimi K3采用KDA与MLA混合注意力架构,引入循环状态缓存,改变传统KV缓存语义。Mooncake与SGLang、vLLM、TokenSpeed合作,实现KDA感知的检查点管理、跨实例缓存复用及统一数据传输平面,支持百万级长上下文推理,降低冗余计算,提升多轮对话和智能体任务效率。

当前缀缓存遇见KDA:Mooncake如何为Kimi K3实现Day-0支持

Home | KVCache.ai Home | KVCache.ai · 2026-08-03T00:00:00Z

本文面向重度使用Claude Code/Codex的工程师,解析上下文窗口、压缩与缓存三概念及其因果链。上下文是模型单次可见的输入输出总和,有硬上限且随token增多质量下降;压缩在窗口将满时用摘要替换历史,会永久丢失细节;缓存通过精确前缀匹配复用计算,失效仅增加成本与延迟,不影响正确性。实践建议:会话开头定好模型,中途只追加不修改,任务间用/clear,压缩趁缓存热时进行。

上下文、压缩与缓存:大模型使用者必须搞懂的三个概念

碎碎念 碎碎念 · 2026-08-02T14:50:00Z
Furion 新增远程请求缓存和配额后,我更关心它怎么进生产

Furion v4.9.9.51新增HTTP远程请求的ETag缓存和配额策略,旨在简化开发并提升稳定性。ETag减少重复请求,配额策略防止系统被远程调用拖垮。升级时需谨慎,建议先在非主干项目测试,关注缓存边界、超时和回滚路径。普通团队可借此整理远程调用,但不必盲目追新。

Furion 新增远程请求缓存和配额后,我更关心它怎么进生产

mongona news mongona news · 2026-07-31T22:39:29Z
Webpack v5.109.2:别只看补丁号,构建缓存和路径细节更容易坑团队

Webpack v5.109.2 发布补丁更新,修复了别名指向.js包目录、CSS sourcemap命名及清理缓存文件等问题。升级前建议在构建量大的项目测试,关注缓存增长和sourcemap映射。若遇alias、sourcemap或缓存膨胀问题可优先验证,稳定项目无需急于升级,先低风险试用。

Webpack v5.109.2:别只看补丁号,构建缓存和路径细节更容易坑团队

mongona news mongona news · 2026-07-29T22:38:58Z

Kubernetes控制器利用本地缓存,通过list+watch机制与API服务器同步,避免直接查询。读取操作快速但可能返回旧数据,写入需处理资源版本冲突。索引可优化查询但增加内存开销,缓存可配置以平衡性能与资源。

controller-runtime缓存的工作原理及其为何不会使API服务器崩溃

Kubernetes Blog Kubernetes Blog · 2026-07-29T18:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码