➡️
继续阅读
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
Kimi K3 模型结构(10):RL 与服务,状态住在哪里
本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间...
-
告别重复手工迁仓,码道MCP+Skill实现仓库批量迁移
本文介绍华为云码道代码智能体配合CodeArts MCP与Skill实现代码仓库批量迁移的实操案例。相比传统手动逐仓填表,该方案通过一份清单文件即可完成多...
-
企业选择 RTC 推流服务时应该关注哪些指标?
选择RTC推流服务时,需核实四类指标:体验指标(延迟、卡顿率、成功率)要明确统计口径;网络能力(抗丢包、抖动吸收、节点覆盖)决定体验上限;可观测性(质量大...
-
Linux Kernel 7.1已经结束生命周期不再提供更新 用户应尽快升级到7.2系列
Linux Kernel 7.1系列已结束支持,最终版7.1.13于9月2日发布,含76项修复。该非LTS版本生命周期短,官方建议用户升级至7.2系列或L...
-
用 ChatGPT 定时任务做一个 Hacker News 中文摘要网站
作者利用ChatGPT定时任务自动抓取Hacker News前30条,生成中文摘要并筛选兴趣内容,通过Eleventy构建静态网站hn-digest并发布...