➡️
继续阅读
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
Kimi K3 模型结构(10):RL 与服务,状态住在哪里
本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间...
-
关于班主任不是主科老师的问题
初中开学家长会上,班主任由历史老师担任,引发家长疑虑。作者分析可能原因:学生数量高峰致师资不足,副科老师获机会;主科老师因班主任工作繁重不愿担任;副科老师...
-
CPU + GPU:为何AI平台工程是一个异构基础设施问题
AI基础设施不应只关注GPU,而应视为CPU、内存、存储和网络协同工作的整体系统。平台团队需匹配各阶段资源需求,而非孤立优化GPU。通过Kubernete...
-
企业选择 RTC 推流服务时应该关注哪些指标?
选择RTC推流服务时,需核实四类指标:体验指标(延迟、卡顿率、成功率)要明确统计口径;网络能力(抗丢包、抖动吸收、节点覆盖)决定体验上限;可观测性(质量大...
-
显存账本:每张卡上住着什么,搬走付什么
本文介绍训练大模型时显存管理的通用记账方法。显存分为五类:权重、梯度、优化器状态、激活和通信缓冲。前三类由参数量和并行度决定,激活随输入长度增长,优化空间...