➡️
继续阅读
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
Kimi K3 模型结构(10):RL 与服务,状态住在哪里
本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间...
-
HyperAI 上新丨MCP接入开发工作流;PyTorch/AI for Beginners/TVM等系列教程上线;AI顶会资源检索功能再升级
HyperAI平台推出三项更新:上线MCP服务器,支持在Claude Code和Cursor中通过自然语言管理算力、数据集等资源;新增AI顶会(如AAAI...
-
企业选择 RTC 推流服务时应该关注哪些指标?
选择RTC推流服务时,需核实四类指标:体验指标(延迟、卡顿率、成功率)要明确统计口径;网络能力(抗丢包、抖动吸收、节点覆盖)决定体验上限;可观测性(质量大...
-
smolts:面向教学语言的教学型IDE
作者开发了名为smolts的教学IDE,用于SMoL教学语言,灵感来自Stacker项目。该IDE支持S表达式编程,可逐步执行并可视化显示continua...
-
显存账本:每张卡上住着什么,搬走付什么
本文介绍训练大模型时显存管理的通用记账方法。显存分为五类:权重、梯度、优化器状态、激活和通信缓冲。前三类由参数量和并行度决定,激活随输入长度增长,优化空间...