➡️
继续阅读
-
Kimi K3 模型结构(10):RL 与服务,状态住在哪里
本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间...
-
押中SpaceX的硅谷老将,把票投给了一家中国世界模型公司
AI虽擅长语言理解,却缺乏对物理世界的认知与决策能力,难以应对暴雨洪水等真实灾害。飞渡科技推出空间智能“峥嵘大模型”,构建全栈基础设施,通过动态边界控制、...
-
自建 RTC 推流与使用第三方 SDK 哪个更划算?
自建RTC与第三方服务的成本比较,核心在于工程质量、运维损耗和机会成本等隐性成本。自建需满足规模大、团队成熟、网络可控等条件;否则,第三方SDK更划算,因...
-
为什么你的网站没有被 ChatGPT 推荐?让网站在 AI 对话中被提到的五个可操作方向
大语言模型推荐网站基于训练数据中的品牌与关键词关联,而非实时搜索。提升被推荐概率需在公开网络积累高质量、多来源的提及,包括语义密度、结构化内容、具体数据、...
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
显存账本:每张卡上住着什么,搬走付什么
本文介绍训练大模型时显存管理的通用记账方法。显存分为五类:权重、梯度、优化器状态、激活和通信缓冲。前三类由参数量和并行度决定,激活随输入长度增长,优化空间...