DeepSeek-V4.1为降低长上下文agent负载成本,将滑窗KV从SSD移至主机内存池,仅保留几分钟;全局KV仍存SSD至少72小时。滑窗KV丢失后用SWA Bounded Replay只回放128个token近似重建,代价是结果不精确。CSA2跨层共享在流水线并行下通过shadow indexer等三项支持训练。多模态训练有三处系统改动。
DeepSeek-V4.1 的 CSA2 通过跨层共享压缩全局 KV,将 KV cache 从每 token 5.41 条降至 2.5 条。每层全局注意力包含 main KV、indexer K、top-k 索引和注意力四部分,前三者可跨层共用,形成 Full、Reindex、Reuse 三种模式:Full 自建 KV 并选索引,Reindex 复用 KV 但重选索引,Reuse 两者均复用。38 层中仅 4 层为 Full,压缩算子去除了重叠与位置偏置,indexer K 改由 main KV 投影。
DeepSeek-V4.1-Flash主干552B参数、40层,另有196B Engram表。核心是压缩KV cache:全局KV降至890字节/token,约为V4-Flash的四分之一,磁盘缓存仅八分之一。前20层为encoder,后20层为decoder,decoder全局KV由第20层投影共享。prefill每token激活8B、只算20层,decode为16B。引入CSA2共享池、Single-Pass mHC、Engram、DSpark与视觉通路。
DeepSeek注意力结构历经六轮迭代:MHA为基线,GQA减少KV头数,MLA将KV低秩压缩至576维latent,DSA用indexer选top-2048条以节省算力,CSA每4个token压缩并做块级检索,HCA压缩率达128且免检索,CSA2跨层共享KV并降至FP4。核心是逐代削减KV cache或注意力计算量,KV cache从V1的480KiB降至V4.1的890B。
完成下面两步后,将自动完成登录并继续当前操作。