DeepSeek-V4.1 的 CSA2 通过跨层共享压缩全局 KV,将 KV cache 从每 token 5.41 条降至 2.5 条。每层全局注意力包含 main KV、indexer K、top-k 索引和注意力四部分,前三者可跨层共用,形成 Full、Reindex、Reuse 三种模式:Full 自建 KV 并选索引,Reindex 复用 KV 但重选索引,Reuse 两者均复用。38 层中仅 4 层为 Full,压缩算子去除了重叠与位置偏置,indexer K 改由 main KV 投影。
完成下面两步后,将自动完成登录并继续当前操作。