本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning indexer打分选择top-1024块。Indexer源自V3.2的DSA,采用64头128维、ReLU加权和FP4量化,通过KL散度模仿主注意力分布训练。V4将索引对象从token改为压缩块,query共享低秩latent。文章详述了indexer实现细节、一层CSA的完整维度流程及参数统计。
完成下面两步后,将自动完成登录并继续当前操作。