内容提要
DeepSeek发布V4.1-Flash,采用FP4精度、CSA2层间缓存复用和CED编解码架构,将每token全局KV缓存压缩至890字节,较初代缩小437倍,百万token会话显存从300GB降至1GB以下。模型总参数552B,Prefill仅激活8B。Agent基准超越Opus 5,但纯推理较弱,且V4 Pro突然下线引发开发者不满。
延伸解读
缓存压缩的代价:能力画像偏移
V4.1-Flash通过FP4精度、CSA2层间复用和CED架构将KV缓存压至890字节,但代价是能力画像的偏移。Agent基准超越Opus 5,纯推理却落后,说明“读多写少”设计更适合工具调用场景,而非深度思考任务。开发者需根据实际负载选择模型,而非盲目追求缓存压缩。
V4 Pro下线:基础设施切换的阵痛
DeepSeek突然宣布V4 Pro下线,仅给四天迁移期,引发开发者不满。模型是生产环境的基础设施,Prompt调试、输出格式、工具调用逻辑都依赖特定模型行为。切换后即使平均能力更强,也可能因指令理解差异导致系统报错。缺乏并行迁移期和回退能力,对已上线系统和科研复现都是风险。
压缩的边界:未解决的近似误差
论文承认SWA Bounded Replay的状态重建是近似的,CSA2的跨层索引复用可能遗漏候选池外的关键信息。这些近似在边界场景下可能导致能力退化,但缺乏系统性测试数据。890字节的缓存虽降低部署门槛,却增加了模型行为的不确定性,开发者需关注长上下文和复杂检索任务中的稳定性。
成本优势与场景匹配
V4.1-Flash缓存命中价格降至每百万token 0.003美元,并发限制从500提升至2500,单卡即可支撑百万token会话。对高频Agent用户,账单变化比基准分数更实际。但科学密集型Agent任务仍落后于Opus 5,选择时需权衡成本与任务类型,避免因缓存压缩牺牲关键场景的可靠性。
Q&A
DeepSeek V4.1-Flash的KV缓存压缩到了多少?相比初代缩小了多少倍?
每token全局KV缓存占用仅890字节,比初代DeepSeek-V1缩小了437倍。
DeepSeek V4.1-Flash是如何实现KV缓存大幅压缩的?
通过三条路线合力:FP4精度从训练阶段直接压到4比特、CSA2让层间共享缓存和索引、SWA Bounded Replay让持久化缓存不再存储滑窗状态。
DeepSeek V4.1-Flash的CED架构有什么特别之处?
CED架构将40层劈成两半:前20层为因果编码器,后20层为解码器。解码器层的全局KV缓存直接从第20层编码器的输出投影出来,Prefill阶段FLOPs接近砍半。
DeepSeek V4.1-Flash在Agent任务和纯推理任务上的表现如何?
Agent基准测试超越Claude Opus 5:Terminal-Bench 2.1拿到90.6%,DeepSWE v1.1拿到74.2%。但纯推理较弱:GPQA Diamond只拿到90.9%,落后于Opus 5的93.4%和GPT-5.6 Sol的94.1%。
DeepSeek V4 Pro下线引发了什么争议?
DeepSeek宣布V4 Pro有序下线,所有请求自动路由到V4.1-Flash,且没有给新旧模型并行迁移期,距离切换不到四天。开发者社区不满,因为生产环境Prompt需重新调试,科研团队实验无法复现。
DeepSeek V4.1-Flash的缓存压缩存在哪些潜在问题?
论文承认两个遗留问题:SWA Bounded Replay的近似性可能在某些边界条件下导致退化;CSA2的索引选择误差,候选池限制为16384个位置,关键信息可能不在池中。