内容提要
字节Seed团队发现DeepSeek-V4存在相位敏感性:同一问题仅改变无关Token数量,答案会以4个Token为周期反复对错,128K检索准确率最大相差40.2个百分点。原因指向其分块KV Cache压缩,不同压缩窗口位置的信息检索能力系统性不同。自训模型证实该现象随压缩步长变化,全注意力基线无此问题。后训练可缩小差距,但评估需按相位分别测试。
延伸解读
相位敏感性:长上下文检索的隐藏陷阱
字节Seed团队发现,DeepSeek-V4系列模型在长上下文检索中表现出相位敏感性:同一信息仅改变其在输入中的位置,检索准确率最大可相差40.2个百分点。这种周期性波动与模型采用的分块KV Cache压缩步长直接相关,步长为4时表现以4个Token为周期起伏。这意味着,模型对信息的记忆能力并非均匀,而是取决于信息相对于压缩窗口边界的位置。
评估启示:平均分可能掩盖位置偏差
常规评测通常汇总所有测试结果计算平均分,但相位敏感性的存在意味着,模型在某些位置表现优异,在另一些位置可能明显掉队,而平均分依然不错。因此,评估采用分块KV Cache压缩的模型时,应将同一信息置于不同压缩相位分别测试,才能全面了解其长上下文检索能力的真实表现。
技术权衡:压缩效率与检索公平性的矛盾
分块KV Cache压缩能显著降低长上下文推理的内存和计算成本,但代价是模型对不同位置的信息可能不再一视同仁。研究显示,即使Key和Value位于同一压缩窗口内,不同位置的检索准确率也能相差很大。后训练和架构迭代可以缩小这种差距,例如DeepSeek-V4.1-Flash-0910的准确率差距降至6.1个百分点,但周期性差异依然存在。
Q&A
字节Seed团队发现DeepSeek-V4存在什么特殊现象?
字节Seed团队发现DeepSeek-V4存在相位敏感性:同一问题仅改变无关Token数量,答案会以4个Token为周期反复对错,128K检索准确率最大相差40.2个百分点。
为什么DeepSeek-V4会出现时强时弱的表现?
原因指向其分块KV Cache压缩,不同压缩窗口位置的信息检索能力系统性不同,导致模型表现随信息位置周期性变化。
相位敏感性对长上下文检索准确率的影响有多大?
在128K长上下文检索测试中,同一条信息仅换位置,DeepSeek-V4系列模型的检索准确率最高能拉开40.2个百分点。
自训模型实验如何验证相位敏感性与KV Cache压缩的关系?
以Qwen3-0.6B为基础构造多种KV Cache压缩方案,所有分块压缩模型都出现与压缩步长对应的周期性变化,而全注意力基线模型无此问题。
后训练能缓解DeepSeek-V4的相位敏感性吗?
后训练可以缩小差距,例如DeepSeek-V4-Flash-0731的准确率差距缩小到19.1个百分点,但周期性差异依然存在。
评估采用分块KV Cache压缩的模型时需要注意什么?
不能只看整体检索准确率,还需把同一条信息放到不同压缩相位上分别测试,因为常规评测的平均分可能掩盖位置带来的性能偏差。