字节找到了DeepSeek时强时弱的原因

字节找到了DeepSeek时强时弱的原因

💡 原文中文,约3600字,阅读约需9分钟。
📝

内容提要

字节Seed团队发现DeepSeek-V4存在相位敏感性:同一问题仅改变无关Token数量,答案会以4个Token为周期反复对错,128K检索准确率最大相差40.2个百分点。原因指向其分块KV Cache压缩,不同压缩窗口位置的信息检索能力系统性不同。自训模型证实该现象随压缩步长变化,全注意力基线无此问题。后训练可缩小差距,但评估需按相位分别测试。

🔎

延伸解读

相位敏感性:长上下文检索的隐藏陷阱

字节Seed团队发现,DeepSeek-V4系列模型在长上下文检索中表现出相位敏感性:同一信息仅改变其在输入中的位置,检索准确率最大可相差40.2个百分点。这种周期性波动与模型采用的分块KV Cache压缩步长直接相关,步长为4时表现以4个Token为周期起伏。这意味着,模型对信息的记忆能力并非均匀,而是取决于信息相对于压缩窗口边界的位置。

评估启示:平均分可能掩盖位置偏差

常规评测通常汇总所有测试结果计算平均分,但相位敏感性的存在意味着,模型在某些位置表现优异,在另一些位置可能明显掉队,而平均分依然不错。因此,评估采用分块KV Cache压缩的模型时,应将同一信息置于不同压缩相位分别测试,才能全面了解其长上下文检索能力的真实表现。

技术权衡:压缩效率与检索公平性的矛盾

分块KV Cache压缩能显著降低长上下文推理的内存和计算成本,但代价是模型对不同位置的信息可能不再一视同仁。研究显示,即使Key和Value位于同一压缩窗口内,不同位置的检索准确率也能相差很大。后训练和架构迭代可以缩小这种差距,例如DeepSeek-V4.1-Flash-0910的准确率差距降至6.1个百分点,但周期性差异依然存在。

❓

Q&A

字节Seed团队发现DeepSeek-V4存在什么特殊现象?

字节Seed团队发现DeepSeek-V4存在相位敏感性:同一问题仅改变无关Token数量,答案会以4个Token为周期反复对错,128K检索准确率最大相差40.2个百分点。

为什么DeepSeek-V4会出现时强时弱的表现?

原因指向其分块KV Cache压缩,不同压缩窗口位置的信息检索能力系统性不同,导致模型表现随信息位置周期性变化。

相位敏感性对长上下文检索准确率的影响有多大?

在128K长上下文检索测试中,同一条信息仅换位置,DeepSeek-V4系列模型的检索准确率最高能拉开40.2个百分点。

自训模型实验如何验证相位敏感性与KV Cache压缩的关系?

以Qwen3-0.6B为基础构造多种KV Cache压缩方案,所有分块压缩模型都出现与压缩步长对应的周期性变化,而全注意力基线模型无此问题。

后训练能缓解DeepSeek-V4的相位敏感性吗?

后训练可以缩小差距,例如DeepSeek-V4-Flash-0731的准确率差距缩小到19.1个百分点,但周期性差异依然存在。

评估采用分块KV Cache压缩的模型时需要注意什么?

不能只看整体检索准确率,还需把同一条信息放到不同压缩相位上分别测试,因为常规评测的平均分可能掩盖位置带来的性能偏差。

🏷️

标签

➡️

继续阅读