内容提要
DeepSeek V4 Pro在官方测试中得分87.9,但第三方仅得54.68,差距33分。原因在于官方使用Harness极简模式,该模式是模型训练时的原生环境,能激活其最强能力。切换模式后分数下降,但通过首轮锚定极简工具可恢复高分。这暴露了Agent能力评测对测试框架的依赖,引发对评测标准的反思。
延伸解读
评测分数差异的根源:测试框架的“入口”效应
文章指出,DeepSeek V4 Pro在官方测试中得分87.9,而第三方仅得54.68,差距达33分。关键原因在于官方使用了Harness极简模式,该模式是模型训练时的原生环境,能激活其最强能力。切换至标准模式后分数下降,但通过首轮锚定极简工具可恢复高分。这揭示了Agent能力评测对测试框架的依赖,同一模型在不同框架下表现差异巨大,评测标准需重新审视。
接口依赖而非过拟合:模型能力的触发条件
文章强调,V4 Pro对初始系统提示词、工具schema和上下文注入策略极其敏感,但并非只能在极简模式下工作,而是必须从该模式启动。一旦启动成功,模型可在任何工具集下正常运行。这种“接口依赖”类似于高端跑车需特定启动程序激活运动模式,启动后驾驶方式不影响性能。因此,模型的最强策略并未被隐藏,只是触发入口较窄。
评测标准的反思:模型能力与Harness不可分割
文章提出,Agent等于模型加Harness,脱离Harness谈模型能力是伪命题。不同Harness测出同一模型33分的差距,引发对行业benchmark排名有效性的质疑。V4 Pro在SWE-bench Verified上使用mini-swe-agent配合单个Bash工具得分96.4%,证明其能力真实存在,但前提是使用正确的“壳”。这促使业界思考:评测模型时,应如何标准化测试框架,以确保结果的可比性和公平性。
Q&A
DeepSeek V4 Pro在官方测试和第三方测试中得分差距有多大?
DeepSeek V4 Pro在官方Terminal Bench 2.1测试中得分87.9,而第三方机构Vals AI使用自研的Terminus 2 Harness测试同一模型只得到54.68分,差距达33.22分。
为什么DeepSeek V4 Pro在官方测试中得分高,而在第三方测试中得分低?
因为官方测试使用了DeepSeek Harness的Minimal模式,这是模型训练时的原生环境,能激活其最强能力。而第三方测试通常使用自己的Harness或Standard模式,导致模型性能下降。
DeepSeek Harness的Minimal模式有什么特点?
Minimal模式的系统提示词只有一句话,仅暴露bash和str_replace_editor两个工具,禁止额外身份指引和工具引导,禁用运行时上下文注入,省略上下文压缩,整个系统提示词仅4KB。
什么是“anchored-standard”两阶段预设?它有什么效果?
anchored-standard预设是社区设计的一种测试方案:第一轮只给Minimal模式的两个工具和极简提示词,模型发起第一次工具调用后,从第二轮开始恢复Standard模式的全部25个工具。该方案在测试中连续跑出98分和99分,与顶级模型分数相当。
DeepSeek V4 Pro在不同Harness下表现差异大,这说明了什么?
这说明V4 Pro对初始系统提示词、工具schema和上下文注入策略极其敏感,其最强策略需要特定的“入口”才能触发,即接口依赖,而非简单的过拟合。
DeepSeek V4 Pro在SWE-bench Verified上的表现如何?
V4 Pro在SWE-bench Verified上使用mini-swe-agent配合单个Bash工具跑出了96.4%的高分,证明其能力确实很强,但前提是使用正确的工具配置。
DeepSeek V4 Pro的评测结果对Agent能力评测标准有什么启示?
评测结果揭示了Agent能力评测对测试框架的依赖,同一个模型在不同Harness下得分差异巨大,说明脱离Harness谈Agent模型能力是伪命题,行业需要重新思考评测标准。