DeepSeek V4 Pro在官方测试中得分87.9,但第三方仅得54.68,差距33分。原因在于官方使用Harness极简模式,该模式是模型训练时的原生环境,能激活其最强能力。切换模式后分数下降,但通过首轮锚定极简工具可恢复高分。这暴露了Agent能力评测对测试框架的依赖,引发对评测标准的反思。
完成下面两步后,将自动完成登录并继续当前操作。