DeepSeek V4加J-Space实测:7项性能反超Fable 5!

DeepSeek V4加J-Space实测:7项性能反超Fable 5!

💡 原文中文,约6300字,阅读约需15分钟。
📝

内容提要

DeepSeek V4 Pro在Agent基准测试中表现优异,但存在“能力实现损失”,其行为受首轮接口和工具schema影响,呈现非连续的“思维链二极管”现象,导致长程任务中状态漂移。J-Space认知增强工具通过功能性分工、三级门控和持久状态账本,稳定模型行为并提升性能,但效果因任务而异,无法完全解决所有问题。

🔎

延伸解读

能力实现损失:模型强不等于用得好

文章指出,DeepSeek V4 Pro在官方极简评测中表现优异,但实际使用时可能因接口条件变化而大幅波动。这种“能力实现损失”意味着模型的能力与稳定输出之间存在管道,任何环节失配都可能导致能力无法发挥。对开发者而言,这意味着不能仅依赖基准分数评估模型,需关注实际部署环境下的行为一致性。

思维链二极管:行为非连续性的启示

社区探测发现,模型行为沿persona轴呈离散带分布,而非平滑变化,被称为“思维链二极管”。这提示用户,调整提示词可能无法实现精细控制,模型可能在不同模式间跳变。理解这一现象有助于合理设定预期,避免因微调无效而困惑。

J-Space的定位与边界

J-Space通过功能性分工、三级门控和持久状态账本,旨在稳定模型行为,提升长程任务表现。实测显示其在部分基准上有效,但效果因任务而异,且无法解决所有问题。它并非替代方案,而是与Anchored Standard、Routing Suite互补,分别负责入口、路由和持续控制。

基准提升的解读与局限

文章强调,J-Space带来的基准提升是单次实测,缺乏置信区间,且不同任务增益差异大。例如,HLE无工具提升有限,而工具型任务提升显著。这提示读者,基准分数需谨慎解读,实际效果可能受任务结构、评测条件等因素影响。

Q&A

DeepSeek V4 Pro在Agent基准测试中表现如何?

DeepSeek V4 Pro在Agent基准测试中表现优异,例如DeepSWE从预览版的12.8飙升至62.7,CyberGym从52.7涨至83.3,AutomationBench从12.8涨至31.8。

什么是“能力实现损失”?

能力实现损失是指模型具备的能力无法稳定转化为可交付任务结果的现象,中间隔着推理模式、首轮接口、工具schema、活动表征、长程状态、验证机制等管道,任何一层失配都会导致能力无法发挥。

为什么DeepSeek V4 Pro在不同会话中会表现出不同的推理风格?

因为模型在后训练阶段学到的Agent行为与特定的工具schema、首轮persona等绑定,一旦改变这些条件,模型的行为会跳变到另一条轨迹,呈现非连续的“思维链二极管”现象。

J-Space认知增强工具的核心机制是什么?

J-Space通过功能性第一人称分工、三级门控分配控制成本和持久状态账本三条核心机制,控制当前激活内容、维持长任务约束、外化持久状态、识别推理失效,从而稳定模型行为。

J-Space在哪些基准测试上提升了DeepSeek V4 Pro的性能?

J-Space在多个基准上提升了性能,例如HLE无工具从42.7涨到48.0,HLE有工具从60.0涨到67.7,Terminal Bench 2.1从87.9涨到90.1,NL2Repo从61.5涨到73.4,CyberGym从83.3涨到86.8,DeepSWE从62.7涨到72.0,Toolathlon-Verified从74.1涨到79.5,Agents' Last Exam从25.7涨到30.3,AutomationBench从31.8涨到38.2。

Anchored Standard、Routing Suite和J-Space三套方案有什么区别?

Anchored Standard负责精确恢复首轮接口,Routing Suite负责任务感知的外部模式选择,J-Space负责持续轨迹维持与全过程控制。三者是不同层级,不是替代关系,分别对应入口、路由和持续控制。

J-Space在效率方面带来了哪些提升?

V4-Flash的得分/时间从0.43提升到1.09,相对增益2.53倍;得分/Token从0.38提升到0.84,相对增益2.21倍。增益主要来自减少重复重编码、空白重试、长链陷入和从头恢复。

J-Space的局限性是什么?

J-Space无法完全解决所有问题,例如在HLE无工具条件下仍低于Fable 5,在AutomationBench上仍低于GLM-5.3,且效果因任务而异,无法弥补知识边界,也不能解决所有行为问题。

🏷️

标签

➡️

继续阅读