实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了

实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了

💡 原文中文,约4700字,阅读约需12分钟。
📝

内容提要

科技圈同日迎来两大模型动态:OpenAI宣布GPT-5.6系列大幅降价,DeepSeek发布V4-Flash模型,通过后训练强化推理与代码能力,价格不变。竞争焦点从能力上限转向“智价比”。实测中,V4-Flash以2.85元完成5个复杂任务,包括数据分析、游戏开发等,表现优异,预示Agent时代来临。

🔎

延伸解读

后训练:不换模型也能提升能力

DeepSeek V4-Flash 的升级并非通过扩大模型规模,而是依靠后训练(Post-Training)强化推理与工具调用能力。这类似于员工入职后的专项培训,而非更换新人。官方数据显示,其在 Terminal Bench 2.1 和 DeepSWE 测试中的得分大幅提升,表明模型在拆解任务、使用工具和连续执行方面进步明显。这提示我们,在参数规模之外,训练方法和数据质量同样能挖掘模型潜力。

智价比:Agent 落地的关键因素

文章指出,Agent 任务往往需要连续调用模型数十次,成本直接影响其能否投入实际工作。DeepSeek V4-Flash 维持低价,OpenAI 也大幅降价,竞争焦点从能力上限转向“智价比”。实测中,V4-Flash 以 2.85 元完成 5 个复杂任务,包括数据分析、游戏开发和 API 调用,说明低成本模型也能高效完成复杂任务,为开发者降低 Agent 应用门槛提供了可能。

实测局限与参考价值

虽然 V4-Flash 在 5 个任务中表现优异,但文章也强调这无法测出模型全部能力。测试任务偏向代码生成和网页开发,未覆盖多轮对话、逻辑推理等场景。此外,测试中未追加提示,实际使用中用户可能需要更多交互。因此,这些结果可作为参考,但开发者仍需根据具体需求评估模型适用性,避免过度依赖单一测试结论。

Q&A

DeepSeek V4-Flash 的 API 价格是多少?

DeepSeek V4-Flash 的 API 价格保持不变,每百万 token 输入 1 元、输出 2 元。

DeepSeek V4-Flash 相比预览版有哪些提升?

V4-Flash 通过后训练强化了推理与代码能力,在 Terminal Bench 2.1 中得分从 61.8 涨到 82.7,在 DeepSWE 测试中从 7.3 涨到 54.4,更擅长调用工具和连续完成任务。

DeepSeek V4-Flash 在实测中完成了哪些任务?

实测中完成了 5 个任务:分析 320 篇早报数据并生成交互式 HTML 报告、开发一个打砖块小游戏、制作三体轨道模拟器、设计科幻控制舱仪表盘,以及编写 Python 脚本生成开源 AI 项目周报。

DeepSeek V4-Flash 完成 5 个任务花费了多少钱?

5 个任务共消耗约 3422 万 token,费用仅为 2.85 元。

OpenAI 对 GPT-5.6 系列模型的价格调整是什么?

OpenAI 将 GPT-5.6 Luna 的 API 价格下调约 80%,Terra 降价 20%。降价后 Luna 每百万 token 输入 0.2 美元、输出 1.2 美元。

为什么说大模型竞争焦点转向了“智价比”?

因为 DeepSeek 和 OpenAI 在同一天分别发布新模型和降价,表明顶级模型不再只比拼能力上限,而是同时注重性能与价格的平衡,即“智价比”。

DeepSeek V4-Flash 的后训练与基础训练有何不同?

基础训练相当于上学,后训练更像入职后的专项练习,让模型反复练习拆解任务、选择工具、发现错误,从而提升完成复杂任务的能力,而模型结构和尺寸不变。

DeepSeek V4-Flash 支持哪些 API 特性?

V4-Flash 支持一次读取 100 万 token 的内容,原生支持 OpenAI 的 Responses API,可接入 Codex。

🏷️

标签

➡️

继续阅读