内容提要
DeepSeek发布V4-Flash-0731公开测试版,通过后训练提升智能体性能,未改架构。模型总参数2840亿,激活130亿,小于V4-Pro,但基准测试超越后者。支持MIT许可、Responses API及Codex集成,可自托管,降低推理成本,体现小模型通过优化追赶大模型的趋势。
延伸解读
后训练优化:小模型也能超越大模型
V4-Flash-0731未改变架构,仅通过后训练就实现了性能提升,并在多个智能体基准上超越参数规模更大的V4-Pro预览版。这表明,在模型大小之外,训练策略和优化技术同样关键。对于企业而言,这意味着在考虑升级到更大模型之前,可以优先探索对现有模型进行后训练调优,以更低的成本获得性能提升。
独立测试与官方数据存在差异
DeepSeek报告的Terminal-Bench 2.1得分为82.7,但Artificial Analysis的独立测试结果为79%,两者存在差距。这提醒用户在评估模型性能时,不应仅依赖官方数据,还应参考第三方独立测试结果,并结合自身业务场景进行实际验证,以更准确地判断模型是否满足需求。
开放许可与API兼容性降低采用门槛
V4-Flash-0731采用MIT许可,支持自托管,并兼容Responses API和Codex集成。对于已使用OpenAI风格API的团队,可以无缝切换或并行测试该模型,无需大幅改动现有工作流。这种开放策略有助于企业更灵活地控制部署和成本,也反映了开源模型在追赶闭源模型方面的趋势。
Q&A
DeepSeek-V4-Flash-0731相比预览版有哪些改进?
DeepSeek-V4-Flash-0731通过额外的后训练大幅提升了智能体能力,基准测试成绩远超V4-Pro-Preview,但模型架构和参数量保持不变。
DeepSeek-V4-Flash-0731的参数量是多少?与V4-Pro相比如何?
V4-Flash-0731总参数2840亿,激活参数130亿;而V4-Pro总参数1.6万亿,激活参数490亿。V4-Flash明显更小。
DeepSeek-V4-Flash-0731在哪些基准测试上超越了V4-Pro?成绩如何?
DeepSeek报告V4-Flash-0731在Terminal-Bench 2.1上得分82.7,DeepSWE上54.4,Toolathlon-Verified上70.3,均超过V4-Pro-Preview。但独立测试显示Terminal-Bench 2.1得分为79%,低于官方数据。
DeepSeek-V4-Flash-0731的许可证是什么?对使用者有何好处?
该模型采用MIT许可证,允许组织自由部署、修改和自托管,不受限于DeepSeek的托管API,提供了更大的控制权和灵活性。
DeepSeek-V4-Flash-0731支持哪些API和集成?
V4-Flash支持Responses API,用于构建AI智能体和多步骤工作流,并已发布与Codex开发工作流集成的说明。这降低了采用该模型的难度。
DeepSeek-V4-Flash-0731的发布反映了什么行业趋势?
该发布表明,通过后训练优化现有模型而非单纯扩大模型规模,可以显著提升性能,同时降低推理成本。这也反映了开放权重模型与专有模型差距缩小的趋势。