内容提要
DeepSeek发布V4 Flash版本,性能大幅提升,Agent能力全面增强,多项基准测试成绩优异,如Terminal Bench 82.7分、NL2Repo 54.2分。该版本价格低廉,单次任务成本仅0.03美元,直接对标OpenAI刚降价的Luna模型,引发价格战。Flash主打轻量快速,Pro版本预计八月初推出,开源策略带来社区优势,但暂不支持视觉识别。
延伸解读
基准测试分数解读
Terminal Bench 82.7分、NL2Repo 54.2分等分数看似亮眼,但需注意这些测试专为评估AI的工具使用、代码修改和网络安全能力而设计,并非传统学术考试。Agent Last Exam 25.2分虽低,但在该赛道已属顶尖,因为许多模型得分为零。理解测试背景有助于避免被数字误导。
价格战与市场影响
OpenAI刚宣布Luna降价80%,DeepSeek次日便发布Flash版本,以0.03美元的单次任务成本直接对标。这种竞争对开发者有利,降低了使用顶级模型的门槛。但需注意,Flash主打轻量快速,Pro版本预计八月初推出,性能可能更强,价格也可能相应调整。
开源与闭源的权衡
DeepSeek的开源策略赋予开发者自主部署和调优的灵活性,这是闭源模型无法比拟的。然而,当前Flash版本不支持视觉识别,限制了其应用场景。社区可能很快推出增强版本,但官方支持与稳定性仍需考量。
Q&A
DeepSeek V4 Flash版本在哪些基准测试中表现突出?
DeepSeek V4 Flash在Terminal Bench上获得82.7分,NL2Repo获得54.2分,Cybergym获得76.7分,DeepSWE获得54.4分,Toolathlon verified获得70.3分,Agent Last Exam获得25.2分,Automation Bench (Public)获得25.1分,DSBench-FullStack获得68.7分,DSBench-Hard获得59.6分。
DeepSeek V4 Flash的单次任务成本是多少?
根据artificialanalysis.ai的更新,DeepSeek V4 Flash 0731的单次任务成本为0.03美元。
DeepSeek V4 Flash与OpenAI的Luna模型相比有何优势?
DeepSeek V4 Flash在性能上接近Luna(仅低1分),但成本极低(单次任务0.03美元),而OpenAI刚宣布Luna降价80%,DeepSeek此举直接对标,引发价格战。
DeepSeek V4 Flash的Agent能力具体体现在哪些方面?
Agent能力全面增强,包括终端操作(Terminal Bench 82.7分)、自然语言转代码仓库(NL2Repo 54.2分)、网络安全攻防(Cybergym 76.7分)、软件工程任务(DeepSWE 54.4分)等,表明模型能像程序员一样使用工具、编写代码、发现漏洞。
DeepSeek V4 Flash版本与Pro版本有何区别?
Flash版本主打轻量快速,适合日常高频调用,而Pro版本预计八月初推出,性能更强,目前API和APP/WEB模型暂未变化。
DeepSeek V4 Flash目前存在哪些局限性?
目前不支持视觉识别,不能直接看图理解图像内容;另外由于测试人数过多,服务器响应速度较慢。
DeepSeek的开源策略带来了哪些优势?
开源策略让开发者可以自行部署、调优和修改,社区可以基于DeepSeek开发各种版本,而闭源模型无法修改底层逻辑。