DeepSeek V4 flash低价高分冲ARC-AGI-2榜首

DeepSeek V4 flash低价高分冲ARC-AGI-2榜首

💡 原文中文,约5100字,阅读约需12分钟。
📝

内容提要

深度求索V4闪速版以极低价格提供高推理能力,在ARC-AGI测试中得分高,成本仅为同类模型的几十分之一。其通过键值缓存和混合架构优化,大幅降低使用费用,使AI智力变得像自来水般廉价。这引发行业竞争逻辑转变,从追求最强模型转向追求性价比,可能重塑软件工程范式,并冲击美国AI实验室的商业模式。

🔎

延伸解读

价格战拐点:从拼性能到拼成本

文章指出,DeepSeek V4 Flash 0731以极低价格提供接近顶级模型的推理能力,在ARC-AGI测试中得分高,但成本仅为同类模型的几十分之一。这标志着大模型竞争从单纯追求性能转向性价比。对于企业用户,这意味着可以大幅降低AI使用成本,甚至让AI助手常驻后台处理日志、生成测试等任务,而无需担心费用。

键值缓存:成本压低的秘密

DeepSeek通过键值缓存(KV Cache)和混合架构优化,将缓存命中后的读取价降至每百万token 0.28美分,远低于竞争对手。这种技术将中间结果存储起来,避免重复计算,同时将部分任务卸载到CPU和硬盘,从而大幅降低成本。文章强调,这种优化基于公开技术,但工程实现极致,使得竞争对手难以快速跟进。

开源权重:官方定价的稀释

尽管DeepSeek官方暗示将上调API价格,但模型权重公开,用户可自行部署或选择其他托管方,导致官方定价权被稀释。文章指出,即使所有商业托管涨价,用户仍可自建服务器运行量化版模型,成本几乎为零。这为依赖闭源API的企业提供了替代方案,也加剧了市场竞争。

智力过剩:便宜才是硬通货

文章提出“智力九十九分位阈值效应”,认为对大多数日常任务,模型性能超过一定基准后,提升感知不明显。因此,足够好且足够便宜的模型更符合实际需求。DeepSeek的成功在于将智力成本打到地板,使AI像水电一样普及,从而改变软件工程范式,并冲击依赖高价API的商业模式。

Q&A

DeepSeek V4 Flash 0731在ARC-AGI测试中的得分和价格是多少?

DeepSeek V4 Flash 0731在ARC-AGI-1半私有任务中得分89.0%,每个任务收费0.02美元;在ARC-AGI-2半私有任务中得分61.4%,每个任务收费0.04美元。

DeepSeek V4 Flash为什么这么便宜?

DeepSeek V4 Flash通过键值缓存(KV Cache)技术,将之前计算好的中间结果存储起来,只计算新增部分,节省大量算力。同时,它使用多层注意力压缩技术缩小缓存占用,并采用混合架构将部分计算任务分配给CPU和硬盘,使缓存读取价远低于竞争对手。

DeepSeek V4 Flash的缓存命中后读取价格是多少?

缓存命中后的读取价是每百万token仅0.28美分,不到一分钱。

DeepSeek V4 Flash的低价对用户使用体验有什么影响?

用户可以用极低的成本大量使用AI,例如一天开五六个会话、同时运行多个实例,花费不到5美元。这使得AI变得像自来水一样便宜,用户可以随意使用而不必担心成本,从而可以承担更多任务,如自动修复测试、生成测试代码、分析日志等。

DeepSeek V4 Flash的低价对美国AI实验室的商业模式有什么冲击?

DeepSeek V4 Flash的能力与一些头部实验室的旗舰模型相当,但价格只有对方的几十分之一,且权重公开可自托管。这导致中小型AI服务商开始用DeepSeek替换OpenAI和Anthropic的接口,国际市场上客户也更倾向于选择低成本方案,从而冲击美国AI实验室依靠技术代差和高价API的商业模式。

为什么说“最强AI”可能是个伪需求?

因为对于大多数日常任务,模型智力达到一定基准线后,再提升的感知差别几乎为零。例如,91分和95分的模型在写邮件、翻译、生成代码等任务上结果难以区分。用户真正需要的是足够聪明、稳定、便宜且响应快的模型,而不是在极端测试中领先几个百分点的昂贵模型。

DeepSeek V4 Flash的低价对软件工程范式有什么潜在影响?

当智力变得像带宽一样便宜时,持续集成、日志分析、安全审计、社交信息流过滤等原本依赖人工或规则引擎的事务都可以被AI接管,从而重塑软件工程范式。例如,AI可以自动分析失败日志、生成测试用例、实时扫描服务器日志等,大幅提高效率并降低成本。

🏷️

标签

➡️

继续阅读