DeepSeek视觉模型白送眼睛!API价格一分没涨实测

DeepSeek视觉模型白送眼睛!API价格一分没涨实测

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

DeepSeek悄然上线视觉模型V4-Flash-Vision-Exp,价格与文本版持平,图片按Token计费,纯文本能力不变,多模态Agent能力大幅提升,但部分测试有退步。此举旨在让Agent“看见”屏幕,提升效率,同时开放Files API构建生态。实验性质或为商业策略,引发开发者对性价比和潜在涨价的讨论。

🔎

延伸解读

价格策略的行业影响

DeepSeek将视觉模型定价与文本版对齐,打破了多模态模型加价的行业惯例。这一策略可能迫使竞争对手重新考虑定价,尤其是依赖视觉API溢价的中间商。开发者短期内受益,但需警惕未来可能的涨价,因为实验性模型常作为市场试探。

视觉Agent的实际价值

多模态Agent能直接处理截图、UI布局等视觉信息,显著提升计算机使用场景的效率。DeepSeek在多个Agent基准测试中大幅提升,接近顶级闭源模型,但Cybergym测试的退步表明视觉模块可能影响某些决策路径,实际应用中需针对性验证。

实验版的风险与机遇

模型名称中的Exp标记意味着不稳定,开发者反馈识别准确率波动和缓存问题。生产环境直接使用存在风险,但低成本试错机会值得利用。建议在非关键任务中测试,并关注后续稳定版发布。

隐藏的生态布局

Files API的开放是更重要的战略动作,它降低了多请求重复上传的成本,为构建开发者生态打下基础。视觉模型是吸引开发者的入口,而API基础设施才是长期粘性的关键。这一布局可能比模型本身更具长远影响。

Q&A

DeepSeek新发布的视觉模型叫什么名字?

DeepSeek-V4-Flash-Vision-Exp,是DeepSeek V4系列第一个视觉模型。

DeepSeek视觉模型的API价格是多少?

价格与纯文本版V4-Flash完全一致,图片按Token计费,单张图片最多384个Token,缓存命中时百万Token输入仅0.05元。

DeepSeek视觉模型相比纯文本版在性能上有哪些提升和退步?

在DeepSWE、Toolathlon-Verified、ApexBench等测试中大幅提升,但在Cybergym测试中略有退步(75.3 vs 76.7)。

多模态Agent能力提升解决了什么问题?

让AI Agent能直接“看见”屏幕截图、UI布局、图表等视觉信息,大幅提升在真实计算机使用场景中的效率。

为什么说DeepSeek视觉模型是“实验性质”?

模型名称带“Exp”,表示实验性,可能不稳定,某些场景可能翻车,开发者反馈识别准确率有时较低。

Files API的开放有什么意义?

开发者可先上传图片到平台,通过file_id引用,避免重复上传,且不收费,有助于构建生态基础设施。

DeepSeek视觉模型对竞争对手有什么影响?

以接近Opus-4.8的多模态能力,价格却与V4-Flash持平,冲击了靠视觉API溢价收费的中间商,重新定义价格锚点。

🏷️

标签

➡️

继续阅读