DeepSeek V4 Flash视觉模型上线,600张图一锅端!

DeepSeek V4 Flash视觉模型上线,600张图一锅端!

💡 原文中文,约4000字,阅读约需10分钟。
📝

内容提要

DeepSeek发布V4-Flash-Vision-Exp多模态模型,视觉能力免费,定价与纯文本版一致,单图最高384 token,价格远低于GPT-4o。性能接近Opus-4.8,但细节识别有限,支持600张图批量处理,受分辨率限制。模型为实验性质,不建议生产使用,旨在收集真实数据优化。

🔎

延伸解读

价格优势背后的技术取舍

DeepSeek将视觉能力免费附赠,单张图最高384 token,价格远低于GPT-4o。但这一低价策略依赖于将图片自动缩放至800x800,细节信息可能丢失。对于需要高精度识别的场景,如小字号OCR或医学影像分析,效果可能受限。开发者需权衡成本与识别精度。

Benchmark分数的解读陷阱

官方宣称性能接近Opus-4.8,但具体分数差异因任务而异。在Terminal Bench上仅差1.1分,但在NL2Repo上差距达12分。开发者应关注与自身业务相关的评测,而非笼统的“接近”表述。真实场景测试可能暴露更多问题,如ERP截图识别错误。

实验性质模型的实用风险

该模型被官方标记为实验性质,不建议生产使用。虽然开放API并定价,但稳定性、效果和价格均可能变动。开发者若依赖此模型,需做好应对变化的准备。同时,上传的文件无法下载,且有效期有限,需注意数据管理。

Q&A

DeepSeek V4 Flash视觉模型的定价是多少?

DeepSeek V4-Flash-Vision-Exp的定价与纯文本版V4-Flash完全一致:缓存未命中时输入1元/百万token、输出2元/百万token;缓存命中时空闲时段低至0.05元/百万token。图片按尺寸换算成token后和文本token一起计费,单张图封顶384个token,一张图最多0.001元出头。

DeepSeek V4 Flash视觉模型与GPT-4o相比价格如何?

DeepSeek V4-Flash-Vision-Exp的输出定价为2元/百万token,而GPT-4o的输出定价约10美元/百万token,按当前汇率差距在30倍以上,DeepSeek的价格远低于GPT-4o。

DeepSeek V4 Flash视觉模型的性能表现如何?

在视觉理解的Agent Benchmark上,V4-Flash-Vision-Exp相比V4-Flash大幅跃升,多模态Agent能力接近Opus-4.8。具体分数:Terminal Bench 2.1为83.9分(Opus-4.8为85.0分),ApexBench (Pass@1)为36.5分(Opus-4.8为39.4分),Chartography为64.3分(Opus-4.8为65.0分),ZeroBench (Pass@5)为35.0分(Opus-4.8为34.0分)。但在NL2Repo上,新模型57.7分,Opus-4.8为69.7分,差距较大。

DeepSeek V4 Flash视觉模型如何实现单张图最高384 token?

384 token是根据Vision Transformer的patch size折算的,一张800x800的图片大约对应这个数量。超过该尺寸的图片会被自动resize到800x800左右,从而成本封顶。

DeepSeek V4 Flash视觉模型支持哪些图片上传方式?

支持三种方式:Base64内联(请求上限48 MiB)、外部URL(单张图最大32 MiB,下载时限60秒,需公开链接)、Files API(官方推荐,单张图最大64 MiB,带file_id的请求图片总量上限200 MiB,每个用户免费25 GiB存储,最多10000个文件,文件有效期1小时到30天)。

DeepSeek V4 Flash视觉模型单次请求最多支持多少张图片?

单次请求最多支持600张图片,但有两个限制:15张以上图片时最大分辨率从8192px降到4096px;带file_id的请求图片总量上限200 MiB,平均每张不能超过0.33 MiB。

DeepSeek V4 Flash视觉模型是否适合生产环境?

官方明确不建议直接用于生产环境,因为该模型是实验性质,不保证稳定性和效果,后续会根据线上调用反馈迭代优化,正式版上线时间未公布。

DeepSeek V4 Flash视觉模型在真实场景中表现如何?

有开发者反馈,用该模型分析ERP系统的1080p截图时几乎全标错了,尽管benchmark数据显示在Chartography上接近Opus-4.8,但真实场景的识别效果可能不佳,具体原因未知。

🏷️

标签

➡️

继续阅读