内容提要
DeepSeek推出多模态模型deepseek-v4-flash-vision-exp,新增视觉理解能力,支持图片输入,提升多模态Agent任务表现。模型延续V4-Flash文本能力,定价按token计费,图片最高换算384 tokens。同步推出Files API,支持文件复用,降低开发者调用门槛,推动Agent从文本处理走向复杂任务执行。
延伸解读
多模态Agent的关键一步
此次更新将视觉能力与Agent工作流结合,而非单纯看图问答。通过Files API和Harness支持,开发者可将图片理解接入现有流程,使Agent能处理截图、文档、表格等,扩展了任务执行范围。这标志着DeepSeek从文本模型向多模态Agent基础设施迈进。
成本与定价策略
模型延续V4-Flash价格体系,图片按token计费,每张最高384 tokens。输入价格在缓存命中时低至0.05元/百万tokens(空闲时段),输出最高9元/百万tokens(高峰)。相比高端多模态模型,DeepSeek保持低价策略,降低开发者调用门槛,但需注意高峰时段价格翻倍。
Files API解决图片复用痛点
此前视觉模型需每次请求重新上传图片,增加传输成本并受大小限制。Files API允许先上传文件,通过file_id复用,支持JPEG、PNG、GIF、WebP,单文件最大64 MiB,总存储25 GiB。这对需要反复调用图片的Agent工作流(如长期分析产品资料)尤为实用。
Q&A
DeepSeek 新发布的多模态模型叫什么?它有什么主要特点?
新模型名为 deepseek-v4-flash-vision-exp,它在保持 DeepSeek-V4-Flash 文本能力的基础上,新增了视觉理解能力,可以处理图片输入,并提升多模态 Agent 任务表现。
deepseek-v4-flash-vision-exp 的定价是怎样的?图片如何计费?
该模型延续 V4-Flash 的价格体系,输入输出按 token 计费。图片会根据尺寸转换为 token,每张图片最高换算为 384 tokens,并按 V4-Flash 价格标准计费。具体价格:缓存命中时,空闲时段输入 0.05 元/百万 tokens,高峰时段 0.10 元;缓存未命中时,空闲 1.5 元,高峰 3 元。输出价格空闲 4.5 元,高峰 9 元。高峰时段为北京时间每天 9:00-12:00 和 14:00-18:00。
DeepSeek 的 Files API 有什么作用?支持哪些格式和限制?
Files API 允许开发者先上传图片文件,然后通过 file_id 在不同请求中引用同一文件,避免重复上传,降低网络传输成本并突破请求大小限制。支持 JPEG、PNG、GIF 和 WebP 格式,单个文件最大 64 MiB,单用户最大存储空间 25 GiB,最多保存 10000 个文件。
deepseek-v4-flash-vision-exp 在哪些场景中可以应用?
该模型可应用于办公场景(读取截图、分析文档页面、理解表格内容)、开发场景(识别界面问题、分析错误信息)、内容生产场景(根据图片素材辅助生成内容),以及生成商业定制 PPT、对网站进行二次创作等。
DeepSeek 为什么推出多模态模型?其战略重点是什么?
DeepSeek 推出多模态模型是为了适应 AI Agent 从文本处理走向复杂任务执行的趋势。视觉能力是 Agent 理解真实世界信息(如图片、文件、界面)的关键,多模态能力成为 Agent 发展的基础设施。DeepSeek 通过 V4-Flash-Vision-Exp、Files API 和 Harness 生态支持,补齐多模态能力,推动 Agent 进入办公、设计、开发等复杂场景。
开发者如何调用 deepseek-v4-flash-vision-exp?支持哪些 API?
开发者可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型,支持通过 Chat Completions、Messages 以及 Responses API 调用。图片可以通过 Base64、外部 URL 或 Files API 方式提供。