内容提要
DeepSeek发布多模态视觉理解模型V4-Flash-Vision-Exp,上线API平台,补齐视觉能力。该模型纯文本能力与V4-Flash持平,多模态Agent能力接近Opus-4.8,支持PPT生成、网站重构等场景。API按token计费,图片最多384 tokens,价格与V4-Flash一致,并推出免费Files API,降低开发者接入门槛。
延伸解读
视觉能力补齐,多模态Agent成亮点
DeepSeek-V4-Flash-Vision-Exp的发布,标志着DeepSeek从纯文本模型向多模态AI的战略升级。该模型在纯文本能力上与V4-Flash持平,但在视觉理解的Agent Benchmark中大幅跃升,多模态Agent能力接近Opus-4.8。这意味着开发者可以在Agent框架中利用视觉信息执行更复杂的任务,如PPT生成、网站重构等,而无需在文本和视觉模型之间切换。
计费透明,Files API降低接入门槛
新模型API按token计费,图片最多384 tokens,价格与V4-Flash一致,延续了高性价比路线。同时推出的免费Files API允许开发者先上传图片,再通过file_id引用,避免重复上传,节省带宽。这一设计简化了多模态应用的开发流程,尤其适合需要频繁处理图片的场景,降低了开发者的接入成本。
工具链闭环,生态有望迎来创新
DeepSeek Harness v0.1.0-rc.8的更新(多模态输入、子Agent协作)与V4-Flash-Vision-Exp的API形成“工具链+模型”闭环。业内分析认为,这一组合将推动开发者生态的创新。对于开发者而言,这意味着可以更便捷地构建多模态Agent应用,但需注意模型仍为实验性,实际效果可能因场景而异。
Q&A
DeepSeek新发布的多模态视觉模型叫什么?
DeepSeek新发布的多模态视觉理解模型名为DeepSeek-V4-Flash-Vision-Exp,已上线DeepSeek API平台。
DeepSeek-V4-Flash-Vision-Exp的纯文本能力和多模态能力分别如何?
该模型的纯文本能力(如Agent、推理、世界知识)与DeepSeek-V4-Flash正式版持平,而多模态Agent能力在Benchmark测试中大幅跃升,接近Opus-4.8。
DeepSeek多模态API如何计费?
API按token计费,图片会转换成token,一张图片最多占384 tokens,计费价格与V4-Flash模型保持一致。
DeepSeek多模态API支持哪些调用格式和图片传入方式?
支持Chat Completions、Messages、Responses三种格式调用,图片传入方式有base64内联、外部URL和Files API三种。
Files API有什么作用?收费吗?
Files API不收费,用户可先将图片上传到平台,再在请求中通过file_id引用,从而节省请求带宽,同一张图片在多个请求中无需重复上传。
DeepSeek多模态模型有哪些应用示例?
官方展示了三个示例:商业PPT生成(如西藏自驾游PPT)、网站二次创作(如未来主义风格重构)、前端动态特效(如3D黏土小怪物舞池派对)。
开发者如何调用DeepSeek多模态API?
开发者可以通过设置model='deepseek-v4-flash-vision-exp'来访问该模型的API。
DeepSeek推出多模态模型的意义是什么?
标志着DeepSeek从纯文本大模型向多模态AI全面进军,补齐了视觉理解能力,并与DeepSeek Harness更新形成“工具链+模型”闭环,有望推动开发者生态创新。