终于来了!DeepSeek多模态视觉模型API全面开放

终于来了!DeepSeek多模态视觉模型API全面开放

💡 原文中文,约1700字,阅读约需5分钟。
📝

内容提要

DeepSeek发布多模态视觉理解模型V4-Flash-Vision-Exp,上线API平台,补齐视觉能力。该模型纯文本能力与V4-Flash持平,多模态Agent能力接近Opus-4.8,支持PPT生成、网站重构等场景。API按token计费,图片最多384 tokens,价格与V4-Flash一致,并推出免费Files API,降低开发者接入门槛。

🔎

延伸解读

视觉能力补齐,多模态Agent成亮点

DeepSeek-V4-Flash-Vision-Exp的发布,标志着DeepSeek从纯文本模型向多模态AI的战略升级。该模型在纯文本能力上与V4-Flash持平,但在视觉理解的Agent Benchmark中大幅跃升,多模态Agent能力接近Opus-4.8。这意味着开发者可以在Agent框架中利用视觉信息执行更复杂的任务,如PPT生成、网站重构等,而无需在文本和视觉模型之间切换。

计费透明,Files API降低接入门槛

新模型API按token计费,图片最多384 tokens,价格与V4-Flash一致,延续了高性价比路线。同时推出的免费Files API允许开发者先上传图片,再通过file_id引用,避免重复上传,节省带宽。这一设计简化了多模态应用的开发流程,尤其适合需要频繁处理图片的场景,降低了开发者的接入成本。

工具链闭环,生态有望迎来创新

DeepSeek Harness v0.1.0-rc.8的更新(多模态输入、子Agent协作)与V4-Flash-Vision-Exp的API形成“工具链+模型”闭环。业内分析认为,这一组合将推动开发者生态的创新。对于开发者而言,这意味着可以更便捷地构建多模态Agent应用,但需注意模型仍为实验性,实际效果可能因场景而异。

Q&A

DeepSeek新发布的多模态视觉模型叫什么?

DeepSeek新发布的多模态视觉理解模型名为DeepSeek-V4-Flash-Vision-Exp,已上线DeepSeek API平台。

DeepSeek-V4-Flash-Vision-Exp的纯文本能力和多模态能力分别如何?

该模型的纯文本能力(如Agent、推理、世界知识)与DeepSeek-V4-Flash正式版持平,而多模态Agent能力在Benchmark测试中大幅跃升,接近Opus-4.8。

DeepSeek多模态API如何计费?

API按token计费,图片会转换成token,一张图片最多占384 tokens,计费价格与V4-Flash模型保持一致。

DeepSeek多模态API支持哪些调用格式和图片传入方式?

支持Chat Completions、Messages、Responses三种格式调用,图片传入方式有base64内联、外部URL和Files API三种。

Files API有什么作用?收费吗?

Files API不收费,用户可先将图片上传到平台,再在请求中通过file_id引用,从而节省请求带宽,同一张图片在多个请求中无需重复上传。

DeepSeek多模态模型有哪些应用示例?

官方展示了三个示例:商业PPT生成(如西藏自驾游PPT)、网站二次创作(如未来主义风格重构)、前端动态特效(如3D黏土小怪物舞池派对)。

开发者如何调用DeepSeek多模态API?

开发者可以通过设置model='deepseek-v4-flash-vision-exp'来访问该模型的API。

DeepSeek推出多模态模型的意义是什么?

标志着DeepSeek从纯文本大模型向多模态AI全面进军,补齐了视觉理解能力,并与DeepSeek Harness更新形成“工具链+模型”闭环,有望推动开发者生态创新。

🏷️

标签

➡️

继续阅读