一张图最多384个Token:DeepSeek多模态模型背后的“极限压缩”艺术 - 蝈蝈俊

一张图最多384个Token:DeepSeek多模态模型背后的“极限压缩”艺术 - 蝈蝈俊

💡 原文中文,约2500字,阅读约需6分钟。
📝

内容提要

DeepSeek推出多模态模型DeepSeek-V4-Flash-Vision-Exp,图片最多占384个Token,通过三级压缩技术大幅降低成本。模型侧重OCR和图像描述,非人脸识别,故认错人属设计初衷问题。API成本可预测,推理快,多模态能力接近Opus-4.8,体现低价高效理念。

🔎

延伸解读

384 Token上限的定价逻辑

DeepSeek将图片Token上限设为384,意味着API调用成本高度可预测,开发者无需担心用户上传超高清图片导致费用激增。按高峰时段缓存未命中价格计算,一张图片输入成本约0.001元,且图片与文本Token合并计费,价格与V4-Flash一致。这种设计降低了开发者的试错成本,尤其适合对成本敏感的应用场景。

压缩技术如何平衡能力与效率

DeepSeek通过三级压缩(ViT切块、空间合并、CSA稀疏注意力)将视觉Token从2916降至81个KV条目,整体压缩比达7056倍。尽管压缩幅度巨大,但多模态Agent能力接近Opus-4.8,说明压缩并未显著牺牲视觉理解能力。这得益于CSA机制保留关键视觉信息,同时降低KV缓存占用,提升推理速度。

识图模式的定位与局限

DeepSeek识图模式本质是OCR+图像描述工具,而非人脸识别系统。官方明确表示不具备人脸识别功能,因此认错人并非Token限制所致,而是设计初衷使然。用户需注意,该模型适合处理含文本的图片(如截图、图表),但对人脸等细节识别能力有限,使用时应根据场景选择合适的模型。

Q&A

DeepSeek-V4-Flash-Vision-Exp是什么?

DeepSeek-V4-Flash-Vision-Exp是DeepSeek于2026年8月21日推出的首个多模态视觉理解模型,标志着DeepSeek从纯文本大模型向多模态AI进军。

DeepSeek多模态模型如何将图片压缩到384个Token?

DeepSeek采用三级压缩技术:首先用DeepSeek-ViT视觉编码器将图片切分为14×14像素的图像块,例如756×756的图片生成2916个Token;然后进行空间压缩,将相邻3×3区域合并为1个Token,使Token数降至324;最后通过压缩稀疏注意力(CSA)机制将KV缓存中的视觉条目压缩4倍,最终得到81个视觉KV条目。整体压缩比高达7056倍,API计费上限设为384个Token。

DeepSeek多模态模型的图片Token上限是多少?成本如何?

一张图片最多占384个Token,按高峰时段缓存未命中价格计算,一张图片的输入成本约为0.001元。图片Token与文本Token合并计费,价格与V4-Flash模型一致。

DeepSeek多模态模型认错人(如将梁文锋识别为张一鸣)的原因是什么?

认错人的原因是DeepSeek的识图模式并非为人脸识别设计,它更像一个升级版的OCR和图像描述工具,主要读取图片中的文本或描述画面内容,不具备人脸识别功能。因此,即使Token限制不影响,模型也会认错人。

DeepSeek多模态模型在哪些任务上表现较好?

DeepSeek多模态模型擅长截图解析、界面识别、图表读取、图文混合任务等,在需要视觉理解的Agent Benchmark上相比V4-Flash大幅跃升,多模态Agent能力接近Opus-4.8。

DeepSeek的Files API有什么作用?

Files API是免费服务,用户可先将图片上传到平台,通过file_id在多个请求中引用,避免重复上传,节省带宽并提高调用效率。

DeepSeek多模态模型如何处理不同分辨率的图片?

模型在读取图片前会根据分辨率进行自适应缩放:小图(总像素低于384×384量级)会保持长宽比放大至该量级;大图则会保持长宽比缩小,将总像素控制在约800×800的量级。

🏷️

标签

➡️

继续阅读