DeepSeek首款视觉模型对比Gemini 3.7 Flash:成本与速度的权衡

DeepSeek首款视觉模型对比Gemini 3.7 Flash:成本与速度的权衡

💡 原文英文,约1200词,阅读约需5分钟。
📝

内容提要

DeepSeek发布V4 Flash Vision Exp,支持图像输入,价格低于Gemini 3.7 Flash。测试显示两者在图表、发票和日志分析中准确率相当,均能识别陷阱。DeepSeek成本约为Gemini三分之一,但速度慢一倍多,且高峰期价格翻倍。建议批量处理选DeepSeek,实时任务用Gemini。

🔎

延伸解读

成本与速度的权衡

测试显示,DeepSeek V4 Flash Vision Exp在准确率上与Gemini 3.7 Flash持平,但成本约为后者的三分之一,速度却慢一倍以上。这种差异在批量处理场景中可能更有利,因为成本节省显著;而在实时交互场景中,Gemini的响应速度优势更为关键。开发者应根据任务对延迟的敏感度来选择合适的模型。

定价与计费差异

DeepSeek的定价在高峰时段翻倍,而测试在周末进行,因此成本优势可能被高估。此外,两家公司对图像输入的token化方式不同:DeepSeek将图像计为约500个token,Gemini则约为1150个。这意味着实际成本不仅取决于单价,还取决于token计数方式,开发者需结合自身使用模式评估总成本。

测试局限与适用场景

本次测试仅覆盖图表、发票和日志分析三类任务,样本量小,且未涉及复杂视觉推理或真实生产环境。DeepSeek在发票测试中出现了异常高的输出token数,可能源于内部推理,这会影响成本。因此,结论主要适用于类似的后台文档处理任务,对于其他视觉任务,建议开发者自行验证。

Q&A

DeepSeek V4 Flash Vision Exp是什么?它有什么特点?

DeepSeek V4 Flash Vision Exp是DeepSeek于8月21日发布的首个支持图像输入的模型,能够理解图表、截图或照片文档。它基于预算型V4 Flash模型,增加了图像理解能力,价格保持每百万输入tokens 0.22美元、每百万输出tokens 0.66美元,但工作日高峰时段价格翻倍。

DeepSeek V4 Flash Vision Exp和Gemini 3.7 Flash在价格和速度上有什么区别?

DeepSeek的价格约为Gemini的三分之一(DeepSeek总费用0.0039美元,Gemini 0.0122美元),但速度慢一倍多(DeepSeek平均16.8秒,Gemini平均7.2秒)。此外,DeepSeek在工作日高峰时段价格翻倍,而Gemini速度更稳定。

在图表分析测试中,DeepSeek和Gemini的表现如何?

在图表分析测试中,两个模型都正确回答了所有问题:指出Q1运营成本超过总收入,订阅是每个季度都增长的细分市场,并估算全年收入为3610万美元。它们都没有被双轴陷阱误导。

在发票审计测试中,两个模型的表现有何差异?

两个模型都发现了所有三个错误:显示器臂线金额错误、总应付金额应为3958.89美元、到期日早于发票日期。DeepSeek还额外指出打印的小计与行项目不匹配。但DeepSeek耗时30.5秒并产生3467个完成tokens,而Gemini仅用7.9秒和944个tokens,表明DeepSeek可能将大量内部推理计为输出。

在日志分析测试中,两个模型能否正确识别故障根因?

是的,两个模型都正确识别出根因是手动触发的分析作业对4800万行表进行全表扫描,消耗了所有20个数据库连接,而不是支付服务本身。它们都指出问题开始于14:05:12,并建议首先终止批处理作业。Gemini还提供了具体的PostgreSQL命令。

根据测试,DeepSeek和Gemini分别适合什么场景?

如果进行大规模批量处理,例如夜间处理发票,DeepSeek更经济实惠;如果任务需要用户等待实时响应,则Gemini更合适,因为其速度更快且更稳定。

🏷️

标签

➡️

继续阅读