给DeepSeek-V4-Flash借一双眼睛:ZCode视觉子Agent方案

给DeepSeek-V4-Flash借一双眼睛:ZCode视觉子Agent方案

💡 原文中文,约900字,阅读约需2分钟。
📝

内容提要

ZCode用户使用纯文本模型deepseek-v4-flash无法识别图片。通过安装zcode-deepseek-eye技能,配置视觉子Agent(如mimo-v2.5)作为“眼睛”,主模型遇到图片时自动转交处理,无感提升功能。安装需重启并配置,选错模型可重配,密钥自持,旧会话需新开。方案保留性价比,解决识图需求。

🔎

延伸解读

适用场景与前置条件

该方案主要面向以纯文本模型(如deepseek-v4-flash)为主力、偶尔需要识图的用户。安装前需在ZCode中配置好支持视觉的模型(如mimo-v2.5),并确保能访问GitHub。若主模型本身支持视觉,则不会触发子Agent,避免额外开销。

配置要点与常见问题

安装后需重启ZCode并新建对话配置视觉助手。若选错视觉模型,无需重装,重新运行配置流程更换即可。视觉调用使用用户自己的API Key,项目不存储密钥。删除视觉助手后,旧会话可能残留旧规则,需开启全新会话才能彻底清除。

成本与体验权衡

该方案在保留deepseek-v4-flash性价比的同时,通过子Agent按需调用视觉模型,避免了手动切换模型带来的上下文中断和额外成本。对用户而言,图片处理过程无感,提升了纯文本模型的实用性。

Q&A

ZCode中如何让纯文本模型DeepSeek-V4-Flash识别图片?

通过安装zcode-deepseek-eye技能,并配置一个支持视觉的子Agent(如mimo-v2.5)作为“眼睛”。主模型遇到图片时,会自动将图片交给视觉子Agent处理,再将文字描述返回给主模型,实现无感识图。

安装zcode-deepseek-eye的具体步骤是什么?

首先在ZCode中配置好支持视觉的模型(如mimo-v2.5),然后新建任务选择“不在项目中工作”,对助手说“请帮我安装这个skill https://github.com/50kg/zcode-deepseek-eye”。安装完成后重启ZCode,新建对话窗口说“帮我配置视觉助手”,并指定使用支持视觉的模型即可。

如果配置的视觉模型选错了怎么办?

不需要重新安装技能,只需重新运行一遍配置流程,更换为正确的视觉模型即可。

使用zcode-deepseek-eye时,API密钥是如何处理的?

视觉调用走用户自己的API Key,项目本身不存储任何密钥,确保密钥自持,安全性有保障。

删除视觉助手后,旧会话中图片识别规则还会生效吗?

删除视觉助手后,旧会话中可能仍保留“图片要交给vision-helper”的旧规则,因此必须开启全新会话才能确保规则被清除,避免冲突。

如果主模型本身支持视觉,还会触发子Agent吗?

不会。主模型本身支持视觉时,不会触发子Agent,因此不会产生额外的视觉调用费用。

zcode-deepseek-eye方案的主要优势是什么?

该方案保留了DeepSeek-V4-Flash的性价比(速度快、便宜),同时通过视觉子Agent弥补了其无法识图的缺陷,实现了无感识图,且视觉调用使用用户自己的API Key,安全可控。

🏷️

标签

➡️

继续阅读