内容提要
开源AI智能体框架四强(Hermes、OpenClaw、Vellum、DeepSeek Harness)各有优劣,但面对600张图的长周期任务均显不足。记忆、技能、成本是核心考量,但空间推理得分仅8.3分,暴露行业盲区。开源不等于免费,选型需匹配场景,复杂任务需定制工作流而非依赖单一框架。
延伸解读
记忆设计的分歧:限制反而更有效
Hermes Agent主动将常驻记忆限制在3600字符以内,与主流追求大上下文窗口的趋势相反。其设计逻辑是,少量精准信息优于大量模糊噪音。通过会话归档、技能文件库和用户画像分层管理,Hermes能在长任务中保持关键信息,避免上下文爆炸。相比之下,OpenClaw早期因记忆混乱被诟病,虽然后来增加了SQLite和QMD双引擎,但缺乏自修改工作流能力。这种差异反映了两种不同的记忆哲学:Hermes追求“记住该记住的”,而OpenClaw更依赖外部技能市场。
开源Agent的隐性成本:算力、时间与运维
开源Agent看似免费,但实际成本包括API调用费、调试时间和服务器资源。以600张图任务为例,若使用GPT-4级别模型,API费用可能达几十美元;而Hermes虽token消耗低,但需要用户投入时间调优记忆配置和编写技能文件。OpenClaw的内存占用比Hermes高72.7%,增加了服务器成本。Vellum则推荐托管服务,存在平台锁定风险。因此,开源Agent的“免费”实质是将成本从软件授权转移到算力、时间和运维能力上。
空间推理短板:行业集体盲区
在《LongHorizon-Harness》基准测试中,Hermes Agent的空间推理得分仅8.3分(满分100),远低于其他任务得分。这暴露了Agent在处理几何题等需要空间理解的任务时的严重不足。视觉模型能识别文字和图形,但无法真正理解空间关系和逻辑链条。大多数框架将图片视为“一次性观察”,不持久化存储,导致无法回溯细节。DeepSeek Harness的“土法视觉”方案也只能解决识别,不能解决理解。这一短板是行业普遍问题,而非个别框架的缺陷。
Q&A
开源Agent四强是哪四个?
Hermes Agent、OpenClaw、Vellum、DeepSeek Harness。
为什么开源Agent处理600张图的长任务会失败?
因为上下文窗口有限,处理大量图片时容易超出上下文限制,导致遗忘和重复工作;同时空间推理能力不足,无法理解几何图形等视觉信息。
Hermes Agent的记忆设计有什么特点?
Hermes Agent主动限制常驻记忆容量(MEMORY.md上限2200字符,USER.md上限1375字符),采用四层记忆:常驻提示、会话归档(SQLite全文检索)、技能文件库、用户画像(Honcho系统)。它追求记住该记住的,而不是记住一切。
OpenClaw的主要优势和劣势是什么?
优势是覆盖面广,支持微信、Slack等50多个平台,技能市场有上万种技能,适合团队协作。劣势是技能深度不够,安全漏洞多(2026年2月曝出13.5万个实例裸奔),内存占用高(比Hermes高72.7%)。
DeepSeek Harness的核心理念是什么?
核心理念是“一切皆插件”,模型、工具、技能等所有能力都可替换,底层基于Cordis微内核,官方公式为Model + Harness = Agent。它支持长周期任务,但仍是开发者预览版,成熟度不足。
开源Agent的隐藏成本有哪些?
显性成本包括API调用费用(如处理600张图需1200次调用,用DeepSeek V4 Flash约0.6美元,用GPT-4级别则几十美元)。隐性成本包括调试时间、服务器租金、运维能力等。开源不等于免费,成本从软件授权转移到了算力、时间和运维上。
LongHorizon-Harness基准测试中,Hermes Agent的空间推理得分是多少?
空间推理得分仅为8.3分(满分100),暴露了行业在空间理解上的集体盲区。
面对600张图的长任务,应该选择哪个Agent?
没有单一框架能完美胜任。Hermes适合长期个人助理,OpenClaw适合团队协作,Vellum适合个人日常使用,DeepSeek Harness最有想象力但成熟度不足。真正可行的方案是使用Harness等框架定制专门的工作流,组合视觉模型、推理模型、记忆系统等插件。