内容提要
2026年8月,DeepSeek发布deepseek-harness,两天获9.5万星;Pi用一年靠口碑积累9.1万星。文章将“智能体框架”(harness)定义为包裹大模型的运行时外壳,包含循环、工具路由、记忆、规划与沙箱五部分,取代旧“框架”概念。文章对比Claude Code、Deep Agents、Hermes、Pi等十款工具,归纳插件化、固定机制、累积技能三种设计哲学,并给出60行Python示例与选型建议。
延伸解读
从框架到Harness:开发范式的转变
文章指出,2023至2025年间,LangChain、AutoGen等“框架”提供的是库和组件,开发者需自行编写编排逻辑。而Harness则直接提供已构建的循环,并对记忆、规划和安全有明确主张,开发者通过运行命令来交互。这一转变在2025年由Claude Code推动,到2026年,DeepSeek等也采用“harness”命名,标志着行业将Harness视为独立的架构层。
三种设计哲学背后的失败模式
文章归纳了三种Harness设计哲学:DeepSeek Harness的插件化一切,针对架构锁定;Claude Code和Deep Agents的固定四机制,针对长会话不可靠;Hermes Agent的累积技能库,针对跨会话重复工作。此外,Pi的极简主义针对臃肿。选择时,应问哪种失败模式最消耗你的时间,而非盲目追随趋势。
60行Python示例揭示的可靠性工程
文章提供的60行Python Harness示例展示了核心循环,但缺乏错误处理、重试和沙箱边界。生产级Harness的差距在于可靠性工程:工具调用失败后的恢复、长会话中的上下文管理、以及沙箱隔离。示例中cwd="./sandbox"是安全边界,max_turns=15防止无限循环,这些细节在重构中易被忽略,却至关重要。
选型建议:匹配失败模式与团队需求
文章建议根据团队面临的失败模式选择Harness:需要可靠完成端到端编码任务,可选Claude Code、Deep Agents或Aider;担心供应商锁定,可选DeepSeek Harness或Deep Agents;任务重复且希望代理越用越快,可选Hermes Agent;追求最小审计面,可选Pi或Oh-My-Pi。若需多代理协调,应上移至LangGraph等编排层。无论选哪个,可观测性层从第一天就应视为非可选。
Q&A
什么是智能体框架(agent harness)?它和普通的大模型有什么区别?
智能体框架是包裹在大模型外面的运行时外壳。模型本身只负责根据文本流和可用工具列表预测下一句话或下一个工具调用,而框架负责其他所有事情:调用模型的循环、执行工具的代码、管理多轮对话上下文的记忆,以及保护文件系统的沙箱。它决定了智能体在工具调用失败后能否恢复,还是直接卡住。
一个智能体框架通常由哪几个部分组成?
每个智能体框架都必须实现五个部分:一个循环(反复调用模型直到任务完成)、一个工具路由器(把调用分发给文件系统、shell 或外部 API)、一个记忆层(决定哪些上下文保留到下一轮)、一个规划层(在执行前把大任务拆成步骤),以及一个沙箱边界(限制工具能触碰的范围)。
为什么2026年大家开始用“harness”而不是“framework”来称呼这类工具?
2023到2025年,“框架”如 LangChain、AutoGen、CrewAI 是库,你需要自己导入组件、选择模型调用并编写编排逻辑。而 harness 直接内置了循环,并且对记忆、规划和安全性有明确主张,你只需运行一条命令即可使用。Anthropic 的 Claude Code 在2025年让这种转变变得不可否认,到2026年,“harness”成为描述这种形态的通用词。
DeepSeek Harness、Claude Code 和 Hermes Agent 在设计哲学上有什么不同?
三者代表三种不同的工程赌注。DeepSeek Harness 赌“一切皆插件”,基于 Cordis 元框架,模型、沙箱、记忆、UI 都可在运行时替换。Claude Code 和 Deep Agents 赌“一组小而固定的机制”,即规划、沙箱文件系统、子智能体委派和上下文压缩,并投入精力让每个机制可靠。Hermes Agent 赌“记忆会累积”,每次解决非平凡问题后保存为可复用技能,下次类似请求先查技能库,从而越用越快。
如何用不到60行Python代码实现一个最小智能体框架?
用 Anthropic 的 Messages API 构建五步循环:定义三个工具(read_file、write_file、run_bash),然后写一个 run_harness 函数,循环调用模型,当模型返回工具调用时执行工具并把结果追加回对话,直到模型不再请求工具调用或达到最大轮数。示例中 cwd="./sandbox" 是安全边界,max_turns=15 防止无限循环。
智能体框架的解决方案栈包含哪些层?
从下到上共四层:协议层(Model Context Protocol,MCP,让任何框架以统一方式连接外部工具和数据源)、框架层(即智能体框架本身的循环)、编排层(协调多个智能体或长时间有状态工作流,如 LangGraph、CrewAI、AG2、Mastra、DSPy)、以及可观测性与沙箱层(Langfuse、LangSmith 追踪,E2B、Modal 提供隔离执行环境)。
为什么DeepSeek Harness两天获得9.5万星,而Pi用一年才积累9.1万星?
两条增长曲线形状不同。DeepSeek Harness 的曲线近乎垂直,是协调发布和时机驱动的关注度爆发;Pi 的曲线是浅而稳定的直线,靠工程师口口相传、试用后留下,没有发布 spike。发布 spike 说明项目获得了关注,而持续使用说明工具在六个月后是否还开着,两者回答不同问题。
团队选择智能体框架时应该考虑哪些因素?
根据你当前面临的失败模式来选,而不是看趋势。需要可靠完成单个编码任务:选 Claude Code、Deep Agents 或 Aider。担心供应商锁定、频繁换模型:选 DeepSeek Harness 或 Deep Agents。同类任务反复出现、希望越用越快:选 Hermes Agent。想要最小审计面、愿意自己写扩展:选 Pi 或 Oh-My-Pi。需要多智能体协调长时间有状态流程:上移到 LangGraph、CrewAI、AG2 或 Mastra。无论选哪个,从第一天起就要把可观测性层当作非可选项。