Pi 1.0 发布,GitHub 星标超 11 万,同步推出实验性 Pi Durable。Pi 1.0 将 MCP 纳入核心,推出 Codemode,让 Agent 在 JS 沙箱中脚本化调用工具,331 次调用零上下文浪费,并支持虚拟模型跨模型调度。Pi Durable 面向长时运行与多人协作,具备崩溃断点自愈、会话无拷贝分叉、后台异步压缩、原子状态与热更新等能力。源码约 1.5 万行,强调极简与供应链安全。
作者翻新博客:统计页三图合并、精简菜单、打赏二维码换源并居中缩小、139个友链体检后81个失联移入失联组、相册改为单文件自动分页、侧栏新增日历与倒计时卡、美化面板按内容自适应尺寸、新增AI页面助手并将Key移至服务端、拆解fomal.js等三座“屎山”,首屏资源从2.72MB降至约1.82MB。
DeepSeek 推出 Harness 桌面端,提供开箱即用安装包,登录送 6 元赠金。产品定位从编程转向日常办公,可直接处理 Word、Excel、PDF 并生成 PPT。新增 Automation 定时任务、插件管理页面和语音输入等功能,支持用户自写插件。官方称约 60% 用户用过第三方插件,未来将建插件市场,并强化沙箱安全、多智能体协作与长期记忆。
Strands开源Agent harness的核心价值在于统一管理工具调用、上下文裁剪、状态保存、重试和权限等工程杂活,而非仅减少接入代码。同模型下可节省28% token,但需结合具体场景验证。落地时应优先关注可观测性、权限和回滚机制,建议从低风险任务试跑,避免直接接入核心链路。
DeepSeek 开源了 Agent 运行时 DeepSeek Harness(dsh),主打“一切皆插件”,其公式为 Agent = Model + Harness。内核 Cordis 仅负责插件的加载、卸载与依赖管理,模型、工具、沙箱、UI 乃至主循环均为可替换、可卸载且无残留的插件。支持 Web、headless、SDK、ACP 四种模式,通过 YAML 分层组装,模型可见数据全部落盘可追溯。当前为开发者预览,采用 MIT 协议。
论文提出Show-Harness具身控制框架,使视觉语言模型通过离散语义动作单元直接操控机器人,无需微调即可零样本控制,少量微调可适配小模型;并提出GUMI界面,支持人类与智能体在统一动作空间采集示教数据,实现跨形态复用与协同采集。
This article explains the development and operational layers of an agent harness through two implementations of a finance assistant: AWS AgentCore Harness and LangChain with Envoy AI Gateway. It...
TypeSafe AI 推出 Jev 模型,不生成文字,仅做结构化判断,输出 Choice、Score、Noul 三类带概率答案以避免幻觉。插件 dsh-jev 将其接入 DeepSeek Harness 的 tools/pre-execute 等扩展点,在智能体调用危险工具前自动决策,按 deny>hold>ask>allow 单调顺序拦截。测试中 31 次删除尝试全被阻止,但每轮增加约 4.6 秒延迟,且无缓存、无记忆,阈值边界仍存风险。
2026年8月,DeepSeek开源智能体运行时DeepSeek Harness(命令行工具dsh),十天内获超18.6万星标。其核心特点是智能体每一层皆为插件,涵盖模型适配器、工具注册、沙箱乃至智能体循环本身,基于成熟框架Cordis构建。它支持约40家模型提供商,采用操作系统级沙箱隔离,会话日志只增不改。作者实测确认其为真实可用的开发者预览版,但尚不适合日常替代Claude Code等工具。
《深入理解AI Agent》读书笔记按实现顺序梳理Agent工程要点:Agent由LLM、上下文和工具构成,最小实现为ReAct循环;核心工程量在模型之外的Harness,负责约束、验证与纠正。关键点包括KV Cache作为架构硬约束、提示词写成SOP、状态显式化、上下文压缩与隔离、双层记忆与混合检索、工具描述重于能力、沙盒默认断网、评估先行、SFT立形与RL泛化,以及通过外部化学习实现自我进化。
TypeSafe AI创始人Diogo Almeida发布Jev Harness白皮书,提出十步蓝图重构编码智能体:将决策、生成、执行三权分立,由专用决策模型Jev负责路由、评分与拦截,大模型专注写代码。方案涵盖上下文压缩、工具分层、条件规则注入、双维度路由、检索复用及语义级命令拦截,目标提速两百倍、降本四百倍。
2026年智能体架构从通用框架转向解绑重组:开发者拆解代理,以强类型交接契约拼装最小基元集,避免自然语言传递造成状态丢失。Jev等专用模型输出结构化决策,评估数据成为选型依据与护城河。通用大模型时代结束,判断与编排成为核心竞争力。
OpenAI’s Vinoth Govindarajan discusses why production AI agents fail beyond model hallucination. Using real-world case studies like OpenClaw, he explains the key principles of reliable agent...
文章讨论 Jev 这类 System One 决策模型:它接收状态与有限候选,直接返回概率,省去生成 JSON 的中间步骤。作者在 Free4Chat 的 Arena 实验中用它做游戏实时决策,结果不如确定性脚本稳定,延迟约 300ms。结论是 Jev 适合候选空间已明确的分类、路由、评分等场景,而非开放控制;前提是 Harness 先把世界整理好。
TypeSafe AI 推出 Jev“系统一”模型,专注结构化决策,不生成文本,通过 RLCD 训练提升概率输出准确性。在分类任务中,其推理速度比传统方法快 20 至 200 倍,成本低 40 至 400 倍。LangChain 已官方集成,可用于模型路由和工具调用风险拦截。早期用户反馈高频决策场景成本大幅降低。Jev 不取代大模型,而是分层协作,但效果仍需第三方验证。
2026年AI智能体爆发,模型转向Agent能力,架构从Workflow、重Skill、Loop演进到Harness,强调为AI提供工具与环境、让其自主完成任务。作者在漏洞挖掘中,用Hermes自进化迭代Kunlun-M,并基于Opencode定制Harness。结论:相信AI能力,但不信其流程与结果,需保留人的审查。
Jev模型以SOTA分类能力作为智能体路由层,拦截分流约八成请求,显著减少GPT-4o调用;可低成本替代LLM-as-a-Judge评估,并将复杂任务拆分为子智能体以避免工具幻觉。最前沿用法是运行时动态生成执行计划,实现智能体自我编排,使GPT-4o调用量降低七成以上。但动态计划出错时,现有评估难以检测步骤间的拓扑错误。
文章提出“调度框架工程”概念,认为提示词、上下文、工具、循环、图、评估等工程属于同一系统。调度框架包裹大模型,包含工具、权限、校验、定时与终止条件,是唯一不随模型版本变动的部分。作者以Kimi K3为内核,用一份yaml配置和钩子脚本搭建可移植智能体,支持300并发、夜间自动运行,并通过替换模型测试检验框架质量。
vivo开发者大会聚焦AI Phone的个人化智能:端侧30B MoE模型可理解用户意图,Harness作为执行中枢调度任务,6000多项原子能力供Agent调用,并开放MCP、Skill等接入第三方。vivo对GUI Agent持保守态度,同时推出小V Co-work遥控PC办公,并以蓝河OS探索原生Agent系统。
AI SDK 的 harness 层支持原生订阅认证,通过统一 HarnessAgent 接口运行不同编码代理,无需修改代码或配置。认证模式包括直接、自动和 ai-gateway 三种,凭证在主机边界解析,OAuth 令牌按需刷新,沙箱中注入占位凭证。支持 Claude Code、Codex、Cursor、GitHub Copilot 等。
完成下面两步后,将自动完成登录并继续当前操作。