面向人机交互设计 Harness:构建以产物为中心的 Agent Loop

面向人机交互设计 Harness:构建以产物为中心的 Agent Loop

💡 原文中文,约3600字,阅读约需9分钟。
📝

内容提要

文章探讨了编码智能体交互模式从“以对话为中心”向“以产物为中心”的转变。作者提出,当工作对象从代码扩展到PPT、网页等持续演化的产物时,对话不再是完整工作现场,产物本身应成为人机协作的核心。通过引入Artifact View,Harness需统一意图、版本、操作和验证,连接人与智能体直接操作同一份产物,形成多元化的Agent Loop。

🔎

延伸解读

从对话到产物:交互中心的转移

文章指出,当工作对象从代码扩展到PPT、网页等持续演化的产物时,对话不再能完整承载工作现场。用户在两轮对话之间可能直接修改产物,这些操作未必被记录在对话中。因此,产物本身应成为人机协作的核心,对话则退居为表达目标和解释判断的辅助工具。这一转变要求Harness重新设计交互逻辑,以产物状态为基准,而非仅依赖对话历史。

Harness的四大职责

面向产物的Harness需统一意图、版本、操作和验证。具体而言,它要确保人的选择、智能体的修改和验证都落在同一产物版本上,避免上下文错位。同时,Harness不强制统一不同领域的模型,而是通过数据快照、受约束构建等方式,让文档、网页等各按其运行方式呈现。这种设计既保持了灵活性,又为后续连接批注、写回和版本比较奠定了基础。

人机直接操作同一产物的意义

在传统Agent Loop中,人主要通过提示词间接影响工作对象;而以产物为中心的模式下,人和智能体都能直接修改同一份产物。例如,用户可直接在画布上选择元素或批注,无需将意图翻译成完整文字。这降低了沟通成本,使产物成为下一轮交互的入口。文章强调,这种直接操作关系是Harness维护的核心,也是区别于“看图说话”的关键。

Q&A

什么是“以产物为中心的智能体协作闭环”?

以产物为中心的智能体协作闭环是指人与智能体围绕同一份可持续演化的工作产物(如代码、PPT、网页等)展开协作,对话仍用于表达目标和解释判断,但工作现场主要由产物及其状态承载,而非仅依赖对话记录。

为什么当工作对象从代码扩展到PPT、网页等产物时,对话不再是完整的工作现场?

因为当用户直接操作产物(如手动调整幻灯片、移动节点、修改单元格)时,这些操作可能未被完整记录在对话中,智能体仅回顾聊天记录无法获取完整上下文,必须重新理解当前产物状态和用户意图。

Artifact View 在 Better Harness 中扮演什么角色?

Artifact View 是 Better Harness 中引入的一种探索性分析视图,用于支持以产物为中心的协作,它统一意图、版本、操作和验证,连接人与智能体直接操作同一份产物,形成多元化的 Agent Loop。

以产物为中心的 Harness 需要处理哪四件事情?

需要处理:1) 统一意图,2) 版本绑定,3) 操作记录,4) 验证证据。确保人的选择、智能体的修改和后续验证都落在同一产物版本上。

浏览器智能体为什么比“把网页截图发给模型”更进一步?

因为网页本身拥有浏览器运行时,智能体可以观察、点击、输入、滚动和截图,并结合页面元素、控制台日志和网络请求理解操作前后的变化,网页成为可不断观察和操作的工作环境,而非静态图片。

在 Cursor/Qoder 的浏览器设计模式中,用户如何向智能体表达意图?

用户可以直接选择运行中页面里的元素,通过绘制、语音或文字补充修改要求,系统将选中的元素、背后代码、周围布局和视觉关系一起交给智能体,产物本身承担上下文和指令入口的职责。

Canvas 在智能体交互中真正重要的变化是什么?

真正重要的不是多了一个预览窗口,而是用户不再需要把“我指的是哪里”翻译成文字,产物本身成为下一轮交互的入口,用户可以直接选择和批注画布中的元素,让智能体根据局部反馈继续修改。

以产物为中心的 Harness 是否要求统一所有领域模型?

不需要。Harness 统一的是协作方式(意图、版本、操作、回执和证据),而不是不同领域内部的模型。不同产物可以有自己的观察、操作和验证闭环,形成多元化的 Agent Loop。

🏷️

标签

➡️

继续阅读