内容提要
本文探讨如何将复杂工作可靠地委托给AI,提出“可委托性”概念,强调稳定性、成本可预测和边界明确的验收标准。作者主张人负责意图与授权,模型执行判断,工具记录事实,并通过外置交接记录防止信息丢失。文章还介绍了Task-Driven工作法,包括角色分工、独立上下文和授权门,以提升AI协作的可靠性。
延伸解读
可委托性的核心:稳定优于惊艳
文章强调,委托AI的关键不在于偶尔的出色表现,而在于稳定的可预测性。一个稳定的B+比时好时坏的A更值得信赖。这意味着要控制整个流程的波动,而非追求单次输出的峰值。通过外置记录和独立验证,可以阻断偏差的放大,确保即使出现较差结果,也不会未经检查就进入最终交付。
验收标准决定成本边界
成本可预测的前提是验收标准有明确边界。没有边界的验收标准会导致成本失控,因为每一轮加严都在追逐无终点的目标。正确的顺序是:工作价值决定验收标准,验收标准决定投入成本。因此,流程应分档,轻流程适用于低价值工作,但底线如外置记录和授权不能省略。
人、模型与工具的分工原则
文章提出清晰的分工:人负责意图、边界、验收标准和授权;模型负责边界内的判断与执行;工具负责事实、状态和记录。任何一方越界都会带来问题,例如让模型自行决定边界会导致目标漂移。授权是最不能让渡的,一次授权不能自动扩展到后续动作,需单独确认。
外置交接记录的必要性
跨上下文协作时,仅存在于对话中的信息会丢失,因此需要独立于对话的交接载体。这份记录本身是权威,而非摘要,且必须支持双向反馈,下游的异议和裁决能写回。记录应保存“是什么”而非“怎么做”,因为执行方法会随模型升级而过时,而意图和边界需要长期保留。
Q&A
什么是“可委托性”?为什么它比追求模型能力的上限更重要?
可委托性是指一项工作能否稳定、可靠地交给AI执行,包括执行范围是否稳定、结果能否被信任、投入是否可预期,以及何时需要人介入。它比追求模型能力的上限更重要,因为委托需要信任,而信任来自可预测性,一个稳定的B+比时好时坏的A更值得信赖。
如何控制AI协作中的成本可预测性?
成本可预测性依赖于有边界的验收标准。工作价值决定验收标准,验收标准决定投入成本。没有边界的验收标准会带来没有边界的成本。因此,需要根据工作价值分档采用不同流程,并明确验收标准,避免事后不断追加检查。
在AI协作中,人、模型和工具各自应该负责什么?
人负责意图、边界、验收标准、价值判断和授权;模型负责边界内的判断与执行;工具负责事实、状态、记录,以及对边界的强制约束。任何一方越界都会带来问题。
为什么需要外置交接记录?它有什么作用?
外置交接记录是独立于对话、可以长期保存的交接载体,用于跨上下文协作。它本身是权威,对话记录、模型记忆等只能作为辅助。它防止信息丢失和目标漂移,并允许下游反馈写回,记录决定的历史和理由。
Task-Driven工作法中的“意图锁定”是什么?为什么需要它?
意图锁定是Task-Driven工作法中的第一步,AI先列出它理解到的目标、补充条件和缺少的授权,由人进行精确确认。确认需要使用明确、可识别的指令,之前的讨论或含糊的“继续”不算正式确认。它确保验收标准描述最终结果,并区分意图确认和授权创建。
Task-Driven中的角色路径是怎样的?为什么路径可以缩短但不能省略?
典型路径是Frame → PM → Design → Dev → QA,但不同任务可以采用不同路线,例如小修正可能从Frame直接进入Dev。路径可以缩短,但必须是一项被明确记录的决定,不能靠模型自行省略。这确保了责任边界清晰,并允许根据任务需要灵活调整。
Task-Driven中如何保证验证证据的可靠性?
验证证据会绑定到当时的代码状态,包括产品仓的提交、是否存在未提交修改,以及修改摘要。下次校验时比较记录证据时的代码状态与当前代码状态是否一致,而不是相信“之前已经测试过”。这由工具提供事实,确保证据可复核。
Task-Driven中的授权门是什么?为什么需要控制授权门的数量?
授权门是流程中需要人确认的少数几个位置,例如确认意图、授权创建、批准对外或重要的历史变更。授权门数量刻意控制,因为每多一道确认都会在高频使用中累积成负担。只有改变共享历史或产生外部影响的动作才需要单独授权。
Task-Driven的代价是什么?它适合哪些场景?
Task-Driven会使用更多token、花费更多时间,并对模型能力有较高要求,尤其需要旗舰模型在初始化和边界划分时具备高强度的抽象推理能力。它主要面向开发、调研等专业知识工作,只有在问题足够复杂时才划算。它换取的是更稳定、更容易交接和复核的结果。