内容提要
GPT-5.6后,通用Skill(如Superpowers)价值下降,因模型和Runtime已内化规划、测试等能力。Comet Native实验显示,去掉固定流程后质量不降,Token和成本降约75%。长期保留的是垂直Skill,含私有知识、执行能力和业务边界,而非通用方法论。
延伸解读
通用Skill的边际收益正在下降
文章指出,随着GPT-5.6等强模型能力的提升,原本需要Superpowers等通用Skill来弥补的规划、测试、审查等能力,已被模型自身内化。同时,Agent Runtime也接管了任务调度、上下文压缩等执行环节。因此,继续叠加通用Skill可能导致重复流程,增加Token消耗和时间成本,而收益却有限。这提醒开发者,在模型能力快速迭代的背景下,应重新评估通用方法论类Skill的必要性,避免流程冗余。
垂直Skill的长期价值
文章认为,真正会被长期保留的Skill是垂直Skill,它们包含三类内容:模型不知道的私有知识(如团队协作方式、项目约定)、模型拿不到的执行能力(如内部系统、专用工具)、以及模型不能擅自决定的边界(如验收标准、审批流程)。这些信息敏感、零散且随业务变化,难以进入通用模型训练数据,却决定了Agent能否在真实环境中可靠工作。因此,开发者应聚焦于构建这类轻量、定制化的Skill,而非通用方法论。
实验数据支持“放松过程,收紧结果”
Comet Native模式的实验显示,在16个业务任务中,去掉OpenSpec和Superpowers后,pass@3仍为100%,且单次严格通过率和三次连续成功率更高。在41组配对样本中,总Token下降76.8%,模型成本下降75.1%,Agent轮次和工具调用减少一半以上。这表明,对于强模型,通过外层工作流锁定验收规则和风险边界,而将具体实现交给模型自主决定,可以在不降低质量的前提下显著降低成本。但需注意,这是第一方实验,结果可能因模型和任务而异。
Q&A
GPT-5.6 之后,为什么说 Superpowers 这类通用 Skill 可以卸载了?
因为 GPT-5.6 等强模型已经内化了规划、调试、测试和自我检查等通用能力,同时 Agent Runtime 也接管了任务状态、子 Agent 调度、工具调用和结果验证等执行循环。继续使用 Superpowers 这类通用 Skill 会增加 Token 消耗和等待时间,但边际收益下降,甚至可能降低效率。
Comet Native 模式相比 Classic 模式改了什么?
Comet Native 模式不再依赖 OpenSpec 和 Superpowers 这两个外部 Skill,只保留 Shape、Build、Verify、Archive 四个阶段。Shape 阶段与人讨论需求,明确目标、范围、不做什么、验收示例和风险边界;Build 阶段由模型自己决定如何规划、测试和审查;Verify 阶段用验收条件核对,失败则返回 Build。整体思路是放松过程、收紧结果。
Comet 官方实验中,Native 模式相比 Classic 模式在完成质量和执行成本上表现如何?
在 16 个业务任务、每种模式 48 次运行的实验中,Native 模式的 pass@3 与 Classic 模式一样都是 100%,但单次严格通过率和三次连续成功率更高。在 41 组配对样本中,总 Token 下降 76.8%,模型成本下降 75.1%,Agent 轮次和工具调用减少一半以上。
为什么通用 Skill 的边际收益在下降?
因为通用能力正在被模型和 Agent Runtime 内化。模型学会了规划、调试、测试等通用方法,Runtime 接管了任务状态、子 Agent 调度、工具调用和结果验证。因此,通用 Skill 原本解决的问题已被吸收,继续使用只会增加 Token 和时间消耗,边际收益下降。
什么样的 Skill 会被长期保留下来?
垂直 Skill 会被长期保留,即那些包含私有知识、执行能力和业务边界的 Skill。具体包括:模型不知道的私有知识(如团队协作方式、项目约定)、模型拿不到的执行能力(如内部系统、专用工具、账号权限)、模型不能擅自决定的边界(如完成标准、审批流程、责任归属)。这些信息敏感、零散且随业务变化,难以进入通用模型训练数据。
对于 GPT-5.6 这类强模型,作者建议如何使用 Superpowers?
作者建议先移除 Superpowers,直接运行一段时间,再根据真实缺口补回必要的约束。因为强模型已能自主规划和验证,移除通用 Skill 可以降低 Token 和成本,且完成质量不会下降。