内容提要
OpenAI正试验按结果付费模式,企业客户仅在AI成功完成任务时付费,而非按token计费。此模式面临挑战:需明确任务成功标准,复杂任务如编码或长流程代理难以判定,且外部故障可能影响结果。失败时成本由供应商承担,促使优化效率,但主观任务评估和归因问题仍待解决。
延伸解读
结果付费的判定难题
按结果付费的核心挑战在于如何客观判定任务是否成功。简单任务如工单关闭或单元测试通过,容易验证;但复杂任务如代码修复,即使通过测试,也可能在生产环境引发新问题,客户未必认可。长流程代理执行多步骤任务时,完成90%可能仍不算成功,导致供应商无法收费。
评估工具与主观性风险
开发者已有评估工具,如OpenAI的托管工具和Braintrust的追踪评分,可记录模型调用、检索和工具使用,并基于任务完成度、事实准确性等打分。但语义评估依赖LLM-as-a-judge,存在误判风险:误报让客户为未完成工作付费,漏报让供应商承担成功运行的成本。主观任务如生成销售报告,质量好坏仍需人工判断。
成本转移与外部归因问题
结果付费将失败成本从客户转移给供应商,促使优化效率,但外部故障如CRM超时或服务不可用,可能导致供应商为并非自身原因造成的失败买单。此外,若任务目标是提升转化率,归因于代理的贡献难以精确衡量,增加了计费争议的可能性。
Q&A
OpenAI正在试验的按结果付费模式是什么?
OpenAI正在试验一种新的计费模式,企业客户仅在AI成功完成任务时付费,而不是按使用的token数量计费。
按结果付费模式面临哪些主要挑战?
主要挑战包括:需要明确任务成功的标准,复杂任务如编码或长流程代理难以判定成功;外部故障可能影响结果,导致供应商承担非自身原因造成的失败成本;主观任务评估和归因问题难以解决。
在按结果付费模式下,如果AI代理只完成了任务的90%,客户需要付费吗?
不需要,因为按结果付费模式下,只有任务完全成功才算作可计费,完成90%的任务可能不足以触发计费。
按结果付费模式对供应商的成本有何影响?
如果客户只为成功结果付费,那么失败的运行成本将由供应商承担,这促使供应商优化效率,因为一次成功的任务比多次重试更有利可图。
如何评估AI代理的任务是否成功?
有些结果容易验证,如单元测试通过、API返回预期响应或数据库包含记录;但语义评估需要判断,可以使用LLM-as-a-judge等工具,但存在误判风险。
按结果付费模式下,外部故障导致AI代理失败,责任如何归属?
如果外部故障导致代理失败,例如CRM超时或服务不可用,这些运行可能不被视为成功,供应商可能不得不承担非自身原因造成的失败成本。