内容提要
Uber公开AI成本优化实践:通过将总花费拆解为六个可独立优化的变量,并采用四层架构管理智能体,实现了周活跃用户增长7倍、请求量增长9.4倍的同时,AI总支出自4月起保持稳定,单次请求成本下降34%,会话成本下降52%。核心方法包括模型选型基准测试、MCP工具CLI化、Code-Mode压缩Token、优化Prompt Cache TTL及构建上下文图谱,强调成本可见性与文化引导,为AI编程降本提供了系统化工程方案。
延伸解读
成本方程式的拆解思路
Uber将AI总花费拆解为六个变量:用户数、人均会话数、每会话轮次、每轮请求数、每请求Token数、单Token价格。这种拆解让团队能区分良性增长(前两项)与可优化的浪费(中间三项),并建立周度/月度监控体系,确保成本变化可归因。这种将模糊问题转化为可量化变量的方法,值得其他团队借鉴。
MCP工具接入的隐性成本
Uber发现标准MCP协议会预加载所有工具Schema,导致会话开始即消耗5万至7万Token。通过将工具CLI化并按需搜索,几乎清零了这部分开销。对于已接入大量MCP Server的团队,预加载Schema的隐性成本可能被忽视,CLI化与按需加载是性价比高的优化方向。
Prompt Cache TTL的权衡
Uber将主会话的Prompt Cache TTL从5分钟调整为1小时,因为工程师常停顿超过5分钟,导致缓存频繁失效。而子智能体任务短,保留5分钟TTL。TTL选择需基于实际使用节奏,而非默认设置,否则可能增加成本。
成本可见性作为治理手段
Uber通过状态栏实时成本计数器、分级预算与Slack提醒,让工程师实时感知花费,而非硬性限制。会话分析仪表盘自动识别16类浪费模式,提供具体优化建议。这种将成本可见性融入工作流的方式,比简单配额更有效,能引导工程师自主优化。
Q&A
Uber是如何在AI使用量大幅增长的情况下控制AI成本的?
Uber通过将总花费拆解为六个可独立优化的变量(用户数、人均会话数、每会话轮次、每轮请求数、每请求Token数、单Token价格),并采用四层架构管理智能体,实施模型选型基准测试、MCP工具CLI化、Code-Mode压缩Token、优化Prompt Cache TTL、构建上下文图谱等措施,实现了成本的有效控制。
Uber的AI成本方程式包含哪些变量?
Uber将AI总花费拆解为六个变量:用户数、人均会话数、每会话轮次、每轮请求数、每请求Token数、单Token价格。其中前两项代表采用度与参与度,是希望增长的;中间三项代表智能体额外工作量,是优化重点。
Uber如何优化模型选型以降低成本?
Uber使用真实工作构建基准测试,运行在模型无关的评测框架上,持续寻找帕累托最优解。例如,代码评审智能体uReview换模型后,F1提升的同时单次评审成本大幅下降。此外,Uber还维护了Uber SWE Benchmark,用于所有SDLC相关智能体的模型选型。
Uber如何解决MCP工具预加载带来的Token消耗问题?
Uber采用两种机制:一是CLI化调用,将MCP工具映射为Shell命令,动态解析转发,避免Schema预加载;二是Tool Search,让模型先搜索工具目录,只加载需要的工具定义。这几乎清零了预加载开销。
Code-Mode是如何节省Token的?
Code-Mode将原本需要模型逐轮参与的轮询、翻页等操作打包成脚本在子进程执行,只将最终摘要返回给模型,避免了中间状态进入上下文,单次查询可节省50%至100%的Token。
Uber如何选择Prompt Cache的TTL?
Uber根据工程师实际的停顿间隔分布选择TTL。交互式会话中工程师常停顿超过5分钟,导致5分钟TTL频繁失效,因此主会话默认TTL改为1小时;子智能体任务短,保留5分钟TTL。
AI Context Graph在Uber中起到什么作用?
AI Context Graph是包含2400万节点、8000万边的知识图谱,整合了超过30个内部系统数据,使智能体能用自然语言查询,将原本20分钟且答错的探索任务压缩到38秒且答对,显著减少搜索轮次。
Uber如何通过可见性和文化引导来降低成本?
Uber在状态栏显示实时成本计数器,采用分级预算和Slack阈值提醒,提供成本自查技能,并开发会话分析仪表盘自动识别16类浪费模式,让工程师实时看到花费并给出优化建议,从而引导成本意识。