3600人、95%覆盖率、24万次拦截:Cloudflare怎么用AI把“提效不降质”变成现实

3600人、95%覆盖率、24万次拦截:Cloudflare怎么用AI把“提效不降质”变成现实

💡 原文中文,约10500字,阅读约需25分钟。
📝

内容提要

Cloudflare用11个月构建了AI工程栈,分为平台、知识、治理三层:通过代理Worker和AI Gateway实现零信任与降本,用AGENTS.md和Backstage提供上下文,以Codex RFC标准库机器化工程规范。其AI代码评审系统由协调者调度7个专科Agent,按风险分级,四个月拦截1.6万次不合规合并,单次成本仅0.98美元,展示了AI时代软件工程的标准落地与审查执行之道。

🔎

延伸解读

分层用模型,成本与质量兼得

Cloudflare的实践表明,不同任务对模型能力的要求差异很大。他们用顶级模型做协调裁决,标准模型处理代码质量、安全等重活,开源模型Kimi K2.5承担文档评审等轻量任务。这种分工不仅让单次评审中位成本降至0.98美元,还通过Workers AI将安全Agent成本降低77%。对团队而言,盲目追求最强模型可能造成资源浪费,按任务难度匹配模型才是规模化落地的关键。

机器可读标准是自动化的前提

Cloudflare没有直接把Wiki文档喂给AI,而是将工程规范整理成带SHOULD/MUST的结构化RFC,并抽取为JSON格式。这一步让标准能被Agent一致地读取和执行,也使得审批与强制执行分离成为可能。国内团队在推进AI治理时,应优先将标准机器可读化,否则后续的自动化审查和强制执行都难以落地。

负面清单比正面指令更有效

Cloudflare在评审Agent的Prompt中明确写出“不该关注什么”,例如安全Agent只标记可利用或具体危险的问题,忽略理论风险和泛泛建议。这种负面清单显著减少了AI输出的“正确的废话”,提高了信噪比。对于任何Agent设计,明确边界往往比堆砌指令更能提升输出质量。

工程细节决定系统可靠性

AI评审系统看似简单,但Cloudflare在工程细节上投入了大量精力:使用JSONL日志避免进程崩溃导致数据丢失,心跳日志防止误判模型卡死,熔断降级机制应对供应商故障,break glass逃生舱保证紧急情况下的灵活性。这些细节确保了系统在真实生产环境中的稳定运行,是AI工具能否被团队接受的关键。

Q&A

Cloudflare的AI工程栈分为哪三层?

Cloudflare的AI工程栈分为平台层、知识层和治理层。平台层负责安全、低成本地调用AI,知识层为AI提供代码库上下文,治理层确保AI产出符合工程标准。

Cloudflare如何降低AI调用的成本?

Cloudflare通过使用Workers AI托管开源模型(如Kimi K2.5)来降低高频安全Agent的成本,相比商业闭源模型降低了77%。此外,通过代理Worker统一入口和AI Gateway集中管理,减少了跨云网络跳转,进一步降低了延迟和成本。

Cloudflare如何解决MCP工具过多导致的上下文窗口Token暴涨问题?

Cloudflare在MCP Portal层引入Code Mode,将182个MCP工具收敛为两个Portal级工具(portal_codemode_search和portal_codemode_execute),模型通过写代码的方式发现和调用具体工具,从而避免上下文窗口被工具Schema占用过多。

Cloudflare的Codex工程标准库是如何运作的?

Codex是Cloudflare的工程标准库,采用RFC格式,用SHOULD和MUST区分建议和强制。标准被抽取为结构化JSON,并设置“批准”和“强制执行”两阶段生命周期。目前已有60多条RFC,由专门的Agent负责提取和分发。

Cloudflare的AI代码评审系统是如何工作的?

该系统基于开源OpenCode构建,由协调者Agent(Opus 4.7)根据风险等级调度最多7个专科Agent(如代码质量、安全、性能等)。系统按风险分级(Trivial/Lite/Full)分配不同数量的Agent,并采用插件化架构、熔断降级、break glass逃生舱等机制。4个月内拦截了1.6万次不合规合并,单次评审中位数成本仅0.98美元。

Cloudflare的AI代码评审系统有哪些关键工程细节?

关键细节包括:使用JSONL格式日志、心跳日志防止误判、Prompt注入防护、熔断与降级机制、break glass逃生舱、增量复审等。这些细节保证了系统的稳定性和可靠性。

Cloudflare的AI代码评审系统运营数据如何?

30天内运行了131,246次评审,覆盖48,095个MR,中位耗时3分39秒,中位成本0.98美元,P99成本4.45美元,缓存命中率85.7%,break glass仅占0.6%。

Cloudflare对国内团队有哪些启示?

启示包括:先解决“Agent知道什么”再谈“Agent能做什么”;标准要先机器可读再谈自动化执行;审批和强制执行要分开;不是模型越贵越好而是分工越细越好;“不该做什么”比“该做什么”更值钱。

🏷️

标签

➡️

继续阅读