95% 的业务分析交给 AI 后,Anthropic 数据团队做对了什么? - 编程一生

95% 的业务分析交给 AI 后,Anthropic 数据团队做对了什么? - 编程一生

💡 原文中文,约5000字,阅读约需12分钟。
📝

内容提要

Anthropic数据团队将95%业务分析交给AI,准确率达95%。核心方法:建立标准数据层、维护元数据、用Skill提供操作手册、持续评测验证。关键发现:查数难点在上下文映射而非SQL生成,历史SQL直接检索无效,数据治理因AI更重要。建议从少量标准数据集、薄Skill和几十个测试问题起步。

🔎

延伸解读

查数难点在上下文映射,而非SQL生成

Anthropic团队发现,AI查数的主要瓶颈不是写SQL,而是将自然语言问题准确映射到数据模型中的实体。同一个业务问题往往只有一个正确答案,但“收入”“活跃用户”等概念在不同表中有不同定义。因此,他们强调先明确业务口径,再生成SQL,这与传统编程中“解法多样”的思维不同。

数据治理因AI而更重要

文章指出,AI的终端用户是代表业务做决定的Agent,它们无法像人类分析师那样自行验算底层逻辑。因此,数据治理变得比以往更重要。Anthropic通过建立标准数据层、强制治理、维护元数据等方式,确保Agent能访问到最新、最准确的数据定义,避免“看起来精确、实际口径错误”的答案。

历史SQL直接检索几乎无效

Anthropic的对照实验显示,让Agent直接搜索全公司历史SQL语料,准确率提升不到1个百分点。即使Agent读到了正确答案,仍会因结构映射问题而用错。因此,他们建议将历史SQL提炼成按领域组织的参考文档和分析模式,放入操作手册,而不是让Agent直接检索原始语料。

从最小可行系统起步

Anthropic建议,从零开始构建AI查数系统时,不必一开始就搭建复杂架构。只需少量官方标准数据集、几十个离线评测问题和一份薄的知识Skill,就能获得大部分收益。他们强调,先跑通最小闭环,再逐步增加功能,避免过度设计。

Q&A

Anthropic 数据团队如何实现 95% 的业务分析由 AI 完成?

Anthropic 数据团队通过建立标准数据层、维护元数据、使用 Skill 提供操作手册,并持续评测验证,实现了约 95% 的业务分析查询由 Claude 自动化完成,准确率约 95%。

为什么说查数难在上下文映射而不是 SQL 生成?

因为同一个业务问题往往只有一个正确答案和一套正确口径,难点在于将自然语言问题准确映射到数据模型中具体、最新、治理过的实体上,而 SQL 生成相对简单。

Anthropic 总结的 AI 分析 Agent 的三类主要错误是什么?

三类错误是:概念对不上表(选错表或字段)、信息过期(文档或操作手册未维护)、该用的资料没找到(搜索空间太大导致检索不到)。

Anthropic 的四层 Agent 分析栈包括哪些部分?

四层包括:数据底座(标准数据层)、标准答案来源(指标层、血缘图、历史 SQL、业务上下文)、操作手册(Skill)、持续检验(离线评测和在线验证)。

为什么历史 SQL 直接检索对 AI 查数几乎无效?

因为即使 Agent 读到了包含正确答案的历史 SQL,仍然会用错,瓶颈是结构(映射)而不是访问(权限)。正确用法是将历史 SQL 提炼成参考文档和分析模式,放入操作手册。

Skill 在 Anthropic 的 AI 查数系统中起什么作用?

Skill 是操作手册,分为知识型(顶层路由)和流程型(分析师工作流),能显著提升准确率。没有 Skill 时准确率不超过 21%,加上后稳定到 95% 以上。

Anthropic 如何维护 Skill 文档以保持其准确性?

Skill 文档与转换模型同仓库,改报表模型的合并请求如果不改 Skill 文件,代码审查钩子会标记。约 90% 的数据模型合并请求包含 Skill 变更,并通过自动同步保证各工具使用同一版本。

Anthropic 建议从零开始实施 AI 查数最少需要做什么?

最少需要:少量官方标准数据集、几十个离线评测、一份薄的知识 Skill。这些就能获得大部分收益,其他内容可以后续逐步添加。

Anthropic 在数据治理方面有什么观点?

数据治理没有因为 AI 而变不重要,反而更重要了。因为现在的终端用户是代表业务同僚做决定的 Agent,他们无法自己验算底层是否正确。

🏷️

标签

➡️

继续阅读