数据本体定义:你的AI代理所缺失的语境层

数据本体定义:你的AI代理所缺失的语境层

💡 原文英文,约2200词,阅读约需8分钟。
📝

内容提要

企业数据架构长期假设结构清晰、人可理解,但AI代理缺乏业务语境,易给出自信却错误的答案。文章主张构建“本体”层,连接数据与业务含义,明确权威定义、计算与权限。应只治理关键概念,长尾知识从现有资产中持续学习,避免全企业建模沦为搁置项目。本体结合治理可提升代理准确率与可信度,使其从报告走向可信行动。

🔎

延伸解读

本体与模式:从结构到业务含义

文章指出,模式描述数据如何组织,而本体解释数据在业务中的含义。例如,模式告诉代理表中有net_rev、gross_rev等字段,本体则帮助代理理解哪个收入定义适用于当前问题、财务认可哪个数据源、计算如何执行以及提问者是否有权限访问。这种从结构到含义的转变,是AI代理能否给出可信答案的关键。

避免全企业建模:治理头部,学习长尾

过去语义层和知识图谱常因试图手动建模整个企业而失败。文章建议采用“建模头部,学习尾部”的策略:人工明确治理少数不能出错的概念(如收入、合规规则、核心KPI),而更广泛的本体则从仪表板、查询、笔记本等现有资产中持续学习。这样既能保持对关键概念的控制,又能避免本体项目因跟不上业务变化而搁置。

上下文税与代理可信度

文章提到,企业已经支付“上下文税”:分析师花时间重新发现定义、寻找权威来源、协调冲突报告。AI代理缺乏上下文时,会重复类似的发现过程,增加延迟、令牌消耗和成本,但更大的代价是信任。一旦用户发现仪表板或AI助手自信地给出错误数字,他们就会回归人工。因此,构建本体层不仅是技术投资,更是维护信任的必要措施。

治理的双重角色:权限与权威

在基于本体的代理中,治理有两个关键作用。一是权限控制:本体不能绕过现有权限,代理检索上下文时应强制执行底层数据源的治理规则,确保不同权限的员工获得不同答案。二是权威信号:认证、权威定义、血缘、使用情况等成为区分官方定义与一次性计算的信号。治理不再只是控制数据,而是教导AI哪些业务知识值得信任。

❓

Q&A

为什么AI代理在企业数据环境中容易给出自信但错误的答案?

因为企业数据架构长期假设有知识的人可以理解数据含义,但AI代理缺乏业务语境,无法知道哪个定义、来源或计算是权威的,因此会自行推断,产生看似合理但错误的答案。

数据本体(ontology)和数据库schema有什么区别?

Schema描述数据的结构,而本体描述数据在业务中的含义。本体将技术资产(如表、指标、查询)与业务概念(如定义、关系、计算、权威来源、权限)连接起来,帮助理解数据如何被组织理解和运用。

如何避免数据本体项目像之前的语义层一样沦为搁置项目?

不要试图手动建模整个企业。应该只治理少数关键概念(如收入、合规规则、核心KPI),而长尾知识则从现有资产(仪表板、查询、笔记本等)中持续学习,并按照权威性排序,同时尊重治理规则。

数据本体如何提升AI代理的准确率?

本体为代理提供权威的业务语境,告诉它哪个定义适用、可信数据在哪里、哪些关系和计算重要,从而减少猜测和探索错误路径。例如,Databricks内部基准测试中,使用Genie Ontology的Genie首次尝试正确率达84.5%,而最强通用编码代理仅为52.4%。

治理在基于本体的AI代理中扮演什么角色?

治理有两个作用:一是确保访问权限,本体不能绕过现有权限,代理只能检索用户有权访问的上下文;二是帮助AI判断哪些知识值得信任,通过认证、权威定义、血缘、使用情况等信号区分官方定义和一次性计算。

企业如何判断自己是否缺少业务语境层?

明显的信号是:简单的业务问题需要知识丰富的人翻译才能用数据回答,比如问“上季度收入是多少?”分析师反问“哪个收入?”或“哪个业务单元?”。其他迹象包括重复的仪表板、冲突的KPI定义、分析师反复回答相同问题、业务用户不信任自助服务等。

🏷️

标签

➡️

继续阅读