让你的数据为智能体AI做好准备

让你的数据为智能体AI做好准备

💡 原文英文,约7300词,阅读约需27分钟。
📝

内容提要

本文讨论为AI智能体准备数据架构的必要性。人类分析师能凭经验处理不完整数据,而智能体缺乏判断力,会自信地基于错误数据行动。文章提出构建AI就绪数据需四层:数据契约与隔离确保可信,语义层提供上下文,能力模型控制访问,可观测性保障审计。强调数据产品化、分阶段授权,并指出数据架构即AI架构。

🔎

延伸解读

数据契约:从“灵活”到“可信”

文章指出,过去十年“无模式”的灵活性对人类分析师只是不便,但对AI智能体却是危险的。数据契约将模式视为法律,通过Open Data Contract Standard等格式明确规则,并设置新鲜度SLA。例如,若价格数据超过24小时未刷新,契约即被违反,数据被隔离,智能体不会引用错误价格。这逆转了传统思维,强调为机器消费而设计数据。

智能体的“自信错误”风险

人类分析师对异常数据有直觉,会怀疑并核实;而智能体缺乏这种判断力,会自信地基于错误数据行动。文章举例:定价智能体因数据未刷新而引用旧价格,导致公司亏损。调查显示,87%的领导者认为数据已为AI就绪,但43%视数据就绪为最大障碍,这种信心与现实的差距正是组织层面的“自信错误”。

治理与审计:从“发生了什么”到“为什么”

传统日志记录“什么”,但智能体需要解释“为什么”。文章提出智能体血缘追踪,记录决策原因,如“先查KYC,再查制裁名单,最后批准”。欧盟AI法案第12条要求高风险系统自动记录日志,违规可能面临高达1500万欧元或全球营业额3%的罚款。即使无监管要求,可解释性也是信任和调试的基础。

能力模型:设计能力而非端点

文章警告,将REST API一对一包装成工具会导致工具泛滥,降低智能体准确性。更好的做法是设计少量、描述丰富、参数化的业务能力,如“检查服务状态”而非多个特定端点。每个能力需声明权限、所有者、前置条件和可逆性。可逆性比交易金额更能预测安全自主性,不可逆操作应始终需要人工批准。

Q&A

为什么AI智能体需要专门的数据准备,而人类分析师不需要?

人类分析师能凭经验处理不完整或错误的数据,会怀疑和检查异常;而AI智能体缺乏判断力,会自信地基于错误数据行动。因此,数据必须为机器消费做好准备,确保可信、有上下文且可操作。

数据契约是什么?它如何防止智能体使用过期数据?

数据契约是用Open Data Contract Standard等格式明确定义数据规则(如模式、质量、新鲜度)的规范。例如,产品定价契约可规定价格必须大于零、货币必须是ISO代码,且数据必须在24小时内刷新。若违反契约,数据会被隔离,智能体无法访问,从而避免使用过期数据。

什么是隔离模式?它如何工作?

隔离模式是当数据违反数据契约时,将其路由到死信队列进行人工审查,而不是让智能体访问。流程是:原始数据先通过契约验证门(检查模式、新鲜度、质量),通过则进入认证层,失败则被隔离并触发警报。这样智能体永远不会看到坏数据。

什么是自适应黄金层?它有什么作用?

自适应黄金层是medallion架构中的第四层,其中智能体成为数据管理的主动参与者,监控自身查询模式,识别频繁访问的组合,并物化优化数据集,从而构建自己的仓库视图。这已在苹果公司的数据目录中实现,智能体作为“数字管家”持续扫描元数据、标记差距并提出更新。

为什么智能体只能访问黄金层及以上的数据?

因为青铜层和白银层的数据可能未经验证或部分验证,暴露给智能体会导致错误决策。黄金层是经过验证和认证的数据,智能体只能访问黄金层及以上,以确保数据可信。

对于非表格数据(如文档),如何应用数据契约和质量门?

对于文档等非表格数据,数据契约转向元数据,要求每个块携带来源、版本、时间戳和访问范围。质量门检查包括拒绝空或截断的块、捕获近似重复文档、标记失败的提取和OCR垃圾,并监控嵌入漂移。新鲜度SLA关注索引重建时间,而非内容更改时间。

什么是置信度阈值路由?它如何工作?

置信度阈值路由是一种机制,智能体根据数据质量信号(如新鲜度、完整性、一致性)评估置信度,若高于阈值(如85%)则自主行动,否则转交人类。阈值可按用例配置,例如定价要求90%,内部FAQ为70%。数据质量信号应驱动阈值,而非仅模型自信度。

什么是智能体血缘?它如何帮助满足监管要求?

智能体血缘是传统数据血缘的扩展,不仅追踪访问了哪些数据源,还追踪智能体为何决定访问它们。例如,在贸易金融中,一个trace代表处理信用证的端到端工作流,每个span记录一个步骤,如先检查KYC,再检查制裁名单,最后批准。这有助于回答监管机构“为什么批准”的问题,满足EU AI Act第12条和第19条的日志要求。

EU AI Act对日志记录有什么具体要求?

EU AI Act第12条要求高风险AI系统自动记录事件,以便事后重建“为什么”;第19条要求提供商保留日志至少六个月。违反记录义务可能面临最高1500万欧元或全球年营业额的3%的罚款,以较高者为准。

智能体如何分阶段获得自主权?

智能体自主权是分阶段获得的,类似于新员工逐步获得权限。阶段包括:先观察,然后建议,再在监督下行动,最后获得有限自主权。晋升应基于证据,而非猜测,需要在每个阶段进行测试。

🏷️

标签

➡️

继续阅读