内容提要
Genie Agents在Databricks中整合结构化与非结构化数据,通过Unity Catalog实现治理。代理以用户身份运行,继承对象权限、ABAC、行过滤和列掩码,确保数据安全。身份自动同步,文档存于Volumes并受权限控制。示例显示不同区域经理查询同一问题,结果按权限过滤,确保治理不依赖模型层。
延伸解读
治理下沉到数据层,而非模型层
文章强调,Genie Agents的安全边界由Unity Catalog的数据治理机制控制,而非依赖LLM的提示工程。这意味着即使模型被诱导或绕过,也无法返回用户未被授权的数据。这种设计将安全责任从模型层转移到数据层,使得审计和合规更可靠,因为治理策略是声明式的、可验证的,而不是依赖模型的行为。
身份同步是治理的基础
访问控制的有效性取决于身份信息的准确性。Automatic Identity Management (AIM) 自动从Microsoft Entra ID或Okta同步用户、组和成员资格,确保权限实时更新。员工调动或离职时,权限即刻调整,无需手动干预。这避免了因身份信息滞后导致的数据泄露风险,是治理体系持续有效的前提。
卷权限的粒度限制需注意
在非结构化数据治理中,Unity Catalog Volume是最小的安全单元,权限作用于整个卷而非单个文件。这意味着无法对卷内特定文件进行细粒度授权。此外,卷作为Genie Agent的必需来源,用户若缺少对卷的读取权限,将无法使用该代理。因此,设计代理时需根据受众划分卷,并确保每个代理挂载的卷与用户权限匹配。
Q&A
Genie Agents如何同时处理结构化数据和非结构化数据?
Genie Agents可以同时基于结构化数据(如表、视图、指标视图)和非结构化数据(如Unity Catalog Volumes中的文档)进行推理,统一回答跨类型问题。
Genie Agents的数据治理是如何实现的?
Genie Agents的治理位于Unity Catalog目录层,而非模型层。代理以最终用户身份运行,自动继承对象权限、ABAC、行过滤器和列掩码,确保每个答案在数据层过滤后才返回。
Automatic Identity Management (AIM)在Genie Agents中起什么作用?
AIM自动从Microsoft Entra ID或Okta同步用户、组和成员资格,实现持续治理。当员工调动或离职时,权限即时更新,无需手动干预。
Genie Agents如何控制对结构化数据的访问?
通过对象权限(如SELECT)、行过滤器(基于组)和列掩码(如掩码邮箱)分层控制。ABAC策略通过治理标签自动应用保护,无需逐表配置。
Genie Agents如何处理非结构化文件(如文档)的权限?
非结构化文件存放在Unity Catalog Volumes中,通过GRANT READ VOLUME控制访问。卷是必需来源,用户必须具有权限才能使用代理,且权限作用于整个卷而非单个文件。
在示例中,APAC和AMER区域经理查询相同问题,结果有何不同?
APAC和AMER区域经理查询相同问题,但结果分别只显示各自区域的数据,且客户邮箱被掩码,验证了治理不依赖模型层。
生产部署Genie Agents时需要注意哪些事项?
需要注意卷权限范围(权限作用于整个卷)、代理源配置(卷是必需来源)和身份同步的及时性,确保治理策略正确实施。