Glyph:面向企业数据目录列描述与敏感本体标注的多策略智能体系统

Glyph:面向企业数据目录列描述与敏感本体标注的多策略智能体系统

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

Glyph系统利用多智能体LLM自动补全企业数据目录的列描述并打治理标签。描述器基于生产该列的管道源码生成描述;标注器并行运行描述、正则和元数据三种策略,再用RRF融合。微调MiniLM编码器使检索NDCG@10从0.55提升至0.92。系统强调无值、代码溯源、逐标签溯源与优雅降级,使多智能体编目可审计、可生产运营。

🔎

延伸解读

多智能体协作如何提升数据目录治理效率

Glyph将列描述生成与列类型标注两个任务交由协作的LLM智能体处理,并以状态图编排。描述器基于生产该列的管道源码生成描述,通过主动检索增强生成从企业GitHub按需获取代码,确保描述有据可查。标注器则并行运行描述、正则和元数据三种策略,再用RRF融合排序结果。这种设计让多智能体编目过程可审计、可运营,适合企业级数据治理场景。

微调编码器对元数据检索的显著提升

Glyph使用批次内对比目标微调了一个6层MiniLM元数据编码器,在分布内留出集上,同标签检索的NDCG@10从基础编码器的0.55提升至0.92,MAP@100从0.19提升至0.90。这一提升表明,针对企业数据目录的特定领域微调能大幅增强元数据标签的检索质量,为标注器的元数据策略提供更可靠的向量检索基础。

无值、代码溯源与优雅降级的设计考量

Glyph强调无值、代码溯源、逐标签溯源与优雅降级。无值意味着不依赖列的实际数据值,仅从管道源码和元数据推断,避免敏感数据泄露;代码溯源使描述可追溯至生产代码;逐标签溯源让每个治理标签都有来源依据;优雅降级确保部分组件失效时系统仍能运行。这些工程决策使多智能体编目系统更符合生产环境对审计和可靠性的要求。

Q&A

Glyph系统主要解决企业数据目录中的哪些问题?

Glyph系统主要解决企业数据目录中列描述缺失和治理标签未分配的问题,即文档债务,这会影响数据发现、访问控制和法规遵从。

Glyph如何生成列描述?

Glyph的描述器通过推理-行动工具循环从企业GitHub按需检索生成该列的管道源代码,并以此为基础生成描述,实现主动检索增强生成。

Glyph的标注器使用了哪些策略?如何融合?

标注器并行运行三种策略:描述标注器、业务线正则标注器和基于微调对比编码器的元数据标注器,然后使用倒数排名融合(RRF)融合它们的排序输出。

微调MiniLM编码器对检索性能有何提升?

微调6层MiniLM元数据编码器使用批内对比目标,将同标签检索的NDCG@10从0.55提升至0.92,MAP@100从0.19提升至0.90。

Glyph系统有哪些关键设计原则使其可审计和可运营?

Glyph强调无值、代码溯源、逐标签溯源和优雅降级,这些设计使多智能体LLM编目可审计且可作为生产服务运营。

Glyph与商业价值/正则敏感扫描器有何不同?

Glyph采用无值和代码溯源设计,提供逐标签溯源和优雅降级,而商业扫描器通常基于值或正则,缺乏这些特性。

🏷️

标签

➡️

继续阅读