Glyph:企业数据目录的多策略智能体列描述与分类标注系统

企业数据湖的表增长速度远超人工维护能力,大量列缺少描述和治理标签,形成文档债,直接影响数据发现、访问控制和合规审计。Glyph 是一套生产级系统,把列描述生成和列类型标注这两个耦合问题,拆成两个协作的 LLM 智能体,用有状态图编排。

Descriptor 负责生成列描述,它通过一个 reasoning–acting 工具循环从企业 GitHub 按需检索生成该列的管道源码,把代码作为生成依据,属于主动检索增强生成(active RAG)。Tagger 负责从一棵 275 个叶节点的数据分类本体中打标签,并行运行三条互补策略:基于描述的打标器、基于业务线的正则打标器、以及基于微调对比编码器和向量数据库的元数据打标器。三条策略的输出用 Reciprocal Rank Fusion(RRF)做排名融合。

作者微调了一个 6 层 MiniLM 元数据编码器,采用 in-batch 对比学习目标。在分布内留出集上,同标签检索的 NDCG@10 从 0.55 提升到 0.92,MAP@100 从 0.19 提升到 0.90,相对基础编码器提升显著。端到端多标签标注质量用召回加权的 F2 目标衡量,并在三个评估组上报告了结果。消融实验分别隔离了每条策略和 RRF 融合的效果。

Glyph 区别于以往列类型标注工作和商业的基于值/正则的敏感度扫描器的核心工程决策有三点:一是设计上不依赖列值、以代码为接地依据(value-free and code-grounded),这避免了对原始数据的直接访问,也规避了值分布漂移问题;二是每个标签都带有来源(per-tag provenance),可追溯、可审计;三是具备优雅降级(graceful degradation),在部分策略失效时整体仍能工作。这些设计让多智能体 LLM 目录标注可以作为生产服务运行,并满足审计要求。

Glyph: A Multi-Strategy Agentic System for Column Description and Sensitivity-Ontology Tagging of Enterprise Data Catalogs

查看原文