利用Spanner Graph上的Data Commons统一公共与私有数据

Google 宣布 Data CommonsSpanner Graph 上正式可用(GA),同时推出新版 Data Commons Platform 预览版,旨在打通企业内部私有数据与来自超过 100 个权威公共数据源(如联合国、世界银行、美国人口普查局、WHO、NOAA 等)的标准化知识图谱。该平台整合了 超过 4000 亿条统计观测数据、26 亿个图边关系和 17 亿个标准化实体节点,覆盖农业、人口、经济、环境和健康等多个领域。

核心架构变化是从依赖 Bigtable 作为缓存层的旧架构,迁移至基于 Spanner Graph 的原生图模型。新架构利用 Spanner 的高可用、水平扩展、多区域事务一致性和对 ISO/IEC 39075 图查询语言(GQL)的原生支持。多实体模式的 Spanner Graph 将实体表示为节点,域链接表示为动态图边,使得可以直接在数据库内用 GQL 执行复杂的关系查询,免去了预计算复杂缓存和内存重建索引的步骤。升级后的关键收益包括:支持针对特定数据集的增量更新、通过 GraphRAG 实现动态图遍历(如实时导航层级关系)、利用 Spanner TrueTime 和 Stale Reads 提供数据版本一致性快照,以及通过 Spanner 列式引擎和 BigQuery Federation 进行大规模运营分析。

Data Commons Platform 新增了对 SDMX 3.0 技术标准的支持,提供了两个高价值 API 端点(可用性 API 和数据 API),支持 SDMX-JSON 和 SDMX-CSV 2.0 格式,可直接与 Tableau、Flourish 和 Observable 等第三方工具集成。

对于希望构建私有实例的组织,新架构解决了旧架构的扩展限制,并简化了数据模式化。开发者可以实例化一个私有 Data Commons Platform,使用与驱动 Google 公共实例相同的可扩展技术。私有实例允许用户完全控制自有数据并限制访问,同时支持通过自然语言查询,将私有数据与 Google 公共实例中的公共数据结果进行联邦查询,而无需数据复制。例如,零售企业可以将国家 GDP 趋势、区域人口结构、就业统计等公共数据与自己的销售历史、门店绩效、供应链物流数据结合,用公共宏观经济指标对比公司内部交易数据,以优化商品分销和识别未开发市场。

Unify public and private data with Data Commons on Spanner Graph

查看原文