
利用Spanner Graph上的Data Commons统一公共与私有数据

Google 宣布 Data Commons 在 Spanner Graph 上正式可用(GA),同时推出新版 Data Commons Platform 预览版,旨在打通企业内部私有数据与来自超过 100 个权威公共数据源(如联合国、世界银行、美国人口普查局、WHO、NOAA 等)的标准化知识图谱。该平台整合了 超过 4000 亿条统计观测数据、26 亿个图边关系和 17 亿个标准化实体节点,覆盖农业、人口、经济、环境和健康等多个领域。
核心架构变化是从依赖 Bigtable 作为缓存层的旧架构,迁移至基于 Spanner Graph 的原生图模型。新架构利用 Spanner 的高可用、水平扩展、多区域事务一致性和对 ISO/IEC 39075 图查询语言(GQL)的原生支持。多实体模式的 Spanner Graph 将实体表示为节点,域链接表示为动态图边,使得可以直接在数据库内用 GQL 执行复杂的关系查询,免去了预计算复杂缓存和内存重建索引的步骤。升级后的关键收益包括:支持针对特定数据集的增量更新、通过 GraphRAG 实现动态图遍历(如实时导航层级关系)、利用 Spanner TrueTime 和 Stale Reads 提供数据版本一致性快照,以及通过 Spanner 列式引擎和 BigQuery Federation 进行大规模运营分析。
Data Commons Platform 新增了对 SDMX 3.0 技术标准的支持,提供了两个高价值 API 端点(可用性 API 和数据 API),支持 SDMX-JSON 和 SDMX-CSV 2.0 格式,可直接与 Tableau、Flourish 和 Observable 等第三方工具集成。
对于希望构建私有实例的组织,新架构解决了旧架构的扩展限制,并简化了数据模式化。开发者可以实例化一个私有 Data Commons Platform,使用与驱动 Google 公共实例相同的可扩展技术。私有实例允许用户完全控制自有数据并限制访问,同时支持通过自然语言查询,将私有数据与 Google 公共实例中的公共数据结果进行联邦查询,而无需数据复制。例如,零售企业可以将国家 GDP 趋势、区域人口结构、就业统计等公共数据与自己的销售历史、门店绩效、供应链物流数据结合,用公共宏观经济指标对比公司内部交易数据,以优化商品分销和识别未开发市场。


