轻松大规模跑 GNN:开源分布式 GraphFlow 简介

电信网络正从人工运维走向完全自主。Google Cloud 认为传统规则和普通 ML 都撑不起这个转变:ML 能从海量数据里发现规律,但理解不了网络系统本身;AI Agent 能推理,却无法直接消化网络里数十亿个数据点。因此需要 Graph Neural Networks(GNN)在时空关系数据上建模,再把 GNN 的洞察交给 Agent 去决策,最终向 TM Forum 定义的 Level 5 自治系统演进。

支撑这套体系的是三个组件:Data、ML、AI。底层 Data 是一个网络数字孪生,基于 Spanner Graph 构建,是实时动态的网络图,而不是静态模型。图里包含路由器、接口、VPN、流量四种节点,以及物理包含、物理链路、控制面 peer、业务归属、流量锚定五类有向边。Spanner Graph 提供近乎无限的水平扩展、0-RPO/0-RTO 与五个9的可用性,还能在同一平台支持关系、图、向量和全文检索四种数据模型,并保持全局一致性。

ML 层就是这次的主角 Distributed GraphFlow(DGF)。DGF 是 Google CoreML 和 Google Research 开源的一个 Python 库,负责 GNN 建模的完整生命周期,把 Google 内部十年规模的工具经验搬给云上客户。它既提供高性能、可组合的底层原语给高级团队,也提供不需要 GNN 经验的高层 API。官方示例中,用高层 API 训练和评估一个 GNN 模型只需要 5 行代码

基于 DGF 和数字孪生,电信运营商可以做四类典型场景:异常检测——利用 GNN 生成的节点和边 embedding 标记偏离历史模式的网络实体;根因分析——DGF 能输出只包含相关实例的子图,比如某个邮编区域的 Attach Failures,让排障 Agent 不用扫全图;预测性维护——预测设备故障或链路中断概率,比如快速移动设备的切换失败,配合人类在环自动执行负载均衡或重路由;What-if 仿真——模拟光纤切断、流量激增、配置变更,预测局部变化如何沿网络拓扑传播,提前验证容灾方案。

文章还给出了一条可落地的根因分析流程:先用 dgf.io.read_spanner_graph 从 Spanner Graph 加载数字孪生拓扑,再用 dgf.learning.train_node_model 训练一个监督式节点预测模型;模型预测出受影响节点里最高影响分的实体,作为根因候选;接着把模型导出到 Gemini Enterprise Agent Platform(原 Vertex AI)部署成低延迟推理端点;最后用异常发生时间作为输入做实时推理,直接返回根因实体节点。这套流程把图数据、GNN 训练、模型服务和 Agent 决策串成了一条完整链路,适合想从被动运维转向主动预防的电信团队尝试。

Run GNNs at Scale with Ease: Introducing Distributed GraphFlow

查看原文