GKE 多集群推理网关,如何把全球 GPU 池当成一台机器?

Google Cloud 发布了一篇关于多集群 GKE Inference Gateway 的技术博客,核心论点是:AI 基础设施需求高涨,但全局加速器短缺让团队难以仅靠单个数据中心获得全部算力,容量往往分散在不同地域的多个集群。与此同时,长上下文 Agentic 负载(上下文窗口达 100k-800k+ tokens)对加速器内存消耗远超此前任一代 AI 流量。GKE Inference Gateway 的目标是解决算力碎片化问题,通过分层路由架构,让全球分散的 GPU/TPU 集群像单一大池子一样工作,从而最大化“单位美元获得的智能”。

架构分为两层:多集群 GKE Inference Gateway 负责全局多地域流量分发和高可用;下方的 LLM-d 路由器处理复杂的内存感知调度算法,保持高利用率。这一架构设计刻意不绑定特定运行时、模型或加速器,能跨不同 serving 框架、模型系列以及 GPU/TPU 硬件工作。

在 17,000 个计算节点、横跨美国和欧洲的多区域 GKE 部署中,相关团队对其进行了基准测试,负载是使用 SGLang 的领先 MoE 基础模型。结果显示:扩展到 3 个集群后,吞吐量保持近线性提升,并在高并发多客户端下维持 99.9% 的成功率。此外,通过多集群 GKE Inference Gateway 路由流量的开销极低:全局路由比本地集群直连调用的吞吐量仅降低不到 1%(约 99.5% 吞吐量)。具体数据:单个集群 0.72 req/s,2 个集群 1.40 req/s,3 个集群 2.10 req/s,同时成功率维持在 99.9% 以上。

关键路由机制:传统的轮询(round-robin)负载均衡不适用于 LLM,因为请求并非等价——重型 prompt 会占满 GPU 计算核心,长生成会撞上内存带宽,长上下文对话则会悄悄吃光 VRAM,直到引擎无法再调度任何任务。该 Gateway 通过实时应用信号路由:利用 KV-cache 利用率,这是一个关键的运行指标。具体而言,Endpoint Picker Proxy (EPP) 读取底层推理引擎暴露的 KV-cache token 利用率,作为负载均衡指标。当某个地域的集群依赖该指标触发热点阈值,负载均衡器会将超出的流量调度到下一个健康地域。在跨地域监控的部署中,它监控全局 17,000 个节点的内存压力。

这一机制的效果是:当跨地域路由时,流量接近线性扩展。与此形成对照的是,单一集群在大型 MoE 模型下容易出现内存瓶颈。该架构还能与 GKE 原生特性(如 LeaderWorkerSet 和 Kubernetes Gateway)协作,实现自动路由和故障切换。对于大型基础模型构建者,建议使用开放、可移植的推理栈(如 LLM-d on GKE),以适应多集群,根据实际集群算力弹性分配。最终,该系统能将三个隔离的地域数据中心变成一个统一的全球加速器池,在高并发下实现接近满负载的硬件利用率。

GPU and TPU utilization with multi-cluster GKE Inference Gateway

查看原文