实测:GKE 多集群推理网关 + TPU + 托管 DRANET 跨区域容灾
跨区域 AI 推理服务的高可用是个老问题,但这篇文章实测了 Google Cloud 最新的 GKE Inference Gateway 配合 **Managed DRANET**,看它能否在真实故障场景下自动完成流量切换。
核心思路是把 Gemma 3 模型权重存在 **Cloud Storage FUSE** bucket 里,通过 ResourceClaimTemplate 声明 `netdev.google.com` 设备类,让 vLLM 服务直接挂载 TPUs 的专用加速网络,然后部署到两个不同区域的 GKE 集群。关键一步是用 Helm 把两个独立集群的部署打包成一个逻辑上的 InferencePool,再通过 HTTPRoute 和 InferenceObjective 配置全局流量规则——当主集群节点池不可用时,Gateway 会自动把请求路由到备集群。
这篇文章最有价值的地方在于它验证了这套新功能组合在生产级别的可行性。Managed DRANET 让 TPU 的网络配置从手动分配变成了声明式管理,配合 Fleet 的统一控制面,跨集群的资源调度终于不再需要复杂的自建方案。但要注意的是,文章没有给出 failover 的实际耗时、吞吐量损失或成本对比,这些数字才是决定企业是否真正采用它的关键。


