
Google Cloud AI基础设施月度更新

Google Cloud 在 2026 年 5 月至 7 月间密集发布了一系列 AI 基础设施更新,涵盖计算、存储、网络、安全及编排工具。在计算方面,C4N 虚拟机正式上线,这是首个网络和块存储优化实例,基于第五代 Intel Xeon 处理器和 Titanium 卸载硬件,提供 400 Gbps 网络带宽、95 MPPS 报文转发速率以及搭配 Hyperdisk Extreme 时高达 25 GiB/s 的块存储吞吐量。针对 TPU 用户,Google 推出了 TPU Developer Hub 和基于 OpenTelemetry 的遥测采集代理,可将高保真 TPU 硬件指标路由到 Cloud Monitoring 或自建 Grafana。存储方面,Managed Lustre 正式提供四个性能层级(每 TiB 容量 125/250/500/1000 MB/s),可扩展至 8 PB;同时发布了 Cloud Storage Rapid 系列(Rapid Bucket 和 Rapid Cache),旨在加速 AI 工作负载的存储访问。
在编排与性能优化上,GKE Dataplane V2 已支持 15,000 节点集群并同时启用网络策略。针对强化学习负载,llm-d 中的协作时间分片功能可将加速器占空比从约 40% 基线提升至 70% 而不影响模型收敛。GKE Agent Sandbox 正式 GA,帮助在固定计算资源上安全打包更多 Agent。基准测试显示,GKE Inference Gateway 相比下一领先管理 K8s 服务吞吐量高 15.7%,等待时间短 92.8%,令牌间延迟低 62.6%,优势来自前缀缓存(KV cache 复用)。
安全方面开源了 k8s-aibom,一个轻量级无特权 Kubernetes 控制器,可持续检测集群中的 AI 运行时(如 vLLM、Triton)并生成标准 CycloneDX ML-BOM。机密计算扩展到 G4 机器系列(搭载 NVIDIA RTX PRO 6000 Blackwell GPU),可在 TEE 中保护使用中的数据。
指南与深度内容涵盖:Moonshot AI 的 Kimi K3(2.8 万亿参数)开放权重发布当天(Day 0)即提供 Google Cloud 部署支持;在 Ironwood (TPU v7x) 上优化 Mistral 3 大 MoE 模型推理,通过混合分片、树规约、GMM/MLA 内核优化和异步调度取得 1.5 倍性能提升,吞吐量提高 48% 且保持基准准确率不变;还有 Ray 在 TPU 上运行的系列教程、TPU 微基准测试套件,以及利用 Model Context Protocol (MCP) 将 Agent 连接到 Cloud Storage 非结构化数据的实践。
报告与客户案例方面:Gartner 首份 AI 基础设施魔力象限将 Google 评为领导者,在“执行能力”和“愿景完整性”上均获最高分。Google 对 1400 多名 IT 高管的调查显示 83% 的组织需要升级基础设施以支持生产级 Agentic AI,基础设施与 AI 抱负的差距正在扩大。客户案例包括 Pager Health 利用 GKE 和 Gemini 平台消除运营碎片化、Trustpilot 在 A2 VM 上使用 Gemma 模型和 vLLM 构建高吞吐流管道、Imgix 在 G4 VMs 上为超过 80 亿张图片和视频提供服务。


