为 AI 时代构建的数据中心与全球网络
当前 AI 算力需求持续超越单一数据中心的空间和电力承载能力,Google 的解法是把“校园当作一台计算机”来设计网络架构,将网络解耦为三个独立域:面向加速器互联的 scale-up 域、专用东西向 scale-out 加速器网络,以及 Jupiter 前端网络。这种解耦让各域可以独立演进、与新硬件协同设计,从而在 TPU 8t 集群中支撑 134,000 颗芯片、47 petabits/秒的无阻塞双向带宽,同时将延迟降低 40%。在大规模训练中,单个故障芯片会中断整个同步训练任务,Virgo Network 通过亚毫秒级遥测自动检测挂起事件,在毫秒内定位并隔离故障节点,从检查点恢复任务,避免人工介入。在跨校园 WAN 层面,Google 采用多分片隔离架构结合实时微突发管理,确保 10 倍流量增长下的可用性和 QoS;将 100 Gbps 链路升级至 3.2 Tbps 后,传输 1 PB 数据的时间从 22.2 小时压缩至 0.7 小时,GPU 空闲等待时间降低 97%。整个网络堆栈自底向上整合了芯片、系统、平台和 Agent 生态,统一由 AI Hypercomputer 对外提供弹性算力池。


