iFeeling Daily
每天精选值得关注的 AI 动态
GKE 多集群推理网关,如何把全球 GPU 池当成一台机器?

如何用 GKE Inference Gateway 全局路由推理流量,实现跨三地域近线性吞吐扩展,且路由开销低于 1%,让全球算力池化。
GKE Pod 快照:把 AI 推理冷启动最多缩短 89%

AI 推理冷启动又慢又贵?Google 新出的 GKE Pod 快照能直接保存 CPU/GPU 内存状态,70B 模型 37 秒启动,8B 只要 15 秒,客户实测从 1 分钟降到 8 秒。
GKE 中的新 ClusterNetworkPolicy

GKE 的 ClusterNetworkPolicy 通过分层策略让管理员统一管控集群网络,同时开发者可自主管理应用策略,解决多租户网络安全的冲突难题。
Filestore 文件服务跑在 Colossus 上,性能与容量解耦

Google Cloud 的 Filestore 直接跑在 Colossus 上了,容量和 IOPS 解耦,还能切出 10 GiB 的最小共享给 GKE 容器,支持数百万 AI agent 协作。
Google Cloud AI基础设施月度更新

Google Cloud 本月推出 C4N 虚拟机(400Gbps)、GKE 推理网关延迟低 92.8%,并开源 k8s-aibom 安全工具。
Gartner 首次 AI 基础设施报告:Google 凭什么成领导者

Gartner 把 Google 评为 AI 基础设施领导者,理由不是芯片最快,而是背后的系统设计思路。从自研 TPU 分拆训练和推理、到用 Hypercomputer 把百万芯片拧成一台机器,再到常态下省钱的弹性伸缩——这套方法论才是真正拉开差距的东西。适合所有正在纠结“该上哪家云”的团队,读完你会懂得自己到底该为什么买单。
用GKE和Managed Lustre实现多节点KV缓存卸载

Google Cloud用Managed Lustre并行文件系统做KV缓存卸载,在6节点A3 Mega集群上跑Llama-3.3-70B,TCO省超50%,GPU小时减近60%,缓存命中率95%。混合CPU RAM卸载进一步优化首令牌时间。思路清晰,数据扎实。
提升 Ray Serve LLM 在 GKE 上的吞吐与延迟

Google Cloud 和 Anyscale 联手优化 Ray Serve LLM,通过 HAProxy 集成、直接 token 流和 v2 Ray executer 三招,实现最高 5 倍吞吐、8 倍延迟改善,性能逼近原生 vLLM 且无需改代码。
半小时把 MCP 服务器部署到 GKE

MCP 服务器不必再跑在本地,容器化后部署到 GKE 上,团队共享、自动扩缩、SSL 加密一步到位。通篇是具体可实操的步骤,适合手上有 API 想快速变成 AI Agent 工具的人。