Google SRE如何用Agentic AI改进运维

随着微服务架构普及和AI代码生成能力增强,Google内部的系统复杂度已远超过去。跨地域分布、硬件多样性、持续部署带来的频繁变更,以及开发团队交付代码量级的增长,都让传统的SRE方法面临更大压力。但AI本身也在提供新的解决思路,Google SRE正在将AI作为力量倍增器,同时保持对系统的控制能力。

Google SRE将AI能力渗透到软件开发生命周期的多个环节。**可靠性设计阶段**,AI可以自动检测问题并在人工审查前完成修复,显著减少工程师投入的时间。**异常检测**不再依赖静态阈值,而是通过TimesFM等模型分析历史信号,预测客户导向的SLO,自动聚合和丰富告警上下文。**事件管理**方面,AI监控通信渠道、生成交接文档、自动起草事故复盘。**事件调查**则利用可观测性数据和系统拓扑知识,让AI代理形成假设并提出缓解方案。此外,AI Insights系统持续从历史事故中提取有意义的信息,帮助代理和工程师进行更好的风险评估。

Google SRE为AI Agent制定了明确的设计原则:不替换已正常工作的经典自动化系统;必须满足安全、合规和隐私要求;代理需要明确的身份、角色和权限;提供高可靠性的SLO和备份方案;优先选择透明性而非黑盒自动化。在基础设施层面,基于Gemini基础模型和微调版本,结合Agent Development Kit、MCP服务器和标准可观测性基础设施构建自主系统,并建立了自主等级追踪机制来评估系统的实际自主程度。

How Google SRE is using agentic AI to improve operations

查看原文