
初创团队上云前必答的 10 个问题

Google Cloud 官方博客面向初创团队,给出了从原型到生产规模时必须回答的 10 个问题,按 Onboard(搭建项目与身份)、Scale(在不超支的前提下提升吞吐)、Govern(管住成本、密钥与 Agent 行为)三个阶段展开,每个问题附可直接复制的代码片段。
核心前提是:AI Studio 的 API Key 适合快速做原型,但一旦有真实用户,就要迁移到 Gemini Enterprise Agent Platform(原 Vertex AI)。两者暴露的是同一族 Gemini 模型,但后者具备 IAM 服务账号认证、VPC 服务控制、日志监控、预留容量与合规能力。迁移代码改动极小(google-genai SDK 两行切换),真正耗时的是项目治理配置,这正是第 2、3、4 题要解决的。
关于身份认证,层级清晰:原始 API Key 只适合本地原型,生产环境必须用服务账号 + 最小权限 IAM 角色,代码通过 ADC 自动获取短时令牌,完全看不到密钥。给服务账号分配角色时,明确要求“最低权限”,避免默认 Admin/Editor 这类过宽角色,防止凭证泄露后变成主钥匙。迁移触发条件不是“系统坏了”,而是:密钥离开笔记本、团队超过一人调用、月花费超几百美元、或即将接入付费客户。泄漏密钥可能被用于蒸馏攻击,账单在收到告警前就可能累积数万美元,责任方是客户自己。
在 Scale 阶段,最常见的错误是过早购买 Provisioned Throughput(预留容量)。作者推荐的务实路径是:先用 Standard PayGo 测量真实请求形态(p50/p99 的 token 速率),429 风暴出现后为关键流量临时启用 Priority PayGo(约 1.8 倍价格),等基线可预测再用 PT 覆盖平坦部分,超出的尖峰溢出到 PayGo。同时,把不需要实时响应的任务移入 Batch Prediction,它走独立队列、不占交互配额、价格约为实时推理的一半。对于 429,优先固定区域端点(避开 global 路由竞争),并启用 SDK 内置的重试与退避——注意旧版 if_transient_error 装饰器不认识新异常类,会静默放过 429。
治理部分的亮点是 2025 年 7 月新推出的 spend cap 预算(预览),它能在费用达到预算 100% 时暂停服务,而不仅仅是发邮件提醒。但它有局限:只能按项目、按服务设置(不是账户级保护),基于预估成本,暂停后需手动恢复(最多一小时),且会同时停掉 Provisioned Throughput 使用。更硬核的机制是预算触发 Pub/Sub 后调用 Cloud Function 解绑账单账户,这能快速停掉所有服务,但可能让资源不可恢复,应作为第二道防线。另一个轻量做法是设置显式配额覆盖,低于平台默认值,让密钥即使泄露也无法烧钱。
密钥管理方面,明确要求用 Secret Manager 而非 .env,定期轮换,并用通知与敏感数据保护扫描仓库中的密钥。对于代表用户操作的 Agent,绝不能用长期令牌,必须用 OAuth 2.0 短时访问令牌 + 刷新流程,这样用户退出或账号被吊销时,Agent 同步失去权限。
最后一题针对 Agent 安全,给出四层防线:给 Agent 独立服务账号(可审计)、沙箱执行生成的代码、用 Model Armor 过滤提示注入与越狱、用 Security Command Center 监控行为异常(如服务账号突然调用从未访问过的 API)。这些在 Agent 处理真实用户或真实资金时缺一不可。
文章末尾给出三个本周可做的行动:审计并轮换仓库中的 API Key,把无需响应的负载迁到 Batch API,打开模型可观测性仪表板并设置 capacity 错误告警。整体行文务实,没有空泛口号,每个问题都有具体配置路径和代码片段,适合正在用 Google Cloud 构建 AI 产品的初创团队直接参照执行。


