幕后:我们如何构建、测试和扩展 Google Agent Skills

Google Agent Skills 项目始于 Google Cloud Next 2026 前的快速冲刺(swarm),由开发者倡导者和技术文档团队组成的跨职能小组,目标是将 Google Cloud 领域知识编码成结构化、AI Agent 可读的开源指令。项目发布后社区反应热烈,GitHub 星标超过 15,000,内部外团队纷纷希望贡献自家服务的 skill(不仅限于 Cloud,如 Ads)。

规模扩大带来的核心挑战是质量控制。不同团队贡献 skill 时,标准不一致会导致指令模糊、链接失效、边界情况缺失。为此团队设定了严格流程:每个 skill 遵循标准化仓库布局,设计上优先引用远程 MCP(Model Context Protocol)工具,回退到 CLI 或 API 仅当必要时,因为远程 MCP 服务器自带认证和 IAM 治理,更适合 Agent 工作负载。

具体质量控制手段包括四层:1. 自动化 CI/CD 流水线在提交时运行检查——lint 校验前端元数据、行数、目录布局和命名规范;链接检查器测试每个 URL 以消除 404 和幻觉链接;AI 辅助校验确保指令符合结构模板和护栏。2. 持续评估:新 skill 提交时作者必须提供评测提示集和评分标准,内部先评估准确性和效率;每周运行全量库的定时评估,捕捉回归。评估聚焦两个维度:准确性(响应质量和任务完成率)和效率(消耗的 token 数和执行时间),并针对不同 Agent 框架多次运行以获得统计显著结果。团队用 2×2 矩阵验证 skill 是否带来可衡量的准确率和效率提升。

一个关键认知是:skill 不是一次性文档,而是活的产品的。为此设定了严格所有权规则:仓库维护者负责仓库健康、CI 流水线和架构标准;skill 所有者长期维护,例如当产品 API 变更时更新 skill,或在评估发现质量下降时修复。为帮助作者编写有效指令和评测套件,团队构建了内部辅助工具和 Agent 工作流(基于 ADK 的多 Agent 循环用于写作和自我批评)。此外,内部单独的 DevRel Skills 项目专注于将内部工作流(内容转换、SEO 优化、内部报告等)编码为 skill,提升团队日常效率。

总结来说,Google Agent Skills 的成功依赖于将 skill 作为持续产品而非静态文档来治理,用自动化和持续评估在规模化中保持质量,并强调所有权和远程 MCP 优先架构。

Behind the scenes: How we build, test, and scale Google Agent Skills

查看原文