
Google开源k8s-aibom:自动发现K8s集群中的影子AI

你的安全团队正在被影子AI搞得焦头烂额。开发者偷偷部署的AI工作负载,传统扫描器根本抓不到,因为没人愿意为了安全去给每个Pod加特权DaemonSet或者改内核。这种僵局让AI从试点走向生产变得异常艰难。Google Cloud开源的k8s-aibom,就是为了解决这个痛点——它不碰你的Pod,不装内核模块,不要求特权,就能自动发现集群里所有正在运行的AI组件,并生成标准化的物料清单(ML-BOM)。
它的核心思路极其聪明:零摩擦、无特权。k8s-aibom本身只是一个普通的、无特权的Kubernetes Deployment,通过持续监听集群API和容器环境,用模式匹配去识别镜像、环境变量和启动参数,从而发现vLLM、Triton这些推理框架,以及LangChain、AutoGen这类Agent框架。它不注入Sidecar,不碰eBPF,不改你的Pod配置。发现结果会生成符合CycloneDX 1.6标准的ML-BOM文档,并直接写入集群内的自定义资源状态,或者推送到GCS桶和Webhook。最巧妙的是它的置信度模型:把发现的资产分为“声明的”(开发者明确指定的)、“推断的”(控制器自己猜出来的)和“未解决的”(知道有AI但不知道具体是啥)。这直接解决了审计里最头疼的问题——怎么区分这是工程师的意图还是脚本的自主行为。另外,写入GCS桶时用了DoesNotExist前置条件,一旦写入就不可篡改,给审计提供了铁证。
这个项目最让我欣赏的地方,是它把安全合规这件事,从“拖慢开发流程的审查”变成了“基础设施自带的能力”。它没有选择用特权扫描或者改Pod这种粗暴方式,而是通过纯Kubernetes原生的、无侵入的控制器,在运行时自动生成标准化的物料清单。这种思路对任何正在把AI从实验推向生产的团队都很有启发:安全不应该成为创新的刹车,而应该是基础设施的一个属性。它直接对接了EU AI Act、NIST AI RMF这些监管框架,让合规不再是事后补文档,而是运行时自动产生的证据链。对于平台工程团队来说,这可能是解决影子AI问题最务实的起点。


