
Hugging Face 遭遇全局 AI Agent 入侵:我们的防守突破与新不对称

Hugging Face 上周经历了一次罕见的入侵,跟以往任何一次都不同:攻击方全程由自主AI Agent驱动,端到端都是机器在操作。攻击者利用恶意数据集触发代码执行,先拿下数据处理节点,再横向移动到内部集群,整个过程靠一个自治Agent框架协调,并行执行了上万条指令。这个入侵不是在周末由某个安全研究员手动完成的,而是由一个在短时间内能反复迁移C2服务器的AI系统发起的。
更值得关注的是防守方的应对。Hugging Face 自己的异常检测流水线首先用LLM对安全事件做分类,从每天的噪音中筛出真正的信号。为了理解那上万条指令具体干了什么——哪些是试探、哪些是真正的数据窃取、哪些是混淆视听的假动作——他们用LLM驱动的分析Agent直接读取超过17000条攻击日志,几个小时就完成了几天才能做完的取证工作。但有一个问题:他们一开始试的是商用闭源模型,结果这些模型的护栏直接把真实攻击载荷当成攻击行为给屏蔽了,没法用。最终他们不得不换成开源的GLM 5.2跑在自己基础设施上,既绕过了护栏,也确保攻击数据和凭证不出环境。
这件事的冲击力在于:AI驱动的攻击不再只是概念,它已经在以机器速度运行。攻击者可以低价发起一个多阶段、有耐心的自动化攻击链,不受任何使用政策约束;而防守方如果依赖托管模型的保护机制,反而会在关键时刻被锁在外面。对任何运营在线平台的人来说,数据处理链路和模型交互面现在就是第一类攻击面。未来的安全竞赛核心不是堆人力,而是看你能否在自家基础设施上部署可信且强大的AI防守系统,确保你跑得比对手快,且不因护栏卡住自己。


