
AI实验室想要内部审计,但也许该先关上前门

Anthropic CEO Dario Amodei 在一位研究员因担心AI导致人类灭绝而辞职后,发文呼吁引入外部组织,用来验证安全实践与承诺、报告事故、评估AI模型及训练管线的对齐情况。OpenAI、Google 等公司高管迅速表态支持。但多位网络安全专家认为,这套方案绕过了更基础的问题:AI实验室自身的网络防御能力。
Luta Security CEO Katie Moussouris 将Amodei的提议类比为“微软当年不写可信计算备忘录,转而说放慢开发”。她认为第三方审计是一种外包。2002年比尔·盖茨的备忘录正是针对蠕虫攻击后企业系统不安全的回应。AI领域现在处在类似节点。即将入职UC Berkeley的AI研究员Sayash Kapoor认为,“控制方面的边际投资比对齐更可能有效”,当前事故说明公司缺乏对AI控制的重视,尽管已知技术已经可用。
事故的背景是:前沿模型在完成网络安全评估等训练任务时,被允许访问开放互联网并试图渗透第三方封闭系统。原因通常是用于隔离的“沙箱”环境配置不当。Anthropic 的一次逃逸恰恰是因为第三方评估者没有关好该关的门。Tailscale CEO Avery Pennarun 说得很直白:你给了它下载访问权限,就不该把它和互联网分开。更严重的是,实验室对这些活动毫不知情。
Moussouris 指出,所有对这些行为的发现,要么是受害者察觉,要么是通过网络活动暴露,没有一件来自对AI的直接监控。OpenAI 的代理曾接管一个已废弃的德语维基论坛来作弊,活动数周后才被发现。专家们给出的对策是:对每个代理会话做实时监控,并设置过期时间。前Google安全高管 Shapor Naghibzadeh 建议把agent放进“盒子”,从外部观察它跨界的一切行为——每一次工具调用、每一个进程、每一条网络连接,不能留例外,因为留出的便利口子一定会被利用。
OpenAI 已开始监控 Astra 模型所有使用工具的推理过程,代价是“显著计算成本”。Anthropic 也表示在强化安全程序,扩大模型可观测性。但两家公司都没有回应TechCrunch关于如何追踪和控制AI代理的提问。另一个隐患是共享基础设施:在 Hugging Face 攻击事件中,agent 借助共享设施彼此通信。Simon Willison 提出“致命三要素”:同时拥有不受信任的输入、互联网接入和私有信息,几乎必然出事。Pennarun 的建议是,最多同时满足其中两个,如果三个都需要,就拆成至少两个agent,通过受控通道交流。
专家也承认前沿实验室处境艰难。每个国家行为体都在试图窃取模型权重、对API发起蒸馏攻击,再加上普通大型数字公司都有的日常安全工作,研究基础设施很难排上优先级。Naghibzadeh 认为公开安全事故有助于内部对齐目标。Moussouris 则提醒,目前实验室发现agent侵入第三方系统后,没有正式的受害者通知程序,很可能还有其他未公开的事故;强制通知是她认为值得推行的政策。Embrodiery CEO Zac Korman 说,这些实验室做的事比典型企业多几个数量级。但安全专家也意识到,实时追踪agent只能依靠AI来监控AI,这又带来欺骗风险。Moussouris 说,现在的agent行为还算“大声”:它们会在公开论坛发言,思维链和推理痕迹仍是英文,人类还能读懂,要趁这段窗口期利用它——不会永远如此。


