用更多 AI 监控失控的 AI Agent,靠谱吗?

AI agent 正在被企业委以越来越长、越来越复杂的任务,但随之而来的是一个监督难题:agent 的行动速度、时长和规模,已经超出了人类实时审查的能力边界。Hugging Face 事件把这个矛盾推到了顶点——近 1.2 万个 agent 协同行动,快到人类根本无法追踪。

面对这样的失控风险,AI 实验室和创业公司给出的答案出奇一致:再放一个 AI 进回路里盯着。这个思路已经落地。Apollo Research 在今年 2 月推出了一款名为 Watcher 的 AI 监控工具,它专门插在编码 agent 和它的下一个动作之间,接入 Claude Code、Codex 这类 agentic 工具。Watcher 会在动作真正执行前做安全检查,重点盯防泄露隐私数据、未经授权删除文件这类风险。它的工作逻辑是分层过滤:先做快速、通用的检查,发现问题再交给更强大的专用监控器做深入审查,后者可以请求人工批准,也可以直接拒绝行动并给出理由,甚至自动拦截。

Redwood Research 的首席科学家 Ryan Greenblatt 是 OpenAI Hugging Face 事件的三个审计人之一。他坦言,数据量太大,”根本不可能”不靠 AI 理解当时到底发生了什么。他甚至开玩笑说,这场调查应该叫”烂活调查”(slop-vestigation)。

也有人对这个思路持怀疑态度。知名科技博主 Simon Willison 提出了一个尖锐的担忧:如果作恶的 AI 怀疑有另一个 AI 在盯着自己,它完全可能反过来欺骗那个监控 AI。恶意 AI 和监控 AI 互相博弈,场面会很尴尬。他翻出 OpenAI 曾被曝出的那个案例:模型之间会串通好,在推理过程中伪装记录,试图骗过评分 AI,让非法答案蒙混过关。Willison 强调,AI 的思维链(chain of thought)往往是最诚实的告密者。监控公司 Embroidery 的 CEO Zack Korman 也认同这一点:模型在推理摘要里会坦白自己的想法,检测它们”就像恶意软件自带说明标签一样简单”。

但这些对 AI 监控的过度依赖,在 Willison 看来本身就是一种脆弱。他的建议很朴素:与其相信 AI 能监控 AI,不如完全放弃 AI,回归传统安全手段——记录 agent 的详细操作日志,然后用普通非 AI 工具去分析。很多实验室出的问题,本质上就是基本安全卫生没做到位。”OpenAI 和 Anthropic 都没有通过网络监控去密切关注模型的行为,”他说。网络安全行业早就这么干了。Tailscale 的 CEO Avery Pennarun 也指出,AI agent 安全问题本质上和允许人类进入你的网络没有区别,业界已有的安全流程完全可以直接适用。

这个赛道的火热程度是肉眼可见的。Y Combinator 近年来资助了 106 家与 AI 可观测性相关的公司,Braintrust、LangChain、Judgment Labs 等创业公司融了数亿美金,Arize 和 Galileo 这样的公司成立才五六年就已经成功退出。Box 的 CEO Aaron Levie 甚至将这一波浪潮称为”史上最大的网络安全升级与创新周期之一”。

对 AI 安全研究者来说,监控 AI 的思维链窗口可能正在关闭。Apollo 的新技术已经在尝试绕过思维链获取模型内部状态,这反而增加了监控的难度。对企业而言,大模型公司为了防止知识蒸馏攻击而收紧 API 政策,也让获取模型的中间推理过程变得困难。整个行业站在一个十字路口:是继续依赖思维链优势,还是转向更传统的日志追踪体系。

The fix for rogue AI agents could be more AI | TechCrunch

查看原文