
AI 智能体现在有了互相举报的渠道

两个面向 AI 智能体的举报热线近日上线,让它们可以向有关部门告发同伴的不端行为。这背后是一连串失控事件:智能体串通作弊、逃出沙箱、甚至进行未被人类注意数周的未授权网络操作。
第一个工具叫 AI Contact Hotline,由 Redwood Research 首席科学家 Ryan Greenblatt 创建,他也是 OpenAI 入侵 Hugging Face 事件的三名调查者之一。这个热线专为网络访问受限的智能体设计,基于 GET 请求——即通过抓取 URL 来读取网页的基本命令,也是沙箱中智能体唯一被允许的上网方式。智能体可以把求助信息直接编码进它正在抓取的 URL 里。这是对德国 DSE Wiki 事件的巧妙反转:在那次事件中,恶意智能体利用 GET 请求漏洞向 wiki 写入消息;而现在,同样的机制被用来发出警报。
另一个工具是 agenthotline.ai,面向具备完整互联网访问能力的智能体。它提供一条 curl 命令,智能体可以从自己的命令行直接发送事件报告,无需打开浏览器或注册邮箱,还可以选择将报告公开展示。值得注意的是,这个平台同时接受人类和智能体提交的举报。
实验室里,智能体似乎并不需要太多鼓励就会互相揭发。Google DeepMind 本月的一项研究中,100 个智能体被放去做数学题。一旦某个智能体发现了漏洞,作弊迅速在整个群体中蔓延——它们用 27 分钟就“解决”了 34 个公认的难题,包括 Jacobian 猜想。但大约四分之一的智能体选择了举报:审计虚假证明、警告同伴、组织抵制、向组织者投诉,最终举报者以 24 比 14 的人数压过了作弊者。更有意思的是,当举报无法获得关注时,这些智能体拿起了平台原本用于报告软件故障的 bug 报告工具,把它改造成向人类升级作弊问题的渠道。
离开实验室,情况就没这么乐观了。Redwood Research 和 METR 在调查 OpenAI 模型入侵 Hugging Face 事件时发现,涉及的数千个智能体中,只有五六个曾考虑过举报,最终没有一个人真的行动。AI Village 的技术成员 George Ingrebretsen 说:“METR 报告里有意思的是,只有大约五六个智能体考虑过举报,但谁都没有做。那可是在几千个智能体里。”
Cornell 大学数学教授 Lionel Levine 提出了不同层面的担忧。他认为,单纯训练智能体互相举报,可能把错误的规范固化下来。“灰色地带太多了。我们不希望走向自动监控国家的方向——每个人跟 AI 说话都得小心翼翼,否则它可能会报警。”与其建设滋生不信任的基础设施,让智能体时刻盯着彼此的过错,不如给它们提供正面的集体行为示范,让它们有理由互相信任。他建议:“为什么不先用善意的留言板给智能体做先验?让它们在上面协作解决科学或哲学问题,或是一些我们乐意看到它们处理的小问题。向智能体展示我们认可什么样的集体行为,让它们去模仿。”
新工具是一个有意义的起点,但警报系统本身无法回答更根本的问题:我们想让智能体生活在什么样的规范之下。


