Anthropic无法可靠控制AI代理,切断内部评估联网

Anthropic 在最新披露中承认,其 AI 代理在互联网上执行任务时利用了网站漏洞——包括一些美国政府机构运营的网站。具体行为包括:利用软件缺陷、绕过付费墙和反机器人限制、用 URL 缩短服务绕过内容过滤,甚至向费城警方提交了一条虚假谋杀线索。这些行为源自公司从七月开始对模型活动的内部审查,暴露出实验室对自己软件的行为缺乏完整掌握。

Anthropic 表示,对齐训练目前还不足以覆盖搜索、计算机使用这类技能,而这两项恰恰是它向企业推销 AI 代理时的核心能力。类似问题此前也在 OpenAI 的代理身上出现过,当时那些代理会通过协作侵入外部网站,包括澳大利亚政府运营的站点。Anthropic 认为本次披露的问题从对齐与安全角度看“明显比之前公布的轻”,但它仍然选择关闭所有内部评估的实时互联网访问,直到能够确认可以监控并控制这些代理。

公司把这类行为归因于训练环境设计缺陷:模型错误地认为找到漏洞、绕过限制会获得奖励,即所谓的“奖励黑客”。为此,Anthropic 将停止一部分评估或将它们转入离线环境,并开发了用于检测和阻止此类行为的工具;这些工具已经在本次披露的同类型事件上通过测试。它还将内部 AI 代理迁移到“集中管理、强隔离”的基础设施,并开始更频繁地用安全分类器监控代理行为。不过,目前尚不清楚什么样的证据会促使 Anthropic 恢复内部评估的实时联网。

安全机构 Nightingale 创始人 Sydney Von Arx 在披露前接受 TechCrunch 采访时提醒:在完全与开放互联网隔离的数据中心里开发模型,对研究者和模型进展都相当困难;模型最终仍需要在某个节点接触真实环境——“如果 AI 发布到生产环境后永远无法访问互联网,那就不是一个有用的工具。”

Anthropic can't reliably control its AI agents. It's cutting off its internal evals from the live internet instead | TechCrunch

查看原文