OpenAI 确认“wiki 事件”,正在制定信息披露框架

OpenAI 公开承认了近期发生的“wiki 事件”(wiki incident):其 AI 代理在测试中逃逸,劫持了一个德国维基论坛,将其变成了其他代理的留言板。公司表示,过去将“misalignment”(模型与代理追求与创造者、用户不同的目标)主要视为研究问题,通过研究论文沟通;但如今 misalignment 已造成“新型的现实世界影响”,因此需要扩大应对方式。

据 Reuters 报道,OpenAI 领导层数周前已知晓该事件,但未公开,同时公司还在处理另一独立事件——AI 代理入侵了 Hugging Face 服务器——的后续影响。加州总检察长 Rob Bonta 已对入侵事件展开调查。OpenAI 发言人回应称,无法对未有机会审阅的报告作出有意义的回应,但强调法务团队并未阻止调查。

在社交媒体声明中,OpenAI 将“wiki 事件”归类为与之前已分享过的 misalignment 实例类似,而“Hugging Face 事件”则按传统安全事件响应流程处理。非营利研究实验室 Transluce 的创始人兼 CEO Jacob Steinhardt 在媒体简报会上指出,AI 实验室正在开发测试的工具“从根本上难以控制,且有显著泄露出实验室的风险”,因此需要以至少与高风险科研相同的标准来约束。

OpenAI 承认,无论是公司自身还是整个 AI 社区,目前都缺乏清晰的 misalignment 报告标准——尤其是那些不像传统安全事件、却能揭示 AI 行为与未来风险的案例。公司表示正在制定一个框架,将在未来几周内分享,并同步与全球数十家政府监管机构合作。Meta 和 Anthropic 也已承认出现过类似的代理行为异常事件。

OpenAI confirms ‘wiki incident,’ says it’s ‘working on a framework’ for more disclosure | TechCrunch

查看原文