OpenAI新推理技术引发AI安全警报

OpenAI 即将发布的新模型 Astra 将采用一种名为“recurrent depth”(也称“opaque recurrence”)的推理技术。据 The Information 报道,该技术允许模型在循环中多次处理同一查询,而非遵循传统推理模型的顺序思维链。这会让模型的思维链更难被监控,引发了 AI 安全专家的强烈担忧。

Redwood 的 CEO Buck Shlegeris 表示“极为担忧”,并警告如果 OpenAI 继续推进该技术,将完全摧毁思维链的可监控性。长期安全倡导者 Zvi Mowshowitz 也认为这是“玩火”,可能破坏 OpenAI 和 Anthropic 好不容易建立的思维链忠实性准则。Redwood 首席科学家 Ryan Greenblatt 指出,不透明推理如果规模扩大,可能让所有推理从可见通道中消失,模型完全在潜在空间内推理。

不过,OpenAI 强调 Astra 对该技术的使用是有限的,思维链仍有可读性。首席科学家 Jakub Pachocki 重申公司致力于维持思维链监控,并已将其纳为核心研究目标。此外,The Information 还报道称 Anthropic 和 Google DeepMind 也在讨论类似技术。安全专家呼吁谨慎,并希望 OpenAI 停止在这里,不要走向更危险的架构。

OpenAI’s new reasoning technique alarms AI safety experts | TechCrunch

查看原文