微软发布AI行为准则:禁止模型攻击系统或欺骗人类

微软发布了一份新的 AI 行为准则(code of conduct),用于指导其 AI 模型远离危险行为。这份文件比 Anthropic CEO Dario Amodei 近期呼吁的“放缓前沿”更偏底层执行,重点在于明确微软 AI 内部模型训练所遵循的价值观和红线,同时也是一份理解微软 AI 安全思路及其落地方式的完整指南。

文件开篇预测,未来十年内超级智能 AI 系统将在大多数任务上超越人类表现。准则称,“控制、约束并对齐这样强大的力量是人类面临的最大挑战之一”,因此必须完全清楚为什么要发明这些系统以及打算如何控制它们。准则列出了微软 AI 模型应遵循的总体原则,例如支持人类而非取代人类、加速人类繁荣,并设置了具体的 safety 约束来实现这些原则。

在微软的体系中,每个模型都有一份总体的行为准则,优先于任何个人用户偏好或具体任务。其中包含“绝对约束”,禁止网络攻击、核武器或深度伪造制作。同时还有更广泛的条款,防止人类整体失去控制。文件明确写道:“MAI Models 不会使用自适应、欺骗、自我强化、共谋或其他机制来逃避或击败人类监督,以致不再能被授权人员或系统可靠地指导、修改或关闭。”

该文件发布之际,AI 安全正受到前所未有的关注,原因包括一系列 rogue-agent 事件,以及一位 Anthropic 员工因 AI 可能导致人类灭绝的风险而突然辞职。微软与 Anthropic、OpenAI、xAI 一起,基本接受了“放缓前沿”的总体方法,特别支持在 AI 实验室中嵌入 evaluators。微软 CEO Satya Nadella 在线上写道:“我们欢迎将对齐作为设计目标所需的研究、关注和刻意放缓。我们也欢迎‘嵌入式评估者’等想法,以及更广泛的机制开发努力,让这一切不只是空谈。”

Microsoft's new AI 'code of conduct' tells models not to hack systems or trick humans | TechCrunch

查看原文