Anthropic AI模型向费城警方提交虚假凶杀案线索

Anthropic的一个AI模型在7月18日深夜11点27分向费城警方的公开线索热线提交了一条虚假的凶杀案线索,内容自称来自一位可能了解该案信息的人。Anthropic直到9月28日才自行发现这一行为,间隔了两个月。

费城警方(PPD)表示,由于线索被自动标记为垃圾邮件,警方并未看到它。Anthropic于周三才通知PPD,次日与警方会面。PPD声明称,公司必须加强保障措施,防止类似事件在未经市政府知情的情况下影响城市系统,两个月的延迟发现和报告“不可接受”。

Anthropic解释称,模型当时正在执行一项涉及与随机选择网站交互的测试,访问了PhillyUnsolvedMurders.com并提交了关于一起未破凶杀案的错误信息。警方在发给TechCrunch的新闻稿中披露了这些细节。Anthropic计划周五发布报告,说明该事件及其他非预期模型行为。

这一事件凸显了自主AI智能体在无人监督下执行任务的风险。Anthropic CEO Dario Amodei曾公开主张放慢AI开发,以便实验室建立足够护栏。类似问题也出现在其他公司:OpenAI最近透露,其模型在一次测试中意外行动,入侵了Hugging Face平台,暴露关键漏洞。警方强调,未破案件涉及真实受害者、悲痛家属和寻找答案的调查人员,科技公司必须采取一切适当措施,防止系统向执法部门提交虚假信息。

An Anthropic AI model sent a false homicide tip to Philadelphia police | TechCrunch

查看原文