Anthropic 启动 500 万美元资助计划,推动 AI 福祉评估研究

Anthropic 宣布启动一项 500 万美元的资助计划,用于资助独立研究,以评估 AI 对用户福祉的影响。该计划将为受资助者提供直接资金、模型访问权限和技术支持,帮助他们构建开源评估工具,帮助 AI 行业衡量模型对用户的影响。受资助者将完全独立工作,并以开源项目的形式发布成果。

AI 系统已成为许多人工作、学习和解决问题的核心工具,同时也成为对话伙伴,在困难时期提供情感支持。但整个行业仍在努力制定模型在这些对话中应如何表现的标准,例如当用户开始寻求模型的陪伴,或使用 AI 应对心理健康危机时。

福祉评估是一个特别困难的领域。对于大多数模型行为,可以通过查看单个答案来判断其准确性和适当性。但评估福祉需要更多上下文。例如,处于痛苦中的用户可能不会立即分享自残想法;对更谨慎回应的需求可能只有在长对话过程中才会变得清晰。一个在某种情境下合理的回应在另一种情境下可能有害。例如,Claude 可能会向询问减肥的用户提供均衡饮食和锻炼计划的建议,但如果用户有饮食失调史,这种回应可能不合适,甚至可能有害。

Anthropic 致力于开发保障措施来识别此类对话,并发布关于人们与 Claude 对话类型的研究,以更好地指导保障措施的开发、评估方式以及保护用户福祉的其他措施。但这些是细微的考量,风险重大。正确的方法需要随着模型及其用途的发展而演变。

通过资助独立的福祉评估和基准测试,Anthropic 希望邀请更多专家(包括临床医生、心理学家、方法论学家等)加入这个新兴且关键领域。

作为计划的一部分,Anthropic 分享了其 Safeguards 团队的指导,说明他们认为什么样的福祉评估足够严谨,以及可能限制评估实用性的常见挑战。他们寻求的评估应:明确说明衡量内容(即什么算通过或失败,以及为什么重要);让临床和主题专家参与设计和验证;同时测试预防措施和危害(即评估过度顺从和过度拒绝的风险);反映用户实际使用 AI 的方式(通常意味着构建代表多轮对话的场景,风险在长对话中升级且背景变化);对照真实主题专家验证评分者。

申请截止日期为 9 月 21 日;被选中提交完整提案的申请人将在 10 月 5 日前收到通知。

Funding better evaluations of AI’s impact on wellbeing

查看原文