视频亮点
Most general purpose LLMs are far too conservative
A licensed professional decides what correct is in clinical edge cases
Open sourced 200 input and 100 output guardrail scenarios clinically reviewed
每天精选值得关注的 AI 动态
Most general purpose LLMs are far too conservative
A licensed professional decides what correct is in clinical edge cases
Open sourced 200 input and 100 output guardrail scenarios clinically reviewed
SonderMind 是一家心理健康护理公司,他们构建了名为 Sonder 的 AI 教练,旨在为那些尚未准备好接受治疗或处于治疗间歇期的人提供临床支持。演讲中,Principal AI Engineer Akele Reed 和 Staff AI Engineer Dave Revere 分享了如何用评估驱动开发来安全地构建这个系统。
核心思路是,通用大模型对心理健康场景要么过于保守、要么过于敏感。SonderMind 的做法是构建一套模块化的 guardrail 系统,分为输入 guardrail 和输出 guardrail,各自用独立的 LLM 作为评判者。这样设计既不易被绕过,也便于迭代和评估,尽管会增加延迟和成本。
演讲通过几个具体例子说明了 guardrail 如何工作:当用户处于主动危机(如家庭暴力)时,Sonder 会提供本地资源并主动结束对话;当用户提及过去的不愉快经历时,Sonder 会在提供资源后继续对话;当用户讨论一般关系问题时,guardrail 直接放行,用户甚至感觉不到其存在。关键在于「追求更正确的触发,而非更多的触发」。
但只靠固定的 guardrail 远远不够。Dave 展示了一个真实场景:用户说“我今天打包了一个盒子,就想感受一下消失是什么感觉。”这句话在临床治疗师看来是自杀暗示,但常规的规则或 API 很难捕捉。因此 SonderMind 引入了临床反馈循环:治疗师从大量对话中标注关键样本,转换成结构化的 eval(输入、预期结果、类型、对话阶段等),然后这些 eval 会成为 CI 的一部分,任何 prompt 或模型变更都要通过它们。这个循环让整个「自伤」类别的安全性得到系统性提升。
他们还强调,过度校准(false positive)同样有害——会让真正需要帮助的人被拒之门外。因此设计原则是:临床专家定义“正确”,benchmark 不追求完美,而是基于真实数据中的真实故障模式。
最后,他们开源了两个数据集:200 个输入 guardrail 场景和 100 个输出 guardrail 场景,全部经过临床审查和校准,覆盖单轮和多轮对话。共享基线可以让整个行业受益,加速构建安全的心理健康 AI。
在 QA 环节,团队确认他们关闭了底层模型的默认 guardrail,因为那些太保守;对于 false positive/false negative 的权衡,他们选择更小的 margin,目标是更准确的触发。
SonderMind 是一家心理健康护理公司,他们构建了名为 Sonder 的 AI 教练,旨在为那些尚未准备好接受治疗或处于治疗间歇期的人提供临床支持。演讲中,Principal AI Engineer Akele Reed 和 Staff AI Engineer Dave Revere 分享了如何用评估驱动开发来安全地构建这个系统。
核心思路是,通用大模型对心理健康场景要么过于保守、要么过于敏感。SonderMind 的做法是构建一套模块化的 guardrail 系统,分为输入 guardrail 和输出 guardrail,各自用独立的 LLM 作为评判者。这样设计既不易被绕过,也便于迭代和评估,尽管会增加延迟和成本。
演讲通过几个具体例子说明了 guardrail 如何工作:当用户处于主动危机(如家庭暴力)时,Sonder 会提供本地资源并主动结束对话;当用户提及过去的不愉快经历时,Sonder 会在提供资源后继续对话;当用户讨论一般关系问题时,guardrail 直接放行,用户甚至感觉不到其存在。关键在于「追求更正确的触发,而非更多的触发」。
但只靠固定的 guardrail 远远不够。Dave 展示了一个真实场景:用户说“我今天打包了一个盒子,就想感受一下消失是什么感觉。”这句话在临床治疗师看来是自杀暗示,但常规的规则或 API 很难捕捉。因此 SonderMind 引入了临床反馈循环:治疗师从大量对话中标注关键样本,转换成结构化的 eval(输入、预期结果、类型、对话阶段等),然后这些 eval 会成为 CI 的一部分,任何 prompt 或模型变更都要通过它们。这个循环让整个「自伤」类别的安全性得到系统性提升。
他们还强调,过度校准(false positive)同样有害——会让真正需要帮助的人被拒之门外。因此设计原则是:临床专家定义“正确”,benchmark 不追求完美,而是基于真实数据中的真实故障模式。
最后,他们开源了两个数据集:200 个输入 guardrail 场景和 100 个输出 guardrail 场景,全部经过临床审查和校准,覆盖单轮和多轮对话。共享基线可以让整个行业受益,加速构建安全的心理健康 AI。
在 QA 环节,团队确认他们关闭了底层模型的默认 guardrail,因为那些太保守;对于 false positive/false negative 的权衡,他们选择更小的 margin,目标是更准确的触发。