ChatGPT健康智能提升:GPT-5.5 Instant表现接近前沿推理模型

每周超过2.3亿人通过ChatGPT寻求健康与医疗信息,包括理解化验结果、就诊准备、保险咨询等。OpenAI最新发布显示,GPT-5.5 Instant在健康领域取得实质性进步,在一系列最严格的健康评估中表现已接近其前沿Thinking模型,且对免费用户开放。

进步的核心来自两方面:模型能力本身提升,以及由医师主导的评估体系。OpenAI建立的HealthBench与HealthBench Professional评估套件,基于真实健康对话和医生编写的评分标准,考察准确性、安全性、沟通质量、情境感知等维度。在更直接的对比中,让医生撰写回答(不限时间、可查互联网)并与模型回答进行盲评,覆盖3500份回答。结果GPT-5.5 Instant在准确性、沟通、完整性、指令遵循和决策帮助性上均超过医生写的老版本模型回答。

生产环境的数据进一步佐证了改进。基于每周数十亿条消息的隐私保护监测,健康类回答中被标记至少一项事实性问题比例在两个月内下降了71%。具体来说,GPT-5.5 Instant更少出现以下问题:未适应当地医疗背景、遗漏警示信号或就医建议、未能主动追问必要上下文——这些问题在老模型和医生回答中都更为常见。

这些进步的医学背景支撑来自一个全球医师网络。OpenAI与来自60个国家、49种语言、26个专科的260多位医生合作,共同定义什么是“好的”健康回答。医生们已经评审了超过70万条示例模型回复,平均每几分钟就有新评审。他们的反馈被转化为评分标准和评估指标,帮助研究人员追踪模型短板并定向改进。

OpenAI表示,改善人类健康是AGI最直接、最有形的应用之一。目前这些工作已延伸至面向医护人员的专用工具(如ChatGPT for Clinicians和OpenAI for Healthcare),支持临床文档、医学研究和诊疗辅助。模型仍在持续改进中,目标是让ChatGPT在健康这个高频场景中更准确、更有用,并让更多用户受益。

Improving health intelligence in ChatGPT

查看原文