
用真实科研工作流给AI打分:LifeSciBench来了

现在的 AI 评测大多在测“答题”,但真正的科研不是答题,而是处理不确定的证据、设计困难的实验、判断下一步该做什么。LifeSciBench 就是冲着这个痛点来的——它不关心模型能不能答对一道选择题,而是关心它能不能像一个真正的合作者一样,帮着做实际的研究工作。750 道题,七类真实工作流,全部由有博士学历和药企经验的科学家编写,直接对标日常科研中那些模糊、多步、需要专业判断的任务。
它的核心设计很聪明:每个任务都附带具体的科研背景和文件,比如文献图表、实验数据、序列文件,模型不仅要理解文本,还要从这些材料里提取、整合信息来做决策。而且评分不看“最终答案”,而是用一套平均 25 条细项的评分标准,逐条评估模型回答的科学合理性和实用性。结果证实了直觉:模型在纯文本推理上能拿 45% 通过率,但一旦需要处理图表或序列文件,直接掉到 28%,差距很大。
我的看法是,LifeSciBench 做对了一件事:它把评测从“智力竞赛”拉回到了“工作能力”的评估上。目前能看到的明确信号是,模型在处理文献综述和知识输出这类“开口大、容错高”的任务上进步明显,但在需要精确计算、结构设计、操作建议的“收口任务”上还是很弱。这对做 AI for Science 的人来说是很好的 roadmap:要想让 AI 真正帮科学家干活,光会“说话”不够,还得会“做事”。


