Lila Sciences:实验室即验证器,训练科学超级智能

视频亮点

00:00

Andy Beam 认为互联网数据已耗竭,科学实验将成为新的数据来源

24:39

RL 训练中会出现奖励黑客和思维链崩溃等病理现象

44:12

Lila 在 6 个月内由 2-3 人设计出 CAR-T 候选,验证了模型能力

Lila Sciences 的 CTO Andy Beam 和联合创始人 Rafa Gómez-Bombarelli 在访谈中阐述了他们构建科学超级智能的核心逻辑:互联网数据已经枯竭(“we have but one internet, it’s the fossil fuel, we fracked”),下一个互联网规模的数据集来自科学方法本身——将实验过程作为强化学习的可验证奖励,湿实验室充当验证器。他们反驳了“领域专用模型更好”的共识,声称一个在 约10万亿实验验证的推理 token 上训练的通用模型,在生物学、化学和材料科学上反而赢了专用模型,因为“广度带来深度”。

Andy 强调,实验室不再是产品,模型才是产品——他们不是一家生物技术公司,而是一家 AI 公司。他反对“只靠考试就能获得科学超级智能”的观点,认为没有真实实验反馈的模型只是“好学生”。Rafa 则分享了“苦乐参半的教训”:只有可扩展的事情才重要,材料科学至今没有 AlphaFold 级别突破,就是因为缺乏可扩展的实验验证。他们展示了具体成果:一个 CAR-T 候选在 6 个月内由 2-3 人设计完成,以及“Monster UTRs”达到 Moderna/Pfizer mRNA 表达水平的 约 10 倍。他们还讨论了 RL 训练中的病理现象,如思维链崩溃和模型“说脏话”,以及将普通仪器(甚至 Windows 95 设备)接入自动化流程的工程挑战。

最值得持续关注的趋势是“零 FTE 创业”模式——Lila 的模型能够自主设计实验、分析结果,未来可能将初创公司的人力成本压缩到几乎为零。另外,“实验室即数据中心”的物理基础设施(仪器像 PCI 总线一样接入,人类在 API 层以下)若被验证可扩展,将彻底改变药物和材料研发的范式。但 Rafa 也警示:材料科学比生物学更难规模化,因为实验周期长、反馈慢,这可能是未来最大的瓶颈。

🔬 RL with Verifiable Rewards, but the Verifier is a Lab — Lila Sciences

查看原文