X-Cell模型:因果建模需要因果数据

视频亮点

00:09:46

生物学建模落后于蛋白质设计,核心是数据限制而非模型。

00:43:11

扩散语言模型可以看作编辑过程,迭代地从粗到细生成。

00:57:29

X-Cell泛化受数据多样性瓶颈,而非计算量。

Xaira Therapeutics的首席AI科学家Bo Wang和首席发现官Ci Chu在Latent Space播客中介绍了他们最新的虚拟细胞模型X-Cell。这个49亿参数的扩散语言模型能预测细胞对从未见过的遗传扰动的响应,核心挑战在于数据——需要大规模的因果数据集而非观测数据。他们耗时多年构建了PISCES(X-Atlas),这是迄今最大的全基因组CRISPRi Perturb-seq数据集,覆盖2560万个单细胞和16种生物学背景。

[Bo Wang]解释了为什么观测性的细胞图谱能描述生物学但无法预测干预结果:自回归模型(如GPT)在基因表达数据上表现不佳,因为基因表达本质上是单向的?他们转而采用扩散语言模型,将其视为一种“编辑”过程——从模糊的起始状态逐步细化。反对之前流行的自回归方法,认为扩散更适合捕捉基因调控网络的复杂性。[Ci Chu]强调了数据多样性的瓶颈:X-Cell的损失函数像LLM一样随参数缩放,但泛化能力受限于训练数据的生物多样性而非计算量,这是反直觉的发现。模型在永生化细胞系上训练后,竟能预测真实供体原代T细胞对扰动的反应,超越线性基线。

这个工作预示了AI for biology领域的关键转折:下一步的瓶颈不再是模型架构或算力,而是高质量因果数据的生成X-Cell证明了大规模干预实验(如Perturb-seq)的价值,但当前技术只能测量终点状态,无法追踪活细胞的动态变化。未来如果实现活细胞时间序列测序,虚拟细胞模型将迎来质的飞跃。学术界应专注于构建多样化的因果数据集和验证实验,而非在模型竞赛中消耗资源。

Causal Models Need Causal Data - Xaira’s X-Cell model (Bo Wang & Ci Chu)

查看原文