因果模型需要因果数据:Xaira 的 X-Cell 药物发现模型

因果模型需要因果数据:Xaira 的 X-Cell 药物发现模型 图片 1
因果模型需要因果数据:Xaira 的 X-Cell 药物发现模型 图片 2

押注信息

如果在训练过程中,当参数数量达到15亿时,测试损失却停滞不前,而训练损失却随着规模的扩大持续下降,这说明你的模型受限于数据中所蕴含的信息量。

在仅使用一个相对较小的数据集上进行训练,导致了信息缺口:31亿参数的模型在规模扩展的过程中逐渐偏离了原有的增长趋势。 无论是参数数量还是计算资源,都无法在这一瓶颈之上进一步提升性能。 若要预测基因表达的变化,你必须利用更多富含信息的数据。

这就是Chu和Bo的团队所做的事情;而这里则是“信息量提升30倍”所带来的收获:

如今,我们已经能够借助更多的参数和更强大的训练算力实现规模化! 我们尚不清楚这项投入究竟耗费了多少成本,但可以推测,数据采集实验和基础设施的投入大约为数千万美元, 而算力、人员配置以及科研投入则约为数百万美元。 从预算结构来看,这更像是一个RL(强化学习)部署的预算,而非以数据丰富为前提的预训练预算。

我们很幸运地在播客中邀请到了这个故事中的两位核心人物。 在Ci Chu和Bo Wang的带领下,Xaira Therapeutics坚信:信息丰富的数据是推动AI驱动药物研发的关键所在。 Chu被任命为首席发现官,Bo则担任首席AI科学家——最近晋升和1, 这充分凸显了Xaira对这一战略决策的高度重视。

逆向工程人类细胞

如果你必须弄清人类细胞是如何运作的,你会怎么做?一个不错的起点,就是记录不同细胞类型在不同环境下的基因表达情况(例如,哪些RNA在细胞中游离存在)。

这就是细胞×基因——由Chan Zuckerberg Institute打造的1.68亿个细胞数据库。 该数据库将每个细胞的基因表达情况与其所包含的2万至3万个基因的检测次数一一对应, 并附带了关于每种细胞的详细元数据。整个数据库拥有约4万亿条记录。

如果说蛋白质数据库(PDB)曾解锁了结构生物学模型(博尔茨事件、ESM/BioHub 事件),那么CELLxGENE则为虚拟细胞模型完成了同样的工作。 与PDB类似,CELLxGENE也催生出了一大批基于AI的RNA表达模型……

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论