Biohub 扩大虚拟生物学计划,联合美国能源部、NIH、Google等投入约18亿美元建设AI生物学数据底座
“虚拟生物学计划”扩容,18亿美金投向AI生物学数据底座,美国能源部、Google、NIH等参与建设
Biohub 联合美国能源部、NIH、Google DeepMind、Isomorphic Labs 和 Meta 等机构,将合计约18亿美元资金、数据与算力投入虚拟生物学计划,为下一代AI虚拟细胞模型建设开放数据训练基础设施。
发生了什么
10月7日,由扎克伯格和普莉希拉·陈支持创立的Biohub宣布扩大虚拟生物学计划,联合美国能源部、NIH、Google DeepMind、Isomorphic Labs和Meta等机构,汇集总计约18亿美元的资金、数据、算力与实验测量资源,为预测细胞行为的AI虚拟细胞模型建设开放数据基础设施。其中Google DeepMind、Isomorphic Labs和Meta联合投入3亿美元,美国能源部计划未来五年投入超过5亿美元,Biohub此前已承诺投入5亿美元,NIH将整合此前超过5亿美元联邦科研投资形成的生物医学数据资源,艾伦研究所、博德研究所、人类细胞图谱计划、桑格研究所等参与,NVIDIA提供加速计算支持。目标是让模型学会预测细胞在药物、基因编辑或环境变化干预后的反应,从而减少部分重复实验、更快寻找疾病机制和潜在治疗方案。
为什么重要
生物学界虽已积累大量基因序列、蛋白质结构和细胞图谱,但多数数据只记录某一时刻的状态,缺少覆盖大量细胞类型、疾病状态和干预条件的标准化干预前后数据,所以现有模型回答不了关闭某个基因后癌细胞是否停止增殖、两种药联用是否产生不同效果这类问题。Biohub科学负责人Alex Rives提出,现有数据集仅覆盖数亿个细胞,训练可靠预测模型可能需要数十亿甚至数万亿级别,这次投入本质上是把数据生产本身当作瓶颈来打通,钱的去向是冷冻电子断层扫描、大规模显微成像和高通量干预测量这三类能记录细胞如何变化的技术。对研发和BD读者还有一个值得记住的安排:商业出资方可限期优先使用其资助生成的数据,之后向科研界开放,政府资助数据不带限制,这解释了科技公司为何愿意为公共数据底座掏钱。同期Anthropic已在旧金山湾区建生物湿实验室、OpenAI基金会启动超过1.25亿美元的数据集资助计划,说明AI公司正从使用科研界现成数据转向直接参与实验和数据生产。
还缺什么
最大的未解问题是生物学是否存在类似大语言模型的规模化规律,Rives自己也承认不知道需要增加多少数据才能让模型达到有实际研究价值的预测精度,而斯坦福的Anshul Kundaje认为这项工作九成靠实验设计、一成靠AI,Xaira Therapeutics的Bo Wang则追问该扩大的究竟是细胞数量、干预种类还是生物学条件,这些都还没有定量答案。可观察的节点是Biohub约一年内能否交付首批新的大规模数据集、未来五年细胞行为预测模型是否有实质进展,以及Rives所说把原本数十年量级的数据收集压缩到五年左右的推进是否兑现。商业出资方优先使用数据的具体期限、各机构分阶段投入节奏等细节材料未披露,待确认。
多家科技公司与联邦机构联合投入约18亿美元建设AI生物学数据基础设施,反映AI制药正从模型训练延伸至实验数据生产环节。
来源:中文产业新闻 · mittrchina.com