Zatom-2:基于原子级数据多任务预训练的跨领域生成模型
Zatom-2: Multitask Pretraining on Atomistic Data for Generative Modeling across Domains
Zatom-2 是一个原子级生成模型,基于 OMol25 和 OMat24 电子结构数据集约 500 万个结构预训练,采用多尺度 Transformer 架构结合条件流匹配,支持力条件化以及生成、结构预测、能量与力预测等任务。
原子尺度建模长期受制于显式电子结构方法高昂的计算成本,可靠的能量与力场获取一直是大规模模拟的瓶颈 [1,2]。机器学习通过拟合电子结构数据构造原子间势,以快若干数量级的速度逼近可比精度,从早期分子能量预测中“必须刻画多体相互作用才能达到化学精度”的认识 [5],到可复现量子化学精度全局力场的方案 [3]、覆盖元素周期表的通用材料势 [4]、无需重新拟合的通用反应性势 [6],再到对等变架构设计空间的系统梳理 [7],这条以“预测”为中心的路线已相当成熟。而“生成”路线则各行其道:蛋白质骨架已能由扩散模型从随机未折叠状态去噪生成 [8],但现有原子尺度生成方法要么专属于化学或生物某一学科,要么未能同时利用海量有机分子与无机材料数据做通用预训练,数据丰富的化学与数据稀缺的生物之间缺少统一的桥梁。
Zatom-2 正是在这一断点上发力:它在 OMol25 与 OMat24 两个电子结构数据集约五百万个结构上预训练一个原子尺度生成模型,采用多尺度 Transformer 架构配合支持力条件化的条件流匹配,预训练任务同时涵盖生成、结构预测以及分子与材料的能量和力预测。实验上,它的分子分布保真度较 Zatom-1 更优,在分子与材料生成基准上表现强劲,并能在低力与高力区间对样本生成进行调控。最引人注目的是低数据场景下的蛋白质迁移:在长度外推设置中,蛋白质骨架可设计性从无预训练的 67.8% 提升到在 2,000 个蛋白结构域上微调后的 74.8%。
相对已有认识,这项工作的推进在于把两条原本分行的线索拧在了一起:以往机器学习势专注于能量与力的预测以支撑模拟 [1,2,4],生成模型则另立门户 [8];Zatom-2 通过生成与预测联合的多任务预训练,让同一模型既能产出分子与材料结构,又展示了化学侧大数据向数据稀缺的蛋白质设计迁移的直接证据。力条件化带来的跨力区间生成控制,也把模型输出与物理状态的联系变成了可操作的旋钮。
需要提醒的是,这仍是未经同行评议的 arXiv 预印本;其生物学侧的验证目前限于蛋白质骨架生成这一种任务和特定的长度外推设置,更多生物场景下的迁移效果与模型能力的边界,都有待进一步检验。
- 1.Machine Learning Interatomic Potentials as Emerging Tools for Materials Science · Adv Mater 2019
- 2.Perspective: Machine learning potentials for atomistic simulations · J Chem Phys 2016
- 3.Towards exact molecular dynamics simulations with machine-learned force fields · Nat Commun 2018
- 4.A universal graph deep learning interatomic potential for the periodic table · Nat Comput Sci 2022
- 5.Machine Learning Predictions of Molecular Properties: Accurate Many-Body Potentials and Nonlocality in Chemical Space · J Phys Chem Lett 2015
- 6.Exploring the frontiers of condensed-phase chemistry with a general reactive machine learning potential · Nat Chem 2024
- 7.The design space of E(3)-equivariant atom-centred interatomic potentials · Nat Mach Intell 2025
- 8.Protein structure generation via folding diffusion · Nat Commun 2024
来源:AI × 生物医药 · arxiv.org