ESMFold2 蛋白结构预测架构与结果专家解读(Biohub)
ESMFold2:蛋白语言模型驱动的结构预测架构与结果(Biohub)
Biohub 研究负责人 Ziming Lin 在 57 分钟视频中解读 ESMFold2,以 ESM-C 6B 蛋白语言模型嵌入为特征的端到端蛋白结构预测模型无需 MSA 即可在蛋白-蛋白界面上媲美旧 MSA 模型。
Biohub 研究负责人 Ziming Lin 讲 ESMFold2——以 ESM-C 6B 蛋白语言模型嵌入为特征的端到端结构预测模型,重点在架构改动、三阶段训练,以及无 MSA / 单序列即可媲美旧 MSA 模型的结果。
- 蛋白语言模型动机:进化是对功能蛋白的"筛选",在功能序列上训练掩码语言模型会先"掉出"结构知识(注意力图可直接做接触预测,无需监督);ESM-C 扩到 6B 参数后结构理解随规模涌现。
- 架构关键改动(相对 AlphaFold):把 ESM-C 嵌入送入"成对折叠层"(L×L 边嵌入,AlphaFold 风格);用 PARSE 稳定循环更新(约束为对角矩阵、幅度递减,永不爆炸)替代部分循环;丢掉 triangle attention,发现 triangle multiplication 已足够、更快;在 atom transformer 加滑窗注意力 + 3D RoPE(相对位置编码)提速;对各条链独立编码以规避同源二聚体的"复制电路"、得到好的界面表征。
- 训练三阶段:预训练 5 万步(crop 384、扩散 batch 48)+ 长上下文扩展(640 残基、5 千步)+ 仅微调扩散模块 1 万步(更大 crop 修 bond / molprobity);数据用 PDB + 800 万条高置信 AlphaFold DB 蒸馏。
- 结果:无需 MSA 即在蛋白–蛋白界面(FoldBench 278 界面)媲美旧 MSA 模型;抗体–抗原(172 界面,共进化信息不那么关键)单序列即胜过多数开源 / 闭源模型,给 MSA 后更佳。
- 推理时标度:蛋白–蛋白约 8–16 个 recurrence loop 即饱和;抗体–抗原越多 loop 越好(柔性区);扩散步数低于 8 不收敛、20–30 步即可高效;多次采样按 interface pTM 排序可提升。
- 定位:AI4Science(蛋白结构基础模型);与 #11(Steinegger 蛋白宇宙)、#14(cryo-EM 逆向问题)、#15(AlphaGenome)等构成结构 / 序列 AI 主题簇。
结构预测曾长期依赖同源检测与模板建模这类策略 [3],AlphaFold2 把单链预测推到即便无同源结构也常能达到原子精度的水平 [1],但它与同类系统仍要靠多序列比对(MSA)中的共进化信号驱动 [2]。由此留下两个卡点:一是孤儿蛋白、快速进化蛋白和设计蛋白难以构建 MSA,早期单序列尝试 RGN2(AminoBERT)虽在这类蛋白上占优且算力大减,整体覆盖仍有限 [2];二是复合物一侧,AF2 配上优化 MSA 也只在 63% 的二聚体上达到可接受界面质量(DockQ ≥ 0.23)[4],DeepMSA2 更表明输入 MSA 的构建质量与预测器设计本身同等重要 [6]。与此同时,蛋白语言模型已能同时建模序列与结构两种模态 [5],为绕开 MSA 提示了另一条路。
Biohub 的 Ziming Lin 在报告中介绍的 ESMFold2,正是沿这条路走到的新一站:一个以 ESM-C 6B 嵌入为特征的端到端结构预测模型。其出发点是进化筛选了功能序列,在功能序列上训练掩码语言模型会先“掉出”结构知识——注意力图无需监督即可做接触预测,且 ESM-C 扩到 6B 后结构理解随规模涌现。架构上,ESM-C 嵌入被送入 AlphaFold 风格的成对折叠层(L×L 边嵌入);用约束为对角矩阵、幅度递减、永不爆炸的 PARSE 稳定循环更新替代部分循环;去掉 triangle attention,因为 triangle multiplication 已足够且更快;atom transformer 用滑窗注意力加 3D RoPE 提速;各链独立编码以规避同源二聚体的“复制电路”、获得好的界面表征。训练分三阶段:预训练 5 万步(crop 384)、640 残基长上下文扩展 5 千步、再仅微调扩散模块 1 万步以修 bond/molprobity;数据为 PDB 加 800 万条高置信 AlphaFold DB 蒸馏。结果上,无 MSA 即在 FoldBench 的 278 个蛋白–蛋白界面上媲美旧 MSA 模型;在 172 个抗体–抗原界面上,单序列便胜过多数开源与闭源模型,给 MSA 后更佳。推理时标度方面,蛋白–蛋白约 8–16 个 recurrence loop 即饱和,抗体–抗原因柔性区越多越好;扩散步数低于 8 不收敛、20–30 步即可高效,多次采样按 interface pTM 排序还能再提升。
把几条线索放在一起看,这一进展的意义在于把“输入信息工程”从外部 MSA 管线 [6] 内化为语言模型表征:RGN2 当年论证过 pLM 相对 MSA 的潜力 [2],而这里显示,6B 规模的嵌入加上架构改造,单序列方法在蛋白–蛋白界面这类此前强依赖共进化信号的任务 [4] 上也能达到可比水平。问题由此从“能否绕开 MSA”推进到“哪些任务上、以何种代价绕开”。
边界同样清楚:抗体–抗原给 MSA 仍更佳,说明嵌入尚未完全取代共进化信息;扩散少于 8 步不收敛、柔性区需要更多循环,构象柔性与推理成本的权衡仍在;且以上数字目前以报告形式呈现,在上述基准之外能否泛化,还有待检验。
- 1.Highly accurate protein structure prediction with AlphaFold · Nature 2021
- 2.Single-sequence protein structure prediction using a language model and deep learning · Nat Biotechnol 2022
- 3.The HHpred interactive server for protein homology detection and structure prediction · Nucleic Acids Res 2005
- 4.Improved prediction of protein-protein interactions using AlphaFold2 · Nat Commun 2022
- 5.Bilingual language model for protein sequence and structure · NAR Genom Bioinform 2024
- 6.Improving deep learning protein monomer and complex structure prediction using DeepMSA2 with huge metagenomics data · Nat Methods 2024
读者可以借此了解用蛋白语言模型嵌入替代 MSA 做结构预测的架构改动,以及无 MSA 方案在蛋白-蛋白界面与抗体-抗原上的实际表现。
来源:专家解读(YouTube) · youtube.com