Cerberus:双向状态空间块提升调控序列模型的精度与效率
Cerberus: bidirectional state space blocks improve accuracy and efficiency of regulatory sequence models
Calico 等提出 Cerberus 模型,将 Borzoi 的自注意力层替换为双向状态空间块 Hydra,在 8192-token 输入上速度提升约 5.7 倍。
从DNA序列直接预测调控功能,一直是基因调控研究的长期难题。深度学习虽有潜力,但前提是要有把调控元件与定量功能联系起来的大规模数据集,而这类数据的获取并不容易,如何在有限数据下学到准确的序列—功能映射始终是核心挑战 [3]。近年出现的一批"序列到功能"模型(如 Borzoi)仅凭序列即可预测调控活性与变异效应,已被整合进基因组注释框架,把可处理的序列上下文扩展到 500 kb [1];transformer 编码器等注意力结构也广泛用于转录因子结合位点等调控预测任务 [2]。不过这类模型靠自注意力刻画长程相互作用,而参考基因组从根本上限定了可用训练序列的上限,新的检测手段带来的是更多标签而非更多序列,这就把压力转移到了架构本身:如何在有限的序列多样性里学到更多。
这篇论文正是在这一点上做文章。作者在固定其余架构和训练数据的前提下,把 Borzoi 的 transformer 模块替换为基于 Mamba-2 的双向状态空间模块 Hydra。结果显示,Hydra 模块在 8,192 个 token 输入上快 5.7 倍,且在保留序列上预测分箱覆盖度更准,对精细定位 eQTL 的分类也更准确。得益于状态空间模型随序列长度线性增长的代价,作者得以在 32 bp 分辨率下运行模块并去掉 U-net 解码器,得到一个更小也更准确的卷积—SSM 模型,再经扩增的轨道数据放大为 Cerberus——一个由 8 个模型组成、覆盖 786 kb 输入的集成。在 GTEx v11 精细定位的 eQTL、sQTL 和 paQTL 基准上(阴性对照按等位基因频率、基因表达和表型特异性位置注释匹配以减少混杂),Cerberus 在三种表型上均优于 Borzoi:48 个组织的平均 eQTL AUPRC 为 0.692 对 0.668,eQTL 效应量估计的 Spearman ρ 为 0.379 对 0.321。与 AlphaGenome 相比则互有胜负:在距转录起始位点 3–100 kb 的变异上领先,在编码区和 3 kb 以内落后。
相对已有认识,这项工作说明在序列供给受限的现实下,架构选择本身可以是重要的增益来源:把长程建模从二次代价的自注意力换成线性代价的双向状态空间块,同时带来了速度、精度和分辨率上的提升。可解释性分析也提供了新视角——训练后的模块中相互作用范围随深度递增,第一块的中位半衰期约 0.9 kb,到第七块达 79 kb,最深层的选择头锚定在启动子、增强子和 CTCF 峰上,给出了模型内部"长程"如何逐步形成的直接证据。作者还公开了模型、训练数据、训练与评估代码及基准集,便于变异打分和迁移学习。
当然,问题并未就此解决。与 AlphaGenome 相比,Cerberus 在编码区和转录起始位点近端的变异上仍处下风,提示其短板集中在这些区域;而状态空间架构在其他调控任务和物种上的泛化能力,也有待进一步检验。
(利益相关:论文作者声明 DK、HY、XH 为 Calico Life Sciences LLC 员工,JL 为该公司顾问。)
- 1.Annotating the genome at single-nucleotide resolution with DNA foundation models · Nat Methods 2025
- 2.DeepSTF: predicting transcription factor binding sites by interpretable deep neural networks combining sequence and shape · Brief Bioinform 2023
- 3.Large-scale DNA-based phenotypic recording and deep learning enable highly accurate sequence-function mapping · Nat Commun 2020
来源:bioRxiv Genomics · biorxiv.org