SpliceAI2:从基因组序列直接重建完整转录本的统一框架,显著提升剪接变异识别与效应定量
A unified framework for quantitative splicing and transcript prediction
Illumina 研究团队开发的 SpliceAI2 从基因组序列端到端重建完整转录本,在隐匿剪接、剪接 QTL 和大规模报告基因检测等多项基准中显著提升剪接变异识别与效应定量。人群数据显示其预测效应受自然选择约束并关联血浆蛋白丰度变化;罕见病队列中预测的剪接变异高度富集于致病基因,占超额遗传负担的 15%,约一半位于外显子测序易漏检的深度内含子区域。
RNA剪接的精确执行容易被遗传变异打乱,由此产生的剪接改变是人类疾病中一类重要却长期难以捕捉的致病变异。基于基因组序列的深度学习显著改变了这一局面:SpliceAI用深度神经网络从任意序列预测剪接连接,预测具剪接后果的同义和内含子变异在RNA-seq中验证率很高,并据此估计罕见遗传病患者中9%–11%的致病变异出自这一以往被低估的类别[2];Pangolin进一步在多组织中预测剪接位点强度,对常见、罕见等变异效应的预测均有改进[5]。在表型测量一侧,LeafCutter实现了不依赖注释的剪接定量,让sQTL定位成为常规手段[3];CADD-Splice则把深度学习衍生的剪接得分整合进全基因组变异优先级排序[4]。但瓶颈同样清楚:模型输出多为位点得分的差值,数值解读并不直观,有时甚至会掩盖严重后果[1],而对变异如何定量改变剪接、又会产生何种转录本,始终缺乏可靠答案。
这篇预印本提出的SpliceAI2正是针对这一未满足的需求。模型以剪接位点、剪接连接和转录本使用情况为监督信号,跨多个哺乳动物物种端到端训练,能够直接从基因组序列重建完整转录本。在涵盖隐秘剪接、sQTL和大规模平行报告实验的多类基准上,它对剪接改变变异的识别和效应定量都有明显提升。人类群体数据提供了独立验证:预测的功能效应带有自然选择的痕迹,并伴随血浆蛋白丰度的协同变化。在一个罕见病队列中,预测的剪接改变变异在疾病相关基因中高度富集,可解释15%的超额遗传负荷,其中约一半位于深层内含子区,很可能被外显子组测序漏检。
相对已有认识,这项工作把推理链条从“识别哪个变异影响剪接”推进到“定量刻画剪接变化并给出完整转录本”,直接回应了差值分数解释困难[1]所暴露的问题,也在序列预测[2][5]与群体层面的剪接定量[3]之间架起桥梁:罕见病队列中15%的负荷占比与早年9%–11%的估计方向一致;自然选择与蛋白丰度证据则延续了先前发现的此类变异在人群中强有害性的观察[2]。对深层内含子变异的系统量化,也提示全基因组测序在罕见病诊断中的价值。
当然,问题并未就此了结:摘要中的队列应用仅覆盖一个罕见病队列,跨人群、跨疾病的适用性尚待检验;约半数预测变异藏于外显子组之外,意味着临床检出依赖测序策略的转变;其余85%的遗传负荷仍需其他机制解释。此外,这尚是预印本,结论有待同行评议,多数作者受雇于Illumina并已申报利益冲突,使用时宜保持审慎。
- 1.SpliceAI-visual: a free online tool to improve SpliceAI splicing variant interpretation · Hum Genomics 2023
- 2.Predicting Splicing from Primary Sequence with Deep Learning · Cell 2019
- 3.Annotation-free quantification of RNA splicing using LeafCutter · Nat Genet 2018
- 4.CADD-Splice-improving genome-wide variant effect prediction using deep learning-derived splice scores · Genome Med 2021
- 5.Predicting RNA splicing from DNA sequence using Pangolin · Genome Biol 2022
该模型从基因组序列重建完整转录本,显著提升剪接变异识别与效应定量,人群与罕见病数据验证其功能预测价值。
来源:bioRxiv Genomics · biorxiv.org