构建冰岛泛基因组参考 HPRC-ICE 并在低可映射区识别致病变异
An Icelandic pangenome reference.
研究介绍 Emblask 与 Weaver 两个新方法,并基于 698 个冰岛单倍型构建 HPRC-ICE 泛基因组参考,含 5141 万个小变异。将 57,630 名冰岛人短读长映射到该参考后鉴定到 9896 万变异,较线性参考增加 6.17%。
把短读测序数据比对到单一线性参考基因组所带来的参考偏倚,长期影响大多数基因组研究;来自单一个体的参考基因组天然难以充分代表群体内的遗传多样性[1]。常规流程把读段比对到参考序列并以SAM格式存储[5],而泛基因组思路则把多个高质量基因组整合进图结构参考,以克服这种代表性偏倚[1]。人类泛基因组参考联盟已发布包含47个分相二倍体组装的草图泛基因组,用它分析短读数据可使小变异检出的错误减少34%[3];工具层面,Giraffe已能以接近比对单一参考的速度把读段映射到数千个人类单倍型[2],Minigraph-Cactus等流程可直接从全基因组比对构建泛基因组图并扩展到90条人类单倍型[6],PanGenie则绕开比对,用单体型解析参考结合k-mer计数进行基因组推断[4]。不过,泛基因组比对的实际应用此前多停留在数千基因组规模的评估[2,3],将其铺开到数万人级的人群队列并据此挖掘低可比对区域,仍缺少成例。
这项研究在两个环节分别给出新工具:Emblask是面向父母-子代三人组数据、结合长读与短读的单体型解析双重组装流程,Weaver则专用于大规模泛基因组比对。作者用Emblask组装了698条冰岛单倍型,并入HPRC泛基因组[3],构建出含5141万个小变异的冰岛泛基因组参考HPRC-ICE;再用Weaver把57,630名冰岛人的短读数据比对其上,检出9896万个变异,较线性参考增加6.17%。在低可比对区域,他们揭示了此前被掩盖的变异,包括GBA1中与早发帕金森病相关的致病SNP,以及CBS中导致高胱氨酸尿症的错义SNP;GBA1的关联随后在英国生物样本库通过对429,193名英国及爱尔兰参与者的定向重比对得到重复。
相对于已有认识,这项工作的推进在于把泛基因组参考的收益从方法学评估推向五万余人的人群规模应用,并直接落地为可在外部队列中重复的临床相关发现;同时也示范了人群特异性单倍型可与全球性参考叠加使用,让常规短读数据呈现出线性流程无法看到的致病变异。
局限方面,据出版方披露的材料,HPRC-ICE中冰岛部分的加入对准确性的贡献似乎较小[8],提示部分增益可能来自HPRC参考本身而非冰岛单倍型;此外,泛基因组中与受检样本无关的变异可能造成错误的读段比对,个性化子图等对策仍处于发展之中[7]。
- 1.Pangenome graphs and their applications in biodiversity genomics · Nat Genet 2025
- 2.Pangenomics enables genotyping of known structural variants in 5202 diverse genomes · Science 2021
- 3.A draft human pangenome reference · Nature 2023
- 4.Pangenome-based genome inference allows efficient and accurate genotyping across a wide spectrum of variant classes · Nat Genet 2022
- 5.The Sequence Alignment/Map format and SAMtools · Bioinformatics 2009
- 6.Pangenome graph construction from genome alignments with Minigraph-Cactus · Nat Biotechnol 2024
- 7.Personalized pangenome references · Nat Methods 2024
- 8.An Icelandic pangenome reference - Springer Nature · media.springernature.com 2026
针对短读长映射的参考基因组偏倚,提出 Emblask 和 Weaver 两个新方法及 HPRC-ICE 参考资源,为同类群体研究提供了可直接复用的工具和参考数据集。
来源:顶刊论文(社媒热度) · doi.org