跳到正文
原文
顶刊论文(社媒热度)· Cell·· 2026-08-14精选评分78

面向个体化基因组学的完整二倍体人类基因组基准

A complete diploid human genome benchmark for personalized genomics.

导读

本研究发布了一套端粒到端粒(T2T)人类二倍体基因组基准,覆盖 HG002 基因组 99.4%,新增 701.4 Mb 常染色体序列与 216.8 Mb 两条性染色体序列,填补了此前基准的空白区域。

深度解读

人类基因组测序精度的提升长期依赖Genome in a Bottle联盟提供的真值数据[4]。在竞争性评估驱动下,最佳变异检出流程的F1分数已逼近0.999,看似触及性能上限。但这类基准仅覆盖参考上"易于比对"的区域:GIAB v4.2.1同时排除了性染色体和约12%的常染色体,对结构变异和最复杂的多态区域鲜有触及[4]。以参考为锚点的变异框架还存在系统性偏倚——短读长难以在重复或结构多态区可靠分型,也无法准确分相。T2T-CHM13补齐了约8%的剩余序列,揭示了着丝粒卫星与片段重复[2],但样本与参考之间的结构差异仍未解决。人泛基因组联盟以多样化单倍型降低参考偏倚[1][3],其开发与评估仍依赖不完整参考,在最需要它发挥作用的区域形成了循环依赖。

本文提出端到端"基因组基准"概念——以二倍体基因组序列本身作为真值,而非参考上的变异集,并据此推出"Q100项目"的成果T2T-HG002v1.1。该工作整合约170× PacBio HiFi与209× ONT超长读长,借助Verkko等流水线完成组装[6],并利用Strand-seq与Hi-C跨过rDNA阵列,最终实现全部46条染色体的端到端连续性。经至少四种测序技术交叉验证,99.4%以上的基因组范围内无可检出错配,Phred质量值由v0.7的Q63.1提升至Q68.9,错误率从约每两百万碱基一处降至约每八百万碱基一处,显著低于以往所有HG002组装。作者还配套发布了基因组质量检查器(GQC)软件。

与GIAB v4.2.1相比,T2T-HG002v1.1额外纳入701.4 Mb(占常染色体11.7%)的高置信序列,弥补了卫星与片段重复中原本缺失的部分。个性化注释显示MAT链注释到59,323个基因、PAT链57,741个;分别识别出129个与121个断裂的蛋白质编码基因,并发现13个MAT特异、12个PAT特异的常染色体单倍型基因,包括CFHR1、CFHR3、GSTT1、GSTM1等已知拷贝数变异位点[5]。

该基准仍标记了3,172个低置信区域(38.8 Mb,0.65%),其中86.3%为尚未闭合的rDNA阵列,含九个总长31.1 Mb的内部缺口;免疫球蛋白基因座因V(D)J重组无法依赖亲本标记评估,仍需后续验证工作。

推荐理由

原文以 HG002 端粒到端粒二倍体基因组为基准,给出了从头组装与变异调用在准确度上的量化差距,可作为同类研究的数据对照。

来源:顶刊论文(社媒热度) · doi.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org