跳到正文
原文
bioRxiv Genomics· Götsch, H., Baumdicker, F. ·· 1 天前评分49

隐匿但持续扩大的采样偏倚扭曲原核生物基因组数据集

Hidden but Expanding Sampling Bias Distorts Prokaryotic Genome Collections

导读

研究人员开发了 PhyloThin 方法,基于系统发育关系检测并降低原核生物基因组采样偏倚,在 NCBI 402 个物种中测得有效样本量比实际低 41%。该方法揭示各物种过采样程度差异显著,表明基因组数量不足以衡量物种表征充分性。校正偏倚后可见更多待鉴定基因和更高基因组多样性,对病原体监测和新基因功能发现具有积极意义。

深度解读

公共原核基因组数据库是理解细菌多样性以及抗生素抗性等性状分布的基石,但它汇聚了采样取向各异的研究,常常过度收录人们特别关注的近缘菌株。这种偏差由来已久:早在2002年就有综述指出,基于纯培养和测序的研究明显偏向变形菌门、厚壁菌门、放线菌门和拟杆菌门,而当时已记载的门级谱系共有35个细菌门和18个古菌门[1];近年研究进一步表明,地理位置与生活方式的宏基因组采样偏差是肠道参考基因组目录不完整的部分原因,补充印度、日本和韩国数据并组装出29082个基因组后,目录得以扩充至232098个非冗余基因组[2]。

在分析层面,偏差的干扰同样清楚:泛基因组的基因累积曲线可能只是反映采样的时间结构而非水平基因转移的真实动态,Panstripe等方法因此把对群体结构和采样偏差稳健作为设计目标[3];而泛基因组大小的估计本身也取决于进化树形状,在星形树上随基因组数线性增长,在溯祖树上则呈对数增长[4]。不过,物种内部的过度采样究竟在多大程度上削减了数据库的有效信息、又如何扭曲多样性估计与继续测序的价值,长期缺乏系统量化,而实践中常用的去重和数据缩减手段并不考虑样本量。

这项研究把问题推进到可检测、可校正的层面。作者将样本间的系统发育关系与随机抽样下的期望相比较,据此识别并削减过度采样,与去重和数据缩减不同,这一策略显式考虑样本量。应用于NCBI基因组数据库的402个原核物种后,工具PhyloThin估计有效样本数比实际样本数低41%;偏差普遍存在且近年不断加剧,物种间差异也很大,说明仅凭基因组计数无法衡量一个物种已被刻画的充分程度。校正过度采样后,基因组多样性和待发现的新基因都比现有数据显示的更多,基因频率估计随之改善,这对病原体监测和新遗传功能的发掘都有直接意义。据报道,PhyloThin已作为基于溯祖理论的自动化统计工具在GitHub上公开,用于检测并纠正细菌群体的采样偏差[5]。

需要提醒的是,这仍是一篇预印本,方法与结论尚待同行评议检验;摘要也没有交代当真实群体结构明显偏离随机抽样假设、或应用于宏基因组组装基因组等更嘈杂数据时的表现。检测出偏差只是第一步,如何据此引导未来的测序资源投向代表性不足的分支,仍是悬而未决的问题。

来源:bioRxiv Genomics · biorxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org