邓志罗/Alice McHardy 团队开发跨域宏基因组物种解析新方法 Metax
Cell:邓志罗/Alice McHardy 团队开发高精度跨域宏基因组物种解析新方法 Metax
邓志罗/Alice McHardy 团队在 Cell 发表宏基因组物种解析工具 Metax,可在跨域数据集中提升物种鉴定与丰度预测精度。在 600 余个数据集评估中,Metax 的物种检出 F1 平均提高 55%,Bray–Curtis 丰度差异度平均降低 45%,并能识别参考基因组污染、试剂污染与局部序列相似性等可疑信号。
宏基因组测序让我们能直接刻画人体与环境中的微生物群落,但把测序读段准确归到“物种”层面始终不易。症结早已被反复指出:分类工具的假阳性问题相当严重,有研究估计假阳性可占已识别物种的九成以上 [5];低生物量样本中,污染与技术噪声令真实群落信号难以判别 [3],为此出现了依赖正负对照的 KatharoSeq 实验方案 [4],以及只测序约 1% 宏基因组、可应对低生物量与降解样本的 2bRAD-M [2];计算侧的改进包括以种特异性 IIB 型限制酶位点甄别假阳性的 MAP2B [5],以及把 k-mer 相似性与基因组覆盖信息结合以压低假阳性的 KMCP [6]。此外,多数工具主要面向细菌、古菌和真菌,对病毒等群落的关注相对有限 [6]。如何在剔除可疑信号的同时不伤及真信号,并覆盖更广的类群与样本场景,一直缺乏一套系统方案。
这条消息报道,邓志罗与 Alice McHardy 团队在 Cell 发表了跨域宏基因组物种解析方法 Metax。研究系统评估了超过 600 个数据集,场景横跨人体微生物组、低生物量临床样本、海洋、土壤和污水。Metax 的思路是在最大限度保留真实微生物信号的前提下,识别由参考基因组污染、试剂污染及局部序列相似性造成的可疑信号,从而同时提高物种鉴定和丰度预测的准确性。与其它代表性方法相比,其物种检出 F1-score 平均提高 55%,丰度预测的 Bray–Curtis 丰度差异度平均降低 45%。
相对已有认识,这一步的推进在于把此前分散处理的偏差来源放进同一框架:MAP2B 聚焦假阳性识别并依赖限制位点特征 [5],KMCP 依赖 k-mer 与覆盖度的组合 [6],实验方案则需外加正负对照 [4];Metax 则在计算流程内统一甄别参考库污染、试剂污染与局部序列相似性三类问题,并在涵盖低生物量临床样本、海洋、土壤等异质场景的大规模数据上检验了表现——而这些恰是污染与噪声最棘手的地带 [2][3]。
当然,消息并未交代各场景下的性能差异与运行代价,也未说明方法对参考数据库质量的要求;参考库本身的覆盖与整理仍是悬而未决的问题,大量未培养物种因缺乏整理良好的分类树而难以纳入参考 [1],这类“库”层面的限制恐怕仍会制约任何解析方法的准确上限。
- 1.DeepMicrobes: taxonomic classification for metagenomics with deep learning · NAR Genom Bioinform 2020
- 2.Species-resolved sequencing of low-biomass or degraded microbiomes using 2bRAD-M · Genome Biol 2022
- 3.Performance of Microbiome Sequence Inference Methods in Environments with Varying Biomass · mSystems 2019
- 4.KatharoSeq Enables High-Throughput Microbiome Analysis from Low-Biomass Samples · mSystems 2018
- 5.Removal of false positives in metagenomics-based taxonomy profiling via targeting Type IIB restriction sites · Nat Commun 2023
- 6.KMCP: accurate metagenomic profiling of both prokaryotic and viral populations by pseudo-mapping · Bioinformatics 2023
来源:中文产业新闻 · mp.weixin.qq.com