跳到正文
原文
bioRxiv Cancer Biology· Martelli, J., Martelli, J. ·· 15 小时前评分33

人工智能应用于白血病表观基因组数据:诊断、预后与监测模型的系统综述

Artificial Intelligence Applied to Epigenomic Data in Leukemia: A Systematic Review of Diagnostic, Prognostic and Monitoring Models

导读

该系统综述纳入 2010–2026 年间 30 项研究,评估 AI 模型在白血病表观基因组数据中的诊断、预后与监测表现。诊断分类器准确率/F1 0.87–1.00,两款纳米孔测序模型可在约 2 小时内给出急性白血病亚型判定;预后评分与生存相关(HR 2.36–10.82),但外部验证判别力下降(C-index 0.677→0.529)。

深度解读

白血病的表观遗传失调早有坚实的证据基础:对344例AML患者甲基化谱的聚类曾分出16个群组、揭示了多个由甲基化定义的亚型,15基因甲基化分类器还在独立队列中与总生存相关[2];CLL两种IGHV分子亚型的甲基化组不同,似乎承载了不同正常B细胞亚群的表观遗传印记[3];表观调节基因的体细胞突变也频繁出现并与不良预后相关[1][4]。在实体瘤中,表观基因组数据加机器学习的方法已被用于预测基因表达变化[6]乃至无创检测组织学转化[5]。但在白血病领域,已发表的AI模型性能如何、能否外推到独立队列、偏倚风险多大,一直没有系统评估,本研究正是针对这一缺环。

作者按照PRISMA 2020和SWiM规范,于2026年10月7日检索PubMed并结合引文与网络检索,最终纳入2010至2026年间的30项研究(22项发表于2020年之后):AML 16项、ALL 4项、跨急性白血病谱系2项、JMML 3项、CLL 5项,其中10项为儿童研究。28项以DNA甲基化、2项以染色质可及性为输入,没有研究建模组蛋白修饰;树集成(9项)和支持向量机(5项)最常见。诊断类模型报告的准确率、一致性或F1为0.87至1.00,两项应用于纳米孔测序数据的分类器中,一项约2小时内即可给出急性白血病亚型判断。甲基化预后评分与生存相关(报告风险比2.36–10.82),但迁移到独立队列后区分度明显缩水(内部C指数0.677,一个外部队列仅0.529)。15项做了外部表观基因组队列验证、仅1项为前瞻性;PROBAST评估显示21项高偏倚风险、8项不明确、仅1项低,问题集中在分析域(样本量小、缺少校准、可能的数据泄漏),且只有3项报告校准、11项提供代码。

这篇综述的贡献不在于提出新模型,而在于把十余年散落的证据放到同一框架下严格审视:一方面确认了甲基化AI模型在白血病分型上的高报告准确性乃至当天诊断的潜力,另一方面量化了模型跨队列运输时性能大幅衰减这一常被忽视的事实。它把问题从早年“甲基化签名能否定义亚型、是否携带临床信息”[2][3],推进到“这些信息能否转化为可靠、可迁移的临床工具”。

局限和遗留问题同样清晰:证据几乎全部来自回顾性、高偏倚风险的模型开发研究,前瞻性验证和临床影响评估近乎空白;由于研究间异质性,作者只能做叙述性综合而无法荟萃分析;组蛋白修饰这一数据类型在白血病AI建模中尚无合格研究。作者据此呼吁,在临床采用之前需要开展前瞻性、多中心验证,并报告经过校准、细节透明的模型。

来源:bioRxiv Cancer Biology · biorxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org