跳到正文
原文
AI × 生物医药· arXiv · cs.LG·· 4 小时前评分34

跨模态对比学习从组织病理图像检索免疫治疗相关分子特征

Cross-Modal Contrastive Learning for the Retrieval of Immunotherapy-Associated Molecular Signatures from Histopathology

导读

CCMIL 框架通过跨模态对比学习,从标准 H&E 病理切片直接推断胃癌免疫治疗相关的炎症/非炎症分子表型,免去 10 基因 RNA 测序。该方法将视觉形态模式与分子表型对齐到共享潜空间,支持以图搜图的检索式查询并产出可解释的注意力热图。学到的表征还可用于下游分类,提供实用的分子预筛方案。

深度解读

在晚期胃癌中寻找免疫治疗的获益人群,一直是个难题:持久应答只发生在少数转移性胃癌患者身上,获益的确定性生物标志物也不清楚[4]。转录组层面已有两条路径:量化肿瘤微环境的 TMEscore 在帕博利珠单抗 II 期试验(NCT02589496)中达到 AUC 0.891,且 AUC 大于 PD-L1 CPS、TMB、MSI 与 EBV[4];18 基因肿瘤炎症签名(TIS)则在 CERTIM 队列中显著富集抗 PD-1 获益(OR 2.64)[3],其初衷是检测泛癌种的适应性免疫抵抗[7]。这类工作的底层逻辑多沿用按 T 细胞浸润状况把肿瘤分为“炎症型”与“非炎症型”表型的惯例[8],但都依赖测序或分子检测平台,在仅有常规染色的病理形态层面难以企及。

另一条线索是从 H&E 切片直接预测分子信息。早在 2020 年,集成多实例学习模型预测结直肠癌微卫星不稳定,在 TCGA-COAD 与外部队列分别取得 AUC 0.8848 和 0.8504,并通过与基因组和转录组资料的关联加以解释[2];此后的工作显示,自监督特征提取加注意力多实例学习的流程在生物标志物与泛癌种突变预测上有良好可泛化性[5][6],对比式自监督预训练也能为病理图像提供通用表征[1]。不过这些范式大多止步于输出“是与否”的分类标签,而胃癌的“炎症型/非炎症型”分子分型依赖一套成本不低的 10 基因 RNA 签名来识别,两者之间并未打通。

本研究提出的跨模态对比多实例学习框架(CCMIL)正是针对这一缺口:用有监督的对比目标,把视觉形态模式与分子表型对齐到共享潜在空间,从而直接从常规 H&E 切片“填补”RNA 签名。与以往判别式模型不同,CCMIL 把检索作为首要任务——病理医生提交一张全切片图像,即可检索出转录组上同质的邻近病例并近似 RNA 签名,推理阶段无需基因组测序。结果显示,这一“检索优先”的策略捕捉到肿瘤炎症的连续表型谱,并给出临床可解释的注意力热图;所学表征还支持有竞争力的下游分类,可作为实用的分子预筛查手段。

相对既有认识,此文推进的一步在于把任务从“给出标签”转为“逼近连续的分子表型”,并让输出以可检索、可核查的方式呈现——检索到的邻域和热图本身即是证据;对比目标也从无监督的表征学习[1]延伸到有监督的跨模态场景。需要提醒的是,这仍是未经同行评议的 arXiv 预印本,摘要未给出样本量、检索精度或外部验证数据,近似的 RNA 签名能否最终转化为对免疫治疗获益的预测价值,尚待临床层面检验。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org