跳到正文
原文
AI × 生物医药· arXiv · cs.LG·· 1 天前评分36

MPGE:用于分子分类解释的多视角图解释器

MPGE: A Multi-Perspective Graph Explainer for Molecular Classification Explanation

导读

MPGE(Multi-Perspective Graph Explainer)将事实支持、反事实敏感性和样本容忍性三种解释视角整合到统一约束框架中,针对冻结 GNN 分类器同时生成三类分子图解释。

深度解读

图神经网络从化学图直接学习分子表示来预测性质,已是计算机辅助药物发现中的主流工具之一,相关综述已收录数十种架构和数十个分子性质数据集 [1]。围绕“学到的表示是否真的好用”,领域内做过大量基准比较:有研究在公共与工业专有数据集上系统评测图卷积模型与固定描述符模型,并提出了表现稳定的图卷积架构 [2];也有工作在多个公共数据集上比较描述符模型与图模型,发现平均而言描述符模型在精度和效率上反而占优,图模型仅在部分较大或多任务数据集上突出 [3]。此后的发展沿多个方向推进,包括保留分子层面空间信息的图卷积嵌入 [4]、面向蛋白-配体结合亲和力的 PotentialNet 图卷积 [5]、实现有向消息传递网络的开放软件包 [6]、多保真数据下的迁移学习策略 [7],以及在何种条件下量子力学描述符能改善小数据集上的预测 [8]。但这条主线的评价对象始终是预测精度,卡点在于:一个紧凑的、保持预测的“理由”并不必然揭示哪些改动会翻转决策、哪些改动模型能够容忍,即对单个决策的解释仍然缺失。

这篇预印本提出的 MPGE(Multi-Perspective Graph Explainer)把解释拆成三个互补视角,统一作用于一个冻结的分类器:事实视角(原文称 prototype,PT)寻找紧凑的保留边集合,要求保持标签与所需置信度;反事实视角(CF)寻找有界的、能改变预测的删边操作;样例容忍视角(EXE)寻找非平凡的、有界的删边同时保持标签与置信度。三者由一个共享的带约束 formulation 连接预测行为、紧凑性与编辑代价,再以各自目标分别生成。作者对 CF-GNNExplainer 做图分类扩展,学习对称的边排序并离散验证候选,同时记录搜索失败的案例;另有一个 BBBP 片段后端输出经 RDKit 规范化的分子。评测以 GCN 为主实现,覆盖 MUTAG、Mutagenicity、AIDS、COX2_MD 与 BBBP,指标包括语义覆盖、条件质量、稳定性与运行时间。结果显示:成功的事实掩码平均仅保留输入边的 8.6%–15.5%,有界反事实的覆盖率为 4.8%–67.6%,样例容忍的保持覆盖率达到 98.9%–100.0%。

相对已有认识,这项工作的推进在于把“模型依赖什么”“模型对什么敏感”“模型能容忍什么”放进同一个约束框架下量化呈现,而不是只回答其中一个问题;记录失败搜索、报告不成功的反事实比例,也使解释本身的可靠性可见。作者同时明确,定量比较与分子可视化刻画的是模型层面的支持、敏感与容忍,并不将其当作经过验证的化学机制。

局限方面,这是未经同行评议的 arXiv 预印本;反事实覆盖率在数据集间波动很大(4.8%–67.6%),说明有界删边在不少分子上难以翻转预测;探索性控制实验也显示硬投影与保留节点信息的处理会影响结果。解释结果如何对应真实化学机制、以及在更广泛模型与数据集上的稳健性,仍待后续工作回答。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org