跳到正文
原文
AI × 生物医药· arXiv · cs.LG·· 1 天前评分32

基于潜在流匹配的分子图生成

Latent Flow Matching for Molecular Graph Generation

导读

作者提出在预训练 VAE 潜在空间进行流匹配、最后才解码为图的分子图生成方法,在不同规模分子基准上取得较强有效性与 FCD,质量-效率权衡优于现有显式图生成模型。潜在表示只需学习一次即可复用于多种生成目标,无需重训,并支持分子属性引导与潜在空间分类器驱动的有效性感知生成。

深度解读

深度生成模型已成为 de novo 分子设计的主流工具,架构上大体沿 SMILES 字符串与分子图两条路线展开 [2]。直接在离散图空间中逐步生成原子和键的图生成模型,虽然在有效输出率等指标上优于 SMILES 模型,但长期被认为过于通用、计算开销大,分子变大时代价随之攀升 [1];为绕开这一瓶颈,另一些工作转向先用变分自编码器学习分子潜表示、再在约束条件下生成分子 [3],而条件化、多目标生成通常与训练时的目标绑定——早期 DrugEx 版本便因在固定目标下训练、无法接收先验信息而需要重新设计 [4]。

这篇未经同行评议的 arXiv 预印本把生成过程整体搬进潜空间:作者先用一个重建保真度很高的预训练 VAE 编码整张分子图,再用 flow matching 在整图潜表示上建模生成,只在最后一步才解码回图。在一系列规模递增的分子基准上,该方法取得了很强的有效性与 FCD 表现,与最先进的显式图生成模型相比提供了有利的质量—效率折中。更关键的是,图的潜表示只需学习一次,之后无需重训即可复用于多个生成目标;作者据此演示了面向分子性质的引导生成,并通过直接在潜空间中学习的分类器实现了有效性感知生成。

相对已有认识,这项工作的推进在于把表示学习与生成目标解耦:显式图生成模型每换一个目标往往要重训整套生成器,而这里 VAE 定型之后,多个生成目标共享同一套表示。从更大的图景看,潜空间流匹配的思路此前已在图像生成领域确立,LFM 框架将流匹配扩展到感知对齐的潜空间 [5];在分子方向上,2026 年发表的 VFMol 同样把 VAE 与流匹配深度整合,但选择在离散状态空间中做逐步采样 [6],与本文让流匹配始终停留在潜表示层面、末步才解码的路线形成对照。相邻的化学反应轨迹驱动工作中,主要计算成本也仅在最后一步发生一次 [7],显示“只在末端付代价”正成为这类框架的共同取向。

当然,该结果目前只是预印本,代码也声明录用后才公开;生成质量依赖 VAE 的重建保真度,潜空间自身的偏差会如何传导到产物尚待检验,且化学有效性并非模型内生保证,仍需额外分类器加以引导。这些优势在更大分子规模、更广化学空间内是否依然成立,摘要中并未给出证据。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org