跳到正文
原文
AI × 生物医药· arXiv · q-bio.QM·· 1 天前评分42

VenusRX-Bench 与 VenusRX:面向酶促反应空间的统一基准与预训练模型

Elucidating the Space of Enzymatic Reaction: A Unified Benchmark and Pretrained Model

导读

VenusRX-Bench 与 VenusRX 共同构成酶促反应建模的统一框架:基准涵盖正向反应预测、单步逆合成与 EC 号预测,VenusRX 基于 T5 架构、经模板扩展与真实生化反应两阶段训练。基准测试显示现有化学模型在酶促任务上存在显著领域差距,VenusRX 在多数任务上达到最优或具竞争力表现。引入 EC 信息可同时提升反应预测与 EC 预测准确率,揭示反应结构与催化功能之间的双向关系。

深度解读

在计算机辅助化学领域,反应预测与逆合成的深度学习方法已相当成熟:Molecular Transformer 将正反应预测视为 SMILES 到 SMILES 的机器翻译,在常用基准上 top-1 准确率超过 90% [3];与超图探索策略结合后又实现了自动化的逆合成路线规划 [4];针对 SMILES 难以高效表达分子结构的问题,图到序列模型进一步引入置换不变的图编码器以减少对数据增广的依赖 [1]。然而这些模型学到的主要是分子转化本身,而酶促反应的结局同时取决于分子结构与酶的催化功能。另一方面,面向酶的计算工具则集中于功能注释,如 EC 编号预测的 DEEPre、CLEAN 和 GraphEC [2,5,8],以及预测转换数等动力学参数的 TurNuP 和 MPEK [6,7]。两条线索各自发展,一直缺少能把反应物、产物与 EC 注释放在一起统一建模与评测的框架。

这项研究将问题形式化为学习一个联结反应物、产物与 EC 注释的酶促反应空间,并提出统一基准 VenusRX-Bench,覆盖正反应预测、单步逆合成与 EC 编号预测三项任务,整合多个生化数据库的反应数据,辅以标准化整理、防泄漏的数据划分和一致的评测流程。对代表性化学与酶学模型的系统评测揭示出明显的“化学到酶促”域差距,其根源在于领域数据有限、对催化情境的依赖以及大生物分子结构难以建模。为弥合这一差距,作者构建了 T5 风格的统一序列到序列模型 VenusRX,联合学习正向预测、逆合成与反应重构,采用两阶段训练——先在数百万模板扩展的反应上训练,再在真实生化反应上继续训练;可选的 EC 条件化引入催化情境,分子库约束解码则改善复杂生物分子的生成。

在基准任务及更具挑战性的泛化划分上,VenusRX 在多数评测设置中取得最优或具有竞争力的结果,面对的是代表性的化学与酶学基线。更值得注意的是作者呈现的双向关系:引入 EC 信息能持续改善反应预测,而学到的反应表征反过来也能支持准确的 EC 预测。这为以往主要依据酶自身信息进行功能注释的路线 [2,5,8] 提供了互补视角,说明反应结构与催化功能可以互相约束、联合学习。

总体而言,这项工作把此前分立的化学反应预测与酶功能预测纳入同一框架,并提供了防泄漏、标准化的统一评测基准。但需要指出,它目前是未经同行评议的 arXiv 预印本;模型在部分设置上也只是“有竞争力”而非全面领先,而作者所揭示的领域数据稀缺、催化情境依赖与大分子建模困难等域差距根源,仍是这一方向未来需要持续应对的挑战。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org