跳到正文
原文
AI × 生物医药· arXiv · cs.AI·· 4 小时前评分38

PharmAgent:基于冻结语言模型的约束感知分子优化搜索方法

PharmAgent: Constraint-Aware Search with Frozen Language Models for Molecular Optimization

导读

PharmAgent 是一种面向分子优化的约束感知搜索方法,采用冻结语言模型结合拉格朗日控制器与结构索引回放机制,将候选分子的约束违反转化为累积约束压力,并随课程逐步激活各约束。

深度解读

深度生成模型早已进入分子设计的工具箱:从循环网络、变分自编码器到对抗生成网络,各类架构已被系统梳理并用于化合物从头设计 [1];对抗自编码器 druGAN 展示了生成具备预设性质分子的能力 [2];几何约束变分自编码器进一步把三维结构信息纳入条件生成 [3];分层生成模型 DrugHIVE 覆盖从头生成、分子优化、骨架跃迁等多种设计任务 [4];OptiMol 则以分子对接为神谕,在化学空间中迭代逼近高结合能的配体 [5]。这些路线的共性在于,要把化学指令与性质反馈纳入系统,通常依赖专门的模型设计或训练;而现实中的分子优化评价预算有限,分子既要提升靶标活性,又必须同时满足可开发性约束,痛点正在于此。

PharmAgent 的做法是给冻结的语言模型外挂一套自适应状态:拉格朗日控制器把已接受状态中的违约转化为逐轮累积的约束压力,并与当前性质测量分开维护;结构索引的回放机制从已评估的分子跃迁中调取相关经验,引导后续提案;约束按课程方式逐步激活,候选与现任解在同一当前目标下比较,被接受的状态决定乘子的下一次更新;作者还推导出一个精确恒等式,刻画已接受状态的违约如何在乘子中累积。在五个任务、各五次独立运行下,纯靶标搜索的目标得分曲线下面积之和达 3.9208,较 MOLLEO 提升 37.3%;在线约束设定的性质调整 AUC 达 0.7076,较最强在线基线 ExLLM 提升 53.8%,两项均居所有评测方法之首,在线对比覆盖全部五个基线框架;完整系统在靶标质量、性质调整表现与 Pareto 超体积上领先所有消融变体,五个分子案例全部到达可行终态。值得注意的是,被超越的 ExLLM 并非低效基线:据其披露,在使用完全相同的 API 模型时,其调用成本远低于 MOLLEO,速度还快 15 倍以上[6]。

放在已有版图上看,此前的生成式路线把性质条件“焊”进模型与训练过程 [2][3][4],约束一变往往意味着重新定制或重训;PharmAgent 把约束控制外置为显式状态,冻结模型负责按指令编辑分子,乘子负责记录违约,回放负责供给经验,等于为“冻结语言模型如何获得显式约束控制与相关经验”这一问题给出了一个可控且有理论刻画的实现,那个精确恒等式正是它区别于纯经验技巧的地方。

当然,这仍是一篇未经同行评议的 arXiv 预印本,结论有待独立检验;五个案例虽全部到达可行终态并记录了靶标增益与权衡,但在更紧的评价预算、更硬的可开发性约束下,课程式激活与乘子累积这套机制能否保持领先,材料中还没有给出答案。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org