跳到正文
原文
AI × 生物医药· arXiv · cs.AI·· 1 天前评分47

从基准到实战:开源智能体 MAGI 能否胜任真实药物发现?

From Benchmark to Bench: Can Agents Survive Real-World Drug Discovery?

导读

开源模块化智能体 MAGI 在 3 家药企 9 个回顾性先导优化项目回放测试中表现接近专家水平:LLM 直接生成与调用 REINVENT 4 两种路线均产出有效结构,但项目达成情况取决于评分模型的准确性与适用域,而非生成路线本身。盲评中化学家无法将 MAGI 提案与留作对照的化合物区分开。 ```

深度解读

过去十年,深度生成模型已成为分子设计的常规手段:从早期用对抗自编码器按预设性质生成新分子的尝试 [3],到对该领域方法、数据与技术挑战的系统梳理 [1],生成端的能力不断积累。工具侧,REINVENT 自 2.0 起便以开源、可用于实际项目的从头设计工具定位,帮助研究者权衡化学空间中的探索与利用 [2],其第四代进一步覆盖全新设计、R 基团替换、骨架跃迁与分子优化 [4];评估侧则有 ADMET-AI 这类平台,本地批量预测一百万个分子只需 3.1 小时 [5]。真正的卡点在更上层:智能体系统已开始协调这些分子设计工具,但究竟哪一层限制了真实项目的结果,此前并不清楚。

一项未经同行评议的 arXiv 预印本把这个问题直接搬进真实项目。作者开发了开源模块化智能体 MAGI,它能自行撰写优化目标、启动并监控优化、解读构效关系并据此修订策略;分子既可以由大语言模型直接生成,也可委托给 REINVENT 4,打分服务则在统一契约下可互换。研究在固定时间截点下回放三家制药公司的九项先导优化战役。两条路线都产生了有效结构:LLM 提案更贴近项目原有的局部化学,以更少的操作取得相当或更高的主活性;REINVENT 则探索了更宽的化学空间。但决定成败的不是生成路线而是预测模型——目标达成度跟随模型对所提化学的准确性,一旦化学越出模型适用域便明显下滑。盲测中,化学家无法区分智能体提案与预留的真实化合物,认为其构效关系推理大体可信、但尚不完整。

这项工作推进的一步在于把整条工具链放到真实战役上做归因:既有生态多围绕单一工具构建 [2][4][5],而这里表明协调层已可作为即插即用的组件接入现有计算化学流程,瓶颈被定位在打分器的适用域而非编排本身。这一判断也与行业动向相呼应——arXiv 上同期已有 LLM 引导的先导优化智能体协调异构优化工具的报道[6],以及主张更贴近真实分子设计场景的 MolDesignBench 基准[7]。

需要保留的审慎是:所有结果来自固定时间截点下的回顾性回放,尚无前瞻性湿实验验证;构效关系推理被参与盲测的化学家评为可信但不完整;用作者自己的话说,真实项目的上限目前仍由打分器的适用域、而非工具编排来设定。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org