跳到正文
原文
AI × 生物医药· arXiv · cs.AI·· 4 小时前评分35

面向早期药物发现的本地可部署智能体协同科学家:小模型规划

Toward a Locally Deployable Agentic Co-Scientist: Small-Model Planning for Early-Stage Drug Discovery

导读

研究者提出由本地可部署紧凑语言模型驱动的轻量级框架,调用18个模块化工具完成早期药物发现多步规划,通过Unified Molecular Schema维护共享分子记录。经1,263对查询-规划数据LoRA微调后,Llama 3.2-3B在47个跨组查询上工具选择F1达0.998、序列精确匹配0.979;在更严格工作流分组切分下精确匹配仅0.452-0.548,凸显紧凑模型的组合泛化挑战。

深度解读

早期计算药物发现要跨多步骤工作流协调多种异构科学工具,让大语言模型充当规划者已成主流思路。ChemCrow 用 GPT-4 驱动、整合 18 个专家设计的工具,已能自主规划并执行合成路线并辅助药物发现等任务 [1];CACTUS 进一步把化学信息学工具接入智能体,在数千道化学题上显著超过基座模型,并指出 Gemma-7b、Mistral-7b、Llama3-8b 等较小的开源模型有望部署在消费级硬件上而不明显损失精度 [2]。多智能体 LLM 也已被用于药物组合等生物医学推理场景 [3]。不过,这类方案多依赖大型闭源模型或提示工程,工具调用的规划能力能否由本地小模型可靠承担,仍缺乏系统检验。

这篇未经同行评议的 arXiv 预印本给出一个轻量、可本地部署的框架:由紧凑语言模型负责规划对 18 个模块化工具的调用,与 ChemCrow 同样覆盖 18 个工具 [1],但把规划职责交给可微调的小模型。框架以统一分子模式维护共享分子记录,插件式接口支持工具替换与扩展。作者通过工作流图路径覆盖,人工精修了 1,263 个查询-计划对,并对三个紧凑模型家族做 LoRA 微调。在查询级划分下,47 条留出的跨组查询上,所有微调模型都能生成完全可解析且符合模式规范的计划,其中 Llama 3.2-3B 的工具选择 F1 达 0.998、序列精确匹配 0.979、参数 F1 0.960;而在排除相同有序工具序列、划分更严格的工作流分组设定下,序列精确匹配降至 0.452 到 0.548。

相对已有认识,这项工作把 CACTUS 中“小模型可用”的观察 [2] 往前推进一步:不是靠提示让现成小模型答题,而是用小规模、结构化的查询-计划数据做参数高效微调,使本地小模型也能稳定输出规范、可执行的多步工具调用计划,回应了对本地部署能力的需求 [2]。同时,严格划分下的大幅性能落差,把组合泛化,即生成训练中未见过的完整工作流路径,明确标识为紧凑模型的短板,为后续研究指出了方向。

当然,结果来自自建基准上的计划生成评估,尚不涉及真实药物发现的端到端成效;如何在保持本地部署优势的前提下提升组合泛化能力,仍是这篇论文自己也承认尚未解决的问题。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org