SoftGene:融合蛋白语言模型与软提示的可解释基因集注释框架
SoftGene: Protein Language Model-Enhanced Soft Prompting for Interpretable Gene Set Annotation
SoftGene 是一个结合蛋白语言模型 ESM 与软提示的基因集注释框架,通过蛋白序列信息与文本上下文混合提示提升注释效果。该框架在 Gene Ontology(GO)与 MSigDB 两个基准数据集上评估,结果显示整合蛋白序列表征与文本上下文整体改善注释,但不同生物域中蛋白嵌入贡献存在差异。
基因集分析历来是功能基因组学的重要支柱:自GSEA提出以来,通过把基因列表与共享生物学功能、染色体位置或调控关系的基因集相对照,研究者得以从全基因组表达数据中提炼生物学洞见[1]。此后,各类工具让这一范式更易用、更可扩展——clusterProfiler 4.0 为数千种物种提供了通用的功能富集接口[3],ShinyGO 把富集结果与通路图、蛋白互作网络等图形化信息整合[2],GSEApy 借助 Rust 实现大幅提升了大规模单细胞数据的分析效率[5],Blast2GO 则从蛋白序列出发、基于 GO 词表做高通量功能注释[4]。不过,无论统计富集还是序列注释,最终的功能解读仍高度依赖人工整理与专家判断;而现有的 LLM 注释方法多停留在符号化基因名层面,难以捕捉支配分子活性、相互作用与下游基因功能的蛋白序列信息。
SoftGene 正是针对这一痛点提出的框架。它的第一步是用建立在蛋白质语言模型 ESM 之上的层级注意力编码器,把每个基因集表示为基于氨基酸序列的蛋白质级信息;第二步则构造一种混合提示方案——由基因集嵌入导出的软提示,与 LLM 生成的辅助上下文构成的硬提示相结合——再交由一个本地 LLM 完成注释。作者在 Gene Ontology 和 MSigDB 这两个基准数据集上进行了评估,结果显示:把蛋白质序列表示与文本上下文结合,总体上改善了基因集注释效果;但分领域的分析同时揭示,蛋白质嵌入的贡献在不同生物学领域之间并不一致。
从领域的角度看,这项工作的意义在于把蛋白序列层面的表示引入了 LLM 注释管线。与 Blast2GO 直接从序列映射到 GO 词条的做法[4]不同,SoftGene 让序列嵌入以软提示的形式参与 LLM 的推理过程,并与文本上下文互补,这也在标题所强调的可解释性上做了一定探索。相对于以符号基因名为输入的主流 LLM 方案,它试图让模型“看到”决定分子功能的序列结构本身,而不只是基因的名字。
当然,需要提醒的是,这是一篇未经同行评议的 arXiv 预印本,结论有待检验。摘要中自己也承认,蛋白质嵌入的贡献为何随生物学领域而异,目前仍是一个未解的问题——哪些领域最受益、为何受益,还有待后续工作给出答案。
- 1.Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles · Proc Natl Acad Sci U S A 2005
- 2.ShinyGO: a graphical gene-set enrichment tool for animals and plants · Bioinformatics 2020
- 3.clusterProfiler 4.0: A universal enrichment tool for interpreting omics data · Innovation (Camb) 2021
- 4.High-throughput functional annotation and data mining with the Blast2GO suite · Nucleic Acids Res 2008
- 5.GSEApy: a comprehensive package for performing gene set enrichment analysis in Python · Bioinformatics 2023
来源:AI × 生物医药 · arxiv.org