scBaseCount:AI智能体构建全球最大标准化单细胞数据库
Cell|scBaseCount:AI智能体打造全球最大标准化单细胞数据库
Arc研究所、加利福尼亚大学、斯坦福大学等机构在Cell发表scBaseCount,用AI智能体自动挖掘SRA中全部公开10x Genomics数据集并统一标准化重处理,构建覆盖27个物种、75种组织、超5.02亿个细胞的全球最大标准化scRNA-seq数据库。该数据库缓解了跨研究整合中元数据标准不统一和批次效应严重的问题,为细胞状态AI模型训练提供大规模数据资源。
单细胞RNA测序让人们在单细胞分辨率上解析组织异质性成为可能:早期研究用466个细胞刻画了成年人脑与胎儿皮层的转录组多样性[4],随后的人肺分子图谱则对约7.5万个细胞做多策略注释,界定了58个细胞群体[2]。但这类研究各自独立,不同实验室、不同时间产生的数据存在批次效应,会损害数据的整合与解释[1];为应对不同技术引入的系统性变异,学界曾系统比较14种批次校正方法并推荐Harmony、LIGER与Seurat 3[3],而整个领域的分析流程始终缺乏统一标准[5]。校正手段越积越多,数据标准不一的根源问题却一直悬而未决。
2026年9月,Arc研究所、加利福尼亚大学、斯坦福大学等机构在Cell发表scBaseCount,把功夫下在了数据源头:AI智能体自动挖掘序列读取档案(SRA)中全部公开的10x Genomics单细胞数据集,自动标注元数据,并以统一流程对所有原始数据做标准化重处理,构建出目前全球规模最大的公共scRNA-seq数据库,覆盖27个物种、75种组织、超过5.02亿个细胞,且可自动更新。据报道,其开源代码库显示系统采用层级式智能体工作流来完成数据发现与元数据提取[6]。这项工作早在2025年5月即以预印本形式公布[7],此次是正式发表。
相对已有认识,推进之处在于把整合问题的主战场从下游算法前移到上游数据处理。过去学界主要依赖事后计算校正来抹平批次效应[1],并在多种方法之间反复比较取舍[3];scBaseCount则让全部数据经同一条管道从原始读取重新计数,在源头上规避了不同研究因分析流程与计数策略不一致而引入的差异。其跨物种、跨组织的5亿级细胞体量,也把可用资源从单研究数百[4]到约7.5万个[2]细胞的量级,抬升到接近细胞状态AI模型训练对大规模、多样化数据的要求。
边界同样清楚:其覆盖目前限定于10x Genomics平台,其他建库技术的数据尚未纳入;而且批次效应并非只来自处理流程,不同实验室与时间的差异同样会引入批次[1],统一重处理究竟能抹平多少、AI标注元数据的可靠性如何,都还有待跨研究整合与模型训练实践的检验。
- 1.Batch effects in single-cell RNA-sequencing data are corrected by matching mutual nearest neighbors · Nat Biotechnol 2018
- 2.A molecular cell atlas of the human lung from single-cell RNA sequencing · Nature 2020
- 3.A benchmark of batch-effect correction methods for single-cell RNA sequencing data · Genome Biol 2020
- 4.A survey of human brain transcriptome diversity at the single cell level · Proc Natl Acad Sci U S A 2015
- 5.Single-Cell RNA Sequencing Analysis: A Step-by-Step Overview · Methods Mol Biol 2021
- 6.arc-virtual-cell-atlas/scBaseCount/README.md at main · github.com 2026
- 7.scBaseCount: an AI agent-curated, uniformly processed ... · biorxiv.org 2026
scBaseCount 用 AI 智能体自动整理 10x 公开数据集并统一计数策略,为跨研究整合与细胞模型训练提供可直接复用的大规模标准化数据。
来源:中文产业新闻 · mp.weixin.qq.com