跳到正文
原文
AI × 生物医药· arXiv · cs.CV·· 3 小时前评分38

细胞与细胞核实例分割中性能与代价如何权衡:可持续性感知性能指数 SAPI

Performance at What Cost? A Sustainability-Aware Performance Index for Cell and Nucleus Instance Segmentation

导读

研究者提出可持续性感知性能指数 SAPI,将分割性能、能耗与模型体积纳入统一度量,在 6 个 CellBinDB 数据集上对 19 个零样本推理模型与 16 个少样本适配模型进行基准评估。结果显示更大或计算量更高的模型未必带来成比例的分割质量提升,SAPI 排名与纯性能排名不一致。该框架支持生物医学图像分析中兼顾计算可及性与环境责任的模型选择。

深度解读

在数字病理工作流中,细胞与细胞核的实例分割一直是定量分析的基础环节——对全切片图像中数以万计的细胞核进行分割与分类,是后续大规模核形态学分析的前提[1]。围绕这一任务,学界先后建立了含两万多个手工标注核边界的公开数据集[2]、以距离图回归应对粘连细胞核的深度学习方法[3],以及以聚合Jaccard指数(AJI)为统一准绳的多器官分割挑战赛式评测[4]。分割质量的提升也有明确的临床回报:从分割结果中提取的核形态学特征已被用于关联基因组不稳定性和预后[6]。与此同时,以SAM为代表的分割基础模型凭借在十亿级掩码上预训练所得的能力进入病理图像领域,但已有评测显示,其零样本性能对大块连通目标尚可,对细胞核这类密集实例即便给到20个提示点或框也不稳定[5]。由此留下一个悬而未决的问题:越来越大、越来越耗资源的基础模型,换来的分割收益究竟值不值。

这篇arXiv预印本(未经同行评议)把“值不值”直接量化。作者提出可配置的可持续性感知性能指数(SAPI),将分割性能、能耗与模型大小合成单一指标;在六个CellBinDB数据集上对19个预训练与基础模型进行零样本推理基准测试,又对16个可微调模型进行少样本适配实验(分别采用冻结编码器与全模型微调两种策略),并用软件监测工具估算GPU、CPU与内存三部分的能耗。结果显示,更大、计算需求更高的模型并不必然带来相称的分割质量提升;少样本适配对部分模型确有益处,但收益与资源开销在架构、数据集与适配策略之间差异很大,以致按SAPI排出的名次与只看性能的名次明显不同。

这一工作的推进之处在于为模型评测补上了长期缺位的成本维度。此前的挑战赛式评测以单一性能指标论高下[4],对SAM的病理评测也主要回答“零样本行不行”,而不问“代价几何”[5];这与医学大模型领域关于“提示工程能否省去昂贵微调”的讨论[7]遥相呼应。本文把能耗、显存等运行成本纳入模型选择,给出的不只是又一份排行榜,而是一套可配置、可复用的比较框架,用以支持计算资源更可及、环境责任更友好的模型选型。

当然,结论仍需谨慎看待:预印本尚未经同行评议;能耗依赖软件工具估算而非物理测量;评测局限于CellBinDB的六个数据集,跨染色、跨模态及真实临床部署场景的普适性未经验证;SAPI各项权重的设定如何左右排名也还有讨论空间。更根本的是,资源受限场景下的最优模型与性能最优模型之间的差距能否缩小、何时缩小,仍有待后续研究回答。

来源:AI × 生物医药 · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org