Fabian Isensee 在 Janelia 讲解交互式 3D 分割基础模型 nnInteractive
交互式 3D 分割基础模型 nnInteractive(Fabian Isensee / Janelia)
nnInteractive 作者 Fabian Isensee 在 HHMI Janelia 的 51 分钟讲解中介绍基于 vision transformer 的可提示交互式 3D 分割模型,支持点、框、lasso 等 2D 提示即时生成 3D 掩码。讲解还对比了与 SAM 在器官特定任务上的取舍,并演示了脑肿瘤 MRI、电子显微镜神经元堆叠和昆虫脑 micro-CT 等应用。
NN-UNet 作者 Fabian Isensee 讲 nnInteractive:基于 vision transformer 的可提示(promptable)交互式 3D 分割,用 2D 点/框/lasso 即时生成 3D 掩码,并讨论与通用 SAM 基础模型的对比及在肿瘤 MRI、电镜神经元、昆虫脑 micro-CT 的应用。
- 背景:Isensee 是 NN-UNet(3D 语义分割工具,GitHub 8k+ star、引 1 万+)作者,现聚焦基础模型与交互式分割。
- nnInteractive:基于 vision transformer 的可提示分割模型,支持 2D 提示(点/框/lasso)即时生成 3D 分割,像「用视觉方式跟 AI 模型聊天」。
- 与 SAM 对比:通用 SAM 模型在部分医学分割上仍优于针对特定器官的 checkpoints——通用基础模型有其价值;nnInteractive 走「generalist + 交互修正」路线。
- 应用演示:脑 MRI 肿瘤、电子显微镜神经元堆叠、昆虫脑 micro-CT 等;自动化 mask 作初始化、用户交互修正,规避模型失误。
- 取向:强调「标准单元 AI 模型」已学到通用表征,少旋钮、泛化好;与 #60(钙成像经典 ML)形成「深度学习 vs 经典方法」对照。
- 定位:AI4Science(生物图像 ML / 基础模型);与 #59(ESMFold2 结构基础模型)、#60(NMF)共构计算方法主题。
医学图像分割此前大体沿两条线推进。一条是自动化架构的持续改良:U-Net 长期是主流骨干,MultiResUNet 针对经典结构在困难图像上的不足提出修改 [2],KiU-Net 则用过完备卷积设计缓解 U-Net 系对小结构和边界区域分割不佳的问题 [5]。另一条线承认全自动结果仍不够稳健、需要人来兜底:DeepIGeoS 先用一个 CNN 生成初始分割,再把用户交互通过测地距离变换传给另一个 CNN 做精修 [1];ITK-SNAP 则在软件层面用交互训练的决策森林加主动轮廓实现多模态 3D 半自动分割 [3]。近年来基础模型思路也开始进入这一领域,如 BrainSegFounder 用两阶段自监督预训练构建 3D 神经影像分割基础模型,以降低训练对大量标注的需求 [4]。卡点在于:自动化模型出错时缺少即时、低门槛的纠错手段,而既有交互工具又多与特定任务、模态绑定。
这条消息来自 HHMI Janelia 研究园区的 AI4Science 讲座(51 分钟),讲者是 NN-UNet 作者 Fabian Isensee——该 3D 语义分割工具在 GitHub 上有 8k+ star、引用超过 1 万。他介绍了 nnInteractive:一个基于 vision transformer 的可提示(promptable)交互式 3D 分割模型,用户只需在切面上给出 2D 点、框或 lasso,模型即时输出 3D 掩码,他形容这像「用视觉方式跟 AI 模型聊天」。在讨论与通用 SAM 基础模型的对比时,他提到通用 SAM 在部分医学分割任务上仍优于针对特定器官的 checkpoint,说明通用基础模型自有其价值,而 nnInteractive 走的是「generalist 加交互修正」路线。演示覆盖脑 MRI 肿瘤、电子显微镜神经元堆叠与昆虫脑 micro-CT:先以自动化 mask 作初始化,再由用户交互修正,借此规避模型失误。
放在上述脉络里看,这一工作的推进在于把「可提示」直接变成了分割模型的操作界面:相比 DeepIGeoS 先自动出结果、再靠两段式 CNN 精修的流程 [1],以及 ITK-SNAP 中交互训练分类器的半自动范式 [3],nnInteractive 让稀疏的 2D 提示即时驱动 3D 分割,且演示横跨 MRI、电镜与 micro-CT 多种模态。这与 BrainSegFounder 在神经影像上验证 3D 基础模型路线的努力 [4] 相呼应,但把重点从少样本适配转到了人在环修正:讲者强调「标准单元 AI 模型」已学到通用表征,少旋钮、泛化好,相当于在 U-Net 系自动化改良 [2] 之外提供另一条路径。讲座还把它与钙成像经典机器学习(#60)并置为「深度学习 vs 经典方法」的对照,并与 ESMFold2(#59)同属计算方法主题。
局限与未解之处也很清楚:演示本身承认模型会失误,交互修正正是为此设计的兜底,但交互成本与修正质量如何系统评估、在更广的临床与科研流程中能否保持这种即时性,讲座并未给出定量结论;深度学习与经典方法孰优的问题,也仍处在被反复对照的开放状态。
- 1.DeepIGeoS: A Deep Interactive Geodesic Framework for Medical Image Segmentation · IEEE Trans Pattern Anal Mach Intell 2019
- 2.MultiResUNet : Rethinking the U-Net architecture for multimodal biomedical image segmentation · Neural Netw 2020
- 3.User-Guided Segmentation of Multi-modality Medical Imaging Datasets with ITK-SNAP · Neuroinformatics 2019
- 4.BrainSegFounder: Towards 3D foundation models for neuroimage segmentation · Med Image Anal 2024
- 5.KiU-Net: Overcomplete Convolutional Architectures for Biomedical Image and Volumetric Segmentation · IEEE Trans Med Imaging 2022
nnInteractive 创作者本人对比与 SAM 在器官特定任务上的取舍,并演示肿瘤 MRI、电镜与 micro-CT 应用。
来源:专家解读(YouTube) · youtube.com