跳到正文
原文
Nature Medicine· Andrew Sellergren·· 13 小时前精选评分60

MedGemma:面向多种医学任务的开源视觉-语言基础模型

An open vision-language model for diverse medical applications

导读

MedGemma 在多模态医学影像与文本理解任务上的表现超过同规模生成模型,同时保留 Gemma 3 基础模型的通用能力。该研究以论文形式发表于 Nature Medicine,DOI 10.1038/s41591-026-04626-w。

深度解读

近年来,面向医学场景的人工智能基础模型发展迅速。研究者提出"通才型医学AI"(GMAI)的范式,期望通过大规模自监督训练获得能灵活解释多种模态、产出多样化输出的通用模型[1]。在此方向上已有若干关键进展:在文本侧,Med-PaLM 及其后续版本在医学问答基准上持续提升,并在多个临床维度上获得临床医生偏好[2,6];在影像侧,RETFound 利用大规模无标注视网膜图像自监督学习,为多种眼病和系统性疾病检测提供可迁移的表征[3];Segment Anything Model 也被尝试用于多种医学影像分割任务[4];在报告生成领域,临床医生与视觉-语言模型的协作进一步提示了实际部署的可行性[7]。然而,既有通用视觉-语言医学模型多以闭源、重量级形态发布,开放且轻量的方案有限[5];同时不少模型仍聚焦于单一任务或单一模态,跨任务、跨模态的通用性仍是难点[3,4]。

在这项发表于 Nature Medicine 的工作中,研究者推出了 MedGemma,这是一系列基于 Gemma 3 构建的医学视觉-语言基础模型,旨在覆盖图像与文本的医学理解与推理,并在多种医学影像任务上进行评估[8]。据报道,在分布外任务中,MedGemma 在医学影像问答上取得 2.6%–10% 的提升,在胸片发现分类上取得 15.5%–18.1% 的提升,在智能体评估中取得 10.8% 的提升[9];摘要指出其整体性能优于同规模的生成式模型,同时保留了 Gemma 基础模型的通用能力,且以开源形式发布以便研究者和开发者使用[10]。

这一进展将开源轻量的视觉-语言基础模型推到了与既有专有模型可比较的性能区间。与此前多聚焦于单一影像模态或单一任务的基础模型相比[3,4],MedGemma 在文本与图像之间建立了统一接口并跨多种影像域加以评估,在保留通用能力的同时提供医学专精版本[8]。它延续了 BiomedGPT 等方案在开放性上的努力[5],并将适用范围拓展到了多模态推理和更广泛的影像任务。

尽管如此,MedGemma 的临床效用仍需在真实工作流中进一步验证,在少见病、不同人群间的公平性以及与现有临床决策系统的整合方式等问题尚待回答;分布外场景下的稳健性以及生成内容的可解释性,也仍是医学基础模型走向部署前必须审慎评估的环节。

推荐理由

原文介绍了 MedGemma 这一基于 Gemma 3 的开源医学视觉-语言基础模型,并给出其在多模态医学影像任务上对同规模生成模型的性能对比,读者可直接基于其权重做下游微调。

来源:Nature Medicine · nature.com

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org