MAGIC:评估生成式AI在全球健康领域应用的国际网络
MAGIC: an international network for evaluating generative artificial intelligence in global health
Nature Medicine于2026年10月6日发表MAGIC国际网络的介绍文章,聚焦生成式AI在全球健康中的评估。文章作者来自杜克-新加坡医学院、康奈尔、东京大学、清华大学、斯坦福、哈佛、MIT、WHO、ITU等机构,覆盖十余国,DOI为10.1038/s41591-026-04706-x。
近两年,大语言模型在医疗领域的能力快速提升——临床语言模型 GatorTron 已在超过 900 亿词料上完成训练 [2],Med-PaLM 2 在 MedQA 数据集上达到 86.5% 的正确率 [6],通用模型 ChatGPT 也在多种临床场景中展现潜力 [1]。与此同时,模型的脆弱性也日益暴露:商业大模型在八种临床情景中反复复述基于种族的错误医学观念 [3],提示仅有考试分数远不足以衡量临床可用性。为补齐评估环节,研究者已构建多种框架,例如涵盖五类临床任务、22 个子类别、121 项具体任务和 37 项评测的 MedHELM [4],以及关注人评质量的 QUEST 框架 [5];OpenAI 发布的 HealthBench 包含 5000 段多轮合成临床对话,据报道于 2025 年 5 月上线 [7][8]。
正是在评估需求迅速扩张、但标准仍显分散的背景下,MAGIC 网络应运而生——这是一个面向生成式人工智能在医疗健康领域评估的国际合作,由新加坡杜克—新加坡医学研究院等多机构共同牵头,作者覆盖亚、非、欧、北美、南美数十国研究者,既包括加纳、乌干达、巴基斯坦、越南等中低收入国家机构,也涵盖 WHO、国际电信联盟等国际组织代表。据其官网描述,MAGIC 旨在建立具有全球代表性的基准和统一的报告标准 [9]。
相较于主要由斯坦福等机构开发的 MedHELM [4] 和由 OpenAI 主导的 HealthBench [7][8],MAGIC 把"全球代表性"明确写入网络目标——把评估场景从单中心、单一语言环境推进到跨地域、跨收入水平的多样化人群。这一布局有望缓解现有基准难以直接互比的状况,为监管者与临床机构的跨模型、跨地区比较提供更一致的参照。
不过,新论文材料中并未给出 MAGIC 将覆盖哪些具体任务、采用何种评分机制或时间表,其与 MedHELM、HealthBench 等既有基准将如何分工或互通也尚不清晰;如何在数据稀缺、隐私约束严苛的中低收入国家真正落地"全球代表性"评估,仍是网络后续需要回答的核心问题。
- 1.Large language models in medicine · Nat Med 2023
- 2.A large language model for electronic health records · NPJ Digit Med 2022
- 3.Large language models propagate race-based medicine · NPJ Digit Med 2023
- 4.Holistic evaluation of large language models for medical tasks with MedHELM · Nat Med 2026
- 5.A framework for human evaluation of large language models in healthcare derived from literature review · NPJ Digit Med 2024
- 6.Toward expert-level medical question answering with large language models · Nat Med 2025
- 7.HealthBench: Advancing AI evaluation in healthcare, but not ... · pmc.ncbi.nlm.nih.gov 2026
- 8.OpenAI releases HealthBench to evaluate AI in healthcare · fiercehealthcare.com 2026
- 9.MAGIC | Global Evaluation for Generative AI in Health Care · magic-ai.health 2026
原文汇总了来自十余国数十家机构的作者名单,覆盖高校、医院与WHO、ITU等国际组织,为评估生成式AI在医疗健康中应用的合作框架提供索引。
来源:Nature Medicine · nature.com