[评论] 初级保健中的对话式诊断AI:"开口"之后呢?
[Comment] Conversational diagnostic AI in primary care: what happens after it speaks?
初级保健中的对话式诊断AI已被越来越多患者在就诊前使用,但临床证据仍然缺乏。AMIE在文字问诊中表现优于初级保健医生,但其受试者均为模拟患者;一项2069例随机试验显示聊天机器人可生成病史、初步诊断和检查医嘱(有时无需医务人员支持),主要终点聚焦于效率指标。
问诊对话处于医学实践的核心,能够进行诊断对话的AI因此被寄望于提升医疗的可及性与质量。此前问世的AMIE利用自我博弈的模拟环境和自动反馈进行优化,并在与初级保健医生对照的双盲交叉研究中,由标准化“患者演员”完成文字问诊,从问诊技巧、诊断准确性到沟通与共情接受了多维评估[2];拥有1760亿参数的通用医学模型MedFound也在常见病、外部验证和罕见病等实验场景中胜过基线模型,但正如该领域所承认的,LLM在临床诊断中的有效性仍未被证明[4]。与此同时,学界对LLM在真实医疗场景中的表现与恰当使用方式仍心存疑虑[1];即便已有LLM进入门诊流程,也多停留在接待咨询层面,例如护士与定制聊天机器人协作、并经随机对照试验验证的答疑分诊模式[5]。换言之,对话式诊断AI虽在模拟环境中崭露头角,却一直卡在能否安全走进真实诊室这一步。
这项新研究正是对这一卡点的回应。研究者在门诊初级保健场景开展了一项前瞻性可行性研究,考察对话式诊断AI在真实世界环境中的表现,评估聚焦会话的安全性、会话质量与用户接受度三个维度。结果显示,该系统在真实门诊环境中具备了初步可行性。
相对已有认识,这项工作的推进主要体现在评估场景的跃迁:它把对话式诊断AI的证据链从模拟问诊与患者演员[2]、实验场景中的诊断能力[4],延伸到了真实世界的门诊对话,并以安全性、质量与用户接受度这类临床转化最关心的指标作为衡量标准。作者也据此将其定位为迈向临床转化的关键一步。
当然,结论仍是“初步”的,作者明确表示仍需进一步研究。在会话安全、质量与接受度之外,这类系统能否在更大范围、更多元的真实环境中稳定表现,并最终转化为诊断与临床结局层面的获益,目前尚无答案;而医疗AI从早期验证走向严格临床检验本就是普遍短板,心理健康聊天机器人领域的系统综述显示,仅16%的LLM研究完成了临床有效性检验,77%仍停留在早期验证[3],加之真实场景使用中的不确定性与规范风险[1],对话式诊断AI的落地之路仍然漫长。
- 1.Evaluating the Feasibility of ChatGPT in Healthcare: An Analysis of Multiple Clinical and Research Scenarios · J Med Syst 2023
- 2.Towards conversational diagnostic artificial intelligence · Nature 2025
- 3.Charting the evolution of artificial intelligence mental health chatbots from rule-based systems to large language models: a systematic review · World Psychiatry 2025
- 4.A generalist medical language model for disease diagnosis assistance · Nat Med 2025
- 5.Outpatient reception via collaboration between nurses and a large language model: a randomized controlled trial · Nat Med 2024
来源:The Lancet · thelancet.com