跳到正文
原文
medRxiv Oncology· Xu, Z., Zeng, J., Zhou, S., Zhang, Z., Heintz, T., Tonneau, M., Yaghoubi, A., Ye, B., Goddla, V., Lehmann, L., Chen, Y.-H., Kozono, D., Revette, A., Maues, J., Brown, T., Catalano, P., Mak, R. H., Dligach, D., Bitterman, D. ·· 15 天前精选评分42

验证用于患者沟通自动化监督的LLM评审员

Validating LLM judges for automated oversight of patient communication

导读

研究验证了大型语言模型作为评审员在临床试验知情同意这一场景下自动化监督患者沟通的能力。在ICON-Bench基准测试中,19个LLM评审员在安全筛查和事实核查方面与临床医生评分高度一致(Spearman ρ > 0.80),但在沟通质量评估上一致性较弱(ρ < 0.60)。患者权益倡导者对沟通质量的评分低于临床医生和LLM评审员,表明需根据以患者为中心的标准对LLM进行重新校准。

来源:medRxiv Oncology · medrxiv.org