跳到正文
原文
AI × 生物医药(arXiv / AIHOT)· arXiv · cs.AI·· 3 小时前评分44

OpenMTB-Audit:基于LLM的分子肿瘤委员会安全评估基准,揭示过度拒答与临床专家分歧

OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation

导读

OpenMTB-Audit 基准测试 8 种 LLM 配置在分子肿瘤委员会安全分类中发现普遍过度拒答:83.3%–100% 的真实"部分支持"病例被错误放弃标签,模型高安全分源于标签坍缩而非临床校准。

来源:AI × 生物医药(arXiv / AIHOT) · arxiv.org

CBACBA Frontier Insights (CFI)美国华人生物医药科技协会(CBA)www.cba-usa.org