AI × 生物医药(arXiv / AIHOT)· arXiv · cs.AI·· 3 小时前评分44
OpenMTB-Audit:基于LLM的分子肿瘤委员会安全评估基准,揭示过度拒答与临床专家分歧
OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation
导读
OpenMTB-Audit 基准测试 8 种 LLM 配置在分子肿瘤委员会安全分类中发现普遍过度拒答:83.3%–100% 的真实"部分支持"病例被错误放弃标签,模型高安全分源于标签坍缩而非临床校准。
来源:AI × 生物医药(arXiv / AIHOT) · arxiv.org