热点事件持续更新
OpenMTB-Audit基准揭示LLM过度拒答问题
1 篇报道1 个报道来源2 小时前更新
先了解这件事
事件综述
2026年10月3日报道,OpenMTB-Audit基准针对分子肿瘤委员会(MTB)安全分类场景,对8种LLM配置进行了系统测试。测试结果显示,模型存在严重的过度拒答问题:在真实标注为"部分支持"的病例中,83.3%至100%的案例被模型错误地归入放弃/拒答标签,未能给出具有临床参考价值的分类。报告指出,模型获得的高安全评分并非源于真正的临床校准能力,而是源于"标签坍缩"——即模型倾向于系统性回避输出,而非在保守前提下提供准确的临床判断,揭示了当前LLM在该高风险医疗场景中的安全性评估存在失真。
由模型根据报道生成 · 2 小时前更新
最新进展10月3日 19:53
8种LLM在MTB分类中普遍过度拒答,83.3%–100%部分支持病例被错标,高安全分实为标签坍缩。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- AI × 生物医药(arXiv / AIHOT)OpenMTB-Audit:基于LLM的分子肿瘤委员会安全评估基准,揭示过度拒答与临床专家分歧
OpenMTB-Audit 基准测试 8 种 LLM 配置在分子肿瘤委员会安全分类中发现普遍过度拒答:83.3%–100% 的真实"部分支持"病例被错误放弃标签,模型高安全分源于标签坍缩而非临床校准。
本事件热度走势
当前热度 9·可比范围峰值 10(10月3日 20:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。