Evo 2 作为分类机器的证据:来自情境学习与机制可解释性的研究
Evo 2 在涵盖生物与人工序列的五项二元分类任务中展现出稳健的情境学习能力,其在较短自然序列上表现优异(miRNA F1=0.902,Toxins F1=0.785),但性能随序列长度增加而下降并在千碱基尺度上崩溃。研究还发现模型缩放并无益处,7B 参数模型系统性地优于 40B 变体。机制可解释性分析揭示了预测与泛化之间的权衡,并表明模型可能追踪提示的结构而非信号承载内容。
Evo 2 在涵盖生物与人工序列的五项二元分类任务中展现出稳健的情境学习能力,其在较短自然序列上表现优异(miRNA F1=0.902,Toxins F1=0.785),但性能随序列长度增加而下降并在千碱基尺度上崩溃。研究还发现模型缩放并无益处,7B 参数模型系统性地优于 40B 变体。机制可解释性分析揭示了预测与泛化之间的权衡,并表明模型可能追踪提示的结构而非信号承载内容。
研究人员开发了用于细胞学的通用基础模型CROWN。该模型旨在支持跨器官、疾病和临床场景的广泛诊断应用,突破了现有AI系统通常仅针对特定任务和样本类型的局限。
AGENT框架结合高通量实验与贝叶斯优化,可快速设计热稳定的固态mRNA疫苗。这些制剂在37°C储存两个月后仍保持完全生物活性,在啮齿类和非人灵长类动物中通过微针贴片引发与新鲜疫苗相当的免疫反应。
一项研究利用数据高效的 AI 方法加速了热稳定 mRNA–脂质纳米颗粒疫苗的发现。该方法通过优化配方,提高了疫苗在高温下的稳定性,有望解决 mRNA 疫苗储存和运输中的冷链依赖难题。这项工作为开发更易分发的疫苗提供了新策略。
研究通过分子对接从 59,319 条四肽中筛选得到靶向 ML-IAP 的 peptide-1,其 Kd 值低于 Smac 肽且具最优结合特征。
研究人员开发了深度学习框架 CMAC,用于估计心肌细胞的绝对转录成熟年龄。该模型整合了18个小鼠单细胞RNA测序数据集,在独立验证队列中对98,163个心肌细胞的预测误差仅为0.33天,并成功量化了PGC1{beta}双敲除模型中4.77至8.60天的成熟延迟。CMAC为量化心肌细胞发育偏离正常轨迹提供了统一工具。
本期《新英格兰医学杂志》就人工智能在先天性巨结肠检测领域的应用发表了进一步评论。该评论围绕相关技术进展展开讨论,内容发表于第395卷第12期第1248页。
基于 482 名患者的 5390 万条 EHR 访问日志构建的新型团队内外信息共享测量指标,能显著预测未来急诊就诊和经急诊入院的住院情况。这一通过 EHR 进行的、可修改的团队信息共享维度,可减少急性护理利用率。研究获得了加州大学戴维斯分校 IRB 的批准(#1988738)。
一项研究显示,AI设计的IL-21模拟物可通过CD4 T细胞将KRAS抑制剂的短暂响应转化为胰腺癌的持久缓解,且该过程不依赖CD8 T细胞和肿瘤MHC I类表达。
推荐理由:该研究通过AI设计的IL-21模拟物,揭示了CD4 T细胞在胰腺癌中对KRAS抑制剂疗效的转化作用,为克服耐药提供了新视角。
研究团队利用基因组基础模型 Evo2 对软组织肉瘤患者的肿瘤基因组变异序列进行嵌入,生成患者水平的基因组表征。在包含102名患者的队列中,将Evo2特征加入临床病理模型SARCULATOR后,总体生存(OS)的C-index从0.620提升至0.770,无进展生存(PFS)从0.625提升至0.755。
推荐理由:研究将基因组基础模型与临床病理和转录组模型结合,在多个生存终点上展示了预后预测能力的提升。
Ataraxis Breast CTX多模态AI模型整合临床变量和H&E图像特征,在III期UNIRAD试验(NCT01805271)的556名患者队列中进行前瞻性-回顾性验证。
推荐理由:该研究在已完成的III期试验队列中验证了AI模型对辅助治疗决策的潜在指导价值,为高风险患者分层提供了具体数据。
Zheng 等人开发了用于细胞病理学的通用视觉基础模型 CROWN。该模型在涵盖淋巴结转移和宫颈癌筛查等队列的超过 200 项真实世界细胞学任务上进行了基准测试。CROWN 展示了其在计算细胞病理学领域的广泛应用潜力。
研究者开发了一种基于大语言模型的方法,构建了包含超过5万名患者的泛癌种毒性资源 MSK-Tox。分析六种代表性不良事件发现,毒性模式受癌症类型、治疗方案和临床背景影响。研究识别了两种胚系易感性模式:器官固有模式(如 FOXE1 附近调控变异与甲状腺功能减退相关)和免疫介导模式(HLA-DRB1*15 是免疫检查点抑制剂治疗患者肾上腺功能不全的主要决定因素)。
推荐理由:研究识别了两种胚系易感性模式,包括与免疫检查点抑制剂相关的 HLA-DRB1*15 等位基因,为治疗前毒性风险预测提供了新维度。
研究开发并评估了一个完全本地部署的临床AI代理,该系统结合本地操作控制与多视角可靠性框架来支持选择性自主决策。在MIMIC-IV衍生的两个基准测试中,代理在七疾病任务上达到90.04%准确率,在四疾病任务上达到83.8%准确率。诊断行为一致性对正确性的区分能力最强(AUC=0.860),在一致性阈值0.90时,49.4%的病例以98.9%的诊断准确率被保留用于自主处理。
推荐理由:该研究为临床AI代理提供了本地部署和决策时可靠性评估的实用框架,有助于识别可安全自主处理的病例。
研究者开发了基于大语言模型的临床助手MoChiAgent,整合电子健康记录数据预测母婴疾病。核心预测引擎MoChiFormer在4,401,599次纵向临床就诊中开发,并在外部队列验证。
推荐理由:该研究在超过460万次临床就诊数据上开发并验证了AI模型,提供了胎盘早剥、胎膜早破和早产等关键妊娠结局的AUROC具体数值。
研究团队结合天然蛋白结构域与AI设计的合成蛋白组装体,构建了100多种不同大小和形状的RNA递送载体,其RNA递送效率比常用载体高几个数量级。通过计算设计的肽结合物可编程载体趋向性,在多种细胞模型中递送治疗性RNA。在小鼠体内显示近单细胞分辨率的生物分布并确认安全性,在患者来源细胞和猪模型中成功应用于杜氏肌营养不良的基因编辑治疗策略。
推荐理由:通过AI设计合成蛋白组装体构建了100多种非病毒RNA递送载体,在小鼠和猪模型中验证了安全性和基因编辑治疗效果。
GPN-Star 是一种基于系统发育感知架构的基因组预训练网络,利用全基因组比对和物种树显式建模进化关系。该模型在人类基因组编码和非编码区的多种变异效应预测任务中达到最优性能,能更好优先识别致病性和精细定位的GWAS变异,并提升罕见变异关联检验的效能。研究还展示了该框架在五种模式生物中的可推广性。
推荐理由:该模型整合了物种树和全基因组比对,在编码和非编码区变异效应预测中优于传统进化模型和现有基因组语言模型。
一项研究发现,人工智能模型可通过分析血液代谢组学特征识别早期卵巢癌。该模型在两个独立回顾性队列(血清队列 N=91,血浆队列 N=83)中分别实现了高达 99.0% 的敏感性和 99.8% 的特异性。研究识别出 239 个一致的代谢物变化,表明存在一种涉及肿瘤与宿主的分布式代谢反应系统型,支持进一步开发基于代谢组学的卵巢癌早期检测方法。
I3LUNG(NCT05537922)是迄今最大国际真实世界多模态AI研究,纳入2396例非小细胞肺癌患者。机器学习与深度学习仅用临床血液数据模型在测试集AUC最高达0.77,外部验证AUC为0.55-0.72;AI模型显著优于PD-L1、ECOG PS等传统指标。
推荐理由:研究比较了仅用临床血液数据和加入影像病理的多模态模型,为AI工具在真实世界肺癌免疫治疗选择中的实际增益提供了参照。
国际医疗数字孪生联盟成立,旨在推进医疗数字孪生技术作为精准健康的新基础设施。该联盟汇集了来自澳门科技大学、广州国家实验室、清华大学、北京大学、牛津大学、哈佛医学院、斯坦福大学等机构的众多研究人员。
Luo 等人整合五种预训练病理基础模型形成集成学习方法,提升了肿瘤分型、生物标志物识别和治疗反应预测的准确性。该方法通过利用模型间的互补信息生成玻片级表征,展现了集成与多模态方法在计算病理学中的潜力。
ELF 集成五种预训练病理基础模型,在 53,699 张全切片图像上训练,生成统一的切片级表征。该方法在疾病分类、生物标志物检测以及抗癌和免疫治疗反应预测任务中,性能优于单个组成模型和现有切片级基础模型。
推荐理由:该方法整合多个预训练模型以提升病理图像分析性能,可在数据有限场景下支持治疗反应预测。
Luo 等人开发了 ELF 框架,集成五种病理基础模型从全切片图像生成统一表征。基于 20 个解剖部位的近 54,000 张切片训练,ELF 在疾病分类、生物标志物检测以及化疗、靶向治疗和免疫治疗反应预测方面优于单个基础模型。
Luo等人开发了一种集成方法,将五个预训练病理学基础模型整合为玻片级表征以利用其互补信息。该方法在肿瘤分型、生物标志物和治疗反应预测方面均取得提升。该研究展现了集成与多模态方法在计算病理学中的潜力。
UniCure 多模态基础模型能够预测不同细胞背景下药物诱导的转录组反应。该模型通过整合癌细胞系数据与患者来源模型,实现了个性化药物优先级排序和患者分层。其预测的治疗排序在真实世界队列中与临床生存结局显著相关。
一种受视网膜启发的光子计算系统利用随机网络激光器中空间竞争的激光模式作为异质性抑制耦合的神经元,实现了特征检测、少样本分类和分割任务。该系统在仅有数百张训练图像的少样本和类别不平衡场景下,于MNIST、Fashion-MNIST和BreakHis癌症诊断数据集上分别达到98.05%、87.85%和90.12%的准确率,优于EfficientNetV2和ViT等软件卷积神经网络。
研究人员通过AI从头设计出名为Rhobins的通用罗丹明结合剂,具备高亮度、可逆结合和极高稳定性。Rhobins在活细胞/固定细胞、超分辨和单分子成像中性能超越现有标签,并能在75°C下实现对极端微生物的成像。
COMPASS泛癌基础模型可利用批量转录组数据预测免疫疗法应答。该模型采用概念瓶颈架构,通过人类可读的概念处理转录组输入,从而预测免疫疗法结局。COMPASS显著改善了结局预测,并提供了生物学见解。
Hyeon等人整合蛋白质结构与人群规模的癌症基因组数据,分析了173个癌症相关基因中的显著突变区域。这些区域与功能结构域、三维结构约束及基因特异性生物学特征相吻合。该研究为癌症基因突变模式的分类及优先筛选临床意义不明的罕见变异提供了框架。
ULTRA平台将三维组织学分析时间从数天或数小时缩短至30分钟内,实现了术中神经胶质瘤浸润深度的测绘。该技术结合了快速组织透明化与无监督人工智能,利用受激拉曼散射显微镜的化学特异性。平台可术中可视化神经胶质瘤结构及其深度依赖的肿瘤浸润边界。