PRISM2:230万张切片教AI说诊断语言 — Nature Medicine发表病理基础模型,免训练比肩FDA获批产品
计算病理基础模型多停留在图像块编码,切片级临床落地难。Paige/Tempus 联合微软研究院在 Nature Medicine 发表 PRISM2:用 230 万张全切片图像与 68.5 万份病理报告生成的 1400 万问答对做临床对话监督,让组织形态学对齐诊断推理。仅靠提示推理即在前列腺癌、乳腺癌与乳腺淋巴结转移检测上达到或超过 FDA 获批临床级产品;结直肠癌无复发生存预测 C-index 达 0.809。
核心要点
- 问题:病理诊断的高价值判断发生在"病例级",但现有病理基础模型只擅长编码微小图像块,每换一个任务就要重新训练一个聚合器,临床产品化成本极高。
- 方法:PRISM2 把 68.5 万份真实病理报告拆解成 1400 万个"临床对话"问答对,用语言监督把组织形态学与诊断推理对齐,产出可提示推理、可迁移复用的切片级表征。
- 结果:仅用提示推理(不做任何下游训练),前列腺癌、乳腺癌、乳腺淋巴结转移检测的平衡准确率达到或超过已获 FDA 授权的临床级产品(P < 0.05);结直肠癌无复发生存预测 C-index 0.809,优于同数据从零训练的专用模型 0.773。
- 意义:首次给出证据——一个通用病理基础模型无需额外训练即可达到临床授权专用模型的水平,意味着病理 AI 产品的开发范式可能从"一病一模型"转向"一模型多提示"。
- 原文:End-to-end multimodal pathology foundation model with clinical dialogue,Nature Medicine,2026-07-31 | DOI: 10.1038/s41591-026-04521-4 | PMID: 42538427
计算病理学的"切片级鸿沟"
一张常规苏木精-伊红染色(Hematoxylin and Eosin, H&E)切片扫描成数字图像后,动辄是十亿像素级的千兆图(gigapixel image)。病理医生看它靠的是"先扫全场、再抓重点、最后落成一段诊断结论",而过去两年风头最劲的病理基础模型——Virchow2、UNI2、H-Optimus-1——学会的其实只是"看清一小块组织"(图像块,tile/patch)。
问题就出在这里:真正有临床价值的判断几乎都发生在全切片图像(Whole-Slide Image, WSI)乃至病例(case)层面,需要把成千上万个图像块的信息聚合起来。当前主流做法是对每个任务单独训练一个弱监督聚合器(weakly-supervised aggregator)——检测前列腺癌训一个,判断乳腺淋巴结转移再训一个。这条路的代价是:每上一个新适应证,就要重做一轮数据整理、标注与调参,且样本一少就过拟合、换个机构就掉点。
正如我们此前分析的 NeuroVFM 用医院真实数据训练脑影像基础模型,医疗 AI 正在集体寻找同一个答案:监督信号从哪来,才能既便宜又贴近临床? PRISM2 给出的答案是——从医生每天都在写的病理报告里来。
PRISM2 的核心创新
PRISM2 由 Paige AI(现已并入 Tempus AI)联合微软研究院(Microsoft Research)与纪念斯隆-凯特琳癌症中心(Memorial Sloan Kettering Cancer Center, MSK)共同完成,Kristen Severson 与 Siqi Liu 为共同通讯作者,论文发表于 Nature Medicine(2026 年 7 月 31 日在线)。其创新集中在三点:
-
把病理报告"原子化"成临床对话:研究团队用 GPT-4o 将 685,507 份真实临床报告拆解为五类任务——报告生成、是非问答、开放问答、多选问答、图文匹配,共 1400 万个问答对。这一步的巧妙之处在于:报告本来就是医生诊断推理的自然语言产物,把它拆成对话,等于免费获得了海量、语义丰富且临床落地的监督信号,无需人工重新标注。
-
双嵌入架构(dual-embedding):这是 PRISM2 与前作 PRISM 及竞品 TITAN 最本质的区别。模型同时产出两种表征——轻量的**基础嵌入(base embedding)负责向生物标志物预测、生存分析等新任务迁移;从 38 亿参数语言模型隐状态中抽取的诊断嵌入(diagnostic embedding)**则专为癌症检测与分型这类临床任务调优。一套模型,两种性格。
-
提示推理即临床级性能:论文明确表示,PRISM2 训练成"会对话"并非为了做聊天机器人,单轮对话只是拿来当监督信号用。但结果是意外的——仅凭一句提示(prompt),不做任何下游微调,模型在癌症检测上就追平甚至超过了已获监管授权的商业产品。据作者所述,这是首次有证据表明通用病理模型可以免训练达到临床授权专用模型的水平。
技术原理:让千兆像素切片"学会用诊断语言自我压缩"
PRISM2 总参数量约 46 亿,整条链路可以这样理解:
第一步,看细节。 切片先由 Virchow2 编码成大量图像块嵌入(tile embeddings),分辨率固定在 0.5 μm/px(约 20 倍镜)。
第二步,做压缩。 切片编码器采用 Perceiver 架构(5.41 亿参数,1 个交叉注意力块 + 6 层自注意力,256 个潜查询 latent queries),把成千上万个图像块压缩进 256 个潜向量,输出"基础嵌入"。这一步的关键难题是——用什么监督信号,才能让压缩既紧凑又不丢下游任务需要的信息?
第三步,对齐语言。 一路通过 BioGPT 文本编码器做对比学习(contrastive learning),把切片表征与报告文本拉到同一语义空间;另一路把 256 个潜向量经两层 MLP 适配器(2900 万参数,LLaVA 风格)投射进 Phi-3 Mini(38 亿参数解码器)的输入空间,让语言模型"看着切片回答问题"。取助手回答位的最终隐状态,就是"诊断嵌入"。
这套设计的直觉很朴素:**病理学不只是视觉学科,更是一门语言学科。**医生看到的形态学特征,最终都要落成"腺体结构紊乱"“可见微浸润灶"这类诊断措辞。让模型在压缩图像时被迫去预测这些措辞,压缩结果自然就带上了诊断意义,而不是一堆纯视觉纹理统计量。全部训练在 56 张 A100 40GB 上以 bf16 完成。
数据说话:免训练追平 FDA 获批产品
先看训练规模——这是迄今最大的多模态切片级病理数据集:
| 维度 | PRISM2 规模 | 主要对比模型 |
|---|---|---|
| 全切片图像(WSI) | 2,350,518 张 | TITAN 约 33.6 万张;Prov-GigaPath 约 17 万张 |
| 临床报告 | 685,507 份 | TITAN 报告 + 42.3 万条合成描述 |
| 患者数 | 200,692 人 | — |
| 问答对 | 14,000,000 个 | 无同类监督 |
| 模型总参数 | 约 46 亿(含 Phi-3 Mini 38 亿) | TITAN / COBRA 显著更小 |
再看临床性能。最有分量的对照不是学术基线,而是三款已上市/获授权的商业产品:
| 任务 | 商业对照产品 | 监管状态 | PRISM2(仅提示推理) |
|---|---|---|---|
| 前列腺癌检测 | Paige Prostate | FDA De Novo 获批 | 平衡准确率达到同等水平(P < 0.05) |
| 乳腺癌检测 | Paige Breast | CE-IVD / UKCA 认证 | 平衡准确率达到同等水平(P < 0.05) |
| 乳腺淋巴结转移 | Paige BLN | FDA 突破性设备认定 | 超过对照产品,无需任何额外训练 |
需要强调:这三项 PRISM2 没有针对性训练过,只是被问了一句是非题。而对照产品是经过专门数据整理、专门校准、专门送审的临床级软件。
嵌入迁移能力则通过线性探测(linear probing)评估:
| 基准 | 指标 | PRISM2 | 最佳竞品 |
|---|---|---|---|
| MSK 生物标志物预测(多任务均值) | AUC | 0.846 | COBRA 0.854 |
| TCGA 生物标志物预测(多任务均值) | AUC | 0.781 | TITAN 0.784 |
| MSK 结直肠癌无复发生存 | C-index | 0.809(生存嵌入微调后) | 同数据从零训练专用模型 0.773 |
作者对整体表现的统计学结论是克制且严谨的:在全面的诊断、生物标志物与生存基准上,PRISM2 嵌入从未在统计上低于既往基础模型(P < 0.05)。换言之,它的价值不在于某一项刷榜,而在于没有短板 + 免训练可用这两件事同时成立。
从实验室到临床:应用前景与局限
应用前景:
- 病理 AI 产品开发提速:过去每个适应证要走一遍"数据整理—训练聚合器—校准—送审”,PRISM2 提示推理即可达临床级,意味着新适应证的原型验证成本可能从数月压缩到数天。这对国内病理 AI 厂商的管线布局影响直接。
- 罕见病种与小样本场景:弱监督聚合器最怕样本少,而基础模型的迁移能力恰好在小样本区间优势最大,罕见肿瘤亚型的辅助判读有望受益。
- 精准肿瘤学的预后分层:结直肠癌无复发生存 C-index 0.809 已具备研究级实用性,可支撑术后复发风险分层与临床试验入组富集。
- 开放权重可复现:PRISM2 模型权重已在 Hugging Face 公开(非商用/非临床用途),科研机构可直接复现与二次开发,这一点对国内课题组的价值不亚于论文本身。
当前局限(作者自陈,必须正视):
- 缺少位置编码:Perceiver 交叉注意力未引入空间位置信息,CAMELYON17 结果提示模型可能是靠局部形态"猜"出 N 分期,空间推理能力偏弱。
- 单一放大倍率:仅使用 0.5 μm/px,未做混合倍率输入,对核分裂计数这类需要跨尺度上下文的任务构成硬约束。
- 扫描中心偏倚:Virchow2 与 PRISM2 均只在 MSK 扫描的切片上训练,跨扫描仪、跨机构的鲁棒性尚待独立验证——这恰恰是病理 AI 落地最容易翻车的地方。
- 训练数据存在噪声:互补是非问答的误标率达 18%,说明 GPT-4o 自动生成的监督信号并非无损。
- 生物标志物提升有限:相较基线优势较小,作者认为需要在预训练阶段直接引入生物标志物与生存目标。
结论与产业启示
PRISM2 最重要的贡献,不是又刷高了几个点,而是验证了一条新的监督范式:医院里每天堆积的病理报告,本身就是最廉价、最贴近临床推理的监督信号。把它们拆成对话喂给模型,就能让千兆像素切片的压缩过程"带着诊断意图",从而让一个通用模型免训练地追平专用产品。
这与我们此前报道的 COMPASS 泛癌基础模型 形成有趣呼应——前者用多组学做通用表征,后者用诊断语言做通用表征,殊途同归地指向"少训练、多复用"。而与 MIRA 在电子病历沙盒内自主完成诊疗流程 相比,PRISM2 走的是另一条务实路线:不追求自主决策,而是把最重的感知环节做成可复用底座。
对产业界的启示很清楚:病理 AI 的竞争壁垒正在从"模型精度"转向"报告语料规模 + 数据治理质量"。谁手上有结构化、可追溯、跨机构的病理报告库,谁就掌握了下一代病理基础模型的燃料。
这正是思陌智能科研服务在 AI 医疗软件开发与医疗 AI 科研服务中重点投入的方向——从医疗数据治理(报告结构化、术语标准化、去标识化)、基础模型微调,到院内私有化部署与合规落地,我们为医院病理科、科研团队与医疗器械企业提供从课题设计到工程交付的一体化支持,帮助机构把沉睡的历史报告转化为可训练、可复用的科研资产。
相关问题
Q:PRISM2 能直接拿到医院当诊断软件用吗? A:不能。论文明确其定位是研究用基础模型,公开权重也限定非商用、非临床用途。它证明的是"通用模型可以达到临床级性能",但真正上临床仍需完成注册检验、临床试验与监管审批全流程。
Q:它会取代病理医生吗? A:短期内不会。PRISM2 强在感知与初筛(癌/非癌判断、转移检出),弱在空间推理与跨尺度任务;且训练数据存在 18% 级别的标签噪声、仅覆盖单一扫描中心。更现实的定位是把病理医生从大量阴性切片的机械筛查中解放出来,让人力集中在疑难病例上。
Q:中国的医院和科研团队能怎么用起来? A:三条路径最现实——一是直接下载开放权重做本地科研复现与下游任务微调;二是借鉴其"报告拆解成问答对"的监督思路,用本院历史病理报告构建中文语料训练本土模型;三是先做数据治理,把非结构化报告标准化,这是所有后续工作的前置条件。
参考文献
- Vorontsov E, Shaikovski G, Casson A, et al. End-to-end multimodal pathology foundation model with clinical dialogue. Nat Med (2026). DOI: 10.1038/s41591-026-04521-4 | PMID: 42538427
- Ding T, Wagner SJ, Song AH, et al. A multimodal whole-slide foundation model for pathology (TITAN). Nat Med (2025). DOI: 10.1038/s41591-025-03982-3 | PMID: 41193692
- Vorontsov E, Bozkurt A, Casson A, et al. A foundation model for clinical-grade computational pathology and rare cancers detection. Nat Med 30, 2924–2935 (2024). DOI: 10.1038/s41591-024-03141-0
本文基于 End-to-end multimodal pathology foundation model with clinical dialogue(Vorontsov E et al., Nature Medicine, 2026)的独立解读,仅供学术交流,不构成临床建议。
📄 论文原文信息
| 论文标题 | End-to-end multimodal pathology foundation model with clinical dialogue |
| 作者 | Eugene Vorontsov, George Shaikovski, Adam Casson, Julian Viret, Eric Zimmermann, Neil Tenenholtz, Yi Kan Wang, Jan H. Bernhard, Ran A. Godrich, Juan A. Retamero, Jinru Shia, Mithat Gonen, Martin R. Weiser, David S. Klimstra, Razik Yousfi, Nicolò Fusi, Thomas J. Fuchs, Kristen Severson, Siqi Liu |
| 期刊 | Nature Medicine |
| 发表时间 | 2026-07-31 |
| DOI | 10.1038/s41591-026-04521-4 |
| PubMed | PMID: 42538427 |