← 行业趋势

MerMED-FM:单一视觉基础模型跨七种医学影像接近专科级诊断表现

医学影像AI长期被分割为单模态单病种模型,部署与维护成本高。新加坡团队在《柳叶刀·数字健康》发表MerMED-FM:用约332万张无标注图像预训练一个跨七模态的视觉基础模型,仅10%标注即可在OCT、CT、病理等任务达到或接近专科模型水平。

核心要点

  • 问题:医学影像AI长期按单一模态、单一病种开发,医院需为各科室分别部署、维护大量碎片化的专用模型,集成与治理成本高。
  • 方法:新加坡团队在《柳叶刀·数字健康》发表MerMED-FM,用自监督学习加记忆模块,在约332万张无标注图像(12专科、7模态)上预训练一个共享视觉基础模型,并在31个数据集上微调验证。
  • 结果:仅用10%标注时,整体平均AUROC达0.854,在OCT(0.962)、病理(0.908)、CT(0.906)等任务上达到或接近专科模型水平。
  • 意义:证明一个通用视觉骨干可作多专科任务的共同起点,但仍是研究型基础模型,距临床落地尚需本地验证与前瞻性评估。
  • 原文MerMED-FM: Multimodal, Multi-Disease Medical Imaging Foundation Model,The Lancet Digital Health,2026年7月(PMID: 42509078

MerMED-FM跨七种医学影像模态的通用视觉基础模型概念图:一个共享编码器同时映射胸片、CT、超声、病理、眼底、OCT与皮肤影像到同一表征空间,仅作概念视觉

一、医学影像AI的「单科碎片化」困局

医院里的医学影像AI,大多是一个模型只认一种设备、只看一种病。看肺片的模型管不了肝脏,读眼底的模型不懂病理切片,超声和CT又各有各的编码器、训练数据与部署环境。当一家医院要同时支撑放射、病理、眼科、皮肤科的智能化,就要并行维护一整套彼此独立、版本各异的算法。这种单科碎片化推高了接口、算力与质量管理的综合成本,也成为医学影像AI规模化落地的现实阻力。对缺少专科医生与标注资源的基层机构,问题更突出:与其逐个训模型,不如有一个能跨模态复用的通用底座。这正是MerMED-FM试图回答的问题——一个纯视觉编码器,能否同时学会胸片、CT、超声、病理、眼底、OCT与皮肤影像,并在多个专科任务上保持有竞争力?

二、MerMED-FM的核心创新

过去的多模态医学影像模型,要么依赖图文配对(需要影像报告文本),要么把不同模态数据直接混合训练,结果准确性参差不齐,且常被数据量大的模态主导。MerMED-FM的三点改变来自《柳叶刀·数字健康》发表、由新加坡A*STAR、新加坡国家眼科中心等机构完成的研究(Yang Zhou与Chrystie Wan Ning Quek为共同第一作者,Yong Liu与Daniel Shu Wei Ting为共同通讯作者)。

其一,它放弃文本依赖,改用纯视觉自监督学习:每张图像生成多组增强视图,分别送入学生与教师编码器,二者需对同一图像的不同视图产出一致表征,从而学到不依赖裁剪、颜色和局部扰动的稳定视觉特征。其二,它引入动态记忆模块,保存此前训练样本的紧凑表征,用相似度结构约束当前学习,缓解新模态覆盖旧知识的问题;再配合模态与专科感知的均衡采样,避免病理图像块、胸片等大体量数据主导训练。其三,下游不再从零训练:保留同一学生编码器,为每个任务接一个轻量分类头并微调,使一个预训练骨干成为放射、病理、眼科等多专科任务的共同起点。

三、技术原理:一个视觉编码器如何学会七种影像

可以把MerMED-FM理解为一个先广泛识图、再分科上岗的视觉骨干。输入是七类医学影像的二维图像——胸片、CT切片、超声帧、病理图像块、彩色眼底照、OCT切片与皮肤镜图像。预训练阶段不需要任何疾病标签:模型通过教师—学生框架对同图的不同增强视图对齐表征,并由记忆模块维持跨模态的一致性;模态与专科感知采样保证七类数据被均衡看待。评价时,研究者保留学生编码器,为每个下游疾病任务接一个多层感知机分类头,用相应标注数据微调,最终只在留出测试集上报结果。

需要强调的是,MerMED-FM是基础模型而非即插即用的诊断产品:每个具体任务仍需自己的标注、微调、阈值与模型权重;它提供的是共享初始化,而非一套无需训练就直接出诊断的固定参数。这一设计与我们在PRISM2病理基础模型中讨论的切片级多模态路径形成对照——后者用语言监督对齐形态学与诊断推理,MerMED-FM则用纯视觉机制打通跨模态表征。

MerMED-FM技术流程示意图:七类医学影像经增强视图送入教师—学生编码器,借记忆模块与均衡采样对齐到同一表征空间,再接任务专用分类头微调输出诊断

四、数据说话:跨七种模态的AUROC

研究在53个公开数据集(约332万张无标注图像)上预训练,并在26个公开与5个私有数据集(共31个评价集)上微调与测试,主要结局为按模态汇总的AUROC。下表为10%标注比例下的核心结果,原文未报告P值与置信区间。

影像模态(研究维度) 比较对象 核心结果(10%标注 AUROC) 统计证据
光学相干断层扫描 OCT MerMED-FM vs 专科/通用对照 0.962 未报告P值/CI
病理图像块 MerMED-FM vs UNI等专科模型 0.908 未报告P值/CI
CT MerMED-FM vs DINO/专科模型 0.906 未报告P值/CI
胸片 MerMED-FM vs BiomedCLIP 0.844 未报告P值/CI
皮肤镜 MerMED-FM vs PanDerm等 0.827 未报告P值/CI
超声 MerMED-FM vs BiomedCLIP 0.818 未报告P值/CI
彩色眼底 CFP MerMED-FM vs DINO 0.810 未报告P值/CI
整体平均 MerMED-FM(0.854) vs 通用/多专科/单专科三类对照 0.854 未报告P值/CI

关键读数:在仅10%标注的严苛条件下,MerMED-FM整体平均AUROC为0.854,高于论文所比较的通用视觉模型、多专科图文模型与单专科基础模型组合三类对照;分模态看,OCT(0.962)、病理(0.908)、CT(0.906)表现最强。但论文也明确承认,它并未在所有模态与数据集上稳定超过对应专科模型——在胸片、超声与部分皮肤任务上,单项最佳仍由其他模型获得。这意味着MerMED-FM证明的是跨领域适应能力,而非在所有模态全面碾压专科模型。

MerMED-FM各模态平均AUROC关系示意图(概念图,数值来自论文摘要):OCT、病理、CT领先,整体平均0.854高于通用、多专科与单专科三类对照

五、从实验室到临床:应用前景与局限

作为研究型基础模型,MerMED-FM最可能的落地形态不是「一个模型看遍所有病」,而是通用骨干加份科精调的混合架构:在筛查与分诊环节用统一底座快速适配多病种,在疑难升级环节仍交由专科模型或更精细的专用系统。对资源受限、专科医生不足的机构,一个可跨模态复用的预训练底座有望降低模型引入与维护门槛;对多院区、多设备的大型医疗集团,统一骨干也有利于一致的AI治理与版本管理。

但局限同样明确。第一,训练数据主要来自发达国家高资源医院,在低收入地区与不同种族人群中的泛化能力仍需实地验证,公平性不能默认成立。第二,MerMED-FM处理的是二维切片而非三维体数据,对依赖空间结构的任务存在天然上限;且它尚未经过前瞻性临床验证,也缺少卫生经济学评估,距离获批与常规部署仍有距离。第三,它并非零样本诊断系统——每一个下游疾病任务仍需各自的标注、微调、阈值与独立验证,且论文坦承它并未在所有模态上稳定超过对应专科模型。与我们在PathPrism可解释病理AI中强调的一致,模型指标提升不等于患者获益,临床转化必须建立在本地验证之上。

六、结论与产业启示

MerMED-FM证明了一个朴素的工程判断:与其为每个模态、每种病各训一个模型,不如先用大量无标注影像学一个共享视觉底座,再用少量标注快速分科上岗。它的价值不在于全面取代专科模型,而在于把多专科AI的集成、治理与适配成本显著压低。对医疗AI企业而言,三类动作值得优先:一是建设跨模态预训练与统一骨干的能力;二是为下游任务建立规范的本地微调与验证管线;三是把基础模型定位为辅助底座而非终局产品,始终保留人在环路。

思陌智能科研服务面向医院与科研机构提供医学影像AI与医疗AI科研服务,涵盖影像基础模型预训练、专科模型精调、临床决策支持系统开发与AI评估验证。我们可协助团队在自有数据上完成模型本地化、性能校准与前瞻性验证设计,让基础模型的通用能力稳妥落地到具体临床场景。

相关问题

Q:MerMED-FM能直接用于临床诊断吗?

A:目前不能。MerMED-FM是一个研究型视觉基础模型,并非已获批的诊断产品;它提供的共享预训练底座,每个具体疾病任务仍需各自标注、微调、设定阈值并独立验证。论文也明确指出,该模型尚未经过前瞻性临床验证,距离常规临床应用还有距离。

Q:它会取代放射科、病理科等专科AI模型吗?

A:不会简单取代。在10%标注下,MerMED-FM在OCT、病理、CT等任务上达到或接近专科模型水平,但论文承认它并未在所有模态与数据集上稳定超过对应专科模型。更现实的定位是通用骨干加份科精调的混合架构:筛查分诊用统一底座,疑难升级仍交专科模型。

Q:这项研究对中国医疗环境有什么参考?

A:参考意义在于工程范式而非现成产品。中国医疗机构设备与人群结构差异大,一个可跨模态复用的预训练底座有助于降低多专科AI的接入与治理成本,尤其利好专科资源不足的基层。但模型训练数据主要源自高资源医院,在本地人群与设备上的泛化必须经过独立验证,不能直接套用。

参考文献

  1. Zhou Y, Quek CWN, Zhou J, et al. MerMED-FM: Multimodal, Multi-Disease Medical Imaging Foundation Model. The Lancet Digital Health. 2026. DOI: 10.1016/j.landig.2026.101007 (PMID: 42509078)
  2. Vorontsov E, Shaikovski G, Casson A, et al. End-to-end multimodal pathology foundation model with clinical dialogue (PRISM2). Nature Medicine. 2026. DOI: 10.1038/s41591-026-04521-4 (PMID: 42538427)

本文基于 MerMED-FM: Multimodal, Multi-Disease Medical Imaging Foundation Model 的独立解读,仅供学术交流,不构成临床建议。

📄 论文原文信息

论文标题MerMED-FM: Multimodal, Multi-Disease Medical Imaging Foundation Model
作者Yang Zhou, Chrystie Wan Ning Quek, Jun Zhou, et al.
期刊The Lancet Digital Health
发表时间2026-07-27
DOI10.1016/j.landig.2026.101007
PubMedPMID: 42509078