用医院真实数据训练的AI读脑CT/MRI,诊断156种疾病超越GPT-5——Nature Medicine发表NeuroVFM
一、研究背景
过去两年,医学AI的主流发展路径是"互联网尺度学习"——将海量网络图文喂给大模型,训练出像GPT-5、Claude Sonnet 4.5这样的通用智能系统。但神经影像(脑部CT和MRI)几乎不会出现在互联网上:它们是包含患者面部特征的私密三维体数据,格式复杂且高度依赖专业解读。因此,这些前沿通用模型在脑影像任务上往往力不从心。
密歇根大学Todd Hollon团队提出了另一条根本不同的路径——“健康系统学习”(Health System Learning)。这个范式的核心思想很简单:不做数据策展、不用人工标注、不依赖放射学报告,直接从一家医院近20年积累的、原封不动的常规临床影像里学习。研究团队将这一理念实现为NeuroVFM(Neuroimaging Vision Foundation Model),并于2026年7月10日在Nature Medicine上发表了这一成果。
二、研究创新点
本研究的核心创新可以概括为三个层面:
(1)提出"健康系统学习"新范式。 传统医学AI依赖大量人工标注或配对的放射学报告进行监督训练,而NeuroVFM直接从未经整理的原始临床影像中自监督学习,打破了数据标注的瓶颈。
(2)开发Vol-JEPA体积联合嵌入预测架构。 这是JEPA(Joint Embedding Predictive Architecture)在三维医学影像上的首次大规模应用。采用学生-教师双网络结构,通过在隐空间中预测被掩码区域的表示来学习,完全不需要体素级数据增强、负样本对、生成式解码器或配对报告。
(3)单一冻结编码器覆盖156项诊断任务。 NeuroVFM的视觉编码器在预训练后冻结,不需要针对每个下游任务微调,即可同时覆盖82种CT诊断和74种MRI诊断,实现了真正的"通才型"医学AI。
三、技术原理
NeuroVFM基于Vol-JEPA架构,其训练流程可分为以下关键步骤:
训练数据: 使用密歇根医学院2005–2025年积累的566,915例神经影像检查、共524万个临床CT/MRI体积(约365万MRI + 159万CT),覆盖超过20年的真实临床数据。
Vol-JEPA架构: 将三维体积分割为非重叠的4×16×16体素图块。每个体积分为两部分:较小的可见上下文区域(MRI采样25%、CT采样20%)和较大的掩码目标区域。学生编码器处理上下文区域生成潜在表示,预测器结合上下文表示和位置信息预测目标区域的潜在表示,教师编码器通过学生编码器的指数移动平均(EMA)更新并提供预测目标。训练目标是最小化预测表示与教师生成表示之间的平滑L1距离。
关键设计细节: CT数据采用多窗口训练策略——脑窗权重0.7、硬膜下窗0.15、骨窗0.15——确保模型同时学习不同组织对比度下的特征。图块丢弃率设为20%以增加训练难度。
四、实验结果
NeuroVFM在多项评估中展现出全面的性能优势:
诊断性能: 在156项诊断任务中,CT宏平均AUROC达92.68(95% CI 92.27–93.08),MRI宏平均AUROC达92.49(95% CI 92.14–92.82),全面超越HLIP、NeuroMAE、DINOv3、BiomedCLIP等对照模型(AUROC提升1.55–3.87不等)。
标注效率: NeuroVFM所需的阳性训练样本比传统方法少31.5%–55.9%,意味着在临床稀有疾病上也能快速适配。
报告生成超越GPT-5: 在300例专家验证的影像研究上,NeuroVFM结合开源语言模型生成的放射学报告,三级紧急程度准确率超越GPT-5 +11.0%,紧急发现检测超越+10.5%,关键发现错误率约为GPT-5的一半(10% vs 20%)。盲法专家以超过2:1的比例优先选择NeuroVFM生成的报告。
前瞻性临床分诊: 在一项为期一周、覆盖1,155例真实急诊影像的前瞻性研究中,NeuroVFM组平衡准确率达92.6%,远超GPT-5的71.2%。关键发现漏检率方面,NeuroVFM仅为GPT-5的约四分之一。
五、应用前景
NeuroVFM的"健康系统学习"范式为医疗AI的落地提供了全新的可能性:
急诊影像智能分诊。 在放射科医生短缺的背景下,NeuroVFM能自动识别脑出血、急性梗死等需要紧急处理的影像征象,将真正需要优先处理的病例推到队列前面,为抢救争取宝贵时间。
基层医疗赋能。 神经影像诊断高度依赖专家经验,基层医院往往缺乏神经放射学专科医生。一个冻结的NeuroVFM编码器即可覆盖上百种诊断,结合开源大语言模型生成结构化报告,有望将三甲医院的诊断能力下沉至县级医院。
作为AI医疗软件开发的基础模块。 NeuroVFM的预训练编码器和Vol-JEPA架构可作为"视觉感知前端",与各类大语言模型(如GPT-5、Claude等)组合,构建面向不同临床场景的AI辅助诊断系统。这正是思陌智能科研服务关注的方向——将前沿AI模型工程化为可落地的临床工具。
六、结论
NeuroVFM的研究证明了一个重要事实:医学AI不需要依赖互联网规模的公共数据。一家医院20年积累的常规临床影像,配合合适的自监督学习架构,就能训练出在诊断、报告生成和临床分诊方面全面超越GPT-5等前沿模型的通才型系统。虽然该模型目前仍是研究工具、尚未获得监管批准用于临床诊断,但其开放的代码和权重为全球医疗AI开发者提供了极有价值的参考框架。
“健康系统学习"不仅是技术路线的创新,更提示了一种务实的落地路径:让每家医院用自己的数据训练自己的AI。
参考文献
-
Kondepudi A, Rao A, Zhao C, et al. Health system learning enables generalist neuroimaging models. Nature Medicine, 2026. DOI: 10.1038/s41591-026-04497-1 | PMID: 42432292
-
Assran M, et al. Self-supervised learning from images with a joint-embedding predictive architecture. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023: 15619–15629.
-
Lyu Y, et al. Learning neuroimaging models from health system-scale data. Nature Biomedical Engineering, 2026. DOI: 10.1038/s41551-025-01608-0
-
Moor M, et al. Foundation models for generalist medical artificial intelligence. Nature, 2023, 616: 259–265. DOI: 10.1038/s41586-023-05881-4
📄 论文原文信息
| 论文标题 | Health system learning enables generalist neuroimaging models |
| 作者 | Kondepudi A, Rao A, Zhao C, Lyu Y, Harake S, Banerjee S, Ogle J, Joshi R, Meissner AK, Hou X, Jiang C, Chowdury A, Srinivasan A, Athey B, Gulani V, Pandey A, Lee H, Hollon T |
| 期刊 | Nature Medicine |
| 发表时间 | 2026-07-10 |
| DOI | 10.1038/s41591-026-04497-1 |
| PubMed | PMID: 42432292 |