← 行业趋势

神经影像大模型评测:开放式诊断准确率仅六成,判别式高出15个百分点以上

神经外科视角评测三款多模态大模型在 252 例颅脑与脊柱神经影像上的诊断表现:开放式推理准确率仅 51.6%–62.7%,提供选项后升至 75.4%–81.0%,相差 15 个百分点以上;临床显著错误率达 17.8%–26.9%,不支持自主诊断使用。

核心要点

  • 问题:多模态大模型做神经影像诊断,开放式推理的真实准确率有多高?能否自主使用?
  • 方法:对 GPT-5.2、Gemini 3 Pro、Claude Opus 4.5 三款大模型,在 RSNA 病例集 252 例颅脑与脊柱神经影像上,用「开放式生成 vs 选择题判别」两阶段范式评测。
  • 结果:开放式主要诊断准确率仅 51.6%–62.7%,给出选项后升至 75.4%–81.0%,相差 15.1–23.8 个百分点;临床显著错误率 17.8%–26.9%。
  • 意义:低开放式准确率与临床错误负担不支持自主诊断使用,判别式能力能否辅助需前瞻性人机对照验证。
  • 原文Generative versus discriminative diagnostic performance of large multimodal models in intracranial and spinal neuroradiology,npj Digital Medicine,2026-08-24

一幅概念视觉:医学蓝绿配色的抽象画面,中央一枚发光的颅脑与脊柱影像切片,旁边悬浮着多个被点亮或未被点亮的候选诊断节点,象征大模型在开放式诊断与选择题判别之间的能力落差,画面无文字、无数据、无真实患者形象

1. 神经影像诊断的临床挑战

颅内与脊柱的神经影像(neuroimaging)是神经外科与神经内科临床决策的基石:脑肿瘤、颅内出血、脊柱退变与占位性病变等,都要靠 CT、MRI 影像结合病史做出判断。这类阅片任务结构复杂、病灶细小、鉴别诊断多,误诊漏诊的代价很高。

临床上,医生的诊断是一个「开放式」过程——不受选项限制,直接从影像与病史中推理出结论。但眼下大模型评测多采用「选择题」形式,模型只需在给定的几个选项里挑答案。这就带来一个关键问题:大模型在更接近真实阅片的开放式场景下,诊断能力究竟如何?它与选择题评测之间差了多少?这项由多中心神经外科团队完成的研究,用 252 例真实神经影像病例给出了量化答案,成果发表于 npj Digital Medicine。

2. 这项评测的核心创新

这项工作的价值不在训练一个新模型,而在三点评测方法上的实质贡献。

第一,两阶段对照,量化「生成式」与「判别式」的差距。研究对同一批病例先让模型开放式生成主要诊断,再提供候选选项让模型做判别式选择,直接量出两种范式之间的准确率鸿沟。过去多数评测只看选择题得分,可能高估模型在真实阅片中的表现,本研究把这个问题显式地摆上了台面。

第二,从神经外科视角做「临床影响分级」。研究不只报告笼统的准确率,而是由神经外科专家组对每一例错误做临床影响分级,得出「具有临床意义错误」的具体比例。这个指标比准确率更贴近真实场景——因为并非所有错误都一样严重。

第三,稳健性检验排除「会话内偏差」。研究在分层抽取的 100 例亚组中用四个模型重复运行,并做全新会话的重新评估,确认「生成式与判别式」的差距稳定存在,并非评测设计的偶然产物。

3. 技术原理:同一输入,两种作答,专科分级

评测的基本流程可以概括为「同一输入、两种作答、专科分级」三步。

输入是来自 RSNA 病例集(受付费墙保护)的 252 例颅脑与脊柱神经影像病例,覆盖颅内与脊柱的多种病变。第一阶段是开放式生成:模型不受选项约束,直接输出主要诊断;第二阶段是判别式识别:给定若干候选答案,让模型从中选择。评价从神经外科视角进行,既统计两种范式下的主要诊断准确率,又由专家组对错误做临床影响分级。

需要特别说明,这里评测的是三款商业大模型的 API 能力——GPT-5.2、Gemini 3 Pro 与 Claude Opus 4.5,而非经过临床验证、获批上市的诊断产品。评测结论反映的是「通用大模型直接用于神经影像诊断」这一特定场景,不能等同于成熟产品的临床性能。

一幅技术流程示意图:左侧为神经影像病例输入的抽象节点,中间分出上下两条路径——上方代表开放式生成、下方代表选择题判别,右侧汇合到准确率比较与临床影响分级的输出节点,整体为纯几何图形与箭头连接,无文字、无标签、无具体数字

4. 数据说话:开放式仅六成,判别式相差15个百分点以上

论文报告的核心结果如下表。

研究维度 比较对象 核心结果 统计证据
开放式主要诊断准确率 GPT-5.2 / Gemini 3 Pro / Claude Opus 4.5 51.6%–62.7% 未报告 P 值/置信区间
判别式(提供选项)准确率 同上三款模型 75.4%–81.0% 未报告 P 值/置信区间
两种范式差距 判别式 vs 生成式 15.1–23.8 个百分点 未报告 P 值/置信区间
错误自我纠正 完全错误诊断中 43%–59% 未报告 P 值/置信区间
临床显著错误率 神经外科专家组分级 17.8%–26.9% 未报告 P 值/置信区间

三个数字最值得关注。其一,开放式诊断准确率仅 51.6%–62.7%,意味着在最接近真实阅片的场景下,最强的多模态大模型也有一半左右会答错;其二,提供选项后准确率升至 75.4%–81.0%,二者相差 15.1–23.8 个百分点,说明「选择题」形式会明显放大模型的表面能力;其三,即便在「完全答错」的病例中,也有 43%–59% 能在看到选项后自我纠正,进一步印证了差距主要来自「开放式生成」这一环节。

但也要看清边界:研究未报告灵敏度、特异度等操作点指标,且 17.8%–26.9% 的临床显著错误率并不低,因此判别式较高的准确率也不能直接等同于「可以放心辅助」。

一张由论文真实数据绘制的柱状图,左侧对比三款大模型开放式诊断(51.6%–62.7%)与判别式诊断(75.4%–81.0%)的准确率区间,右侧展示临床显著错误率区间(17.8%–26.9%),以视觉呈现「生成式与判别式」的能力落差与错误负担

5. 从实验室到临床:应用前景与局限

这项研究对产业有三个具体落点。其一,可作为医疗 AI 企业评估大模型的「范式校准」工具——在宣称模型诊断能力前,至少同时报告开放式与判别式两种准确率,避免被选择题高分误导;其二,可把「临床影响分级」引入模型评测,量化「有临床意义的错误」而非只看总体准确率;其三,为「人机协同」与前瞻性对照试验的顶层设计提供依据,把大模型定位为「第二意见 / 候选诊断」,而非自主决策者。

这也呼应了我们此前关于大模型辅助诊断推理中的自动化偏差的讨论:AI 建议无论对错,都会显著影响医生的判断,因此评测的真实性比单个分数更重要。

但至少有两条重要局限需要正视。第一,样本来自单一 RSNA 病例集、共 252 例,代表性有限,且为横截面回顾性评测,未做多中心前瞻验证,也未纳入患者临床结局。第二,评测对象是通用商业大模型的 API 能力,而非针对特定临床工作流优化过的系统;结论能否外推到不同人群、不同影像协议与真实阅片流程,仍需进一步研究。

6. 结论与产业启示

这项研究给出一个清醒的结论:即便最强多模态大模型,在神经影像开放式诊断上准确率也仅五到六成,与判别式相差 15 个百分点以上,临床显著错误率最高近三成,目前不足以支持自主诊断使用。

对医疗 AI 企业和研究团队有三点建议:一是评测必须「生成式与判别式」双范式并报,警惕选择题高分掩盖开放式短板;二是把专科视角的临床影响分级纳入评价,量化错误的实际后果;三是将大模型定位为可审计的辅助工具,落地前设计前瞻性人机对照验证。

这也正是思陌智能科研服务长期关注的方向:面向医疗大模型与医学影像 AI 的评估验证,协助团队完成从基准评测、专科影响分级到前瞻人机对照的完整评估链条,为临床决策支持系统的合规落地提供端到端支撑。

相关问题

Q:这些大模型已经能用于神经影像自主诊断了吗?

A:不能。开放式诊断准确率仅 51.6%–62.7%,临床显著错误率高达 17.8%–26.9%,作者明确表示这不支持自主诊断使用。即便提供选项后准确率升至 75.4%–81.0%,也只说明「判别式」能力更强,仍需前瞻性人机对照验证后才能谈辅助定位。

Q:这项研究测试的是完整产品,还是模型本身?

A:测试的是三款商业大模型(GPT-5.2、Gemini 3 Pro、Claude Opus 4.5)的 API 能力,并非经过临床验证、获批上市的诊断产品。它衡量的是「通用大模型直接读影像作答」这一特定场景,不能等同于成熟产品的临床性能。

Q:这对医院或患者意味着什么?

A:意味着当下不应把通用大模型当作神经影像诊断的最终答案。对医院而言,若引入此类工具,应定位为「第二意见 / 候选诊断」,并由专科医生复核;对患者而言,AI 结论仍需以影像科与神经外科的正式诊断为准,不可据此自行决策。

参考文献

  1. Acar A, Kaya B, Yahya D, et al. Generative versus discriminative diagnostic performance of large multimodal models in intracranial and spinal neuroradiology. npj Digital Medicine. 2026. DOI: 10.1038/s41746-026-03169-1
  2. Goh E, Gallo R, Hom J, et al. Automation Bias in Large Language Model–Assisted Diagnostic Reasoning. NEJM AI. 2026. DOI: 10.1056/AIoa2501001

本文基于 Generative versus discriminative diagnostic performance of large multimodal models in intracranial and spinal neuroradiology 的独立解读,仅供学术交流,不构成临床建议。

📄 论文原文信息

论文标题Generative versus discriminative diagnostic performance of large multimodal models in intracranial and spinal neuroradiology
作者Alaeddin Acar, Bahadir Kaya, Diaa Yahya, Selcuk Yazici, Sacide Kalaycioglu, Eray Tekirdas, Burcak Bilginer
期刊npj Digital Medicine
发表时间2026-08-24
DOI10.1038/s41746-026-03169-1
论文原文信息地址:https://doi.org/10.1038/s41746-026-03169-1