← 行业趋势

Automation Bias:受过AI培训的医生仍被LLM误导 — NEJM AI RCT证实错误AI建议使诊断准确率下降14个百分点

NEJM AI发表随机对照试验揭示:即使完成20小时AI素养培训的医生,在接触到大型语言模型(LLM)的错误诊断建议后,诊断推理准确率仍从84.9%骤降至73.3%(P<0.0001)。更令人担忧的是,经验越丰富的医生受自动化偏见影响反而越大。研究警示:仅靠AI培训不足以保护临床安全,必须在部署环节引入系统性验证框架。

核心要点

  • 问题:全球每年因诊断错误导致数百万可预防死亡,LLM虽有望辅助诊断,但其"幻觉"输出引发的自动化偏见风险尚未被充分评估
  • 方法:44名完成20小时AI素养培训的医生被随机分为两组,在自愿咨询ChatGPT-4o的条件下诊断6个临床案例(治疗组3个案例的AI建议被故意植入错误)
  • 结果:错误AI建议使诊断推理准确率下降14.0个百分点(73.3% vs 84.9%,P<0.0001),首选诊断准确率下降18.3个百分点(76.1% vs 90.5%)
  • 意义:仅靠AI素养培训无法消除自动化偏见;医疗AI部署需要系统性验证框架和监管防护,而非仅依赖个人判断
  • 原文:Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy — A Randomized Clinical Trial,NEJM AI,2026年4月23日 | DOI: 10.1056/AIoa2501001

一位医生面对电脑屏幕上显示的大语言模型诊断建议,表情凝重,屏幕上有红色警告标识提示AI可能存在错误,背景为医院诊室环境

诊断错误的全球负担与AI的双刃剑

诊断错误(Diagnostic Error)是医疗安全领域最严峻却长期被低估的挑战之一。据估计,全球每年因诊断错误导致的超额死亡达570万至840万例,仅美国就有约79.5万人因此死亡或永久残疾。这些错误大多源于认知偏差——医生可能过早锁定某个诊断方向(锚定偏差,Anchoring Bias),或忽略与初步判断相悖的检查结果。

大型语言模型(Large Language Models, LLMs)如ChatGPT-4o的出现,为缓解这一困境带来了前所未有的期待。多项研究表明,LLM在结构化医学考试和标准化病例诊断中表现出色。然而,LLM的"幻觉"(Hallucination)问题——即生成看似合理但内容虚假的输出——使其在临床场景中的安全性备受质疑。

更关键的问题是自动化偏见(Automation Bias):人类倾向于过度信任自动化系统的输出,即使这些输出是错误的。一个令医学界不安的假设是:如果医生完成了AI素养培训,他们是否就能有效识别和抵御LLM的错误建议?2026年4月发表在**《NEJM AI》**上的一项随机对照试验(RCT)给出了一个令人警醒的答案。

Automation Bias研究的核心设计创新

这项由巴基斯坦拉合尔管理科学大学(LUMS)Ihsan Ayyub Qazi博士团队完成的研究,在设计上有三个关键创新:

  1. 真实培训而非表面教育:44名参试医生均完成了20小时的系统性AI素养培训,涵盖LLM能力边界、提示工程(Prompt Engineering)和AI输出批判性评估——这远超大多数医疗机构当前的AI培训水平。

  2. 自愿咨询而非强制使用:医生可以自主决定是否查看ChatGPT-4o的建议,同时可自由使用PubMed、Google搜索(无AI功能)等常规资源。这模拟了真实临床场景中的"可选AI辅助"模式。

  3. 盲法评估与错误植入:三位置盲评审员使用专家制定的评分标准(Rubric)评估诊断推理的四个维度——鉴别诊断正确性、支持与反对证据、首选诊断、后续步骤。治疗组6个案例中的3个被植入了故意设计的临床推理错误,案例顺序随机化以避免锚定偏差。

技术原理:AI建议如何悄悄篡改临床推理

本研究的核心机制涉及人机交互中的认知心理学。自动化偏见并非简单的"医生变懒了",而是涉及两个层面的心理过程:

认知卸载(Cognitive Offloading):当可靠的AI工具可用时,人类大脑会自动降低对同一任务的认知投入。这种机制在正常AI输出下有益——如我们此前分析的多模态AMIE研究所示,准确的AI辅助确实能提升诊断效率。但当AI出错时,卸载的信息处理能力不会自动"回收"。

确认偏差的放大器效应(Confirmation Bias Amplification):LLM输出通常以高度自信的学术化语言呈现,即使内容是错误的。医生在阅读AI建议后,会下意识地寻找支持该建议的证据,而忽略矛盾信息。更令人担忧的是,本研究的亚组分析显示:基线诊断准确率越高的资深医生,受错误AI建议的影响反而越大——这与我们此前报道的LungIMPACT RCT中"AI辅助不一定改善临床结局"的发现形成了危险呼应。

一张信息图展示了自动化偏见的心理机制:从AI输出到认知卸载再到诊断错误的三步流程,用红色箭头标出错误AI建议的传导路径

数据说话:14个百分点的诊断能力损失

研究共完成264例诊断评估。以下是核心结果:

评估指标 对照组(正确AI建议) 治疗组(含错误AI建议) 调整后差异 P值
综合诊断推理准确率 84.9% 73.3% −14.0 pp(95%CI: −18.9~−9.1) <0.0001
首选诊断准确率 90.5% 76.1% −18.3 pp(95%CI: −26.6~−10.0)

“首选诊断准确率"的18.3个百分点下降尤为触目惊心——这意味着在近五分之一的情况下,即使经过AI培训的医生,其首选诊断也会被错误AI建议"带偏”。

亚组分析揭示了一个反直觉的发现:基线诊断能力更强的资深医生,在暴露于错误AI建议时表现退化更为显著。同时,研究前更频繁使用LLM的医生也倾向于表现出更大程度的性能下降(虽未达统计显著性)。这暗示一个危险的"熟练陷阱"——越依赖AI的医生,可能在面对错误AI建议时越脆弱。

从实验室到临床:对AI部署策略的启示与局限

应用前景:

  • AI输出置信度标注:在LLM建议旁附加实时置信度评分(如"本建议置信度:中等,建议人工复核"),帮助医生校准信任水平
  • 对抗性测试框架:在临床AI系统上线前,必须经历含故意植入错误的"压力测试",而非仅评估其在干净数据上的表现
  • 双通道验证机制:将AI建议与独立的知识库检索结果并列展示,减少单一信号源带来的锚定效应
  • 人机交互设计优化:不将AI建议放在屏幕最醒目位置,避免"建议即决策"的界面设计

当前局限:

本研究在巴基斯坦完成,参试医生数量(44名)和临床案例种类有限,且使用的是ChatGPT-4o而非专门训练的医疗AI模型。在美国等不同医疗体系和文化背景下的可重复性有待验证。此外,临床案例(Vignettes)与真实诊疗环境中的多任务并行压力和患者互动仍有差距。

结论与产业启示

Qazi团队的研究击穿了一个广泛存在的假设:AI素养培训不等于AI使用安全。即使医生知道AI可能出错、知道如何评估AI输出、甚至可以自由选择是否信任AI——当LLM以自信的学术腔调给出错误建议时,人类的认知防线依然会被突破。

这一发现对思陌智能科研服务正在推进的医疗AI软件开发方向具有直接指导意义。我们始终认为,医疗AI产品的核心壁垒不仅在于模型性能,更在于人机协作中的安全架构设计。无论是智能诊疗系统的临床部署,还是医学影像AI的辅助阅片流程,都必须内置对抗性验证、置信度反馈和人类复核的强制节点——而非将"医生自行判断"作为最后的安全网。

本文基于 “Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy — A Randomized Clinical Trial” 的独立解读,仅供学术交流,不构成临床建议。

相关问题

Q:这是否意味着大语言模型不应该用于临床诊断辅助? A:并非如此。研究表明,当LLM输出正确时,医生表现良好(准确率84.9%)。问题在于缺乏区分正确与错误AI输出的可靠机制。答案是"审慎部署",而非"禁止使用"。

Q:既然医生培训没用,那什么才有用? A:培训仍然必要,但不够。需要的是系统性防护——包括AI置信度实时反馈、输出的对抗性验证、双通道信息展示等工程化手段,而非仅依赖个人判断力。

Q:这个研究结果对正在开发医疗AI的公司意味着什么? A:意味着产品安全设计必须前置。不能假设"医生会自行判断",而应在系统层面阻断错误建议的传导路径。这对医疗AI软件的监管审批和临床部署策略都有深远影响。

参考文献

  1. Qazi IA, Ali A, Khawaja AU, et al. Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy — A Randomized Clinical Trial. NEJM AI. 2026;3(5). doi:10.1056/AIoa2501001

  2. Goh E, Gallo R, Hom J, et al. Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial. JAMA Netw Open. 2024;7(10):e2440969. doi:10.1001/jamanetworkopen.2024.40969

  3. Zwaan L, Rodman A, Shimizu T. Trust, Scrutiny, or Collaboration? A Performance-Based Framework for Human–AI Interaction in Medicine. NEJM AI. 2026;3(5). doi:10.1056/AIe2600354

📄 论文原文信息

论文标题Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy — A Randomized Clinical Trial
作者Qazi IA, Ali A, Khawaja AU, Akhtar MJ, Sheikh AZ, Alizai MH
期刊NEJM AI
发表时间2026-04-23
DOI10.1056/AIoa2501001
PubMedPMID: 暂无(NEJM AI 2026年新刊,待PubMed收录)