← 行业趋势

MIRA:首个EHR内自主AI智能体完成全流程诊疗 — Nature发表真实病例模拟,诊断准确率87.8%超越专科医生

海德堡大学与德累斯顿工业大学联合团队在Nature发表MIRA(Medical Intelligence for Reasoning and Action)——首个可在电子健康记录(EHR)沙盒环境中自主完成问诊、检查开立、诊断与治疗决策的AI智能体。基于574例真实急诊病例,MIRA诊断准确率达87.8%,显著优于认证专科医生的78.1%(P<0.001),指南依从性高出35个百分点,且零用药安全事件。该研究标志着医疗AI从「聊天输出」迈向「临床操作」的关键转折。

核心要点

  • 问题:当前医疗 AI 多为文本级「聊天工具」,无法在电子健康记录(EHR)中执行真实临床操作,远未触及急诊全流程闭环。
  • 方法:MIRA 是首个运行在 FHIR 沙盒 EHR 中的自主 AI 智能体,基于 GPT-4o,可调用 11 种医疗工具、覆盖超过 85,000 个临床决策选项。
  • 结果:574 例真实急诊病例模拟中,诊断准确率 87.8% vs 认证专科医生 78.1%(P<0.001);指南依从性高出 35 个百分点;零严重用药安全事件;入院决策未遗漏任何需住院病例。
  • 意义:医疗 AI 首次从「提建议」跨越到「执行操作」——自主完成问诊→开检查→解读结果→制定治疗方案的全流程,标志着 AI 医生「副驾驶」(copilot)方案迈出关键一步。
  • 原文:Towards autonomous medical artificial intelligence agents,Nature,2026年6月17日 | DOI: 10.1038/s41586-026-10675-5 | PMID: 42310457

一名急诊科医生与AI智能体在电子病历系统前协同查看患者数据的场景

急诊科的临床痛点:从信息碎片到决策时间窗

急诊科(Emergency Department, ED)是医院系统中最高压、最复杂的场景之一。医生必须在极短时间窗内完成病史采集、体格检查、实验室和影像学检查开具、结果解读、鉴别诊断生成,再到处方、手术安排和入院决策——每一步都在电子健康记录(Electronic Health Record, EHR)中完成,整个流程涉及成百上千个可执行操作和数十种医学编码系统的交叉调用。

然而,当前几乎所有医疗大语言模型(Large Language Model, LLM)的应用都停留在「聊天级」——输出一段文本建议,无法真正嵌入 EHR 工作流中执行操作。正如我们此前分析的 Pythia 认知筛查智能体,即便是多智能体协作系统,也仍然囿于特定筛查场景。而正如 Automation Bias 研究 所揭示的,不恰当的 AI 建议反而可能误导医生,因此 AI 能否「做对的事」比「说对的话」更为迫切。

Nature 于 2026 年 6 月 17 日发表的这项研究,正是直面这一根本性瓶颈。由德国海德堡大学医院(Heidelberg University Hospital)与德累斯顿工业大学 Else Kröner Fresenius 数字健康中心(EKFZ)Jakob Nikolas Kather 教授团队领衔,联合麻省总医院 A. John Iafrate 等多中心力量,推出了 MIRA(Medical Intelligence for Reasoning and Action)——首个在沙盒化 EHR 环境中实现全流程自主诊疗的 AI 智能体。

MIRA 的三大核心创新

第一,从「聊天工具」到「临床操作者」的范式跨越。 与以往仅输出自由文本建议的 LLM 不同,MIRA 通过符合 HL7 FHIR(Fast Healthcare Interoperability Resources)标准的 API 直接操作 EHR 服务器,能够像真实的临床医生一样,自主完成病史询问、体格检查、检验检查开立、结果解读、鉴别诊断生成、处方开具、手术安排和入院决策——全部在标准 EHR 框架内完成。

第二,超大规模可控行动空间与幻觉消除机制。 MIRA 的行动空间覆盖 11 种医疗工具、超过 85,000 个临床决策选项(包括 246 种 LOINC 实验室编码、176 种微生物学检查、超过 80,000 个 ICD-9/ICD-10 手术代码),并通过**标记掩蔽(Token Masking)**技术强制约束输出为预定义有效选项,从程序层面消除了 LLM 生成不存在检查或药物代码的可能性。

第三,双智能体对话框架与结构化推理。 研究构建了一个「患者智能体 + 医生智能体(MIRA)」的双向对话系统——患者智能体基于 MIMIC-IV 数据库真实病历回答问诊,MIRA(基于 GPT-4o,温度=0.01)则调用 o1-preview 进行多步推理规划,并利用基于 RAG 的向量检索系统(jina-embeddings-v3 + Qdrant)精准匹配 ICD 手术编码。这与 多模态 AMIE 的思路一脉相承——Nature 同期发表的 AMIE 论文也采用了类似的智能体架构,但 MIRA 更进一步实现了 EHR 内的结构化操作闭环。

MIRA自主AI智能体在FHIR电子健康记录系统中的技术架构流程图,展示从患者问诊到诊断决策的全流程操作

技术原理:FHIR 标准化沙盒中的自主推理与行动闭环

MIRA 的技术栈可归纳为三层:

数据层:所有患者病例来自 MIMIC-IV 数据库(Beth Israel Deaconess Medical Center, 2008-2019),经 2 位医生人工筛选后的 574 例真实急诊病例,覆盖阑尾炎、胆囊炎、憩室炎、胰腺炎、肺炎、尿路感染(Urinary Tract Infection, UTI)、肺栓塞(Pulmonary Embolism)和胰腺癌 8 种目标疾病。

交互层:患者智能体基于出院小结中的现病史(History of Present Illness, HPI)回答 MIRA 的问诊,研究验证了其回答一致性高达 99.4%,且在 933 次常规对话和 880 次对抗性提示中实现零信息泄露。

执行层:MIRA 通过 Docker 化部署的 HAPI-FHIR 服务器,以标准 CRUD 操作与 EHR 交互。所有工具参数的有效性由标记掩蔽强制约束,并行工具调用机制允许在单轮对话中同时发起多项检查请求。诊断推理由 o1-preview 模型生成结构化多步计划,手术编码匹配通过本地 Qdrant 向量数据库进行语义检索。

数据说话:诊断超越医生、指南依从性高出35个百分点

研究设计了多维度严谨的对照评估,核心结果如下:

评估维度 MIRA 认证专科医生 P 值
总体诊断准确率 87.8% 78.1% <0.001
胰腺炎诊断准确率 95.2% 78.6% <0.05
阑尾炎诊断准确率 98.6%
指南依从性(较医生) +35 pp 参照 <0.001
血液检查覆盖率 51.1% 28.3% <0.001
处方正确率(468处方) 97.0-99.8%
用药严重安全事件 0 例
入院决策召回率 100%

值得注意的是,MIRA 并非简单「全查策略」——其血液检查覆盖率(51.1%)虽高于医生的 28.3%,但仍仅为真实临床基准(MIMIC-IV 记录)的约一半,说明 MIRA 在必要检查和过度检查之间找到了更优平衡点。在 Tversky 距离(惩罚过度使用)评估中,MIRA 在微生物学(0.640)、血液检查(0.607)和影像学(0.508)三个维度均显著优于医生(P<0.001)。

用药安全方面,6 位盲法评审专家对 56 例 MIRA 处方进行了全覆盖安全审查:零重度药物相互作用、零肾功能剂量不兼容、零过敏-药物不匹配、零 QT 风险处方、零不安全阿片类处方。唯一的 3 例治疗重复(昂丹司琼重复开具、华法林/依诺肝素重叠待降阶梯、高钾血症管理中胰岛素/葡萄糖推注)均被临床判定为合理,仅剂量说明可更明确。

偏倚鲁棒性测试显示,面对 6 种偏倚场景(性别不同、患者坚信健康/患癌、过度焦虑、仅说德语/法语),MIRA 的性能波动极小,Holm 校正后无任何偏倚条件达到统计显著——展现出超出人类医生的抗干扰能力。

MIRA与认证专科医生在急诊8种疾病诊断准确性对比柱状图,突显87.8% vs 78.1%的整体优势

从实验室到临床:应用前景与局限

应用前景:

  • 急诊分诊与住院决策辅助:MIRA 入院决策零遗漏(召回率=100%),可作为急诊 Triage 的「安全网」,防止高危患者被误放回家。尤其在肺炎和肺栓塞场景中展现出极高的阴性预测值(NPV=100%)。
  • 基层医疗能力倍增:面对混合经验组(含住院医师),MIRA 优势扩大至 87.8% vs 71.1%(P<0.001)——越是在经验不足的场景中,MIRA 的辅助价值越突出,有望缓解医疗资源不均问题。
  • 医学编码与文书减负:MIRA 的手术编码匹配率(阑尾炎 100%、胆囊炎 81.2%)和处方填写正确率(>97%)展示了自动化 EHR 操作的效率潜力,可大幅减轻医生的文书负担。

当前局限:

  • 模拟患者与真实患者的差距:患者智能体的回答基于结构化的出院小结文本,可能比真实急诊患者的口语表达更规整,缺乏真实场景中的口误、遗漏和不一致。真实世界前瞻性验证必不可少。
  • 训练数据重叠风险:MIMIC-IV 是公开数据集,虽需注册访问,但无法完全排除被包含在 GPT-4o 训练语料中的可能。因此诊断性能应保守解读为可能的上界。
  • 给药途径错误率:处方正确性中给药途径是最大薄弱项(正确率 97.0%),提示在真实临床部署前需专项优化。

结论与产业启示

MIRA 的核心价值在于完成了一次从「AI 说」到「AI 做」的范式验证——在受控沙盒环境中,一个基于 GPT-4o 的自主智能体能够在标准 FHIR EHR 框架内,从零开始完成一次完整的急诊诊疗流程,且诊断、治疗和安全指标全面达到或超越人类医生水平。

对于 思陌智能科研服务 而言,MIRA 的方向与本公司在 AI 医疗软件开发和医疗 AI 科研服务方面的布局高度契合:EHR 集成、FHIR 标准化接口、智能体工具调用链、临床安全验证框架——这些技术要素正是医疗 AI 从概念验证走向产品化的必经路径。思陌可为医院和科研机构提供从医学知识库构建、LLM 微调、EHR 接口开发到临床验证方案设计的全链条服务,助力这一方向的快速落地。

正如 Kather 教授所言:「我们正在预览 AI 将如何变革医学。」而现在,预览已经清晰地指向了一个方向:AI 不仅是医生的知识库,更将成为一个有执行能力的临床协作者。

相关问题

Q:MIRA 会替代急诊科医生吗? A:不会。MIRA 的定位是「临床副驾驶」(copilot),承担问诊、检查开立、处方填写等重复性高、耗时长的常规任务,将医生的时间解放出来投入更有价值的临床判断和医患沟通。Kather 教授用飞机自动驾驶类比——自动驾驶承担巡航任务,但机长始终拥有最终控制权。

Q:MIRA 何时能真正用于临床? A:目前仍在沙盒验证阶段。Nature 论文明确指出现阶段不应在真实临床环境中部署,需经过前瞻性真实世界研究验证其安全性、泛化能力和长期可靠性。考虑到医疗器械审批流程,预计至少需要 3-5 年才能进入有限场景的临床试点。

Q:MIRA 所依赖的 GPT-4o 模型已被更新版本取代,这对研究意义有何影响? A:这一点恰恰强化了研究的工程意义——MIRA 的价值更多体现在 EHR 集成架构、工具链设计、安全约束框架和评估方法论上,而非底层模型本身。将这些架构迁移到更新、更强的模型(如 GPT-5、Gemini 3 等)有望获得更好的性能,这也为后续研究指明了方向。

参考文献

  1. Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents. Nature. 2026;655:1282-1291. doi:10.1038/s41586-026-10675-5 | PMID: 42310457
  2. Johnson AEW, Bulgarelli L, Shen L, et al. MIMIC-IV, a freely accessible electronic health record dataset. Sci Data. 2023;10:1. doi:10.1038/s41597-022-01899-x
  3. Singhal K, Tu T, Gottweis J, et al. Toward expert-level medical question answering with large language models. Nat Med. 2025;31:1096-1104. doi:10.1038/s41591-025-03724-5

本文基于 Ferber D et al. “Towards autonomous medical artificial intelligence agents”(Nature, 2026)的独立解读,仅供学术交流,不构成临床建议。

📄 论文原文信息

论文标题Towards autonomous medical artificial intelligence agents
作者Ferber D, Hilgers L, Höper C, Kinny-Köster B, Eckardt JN, Egger-Heidrich K, Bill M, Schneider MMK, Clusmann J, Kadric L, Oehme M, Mayrhofer-Schmid M, Oeser A, Wölflein G, Wiest IC, Middeke JM, Iafrate AJ, Truhn D, Jäger D, Kather JN
期刊Nature
发表时间2026-06-17
DOI10.1038/s41586-026-10675-5
PubMedPMID: 42310457