← 行业趋势

SHAKED:急诊科大模型决策支持前瞻评估,参与度而非准确度成落地关键障碍

急诊科大模型决策支持系统能否真正落地?Nature Medicine发表SHAKED系统的DECIDE-AI一期前瞻评估,1138例急诊患者显示医生采纳率从68%降至30%,提示持续参与度而非算法准确度才是落地关键障碍。

核心要点

  • 问题:急诊科大模型决策支持系统在真实工作流里能否被医生持续使用、能否带来效率提升,长期缺乏前瞻性证据。
  • 方法:Nature Medicine 发表 SHAKED 系统的 DECIDE-AI 一期前瞻评估,在以色列海法 Rambam 医院三级急诊科,用两个平行病区对比,4 周内分析 1138 例患者。
  • 结果:医生对 SHAKED 的采纳率从 68% 降至 30%;急诊科停留时间两翼均为 4.9 小时(P=0.99),无显著差异。
  • 意义:提示医生持续参与度而非算法准确度,可能是急诊 AI 落地的真正瓶颈,为随机试验设计提供参考,但尚不足以支持临床部署。
  • 原文Prospective evaluation of a large language model clinical decision support system in the emergency department,Nature Medicine,2026-08-19(PMID: 42618632

急诊科场景中叠加抽象人工智能决策支持界面的概念视觉,仅作示意,不包含任何真实患者数据

1. 急诊科大模型决策支持的临床挑战

急诊科是医疗 AI 落地最被寄予厚望、也最难攻克的场景之一。医生要在极短时间、信息不全、节奏高压下做出分诊与治疗决策,任何一个"助手"都必须在几秒钟内真正帮上忙,而不是添乱。

过去几年,大语言模型(LLM)在医学问答和模拟病例上屡创高分,但"考试高分"不等于"床旁好用"。此前我们的卒中多智能体大模型研究解读显示,LLM 辅助能把医生决策准确率从 73.1% 提升到 88.6%——但那发生在受控评估环境下;把同样的系统放进真实急诊科、真实班次里会发生什么,此前一直缺乏严格的前瞻证据。

这正是 SHAKED 研究要回答的问题:算法足够好之后,医生到底愿不愿意用、会不会持续用下去。

2. SHAKED 系统的核心创新

SHAKED 是由以色列理工学院(Technion)与 Rambam 医疗中心团队构建、基于多个大语言模型的临床决策支持系统。这项发表在 Nature Medicine 的前瞻评估,有几点方法论上的实质创新。

第一,采用 DECIDE-AI 一期评估框架。既往 AI 临床研究多为回顾性验证或模拟病例,本研究则把系统真正部署进三级急诊科,在连续四周的日常工作中评估医生的采纳行为与实际影响。

第二,用两个平行病区做准实验对照。1138 例患者被分配到两个平行单元:一个使用 SHAKED,另一个遵循常规轮转流程,从而在接近真实的条件下去比较干预效果。

第三,把"医生参与度"本身作为核心观测对象。研究没有只盯着诊断准确率,而是系统记录了采纳率随时间的变化,以及是什么因素导致医生放弃使用——这个视角直指 AI 落地最常被忽视的软性障碍。

3. 技术原理:事件驱动的多 LLM 床旁决策助手

SHAKED 的架构并不神秘,但贴合急诊科的工作方式。它由事件驱动:当电子病历出现新的临床事件,系统自动调取患者数据,生成结构化的病史摘要与临床洞察,存入中央数据库;医生通过聊天式界面与系统交互,背后由检索增强生成(RAG)知识模块提供循证支持。

简单说,输入是患者的实时病历数据,处理流程是"事件触发—数据汇总—多模型推理—证据检索",输出是面向医生的临床提示与建议。评价方式也不是单一的对错,而是同时观察三类结局:医生是否采纳(采纳率)、效率是否改善(停留时间、会诊周期)、安全性是否有保障(不良事件与专家适宜性打分)。

需要强调,SHAKED 是研究型决策支持系统,本研究评估的是"系统加医生"在真实科室里的整体协作,并非宣称某个大模型可以独立看诊。

展示多语言模型决策支持系统数据从输入节点经中央处理到输出节点的流程示意图,仅示意技术流程,不含虚构数字

4. 数据说话:采纳率下降,效率无显著差异

研究维度 比较对象 核心结果 统计证据
医生采纳率 研究开始 vs 结束 68% 降至 30% OR=0.72/班次小时,95% CI 0.62–0.83
放射学会诊偏好 SHAKED 使用场景 医生更倾向在放射学会诊使用 OR=2.98,95% CI 1.58–5.63
输出临床适宜性 专家组盲评 100 份输出 99 份被评为适宜 未报告 P 值
急诊科停留时间 干预病区 vs 对照病区 均为 4.9 小时 P=0.99
会诊周期时间 ITT 分析 缩短 9.4 分钟 P=0.077(不显著)

最值得注意的是一对看似矛盾的结果:算法的"答卷"并不差——100 份抽样输出里 99 份被专家评为临床适宜,全程未发现不良事件;但医生的使用热情却在快速消退,采纳率一个月内从 68% 跌到 30%,且这种弃用与工作量高度相关——每多上一个班次小时,继续使用的概率就下降。而效率结局(停留时间、会诊周期)都未达到统计学显著。这恰恰说明,问题可能不在 AI 准不准,而在医生有没有余力和动力去用。

展示医生采纳率下降与效率结局无显著差异的结果关系示意图,基于论文已核验数据,不含推算数字

5. 从实验室到临床:应用前景与局限

这项研究给产业一个清醒的提示:在急诊这类高压场景,AI 决策支持的落地瓶颈可能不是模型能力,而是工作流集成与医生负担。作者自己的结论也很克制——“为随机试验设计提供参考,但尚不足以支持现阶段临床部署”。

可能的应用方向:其一,SHAKED 在放射学会诊中的使用偏好(OR=2.98)提示,AI 决策支持可能更适合嵌入特定、边界清晰的会诊环节,而非全科室无差别铺开;其二,研究揭示的"工作量敏感弃用"提示,产品设计应把降低使用成本、减少打断放在与提升准确率同等重要的位置。

但局限同样明显:这是单中心(Rambam 医院)、四周的探索性评估,采纳率下降使干预暴露不足,符合方案分析可能受选择性采纳偏倚影响;所有 P 值未经多重比较校正,效率结局均未达显著,不能据此推断患者结局改善;结果基于以色列单一三级医院流程,是否适用于中国急诊科的分诊节奏与信息化水平,仍需独立的本地化验证。

6. 结论与产业启示

SHAKED 研究最有价值的,不是又一个"AI 高分"的故事,而是用前瞻性证据指出:当算法已经足够合格,医生愿不愿意、有没有空去用,才真正决定 AI 能否在急诊科落地。

对医疗 AI 团队而言,至少有三点可执行启示:把医生参与度与工作流契合纳入和准确率并列的核心评价指标;优先在边界清晰的会诊场景做小步验证;在真实部署前用 DECIDE-AI 等框架做前瞻评估,而非只靠回顾性数据讲故事。

这与思陌智能科研服务"医疗大模型、临床决策支持与医疗 AI 评估验证"的业务方向高度契合。我们为医院和研究团队提供医疗 AI 软件的开发落地与科研级评估验证服务,帮助把模型从高分答卷做成床旁真正被用起来的系统。

相关问题

Q:SHAKED 现在能用于急诊科临床了吗?

A:还不能。SHAKED 只是一项 DECIDE-AI 一期探索性评估,样本来自以色列单中心、仅运行四周,且主要效率结局未达统计学显著,作者也明确表示结果尚不足以支持临床部署。它需要后续随机对照试验、更长时间和更多中心的前瞻验证后,才能进一步讨论落地可能。

Q:这项研究是不是说明 AI 临床决策支持没用?

A:不是。研究并未否定算法的能力——100 份抽样输出中 99 份被专家组评为临床适宜,全程也未发现不良事件;真正的发现是医生采纳率随工作量从 68% 跌到 30%,说明当前瓶颈在于医生参与度与工作流契合,而非模型本身的质量,这为产品设计提供了明确方向。

Q:这个结果对中国医院有什么启示?

A:中国急诊科同样面临高压高负荷,这项研究提示:与其追求全科室无差别铺开,不如把 AI 决策支持优先嵌入放射学会诊等边界清晰、医生使用偏好更高的场景;同时要把降低医生操作负担、减少工作流打断纳入产品设计,并在本地开展前瞻性验证。

参考文献

  1. Leibovitch L, Ahituv A, Gorenshtein A, et al. Prospective evaluation of a large language model clinical decision support system in the emergency department. Nature Medicine. 2026. DOI: 10.1038/s41591-026-04601-5
  2. Vasey B, Nagendran M, Campbell B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. Nature Medicine. 2022. DOI: 10.1038/s41591-022-01772-9

本文基于 Prospective evaluation of a large language model clinical decision support system in the emergency department 的独立解读,仅供学术交流,不构成临床建议。

📄 论文原文信息

论文标题Prospective evaluation of a large language model clinical decision support system in the emergency department
作者Liron Leibovitch, Adi Ahituv, Alon Gorenshtein, Dvir Aran, Moran Sorka, Keren Miron, Shahar Shelly
期刊Nature Medicine
发表时间2026-08-19
DOI10.1038/s41591-026-04601-5
PubMedPMID: 42618632
论文原文信息地址:https://doi.org/10.1038/s41591-026-04601-5