← 行业趋势

多智能体大模型辅助卒中治疗决策:医生准确率从73.1%提升到88.6%

急性缺血性卒中治疗选择复杂且易出错。上海六院团队开发结构化多智能体大模型框架,在医生决策研究中将急性缺血性卒中治疗决策准确率从73.1%提升至88.6%,并降低幻觉与遗漏率,提示其有望缩小不同年资医生的决策差距。

核心要点

  • 问题:急性缺血性卒中治疗选择需在时间窗内整合临床、影像与检验数据,复杂且易出错。
  • 方法:上海六院团队开发结构化多智能体大模型框架,基于2081例真实与文献病例验证,并开展12名医生的前瞻性决策研究。
  • 结果:大模型辅助使医生治疗决策准确率从73.1%升至88.6%(OR 2.86,95% CI 2.27–3.60)。
  • 意义:多智能体编排可提升基层与非专科医生的卒中决策一致性,但仍需前瞻性多中心研究验证临床结局。
  • 原文A Multiagent Large Language Model Framework for Emergency Treatment Recommendation in Acute Ischemic Stroke: Development and Validation Study,Journal of Medical Internet Research,2026-07-30(PMID: 42531250

概念视觉:多智能体大模型在急性缺血性卒中急救中作为医生决策协作者,整合临床、影像与检验信息并生成结构化治疗建议,仅作概念示意,不含真实患者数据与诊断结论。

1. 急性缺血性卒中治疗决策的临床挑战

急性缺血性卒中(Acute Ischemic Stroke,AIS)的治疗选择是一场与时间赛跑的决策。静脉溶栓、血管内取栓或标准内科治疗各有严格的时间窗、禁忌证与适应证,医生必须在短时间内整合神经功能评分、影像 eligibility、化验结果与既往史,做出正确判断。上海六院团队在论文开篇指出,这一过程高度依赖专科经验,且对安全攸关的错误极为敏感。在医疗资源分布不均、神经专科医生短缺的地区,基层与非专科医生独立决策的准确性难以稳定保障。正是在这一高复杂、高风险的场景下,由大语言模型(Large Language Model,LLM)驱动的临床决策支持系统被寄予厚望,但它能否在真实病例中既提升准确性又不引入新的安全隐患,此前缺乏系统证据。

2. 结构化多智能体框架的核心创新

既往单一大模型在卒中治疗推荐中常因长文本、模糊输出和幻觉而难以直接用于临床。本研究的核心创新在于把决策拆解为多个专职智能体协作。

第一,过去医生或单一模型需一次性消化冗长病历并直接给出结论;论文引入一个摘要智能体,先提炼关键临床叙事,降低后续推理噪声。第二,过去通用大模型输出自由文本、难以审计;论文设计遵循指南的推理链智能体,将建议约束在可解释、可勾选的结构化类别(静脉溶栓、血管内取栓、标准内科治疗、非AIS、非卒中,以及TOAST分型)。第三,过去模型错误难以被发现;论文加入约束智能体,对最终输出做格式与一致性把关。三个智能体分工协作,使输出既符合临床指南,又便于医生复核与追溯。论文并未声称这是首个此类框架,而是强调其在真实多中心病例上的系统化验证与可审计性,这与面向电子病历的自主医疗智能体 MIRA 的编排思路相呼应。

3. 技术原理:多智能体如何协作生成可审计的治疗建议

整个框架的输入是结构化与半结构化的病例信息,包括主诉、神经功能评分、影像报告与化验结果。摘要智能体先生成标准化病例摘要;推理智能体依据急性卒中诊治指南,沿时间窗、禁忌证、影像 eligibility 等维度逐步推导,产出治疗推荐与TOAST分型;约束智能体再将结果压缩为临床可解释的多选类别,并校验一致性。研究在多个基座模型(百川、通义千问、DeepSeek、GPT)上测试该框架,各智能体在研究中扮演的是流程编排与约束角色,而非替代医生做出最终临床决定。需要明确的是,框架本身是一个研究原型与决策支持工具,不等同于经过医疗器械审批、可直接部署的完整产品。

技术流程示意图:摘要智能体提炼病历、推理智能体按指南推导治疗与TOAST分型、约束智能体校验输出一致性的多智能体协作流程,仅示意图,不含虚构数据。

4. 数据说话:医生决策准确率的提升

研究最终纳入1055例A组、721例B组、144例C组(文献挑战病例)与161例D组(前瞻性收集)病例,并在12名不同年资与专科背景的医生中开展前瞻性决策研究。

研究维度 比较对象 核心结果 统计证据
治疗决策准确率 无AI支持 vs 有AI支持(医生前瞻研究) 73.1% 升至 88.6% OR 2.86,95% CI 2.27–3.60,P<0.001
TOAST分型准确率 无AI支持 vs 有AI支持 提升 OR 3.63,95% CI 2.85–4.64,P<0.001
幻觉事件率 基座模型 vs 多智能体框架 33.6% 降至 20.6% 原文报告,未提供CI
遗漏事件率 基座模型 vs 多智能体框架 38.5% 降至 24.5% 原文报告,未提供CI
临床安全评分 基座模型 vs 多智能体框架 3.70 升至 4.01(5分制) 原文报告,未提供CI

在模型层面,多智能体框架使A组治疗推荐准确率由0.546–0.737提升至0.687–0.851,B组由0.587–0.698提升至0.671–0.813,C组由0.507–0.646提升至0.667–0.750,平均提升约18.9%。收益在低级年资与跨专科医生中最大:初级专科医生准确率由0.667升至0.833,初级非专科医生由0.600升至0.846。上述为决策准确率与代理安全指标,不等同于患者结局改善。

概念示意图:医生在有无大模型辅助下急性缺血性卒中治疗决策准确率对比,柱状对比73.1%与88.6%,仅示意核心关系,不含精确统计推断。

5. 从实验室到临床:应用前景与局限

该框架可能用于两类场景:一是基层与转诊医院中,作为神经专科医生的第二意见,帮助非卒中专科医生在黄金时间窗内快速形成符合指南的治疗与分型建议;二是作为教学与质控工具,标准化年轻医生的决策路径。然而,研究存在明确局限。

第一,验证建立在历史病例与医生决策层面,并未测量对真实临床工作流或患者结局(如再通率、致残率、死亡率)的影响,作者明确呼吁开展前瞻性多中心研究。第二,病例与医生均来自单一开发机构(上海六院),且框架表现依赖于所接入的特定基座模型,外部人群与不同模型上的泛化能力尚待验证。第三,安全评分与幻觉、遗漏率为代理指标,不能替代独立的安全性与等效性评估。与既往关于LLM辅助诊断推理的研究一致,医生在采纳AI建议时仍须保持独立判断,避免 自动化偏误 带来的错误传导。

6. 结论与产业启示

这项开发验证研究表明,结构化的多智能体大模型编排能够在不增加幻觉与遗漏的前提下,显著提升医生(尤其是低年资与非专科医生)的急性缺血性卒中治疗决策准确性。对医疗AI企业而言,三点启示值得关注:其一,把复杂临床决策拆解为可审计的专职智能体,比单一大模型直接出结论更可行、更安全;其二,决策支持系统的价值应以医生决策准确率和可审计性为核心指标,而非模型自身的单项分数;其三,真实部署前必须经过前瞻性多中心、覆盖工作流与患者结局的验证。

思陌智能科研服务面向医疗机构与AI团队,提供医疗大模型微调、医学影像AI与多智能体临床工作流的设计、评估与验证服务,可协助将此类决策支持原型转化为经得起临床与监管检验的可靠系统。

相关问题

Q:这项AI系统现在能直接用于临床吗?

A:目前不能。研究本身是开发验证性质,病例验证基于历史数据与医生决策层面,并未评估对真实临床工作流或患者结局的影响。作者在结论中明确呼吁开展前瞻性多中心研究。任何用于卒中治疗决策的系统,都需经过监管审批与前瞻验证后方可进入临床。

Q:AI会取代卒中医生吗?

A:不会。论文中AI以辅助形式出现,最终治疗与分型决定仍由医生作出;框架的价值在于提升非专科与低年资医生的决策一致性。研究也未比较AI单独决策与医生决策,而是衡量有、无AI支持时医生表现的差异。

Q:这套框架对中国基层医院有意义吗?

A:有意义但需验证。卒中专科资源在城乡间分布不均,结构化多智能体可作为第二意见缩小决策差距,尤其利好非专科医生。但本研究病例与医生来自单一机构,在中国基层与农村人群中的泛化能力尚未验证,需后续多中心数据支撑。

参考文献

  1. Yan B, Zhang R, Chen L, Song X, Cao Z, Li Y. A Multiagent Large Language Model Framework for Emergency Treatment Recommendation in Acute Ischemic Stroke: Development and Validation Study. J Med Internet Res. 2026. DOI: 10.2196/96304(PMID: 42531250
  2. Ferber D, Hilgers L, Höper C, Kinny-Köster B, Eckardt J, Egger-Heidrich K, Bill M, Schneider M, Clusmann J, Kadric L, Oehme M, Mayrhofer-Schmid M, Oeser A, Wölflein G, Wiest I, Middeke J, Iafrate A, Truhn D, Jäger D, Kather J. Towards Autonomous Medical Artificial Intelligence Agents. Nature. 2026. DOI: 10.1038/s41586-026-10675-5(PMID: 42310457

本文基于 A Multiagent Large Language Model Framework for Emergency Treatment Recommendation in Acute Ischemic Stroke: Development and Validation Study 的独立解读,仅供学术交流,不构成临床建议。

📄 论文原文信息

论文标题A Multiagent Large Language Model Framework for Emergency Treatment Recommendation in Acute Ischemic Stroke: Development and Validation Study
作者Bicong Yan, Ruipeng Zhang, Li Chen, Xinyu Song, Zhongzheng Cao, Yuehua Li et al.
期刊Journal of Medical Internet Research
发表时间2026-07-30
DOI10.2196/96304
PubMedPMID: 42531250
论文原文信息地址:https://doi.org/10.2196/96304