← 行业趋势

HemaGuide:普通服务器跑通血液肿瘤MDT决策 — Nature Medicine发表前瞻静默试验,一致性达82.8%

血液肿瘤多学科会诊依赖亚专科专家,优质资源分布极不均衡。海德堡大学医院与 DKFZ 团队在 Nature Medicine 发表 HemaGuide:一个可本地部署的模块化大模型智能体,把非结构化病历转成结构化病例,自主路由到指南、进阶、分子三种决策模式,并接地于 2000 余例真实 MDT 病例记忆。外部验证 555 例一致性 81.8%,前瞻性静默试验 64 例达 82.8%,幻觉率仅 0.3%,全流程在普通硬件上中位 39 秒完成。

核心要点

  • 问题:血液系统恶性肿瘤的治疗决策高度依赖多学科肿瘤委员会(MDT)整合纵向治疗史、分子分型与快速更新的证据,但这种亚专科级别的深度会诊资源在各级医院之间分布极不均衡。
  • 方法:HemaGuide 是一个可本地部署的模块化大模型智能体,把非结构化临床文书转换为结构化病例表征,自主路由到"指南"“进阶"“分子"三种决策模式,并将推荐结果接地于疾病特异性指南流程图与一个包含 2000 余例真实 MDT 病例的临床决策记忆库。
  • 结果:第二家学术中心 555 例外部验证覆盖 47 个病种,一致性 81.8%;海德堡为期 1 个月、64 例连续未筛选病例的前瞻性静默试验一致性 82.8%;664 例评估中仅 2 例出现幻觉(0.3%);分子工作流在普通商用硬件上中位延迟 39 秒。
  • 意义:首次系统证明"本地可部署 + 病例接地 + 可审计"的大模型智能体能在跨机构、实时条件下稳定输出血液肿瘤决策支持,为数据不出院区的医院级 AI 落地提供了可复制范式。
  • 原文:Clinical decision support in hematological malignancies using a case-grounded AI agent,Nature Medicine,2026-06-30 | DOI: 10.1038/s41591-026-04494-4 | PMID: 42380678

HemaGuide 血液肿瘤多学科会诊场景概念图:会议室内医生围坐讨论,大屏显示白血病与淋巴瘤病例的分子图谱与治疗决策流程,桌上一台本地部署服务器以数据流连接大屏,象征数据不出院区的私有化AI决策支持

血液肿瘤MDT的资源鸿沟:好决策为什么这么贵

白血病、淋巴瘤、浆细胞疾病(Plasma Cell Disorders, PC disorders)这类血液系统恶性肿瘤,几乎是现代肿瘤学里决策最复杂的一档。一个患者的最优方案,往往要同时权衡:既往多线治疗的应答与毒性、二代测序(Next-Generation Sequencing, NGS)报出的驱动突变与耐药位点、造血干细胞移植与 CAR-T 的时机窗口,以及每年都在改写的 NCCN/ESMO 指南与刚读出的临床试验数据。

这正是多学科肿瘤委员会(Multidisciplinary Tumor Board, MDT)存在的意义——把血液科医生、病理科医生、遗传学家、移植专家拉到一张桌子上,用集体判断顶住单人认知的极限。问题在于,这种"亚专科级别的集体审议"本身就是稀缺品:它需要足够体量的专家池、固定的会议排期,以及在会前把上百页病历读透的时间成本。研究团队在论文中给出的判断很直接——获取这一层级会诊的机会正变得越来越不均衡(access to this level of subspecialty deliberation is increasingly uneven)。

于是问题被重新定义:能不能让 AI 不是去"回答一道医学考题”,而是去复现 MDT 这套集体审议的过程?这与我们此前报道的 MIRA——首个在 EHR 沙盒内完成全流程诊疗的自主智能体 属于同一条技术脉络,事实上两项研究共享同一位通讯作者 Jakob N. Kather。区别在于,MIRA 解决的是"AI 能不能在电子病历里动手做事”,而 HemaGuide 要回答的是更窄也更难的一问:在一个高度亚专科化的病种里,AI 给出的方案能不能和真实肿瘤委员会的决定对得上

HemaGuide 的三个核心创新:从"通用聊天"到"可审计智能体"

2026 年 6 月 30 日,海德堡大学医院、德国癌症研究中心(DKFZ)与德累斯顿工业大学、慕尼黑大学医院(LMU)联合团队在 Nature Medicine 发表了 HemaGuide。Julian Zoller 与 Michael Kalz 为共同第一作者,Jakob N. Kather 与 Mirco J. Friedrich 为共同通讯作者。其设计上有三处与主流"医疗大模型"截然不同的选择:

创新一:自主路由的三模态决策架构。 HemaGuide 不用一套提示词包打天下。系统在读完病例后会自主判断该走哪条路:常规病例进"指南模式"(guideline),按疾病特异性指南流程图逐节点推理;复杂或指南未覆盖的进"进阶模式"(advanced);涉及分子分型判读的进"分子模式"(molecular)。消融实验证实,性能增益是路由类型依赖的(routing-type-dependent),没有任何单一组件能通吃所有病例类型——这从反面否定了"堆一个更大的模型就够了"的思路。

创新二:2000 余例真实 MDT 病例构成的"临床决策记忆"。 这是"case-grounded(病例接地)“一词的实质:模型的推荐不是从参数记忆里生成的,而是检索并对齐真实肿瘤委员会做过的决定。记忆库构成为淋巴瘤 666 例、浆细胞疾病 1120 例、白血病 197 例。这一设计同时带来了可审计性——每条建议都能回溯到具体的指南节点和历史病例。

创新三:本地部署 + 商用硬件 + 实时响应。 全流程在普通商用硬件(commodity hardware)上跑完,中位延迟 39 秒(p95 为 62 秒),分子模式中位 45 秒(p95 123 秒)。作为对照,人工分子肿瘤委员会流程通常需要数小时。对医院而言更关键的是:基因组与临床数据全程不出院区,这在 GDPR 与国内医疗数据合规语境下几乎是准入门槛级的要求。

HemaGuide 技术架构示意图:非结构化临床文书经解析转为结构化病例表征,输入中央智能体后自主分流至指南、进阶、分子三条并行决策通道,下方2000余例真实肿瘤委员会病例记忆库通过检索箭头为决策提供接地支撑,侧方接入分子变异判读与指南流程图模块

技术原理:把病历"结构化”,再让智能体"查案例、走流程、给方案"

HemaGuide 的工作链条可以拆成四步。

第一步,文档结构化。 输入端是医院里真实存在的那堆东西:出院小结、骨髓穿刺报告、影像描述、NGS 报告——全是非结构化文本。智能体先把它们转换成结构化的病例表征(structured case representation),相当于替 MDT 做完了"会前读片读病历"这道最耗时的工序。

第二步,自主路由。 系统根据病例特征决定调用哪个决策模式。这一步是模块化设计的关键:它让不同复杂度的病例走不同深度的推理路径,既避免简单病例被过度推理,也防止复杂病例被指南流程图强行套死。

第三步,双重接地(grounding)。 推理过程被同时锚定在两个外部知识源上——疾病特异性的指南流程图(保证合规性)与真实病例记忆库(保证临床现实感)。这套"检索增强 + 流程约束"的组合,正是幻觉率被压到 0.3% 的直接原因。与我们此前解读的 PRISM2 病理基础模型 用海量数据做预训练不同,HemaGuide 走的是轻模型 + 强接地的路线,这也是它能在商用硬件上跑起来的前提。

第四步,分子变异判读。 针对 70 个临床相关错义突变(missense variant)的自动分类显示,其与专家标准高度一致:敏感度 0.88,特异度 0.84,阳性预测值 0.83,阴性预测值 0.89,组内相关系数(ICC)0.806。更重要的是安全性边界——没有任何一个致癌性变异被降级判为良性,这条"绝不漏掉坏消息"的约束比平均准确率更有临床意义。

值得一提的是,多智能体分工协作的思路已在多个临床场景被验证,我们此前报道的 Pythia 五智能体自主筛查认知障碍系统 是另一个典型案例;而在肿瘤领域,COMPASS 泛癌免疫治疗响应预测模型 则代表了另一条以分子数据驱动的路径。三者合起来,勾勒出临床 AI 从"单点预测"走向"流程复现"的整体趋势。

数据说话:外部验证81.8%、前瞻静默试验82.8%、幻觉率0.3%

HemaGuide 的验证链条相当克制,逐级抬高难度:从专家盲法基准测试,到消融拆解,到模拟实践,最后到跨中心外部验证与前瞻性静默试验。核心结果如下。

核心一致性结果(与真实肿瘤委员会决策相比)

验证场景 机构 / 设计 病例数 一致性 关键说明
外部验证 LMU 慕尼黑(第二学术中心) 555 例,47 个病种 81.8%(454/555) 评分者间 κ=0.934
前瞻性静默试验 海德堡,1 个月连续未筛选 64 例(筛自 92 例) 82.8%(53/64) 评分者间 κ=0.795
消融全代理(L10) 内部基准 15 例 86.7%(13/15) 纯 LLM 基线为 0%

外部验证按病种拆解(555 例)

病种分组 一致性 病例数
浆细胞疾病 90.9% 70/77
白血病 84.6% 99/117
淋巴瘤 79.2% 270/341
非恶性血液病 70.0% 15/20

前瞻性静默试验按病种拆解(64 例)

病种分组 一致性 病例数
白血病 88.9% 8/9
浆细胞疾病 82.4% 14/17
淋巴瘤 81.6% 31/38

HemaGuide vs 纯大模型(模拟实践研究,每病种 15 例未见过病例,中位正确数)

系统配置 正确数中位区间(/15) 对比 HemaGuide 的 P 值
HemaGuide(gpt-oss-120b 内核) 11.5 – 12.75
纯 gpt-oss-120b 3.5 – 7.5 淋巴瘤 P=0.0000306;浆细胞病 P=0.0000226;白血病 P=0.0021
gpt-5-mini 3.75 – 7.5 淋巴瘤 P=0.0208;浆细胞病 P=0.0001;白血病 P=0.0033

在 45 例高复杂度病例的专家盲法基准测试中(覆盖 6 个基础模型),纯大模型的平均评分为 3.21±0.39,嵌入 HemaGuide 框架后升至 4.22±0.063(P=0.0015)。

三个容易被忽略但更关键的数字:

  1. 幻觉率 0.3%——664 例评估中仅 2 例出现幻觉,且均出现在外部验证集,基准测试与静默试验中零发生。
  2. 住院医师接近资深水平——无辅助时住院医师与 MDT 真值的符合率约 60%;在 HemaGuide 辅助下达到接近资深医师的一致性,并在部分亚专科外的病例上超过了资深医师。这指向了 AI 最现实的价值定位:抹平经验梯度,而非取代顶端专家
  3. 不一致 ≠ 错误——在所有不一致病例中,平均 50.7%(±7.1% s.e.m.)属于 AI 选择了一个"合理的替代方案"而非真正犯错(基准测试 58.3%、外部验证 57.3%、静默试验 36.4%)。

HemaGuide 关键结果数据可视化:中心圆环仪表盘显示约八成的决策一致性水平,右侧分组柱状图对比不同病种组的表现差异,下方十一段渐进式条带图展示消融实验中各模块的累积增益,右下角秒表图标与极短延迟条、近乎空白的圆环分别表示数十秒级响应速度与极低的错误发生率

从实验室到临床:应用前景与必须正视的局限

应用前景可以落到四个具体场景:

  • 基层与地市级医院的"虚拟MDT"。血液肿瘤亚专科专家高度集中于头部中心,HemaGuide 这类系统可以让缺乏完整 MDT 编制的医院在本地获得接近亚专科水准的决策参考,直接对应"资源不均衡"这一原始痛点。
  • 住院医师与规培医师的实时带教。60% → 接近资深水平的跃升,意味着它可以作为一个"随时在线的上级医师",尤其在夜班、跨亚专科值班等场景。
  • 分子肿瘤委员会(MTB)提速。把原本需要数小时的分子解读压缩到 39 秒中位延迟,且不漏判致癌性变异,这对 NGS 报告积压严重的机构是可量化的效率增益。
  • 数据合规敏感场景的私有化交付。本地部署 + 商用硬件的组合,意味着不必把患者基因组数据传到院外云端。

但必须指出的局限至少有三条:

第一,“与MDT一致"不等于"患者获益”。研究的主要终点是决策一致性(concordance),而非无进展生存期、总生存期或治疗毒性等硬终点。作者自己也明确表示,HemaGuide 是否真正改善工作流、决策质量或患者结局"仍有待确立"(remains to be established)。

第二,前瞻性验证的体量仍然很小。静默试验只有 1 个月、64 例,且淋巴瘤占 38 例,白血病仅 9 例——按病种拆开后,单组样本量不足以支撑稳健的亚组结论。

第三,非恶性血液病是明显短板。外部验证中该组一致性仅 70.0%(15/20),显著低于三类恶性肿瘤。这暴露了病例记忆库的覆盖偏倚:记忆库的 2000 余例主要来自恶性肿瘤 MDT,罕见与非恶性病种天然接地不足。

此外还需警惕人机交互层面的风险。我们此前解读的 Automation Bias 随机对照试验 已经证明,即便是受过 AI 素养培训的医生,在接触到错误 AI 建议后诊断准确率仍会显著下降。一个 82.8% 一致性的系统,剩下那 17.2% 会如何影响医生的独立判断,需要专门的前瞻性研究来回答。

结论与产业启示:医院级AI的胜负手正在从"模型"转向"工程"

HemaGuide 给出的最重要结论,可能并不是那几个一致性数字,而是消融实验里那个刺眼的对照:纯大模型基线一致性 0%,全代理架构 86.7%。同一个底层模型,加上文档结构化、自主路由、指南流程接地、病例记忆检索这一整套工程化封装之后,性能从完全不可用变成了接近临床可参考。

这条结论对产业界的启示非常直白:在垂直医疗场景里,决定成败的往往不是模型参数量,而是围绕模型构建的检索、路由、约束与审计体系。 也正因如此,“本地部署 + 商用硬件"才成为可能——当能力主要来自工程架构而非模型规模时,私有化交付的算力门槛就被大幅拉低了。

这与思陌智能科研服务一直坚持的技术路线高度一致。我们在医疗 AI 软件开发中同样把重心放在三件事上:把医院存量的非结构化文书(病历、报告、影像描述)转化为可计算的结构化表征用院内真实病例与本地指南构建可检索、可审计的领域知识底座以私有化部署方式交付,确保数据不出院区。HemaGuide 用一篇 Nature Medicine 证明了这条路径在最复杂的血液肿瘤场景中同样成立——对正在规划智慧医疗与临床科研平台的机构而言,这是一份很有分量的可行性背书。

相关问题

Q:HemaGuide 现在可以直接用于临床决策吗? A:不能。目前它只完成了"静默试验”——即系统给出建议但不影响真实诊疗,事后再与肿瘤委员会决定比对。研究尚未评估其对患者生存、治疗毒性等硬终点的影响,作者本人也强调临床获益"仍有待确立",距离常规临床使用还需要更大规模的前瞻性研究与监管审评。

Q:82.8% 的一致性算高还是低?剩下的 17.2% 是不是都错了? A:需要分开看。研究发现在所有不一致的病例中,平均约 50.7% 属于 AI 选了一个临床上同样合理的替代方案,而非真正的错误判断——血液肿瘤的很多决策本身就存在多个可接受选项。真正意义上的"幻觉"(生成不存在或明显错误的信息)在 664 例评估中只出现了 2 例,占 0.3%。

Q:这类系统会取代血液科医生或 MDT 吗? A:研究数据指向的恰恰相反。最显著的增益出现在住院医师身上——从约 60% 提升到接近资深医师水平;而对本亚专科内的资深专家,帮助相对有限。它更像是一个抹平经验梯度的工具,让年轻医生和资源不足的医院更快接近专家水准,而不是替换掉决策链条顶端的人。

Q:本地部署具体意味着什么?普通医院的算力够吗? A:意味着模型与病例记忆库都运行在医院自己的服务器上,患者的病历和基因组数据全程不上传外部云端,天然满足数据合规要求。研究明确说明全流程在"商用硬件"(commodity hardware)上完成,分子工作流中位延迟仅 39 秒,说明其算力门槛远低于训练大规模基础模型,具备在中等规模医院落地的现实条件。

参考文献

  1. Zoller J, Kalz M, Wu X, et al. Clinical decision support in hematological malignancies using a case-grounded AI agent. Nature Medicine. 2026 Jun 30. DOI: 10.1038/s41591-026-04494-4 | PMID: 42380678

  2. Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents. Nature. 2026;655:1282-1291. DOI: 10.1038/s41586-026-10675-5 | PMID: 42310457

  3. Vorontsov E, Shaikovski G, Casson A, et al. End-to-end multimodal pathology foundation model with clinical dialogue. Nature Medicine. 2026 Jul 31. DOI: 10.1038/s41591-026-04521-4 | PMID: 42538427

本文基于 Clinical decision support in hematological malignancies using a case-grounded AI agent 的独立解读,仅供学术交流,不构成临床建议。

📄 论文原文信息

论文标题Clinical decision support in hematological malignancies using a case-grounded AI agent
作者Julian Zoller, Michael Kalz, Xuewei Wu, Sven Cuntz, Linus Kruk, Niklas Kehl, Julius J. Michel, Cornelius Funk, Sarah Richter, Tobias Tix, David Sedloev, Jonathan Naboschni, Jan H. Frenking, Silvia Barbosa, Oliver L. Saldanha, Alanna Kirschner, Anna D. Metzler, Antonia Schach, René Onken, Tim R. Wagner, Martin Dugas, Andreas Trumpp, Martin Dreyling, Michael von Bergwelt-Baildon, Kai Rejeski, Tim Sauer, Peter Dreger, Marc S. Raab, Carsten Müller-Tidow, Jakob N. Kather, Mirco J. Friedrich
期刊Nature Medicine
发表时间2026-06-30
DOI10.1038/s41591-026-04494-4
PubMedPMID: 42380678