← 行业趋势

AUGUST:顺序问答AI分步诊断胃癌,2.3万张切片验证超越现有模型

AUGUST 把病理医生的分步推理显式建模进 AI:先定肿瘤有无、再判是否恶性、后定分化程度,以顺序问答框架在 23072 张胃全切片、19 个层级任务、79924 组问答对上验证,自主与人机协同两种设定下均超越现有模型。

核心要点

  • 问题:胃癌病理诊断是层层递进的决策过程——先看有无肿瘤、再判是否恶性、后定分化程度,每一步都依赖上一步;但现有 AI 把各任务孤立处理,容易给出逻辑自相矛盾的结论。
  • 方法:AUGUST 用「顺序问答」框架模仿病理医生的分步推理,把诊断的层级依赖显式建模进模型,并把答案约束在临床有效路径上。
  • 结果:在 23072 张胃全切片、19 个层级任务、79924 组问答对上验证,自主与人机协同两种设定下均超越现有 MIL、视觉语言与基础模型,层级一致性更优。
  • 意义:为「可解释、贴合临床推理」的病理 AI 提供新范式,可作为病理医生决策辅助工具。
  • 原文Sequential question answering AI for hierarchical gastric pathology diagnosis,npj Digital Medicine,2026-08-10

一幅概念视觉:医学蓝绿配色的抽象画面,中央一枚发光的胃部组织切片剪影,周围悬浮着多个由箭头依次相连的半透明节点,象征从「有无病变」到「性质判断」再到「分化分级」的递进推理过程,画面无文字、无数据、无真实患者形象

1. 胃癌病理诊断的临床挑战

胃癌(gastric cancer)是全球最常见的恶性肿瘤之一,在东亚地区(中国、韩国、日本)尤为高发。对疑似胃癌的患者,胃镜活检的病理切片判读是确诊和指导治疗的「金标准」:切片上有没有癌细胞、是什么类型、恶性程度有多高,直接决定了患者要不要手术、怎么用药。

这一诊断其实是一个层层递进、环环相扣的过程,而不是「一次判完」。病理医生先看切片上有没有幽门螺杆菌(Helicobacter pylori)感染,再看它属于炎症、良性肿瘤、异型增生还是癌症;如果确诊是癌,还要进一步判断是腺癌、鳞癌还是神经内分泌癌;最后给出分化程度——高分化、中分化,还是恶性程度更高的低分化或低黏附性癌。每一步的答案都依赖上一步的结果,比如「分化程度」只有在确诊腺癌之后才有临床意义。

问题在于,目前绝大多数病理 AI 恰恰忽略了这一点:它们把每一个诊断任务当成彼此孤立的任务来训练,结果就是模型可能给出逻辑上自相矛盾的结论——连「是不是癌」还没判清,就谈「低分化」。这种与真实诊断流程的错位,成为病理 AI 临床落地的重要障碍。

2. AUGUST 的核心创新

研究团队把这一系统命名为 AUGUST(Adaptive Unified Gastric diagnosis Using Sequential Tasks,基于顺序任务的自适应统一胃部诊断系统),创新集中在三点。

第一,用「顺序问答」显式建模诊断的层级依赖。过去的病理 AI 把各任务独立处理,AUGUST 则让模型基于前一步的结论,迭代生成下一步所需的问题并作答,把答案约束在「临床有效路径」上,从根源上减少逻辑跳步与自相矛盾。

第二,上下文感知的全切片表征。AUGUST 不是孤立地看整张全切片图像(whole slide image, WSI),而是根据当前诊断步骤的问题,把 WSI 投射成「上下文感知」的表征,让模型聚焦与当前步骤相关的区域,从而提升判读精度。

第三,三阶段渐进式预训练。从「对齐视觉与诊断概念」到「习得诊断行为」再到「思维链多轮推理」,训练方式本身也在模拟病理医生从入门到熟练的成长路径。

3. 技术原理:先问有没有、再问恶不恶、后问分没分

AUGUST 的工作流程可以概括为「先问有没有、再问恶不恶、后问分没分」三个递进环节。输入是一张胃镜活检的全切片图像,输出是结构化的诊断结果,外加一条可追溯的推理链。

处理流程上,模型不会一步给出最终结论,而是逐步生成并回答「当前步骤需要什么」的问题:先判断有无肿瘤;若有,再判断是否恶性;若恶性,再进一步细分病理类型与分化程度。每一步的问题都以前一步的答案为前提,最终把答案约束在临床上有效的路径内。评价方式上,研究把 AUGUST 与当前主流的多实例学习(MIL)、病理专用视觉语言模型以及多模态基础模型做对比,分别在「全自主」和「人机协同」两种设定下评估诊断准确率与层级一致性。

需要说明,这里验证的是 AUGUST 这一研究原型系统的诊断能力,而非已获批上市的商业产品;其透明推理链服务于病理医生复核,而非替代医生的判断。

一幅技术流程示意图:左侧为胃全切片图像输入的抽象节点,中间依次排列多个由向右箭头相连的半透明圆角模块,象征「有无肿瘤—是否恶性—类型与分化」的递进问答,右侧汇合到结构化诊断输出的节点,整体为纯几何图形与箭头连接,无文字、无标签、无具体数字

4. 数据说话:23072 张切片、19 个层级任务

论文报告的核心结果如下表。

研究维度 比较对象 核心结果 统计证据
评估规模 AUGUST 23072 张胃全切片、19 个层级任务、79924 组问答对 论文摘要明确报告
训练规模 内部数据集 6913 张全切片、27069 组问答对 论文与官方仓库报告
自主诊断 对比现有 MIL / 视觉语言 / 基础模型 超越现有 SOTA 模型 摘要报告,未给出具体 F1/P 值
人机协同 对比现有 SOTA 模型 超越现有 SOTA 模型 摘要报告,未给出具体 F1/P 值
层级一致性 粗、细、分级三类任务 一致性更优 摘要报告,未给出具体数值

最值得关注的是,论文在「全自主」和「人机协同」两种设定下都报告 AUGUST 优于现有模型,并强调其层级一致性更优——这意味着模型不仅「更准」,而且「更少自相矛盾」。不过也要客观看待:论文摘要是定性表述,未给出具体的 F1 分数与 P 值,具体的量化对比需查阅正文表格,本文不作推算或补写。

一张结果关系示意图:左侧用并列的抽象色块表示 AUGUST 与现有 SOTA 模型的相对高低对比,右侧用一条上行箭头指向「准确性与一致性更优」的含义,整体为几何色块与箭头关系,不含具体坐标刻度与数字标注,仅为概念示意图

5. 从实验室到临床:应用前景与局限

对应三个可能的应用场景。其一,作为病理医生的「第二阅片人」,用可追溯的推理链辅助胃癌切片判读,尤其减轻年资较低医生的负担;其二,用于基层医院的病理质控,以透明问答链帮助发现逻辑不一致的判读;其三,用于病理教学培训,让学员看到「医生式」的分步推理过程。

但至少有两条局限需要正视。第一,这是回顾性基准评估(benchmark),没有前瞻性临床验证,也未报告长期患者结局,距离临床落地还需多中心、前瞻性研究。第二,论文摘要未报告具体量化指标,且模型在不同机构、不同染色与扫描设备上的泛化表现尚需外部验证——尤其罕见癌种的样本稀缺问题依然存在。

6. 结论与产业启示

这项研究给出一个清晰信号:把病理诊断的层级依赖显式建模进 AI,能让模型「更准、更一致、更可解释」——这正是病理 AI 从「检测病灶」走向「辅助决策」的关键一步。这与我们此前关注的病理基础模型 PRISM2可解释病理 AI PathPrism一脉相承,共同指向「可解释、贴合临床工作流的病理 AI」这一落地方向。

对医疗 AI 企业有三点建议:一是把「层级依赖 + 顺序推理」纳入架构设计,让模型输出贴合医生真实决策路径;二是把「可追溯的推理链」作为病理 AI 的标配,降低黑箱风险、便于质控复核;三是补足罕见类别与外部验证,避免长尾癌种成为落地短板。

这也正是思陌智能科研服务长期投入的方向:面向医学影像 AI 与临床决策支持,提供从模型开发、可解释性设计到多中心验证的完整科研服务,协助团队把病理 AI 从论文原型推进到可落地的临床评估。

相关问题

Q:AUGUST 已经能用于临床自主诊断了吗?

A:不能。这是回顾性基准研究,作者将其定位为病理医生的决策辅助工具,并未声称可独立诊断。论文也未报告前瞻性临床验证,任何诊断结论仍需病理医生复核,落地前需多中心、前瞻性研究。

Q:会取代病理医生吗?

A:不会。AUGUST 的价值在于「辅助」——用透明推理链帮医生复核与提升一致性,而非替代。它更像第二阅片人或教学工具,最终诊断责任仍在医生。

Q:测试的是模型还是完整产品?

A:是 AUGUST 研究原型系统,不是已获批上市的商业产品。它在特定数据集上验证,能否迁移到其他医院、不同染色与扫描设备,仍需外部验证。患者不应据此自行解读病理结果。

参考文献

  1. Quoc KN, Song J, Lee C, et al. Sequential question answering AI for hierarchical gastric pathology diagnosis. npj Digital Medicine. 2026. DOI: 10.1038/s41746-026-03107-1
  2. Li H, et al. End-to-end multimodal pathology foundation model with clinical dialogue. Nature Medicine. 2026. DOI: 10.1038/s41591-026-04521-4

本文基于 Sequential question answering AI for hierarchical gastric pathology diagnosis 的独立解读,仅供学术交流,不构成临床建议。

📄 论文原文信息

论文标题Sequential question answering AI for hierarchical gastric pathology diagnosis
作者Khang Nguyen Quoc, Jinsol Song, Chaeyeon Lee, Seung-Won Jung, Jin Tae Kwak, Kwangil Yim, Yosep Chong
期刊npj Digital Medicine
发表时间2026-08-10
DOI10.1038/s41746-026-03107-1
论文原文信息地址:https://doi.org/10.1038/s41746-026-03107-1