AUGUST:顺序问答AI分步诊断胃癌,2.3万张切片验证超越现有模型
AUGUST 把病理医生的分步推理显式建模进 AI:先定肿瘤有无、再判是否恶性、后定分化程度,以顺序问答框架在 23072 张胃全切片、19 个层级任务、79924 组问答对上验证,自主与人机协同两种设定下均超越现有模型。
核心要点
- 问题:胃癌病理诊断是层层递进的决策过程——先看有无肿瘤、再判是否恶性、后定分化程度,每一步都依赖上一步;但现有 AI 把各任务孤立处理,容易给出逻辑自相矛盾的结论。
- 方法:AUGUST 用「顺序问答」框架模仿病理医生的分步推理,把诊断的层级依赖显式建模进模型,并把答案约束在临床有效路径上。
- 结果:在 23072 张胃全切片、19 个层级任务、79924 组问答对上验证,自主与人机协同两种设定下均超越现有 MIL、视觉语言与基础模型,层级一致性更优。
- 意义:为「可解释、贴合临床推理」的病理 AI 提供新范式,可作为病理医生决策辅助工具。
- 原文:Sequential question answering AI for hierarchical gastric pathology diagnosis,npj Digital Medicine,2026-08-10
1. 胃癌病理诊断的临床挑战
胃癌(gastric cancer)是全球最常见的恶性肿瘤之一,在东亚地区(中国、韩国、日本)尤为高发。对疑似胃癌的患者,胃镜活检的病理切片判读是确诊和指导治疗的「金标准」:切片上有没有癌细胞、是什么类型、恶性程度有多高,直接决定了患者要不要手术、怎么用药。
这一诊断其实是一个层层递进、环环相扣的过程,而不是「一次判完」。病理医生先看切片上有没有幽门螺杆菌(Helicobacter pylori)感染,再看它属于炎症、良性肿瘤、异型增生还是癌症;如果确诊是癌,还要进一步判断是腺癌、鳞癌还是神经内分泌癌;最后给出分化程度——高分化、中分化,还是恶性程度更高的低分化或低黏附性癌。每一步的答案都依赖上一步的结果,比如「分化程度」只有在确诊腺癌之后才有临床意义。
问题在于,目前绝大多数病理 AI 恰恰忽略了这一点:它们把每一个诊断任务当成彼此孤立的任务来训练,结果就是模型可能给出逻辑上自相矛盾的结论——连「是不是癌」还没判清,就谈「低分化」。这种与真实诊断流程的错位,成为病理 AI 临床落地的重要障碍。
2. AUGUST 的核心创新
研究团队把这一系统命名为 AUGUST(Adaptive Unified Gastric diagnosis Using Sequential Tasks,基于顺序任务的自适应统一胃部诊断系统),创新集中在三点。
第一,用「顺序问答」显式建模诊断的层级依赖。过去的病理 AI 把各任务独立处理,AUGUST 则让模型基于前一步的结论,迭代生成下一步所需的问题并作答,把答案约束在「临床有效路径」上,从根源上减少逻辑跳步与自相矛盾。
第二,上下文感知的全切片表征。AUGUST 不是孤立地看整张全切片图像(whole slide image, WSI),而是根据当前诊断步骤的问题,把 WSI 投射成「上下文感知」的表征,让模型聚焦与当前步骤相关的区域,从而提升判读精度。
第三,三阶段渐进式预训练。从「对齐视觉与诊断概念」到「习得诊断行为」再到「思维链多轮推理」,训练方式本身也在模拟病理医生从入门到熟练的成长路径。
3. 技术原理:先问有没有、再问恶不恶、后问分没分
AUGUST 的工作流程可以概括为「先问有没有、再问恶不恶、后问分没分」三个递进环节。输入是一张胃镜活检的全切片图像,输出是结构化的诊断结果,外加一条可追溯的推理链。
处理流程上,模型不会一步给出最终结论,而是逐步生成并回答「当前步骤需要什么」的问题:先判断有无肿瘤;若有,再判断是否恶性;若恶性,再进一步细分病理类型与分化程度。每一步的问题都以前一步的答案为前提,最终把答案约束在临床上有效的路径内。评价方式上,研究把 AUGUST 与当前主流的多实例学习(MIL)、病理专用视觉语言模型以及多模态基础模型做对比,分别在「全自主」和「人机协同」两种设定下评估诊断准确率与层级一致性。
需要说明,这里验证的是 AUGUST 这一研究原型系统的诊断能力,而非已获批上市的商业产品;其透明推理链服务于病理医生复核,而非替代医生的判断。
4. 数据说话:23072 张切片、19 个层级任务
论文报告的核心结果如下表。
| 研究维度 | 比较对象 | 核心结果 | 统计证据 |
|---|---|---|---|
| 评估规模 | AUGUST | 23072 张胃全切片、19 个层级任务、79924 组问答对 | 论文摘要明确报告 |
| 训练规模 | 内部数据集 | 6913 张全切片、27069 组问答对 | 论文与官方仓库报告 |
| 自主诊断 | 对比现有 MIL / 视觉语言 / 基础模型 | 超越现有 SOTA 模型 | 摘要报告,未给出具体 F1/P 值 |
| 人机协同 | 对比现有 SOTA 模型 | 超越现有 SOTA 模型 | 摘要报告,未给出具体 F1/P 值 |
| 层级一致性 | 粗、细、分级三类任务 | 一致性更优 | 摘要报告,未给出具体数值 |
最值得关注的是,论文在「全自主」和「人机协同」两种设定下都报告 AUGUST 优于现有模型,并强调其层级一致性更优——这意味着模型不仅「更准」,而且「更少自相矛盾」。不过也要客观看待:论文摘要是定性表述,未给出具体的 F1 分数与 P 值,具体的量化对比需查阅正文表格,本文不作推算或补写。
5. 从实验室到临床:应用前景与局限
对应三个可能的应用场景。其一,作为病理医生的「第二阅片人」,用可追溯的推理链辅助胃癌切片判读,尤其减轻年资较低医生的负担;其二,用于基层医院的病理质控,以透明问答链帮助发现逻辑不一致的判读;其三,用于病理教学培训,让学员看到「医生式」的分步推理过程。
但至少有两条局限需要正视。第一,这是回顾性基准评估(benchmark),没有前瞻性临床验证,也未报告长期患者结局,距离临床落地还需多中心、前瞻性研究。第二,论文摘要未报告具体量化指标,且模型在不同机构、不同染色与扫描设备上的泛化表现尚需外部验证——尤其罕见癌种的样本稀缺问题依然存在。
6. 结论与产业启示
这项研究给出一个清晰信号:把病理诊断的层级依赖显式建模进 AI,能让模型「更准、更一致、更可解释」——这正是病理 AI 从「检测病灶」走向「辅助决策」的关键一步。这与我们此前关注的病理基础模型 PRISM2和可解释病理 AI PathPrism一脉相承,共同指向「可解释、贴合临床工作流的病理 AI」这一落地方向。
对医疗 AI 企业有三点建议:一是把「层级依赖 + 顺序推理」纳入架构设计,让模型输出贴合医生真实决策路径;二是把「可追溯的推理链」作为病理 AI 的标配,降低黑箱风险、便于质控复核;三是补足罕见类别与外部验证,避免长尾癌种成为落地短板。
这也正是思陌智能科研服务长期投入的方向:面向医学影像 AI 与临床决策支持,提供从模型开发、可解释性设计到多中心验证的完整科研服务,协助团队把病理 AI 从论文原型推进到可落地的临床评估。
相关问题
Q:AUGUST 已经能用于临床自主诊断了吗?
A:不能。这是回顾性基准研究,作者将其定位为病理医生的决策辅助工具,并未声称可独立诊断。论文也未报告前瞻性临床验证,任何诊断结论仍需病理医生复核,落地前需多中心、前瞻性研究。
Q:会取代病理医生吗?
A:不会。AUGUST 的价值在于「辅助」——用透明推理链帮医生复核与提升一致性,而非替代。它更像第二阅片人或教学工具,最终诊断责任仍在医生。
Q:测试的是模型还是完整产品?
A:是 AUGUST 研究原型系统,不是已获批上市的商业产品。它在特定数据集上验证,能否迁移到其他医院、不同染色与扫描设备,仍需外部验证。患者不应据此自行解读病理结果。
参考文献
- Quoc KN, Song J, Lee C, et al. Sequential question answering AI for hierarchical gastric pathology diagnosis. npj Digital Medicine. 2026. DOI: 10.1038/s41746-026-03107-1
- Li H, et al. End-to-end multimodal pathology foundation model with clinical dialogue. Nature Medicine. 2026. DOI: 10.1038/s41591-026-04521-4
本文基于 Sequential question answering AI for hierarchical gastric pathology diagnosis 的独立解读,仅供学术交流,不构成临床建议。
📄 论文原文信息
| 论文标题 | Sequential question answering AI for hierarchical gastric pathology diagnosis |
| 作者 | Khang Nguyen Quoc, Jinsol Song, Chaeyeon Lee, Seung-Won Jung, Jin Tae Kwak, Kwangil Yim, Yosep Chong |
| 期刊 | npj Digital Medicine |
| 发表时间 | 2026-08-10 |
| DOI | 10.1038/s41746-026-03107-1 |