自主多模态眼科AI智能体AgentEYE:循证可追溯的报告将诊断正确率提升到83%
浙江大学金凯团队开发自主多模态眼科AI智能体,可自动识别眼底照片与眼部B超影像、调用专科工具并检索指南证据。302例内部基准诊断正确性71.93、完整性75.59;200例医生盲评正确率83%、潜在有害输出仅3.5%。研究为回顾性设计,作为临床决策支持原型仍待前瞻性多中心验证。
核心要点
- 问题:眼科真实诊断需综合眼底照相、眼部B超等多模态影像与指南证据,现有AI多为单任务、弱循证、难追溯。
- 方法:浙江大学团队开发模块化智能体AgentEYE,在302例内部多模态基准与200例医生盲法评估中对照大模型基线。
- 结果:医生盲评诊断正确率83.0%* vs 42.0%,潜在有害输出3.5% vs 29.0%。
- 意义:AgentEYE是可审计的眼科临床决策支持原型,价值在可追溯与报告质量,尚不能替代医生,需前瞻性验证。
- 原文:An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis,Cell Reports Medicine,2026-08-05(PMID: 42556343)
1. 眼科多模态诊断的临床挑战
眼科临床诊断从来不是单张图片的分类题。以眼底照相(fundus photography)、眼部B超(B-scan ultrasonography)为代表的影像各有侧重,医生需要把两者与病史、体征和指南综合起来,才能形成可靠的诊断与管理建议。过去十余年,基于单一影像的深度学习模型在糖尿病视网膜病变筛查等任务中进展显著,但真实场景里多模态信息的整合、证据追溯与鉴别诊断仍是难点。现有眼科AI大多停留在单任务、单模态或弱证据支撑阶段,既难以模拟临床医生对多源信息的综合推理,也无法让医生审计其诊断依据。当通用大语言模型直接"看图说话"时,还常出现识别错误、推理依据不清或引用文献无法核实等问题。这种"给出答案却给不出证据"的局限,正是高风险临床场景落地的主要障碍。与此前发表在 Nature Medicine 的 Retina4IRD(面向遗传性视网膜病的基因检测前决策支持)相似,AgentEYE同样把眼科AI从单任务分类推向可追溯的临床决策支持,但切入点换成了多模态影像与循证检索的协同。
2. AgentEYE的核心创新
AgentEYE由浙江大学医学院附属第二医院眼科中心金凯团队联合新加坡南洋理工大学、宾夕法尼亚大学、波兰奥尔什丁瓦尔米亚玛祖里大学等机构开发,其核心是把"大模型看图问答"重构为可审计的模块化智能体。第一,传统眼科AI多为"一种图像对应一个模型"的固定管线,AgentEYE引入模态路由,自动区分眼底照片与眼部B超并分配至对应专科工具,模拟医生按检查类型组织信息的思路。第二,过去系统缺乏证据绑定,AgentEYE在影像结果不确定或模态冲突时主动检索临床指南与权威网络证据,并判断证据是否充分、必要时优化检索问题。第三,最终由推理核心综合影像表现、工具输出与检索证据,生成包含诊断解释、鉴别诊断、处理建议和参考文献的报告。消融实验显示,专门化影像工具是诊断性能提升的主要来源,检索则主要增强证据支撑与引用可核查性——这提示医学智能体的评价不能只看准确率,还应考察证据质量、安全性与审计能力。
3. 技术原理:模块化路由—工具调用—循证检索—报告合成
AgentEYE的输入是同一次就诊采集的眼底照片与眼部B超图像,处理流程分为四个相继环节:模态识别与路由、专科影像工具分析、循证检索与充分性判断、诊断整合与报告生成。推理核心(基于大语言模型)根据病例特点自主规划分析路径,并保留可检查的中间状态——影像类型路由、工具执行、检索规划与证据合成均被显式记录。在302例流程审计中,模态路由与工具调用成功率达100%,检索在86.4%的病例中被调用、平均每例1.89次检索查询。需要明确的是,大语言模型在此扮演的是"推理与整合核心"角色,而非端到端的诊断模型;真正决定诊断质量的是专门训练的专科影像工具与证据检索层。这与基础模型的通用能力不能等量齐观,更不能把API模型的测试表现写成消费级产品实测。
4. 数据说话:关键结果
| 研究维度 | 比较对象 | 核心结果 | 统计证据 |
|---|---|---|---|
| 诊断正确性(内部302例基准,0–100) | AgentEYE vs LLM-only | 71.93 vs 36.52 | 95% CI 68.72–75.10 vs 32.64–40.56 |
| 报告完整性(内部302例基准,0–100) | AgentEYE vs LLM-only | 75.59 vs 48.57 | 95% CI 73.82–77.27 vs 45.84–51.33 |
| 医生盲评诊断正确率(200例) | AgentEYE vs 基线 | 83.0% vs 42.0% | 未报告(多数投票) |
| 潜在有害输出率(200例盲评) | AgentEYE vs 基线 | 3.5% vs 29.0% | 未报告 |
| 外部验证正确性提升(皖南50例) | AgentEYE vs 基线 | +18.53 | 95% CI 5.07–31.98,p=0.008 |
主要结果均来自论文报告:内部302例同日多模态基准中,AgentEYE诊断正确性71.93(95% CI 68.72–75.10)、完整性75.59(95% CI 73.82–77.27),LLM-only基线分别为36.52与48.57;去除专科影像工具的消融版本正确性仅39.40,说明专科工具是关键增益来源。200例由3名眼科医生盲法评估,AgentEYE多数投票诊断正确率83.0%对42.0%、完整性82.5%对41.5%,潜在有害输出率3.5%对29.0%。引用可核查性方面,眼科医生判定AgentEYE 86.5%的引用正确,基线仅46.5%,虚构或无法核实的文献仅出现在基线组。外部验证呈分布依赖:皖南队列50例基准类别子集较基线正确性提升18.53(95% CI 5.07–31.98,p=0.008);波兰25例外部队列结果中性(p=0.952);35例未见疾病子集正确性差异不显著(p=0.534),仅完整性改善。
5. 从实验室到临床:应用前景与局限
AgentEYE最现实的应用是作为眼科多模态诊断的"副驾驶":在资源不均的基层或会诊场景中,帮助组织眼底与B超信息、呈现可能的鉴别诊断并附上可核查证据,减轻医生文书与查证负担;在医学教育与质控中,其可追溯的报告结构也可用于培训与审查。与血液肿瘤领域的 HemaGuide 智能体类似,这类模块化、可审计的轨迹设计正成为高风险临床AI的共同路径。但局限同样明确。其一,研究为回顾性设计,系统仅以影像为中心,未纳入症状、视力、眼压、既往史与OCT等完整临床变量,不能代表真实端到端决策性能。其二,主基准限定7类诊断,其中两类各仅1例,未见疾病分析仅为边界条件测试,尚不能视为开放世界诊断能力。其三,外部验证样本有限且结果分布依赖,波兰小队列呈中性;跨设备、跨疾病谱与跨机构泛化仍需前瞻性、多中心、真实世界研究确认。
6. 结论与产业启示
AgentEYE表明,将专科影像工具、循证检索与大模型推理组织为可审计的模块化智能体,能显著提升眼科多模态诊断报告的正确率、完整性与可追溯性,同时压低有害输出与虚构引用。对医疗AI企业,三点值得借鉴:一是把"证据可追溯"作为产品一级指标,而非准确率的点缀;二是优先打磨专科工具而非堆砌通用大模型能力;三是以临床决策支持定位切入,明确人机协同边界。思陌智能科研服务专注于AI医疗软件开发与医学影像AI、医疗大模型及多智能体临床工作流,可基于此类模块化智能体范式,为眼科等专科提供可审计、可追溯的科研与辅助决策解决方案。
相关问题
Q:AgentEYE现在能直接用于临床诊断吗?
A:不能。论文明确将其定位为临床决策支持原型,研究为回顾性设计,尚缺前瞻性多中心验证。所有诊疗决策仍应由医生结合完整病历作出,系统仅提供可追溯的辅助信息与参考依据,不替代诊断权威。
Q:AgentEYE会取代眼科医生吗?
A:不会。在200例医生盲法评估中,系统作为医生辅助工具提升了报告的正确率与完整性,但论文明确将其定位为受临床医生监督的眼科助手,不具诊断权威。它承担的是证据检索与结构化呈现工作,最终判断与医疗责任仍完全在医生一方。
Q:这项研究是否适用于中国医疗环境?
A:部分适用。研究由中外多机构完成,含中国内部与外部(皖南)队列,但在波兰小队列表现中性,且未覆盖不同设备与广泛疾病谱。其模块化、可追溯思路契合国内眼科资源不均现状,真实效益仍需本土前瞻性验证。
参考文献
- Zhao K, Sun Q, Kang D, et al. An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis. Cell Reports Medicine. 2026. DOI: 10.1016/j.xcrm.2026.102969(PMID: 42556343)
- Jia H, Qian B, Qu Y, et al. AI-based clinician decision support system for diagnosis of inherited retinal diseases: a multicenter, randomized trial. Nature Medicine. 2026. DOI: 10.1038/s41591-026-04545-w(PMID: 42498742)
本文基于 An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis 的独立解读,仅供学术交流,不构成临床建议。
📄 论文原文信息
| 论文标题 | An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis |
| 作者 | Kaikai Zhao, Qixuan Sun, Daohuan Kang, Tao Yu, Wenzheng Han, Rui Yao, Rupesh Agrawal, Gui-shuang Ying, Andrzej Grzybowski, Kai Jin et al. |
| 期刊 | Cell Reports Medicine |
| 发表时间 | 2026-08-05 |
| DOI | 10.1016/j.xcrm.2026.102969 |
| PubMed | PMID: 42556343 |