PI | 大语言模型在儿科诊断中的应用:基于常见病与罕见病真实临床病历的性能评估

2026-05-26 09:38:59, Pedia Investig Know it All光谱数据库


大语言模型在儿科诊断中的应用:基于常见病与罕见病真实

临床病历的性能评估


研究背景

精准诊断是儿科临床有效诊疗的核心。然而在临床实践中,儿科疾病种类繁多,症状表现存在异质性,医生无论在常见病还是罕见病的诊断上都面临不小的挑战。其中儿科罕见病的诊断延迟问题尤为突出。人工智能(artificial intelligence,AI的发展为解决这一难题带来了新契机。大语言模型(large language models,LLMs)凭借强大的语言处理和知识整合能力,在医疗诊断领域展现出巨大潜力。基于LLMs的诊断决策支持工具也应运而生,例如 DxGPT,它们能辅助临床医生实现更准确、及时的诊断。现有研究已经探索了LLMs在儿科基层医疗、急诊、放射科等场景的应用,成人领域的随机对照试验也证实这类模型能提升医生的诊断效率。但关于LLMs仍存在明显研究空白:多数研究采用人工整理的病例摘要,而非真实的临床初诊场景数据;鲜有研究在相同儿科病例中对比多款模型,同时控制病例聚类与模型输出一致性。此外,临床医生经验与诊断表现的关联、额外临床信息对诊断准确率的影响等也尚未明确。针对这些空白,该研究开展了针对性的对比分析,为LLMs在儿科初诊阶段的安全应用提供参考。

研究方法

本研究是一项在西班牙巴塞罗那圣胡安德乌儿童医院开展的单中心横断面研究。研究选取了该院2012年1月至2023年12月期间0至18岁患者的真实病例。最终纳入50例,其中罕见病与常见病各25例。所有病例均满足两个条件,即确诊结果明确,且初诊72小时内的临床记录完整。研究还排除了极罕见病,以降低数据再识别的风险。此外,研究为其中20例病例制作了扩展版临床摘要,这些摘要包含了后续检查结果。最终形成了70个西班牙文的独特临床场景,用于后续评估。

研究选取了4款主流LLMs作为评估对象,包括基于GPT‑4(0613)的DxGPT、Claude‑3.5 Sonnet、GPT‑4o(0513)以及o1‑preview。同时,研究招募了78名医生组成人类诊断基准组,这些医生来自该院的儿科、急诊科和重症监护室,涵盖了不同临床经验水平。

在评估方法上,研究通过自动化流程对每款模型进行3次重复查询,以评估其响应一致性。临床医生则为每例病例提供最多5个按优先级排序的诊断结果。随后,研究从四个维度对比模型与医生的诊断表现,分别是诊断准确率(Top‑1和Top‑5)、响应一致性(组内相关系数ICC)、定性安全评估(4分李克特量表)以及人‑AI互补性(联合准确率)。研究还通过用户体验问卷评估了DxGPT的临床可用性。


研究结果

人工智能模型性能分析

在全病例分析中,o1-preview和Claude‑3.5 Sonnet表现最优。两者的平均Top‑1准确率分别达到60.0%和59.0%,平均Top‑5准确率分别为78.1%和77.6%。GPT‑4o(0513)处于中等水平,而GPT‑4(0613)在所有准确率指标中均为最低。按疾病患病率分层后,模型表现出明显的领域特异性。Claude‑3.5 Sonnet在常见病诊断中更具优势,其Top‑1准确率达77.1%。o1-preview则在罕见病诊断中表现突出,Top‑1准确率为50.5%,显著优于其他模型。

与人类诊断基准的性能对比

顶级LLMs的诊断准确率显著优于临床医生。在全病例分析中,o1-preview和Claude‑3.5 Sonnet的Top‑1准确率均显著高于临床医生的48.2%,比值比分别为2.99 和2.75,均P<0.001。GPT‑4o(0513)的Top‑1准确率与临床医生相当(46.7%),但其Top‑5准确率(71.9%)显著更高(P=0.025)。这一性能差异在罕见病诊断中尤为显著。o1-preview 的罕见病Top‑1准确率(50.5%)远高于临床医生的34.8%(OR=4.13,P<0.001),其Top‑5诊断正确的概率是临床医生的6倍(OR=6.00,P<0.001)。此外,在参与研究的78名临床医生中,住院医师、初级主治医师和高级主治医师的平均Top‑5诊断准确率分别为 65.5%、64.0%和60.3%。不同经验水平医生的诊断准确率无统计学显著差异(P=0.608)。

扩展临床信息对诊断的影响

在20例同时拥有基础版和扩展版病例摘要的配对病例中,提供后续实验室检查、影像学检查等临床医疗信息能够显著提升临床医生和LLMs的诊断准确率。这一提升效果在罕见病领域和顶级模型中表现更为突出。具体而言,o1-preview 的罕见病 Top‑5 准确率随额外信息补充显著提升(P=0.041),临床医生的罕见病Top‑1准确率也因额外信息得到显著改善(P=0.034)。Claude‑3.5 Sonnet 的全病例Top‑1准确率提升幅度最大,从40.0%升至75.0%,提高了35.0个百分点。

人机智能互补性分析

病例逐一分析结果显示,LLMs和临床医生均不具备绝对的诊断优势,二者呈现明显的双向互补特征。LLMs在Bardet-Biedl综合征、婴儿痉挛症等复杂罕见病诊断中表现优异,能够实现满分诊断。而临床医生则在成熟畸胎瘤、软组织肉瘤等病例的Top‑5 诊断中显著优于所有LLMs。人‑AI 联合诊断的准确率分析显示,o1-preview 与临床医生的联合准确率最高,达到94.3%,较临床医生单独诊断提升10.0个百分点。Claude‑3.5 Sonnet、GPT‑4o(0513)和 GPT‑4(0613)与临床医生的联合准确率分别为92.9%、91.4%和88.6%,较医生单独诊断均有明显提升。

诊断准确率与一致性的联合性能特征

将诊断准确率与模型一致性结合分析发现,在Top‑5诊断性能上,Claude‑3.5 Sonnet和GPT‑4o(0513)处于高准确率、高一致性的理想区间。GPT‑4(0613)的一致性较好,但整体诊断准确率偏低。而表现出高诊断准确率的 o1-preview,其一致性显著低于其他顶级模型。从Top‑5到Top‑1诊断性能的评估转换中,所有模型的准确率均出现不同程度下降,一致性整体无明显变化。

诊断结果的定性评估

对o1-preview和GPT‑4o(0513)的诊断结果开展定性安全与实用性评估,结果显示两款模型均能提出逻辑连贯、符合临床诊疗思路的诊断方案。评分达到3分及以上(安全有用或安全有效)的响应占比极高,评分低于2分(潜在有害)的响应极少,缺乏连贯诊断逻辑的情况尤为罕见。

DxGPT 的用户体验评估

临床医生对 DxGPT 的临床可用性评价良好。工具整体体验的平均评分为3.9分(满分5分),针对罕见病或复杂病例的辅助有用性平均评分为4.1分,工具易用性评分更高,达 4.5分。不同经验水平医生的评分无显著差异,其中初级临床医生对该工具的评分更高。


研究结论

 本研究证实,新一代LLMs在复杂儿科疾病(尤其是罕见病)诊断中的准确率显著优于早期模型和临床医生。补充额外临床信息可进一步提升其诊断效率,而临床医生自身的诊疗经验与诊断准确率并无显著关联。LLMs与临床医生之间存在明显的双向互补性,二者联合使用可大幅提升整体诊断准确率,且临床医生对这类工具的接受度较高。然而部分高准确率模型的一致性较低,解读模糊或矛盾临床信息的能力有限,且性能表现出领域特异性。此外,其临床落地仍面临监管、伦理、技术等多重障碍。本研究也存在单中心、基于西班牙语病例以及未评估模型临床风险权衡能力与人机协同推理能力等局限。未来需开展更大样本、更多样化数据集的真实世界临床试验,以进一步验证其应用价值。人机协同而非AI替代人类,才是儿科诊断AI工具的核心应用方向。只有在严格的人工监督和规范的临床应用框架下使用LLMs,才能充分发挥其技术优势,切实提升儿科疾病诊断的准确性与效率。



引用本文

Launes C, Esteller-Cucala P, Alvarez-Estape M, Cano I, Pino R, González-Grado C, et al. Large language-models for pediatric diagnosis: Performance evaluation using real-world clinical notes from common and rare cases. Pediatr Investig. 2026;00:1-11. https://doi.org/10.1002/ped4.70053



威立(Wiley)是权威内容与科研智慧领域的全球领导者,致力于推动科学探索、创新发现与学习发展。两个多世纪以来,我们始终立于学术生态体系的中心,将悠久的出版传承与人工智能驱动的平台深度融合,重塑知识的发现、获取与应用方式。从独立研究员、莘莘学子到世界500 强企业的研发团队,威立始终助力将先进的科学突破转化为切实的社会实践。从知识到影响力 —— 我们正在重新定义科学与求知领域的无限可能。



  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved