本文呈现叙述性综述,评估基于人工智能(AI)的预测工具在创伤性脑损伤中次级并发症和临床结局的应用,评估五个并发症领域的证据成熟度,并识别临床实施的关键障碍。
综述文章
本文呈现叙述性综述,评估基于人工智能(AI)的预测工具在创伤性脑损伤中次级并发症和临床结局的应用,评估五个并发症领域的证据成熟度,并识别临床实施的关键障碍。
中度至重度创伤性脑损伤(TBI)后的继发并发症——包括颅内压升高(ICP)、创伤后癫痫发作、创伤诱发凝血障碍(TIC)和败血症——会显著恶化患者的预后。现有预后工具估计住院时的整体死亡率和残疾,但无法预测住院期间的具体可治疗并发症。本叙述综述评估了基于人工智能的预测工具是否能够满足这一未被满足的临床需求,评估五个预测领域证据的成熟度,并确定未来研究的优先事项。2016年1月至2025年10月,在PubMed、Embase和Web of Science进行了针对性的文献检索,辅以人工参考文献追踪。研究根据其与人工智能或机器学习(ML)预测TBI患者继发并发症或临床结局的相关性进行筛选。基于人工智能的模型在ICP危机、TIC、败血症和死亡率方面实现中等预测准确率(受试者工作特征曲线面积为0.70–0.79),准确率为AUC≥0.80。癫痫发作预测证据最不成熟,且无外部验证研究。ICP预测具有最强的证据基础,具有外部验证和独立重复性。死亡预测拥有最大的证据量,并拥有国际多数据集验证。关键的方法论局限依然存在:大多数模型基于回顾性单一机构数据;只有大约三分之一的项目经过外部验证;而且没有随机试验证明AI引导的决策能改善患者结局。人工智能预测工具在预测继发TBI并发症方面展现出潜力,但目前证据尚不支持常规临床应用。在采用之前,这些工具需要严格的外部验证、前瞻性结局试验以及跨多元人群的系统性公平评估。
TBI是全球死亡和长期残疾的主要原因之一,每年约有6900万例病例发生。TBI是45岁以下人群死亡和残疾的主要原因,给医疗、社会经济和社会带来了沉重负担 1,2,3。TBI病理生理的一个基本区别是将初发损伤——即撞击时的即时机械损伤——与继发损伤区分开来,后者通过脑水肿、缺血、兴奋性毒性和神经炎症等连锁过程在数小时到数天内演变。与原发性损伤不同,次级损伤机制原则上是可调整的治疗靶点。这些过程引发的次级并发症——包括颅内压升高、创伤后癫痫发作、心电刺激和败血症——通常决定了患者的最终临床轨迹3,5,6。临床上的根本挑战是识别哪些患者会在并发症出现前出现,从而实现更早、更有针对性的预防干预。
临床医生目前使用GCS进行意识评估,CT影像用于结构损伤特征分析,以及国际TBI临床试验预后与分析任务(IMPACT)和重度头部损伤后皮质类固醇随机化(CRASH)计算器,用于估算六个月死亡率和不利结局7,8.虽然这些工具具有临床价值,但存在重要局限性:它们完全依赖入院数据,假设线性预测变量-结局关系,且设计用于预测死亡或长期残疾,而非住院期间出现的具体、可个别治疗的并发症 6,7,8.人工智能——涵盖机器学习(ML)的总体领域,机器学习是从数据中学习预测模式的算法子集——能够质疑跨大型变量集的复杂非线性关系,并同化持续更新的生理监测流5、6、7。这些能力表明,人工智能能够检测到那些未被标准临床评估的微妙恶化前兆信号。2022年《柳叶刀神经学委员会》TBI明确将先进预后分析列为研究和临床开发优先事项3,这一方向也在2017年该领域研究路线图中提出。本叙述综述审视了人工智能在预测继发性脑损伤并发症和临床结局方面的现有证据,评估了各并发症领域证据的成熟度,并指出在这些工具能够负责任地转化为临床实践之前,必须实现的目标。
多项系统综述已评估过TBI 5,6中的AI结局预测。Malhotra等人5的系统综述涵盖了39项主要研究,重点是利用入院层级变量进行死亡率和全球残疾预测。Courville等人进行了机器学习算法用于预测TBI结局的荟萃分析。本综述特别聚焦于个别继发并发症(ICP危机、癫痫、凝血功能障碍和败血症),作为住院期间独立且临床可操作的预测目标。通过围绕并发症特异性预测组织证据,关注各领域的成熟度和可操作性,本综述提供了以往汇总结局分析未曾强调的临床医生视角评估。
访问受限。请登录或开始试用以查看此内容。
检索策略与研究选择
2016年1月至2025年10月,在PubMed、Embase和Web of Science进行了有针对性的非系统文献检索。2016年启动日期被选为捕捉深度学习研究兴起前的基础机器学习出版物,同时保持当代关注;其选中得到了Myers等人(2016)10的认可,该研究确立了基于机器学习ICP预测的核心方法论方法。检索还辅以人工筛选已识别的系统综述和原始研究参考文献。
搜索词使用布尔算符组合,包括:“创伤性脑损伤”、“TBI”、“人工智能”、“机器学习”、“深度学习”、“神经网络”、“颅内压”、“癫痫”、“凝血病变”、“败血症”、“呼吸机相关肺炎”、“预后预测”和“预后”。
纳入标准:
(1)原创研究或已发表的系统综述;(2)重点关注对TBI患者继发并发症或临床结局的人工智能或机器学习预测;(3)至少报告一项定量性能指标(如AUC、敏感性/特异性、准确性);(4)发表于同行评审期刊或索引会议论文集,并全文可访问。
排除标准:
(1)仅使用传统统计模型,不含人工智能或机器学习成分的研究;(2)仅限于损伤严重程度分类或原发损伤特征的研究,但不预测并发症或结局;(3)临床前(动物)或体外研究;(4)无与预测目标相关原始数据的综述文章。
在五个预测领域中,选出15项代表性研究,按方法学质量、验证方法多样性和临床相关性排序。通过人工参考追踪,还发现了另外两项ICP预测研究,并纳入以提供该领域的更广泛覆盖。作为叙述性综述而非系统性综述,选拔旨在代表性覆盖而非详尽列举;选择偏差无法完全排除。未对单个研究应用正式的质量或偏倚风险评估工具(如PROBAST或TRIPOD报告清单)——这一局限性在局限性部分已有说明。
预测继发并发症的临床重要性
TBI后继发并发症常见,通常可通过及时干预预防,且对临床结局有深远影响。3,5。理解每种并发症类型的临床背景,有助于阐明预测工具为何可能在重症监护实践中具有变革性。颅内压升高是严重TBI之后最严重且时间关键的并发症之一,4,10。当ICP持续超过20–22 mmHg时,脑灌注压下降,缺血性继发性损伤传播。如果临床医生能够可靠地预见ICP危机的发生,他们就能主动优化头部位置、调整镇静剂量、施行渗透治疗或准备手术减压——从被动危机管理向预防性干预的转变,有望大幅减轻继发性缺血损伤的负担(10,11)。
早期创伤后癫痫发作可能通过代谢需求升高、持续的兴奋性毒性以及皮层扩散去极化的传播,引发继发性损伤。准确的风险分层将指导预防性抗惊厥治疗、连续脑电图(EEG)监测阈值及癫痫监测强度的决策12,13。TIC影响高达60%的重度创伤性脑损伤患者,并与死亡率增加三到四倍相关(14,15,16)。早期识别凝血功能障碍患者,可以在出血加重前进行针对性凝血纠正。长期的重症监护,配备机械通气和侵入性监测,显著提高感染风险,基于人工智能的预测工具17,18有望实现风险分层的感染预防方案,有效降低感染并发症发生率。在所有这些领域,准确的预测还为治疗强度决策、家庭沟通、康复规划以及护理目标讨论提供参考 5,7,19。
基于人工智能预测的现有证据
过去十年中,关于TBI中人工智能预测的研究大幅扩展,5、6、7。Courville等人的系统综述和荟萃分析表明,机器学习算法在预测不良TBI结局方面优于传统逻辑回归模型,其中入院GCS评分、患者年龄及部分血清生物标志物被确定为最持续重要的预测特征6。Malhotra等人进行的综合系统综述涵盖39项研究和592,323名患者,确认最强的预测因素——年龄、GCS评分、瞳孔反应和CT结果——与有经验的临床医生已纳入推理的特征有显著重叠 5,7。当AI模型被限制在与传统计算器相同的录取级别变量上时,准确率提升可能仅为适度6。然而,当获得更丰富的纵向数据流——连续的生理监测趋势、连续实验室面板和定量神经影像时,AI方法可能比传统工具带来更大的优势。这五个领域的代表性研究的特征和验证策略总结于表1,概念性预测流程如图1所示。
颅内压预测
在所有次级并发症领域中,ICP预测积累了最为坚实的证据基础。人工智能系统可以提前约30分钟预测危险的ICP升高,为预防干预提供潜在可操作的窗口10,11。Myers等人利用机器学习建立了基础方法,通过连续ICU监测波形预测ICP和脑组织氧分压(PbtO₂)危机。Carra等人随后开发并外部验证了利用协作欧洲神经创伤性脑损伤有效性研究(CENTER-TBI)数据集预测有害累积ICP剂量的机器学习模型,证明了强健的跨中心泛化性11。Lee 等人开发了一种混合卷积神经网络(CNN)-长短期记忆(LSTM)架构,应用于连续的 ICP 波形数据,实现了患者内 ICP 轨迹的准确预测20。Mataczyński等人提出了一个可解释的TabNet模型委员会,应用于多模态生理信号得出指标,在预测ICP危机前30分钟实现高召回率(0.94),并改进了传统的基于阈值的方法21。该领域受益于多项独立复制研究、外部验证以及对早期预测临床可行性的明确生理学依据。
创伤后癫痫发作预测
对于创伤后癫痫发作,利用神经影像和脑电图特征的研究显示,在识别高风险患者方面表现出中等的鉴别效果12,13。Garner等人将随机森林分类器应用于TBI患者的静息状态功能性磁共振成像(fMRI)连接数据,在预测癫痫易感性的交叉验证中实现了69%的原始准确率12。Faghihpirayesh等人将深度学习应用于脑电图数据,检测急性TBI中的癫痫样异常,报告灵敏度为0.78,特异性为0.84。这些结果需要严格的方法学评估:早期创伤后癫痫发生在严重TBI患者中约有4–15%,导致预测数据集存在显著的类别不平衡。在这种情况下,69%的准确率并不比预测所有观测值的负类的朴素分类器有意义地优越;AUC和精确回忆曲线下的面积对于此类不平衡的临床预测问题来说,是更具信息量的性能指标,而Garner等人并未报告这两项指标。值得注意的是,该领域的两项研究均以索引会议论文发表,而非完整的同行评审期刊文章,进一步凸显了该证据基础的初步阶段。癫痫发作预测目前是证据最不成熟的领域,没有发表的外部验证研究,样本量有限,表现指标也需谨慎解读。
TIC预测
对于TIC,Yang等人开发了机器学习模型,采用XGBoost、随机森林和逻辑回归分类器,在TBI特异性队列24中内部验证中,AUC值为0.82–0.85。Li K等人独立开发了急诊创伤患者急性创伤性凝血病预测的机器学习集合模型,报告AUC为0.89。这些互补研究显示了部分重叠患者群体的表现表现一致。Xiong等人在13,235名普通创伤患者(包括但不限于TBI病例)中采用了十个跨中心模型,并在四家独立机构(26)中展现了一致的外部验证表现:26;然而,这些发现特异性地适用于TBI相关凝血病,因此值得在专门的TBI队列中进一步评估。凝血障碍预测具有中等证据成熟度:内部验证表现在各研究中保持一致,但针对TBI特异性外部验证——尤其是针对高致死率的凝血障碍表型,该表型影响多达60%的严重TBI患者,死亡率增加3至4倍15,16——仍是一个未被填补的空白。
败血症与感染预测
Liu等开发了一个基于XGBoost的可解释模型,专门用于TBI相关败血症预测,内部验证AUC为0.81,外部验证为0.76,使用eICU协作研究数据库17。Shapley加法解释(SHAP)数值提供了透明的特征归因,识别了关键的败血症预测因子,包括炎症生物标志物和早期临床恶化信号。Hu等人开发并内部验证了机器学习模型——包括逻辑回归、随机森林和XGBoost——用于对TBI患者ICU住院30天败血症风险进行分层,获得了0.79的AUC18。Li等开发了实时XGBoost模型,利用创伤患者每小时MIMIC-IV数据预测败血症,时间验证证实ICU病程27期间持续预测表现。Wang等人在MIMIC-III中使用集合方法,在TBI患者中有效预测呼吸机相关肺炎(VAP),获得0.87的AUC。外部验证模型(Liu等)的存在使败血症预测文献有所区别;然而,四项研究均依赖于回顾性行政或登记数据库,而非前瞻性患者队列,限制了报告表现估计的普遍性。
死亡率与功能结局预测
死亡率和功能结局预测在所研究领域中拥有最大且验证最广泛的证据基础。Pease等人开发了利用头部CT扫描的深度学习模型,在内部验证中实现了0.92的AUC,超过了IMPACT模型和神经外科医生的表现29。在使用“转型性脑损伤研究与临床知识”(TRACK-TBI)数据集进行外部验证时,模型表现降至AUC为0.80——与IMPACT模型相当,凸显了乐观内部验证估计的普遍风险29。Hibi等开发了一个多模机器学习预后模型,结合临床数据与定量CT影像,结合CENTER-TBI和比较印度创伤性脑损伤有效性研究(CINTER-TBI)数据集,证明多模态数据融合在单模态方法之外提升了预后准确性30.Warman等人比较了高收入国家(HIC)和中低收入国家(LMIC)ML死亡率预测表现,采用跨人群普遍性分析,而非标准的内部或外部验证;LMIC 环境中的绩效下降凸显了重要的公平相关局限性31.Raj等人利用逻辑回归技术开发了动态死亡率预测模型,应用于ICU生理数据演化,AUC从第一天的0.67–0.72提升至监测第5天的0.81–0.84,相较静态入院模型表现优越32。这些研究共同构成了脑损伤中人工智能预测最成熟的证据基础,并多次获得成功的国际外部验证。
关键评估与实施障碍
预测性辨别与临床效用
一个基本的区分——在已发表文献中常被混淆——是预测性歧视与临床效用证据的区别。预测性辨别(由AUC量化)衡量模型按风险对患者排名的能力;它无法确定根据这些预测采取行动是否能改善临床结局。为了负责任的临床实施,需要完整的证据链:(1)校准,确认预测概率与观察到的事件发生率相符;(2)决策曲线分析(DCA),展示在多个决策阈值上的净临床益处;以及(3)前瞻性证据——理想情况下是随机——表明算法引导的临床干预能转化为改善以患者为中心的结局。目前尚无任何已发表的TBI AI预测研究完成了这一证据链,这代表了该领域最关键的证据空白。
验证与方法严谨性
在被评审研究中报告的AUC值必须在充分方法学局限的情况下进行解释,5,33。大多数已发表模型缺乏对独立数据集的外部验证;在Malhotra等人回顾的39项研究中,只有约三分之一接受了外部验证5。应用APPRAISE-AI定量评估工具显示,方法学行为(中位数35%)、结果的稳健性(20%)和可重复性(35%)是本文献中得分最低的领域5。没有随机试验证明AI指导的临床决策能改善患者结局——这是一个关键的证据空白,仅靠回顾性准确性指标无法弥合。
校准、类别不平衡与基线比较器
除了区分之外,还有若干方法学缺陷限制了已发表研究结果的解释性。校准很少被评估或报告;一个区分力强但校准不佳的模型可能会系统性地歪曲绝对风险,从而可能误导临床决策。类别不平衡是并发症预测中的普遍挑战:像创伤后癫痫这样的罕见事件会导致数据集以负面观察为主,抬高准确度指标,却未能提供有意义的预测效用。解决班级失衡的策略——包括过度抽样、成本敏感学习和决策阈值调整——报告不一致。对强逻辑回归基线的比较评估经常被省略,这使得判断性能提升是机器学习特有的真正优势还是单纯的特征工程。DCA在不到五分之一的综述研究中显示出净临床益处。
可解释性
许多高性能AI模型如黑箱般运作,提供无可解释理由的预测5,6,33,34。伦敦探讨了医学人工智能中准确性与可解释性之间的理论权衡,指出不透明的决策在医学领域已很常见,且可解释性预期可能需要校准33。Hassija等人对适用于临床环境的可解释人工智能方法进行了全面的技术综述。Ghassemi等人提出了反对意见,认为当前可解释的人工智能方法可能在安全性和责任制方面提供虚假的保证,却未能实质性提升患者决策质量36。临床医生合理地犹豫信任无法独立评估的产出,而AI影响的决策在大多数司法管辖区仍未解决的医学法律问题。
基础设施、集成与警报疲劳
实际部署需要计算基础设施、数据集成流程和系统维护能力,而许多机构——尤其是在资源较低的环境中——目前并不具备这些能力。实时预测系统必须在灵敏度与特异性之间进行精确校准,以避免警报疲劳,这是一种在重症监护环境中对患者安全的广泛威胁。与现有电子健康记录平台的集成带来了显著的互操作性、延迟和工作流程中断等挑战,这些问题在已发表的算法开发研究中很少得到解决。
公平性与推广性
在非代表性数据集上训练的人工智能系统可能在患者子群体间表现不均,甚至可能带来有害影响 5,31。大多数被评测的模型均基于高收入学术医疗中心的数据开发,存在地理、机构和人口表现偏差的风险5.Warman等人明确回应了这一担忧,展示了在LMIC环境中应用HIC训练模型时,性能可测量的下降31。没有任何综述研究正式评估了按年龄、性别、种族或族裔定义的人口统计亚群的模型表现——这是鉴于全球TBI创伤中心服务的多样化人群,这一根本性缺失。
跨预测领域的比较证据成熟度
所回顾的五个预测领域在证据成熟度上存在显著差异。ICP预测拥有最坚实的基础:它受益于基础研究、利用CENTER-TBI数据进行外部验证、跨多组独立复制,以及明确且生理学上合理的临床工作流程以应对预测。死亡率和功能结局预测拥有最多的已发表文献,已有多项国际外部验证研究,使用TRACK-TBI、CENTER-TBI和CINTER-TBI数据集。凝血功能障碍预测显示出稳定的内部验证表现,但文献中缺乏针对TBI的外部验证。败血症预测至少有一个外部验证的模型(Liu等),但依赖管理数据库限制了对性能普遍性的信心。癫痫发作预测的证据基础最不成熟:没有外部验证,现有研究规模有限,类别不平衡极大限制了报告表现指标的可解释性。这种不同成熟度直接影响了研究投资的优先级排序以及未来临床转化讨论中应保持的谨慎。
未来方向与研究重点
在不同临床环境中进行严格的预注册外部验证是最紧迫的研究优先事项 5,6。多机构框架如CENTER-TBI和TRACK-TBI为此类验证提供了既定模板和基础设施29,30。需要前瞻性研究,包括随机平台试验,配合AI引导干预组,以确定这些工具是否能在标准护理之外显著改善患者结局5。开发能够提供临床可解释、病例特定解释的人工智能系统将显著提升临床医生的信任,识别失效模式,并促进监管审批 5,6,33,34。方法学改进——标准化校准评估、DCA作为必备的性能指标、透明的类别失衡处理以及与强有力的临床基线进行比较——应成为最低报告标准。在做出广泛临床建议之前,需要专门设计用于评估跨人口和地理亚群的预测表现的研究5,31。应要求该领域期刊采用TRIPOD报告标准以提升预测模型透明度,并使用PROBAST偏倚风险评估工具,以提高可重复性和可比性。
伦理考量
将人工智能预测工具整合进重症医学,提出了远超技术性能指标的伦理考量 5,33。公平性问题是核心问题:训练于非代表性患者群体的模型可能系统性地使弱势群体的患者处于不利地位,可能扩大而非缩小TBI结局的差异。负责任的工具开发需要有意识的培训、数据多样化,并要求在部署前进行子组性能评估。人工智能影响的临床决策的透明度和问责性仍未解决:当人工智能建议导致不利结果时,现有法律或监管框架中尚未充分解决责任和知情同意问题 33,34。患者及其家属参与AI部署决策,以及清晰传达AI预测的概率性和不确定性,是实施机构时额外的伦理义务。
本评测的局限性
本综述存在若干局限性,需明确说明。首先,作为叙述性而非系统性综述,未采用正式文献检索方案、PRISMA流程记录和详尽的研究计数;研究选择以代表性覆盖为指导,且无法排除选择偏差。其次,未对被审查的单个研究应用正式的质量或偏倚风险评估工具——如PROBAST或TRIPOD报告清单,限制了对证据质量结论的信心。第三,该领域快速发展的文献意味着2025年10月检索截止日期之后发表的研究可能会解决部分已知的局限性。第四,发表偏差很可能夸大了保留文献中AI模型的表面准确性,因为预测表现较差的研究系统性地更难发表。第五,结局定义、患者病例组合、数据来源和各研究表现指标的异质性限制了直接跨研究比较和荟萃分析综合。
访问受限。请登录或开始试用以查看此内容。
人工智能预测工具显示,在继发TBI并发症临床出现前的预测具有真实潜力 5,6,7。涵盖五个复杂性领域的代表性研究报告预测准确率从中等(AUC 0.70–0.79)到良好(AUC ≥ 0.80)不等,表现最好的模型在内部验证中AUC值最高可达0.92(外部验证AUC通常为0.76–0.80)5,6,10,17,24,29 .在被审查的领域中,ICP预测的证据基础最为成熟;癫痫发作预测最少。在所有领...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。没有任何商业实体参与研究设计、解释或发表决定。
作者未获得任何特定资金支持。
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可