研究文章

基于卷积神经网络-视觉Transformer混合模型预测缺血性卒中后功能预后:一项回顾性研究

DOI:

10.3791/71552

2026年6月12日

* These authors contributed equally

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

一种混合的CNN-ViT模型提取了多参数MRI特征,通过堆叠逻辑回归融合影像学和临床预测结果,以评估急性缺血性卒中后90天的功能预后。该融合模型在内部测试中表现出最优性能,AUC为0.885,准确率为0.840,并在外部验证中展现出令人鼓舞的性能。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

急性缺血性卒中(AIS)是导致死亡和长期残疾的主要原因,早期预测功能恢复情况对于指导临床决策和康复规划具有重要意义。通常使用改良Rankin量表(mRS)评估90天时的功能结局,但从早期临床和影像信息中预测长期结局仍具挑战性。我们假设,与单模态模型相比,采用混合卷积神经网络(CNN)-视觉Transformer(ViT)架构整合多参数磁共振成像(MRI)与结构化临床变量,可提高对90天功能结局的预测能力。本研究回顾性分析了300例接受多参数MRI检查的AIS患者,将其分为训练-验证队列(n = 250)和内部独立测试队列(n = 50),并纳入一个额外的外部测试队列(37例AIS患者)以评估模型的泛化能力。开发了一种混合CNN-ViT模型用于提取多参数MRI特征,并通过堆叠逻辑回归整合影像学与临床预测结果。采用受试者工作特征曲线下面积(AUC)、敏感性、特异性和准确率评估模型性能。在所评估的临床模型中,支持向量机在内部测试中取得最高AUC(0.878)。影像模型的AUC为0.782。多模态融合模型表现出最佳的整体内部性能,AUC达0.885,敏感性为0.920,特异性为0.760,准确率为0.840。在外部测试队列中也观察到类似的表现趋势。这些结果表明,多参数MRI与临床预测的堆叠融合可能有助于改善AIS后90天功能结局的预测。然而,在临床应用前仍需开展更大规模的多中心验证研究。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

急性缺血性卒中(AIS)仍是导致死亡和长期残疾的主要原因,临床医生必须在治疗和出院决策最为紧迫的早期阶段对患者恢复情况进行评估1。因此,对功能恢复进行准确的早期预测在临床上具有重要意义,有助于指导治疗策略、康复计划制定以及出院决策。卒中研究和临床实践中通常将90天时的功能结局作为标准终点指标,最常用的评估工具是改良Rankin量表(mRS),该量表在临床试验和观察性研究中已具备良好的效度和信度2,3。尽管mRS已被常规使用,但从入院数据预测90天mRS评分仍然具有挑战性,因为残疾程度不仅反映不可逆的组织损伤,还受到发病前储备功能及合并症负担的影响,即使急性期影像学表现相似,这些因素仍会影响患者的恢复过程2,4

多参数磁共振成像(MRI)可提供早期缺血性损伤和组织状态的临床可用生物标志物,这些信息无法通过单一成像对比方式全面获取。弥散加权成像(DWI)对早期缺血性改变具有高度敏感性。表观弥散系数(ADC)成像可量化弥散受限程度,并已在急性卒中队列中显示出其预后评估价值5。T2液体衰减反转恢复(T2-FLAIR)成像通过增强病灶演变的可视化,补充了弥散成像信息,在发病时间不确定时,DWI-FLAIR不匹配方法被用于估算病灶年龄和判断治疗适应证,其中T2-FLAIR起核心作用6,7。多项大规模多中心研究和随机对照试验表明,DWI-FLAIR不匹配可识别发病4.5小时治疗时间窗内的患者,并支持在发病时间未知的卒中患者中基于MRI指导溶栓治疗,凸显了DWI和FLAIR在诊断之外的预后意义6,7。综上所述,这些发现支持采用整合DWI、ADC和T2-FLAIR的建模策略,以同时捕捉早期缺血核心特征和可能影响功能恢复的时间信息。

与此同时,已建立的临床变量在入院时常规可获取,并具有较强的预后预测能力4。美国国立卫生研究院卒中量表(National Institutes of Health Stroke Scale, NIHSS)是广泛使用的神经功能缺损严重程度评估工具,可强有力地预测临床结局。卒中病因学亚型(包括急性卒中治疗中Org 10172试验分类,即TOAST分类)在某些分析中可提供超出NIHSS的额外预后信息8,9。既往研究还表明,血管危险因素和共病状况在缺血性卒中队列及预后研究中 repeatedly 被识别为不良结局的潜在预测因子4,10。特定共病如心房颤动、失代偿性心力衰竭和糖尿病 consistently 与卒中后较差的功能结局相关1,11,12。吸烟与更差的90天功能结局相关,而饮酒的影响较弱或呈剂量依赖性,脂质代谢紊乱与卒中后残疾的关系则更为复杂13,14,15,16,17。这些发现支持将反映卒中严重程度、病因及共病负担的结构化临床预测因子与多参数MRI相结合,而非单独依赖其中任一方法。

近期的机器学习研究表明,计算模型能够整合异质性生物标志物以提高卒中预后预测的准确性,但其性能在很大程度上取决于数据模态、队列构成、模型设计以及类别不平衡处理策略18,19,20。梯度提升和集成方法已证明在利用影像学、人口统计学和临床变量预测90天改良Rankin量表(mRS)方面具有可行性,尤其适用于不良预后(mRS > 2)的二分类预测18。近期一些多中心研究将基于三维卷积神经网络(CNN)从DWI、ADC和FLAIR序列中提取的MRI特征与结构化临床变量相结合,结果表明,多模态模型能够捕捉到单模态方法之外的互补性预后信息21。类似的研究结果也见于将单一影像模态(如弥散加权成像或非增强计算机断层扫描)与临床变量融合的分析中18,22。采用多模态人工智能模型预测卒中预后的代表性研究总结于表1中。

研究成像方式人工智能技术(模型)目标摘要
Liu et al.18MRI (DWI) + 临床数据深度学习预测模型(DLPD,基于CNN的影像网络 + 临床特征网络)利用融合的影像和临床信息预测90天mRS等级。融合模型显著优于仅使用影像或仅使用临床数据的模型,并在预测不良结局方面实现了高准确性。
Jung et al.21MRI (DWI, ADC, FLAIR) + 临床数据集成深度学习模型,结合3D-CNN影像网络与多层感知机(MLP)临床模型开发一种用于急性缺血性卒中(AIS)功能预后预测的多模态集成深度学习模型。在大规模多中心队列中,多模态整合相比单模态模型显著提高了3个月预后的预测能力。
Wei et al.27MRI (DWI, ADC) + 临床数据影像组学 + 机器学习(LASSO特征选择 + 逻辑回归/随机森林分类器)利用MRI影像组学和临床变量预测长期功能预后。影像组学-临床模型的预后性能优于仅使用影像或仅使用临床数据的模型。
Liu et al.22非增强CT + 临床数据深度学习融合模型(CNN影像编码器 + 临床MLP网络)基于急性期CT和临床数据预测90天功能预后。多模态融合相比单模态模型显著提高了预测准确性。
Liu et al.19MRI (DWI) + 临床数据深度学习预测模型(DLPD,基于CNN的融合模型)评估深度学习预后预测模型与医生预测的对比表现。该AI模型在预测90天mRS结局方面的表现与卒中专科医生相当。
Rehman et al.20临床数据混合深度学习(CNN+GRU结合ADASYN)从不平衡的临床数据中预测卒中风险。结合ADASYN的混合深度学习提高了卒中风险预测性能,体现了先进数据平衡方法和多模型学习的价值。
Ali et al.29MRI/fMRI/rs-fMRI对机器学习、深度学习及混合模型的系统性荟萃综述评估基于神经影像的诊断中计算智能技术的应用。混合模型总体上优于独立的机器学习和深度学习方法,支持混合架构在基于神经影像的预测中的价值。

表1:基于人工智能的急性缺血性卒中后功能预后预测研究综述。 汇总了使用影像学、临床变量或多种模式方法预测卒中后功能预后的代表性研究,包括影像学模式、人工智能技术、研究目的及主要研究结果。请点击此处下载该表格。

然而,许多现有研究依赖于单一成像序列或传统的深度学习模型,这些模型主要捕捉脑成像数据中的局部空间特征,可能无法充分建模长距离的上下文关系。因此,在开发并对外评估一种多模态方法方面仍存在特定空白:该方法需联合使用DWI、ADC和T2-FLAIR,并结合结构化临床变量,同时整合局部病灶特征提取与全局上下文建模。尽管卷积神经网络(CNNs)在病灶层面的特征提取方面已得到充分验证,但基于Transformer的架构(如视觉Transformer,ViTs)能够通过注意力机制建模长距离上下文关系,从而提供互补的全局表征。23,24因此,混合型CNN-ViT模型为联合编码局部形态学细节与全脑全局上下文提供了一种合理的框架。机器学习算法同样适用于对异质性结构化临床数据中的复杂非线性关系进行建模。25. 根据近期强调互补性跨模态整合的多模态学习原则进行指导26本研究结合多参数磁共振成像与基于卷积神经网络-视觉 Transformer(CNN-ViT)的影像主干模型,并将这些特征与机器学习临床模型整合,用于预测90天预后。该研究的创新之处在于开发并对外评估了一种堆叠式多模态融合框架,该框架在一个统一的90天预后预测模型中整合了互补的MRI序列、局部-全局的CNN-ViT影像表征以及结构化临床预测因子。

本研究的假设是,与单模态模型相比,采用混合卷积神经网络-视觉Transformer(CNN-ViT)架构整合多参数MRI与结构化临床变量,可提高对急性缺血性卒中(AIS)后90天功能预后的预测准确性。因此,本研究的目标是开发并评估一种多模态深度学习框架,该框架整合弥散加权成像(DWI)、表观扩散系数(ADC)和T2-FLAIR MRI序列以及结构化临床预测因子,以估算AIS患者90天的改良Rankin量表(mRS)评分结果。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究经深圳大学总医院机构审查委员会批准(IRB 批准编号:KYLL-2026-077-1)。由于本研究为回顾性设计,免除了书面知情同意的要求。

1. 研究队列

从机构临床数据库中回顾性地筛选出接受过多参数MRI的急性缺血性卒中(AIS)患者。整体研究流程,包括数据集划分、影像模型开发、临床模型构建以及多模态融合,如图1所示。

卒中预测模型示意图;数据采集、影像模型开发、临床模型、融合策略。
图1:多模态预后预测框架的工作流程。A)数据采集。回顾性识别符合预定义纳入标准的急性缺血性卒中(AIS)患者。数据集被划分为训练-验证队列(n = 250)、内部独立测试队列(n = 50)和外部测试队列(n = 37)。在训练-验证队列中进行分层五折交叉验证。(B)影像模型开发。采用混合三维卷积神经网络-视觉Transformer(CNN-ViT)架构,对包括弥散加权成像(DWI)、表观扩散系数(ADC)和T2液体衰减反转恢复(T2-FLAIR)在内的多参数MRI序列进行处理,用于预后预测。(C)临床模型开发。利用结构化临床变量训练机器学习模型,以预测90天功能预后。(D)多模态融合策略。通过堆叠逻辑回归元学习器整合影像模型和临床模型生成的预测结果,以产生最终的预后预测。请点击此处查看该图的放大版本。

采用临床磁共振成像(MRI)系统进行MRI检查。图像采集使用专用的相控阵头线圈。所有序列均在轴位平面采集,并在不同成像方式间保持一致的切片定位。扩散加权成像(DWI)采用单次激发自旋回波平面成像序列,重复时间(TR)为3,000–5,000 ms,回波时间(TE)为80–90 ms。扩散敏感梯度至少在3个正交方向上施加,b值分别为0和800–1,000 s/mm2。成像视野范围为220–240 mm,矩阵大小为128 × 128。层厚为5–6 mm,层间距为1–1.5 mm。采集2至4次信号平均。

表观扩散系数(ADC)图谱通过扫描仪工作站上的DWI数据,基于采集的b值采用单指数拟合方法自动生成。ADC值以体素为单位进行计算,并导出用于定量分析。T2液体衰减反转恢复(T2-FLAIR)图像采用反转恢复序列获取,重复时间(TR)为8,000–10,000 ms,回波时间(TE)为80–140 ms,反转时间(TI)为2,200–2,600 ms。视野范围为220–240 mm,矩阵大小为192 × 192至256 × 256。层厚为4–5 mm,层间距为1–1.5 mm。

2. 数据预处理

临床数据从结构化电子表格中导入,表格包含病例标识符、mRS结局评分、数据集分割标签以及人口统计学和临床变量。病例标识符经过标准化处理,以确保与影像文件名保持一致。临床变量包括人口统计学特征、采用美国国立卫生研究院卒中量表(NIHSS)评估的卒中严重程度、血管危险因素以及入院时记录的合并症情况。

主要结局指标是卒中发病后90天时的功能状态,采用改良Rankin量表(mRS)进行评估。良好结局定义为mRS ≤ 2,不良结局定义为mRS > 2。根据mRS分布采用分层抽样方法将数据集随机分为训练-验证集和内部独立测试集,以保持结局的平衡性。外部测试集被单独处理,在模型开发过程中未被使用。在训练-验证集中,采用分层k折交叉验证,以确保各折之间的结局分布一致。

在模型训练之前,对所有DWI、ADC和T2-FLAIR图像体积数据进行了预处理,以确保不同模态之间的空间和数值一致性。相同的预处理流程被无修改地应用于训练-验证集、内部测试集和外部测试集。图像被重新定向至标准的RAS方向,并转换为浮点型数组。使用线性插值将平面内空间分辨率重采样至256 × 256。通过基于中心的策略将层面方向维度标准化为20个切片:包含超过20个切片的体积数据被从中心裁剪,而少于20个切片的体积数据则进行对称的零填充。最终的体积尺寸为256 × 256 × 20。

采用z分数标准化方法对每个体积进行独立的强度归一化:

标准化公式 \(x'=(x-\mu)/\sigma\),统计方法,方程。

其中,x 表示体素强度,µ 表示体数据的平均强度,σ 表示标准差。若 σ = 0,则不进行归一化处理,以避免数值不稳定。处理后的体数据以 NIfTI 格式保存,并采用标准化的仿射矩阵,用于后续的深度学习分析。

3. 临床模型开发

采用结构化临床变量构建机器学习模型以预测结局。候选预测因子包括人口统计学特征、血管危险因素、卒中病因以及基线临床严重程度指标。连续变量使用中位数进行填补并进行标准化处理。分类变量使用最常见类别进行填补,并采用独热编码(one-hot encoding)进行编码。

评估了多种机器学习算法,包括逻辑回归、随机森林、梯度提升、支持向量机(SVM)、极端梯度提升以及轻量梯度提升机模型。模型开发在训练-验证队列中采用分层五折交叉验证框架,以评估泛化性能。内部和外部测试队列的最终预测结果通过平均各交叉验证折上训练模型的预测值得到。交叉验证或模型选择过程中未使用任何外部测试样本。

4. 深度学习模型架构

采用了一种三维卷积神经网络-视觉Transformer混合架构,用于从多模态磁共振成像体数据中预测结果。该网络设计旨在统一框架内将局部空间特征提取与全局上下文建模相结合。输入数据包含多通道三维图像,进行端到端处理。

特征提取最初使用由4个阶段组成的分层三维卷积主干网络进行。每个阶段包含2个卷积层,卷积核大小为3 × 3 × 3,填充为1个体素,后接批归一化和修正线性单元激活函数。在前3个阶段之后应用三维最大池化层,逐步降低空间分辨率,同时在每一层级增加特征通道深度,以捕获更高层次的语义表征。在最后一个卷积阶段之后应用丢弃正则化(丢弃率 = 0.1),以减少过拟合。该卷积主干网络将尺寸为C × D × H × W的输入体积转换为具有降低空间维度的紧凑高级特征表征。

通过展平空间维度,将得到的特征图重塑为一系列令牌,使得令牌的数量对应于:

N = D' × H' × W'

使用由多头自注意力机制和前馈网络组成的 Transformer 编码器层对令牌之间的全局上下文关系进行建模。自注意力的计算方式如下:

深度学习中的注意力机制公式:softmax((QK^T)/√d)V,数学方程。

其中 Q、K 和 V 分别表示查询、键和值矩阵,d 表示嵌入维度。在每个编码器层内应用了层归一化和 dropout,以提高训练稳定性。Transformer 模块包含 3 个编码器层,具有 8 个注意力头,嵌入维度为 256。

经过 Transformer 编码后,提取并归一化了对应于分类标记的表示。一个全连接线性层生成单个对数几率输出,用于二分类。

所提出的混合CNN-ViT架构被有意设计为一种轻量级且参数高效的模型,以平衡表征能力与过拟合风险。该模型包含379万个可训练参数(在fp32精度下约为14.4 MB),其中卷积主干网络包含138万个参数,Transformer编码器包含237万个参数。

5. 成像模型训练

采用分层五折交叉验证框架对影像模型进行训练,以在各折中保持结果分布的一致性,同时提高性能评估的稳健性。根据结果分布采用分层抽样方法将数据集划分为训练-验证队列和内部独立测试队列。在训练-验证队列内应用分层五折交叉验证。对于每一折,影像模型使用训练子集进行训练,并使用相应的验证子集进行评估,而预留的测试队列则专门用于最终性能评估。

使用配备 GPU 的工作站,基于深度学习框架,采用 AdamW 优化器对模型进行优化,学习率为 3 × 10⁻5,权重衰减为 3 × 10⁻4。训练过程中批处理大小为 8,最多训练 200 个周期。损失函数采用带 logits 的二元交叉熵。

为解决类别不平衡问题,根据每折中阴性样本与阳性样本的比例计算阳性类别的加权因子,并将其纳入损失函数。在优化过程中应用梯度范数裁剪,最大范数为 0.5,以提高数值稳定性。启用自动混合精度训练以提升计算效率。

当验证集性能在连续30个训练周期内未能提升至少1 × 10⁻4时,即触发早停机制。每个折次中表现最优的模型检查点被保留。在所有折次完成后,使用每个折次对应的模型分别对内部和外部测试队列生成预测结果,并通过对5个模型的预测结果取平均值得到最终概率,从而生成集成输出。

6. 多模态融合模型

采用堆叠融合策略,将影像学衍生的预测结果与结构化临床信息进行整合。深度学习影像模型和临床预测模型作为基础学习器,其预测概率被用作逻辑回归元学习器的输入特征。此外,还引入了额外的交互特征,包括预测概率的乘积和绝对差值,以捕捉影像学预测与临床预测之间的互补信息。

为防止信息泄露,元学习器使用来自训练-验证队列的交叉验证预测概率进行训练。通过患者标识符将影像模型和临床模型的交叉验证预测概率合并,以构建元学习器的训练数据集。对于内部和外部测试队列,将影像模型和临床模型在相应测试集上生成的概率作为输入,输入至训练好的元学习器中,以生成融合后的概率。训练好的元学习器在应用于两个测试队列时均未重新拟合。

7. 消融研究

通过消融实验评估了单个MRI序列和视觉Transformer组件的贡献,实验采用与主模型相同的训练和评估设置。序列消融包括单序列模型、留一序列模型以及完整的多参数模型。为了评估视觉Transformer模块的贡献,还将所提出的混合架构与仅使用卷积神经网络(CNN)的基线模型进行比较,其中移除了Transformer编码器,同时保留相同的卷积主干网络。

8. 统计分析

采用受试者工作特征曲线下面积(AUC)作为主要区分指标,分别在内部独立测试队列和外部测试队列中评估模型性能。利用各模型生成的预测概率绘制受试者工作特征(ROC)曲线。此外,还计算了敏感性、特异性和总体准确率,以表征分类性能。

二分类结果通过根据约登指数确定的阈值生成。在最佳阈值下,进一步计算敏感性、特异性和准确性。所有统计分析、机器学习模型的构建以及深度学习模型的训练均采用标准的科学计算与机器学习软件包实现。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

研究队列

在应用预定义的纳入和排除标准后,共纳入300例急性缺血性卒中(AIS)患者。根据功能预后分布,采用分层抽样方法将数据集分为训练-验证队列(n = 250)和内部独立测试队列(n = 50)。此外,纳入来自独立数据集的37例AIS患者作为外部测试队列,以提供初步的外部验证。模型开发与性能评估仅在训练-验证队列中进行分层五折交叉验证。

研究人群的基线人口统计学和临床特征总结于表2中。由于采用了分层抽样策略,训练-验证队列和内部测试队列中功能预后良好(mRS ≤ 2)与功能预后不良(mRS > 2)的患者比例分布均衡。外部测试队列包括29例预后良好的患者和8例预后不良的患者。

特征

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究开发并评估了一种多模态人工智能框架,该框架整合了多参数磁共振成像(MRI)与结构化临床变量,用于预测急性缺血性卒中(AIS)后90天的功能预后。所提出的融合模型的预测性能优于单独的影像学模型或临床模型。具体而言,在内部独立测试队列中,将基于支持向量机(SVM)的临床模型与影像学模型的预测结果进行整合的堆叠式多模态模型,其AUC达到0.885,而临床模型为0.878,影像学模型为0.782。尽管与SVM临床模型相比,AUC的提升幅度较小,但融合模型还将敏感性从0.760提高至0.920,准确率从0.820提升至0.840,表明其预测价值超越了AUC本身。在独立外部队列中的验证显示性能一致但略低,融合模型的AUC为0.797,准确率为0.838。在外部测试队列中,融合模型的AUC、敏感性和准确率均高于SVM临床模型,同时保持了特异性,说明影像学衍生预测结果在结构化临床变量之外具有互补性贡献。综合来看,这些发现提示多模态整合可能有助于改善AIS后的早期预后评估。

近年来,越来越多的研究探索了利用影像学、临床变量或多种模态数据整合的方法,通过机器学习预测卒中预后。多项研究已证明,整合...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明无竞争利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
磁共振成像系统(Discovery MR750 3.0T)GE Healthcarehttps://www.gehealthcare.in/products/magnetic-resonance-imaging/3-0t/discovery-mr750用于获取DWI、ADC和T2-FLAIR图像的临床MRI扫描仪
相控阵头线圈GE Healthcarehttps://services.gehealthcare.com/gehcstorefront/p/5450630用于MRI信号接收的头部线圈
图形处理器(RTX 4090)NVIDIAhttps://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/用于深度学习模型训练的GPU
深度学习框架(PyTorch v2.1)PyTorch Foundationhttps://pytorch.org/用于实现CNN-Transformer模型的框架
编程语言(Python v3.10)Python Software Foundationhttps://www.python.org/downloads/release/python-3100/用于模型开发和数据处理的环境
机器学习库(scikit-learn)scikit-learn Developershttps://scikit-learn.org/stable/用于临床机器学习模型和统计分析
梯度提升库(XGBoost)DMLChttps://xgboost.readthedocs.io/en/release_3.2.0/用于实现梯度提升模型
梯度提升库(LightGBM)Microsofthttps://lightgbm.readthedocs.io/en/stable/用于LightGBM临床模型

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Rankin

相关文章