研究文章

利用MRI进行四类脑肿瘤分类的注意力引导转移学习框架

DOI:

10.3791/69087

2026年7月10日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一个轻量级基于注意力的深度学习框架,利用MobileNetV2、EfficientNetV1和Inception-ResNet-V2的迁移学习,从MRI图像中进行四类脑肿瘤分类。该模型实现了高分类精度,同时降低计算复杂度,支持资源有限的临床决策支持应用。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究的目标是利用磁共振成像(MRI)数据,开发一个轻量级且准确的深度学习框架,将脑肿瘤分为四类——胶质瘤、脑膜瘤、垂体肿瘤和健康脑组织。提出的方法论结合了迁移学习与三种预训练卷积神经网络模型——MobileNetV2、EfficientNetV1和Inception-ResNet-V2——并结合了一种模拟人类视觉系统聚焦于临床相关图像区域的注意力机制。这种以注意力为导向的方法增强肿瘤定位,同时抑制无关背景信息。该框架基于一个大型公开的脑MRI数据集进行评估,该数据集包含了四类中数千张标记图像。采用标准预处理、数据增强和训练协议,以便对拟议方法进行直接复制。实验结果表明,EfficientNetV1实现了最高的分类性能,准确率优于MobileNetV2和Inception-ResNet-V2。研究得出结论,所提出的轻量级、基于注意力的框架在准确性和计算复杂性之间取得了有效平衡,使其非常适合实时和移动医疗应用,尤其是在资源有限的环境中。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

利用磁共振成像(MRI)准确分类脑肿瘤在临床诊断、治疗计划和预后估计中起着关键作用。脑肿瘤,包括胶质瘤、脑膜瘤和垂体肿瘤,表现出独特的病理特征和治疗反应;因此,早期且可靠的识别对于改善治疗效果和减少疾病进展至关重要。MRI因其优越的软组织对比度、非侵入性以及能够跨多个解剖平面可视化肿瘤形态,广受脑肿瘤评估的青睐。然而,手动解读MRI扫描通常耗时且高度依赖放射学专业知识,尤其是在肿瘤边界不规则或肿瘤类别间存在视觉相似时。因此,自动化计算机辅助诊断系统在协助放射科医生准确高效分类肿瘤方面变得越来越重要。

基于深度学习(DL)的图像分析技术显著推动了生物医学和计算机视觉应用中的自动疾病分类 2,3.在神经肿瘤学领域,机器学习和迁移学习技术已在肿瘤检测、分割和分类任务中展现出有前景的表现。尤其是卷积神经网络(CNN),在无需依赖手工特征工程的情况下,能够直接从MRI扫描中自动提取分层图像特征,展现出更优的能力。CNN架构能够从影像数据中学习辨别性肿瘤相关表征,从而提升分类性能,相较于传统机器学习方法。DL的最新进展使得高性能图像分类系统得以开发,能够以更高精度和减少人工干预处理大规模图像数据集。

尽管取得了这些进步,传统的深度卷积神经网络架构通常需要大量计算资源,包括高内存消耗、增加的参数复杂度以及漫长的训练时间5。这些计算需求限制了其在资源受限的临床环境和移动医疗系统的实现。此外,轻量卷积神经网络架构因其计算复杂度较低且适合在低资源应用中部署而受到越来越多的关注 5.多项近期研究探讨了优化CNN策略、高效特征提取机制和轻量级部署框架,以提升分类效率,同时显著降低预测准确性6,7,8。然而,在基于MRI的脑肿瘤分析中,平衡计算效率与稳健的多类肿瘤分类性能仍是一大挑战(9)。

基于注意力的深度学习框架已成为提升医学图像分析特征表现的有效解决方案。注意力机制使神经网络能够选择性地强调诊断相关的图像区域,同时抑制无关背景信息。受人类视觉系统的启发,注意力引导架构通过将计算重点引导到肿瘤特异的空间区域和情境特征,从而提升判别特征学习。此类机制对脑肿瘤MRI分析尤为有益,因为肿瘤组织常表现出异质强度模式、不规则形态以及肿瘤类别间重叠的视觉特征。因此,将注意力模块集成到基于卷积神经网络的架构中可以提升分类准确性并提升特征定位性能。

多项近期研究表明,DL框架在自动脑肿瘤诊断和基于MRI的肿瘤分类中具有潜力(11,12)。Gao等开发并验证了利用MRI数据进行脑肿瘤诊断的DL模型,展示了自动化神经影像分析的强大分类能力11。同样,Abdusalomov等人研究了基于DL的脑肿瘤检测方法,利用MRI扫描,并报告了有前景的诊断表现12。尽管这些研究提高了分类准确性,但数据集多样性、模型泛化和计算需求等限制仍未解决。在许多情况下,训练数据集规模有限或临床来源受限,从而增加了过拟合风险,降低了异质患者群体的鲁棒性。

为改善肿瘤可视化和特征提取,还探索了多模态MRI分析和重建技术13,14。Sun等人研究了基于多模态MRI的胶质瘤评估,结合深度学习重建框架和去噪策略。他们的工作证明了图像质量增强对提升胶质瘤检测准确性的重要性。同样,Srinivas和Rao提出了基于DL的多模态MRI脑肿瘤亚区域分析分段框架14。他们的方法改善了肿瘤亚区域的划分,并促进了个性化的治疗计划。然而,多模态框架通常需要大量预处理、增加计算资源以及影像模态间的精确图像配准,这可能限制其在实际临床环境中的适用性。

注意力引导多模态融合方法也被提出以提高切片准确性和MRI特征整合的方案15,16,17,18。Zhou 等人提出了基于注意力机制的多模态脑肿瘤分割融合框架15。研究通过上下文特征学习展示了切分性能的提升;然而,该方法主要侧重于分割,而非轻量级肿瘤分类。同样,Zhou和Du提出了用于加速MRI重建的三维多模态网络16,而Huang等人则开发了AMF-Net,一种用于多模态脑肿瘤诊断的自适应多序列融合网络17。Zhou等人进一步提出了MLMFNet用于多模加速MRI重建的方案18。尽管这些方法提高了重建质量和特征融合能力,但它们高度依赖多种MRI模态、深度架构以及计算量巨大的融合操作。此类要求可能降低其在资源有限的医疗系统和基于边缘的诊断平台中部署的可行性。

其他研究专门研究了利用MRI图像分类胶质瘤、脑膜瘤和垂体肿瘤的DL框架19。Mokri 等人开发了基于 DL 的分类系统,用于利用 MRI 扫描识别三种主要脑肿瘤类型19。尽管研究表现出令人鼓舞的表现,但该模型依赖的数据集相对较小,且缺乏与轻量级迁移学习框架的比较。基于变换器的架构近年来也因其能够建模远程特征依赖性和上下文关系而受到医学影像领域的关注。Feng等人提出了一个用于加速MR图像重建的多模变换器框架。他们的方法相比传统方法提升了重建性能;然而,变压器架构通常需要大量计算资源和大规模训练数据集,这可能限制其在资源受限医疗系统的实际应用。

基于转移学习的轻量级CNN架构在降低计算复杂度的同时保持分类准确性方面展现出显著潜力 21,22,23。Rahman等人结合先进的预处理和微调方法,展示了脑肿瘤分类性能的提升21。MobileNetV2 因其按深度可分离卷积、参数数量减少以及高效的特征提取,特别适合轻量级医学成像应用。同样,基于EfficientNet的框架通过复合扩展策略同时优化网络深度、宽度和输入分辨率,展现出强大的多类分类性能22。EfficientNet架构在保持较低计算开销的同时,实现了更高的分类效率,相较于传统CNN。此外,Inception-ResNet架构将残差学习与高效的特征提取机制相结合,以提升图像分类性能23。这种混合架构实现了高效的梯度传播和更深层次的网络表示学习,同时保持了计算效率。

尽管基于MRI的脑肿瘤分类取得了显著进展,但仍有若干局限性尚未解决。许多现有方法在计算密集型架构中优先考虑分类准确性,却未能充分解决部署效率或计算限制。其他研究主要聚焦于分段、多模态重建或特征融合,而非直接的四类肿瘤分类。此外,较少有框架将轻量级迁移学习架构与注意力引导特征学习结合,实现高效的多类脑肿瘤分类。因此,在资源有限的临床环境中,仍需建立一个计算效率高的框架,平衡分类准确性、轻量化部署和判别性特征提取。

因此,本研究提出了一种轻量级注意力引导的迁移学习框架,利用MRI图像进行四类脑肿瘤分类。该框架将MobileNetV2、EfficientNetV1和Inception-ResNet-V2整合,采用一种注意力机制,选择性地强调诊断相关的肿瘤区域,同时抑制无关背景特征。该框架旨在提升特征辨别和分类性能,同时降低计算复杂度。通过结合轻量级迁移学习骨干与注意力引导特征提取,该方法旨在为资源有限的临床决策支持环境中,提供高效且可扩展的基于MRI的自动脑肿瘤分类解决方案。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究使用了一个公开的匿名数据集;因此,无需知情同意。所提方法包括六个组成部分:预处理、卷积模块、注意力模块、卷积与注意模块的集成,以及全连通(FC)层。 图1 展示了我们方法的完整工作流程。

数据集获取
标记脑部MRI图像来自公开的Kaggle数据集,包含四个肿瘤类别和正常组织。

数据预处理
图像会被调整到统一分辨率和强度归一。可选的增强(旋转、翻转、缩放)用于提升泛化能力。数据集分为训练组(70%)和测试组(30%)。

模型架构
使用三种在ImageNet上预训练的骨干CNN——MobileNetV2、EfficientNetV1和Inception-ResNet-V2——利用MRI图像将脑肿瘤分为四类。MobileNetV2 和 EfficientNetV1 的输入尺寸为 224 × 224 像素,而 Inception-ResNet-V2 的输入尺寸为 299 × 299 像素。在迁移学习过程中,初始卷积层在开始时被冻结以保留广义图像特征,而上层则被微调以适应脑肿瘤分类模型。每个主链都配有一个轻量级分类头,该头包括全局平均池化、密集层、正则化的dropout以及用于预测四个类别的Softmax激活函数。采用掉值是为了减轻过拟合并增强泛化。设计架构有效地将高效的特征提取与较低的计算需求结合起来,便于精确分类,同时仍适合资源有限和概念验证场景的部署。

基于注意力的特征提取
输入图像经过初始卷积层处理,随后是自定义注意力模块。平行最大池化和平均池化捕捉显著且上下文特征,通过卷积串接和细化以突出肿瘤相关区域。

卷积主干与融合
注意力加权特征会转发到预训练的骨干网(MobileNetV2、EfficientNetV1 或 Inception-ResNet-V2)。高层卷积层被逻辑融合,以减少内存访问并提高计算效率。

分类
扁平特征通过全连通层,ReLU6激活和丢失,形成最终四类软极大分类的紧凑表示。

评价
模型表现通过准确性、精确度、召回率、F1分数和混淆矩阵来评估。

框架开发
该方案用 Python 实现,并使用 Keras 执行。 表1 展示了超参数。数据集按70:30比例分为训练集和测试集。使用五种不同的列车/测试分配方式来显示每个数据集的最终平衡性能。

预处理
输入图像必须更新,因为 MobileNetV2 框架是该方案的基础。为了从照片中提取高分辨率特征,使用预训练的MobileNetV2模型及其输入维度。每张输入图像随后缩放到[-1, 1]范围内的224×224像素。

卷积模型
MobileNetV2 通过高效的卷积神经网络(CNN)架构提升图像识别能力,旨在最大限度地减少计算需求。虽然传统卷积神经网络能够实现高精度,但它们通常需要大量的内存和处理能力。MobileNetV1引入了深度可分卷积的概念,将标准卷积分为两种不同的操作:用于过滤输入的深度卷积和用于积分特征的点向卷积。MobileNetV2基于这一理念,加入了瓶颈残留块,包括扩展层、深度卷积、投影层和残差连接。投影层压缩特征通道,而残余连接则促进网络中更便捷的信息流动。为了提升稳定性和提升学习性能,卷积操作后会应用ReLU6激活和批处理归一化。

在这项研究中,MobileNetV2 在 ImageNet 上预训练,作为提取特征的骨干模型,提供了高效的高层次语义表示,同时降低了脑肿瘤分类的计算成本。每叠卷积层之后,有一个ReLU6激活层,它是ReLU激活函数的适配,其中大小在6时最大化,以及一个批次归一化层。常见的1x1卷积层、平均池化和分类层被应用于剩余的17个瓶颈块,形成完整的MobileNetV2架构。我们使用MobileNetV2作为骨干网络,预训练于ImageNet。在这种情况下,卷积映射是从经过MobileNetV2卷积层后最后一个残差块获得的。低层残差块产生更小的特征图。此类区块对我们的研究无益,因为它们不收集用于整体图像识别的高级数据。在模型构建和训练过程中,生成7 × 7 3D特征图卷积层之前的层保持固定。用数学术语,这在方程(1)中表示如下:

F1(I) = 变体(I)(1)

这里,F1(I)表示从输入图像I中提取的卷积特征。

焦点模块
人脑的注意力机制,意味着人们天生更关注重要的视觉输入而非图像中的每个细节,这成为该转化网络设计的基础。基于这一理念,深度学习研究中创建了许多基于注意力的模型。脑肿瘤表征中观察到的空间相关性被提出的注意力机制所突出。通道注意力模块捕捉特征通道中最重要的肿瘤相关信息,区域注意力单元则识别MRI图像中最具信息量的区域。建议关注单元采用结构化注意力方法,重点关注包含辨别性肿瘤信息的区域。

为了改善特征表示,在空间特征检测阶段之前,会使用顶激活池和平衡特征提取等技术。该策略增强了模型在强调临床重要肿瘤区域的同时减少无关背景细节的能力,从而提高分类准确性和特征学习的效率。第二种是最大池张量和平均池张量的串接。最后,将使用西格玛激活函数结合7x7卷积滤波器,激活视觉中的视觉刺激。对焦模块的不同阶段在方程(2)和(3)中表示。其中平衡池(F)∈RHxWx1表示平均池化操作,MaxPool(F) ∈RHxWx1表示最大池化操作。

F2(I) = [AvgPool(F);MaxPool(F)(2)

这两个元素映射可以在三维中组合生成元素映射

F2(I) = R∈ RHxwx1。 F3(I) = σ(f7x7(F2(I)))(3)

其中σ是表示σ的激活函数。注意力特征由 HxWxC 高度编码张量(V)、宽度(W)和厚度(C)表示,分别由 F3(I) 表示,而 f7x7 表示滤波器尺寸卷积操作(7x7)。

注意力融合与卷积模型
与依赖单一编码器的网络不同,多模态合并单元可以为绝大多数模态提取更高效、更全面的信息。融合块旨在引导最大程度的跨模态特征;因此,它能够精准定位肿瘤区域切除的重点区域。这是一种简单地将各个潜在表示串接起来,但会丢失一些信息。因此,通过使用Sitaula等人的基本特征连接方法,将卷积模块和观察模块的特征映射结合生成了一个组合对象映射。这两张特征图捕捉了不同图像属性的差异,因此我们决定采用简单的连接方法,而非基于最大、最小或和的策略。这也使其计算量比使用双线性方法作为张量积计算形式的替代方法更轻。当这两个特征结合时,所得结果称为特征张量。字符T聚合张量输出的数学表达式由方程(4)给出。

[F1(I), F3(I)] = T(I)(4)

其中F1(I)∈RHxWx1,F2(I)∈RHxWx1280。这些张量是宽度(W)和高度(H)相同的三维张量。此外,它们还可以在三维k的三维张量创建中串联,其中T(I)∈LxWx1281。

全连通层(FC)
我们使用一系列光控层(FC)在特征融合后,将重新塑造的体积张量转换为线性特征矢量。分类头由全局平均池层、全连通稠密层、dropout 正则化和 Softmax 输出层组成。采用ReLU6激活函数,具有128单位,掉落概率为50%。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

使用MRI图像评估了三种预训练深度学习模型,即MobileNetV2、EfficientNetV1和Inception-ResNet-V2,用于四类脑肿瘤分类。

使用的数据集
该框架使用了从Kaggle平台获得的公开脑肿瘤MRI数据集进行评估。数据集包括835张正常脑MRI图像、826张胶质瘤图像、822张脑膜瘤图像和827张垂体肿瘤图像。数据集中的代表性MRI样本如 图2所示。

移动网2
MobileNetV2模型共包含2,263,108个参数,其中可训练参数为2,228,996个,不可训练参数为34,112个。分类绩效指标见 表2。该模型整体分类准确率达到97%,宏观和加权平均F1分数相当。 表3 所示的混淆矩阵显示,四个肿瘤类别的分类表现都很强,胶质...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

基于准确性、回忆性、F1评分和精度的性能评估显示,MobileNetV2和Inception-ResNet-V2在脑肿瘤分类方面取得的成绩相当,均达到97%的综合和加权平均准确率。相比之下,EfficientNet凭借增强的泛化和复合尺度策略,在宏观和加权平均指标上均实现99%的准确率,表现优于其他模型。这些发现与以往研究一致,这些研究证明了EfficientNet架构在多类MRI肿瘤分类和计算高效特征学习方面的有效性22。同样,基于迁移学习的MobileNetV2框架此前在轻量级脑肿瘤分类任务中表现出优异表现,同时保持较低的计算复杂度21

EfficientNetV1性能的提升归功于其对网络深度、宽度和输入分辨率的均衡缩放,从而高效提取辨别性肿瘤相关特征。关于化合物标度策略优势的类似观察也在早期CNN优化研究中报告,7,8

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无需声明利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究未获得外部资金支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
脑部MRI数据集IEEEhttps://dx.doi.org/10.21227/q2vt-tf46该数据集需通过机构访问下载。MRI数据集包含四类:胶质瘤、脑膜瘤、垂体肿瘤和正常脑部
CNN加速器(层融合)建议工作逻辑融合顶部卷积层以减少内存访问并提高计算效率
自定义注意力模块建议工作集成最大池化和平均池化的注意力机制,以强调与肿瘤相关的区域
EfficientNetV1Google预训练(ImageNet)提供最佳准确性和效率权衡的可扩展CNN架构
Google ColaboratoryGooglehttps://colab.research.google.com/用于模型训练、评估和GPU支持的基于云的环境
Inception-ResNet-V2Google预训练(ImageNet)结合Inception模块和残差连接的深度混合CNN架构
KerasGooglev2.6.0基于TensorFlow的高级神经网络API,用于快速模型原型设计
MatplotlibMatplotlib开发团队v3.4.3用于绘制训练曲线、混淆矩阵和性能指标的可视化库
MobileNetV2Google预训练(ImageNet)优化为移动和边缘部署的轻量级CNN主干
NumPyNumPy开发团队v1.21.4用于数值运算的核心科学计算库
PandasPandas开发团队v1.3.4用于数据集组织和元数据处理的数据处理和操作库
PythonPython软件基金会v3.8.10用于数据预处理、模型开发和评估的主要编程语言
Scikit-learnScikit-learn开发团队最新稳定版本用于性能评估指标(如精度、召回率、F1-得分和混淆矩阵)
SeabornSeaborn开发团队最新稳定版本用于增强图形分析的高级统计可视化库
TensorFlowGooglev2.6.0用于实现CNN主干和注意力模块的端到端深度学习框架

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

233 233 MobileNetV2 EfficientNetV1 Inception ResNet V2

相关文章