Method Article

基于MRI的四类脑肿瘤分类的注意力引导迁移学习框架

DOI:

10.3791/69087

July 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一个基于轻量级注意力的深度学习框架,用于从MRI图像中进行四类脑肿瘤分类,采用MobileNetV2、EfficientNetV1和Inception-ResNet-V2进行迁移学习。该模型在降低计算复杂度的同时实现了高分类精度,支持资源受限的临床决策支持应用。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究的目标是开发一个轻量级但准确的深度学习框架,用于将脑肿瘤分类为四类——胶质瘤、脑膜瘤、垂体肿瘤和健康脑组织——利用磁共振成像(MRI)数据。所提出的方法将迁移学习与三个预训练的卷积神经网络模型——MobileNetV2、EfficientNetV1和Inception-ResNet-V2结合起来,并集成了一种注意力机制,模拟人类视觉系统在图像中专注于临床相关区域的能力。这种注意力引导的方法增强了肿瘤定位,同时抑制了无关的背景信息。该框架在一个大型、公开可用的脑部MRI数据集上进行评估,该数据集包含来自四个类别的数千张标记图像。采用标准预处理、数据增强和训练协议,以便能够直接复制所提出的方法。实验结果表明,EfficientNetV1实现了最高的分类性能,在准确性方面达到优于MobileNetV2和Inception-ResNet-V2的水平。该研究得出结论,所提出的轻量级、基于注意力的框架有效地平衡了准确性和计算复杂度,使其非常适合实时和移动医疗应用,特别是在资源受限的环境中。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
```html

利用磁共振成像(MRI)准确分类脑肿瘤在临床诊断、治疗计划和预后评估中起着至关重要的作用1。脑肿瘤,包括胶质瘤、脑膜瘤和垂体肿瘤,表现出不同的病理特征和治疗反应;因此,早期和可靠的识别对于改善治疗结果和减少疾病进展至关重要。MRI因其优越的软组织对比度、无创性和能够在多个解剖平面上可视化肿瘤形态而广泛用于脑肿瘤评估。然而,手动解读MRI扫描通常耗时且高度依赖放射学专业知识,特别是当肿瘤边界不规则或肿瘤类别之间存在视觉相似性时。因此,自动化计算机辅助诊断系统对于辅助放射科医生进行准确和高效的肿瘤分类变得越来越重要。

基于深度学习(DL)的图像分析技术在生物医学和计算机视觉应用中显著推进了自动化疾病分类2,3。在神经肿瘤学中,机器学习和迁移学习技术在肿瘤检测、分割和分类任务中表现出了有前景的性能4。特别是卷积神经网络(CNN),在从MRI扫描中自动提取分层图像特征方面表现出了卓越的能力,而无需依赖手工特征工程。CNN架构可以从成像数据中学习肿瘤相关的判别性表示,从而提高分类性能,相比于传统的机器学习方法更好。深度学习的最新进展已经使得开发出高性能图像分类系统成为可能,这些系统能够处理大规模成像数据集,并提高精度,同时减少人为干预。

尽管有这些进展,传统的深度CNN架构通常需要大量的计算资源,包括高内存消耗、增加的参数复杂度和长时间的训练5。这种计算需求限制了它们在资源受限的临床环境和移动医疗系统中的实施。此外,轻量级卷积神经网络架构因其降低的计算复杂度和适合在低资源应用中部署而引起了越来越多的关注5。最近的几项研究探索了优化的CNN策略、高效的特征提取机制和轻量级部署框架,以提高分类效率而不显著影响预测准确性6,7,8。然而,在基于MRI的脑肿瘤分析中,平衡计算效率与稳健的多类肿瘤分类性能仍然是一个主要挑战9

基于注意力的深度学习框架已经成为改进医学图像分析中特征表示的有效解决方案10。注意力机制使神经网络能够选择性地强调诊断相关的图像区域,同时抑制不相关的背景信息。受人类视觉系统的启发,注意力引导的架构通过将计算焦点引导到肿瘤特定的空间区域和上下文特征来改进判别特征学习。这些机制对于脑肿瘤MRI分析特别有益,因为肿瘤组织经常表现出异质性强度模式、不规则形态和肿瘤类别之间重叠的视觉特征。因此,将注意力模块集成到基于CNN的架构中可以提高分类准确性并改善特征定位性能。

最近的几项研究已经展示了深度学习框架在自动化脑肿瘤诊断和基于MRI的肿瘤分类中的潜力11,12。Gao等人开发并验证了一种用于脑肿瘤诊断的基于MRI数据的深度学习模型,展示了自动化神经影像分析的强大分类能力11。同样,Abdusalomov等人研究了基于深度学习的MRI扫描脑肿瘤检测方法,并报告了有前景的诊断性能12。尽管这些研究实现了分类准确性的提高,但与数据集多样性、模型泛化能力和计算要求相关的限制仍未解决。在许多情况下,训练数据集的大小有限或来源于受限的临床来源,从而增加了过拟合的风险并降低了在异质患者群体中的鲁棒性。

为了改善肿瘤可视化和特征提取,多模态MRI分析和重建技术也已被探索13,14。Sun等人研究了基于多模态MRI的胶质瘤评估,使用深度学习重建框架结合去噪策略13。他们的工作展示了图像质量增强对提高胶质瘤检测准确性的重要性。同样,Srinivas和Rao提出了一个基于深度学习的分割框架用于多模态MRI脑肿瘤亚区域分析14。他们的方法改善了肿瘤亚区域的描绘,并有助于个性化治疗计划。然而,多模态框架通常需要广泛的预处理、增加的计算资源和成像模式之间精确的图像配准,这可能限制了它们在实际临床环境中的适用性。

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究使用了公开可用的、匿名的数据集;因此,不需要知情同意。所提出的方法包括六个组件:预处理、卷积模块、注意力模块、卷积和注意力模块的集成以及全连接(FC)层。 图 1 展示了我们方法的完整工作流程。

数据集获取
标记的脑部核磁共振图像来自公开可用的 Kaggle 数据集,包括四种肿瘤类别和正常组织。

数据预处理
图像被调整为统一分辨率并进行强度归一化。可选的增强(旋转、翻转、缩放)用于提高泛化能力。数据集被分为训练(70%)和测试(30%)集。

模型架构
三个在 ImageNet 上预训练的主干 CNN——MobileNetV2、EfficientNetV1 和 Inception-ResNet-V2——被用来使用核磁共振图像对脑肿瘤进行四类分类。MobileNetV2 和 EfficientNetV1 配置为 224 × 224 像素的输入维度,而 Inception-ResNet-V2 需要 299 × 299 像素的输入大小。在迁移学习过程中,初始卷积层在开始时被冻结以保留广义图像特征,而上层被微调以适应脑肿瘤分类。每个主干与一个轻量级分类头配对,包括全局平均池化、密集层、用于正则化的 dropout 以及用于预测四个类别的 Softmax 激活函数。实施 dropout 以减轻过拟合并增强泛化能力。设计的架构有效地合并了高效的特征提取与较低的计算需求,便于在资源受限和概念验证场景中进行精确分类。

基于注意力的特征提取
输入图像通过初始卷积层和自定义注意力模块进行处理。并行最大池化和平均池化捕获显著和上下文特征,这些特征通过卷积进行连接和优化,以强调与肿瘤相关的区域。

卷积主干和融合
注意力加权特征被转发到预训练的主干(MobileNetV2、EfficientNetV1 或 Inception-ResNet-V2)。高层卷积层被逻辑上融合以减少内存访问并提高计算效率。

分类
展平的特征通过具有 ReLU6 激活和 dropout 的全连接层,生成用于最终四类 Softmax 分类的紧凑表示。

评估
使用准确率、精确率、召回率、F1 分数和混淆矩阵在测试集上评估模型性能。

框架开发
所提出的解决方案在 Python 中实现,并使用 Keras 进行执行。 表 1 显示了超参数。数据集按 70:30 的比例分为训练集和测试集。使用五个不同的任意训练/测试分割来显示每个数据集的最终平衡性能。

预处理
输入图像必须更新,因为 MobileNetV2 框架作为所提出解决方案的基础。为了从照片中提取高分辨率特征,使用预训练的 MobileNetV2 模型及其输入维度。然后,每个输入图像在 [-1, 1] 范围内缩放为 224×224 像素。

卷积模型
MobileNetV2 通过利用高效的卷积神经网络(CNN)架构来增强图像识别,该架构旨在最小化计算需求。虽然传统的 CNN 能够实现高准确率,但它们通常需要大量的内存和处理能力。MobileNetV1 引入了深度可分离卷积的概念,将标准卷积分离为两个不同的操作:用于过滤输入的深度卷积和用于整合特征的点卷积。MobileNetV2 在此基础上进行了改进,引入了瓶颈残差块,包括扩展层、深度卷积、投影层和残差连接。投影层压缩特征通道,而残差连接有助于在网络中更好地流动信息。为了提高稳定性并增强学习性能,ReLU6 激活和批量归一化应用于卷积操作之后。

在这项研究中,预训练在 ImageNet 上的 MobileNetV2 被用作主干模型来提取特征,在保持低计算成本的同时为脑肿瘤分类提供有效的高层语义表示。每个卷积层之后有一个 ReLU6 激活层,这是 ReLU 激活函数的适配,其大小最大化为六,以及一个批量归一化层。常见的 1x1 卷积、平均池化和分类层应用于剩余的 17 个瓶颈块,形成完整的 MobileNetV2 架构。我们使用了预训练在 ImageNet 上的 MobileNetV2 作为主干网络。在这种情况下,通过 MobileNetV2 卷积层后的最后一个残差块得到卷积图。较低级的残差块产生较小的特征图。这样的块不会对我们的研究做出贡献,因为它们不收集高层数据用于整体图像识别。在模型构建和训练过程中,生成 7 × 7 3D 特征图的卷积层之前的层被保持固定。在数学上,这在下面的 Eq (1) 中表示:

F1(I) = Conv(I)       (1)

这里,F1(I) 表示从输入图像 I 提取的卷积特征。

焦点模

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

使用MRI图像对四类脑肿瘤进行分类,评估了三个预训练的深度学习模型,分别是MobileNetV2、EfficientNetV1和Inception-ResNet-V2。

使用的数据集
所提出的框架使用从Kaggle平台获得的公开的脑肿瘤MRI数据集进行评估。该数据集包含835张正常脑部MRI图像、826张胶质瘤图像、822张脑膜瘤图像和827张垂体瘤图像。数据集中的代表性MRI样本显示在图2中。

MobileNetV2
MobileNetV2模型共有2,263,108个参数,其中包含2,228,996个可训练和34,112个不可训练参数。分类性能指标显示在表2中。该模型的总体分类准确率为97%,宏观平均和加权平均F1分数具有可比性。表3中显示的混淆矩阵表明,该模型在所有四种肿瘤类别中都表现出强大的分类性能,而胶质瘤和脑膜瘤之间的错误分类较少。

图3展示了MobileNetV2的训练和验证准确率/损失曲线。经过几个训练周期后,该模型表现出稳定的收敛性,验证性能逐渐提高。

Inception-ResNet-V2
Inception-ResNet-V2模型共有54,342,884个参数,其中包含54,282,340个可训练和60,544个不可训练参数。分类指标总结在表4中。该模型的总体分类准确率为98%,表现出比MobileNetV2更好的性能。

表5中的混淆矩阵表明,所有肿瘤类别的分类准确率较高,错误分类率降低。与MobileNetV2模型相比,该模型在肿瘤类别之间的区分更加明显。图4展示了Inception-ResNet-V2的训练和验证性能曲线。该模型在训练周期中表现出稳定的学习行为和一致的收敛性。

EfficientNetV1
EfficientNetV1模型共有6,580,363个参数,其中包含6,518,308个可训练和62,055个不可训练参数。表6中总结的分类指标表明,在所评估的模型中表现最佳,准确率、精确度、召回率和F1-score约为99%。

表7中的混淆矩阵表明,该模型在所有四种肿瘤类别中都表现出强大的分类性能,错误分类最少。该模型正确分类了大多数胶质瘤、脑膜瘤、无肿瘤和垂体瘤图像。

图5展示了EfficientNetV1的训练和验证准确率/损失曲线。该模型实现了稳定的收敛性,与其他评估的架构相比,验证波动较少。

总体比较
在评估的模型中,EfficientNetV1在保持较低计算复杂性的同时,实现了最高的分类性能。MobileNetV2展示了高效的轻量级性能,参数要求较少,而Inception-ResNet-V2在大幅提高模型复杂性的同时,实现了更高的分类准确率。结果表明,EfficientNetV1在四类脑肿瘤MRI分类中,在分类准确率和计算效率之间提供了最佳平衡。

数据可用性
本研究分析的脑部MRI数据集可以通过Kaggle平台公开获取。本研究期间生成和分析的所有数据,包括分类结果、性能指标、混淆矩阵和训练/验证结果,均在本文的图表中呈现。模型开发和评估使用的自定义代码可向相应作者提出合理请求获得。

图1
图1: 用于四类脑肿瘤分类的注意力引导迁移学习框架。该工作流程展示了用于MRI基于肿瘤分类的预处理、基于注意力的特征提取、卷积特征学习、特征融合和全连接分类层。请点击此处查看该图的大图。

图2
图2: 四类脑肿瘤数据集的代表性MRI图像。
展示了用于模型训练和评估的胶质瘤、脑膜瘤、垂体瘤和正常脑部类别的样本MRI扫描。请点击此处查看该图的大图。

图3

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

基于准确度、召回率、F1-score和精确度的性能评估显示,MobileNetV2和Inception-ResNet-V2在脑肿瘤分类中的结果相当,均达到97-98%的总体和加权平均准确度。相比之下,EfficientNet在宏观和加权平均指标上达到99%的准确度,这要归功于其增强的泛化能力和复合缩放策略。这些发现与先前研究一致,证明了EfficientNet架构在多类MRI肿瘤分类和计算效率高的特征学习方面的有效性22。同样,基于迁移学习的MobileNetV2框架在轻量级脑肿瘤分类任务中表现出色,同时保持较低的计算复杂度21

EfficientNetV1性能的提升可能归因于其对网络深度、宽度和输入分辨率的平衡缩放,这使得能够高效提取具有判别性的肿瘤相关特征。在早期的CNN优化研究中也报告了类似的观察,表明复合缩放策略的优势7,8。此外,注意力引导特征提取模块的整合可能有助于通过抑制无关的背景信息来改善肿瘤相关区域的定位,这与基于注意力的医学图像分类研究的发现一致10,15

尽管有这些结果,脑肿瘤分类仍面临一些挑战,包括对不规则肿瘤的精确区分、肿瘤核心以外子区域的分割,以及对不同脑组织类型的准确分类。以往的研究也同样强调了MRI基于肿瘤分类系统中与数据集多样性、泛化能力和计算复杂度相关的局限性9,11,12。此外,多模态MRI框架已经展示出改进的特征表示和肿瘤可视化,尽管这些方法通常需要大量的预处理和更高的计算资源13,17,18,20

表8显示了MobileNetV2、Inception-ResNet-V2和EfficientNetV1的5折验证交叉分析。该表展示了准确度、精确度、召回率和F1-score的平均值和标准差,以及各折的准确度。MobileNetV2表现出稳定但相对较低的性能,而Inception-ResNet-V2则提高了准确度和一致性。EfficientNetV1取得了最高的平均准确度(0.989 ± 0.003)和最低的方差,表明了优秀的泛化能力。其一致地高的折-wise准确度(0.986-0.992)展示了在多个数据集划分上的稳健和稳定的性能,使其成为本研究中四类脑肿瘤MRI分类最有效的模型。

研究的局限性
该框架目前的评估仅依赖于在线数据增强,这可能限制了其在处理现实世界场景中更广泛数据变异性方面的鲁棒性。此外,该研究主要探索了最终卷积层的特征提取,而没有评估多层特征融合的潜在益处。研究也仅限于静态MRI数据集,未在现实临床工作流中进行验证,这可能带来集成挑战。

未来研究方向
未来的工作应探索来自MobileNetV2和其他主干网络的多层特征聚合,以进一步提高分类准确度。扩展框架以支持多模态成像数据,并在实时临床环境中验证其性能,将增强其实际应用性。此外,优化架构以部署在移动和物联网平台上,结合先进的增强技术和真实患者数据集,可以在多样化的医疗环境中实现可扩展的高性能脑肿瘤诊断。

结论
本研究提出了一种轻量级的基于注意力引导迁移学习的框架,用于使用MRI图像进行四类脑肿瘤分类。通过利用MobileNetV2、EfficientNetV1和Inception-ResNet-V2的迁移学习,该模型在保持计算效率的同时实现了高准确度,使其可能适用于资源受限的临床环境。在平衡的四类MRI数据集上的实验表明,EfficientNetV1取得了最佳结果,达到99%的准确度、精确度、召回率和F1-score。所提出的架构有效平衡了性能和资源使用,为资源受限的医学成像场景提供了一个有前景的方法。

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者没有利益冲突需要声明。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

这项研究没有获得外部资助。

Materials

```html

List of materials used in this article
NameCompanyCatalog NumberComments
脑部MRI数据集IEEEhttps://dx.doi.org/10.21227/q2vt-tf46该数据集通过机构访问下载。MRI数据集包含四个类别:胶质瘤、脑膜瘤、垂体肿瘤和正常脑部
CNN加速器(层融合)提议的工作逻辑融合顶层卷积层以减少内存访问并提高计算效率
自定义注意力模块提议的工作集成最大池化和平均池化的注意力机制,以强调与肿瘤相关的区域
EfficientNetV1Google预训练(ImageNet)提供最佳准确性-效率权衡的可扩展CNN架构
Google ColaboratoryGooglehttps://colab.research.google.com/用于模型训练、评估和实验的云环境,支持GPU
Inception-ResNet-V2Google预训练(ImageNet)结合Inception模块和残差连接的深度混合CNN架构
KerasGooglev2.6.0构建于TensorFlow之上的高级神经网络API,用于快速模型原型设计
MatplotlibMatplotlib开发团队v3.4.3用于绘制训练曲线、混淆矩阵和性能指标的可视化库
MobileNetV2Google预训练(ImageNet)针对移动和边缘部署优化的轻量级CNN骨干网
NumPyNumPy开发团队v1.21.4用于数值运算的核心科学计算库
PandasPandas开发团队v1.3.4用于数据集组织和元数据处理的数据处理和操作库
PythonPython软件基金会v3.8.10用于数据预处理、模型开发和评估的主要编程语言
Scikit-learnScikit-learn开发团队最新稳定版用于性能评估指标,如精度、召回率、F1分数和混淆矩阵
SeabornSeaborn开发团队最新稳定版用于增强图形分析的高级统计可视化库
TensorFlowGooglev2.6.0用于实现CNN骨干网和注意力模块的端到端深度学习框架
```

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Cancer ResearchMobileNetV2EfficientNetV1Inception ResNet V2transfer learningbrain tumor

Related Articles