本研究采用受控框架评估固定架构下的预处理流水线和优化器,旨在确定经典预处理如何影响优化器和卷积神经网络(CNN)在脑肿瘤分类中的应用。
Research Article
本研究采用受控框架评估固定架构下的预处理流水线和优化器,旨在确定经典预处理如何影响优化器和卷积神经网络(CNN)在脑肿瘤分类中的应用。
利用磁共振成像(MRI)进行脑肿瘤分类,由于肿瘤大小、形状和纹理的差异,存在挑战。 尽管传统图像预处理方法常被用于提升输入质量,但其对优化器行为和CNN性能的影响尚未被彻底研究。本研究考察了预处理对各种优化器中收敛性、泛化和分类准确性的影响。我们利用公开的Kaggle数据集创建了两条预处理流程:一条仅调整图像大小的基线管道和一条传统管道,将图像转换为灰度、模糊并应用形态过滤。随后我们测试这些流水线对三个优化器的影响:亚当、均方根传播(RMSProp)和随机梯度下降(SGD)。为了分离协议变量,整个过程采用固定的CNN架构。通过准确性、精确度、回忆和F1评分来评估表现,并通过五重交叉验证进行验证。结果显示,基线预处理在所有优化器间持续带来更高的准确性和更稳定的收敛,RMSProp 和 SGD 在五重交叉验证下达到了最高的平均准确率,达到 99.53%。研究结果解决了预处理对优化器性能影响的不足研究,强调了预处理感知训练策略的必要性,以提升医学图像分析中的鲁棒性和可解释性。
利用磁共振成像(MRI)进行脑肿瘤分类是神经肿瘤学中的关键任务,早期和准确诊断直接影响治疗计划和患者结局。CNN已成为自动化这一过程的主流方法,因为它们能够直接从原始图像数据中学习层级空间和质地特征2。然而,输入数据的质量仍然是模型性能的关键决定因素。经典的预处理技术——如灰度转换、高斯模糊、阈值化和形态学作——被常规应用以减少噪声并强调结构边界 3,4,5。Gangadharan等人对深度学习模型在脑肿瘤预测中的比较分析,强调了不同架构性能的变异性以及数据集特性在塑造结局中的重要性6.Qureshi等人提出了一种超轻量级CNN用于多类肿瘤检测,强调计算效率和实时适用性,同时不影响诊断准确性7.Qureshi等人不仅仅限于结构成像,还利用多参数MRI扫描中的融合多组学特征,进行放射基因组分类,预测甲基鸟嘌呤-DNA甲基转移酶(MGMT)启动子甲基化状态,展示了集成数据模态在非侵入性肿瘤剖析中的潜力。尽管这些变换无处不在,但其对CNN训练动态、优化器行为和可解释性的影响仍然缺乏充分探讨。
脑肿瘤分类的最新进展聚焦于结构复杂性、分割-分类混合体和迁移学习。例如,MultiFeNet采用多尺度特征融合来增强空间表示9,而集合模型和3D CNN则提供高保真度,但计算开销增加10,11。近期关于混合方法的研究,如支持矢量机(SVM)小波变换和基于胞元自动机的边缘检测,通常需要手工制作特征或多阶段处理12,13。对不平衡数据集的比较研究凸显了实现类别泛化的挑战14.使用预训练网络的迁移学习方法,如VGG和ResNet,在MRI分类15、16、17中展现出潜力;然而,他们通常将预处理视为固定的上游步骤。这些模型很少单独分析输入变换如何影响优化器收敛或语义保留。
预处理意识研究开始凸显这一差距。Ivanescu等人证明,过度过滤会降低CNN对细微肿瘤模式的敏感性。Vu 等人证明灰度转换和调整大小可以丢弃上下文信息,从而影响诊断准确性4.Hooper等人发现,上游计算机断层扫描(CT)滤波会引起性能变异,凸显了CNN对结构域移位的脆弱性5。Kundu 等人提出了基于高斯强度的变换以改善分割18;但他们并未评估优化器的灵敏度。与此同时,Asiri等人和Aamir等人优化了脑肿瘤检测的CNN超参数16,17,指出Adam的优异表现,但未分析其对预处理变化的响应。梯度加权类别激活映射(Grad-CAM)和SHapley加法解释(SHAP)等可解释工具通过可视化类别区分区域,推动了我们对CNN决策的理解,19,20。这些方法对于验证预处理是否能改善还是扭曲语义保持至关重要。
然而,很少有研究系统性地探讨预处理如何影响固定架构下的优化器收敛、泛化和可解释性——这些问题在临床和计算上都具有重要意义。临床上,过度平滑或强度变换会削弱诊断相关的纹理和空间梯度,降低定位准确性和临床医生的信任度。在计算上,优化器对特征尺度和梯度方差的变化反应不同;输入复杂度与优化器动态之间的不匹配可能导致收敛不稳定或泛化较差。
为此,我们引入了一个双路径框架,系统地比较三种优化器——Adam、RMSProp 和 SGD——的基线(仅重尺寸)和传统预处理流水线,采用一致的 CNN 架构和 BR35H Kaggle 数据集21。我们通过五重交叉验证,评估了分类性能、收敛速度和可解释性,并通过五重交叉验证进行了验证。与之前将架构变更和预处理变更混为一谈的研究不同,该协议将预处理隔离为独立变量,揭示了激进过滤会阻碍优化器和空间注意力的性能。
这里提出的框架相较于现有模型具有多项优势。首先,它明确评估了预处理策略与优化器之间的相互作用,这一维度在集合和迁移学习研究中常被忽视,见15,16,17。其次,它保持固定的CNN架构,从而模拟现实部署约束,而在重配置通常不切实际的情况下。第三,它整合了视觉归因方法来评估语义保持,补充了此前在放射学和手工特征研究方面的研究23。最后,该框架提供了可重复的预处理感知训练策略洞见,从而提升了鲁棒性和可解释性。
通过综合预处理方法3、4、5、优化研究16、17和可解释工具19、20的见解,本研究为脑肿瘤分类提供了一条实用且可解释的流程,平衡了准确性、稳定性和临床相关性。
Access restricted. Please log in or start a trial to view this content.
图1 展示了协议工作流程的概述。本研究考察了经典图像预处理对CNN性能的影响,以及优化器在利用MRI进行脑肿瘤分类时的行为。该协议涵盖数据集准备、双路径预处理流水线、模型架构、优化器配置、性能评估和可解释性验证。所有实验均在Python 3.10.12中运行,使用Keras 2.13.1版本,后端为TensorFlow,OpenCV为4.8.0版本,Matplotlib为3.8.0。
数据集准备
本研究使用了来自Kaggle21的BR35H脑肿瘤MRI数据集,包含3000张图像,平均分为肿瘤存在(“是”)和肿瘤缺失(“否”)类别。所有图像均使用OpenCV的cv2.resize函数调整为128×128像素,以标准化实验间的输入尺寸。采用Scikit-learn train_test_split的分层抽样确保了训练集(80%)和验证集(20%)之间的平衡代表性,从而保持了各折段类别分布的一致性。
除了BR35H公开数据集外,我们还使用来自Ultralytics脑肿瘤数据集(https://docs.ultralytics.com/datasets/detect/brain-tumor/)收集的独立数据集验证了该方案。该数据集包含878张有效的训练图像和223张测试集,分为两个明确类别:负面(无脑肿瘤图像)和正向(含脑肿瘤图像)。纳入该独立数据集使我们能够进一步评估该框架在原始源数据之外的普遍性和稳健性。
预处理管道
为评估经典图像预处理的影响,实施了两条不同的预处理流程。基线预处理(BP)流水线仅将图像调整为128×128像素,无需进一步变换,从而保留原始像素强度和结构特征作为控制条件。传统预处理(TP)流水线采用了一系列经典图像处理步骤,使用OpenCV函数:灰度转换(cv2.cvtColor)以降低通道维度,高斯模糊(cv2.GaussianBlur)用于抑制噪声和增强对比度24,阈值化(cv2.threshold)用于分割高强度结构25,形态作(cv2.侵蚀,cv2.dilate)用于细化边缘和减少伪影26,轮廓检测(cv2.findContours)用于识别感兴趣区域。这种管道增强了对比度,减少了视觉杂乱,尽管也有可能压抑诊断相关的质感。
模型架构
采用了定制CNN,并在所有实验中保持恒定,以隔离预处理和优化器选择的影响。该架构由一个输入层(128 × 128 × 1)、三个卷积层组成(第一层有32个滤波器,后两个有64个滤波器,均使用 2 × 2 核和整流线性单元(ReLU)激活),每个层后面跟着 2 × 2 最大池化。输出被压平,经过128个单位的密集层,激活ReLU,然后是dropout层(速率=0.5),最后是单一S形单元进行二进制分类。该设计在可解释性和计算效率之间取得了平衡,适合资源有限的临床硬件。
优化器配置
采用固定超参数评估了三种优化器:Adam(学习率 = 0.001,β1 = 0.9,β2 = 0.999,epsilon = 1e−07)、RMSProp(学习率 = 0.001,rho = 0.9,epsilon = 1e−07)和 SGD(学习率 = 0.005,动量 = 0.9,Nesterov 禁用)。训练参数在各实验间保持恒定,批次规模为32,50个历时,并通过Keras回调实现早期停止(耐心=10),以防止过拟合。
绩效评估
表现通过准确性、精准度、回忆率和F1分数评估,这些分数均用Scikit-learn的classification_report计算得出。使用Matplotlib绘制训练和验证损失曲线,以评估收敛速度并检测过拟合。结果被整理并可视化,以比较优化器在不同预处理条件下的灵敏度。
可解释性验证
通过从最终卷积层生成的Grad-CAM可视化验证了可解释性。热图通过Kera和TensorFlow函数生成,然后用Matplotlib叠加在原始MRI图像上。这一步骤确保CNN的空间注意力与临床相关的肿瘤区域对齐,从而支持透明度和诊断信任。
Access restricted. Please log in or start a trial to view this content.
Adam 优化器 - 基线预处理:
图2展示了使用Adam优化器进行基线预处理的脑肿瘤分类模型的性能。混淆矩阵显示肿瘤病例与非肿瘤病例几乎完美分离,600个样本中仅有8个错误分类。随附的分类报告以准确度、记忆力和F1分数均为0.98或以上,证实了这一点。
Adam优化器配合传统预处理:
图3展示了使用Adam优化器和传统预处理训练的CNN模型的分类性能。该模型整体准确率达到95.83%,两类均保持平衡精度和0.96的回忆得分。混淆矩阵显示肿瘤阳性和肿瘤阴性病例的区分力强,正确识别了343例非肿瘤病例中的333例和257例肿瘤病例中的242例。错误分类很少,仅有25个样本标记错误。
带有基线预处理功能的RMSProp:
...
Access restricted. Please log in or start a trial to view this content.
本研究中基于CNN的脑肿瘤分类成功主要由两个方案组成部分推动:预处理设计和优化器选择。基线预处理——仅包含图像大小调整——保持了原生像素强度和空间结构,使模型能够学习临床相关的特征。相比之下,传统的预处理方法(如灰度转换、高斯模糊、阈值和形态作)引入了特征抽象,常常抑制细微的肿瘤线索,导致性能和可解释性降低。
优化器的选择进一步影响了收敛速度和泛化性。Adam和RMSProp这两款自适应优化器在干净输入条件下展现了快速收敛和稳定性能。SGD虽然收敛较慢,但结合基线预处理时展现出强烈的泛化性和最小的过度拟合。这些发现凸显了将预处理策略与优化器动态对齐的重要性,以确保医学影像工作流程中稳健的CNN学习。
如果性能偏离预期结果,可能需要考虑若干方案调整:(i) 预处理调优:过度过滤或阈值化可能模糊肿瘤边界。减少形态作强度或恢复基线预处理可以恢复空间保真度。(ii) 优化器重新配置:如果收敛不稳定,从RMSProp切换到Adam或调整学习率可能会改善梯度流。(iii)...
Access restricted. Please log in or start a trial to view this content.
作者没有什么可透露的。
作者衷心感谢GITAM大学、领导团队、院长以及维沙卡帕特南校区计算机科学与工程系主任对科研与开发的持续支持与鼓励。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| API 包装器 | 克拉斯 | 2.13.1(RRID:SCR_016345) | CNN架构与培训的高级API |
| 归因工具 | Grad-CAM 实现 | 自定义(通过Keras) | CNN注意力的视觉解释 |
| BR35H脑肿瘤MRI数据集 | 卡格尔 | https://www.kaggle.com/ahmedhamada0/brain-tumor-detection | 分类用标记MRI图像来源及nbsp; |
| 脑肿瘤数据集 | 超溶菌 | https://docs.ultralytics.com/datasets/detect/brain-tumor/ | |
| 深度学习库 | 张量流 | 2.15.0 (RRID:SCR_018345) | CNN模型实现的后端 |
| 图像处理 | OpenCV | 4.8.0 (RRID:SCR_015526) | 预处理:灰度、模糊、阈值、形态 |
| 编程语言 | 蟒蛇 | 3.10.12 (RRID:SCR_008394) | 所有实验的执行环境 |
| 可视化 | Matplotlib | 3.8.0 (RRID:SCR_008624) | 损耗曲线绘制与Grad-CAM叠加 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission