Method Article

利用深度神经网络梯度损失进行放射学特征选择,用于肺癌分期检测

DOI:

10.3791/70181

April 30th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一种基于深度学习的特征选择方法,利用神经网络缺失函数相对于输入特征的梯度,识别并优先排序对肺癌分期检测影响最大的特征。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

放射组学技术能够从医学图像中提取定量成像生物标志物,已成为计算机辅助癌症诊断的重要工具。然而,放射学数据集通常具有高维且样本量有限,因此特征选择是构建可靠预测模型的关键步骤。本研究提出了一种梯度损失递归特征消除(GL-RFE)框架,整合深度神经网络的梯度敏感性分析,以识别对肺癌分期检测最具影响力的放射学特征。使用3D Slicer平台的PyRadiomics扩展,从胸部计算机断层扫描(CT)中提取了共106项放射学特征。所提方法通过计算网络损耗相对于输入特征的梯度来评估特征重要性,并递归地消除贡献最小的特征。由此产生的前15个放射电学特征被用来训练深度神经网络分类器,以区分早期和晚期肺癌。该框架在测试数据集上实现了良好的分类性能,准确率为90.22%,精度为90.10%,召回率为90.24%,F1评分为90.16%。可视化分析,包括相关热图和分布图,进一步确认了特征冗余减少和类分离性提升。与传统特征选择技术相比,GL-RFE有效捕捉非线性特征相互作用,增强模型泛化。本方案提供了一种可重复且可解释的放射学癌症分期检测方法。它特别适合高维、小样本的生物医学数据集,并且在基因组学和多模态临床分析等其他领域具有潜在应用潜力。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

肺癌仍然是主要癌症类型之一,导致严重的健康问题,常常导致死亡。放射学通过提取描述肿瘤形状、纹理和强度模式的大量特征,实现了医学图像的定量表征 2,3。这些特征也被称为手工设计,是肺癌诊断、预后和治疗反应的潜在生物标志物。然而,放射组学数据集通常具有高维且样本有限,导致冗余且噪声较大,降低模型性能 4,5,6,7。因此,高效且可解释的特征选择对于开发基于放射学的稳健预测模型至关重要。

传统的特征选择方法,如滤波方法(如相关分析、方差分析[ANOVA]、互信息)和包装方法(如顺序特征选择、递归特征消除)被广泛用于基于放射学的癌症检测模型4,8,9。然而,它们常常未能捕捉到放射组学数据中固有的非线性特征相互作用和深层上下文依赖性 9,10,11集合特征学习技术已被探索用于医学图像分类,但已取得中等准确率,且尚可进一步改进

深度学习方法,尤其是深度神经网络(DNN),在建模特征与结果之间的非线性和层级关系方面表现出优异,非常适合指导特征选择和提供准确的癌症检测模型13,14。在此背景下,探讨了卷积神经网络、多模态人工智能技术以及VCG-16(一种预训练的癌症诊断模型)的潜力,1,15,16提出了一个混合深度学习模型17,包括预训练的VGG-19模型和长短期记忆网络(LSTMs),经过训练并在大量图像上测试,成功率超过99%。

除了癌症检测外,还开展了癌症分期的研究。Hugo等人在NSCLC数据库中设计 了一个前馈神经网络模型,涵盖300名患者,以74.52%的准确率对癌症I、II和III期进行分类。采用了基于放射学的贝叶斯反演法3,利用NLST数据集在200个样本量下用于肺癌分期检测。该方法的准确率达到了86%。文献综述显示,大多数癌症检测研究仅专注于对良性和恶性肿瘤的分类,只有少数涉及癌症分期分类,准确率低于90%,且尚可进一步提升。本研究论文解决了上述研究空白,提出了一个稳健的放射学特征分类框架,用于准确检测肺癌分期。

本研究引入了基于梯度损失的递归特征消除(GL-RFE)框架,将神经网络的梯度反向传播整合进RFE过程。与依赖静态特征重要度的传统RFE方法不同,GL-RFE利用损失函数相对于每个输入特征的梯度来衡量每个特征对模型预测的影响程度。通过迭代去除梯度贡献最小的特征,所展示的模型选择了15个最优的诊断特征,优化了两类肺癌分期检测(I期和II期合并,IIIa期和IIIb期合并)。所执行工作的工作流程图如 图1所示。所选模型所选肺癌数据集为NSCLC Radiomics19,包含411卷格式的数字影像与医学通信(DICOM),包含临床癌症分期信息。每个肺癌DICOM卷共提取106个3D Radiomics特征,该系统是PyRadiomics20的开源软件3D Slicer21的扩展。这些特征属于七个特征类别22,包括形状、灰阶差分法(GLDM)、灰阶共现矩阵(GLCM)、一阶灰阶运行长度矩阵(GLRLM)、灰阶大小区矩阵(GLSZM)、邻域灰调差矩阵(NGTDM)。少数族裔类别(第一阶段和第二阶段)的放射学数据采用合成少数族裔过采样技术(SMOTE)进行了过采样23

GL-RFE框架的创新之处在于将基于梯度的敏感度分析从神经网络训练中整合到递归特征消除过程中。与依赖静态重要性度量的传统RFE方法不同,GL-RFE通过损失函数的反向传播梯度动态评估特征相关性。这使得识别直接影响癌症分期模型预测的特征成为可能,同时保持相对较小的医学数据集的可解释性和计算可行性。

用于训练和测试所提框架的数据集是一个公开的CT图像数据集,涵盖422名肺癌患者,称为NSCLC Radiomics17。每位患者的数据集包括CT体积、DICOM放疗结构组(RTSTRUCT)和DICOM分割(SEG)文件。这些文件包含放射肿瘤科医生手工划定原发肿瘤总体积(GTV-1)的三维体积以及肺部影像。数据集为预处理后,图像尺寸为512 x 512像素。

由于手工制作的放射电学特征具有非线性特性,这些特征无法直接用于深度学习模型用于癌症诊断,其固有的数据模式必须通过人工智能技术捕捉。GL-RFE根据模型损失 L梯度的幅度对特征进行排名,相对于每个输入特征xi

对于每个输入特征 xi,平均绝对梯度计算如下:

figure-introduction-1(1)

这里,N 是样本总数。Lj 是第 j 个样本的损失。xij 第 j 个样本的第 i 个特征。figure-introduction-2表示损耗相对于输入特征的敏感性。

低梯度幅度的特征对模型更新影响最小,且会递归地被消除。图 1展示了利用多层感知器(MLP)消除低梯度放射学特征并对前15个特征进行深度学习神经网络(DNN)训练的工作流程。随后评估GL-RFE方法在特征选择中的表现。

上述采用GL–RFE方法的深度学习模型是在Google Colab的Jupyter笔记本中实现的,允许在线环境中编写和执行Python代码。需要下载包含在协议步骤和材料中的不同软件包以编译代码。利用协议部分描述的方法,识别出肺癌检测中最主要的15个放射学特征,并用于在测试数据集上实现准确的癌症检测。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 利用3D 切片器PyRadiomics扩展提取放射电学特征

注意:以下步骤旨在使用3D Slicer PyRadiomics扩展计算肺部CT DICOM文件的放射学特征,并保存为逗号分隔值(csv)格式文件。

  1. 安装并打开3D切片软件(使用 https://download.slicer.org/ 最新的稳定版本。
  2. 安装 PyRadiomics 扩展和 RT 切片软件。
    1. 在菜单栏中,进入“查看>扩展管理器”。然后搜索RadiomicsSlicerRadiomics和RT Slicer。
    2. 点击 安装 以安装RT切片器和PyRadiomics库。安装后重启3D切片软件。
  3. 下载非小细胞肺癌放射学。
    1. 下载CT肺DICOM数据集及SEG、RTSC文件,涵盖422名患者的 https://www.cancerimagingarchive.net/collection/nsclc-radiomics/
  4. 加载肺部CT的DICOM数据。
    1. 去DICOM模块。点击 导入 ,选择包含 DICOM CT 切片及其 SEG 文件的文件夹,在 RTSTRUCT 模态中。
    2. 导入后,双击患者/研究/系列,将其加载到切片软件场景中。3D CT体积应在观察器面板中可见,如 图2所示。
  5. 检查几何对齐。
    1. 数据 模块中,同时展开CT体积和分段。确保分段正好位于CT上方(无错位)。
  6. 打开 无线电麦克风 模块。
    1. 从模块部分选择放射 模块(或在模块搜索栏中搜索)。在 输入图像卷中,选择所需的CT体积。
    2. 输入标签/分割中,选择分割节点(ROI)。
  7. 调整提取自定义参数。
    1. 设置 重采样像素间距 = [1,1,1](确保各向同性体素)和 Bin 宽度 = 25(CT 标准)。设置 LoG内核大小 =2.0, 3.0, 4.0, 5.0。
  8. 运行特征提取。
    1. 点击 应用。软件现在将计算三维一阶、形状和纹理特征(GLCM、GLRLM、GLSZM、GLDM 和 NGTDM)。如 图3所示,显示表格以验证计算结果。输出一个包含所有提取特征的csv文件。
    2. 对从NSCLC RADIOMICS数据集下载的所有DICOM卷重复上述操作,并将其保存为单一文件“radiomics.csv”。

2. 利用Python库开发基于放射学的癌症检测模型

注意:以下步骤总结供用户使用带有CT数据集放射学特征的Python库开发、训练和测试癌症检测模型。

  1. 将保存为csv格式的放射学数据集格式格式,使每行代表一名患者/样本,每列代表一个特征。为类别标签设置一个标签列。
  2. 在Colab环境中打开一个新的Jupyter笔记本,开始编写代码,声明以下给出的函数定义和内置的Python函数,步骤2.3。
  3. 下令在Jupyter笔记本上安装Pytorch、torchvision、scikit-learn、numpy、pandas matplotlib和imbalanced-learn。
  4. 写一个函数 files.upload(), 从用户那里接收输入的 csv 文件,并将其存储在 x 和 y 变量中。
  5. 使用函数缩放器 = StandardScaler()scaler.fit_transform()对存储的数据进行归一化。
  6. 定义一个多层感知器函数 MLP(nn.模块()),具有可配置的隐藏层。
  7. 定义一个训练函数 def train_epoch(), 用于计算MLP模型中输入的反向传播损耗。
  8. 对于若干纪元,定义一个函数def compute_input_gradients(), 计算损失相对于输入特征的平均梯度,并迭代剔除梯度最低(即重要性较低)的特征,直到剩下15个特征。
  9. 使用 train_test_split() 函数,选定15个特征,将数据按80%的20%比例分割。使用分 层KFold(n_splits=5) 对训练数据进行五重交叉验证,以确保训练数据的稳健性。
  10. 创建一个大型MLP神经网络 final_model = DNN()
  11. 使用以下函数的测试数据评估训练模型的性能:def plot_confusion_matrix()), accuracy_score()precision_score()recall_score()f1_score(), 热图()。

3. 运行Jupyter笔记本构建和测试模型

  1. 在Jupyter笔记本里运行Python代码。会收到上传radiomics csv文件的提示,如 图4所示。
  2. 上传 radiomics.csv
  3. 保存分类结果和生成的图表。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

数据集摘要
NSCLC放射组数据集包含422张肺癌I、II和III期患者的CT卷。早期癌症(I、II)的CT数据集为134个,晚期癌症(IIIa、IIIb)的数据样本为288个。数据集显示出显著的类别不平衡,晚期(第三期)病例数量高于早期(第一期和第二期)病例。为解决这一不平衡,对提取的放射电学特征进行了过采样,以增加少数群体的代表性。因此,第一阶段和第二阶段的样本数量大幅增加,导致各类别分布更加均衡,如 表1所示。这种调整有助于确保对模型性能的更可靠和公正的评估。

放射性特征提取
所提框架的工作流程如 图1所示。步骤1.4和1.5描述了在3D切片器中加载CT体积和分割遮罩,并显示它们的比对情况。上述两步的结果如 图2所示。随后,使用3D Slicer的Radiomics模块提取CT体...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该框架的稳健性和可靠性从评估指标的高值中可见一斑,包括准确性、回忆率、精度和F-1得分24。所有成绩在MLP培训期间采用5折简历后,均获得超过90%的测试成绩。

通过可视化技术进一步支持了GL-RFE框架的性能和有效性。图7中的相关热图25显示,最初提取的放射性特征表现出显著的特征间冗余,而所选特征子集的相关性显著降低,表明有效消除了冗余信息并提高了特征独立性。此外,图8中的核密度估计(KDE)图26揭示了类别特征分布,显示若干选定特征早期与晚期癌症组间重叠减少,凸显其强烈的辨别能力。此外,图9中进行了第27项评...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明他们没有相互竞争的财务利益。

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D切片软件官方网站5.x用于放射组学分析的医学图像可视化、分割和投资回报率提取
Imbalanced-learn 软件包PyPI0.11+处理阶级不平衡(例如,SMOTE)
MatplotLib 包装PyPI3.x训练曲线与特征重要性绘制
NumPy 软件包PyPI1.26.x数值运算与特征矩阵处理
熊猫套餐PyPI2.x数据预处理与结构化数据集管理
PyRadiomics 软件包PyPI3.x从CT图像中提取放射电学特征
PyTorch 包装PyPI2.xMLP和梯度计算的深度学习框架
Scikit-learn 软件包PyPI1.3.x模型评估(准确性、精度、召回率、F1评分)
SciPy 包装PyPI1.11+统计分析与验证
Seaborn 包装PyPI0.13.x特征相关分析热图
Torch.nn 模块 PyPI2.x神经网络架构(层次、激活)
Torch.optim 模块PyPI2.x优化算法(例如,Adam)

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Radiomic Feature SelectionGradient LossDeep Neural NetworkLung Cancer DetectionCancer Stage DetectionRecursive Feature EliminationQuantitative Imaging BiomarkersComputed TomographyFeature ImportanceModel Generalization

Related Articles