研究文章

一种用于肺癌检测中CT扫描分析的人工智能视觉Transformer新方法

DOI:

10.3791/69302

2025年11月28日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究中使用视觉 Transformer 模型,能够从 CT 图像中对肺癌进行分类,在 1,190 次扫描中达到了 98.18% 的准确率。与传统的卷积神经网络(CNN)模型相比,该模型在存在噪声和模糊图像的情况下仍保持了令人满意的鲁棒性,准确率维持在 80–88% 之间,适用于消费级健康诊断应用。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

由于良性疾病与恶性疾病在影像学检查中的差异较为细微,肺癌的诊断仍然具有挑战性。尽管传统的卷积神经网络(CNNs)一直是医学影像分析的主要方法,但其在成像方法变化时的应用性和鲁棒性仍然有限。机器学习的进步正在改变面向消费者的医疗健康技术中的传统诊断方式,从而改善医疗服务的可及性与个性化患者护理流程。本文描述了使用视觉变换器(Vision Transformers, ViTs)结合CT扫描进行肺癌分类的方法,并探讨其在消费者健康应用中的相关性。该视觉变换器模型在包含1,190张CT图像的完整数据集上进行训练,在分类任务中达到了98.18%的准确率,马修斯相关系数(Matthews Correlation Coefficient)为0.9676。此外,该模型还在模拟的实时场景中,利用实时噪声和模糊数据集进行了性能验证。尽管在整体数据集上保持了高诊断准确性的验证方法,ViT模型在区分噪声图像与模糊图像方面的表现仍优于传统验证方法,准确率达到80%至88%,即使在上述不利条件下亦表现出良好性能。尽管初步结果表明ViT在处理图像变异时具有良好的鲁棒性,但由于评估研究是在相对较小的数据集和模拟环境下完成的,因此在结果解读时仍需保持谨慎。未来的研究若能采用更大规模、更能代表真实临床条件且经过临床验证的数据集,将有助于进一步明确ViT在肿瘤学诊断临床识别中的优势,并提升肺癌的早期检出能力。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

肺癌在全球范围内具有重大负担,每年影响数百万人的生命。由于肺癌具有侵袭性强且常在晚期才出现症状的特点,其相关死亡率较高。早期检测至关重要,因为及早干预可显著提高治疗效果和生存率1。目前,初步筛查和诊断的常规方法仍依赖于计算机断层扫描(CT),以实现对肺部结构更详细的可视化。然而,CT图像的评估过程复杂,完全依赖放射科医生的主观判断。肿瘤在大小、形状和密度等方面的变异性也降低了人为观察的可靠性。环境因素可能进一步影响基于人工分析的决策准确性和可重复性。
鉴于上述局限性,近年来的研究文献大力推动将人工智能(AI)应用于医学影像领域,尤其聚焦于深度学习(DL)模型。深度学习,特别是卷积神经网络(CNNs),通过改变图像分析方式,颠覆了医学影像中的观察模式2。CNNs显著提升了肿瘤学中的诊断流程,展现出识别影像数据中细微而复杂特征的能力,这些特征通常难以被人眼察觉。尽管取得了这些进展,CNNs在小样本数据集上仍存在过拟合问题,在成像条件变化时鲁棒性降低,并且依赖局部感受野,可能忽略全局依赖关系。虽然混合型CNN-Transformer方法试图结合卷积先验与注意力机制,但仍继承了卷积架构的固有偏差。图1展示了数据集中属于不同类别的若干样本实例。

用于诊断分析的良性、恶性及正常肺部CT扫描示意图对比。
图1:不同类别的可视化图示,展示正常、良性及恶性肺部的代表性CT切片,突出其相似性与差异性。 请点击此处查看该图的放大版本。

展示了正常、良性及恶性病例的代表性CT图像。尽管对鉴别区域进行明确标注有助于视觉判读,但人工标注需要专业放射科医师参与,超出了本研究的范围。

视觉Transformer(Vision Transformers,ViTs)最初被提出用于自然图像分类3,现已成为一种颇具前景的替代方案。与卷积神经网络(CNN)或CNN-Transformer混合模型不同,ViTs采用完全基于注意力机制的框架,能够捕捉整幅图像中的全局上下文信息。这一特性在CT成像中尤为重要,因为肿瘤特征往往具有弥散性和不规则性,可能遍布整个区域,而不仅局限于局部感受野。尽管CNN-Transformer混合网络保留了卷积的归纳偏置以增强稳定性,视觉Transformer(ViTs)则实现了完全基于注意力的架构,使ViT模型能够捕捉整个CT图像中的长距离依赖关系——这在评估弥散性或不规则的肺部肿瘤特征时具有显著优势。

基于变换器的模型在医学影像领域的应用是近期发展,已在软性放射学和组织病理学中有一些实例4,5,6,这些研究表明,相较于传统的卷积神经网络(CNN)系统,变换器模型在应对噪声、模糊以及不同扫描仪之间的变异方面表现出显著优势,从而为在临床环境中采用视觉变换器(ViT)提供了合理依据,而无需过分强调其新颖性。鉴于肺癌影像分析相较于消费级健康应用具有更高的严谨性要求,本研究旨在基于循证医学中稳健的证据来论证其实际应用价值,同时将自身置于近年来关于变换器及其应用的尚不充分的文献背景之中。既往研究表明,由于图像采集过程中的变异性,卷积神经网络诊断方法的准确率会显著下降7,而相应的视觉变换器在相同扰动条件下表现更优8,这进一步支持了在评估方法中采用视觉变换器的可行性,并为提升诊断工作流程的可重复性提供了新选择。此外,本研究通过采用数据增强、迁移学习以及高效的ViT变体等方法9,10,明确应对了实际应用中可能面临的若干问题,例如所需数据集规模、计算负担以及在不同临床环境中的泛化能力。

本研究在此基础上进一步推进,通过采用视觉Transformer(ViTs)利用CT图像数据进行肺癌分期,并评估模型在存在真实世界成像问题时的鲁棒性与泛化能力。CT数据通常可能包含一定程度常见的伪影、噪声和模糊,这些因素可能掩盖对临床医生有意义的特征。通过考察模型对这些成像变化的抗干扰能力,本研究旨在提供一种额外的分期框架,使其在制定临床护理和治疗决策时能够被实际依赖。

本研究的贡献包括:i) 在 IQ-OTH/NCCD 数据集中,通过使用并评估视觉 Transformer 模型的性能,实现从 CT 图像中特异性检测肺癌;ii) 评估该模型在 CT 数据常见的真实世界临床影像场景(如噪声和模糊)下的表现;iii) 比较 ViT 在准确率、敏感性和特异性方面作为传统 CNN 模型替代方案的性能。

本文其余部分的结构如下:第二节综述相关文献,回顾利用深度学习技术进行肺癌检测的前期研究工作,并阐述从卷积神经网络(CNN)向ViT等更先进架构的发展历程。第三节介绍本研究采用的方法,包括数据预处理、模型架构信息以及训练过程的详细说明。第四节展示研究结果,重点探讨ViT作为临床方法所具备的规范性特征,及其在提升肺癌筛查准确性与可靠性方面的潜力。第五节总结研究成果与实践贡献,并讨论在医疗环境中深度学习技术的未来发展方向。

相关工作:

在过去十年中,深度学习(DL)彻底改变了医学影像领域,尤其是在肺癌诊断方面。最初,该领域依赖于支持向量机(SVM)和决策树等传统机器学习技术,这些技术受限于对精心构建且准确获取的特征的需求。这些特征难以有效处理医学图像的复杂性,且常常引入主观性。

卷积神经网络(Convolutional Neural Networks, CNNs)的发明带来了重大变革,使得从数据中自动提取分层特征成为可能11。CNNs 已被广泛应用于基于 CT 扫描的癌症分期、结节检测以及良恶性分类。尽管 CNNs 取得了成功,但其仍存在局限性,包括图像采集条件的差异,以及对大规模标注数据集的需求——由于隐私问题和医学标注工作耗时耗力,这类数据集难以获取。表1121314151617181920 总结了近年来在肺癌诊断领域开展的研究工作。

Crasta, Lavina Jean, Rupal Neema, and Alwyn Roshan Pais (2024) [20]提出一种基于CT图像进行肺癌检测与分类的新型深度学习框架[20]。该论文引入了一种用于分割的3D-VNet和一种用于分类的3D-ResNet,展示了在准确性和鲁棒性方面相较于先前方法的提升。
Crasta, Lavina Jean, Rupal Neema, and Alwyn Roshan Pais (2024) [20]提出一种基于CT图像进行肺癌检测与分类的新型深度学习框架[20]。该论文引入了一种用于分割的3D-VNet和一种用于分类的3D-ResNet,展示了在准确性和鲁棒性方面相较于先前方法的提升。

表1:近期研究总结,概述了所使用的技术及报告的性能,以供参考。

通过使用能够同时考虑图像整体上下文的自注意力机制,视觉Transformer(ViTs)正逐渐成为在图像相关任务中可与卷积神经网络(CNNs)相媲美的替代方案。ViTs在医学影像领域尤其具有前景,因为其全局处理能力使得某些区域的重要性可能依赖于图像中较远部分的信息。然而,尽管ViTs具备处理复杂任务的能力,例如识别扫描图像中多个疾病指标之间的关联,但其在医学影像领域的研究仍不充分。

在以消费者为中心的医疗设备领域,视觉变换器(ViTs)尚未得到充分探索。本研究旨在弥合高精度与低延迟之间的差距,使以消费者为中心的医疗设备能够在实时环境中表现良好并提供准确的预测。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该数据集共包含来自110个病例的1,190张CT扫描切片,分为三类:正常(55例)、良性(15例)和恶性(40例)。每个病例包含多张CT切片(每例约80至200张切片),提供胸部区域的多种轴向视图。CT图像采用SOMATOM扫描仪以标准成像参数在DICOM格式下获取:管电压 = 120 kV,层厚 = 1 mm,窗宽 = 350–1,200 Hounsfield单位(HU),窗中心值 = 50–600 HU,扫描时患者处于深吸气后屏气状态。

所有图像在分析前均已完全去标识化,以去除任何个人身份信息(PII)。该数据集已获得参与的各医疗中心机构审查委员会的伦理批准,监管审查委员会已免除书面知情同意要求。病例涵盖来自不同背景的个体,包括政府雇员、农民以及来自伊拉克多个省份(包括巴格达、瓦西特、迪亚拉、萨拉赫丁和巴比伦)的居民,在性别、年龄、教育水平和居住状况方面具有多样性。

由于该数据集是公开且去标识化的,因此本研究使用该数据集无需额外的伦理审批。该数据集遵守其原始贡献者及托管平台规定的条款和条件。

本研究的方法采用多阶段流程,旨在借助 IQ-OTH/NCCD 肺癌数据集21构建预测模型。该方法为以消费者为中心的医疗设备奠定了坚实基础,适用于对延迟要求较低且需要更高准确性的场景。图2展示了所提出模型的工作机制。

CT图像处理工作流程;包含以下步骤的示意图:调整大小、归一化、缩放、肿瘤分类。
图2:所提出模型的工作流程图,展示预处理、数据增强、Vision Transformer分类及评估步骤。 请点击此处查看该图的放大版本。

1. 数据集描述

IQ-OTH/NCCD 肺癌数据集于2019年秋季在伊拉克肿瘤教学医院/国家癌症疾病中心收集。所使用的数据集训练部分包含1,097张图像,其详细信息见表2,该表列出了不同类别样本实例的数量。

类别图像数量
正常416
良性120
恶性561

表2:数据集中正常、良性及恶性CT图像的示例。

选择 IQ-OTH/NCCD 肺癌数据集是因为其全面涵盖了正常、良性及恶性肺部 CT 扫描图像。尽管其他数据集(如 LIDC-IDRI 和 NSCLC-Radiomics)也可获取,但它们要么主要关注结节检测,要么缺乏足够的良性病例样本。IQ-OTH/NCCD 数据集特别适用于本研究,因为它能够使视觉 Transformer 学习到三类样本之间的判别性特征,从而实现对肺部 CT 图像中细微模式的稳健分类。

2. 数据预处理

预处理是通过数据的一致性处理和适当调整来提升模型性能的重要步骤,这些数据将被输入神经网络进行处理。为了确保神经网络输入尺寸的一致性,我们将所有图像缩放至相同的256 × 256像素维度,并将数据归一化到0到1之间的像素值,以期改善模型的训练效果和收敛速度。表3列出了数据增强技术的具体参数值。

技术数值
归一化-
尺寸调整image_size x image_size
随机旋转factor=0.02
随机缩放height_factor=0.2, width_factor=0.2

表3:应用的增强技术及其参数范围。

为了增强模型对过拟合的鲁棒性并提高其泛化能力,采用了随机旋转和随机缩放等数据增强技术,以模拟不同患者肺部癌症表现可能出现的各种角度和大小。本研究中应用了旋转角度从 0.02 弧度范围内均匀采样的随机旋转,以及高度和宽度缩放因子可变的随机缩放变换。数据增强后的图像如图 3所示。

CT 扫描图像处理:包括旋转、翻转和亮度调整等变换与调节。
图 3:增强后的 CT 图像,展示旋转、缩放和归一化,以提升模型的泛化能力。 请点击此处查看该图的放大版本。

需要采用这些预处理技术,并且对所有类别都进行了数据增强,以确保模型的鲁棒性。

3. 模型架构

将新型视觉Transformer(ViT)框架进行调整,以有效处理复杂的图像数据,该模型架构旨在将CT扫描图像分为三类:正常、良性与恶性。该方法处理的输入图像尺寸为256 × 256像素。为确保数据一致性并促进模型更高效的学习,每幅图像均经过多种预处理操作,包括尺寸调整和归一化。为增强模型对图像尺度和方向变化的鲁棒性,设计中首先引入数据增强层,采用的方法包括归一化、尺寸调整、随机旋转(最大0.02弧度)以及随机缩放(最高达20%)。经过增强后,模型从每幅图像中提取16 × 16像素的图像块,因此每幅图像共产生256个图像块。

算法1定义了所提出模型的工作流程,以及该模型的构建方式和针对模型进行的微调过程。

算法 1:使用视觉变换器进行肺癌分类
输入:来自 IQ-OTH/NCCD 数据集的 CT 图像集合 I
输出:分类结果 C,类别包括:正常、良性、恶性
预处理:
   对 I 中的每幅图像 i 执行
i <- Resize(i, 256 x 256)         // 归一化并调整图像大小
i <- Normalize(i)
i <- DataAugmentation(i)        // 应用随机旋转和缩放
   结束循环

模型设置:
  初始化视觉变换器(Vision Transformer, ViT)模型
  设置图像块数量 P = 16 x 16
  设置多头注意力机制中的头数 H = 6

训练:
  从 epoch = 1 到 MaxEpochs 执行
    对 I 中的每个批次 b 执行
      图像块 <- ExtractPatches(b, P)
      编码图像块 <- PatchEncoder(图像块)
      注意力权重 <- MultiHeadAttention(编码图像块, H)
      分类 logits <- TransformerEncoder(注意力权重)
      损失值 <- ComputeLoss(分类 logits, 真实标签)
      根据损失值更新模型权重
    结束循环
    如果满足早停条件(验证损失连续 5 个 epoch 无改善)则
      跳出循环
    结束判断
  结束循环

验证:
  将数据划分为训练集(80%)和验证集(20%)
  在验证集上计算验证指标

评估:
  C <- Classify(I)
  计算性能指标(C)
  返回 C

为了保持各图像块之间的空间关系,这些图像块被展平(公式1)为768维向量(因为每个图像块的尺寸为16 × 16 × 3 = 768),然后通过一个图像块编码层,该层通过整合位置嵌入将每个向量投影到64维空间中。该架构的核心由八个Transformer层组成,每一层均采用具有六个注意力头的多头注意力机制,使模型能够同时关注图像的不同区域,并捕捉广泛多样的特征。该过程由公式2、公式3和公式4表示。

层归一化公式,LayerNorm(x) 的方程,显示 (x 减去 μ) 除以根号下 (σ² 加 ε)。

其中 µ 是输入 x 的均值,σ2 是输入 x 的方差,ϵ 是一个用于防止除以零的小常数。

神经网络注意力机制公式,以文本形式展示 softmax 和矩阵运算。

其中 Q 是查询矩阵,K 是键矩阵,V 是值矩阵,dk 是键向量的维度。

多头注意力公式,MultiHead(Q,K,V)=Concat(Head1,...,Headh)Wo,神经网络示意图。
多头注意力机制的公式,展示人工智能模型中的输入和参数矩阵。

其中 WiQ、WiK 和 WiV 分别是查询、键和值的可学习权重矩阵,WO 是输出权重矩阵。

所提出模型的框图如图4所示。

视觉Transformer模型的流程图,包含图像块编码、多头注意力机制和模型训练。
图4:带有多层感知机头部(MLP head)的视觉Transformer模型框图,详细展示主要处理层及整体架构。请点击此处查看该图的放大版本。

每个变换器层包含一个多层感知机(MLP),其隐藏单元首先从64扩展到128,然后再压缩回64,从而有效扩展和压缩信息流,以捕捉复杂的依赖关系。

在注意力机制和MLP中以0.1的比率策略性地应用Dropout,以防止过拟合。Transformer编码器的输出通过一个包含两个全连接层(分别具有2,048和1,024个单元)的MLP头部进行处理,激活函数采用高斯误差线性单元(GELU),该激活函数在深度学习应用中已被证明具有良好的性能。此过程通过公式5实现。

使用GELU进行神经网络激活的MLP方程;数学公式。

其中 W1 和 W2 为权重矩阵,b1 和 b2 为偏置项,GELU 为所采用的激活函数。

在Transformer层中使用了0.1的丢弃率(dropout),以防止过拟合,同时保留重要的特征信息。采用GELU激活函数,因其具有平滑的非线性特性,有助于基于Transformer的模型中的梯度流动和收敛。丢弃率的正则化通过公式6实现。丢弃率方程,公式;深度学习,神经网络训练的伯努利分布方法。

其中 p 为丢弃率(例如 0.1 或 0.5),丢弃层在训练过程中随机将一部分比例为 p 的输入单元设置为零。

这些层中 0.5 的丢弃率进一步有助于缓解过拟合。模型的最后一层为 logits 层(公式 7),输出对应于正常、良性与恶性三个类别的分类 logits,采用适用于此类多分类任务的稀疏分类交叉熵损失函数(公式 8)。

Softmax 激活方程;神经网络输出公式;数学表达式。

softmax分类的损失函数方程;机器学习图示中的 Σlog(Softmax(z_i))y_i 公式。

其中 zi 是类别 i 的 logits 向量,SoftMax(zi) 表示预测概率,yi 是真实类别标签。

该模型使用 AdamW 优化器(公式 9、10、11、12 和 13)进行编译,AdamW 是 Adam 优化器的扩展版本,能更有效地处理权重衰减,学习率设置为 0.001,权重衰减设置为 0.0001,从而优化学习速度和模型稳定性。

梯度下降更新方程;公式;优化方法;用于教学。

梯度下降优化方程,公式 vt=β2vt-1+(1-β2)(∇L(θ))^2,数学概念。
指数移动平均公式方程;随机优化中的关键概念。
Adam优化器公式中偏差校正的二阶矩估计方程。
梯度下降优化公式,数学方程,学习率,迭代更新方法。

其中,mt 和 vt 分别为梯度的一阶矩和二阶矩,静力平衡符号,ΣFx=0,用于力学平衡分析的方程。速度符号 \( \hat{v}_t \),方程,用于动态运动分析。 为经偏差校正后的矩,η 为学习率,ϵ 为防止除以零的小常数。

该模型在训练时采用32的批量大小,以利用GPU加速实现更快的计算,并设置训练100个轮次。

但训练过程中采用了基于验证损失的早停机制,当模型性能停止提升时即终止训练,以节省计算资源并避免连续5个周期的过拟合。模型性能通过稀疏分类准确率和前2名准确率等指标进行监控,这些指标反映了模型在最可能预测类别中的分类能力。模型训练的回调函数包括检查点机制,该机制会根据验证准确率保存性能最优的模型,从而确保训练结束后保留表现最佳的模型版本。这一稳健且设计周密的架构充分利用了Transformer处理医学影像数据的能力,采用高度先进的方法,将现代人工智能技术应用于医疗诊断的重要领域。

4. 训练与验证

该模型在 Kaggle 环境中使用 NVIDIA P100 GPU 进行训练,训练过程中采用批量大小为 32 的小批量梯度下降法。优化器选用 AdamW,学习率为 0.001,权重衰减为 0.0001;该设置在快速收敛和一定正则化之间取得了良好平衡。模型共训练了 100 个轮次,但采用了早停策略,以验证损失为依据,耐心值设为 5 个轮次。简而言之,若连续 5 个轮次训练未能降低验证损失,则训练将提前终止,以防止过拟合并提高计算效率。在大多数情况下,模型会恢复至验证损失最小的轮次对应的权重,表明其已达到最优性能,无需完成全部 100 个轮次。模型训练总耗时约 32 分钟。

训练过程中采用的评估指标包括稀疏分类准确率和前2准确率,这些指标在训练集和验证集上均被监测。这些指标能够反映模型预测正确类别的情况,以及正确类别是否位于前两个预测结果之中,这在医学应用中尤为重要,因为高置信度的错误分类可能带来严重后果。图5展示了损失和准确率的学习曲线。

训练-验证图表,显示准确率、损失随训练轮次的变化趋势,深度学习模型评估。

图5:50个训练周期中的训练与验证准确率及损失曲线,显示学习过程稳定且过拟合程度极低。 请点击此处查看该图的高清版本。

本研究未进行交叉验证。该设置有助于高效地实验模型架构,包括调整 Transformer 层以及 MLP 头的尺寸,同时确保模型在未见过的验证数据上具有良好的泛化能力。

5. 统计分析

基于 IQ-OTH/NCCD 肺癌数据集对 Vision Transformer 模型的性能进行了统计分析。分别使用公式 14、15、16 和 17 计算精确率、召回率、F1 分数和准确率。这四项指标被视为分类任务中的常规评估指标,因其能够反映模型在每个类别上的分类性能以及按类别划分的分类表现。

精确率公式:真阳性除以真阳性与假阳性之和,数学表达式。
召回率公式:真阳性除以真阳性与假阴性之和,数学方程。
F1分数公式:2*(精确率*召回率)/(精确率+召回率);用于评估模型准确性的方程。
准确率公式;方程显示准确率 = (真阳性 + 真阴性) / 总体数量。

召回率是衡量模型识别某一类别中所有相关实例能力的指标,而精确率则是指所有阳性识别结果中实际正确的比例。当召回率和精确率都重要时,F1分数用于平衡二者。
本任务所采用的性能评估指标为马修斯相关系数(MCC,公式18)和科恩κ系数(公式19)。

马修斯相关系数公式,方程,TP,TN,FP,FN,数学表达式。
卡帕统计量公式,κ = (Po - Pe)/(1 - Pe),用于测量评分者间信度。

其中 P0 为观察到的一致性,而 Pe 为期望的一致性。

马修斯相关系数(MCC)是一种全面衡量分类性能的指标,同时考虑了真阳性、真阴性、假阳性和假阴性。其取值范围为-1到1之间,其中1表示完美预测,0表示随机预测,-1表示预测标签与真实标签完全不一致。当应用于不平衡数据集时,MCC在不同模型性能之间进行比较具有重要价值,因为它提供了一种不受类别大小差异影响的平衡性度量。

作为附加统计分析的一部分,计算了优先考虑召回率的 F2 分数,如公式 20 所示。

F2 分数公式方程;模型评估的关键指标;精确率、召回率计算。

模型的性能还通过均方误差(MSE)、均方根误差(RMSE)和平均绝对误差(MAE)进行了量化——这些指标通常用于回归任务,但在此被调整用于分类任务,以衡量平均误差的大小,而不考虑误差的方向。

为了确定在面向消费者的医疗保健设备中集成视觉变换器(ViTs)是否具有可行性,我们开展了全面的性能评估,重点仅关注模型的时间效率。我们编写了函数以报告对单张图像或批量图像进行预测所需的时间,因为这对于实时应用尤为重要。对于每张图像,在开始预测之前,数据首先会被预处理,以符合模型所要求的输入图像形状。我们记录了预测开始和预测完成的时间,以获得时间和延迟结果。时间与平均延迟分别通过公式21和公式22计算得出。

时间计算公式,T = t_end - t_start,用于持续时间分析的数学方程。
平均潜伏期公式 Σ(N) 方程;数据分析结果的计算方法。

其中:

  • N 是图像(样本)的数量。
  • tend 是预测第 i 个图像后记录的时间。
  • tstart 是预测第 i 个图像前记录的时间。

为进一步评估我们提出的视觉Transformer模型的鲁棒性,通过系统地向图像中引入额外的噪声和模糊进行了更多实验。在[0,1]范围内对像素值进行裁剪的同时,为每个像素添加了噪声因子为0.4的高斯噪声。模糊效应通过核大小为45×45的高斯模糊进行减弱。这些实验旨在模拟感知图像质量下降的情况,从而对模型进行全面评估。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vision Transformer 模型在 IQ-OTH/NCCD 肺癌数据集的多种评估指标上表现出色,能够有效区分正常的、良性的和恶性的 CT 图像。在整个包含 220 张图像的测试数据集上,模型的整体性能达到了 98.18% 的高准确率。这一极高的准确率表明,该模型具有很强的泛化能力,因此可用于临床环境。

在良性病例中,该模型的精确度达到100%,召回率为89.47%,F1分数为94.44%。

在恶性病例方面,该模型的精确率为100%,召回率为98.37%,F1分数为99.18%。该模型对正常病例的预测精确率为95.12%,召回率为100%,F1分数为97.50%。结果表明,该模型在检测恶性病例方面的准确性尤为出色,这在肿瘤学中具有重要意义;从临床相关性来看,对恶性病例的判断必须高度准确,因为未能检出恶性诊断将带来严重后果。马...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该模型在IQ-OTH/NCCD肺癌数据集上对视觉Transformer模型的评估与应用取得了显著成果,具有很高的准确性。使用该模型对CT扫描图像分类为正常、良性与恶性的一般准确率达到98.18%。

该模型在其他关键评分指标中也表现出优异的准确性,例如在恶性病例检测中达到100%的精确度,这在早期诊断与临床管理中具有重要意义。

深入分析表明,该模型不仅在精确率方面表现良好,而且具有很高的召回率和F1分数,从而确保了极低的假阴性率——这在医学诊断中是一个非常重要的因素,因为漏诊的代价可能是致命的。该研究取得上述结果得益于实验方案中的多个组成部分。例如,预处理技术(如调整尺寸、归一化以及数据增强(随机旋转和缩放))有助于提高数据一致性,并降低过拟合风险。
采用ViT进行迁移学习,即使在中等规模数据集上也能保证模型收敛的稳定性;而使用AdamW优化器并结合早停机制,则有效避免了过度训练。总体而言,这些方法学上的决策,加上对验证集上各项性能指标的密切监控,共同积极影响了本研究模型的成功,并为临床AI流程中的最佳可复现实践提供...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作由沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学研究人员支持项目(PNURSP2025R432)资助。  作者感谢纳吉兰大学研究生院与科学研究处于成长资助计划下为本研究提供的经费支持(资助编号:NU/GP/SERC/13/575-6)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
A100 GPU (CUDA)NVIDIACUDA 版本 11.6用于模型训练和评估的 GPU 加速。
AMD EPYC-7502P CPUAMDN/A用于高性能计算的处理器。
千兆以太网IntelN/A用于信息物理系统中点对点安全通信的网络连接。
MatplotlibPython 软件基金会版本 3.5用于结果绘图的可视化库。
Paillier 密码系统开源(通过 TenSEAL 实现)N/A支持对梯度进行加法同态加密。
PySyftOpenMined版本 0.6.0差分隐私与联邦学习库。
Python(Anaconda 发行版)Anaconda 公司版本 3.9包含预安装包和环境管理工具,用于脚本编写和框架开发。
PyTorchMeta AI版本 1.12用于模型训练的深度学习框架。
内存Corsair256 吉字节 (GB) 为高强度训练提供高内存支持。
Scikit-learnPython 软件基金会版本 1.1用于性能评估的机器学习工具。
SeabornPython 软件基金会版本 0.11统计数据分析可视化库。
固态硬盘存储Seagate1 太字节 (TB)用于快速数据存储与检索。
TenSEALOpenMined版本 0.3用于安全聚合的同态加密库。
TensorFlowGoogle版本 2.9用于扩散模型的深度学习框架。
Ubuntu 操作系统Canonical版本 20.04 LTS所有实验所使用的操作系统。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章