本文介绍了基于EfficientNetB7模型的深度学习系统,用于精确分类肺癌和结肠癌的组织病理图像。通过预处理、数据增强和迁移学习,模型准确率提升了96%。该方法在帮助临床癌症诊断方面具有很高的潜力。
Research Article
本文介绍了基于EfficientNetB7模型的深度学习系统,用于精确分类肺癌和结肠癌的组织病理图像。通过预处理、数据增强和迁移学习,模型准确率提升了96%。该方法在帮助临床癌症诊断方面具有很高的潜力。
肺癌的早期诊断在确保患者治疗和生存率提升方面起着关键作用。这仍然是临床研究的主要关注点。人工智能(AI)通过显著提升诊断准确性和效率,彻底改变了病理学。本研究以预训练的EfficientNetB7模型为形式,构建了一个稳健的深度学习模型,以极高的准确率96%对结肠和肺组织的组织病理图像进行分类。模型性能通过先进的预处理方法、微调和领域特定数据增强技术进行了优化。这些策略有助于减少类别不平衡和细微的组织学差异等问题。为解决过拟合问题,结合了多种数据增强技术,并引入了早期停止准则。这种方法使培训变得高效且具成本效益。对该模型的稳健验证显示了其在临床应用中的高度实用性,使病理学家能够及时且准确地诊断出问题。将先进的深度学习模型整合进医学影像工作流程,有望实现癌症的早期和准确诊断,最终改善患者预后。
肺癌和结肠癌是全球死亡率最高的癌症之一。根据全球卫生统计,肺癌是每年死亡人数超过180万的致命癌症,其次是结肠癌,是第三大恶性肿瘤,也是第二大癌症死亡原因。准确和早期诊断对于有效治疗和提高这些癌症的生存率至关重要。组织病理学检查,即病理学家对组织样本的显微镜评估,仍然是癌症检测最常用的方法之一。图1展示了多种肺和结肠组织的组织病理样本图像2。

图1:数据集中的样本图像。 本图展示了LC25000数据集中各类的代表性样本,突出了良性和恶性肺及结肠组织图像之间的视觉多样性。 请点击此处查看该图的放大版本。
数字病理通过数字化组织学切片实现了行业的变革,这些切片现已通过复杂的深度学习算法进行诊断。3.结合深度学习模型,算法能够很好地识别大数据中的细微模式,显著提升诊断的准确性和效率。 表1 展示了每个组织类别的描述。
| 级别名称 | 描述 | |
| 肺良性组织 | 肺部的非癌性组织,不参与癌变生长。 | |
| 肺腺癌 | 这是一种由腺体上皮组织引起的肺癌,以其恶性生长模式而闻名。 | |
| 肺鳞状细胞癌 | 这是一种肺癌,其特征是气道内衬鳞状细胞形成的某种细胞形态。 | |
| 结肠腺癌 | 大多数结肠癌的发生是由一种常见的结肠癌引起,这种癌症起始于结肠黏膜的腺体细胞。 | |
| 结肠良性组织 | 结肠内健康组织,没有任何癌症或癌前病变的迹象。 | |
表1:数据集中五个组织和癌症类别的概述,包括类别名称、特征及每类图像数量。
EfficientNetB7是一种尖端卷积神经网络架构,因其深度、宽度和分辨率的均衡缩放性,被认为在图像分类任务中特别有效。与广泛使用的架构如ResNet和DenseNet相比,EfficientNetB7通过复合尺度实现了分类准确性和计算效率之间的优越平衡,该比例尺度对网络深度、宽度和分辨率进行比例调整。虽然ResNet和DenseNet在医学图像分类任务中表现出稳健的性能,但它们通常需要更高的参数数和更强的计算资源才能达到相当的准确性,因此EfficientNetB7更适合在资源有限的临床环境中进行大规模组织病理学分析4。先进计算模型的应用,包括EfficientNetB7等人工智能工具,为克服传统诊断挑战提供了新可能,提供支持病理学家的工具,并有望改善诊断结果。将人工智能融入病理实践有望普及优质诊断服务的获取,使医疗专业知识有限的地区能够开展高级诊断。
近期基准研究和医学图像分析的综合综述一贯强调深度学习架构在组织病理学中日益增长的影响。大规模分析表明,卷积神经网络及其现代变体在识别多种组织类型中微妙的形态特征方面具有最先进的性能,常常超越传统诊断方法。比较评估显示,先进架构,包括EfficientNet及其他可扩展模型,不仅实现了更优的分类精度,还展示了更高的计算效率6。此外,数字病理的系统综述强调了其在常规诊断中的变革性,实现了可重复性、减少观察者间的变异性,并允许与自动化流程集成。这些综合发现证实了采用先进深度学习模型进行组织病理癌症分类的相关性,并有力地证明,应用可扩展且高效的架构能够解决类别失衡、组织学变异性以及专家病理学家有限等临床挑战。
本研究目标包括:(i)基于EfficientNetB7架构,创建和评估用于分类肺癌和结肠癌组织病理图像的深度学习模型;(ii)展示模型实现高度分类准确性的能力,可能超越传统诊断方法;(iii) 探索数据增强、预处理技术和迁移学习对特定领域环境中模型性能的影响。
本研究不仅展示了EfficientNetB7在组织病理图像上可实现的高诊断准确性,还通过有针对性数据增强、稳健的验证策略和早期停止技术,严谨解决了类别失衡和过拟合等关键挑战。该方法论专门设计以反映真实临床环境,利用大规模增强数据集,并在临床相关指标上对模型表现进行基准测试。该工作流程的自动化和高效性确保系统适合整合进数字病理实验室,有望提升病理学家的生产力,改善诊断一致性,并使在高资源和资源有限的临床环境中更广泛地获得专家级分析。
尽管医学影像深度学习取得了显著进展,但在分类肺癌和结肠癌组织病理图像时仍面临诸多挑战。当前模型往往在处理类别不平衡问题上失效,某些类型的癌症在数据集中可能代表性不足,导致预测偏颇。此外,腺癌和肺部鳞状细胞癌等癌症亚型之间的细微组织学差异,对正确分类构成了巨大挑战。此前大多数研究仅针对单一癌症分类或使用有限的小数据集,因此在临床环境中难以广泛应用和实用性。传统方法的计算效率较低,因此不适合大数据或实时临床应用8。
本研究通过利用EfficientNetB7架构弥合这些差距,该架构是一种经过验证的可扩展性和有效性的先进深度学习模型。随机缩放、翻转、旋转和移动被用作高级数据增强方法,以最大化模型在不同组织病理模式中的稳健性和泛化能力。迁移学习还用于微调预训练的EfficientNetB7模型,使其能够以特定方式学习和适应肺癌和结肠癌数据集,并最大限度地减少训练时间和计算成本9。采用全局平均池化和早期停止还能提升模型在良好训练和避免过拟合方面的性能。
近年来,深度学习在医学影像中的应用,尤其是癌症诊断方面的应用取得了巨大进展。肺癌和结肠癌的传统诊断主要依赖于组织病理学检查,病理学家在显微镜下检查组织样本10。虽然有效,但劳动密集型,存在观察者间差异性,且通常受限于专业病理学家有限,尤其是在资源有限的环境中。这些局限性促使了基于人工智能和深度学习的计算机化诊断系统的发展。
深度学习模型,尤其是卷积神经网络(CNN),在组织病理标本的图像分析方面取得了显著成功11.它们特别擅长识别复杂的模式和细微的组织形态变化,这些任务适合癌症分类。尽管取得了进展,目前方法仍存在诸如类别不平衡、多数据集场景泛化有限以及计算成本较高等不足之处。例如,大多数研究关注单一癌症分类,这限制了其应用范围为多种癌症诊断场景。此外,预处理和数据增强技术不佳使其容易出现过拟合,尤其是在数据集较小或不平衡的场景下。
迁移学习的最新发展部分克服了这些局限,利用了像ImageNet这样的大规模数据集上的预训练模型。EfficientNet、ResNet 和 DenseNet 是医学图像分析中备受关注的模型,因为它们能够从有限的训练数据中学习高层次特征12。EfficientNet 因其可扩展性和效率而被广泛采用,因为它在多个图像分类基准测试中实现了最先进的精度。EfficientNet在分类肺结肠联合癌症中的应用尚未被广泛研究,尤其是在处理类别失衡和细微组织学变异方面13。
数据增强一直是模型鲁棒性和泛化性提升的关键策略。通过引入旋转、移动、缩放和翻转等变化,数据增强技术模拟了实际组织病理图像中存在的变异性,使模型能够学习不变特征。早期停止和正则化技术通过避免过拟合和最大化训练效率,进一步提升模型性能。尽管取得了这些进步,仍需采用涵盖先进预处理、增强和迁移学习的端到端框架,以实现多癌症分类的高精度和计算效率。表215、16、17、18、19、20、21、22、23、24展示了现有文献中的研究文献。
| 学习 | 目标 | ||
| Talukder, M. A. 等,15 (2022) | 展示一个结合深度学习和机器学习的混合集合特征提取模型,用于识别结肠癌和肺癌。 | ||
| Attallah, O. 等人 16 (2022) | 提供一个低权重深度学习框架,结合多种模型和转化技术,帮助早期发现肺癌和结肠癌。 | ||
| Hage Chehade, A. 等,第17 页(2022) | 创建一个基于机器学习的计算机辅助诊断系统,能够识别不同类型的肺和结肠组织。 | ||
| Wahid, R. R. 等 18 (2023) | 使用计算机辅助诊断系统配合CNN检测肺癌和结肠癌。 | ||
| Kumar, N. 等,第19 页(2022) | 比较和对比用于分类结肠癌和肺癌的特征提取技术。 | ||
| Mehmood, S. 等,20 (2022) | 创建一个带有修改图层的预训练神经网络,用于肺癌和结肠癌的诊断模型,既准确又高效。 | ||
| Zhou, L. 等,第21 页(2024) | 利用生物信息学方法预测Wogonin(WOG)在肺、膀胱和结肠癌治疗中的新靶点。 | ||
| Reddy, K. R. 等 22 (2022) | 提供基于机器学习的混合集合特征提取方法,用于结肠癌(LCC)检测。 | ||
| 尚迪利亚,S.,纳亚克,S. R.23 (2022) | CNN和视觉变换器设计有助于分类肺癌和结肠癌的组织病理图像。 | ||
| Hasan, M. 等 24 (2023) | 利用多种CNN模型,对肺癌和结肠癌的图像进行分类,以提升诊断程序。 | ||
表2:比较相关以往关于组织病理图像分类的研究,详细说明所用数据集、模型类型及报告结果。
本文基于这些贡献,结合了利用EfficientNetB7架构的深度学习模型,辅以最先进的数据增强和迁移学习技术。当前方案通过提升分类准确性、类别平衡性和更低的计算成本,优于以往方案的缺陷,因此是临床环境中使用的最佳方案。
Access restricted. Please log in or start a trial to view this content.
本研究未涉及对人体参与者或动物的直接实验。所有工作均使用公开可得的匿名LC25000组织病理图像数据集,该数据集不含可识别的患者信息或直接处理人体组织。无需机构审查委员会(IRB)或机构动物护理与使用委员会(IACUC)批准。所有程序均符合伦理标准,并遵守数据集的学术研究使用条款。 图2 展示了工作流程图的步骤。

图2:所提方法的工作流程。 工作流程包括数据预处理、增强、模型训练和评估。 请点击此处查看该图的放大版本。
数据集描述
本研究采用了LC25000数据集。该报告包含25,000张组织病理图像,均统一格式为JPEG文件,分辨率为768×768像素。该数据集来源于最初的1250张原始图像,包括250张良性肺组织图像、250张肺腺癌、250张肺鳞状细胞癌、250张良性结肠组织图像和250张结肠腺癌。其余图像通过数据增强生成,扩展数据集,确保数据集多样化且广泛的数据集,用于稳健的模型训练和验证。
高分辨率图像使得对细胞结构进行了详细检查,这对于准确的癌症分类至关重要。由于原始图像数量有限,数据补充是必要的;采用了旋转、翻转、缩放和移位等技术,以合成方式增加数据集的大小和多样性。该过程以类别平衡方式生成了另外23,750张合成图像,最终数据集为25,000张,每个类别包含5,000张图像。
数据预处理
数据集中的原始组织病理图像分辨率为768×768像素。为了确保与EfficientNetB7架构的兼容性并最大化计算效率,每张图像的尺寸从768×768调整为224×224像素。这种调整规模过程代表了保留重要组织学特征与减少计算负担之间的权衡。调整尺寸作的数学表现如下所示
方程1:
(1)
其中X表示原始图像,X调整大小为调整后的图像,h和w分别表示期望的高度和宽度。所有像素值均被归一化为0到1的范围,通过确保图像间输入分布一致,稳定并加速训练。该归一化通过数学计算得出,如方程2所示。这一步对于提升训练中的模型收敛性至关重要。
(2)
数据增强被用作提升深度学习模型鲁棒性和适用性的关键技术,尤其是在数据集有限且不平衡的医学影像环境中。本研究采用了多种增强技术,利用TensorFlow的ImageDataGenerator模块模拟体内组织病理图像的变异。这些技术包括最多20度的随机旋转以模拟组织方向的变异,水平和垂直移动以模拟切片准备过程中图像尺寸的20%左右,以及最高可达20%的随机变焦以反映放大倍率的变异。
此外,还进行了水平翻转引入镜像变化,进一步丰富了训练数据集。为管理这些变换过程中生成的新像素,采用了最近邻填充策略,以确保过渡平滑并保持关键组织学特征的完整性。用于增广的二维旋转矩阵表示在方程3中,方程4定义了一个具有增量变化的函数:
(3)
(4)
这些增强技术通过学习不变量特征和降低过拟合风险,弥补了类别不平衡、轻微组织学变异和数据集限制等挑战。通过合成扩展数据集并纳入受控变异性,数据增强显著提升了模型对新未见数据的泛化能力,从而打造了一个更强大、更稳健的肺结肠癌临床应用系统。
模型架构
该模型基于EfficientNetB7架构开发,该架构是一个以其性能、可扩展性和在图像分类任务中高效著称的先进深度学习网络。EfficientNetB7 是通过一系列移动逆转瓶颈卷积(MBConv)块构建的,这些模块集成了深度可分离卷积。这种结构设计有效地压缩了模型,显著减少了参数数量,同时性能损失最小。这种创新使模型能够以更低的计算成本实现高精度,使其特别适合计算密集型应用,如组织病理图像分析。 图3 展示了预训练的EfficientNetB7模型架构。

图3:EfficientNetB7的模型架构。 图中展示了EfficientNetB7模型的详细结构,展示了其主要层和用于图像分类的功能模块。 请点击此处查看该图的放大版本。
该模型接受了预处理的组织病理图像,图像尺寸从原先的768×768像素缩小到224×224像素,以满足EfficientNetB7的输入需求。每幅图像在网络中经历多个过程,包括批处理归一化、Swish激活函数和卷积作。批量归一化的计算如方程5所示。Swish激活函数引入了非线性,使得训练速度更快、更高效,相较于传统功能如ReLU。这些层设计用于提取和增强层级特征,使模型能够随着图像在网络中传播,逐步从低层向高层模式学习。
(5)
EfficientNetB7的卷积骨干,在ImageNet数据集上预训练,提供了一套高度通用的特征检测器,适用于广泛的图像域。预训练基础在捕捉组织病理图像中微妙但富有信息量的模式方面发挥了关键作用,这些图像通常具有高类内变异性和细粒度特征。卷积层的输出被传递到一个全局平均池层,将空间维度简化为每张图像的单一特征矢量。该向量封装了卷积层学习到的最相关特征,随后被平展成一维数组,以兼容全连通层。增强肺癌和结肠癌检测的算法见 补充文件1。
后续网络架构包括两个密集(完全连接)层,分别有128和64个单元。两层均使用整流线性单位(ReLU)激活函数,引入额外的非线性特性并微调提取特征,使模型能够识别数据中的更精确的模式和关系。模型的最后一层是SoftMax输出层,包含五个神经元,每个神经元代表数据集中的五个类别之一。SoftMax函数生成了跨类别的概率分布,反映了模型对每张输入图像的预测,如方程6所述:
(6)
最先进的卷积技术、稳健正则化和有效的优化策略相结合,造就了一个非常适合高风险医学图像分类的深度学习模型。该模型实现了精确性、可扩展性和运营效率,展现出在肺癌和结肠癌诊断临床应用中的强大潜力。在此框架下,正则化主要通过高级数据增强和早期停止实现;对于致密层,没有明显的落差或重量衰减。
培训与验证
卷积神经网络(CNN)用于组织病理图像分类的验证和预训练流程LC25000旨在优化模型性能并确保良好的泛化。该流水线始于全面的预处理,包括将原有的768×768像素图像减少为224×224像素,以满足EfficientNetB7架构的输入需求。像素强度被归一化至范围[0, 1]以稳定和加速训练,并采用了数据增强技术,包括随机旋转、移动、缩放和水平翻转,以引入变异性并减少过拟合。这些预处理作确保模型学习不变特征并良好推广到新数据。
以EfficientNetB7模型为基础,该模型在ImageNet数据集上预训练,提供了一套稳健的特征检测器集,能够识别细微的组织学模式。随后,模型通过通过整流线性单元(ReLU)激活两层密集层(128和64单元)进行微调,随后通过SoftMax输出层进行五类分类。该架构在精度和计算效率方面都进行了优化,非常适合医学图像分析。θ的亚当优化器更新规则见方程7。
(7)
模型训练以128张图像为一组,使用Adam优化器进行,该优化器自适应地缩放学习率以促进有效收敛。实施了早期停止准则,用于监控验证损失,若无改善则停止训练,从而防止过度拟合并优化计算资源。在整个培训过程中,关键性能指标——包括准确性、损失、精度和回忆——通过占20%的数据的保留验证集进行了跟踪。保留数据集为模型泛化能力提供了关键洞见,并降低了对未见数据的过度拟合风险。
先进预处理、数据增强和优化策略的整合带来了卓越的模型准确性和鲁棒性,展现出在肺癌和结肠癌检测临床应用中的强大潜力。所有实验均在配备16GB内存和64GB系统内存的NVIDIA Tesla P100 GPU上进行。完整的训练流程——包括预处理、增强和模型优化——完成十个时代,批次为128,大约需要三小时。该计算基础设施旨在高效管理庞大且增强后的数据集,同时保持适合临床研究环境的合理训练时间。
为了可重复性,所有临界超参数都被明确指定。该模型使用Adam优化器训练,学习率恒定为0.001。训练最多持续10个时代,基于验证损失提前停止,耐心等待3个时代以防止过拟合。培训和验证阶段均采用了128批次。为确保结果一致,数据加载和模型训练的所有阶段随机种子都设置为42。培训期间未应用学习率衰减计划。
该协议结合了系统预处理、校准良好的超参数、严谨的验证方案以及开放的计算环境,以促进准确性和可重复性。该工作流程通过整合稳健的深度学习架构、有效优化和可重复的实验设计,为组织病理图像分类奠定了坚实基础。除了在肺癌和结肠癌检测方面表现出色外,该方案还定义了一个可扩展的框架,未来研究中可扩展至类似的生物医学影像挑战。
在模型开发过程中,实施了若干实用调整以实现可靠且可复现的结果。采用早期停止和高级数据增强技术来解决类失衡和过拟合问题。通过将图像调整为224×224像素,并使用128批次大小,缓解了训练期间的高内存使用。当遇到缓慢收敛时,经验上将学习率设为0.001。为防止数据加载错误,对图像目录结构进行了人工验证,并修复了随机种子以确保可重复性。这些策略可为面临类似挑战的研究者提供实用指导,尤其是在使用大量组织病理图像数据集训练深度学习模型时。
统计分析
通过综合指标对模型性能进行了统计建模,以评估其准确性、稳定性和可推广性。关键评估指标包括准确性、召回率、F1评分和准确性,以量化分类表现。混淆矩阵被用来报告类别特定的误差指标,计算方式为8-10:
(8)
(9)
(10)
此外,还评估了均方误差(MSE)、均方根误差(RMSE)和平均绝对误差(MAE)等误差指标,以评估预测准确性,计算方法为11-13:
(11)
(12)
(13)
采用接收者工作特征(ROC)曲线和曲线下面积(AUC)来评估模型在不同阈值区分类别的能力。AUC的计算方式如方程14所示:
(14)
这些统计分析对模型的分类性能、鲁棒性以及对未见数据的泛化性进行了全面评估。
消融研究
为了进一步评估每个组件在分类框架中的贡献,进行了消融研究,通过选择性省略或修改最终模型中的特定架构元素。具体来说,评估了两种替代实验配置:一种配置包含全球平均池化和平坦层,随后是两个密集层(分别为128和64单元);另一种配置省略了扁平层和128单位稠密层,只保留了全局平均池层和一个64单位稠密层。
主要结果报告的完整架构验证准确率约为96%。当排除Flatten层,且仅使用128和64单位的稠密层时,验证准确率降至81.6%。相反,当排除128单位密集层,保留Flatten层时,验证准确率降至88%。这些结果表明,为了实现最佳分类性能,必须同时包含超密集层和相应的架构组件。消融实验的结果一致表明,全球平均汇聚、平整和两层全连通的结合,使特征表现更为丰富,从而实现了更稳健、更准确的组织病理图像分类。
Access restricted. Please log in or start a trial to view this content.
图4 展示了训练和验证的准确性。 图5 展示了训练和验证损失。

图4:跨时代的训练与验证准确性。 图示展示了训练集和验证集在所有时代中准确率的递进,展示了模型性能在训练过程中的演变。 请点击此处查看该图的放大版本。
Access restricted. Please log in or start a trial to view this content.
在EfficientNetB7深度学习架构下对错误标注实例的关键审查中,对模型预测与验证数据集中真实标签不符的实例进行了关键审查。批判性分析在分析某些分类错误时极为重要,尤其是在模型错误分类肺和结肠组织的各种组织病理特征时11。该过程是对验证集中的所有图像进行类别预测,并与真实分类进行比较。错误分类的图像通过其索引表示,预测标签与实际标签不一致。其中一张被误分类的图片,通常有五张,会以视觉形式呈现,标注在预测和实际标签上。这种图形显示让我们清晰地了解模型犯了哪些类型的错误,并有助于我们推断错误分类的原因。这种敏锐的关注在确定模型可能需要调整或改进的预处理技术、数据增强流程或模型架构变更时所必需。放大这些变量有望显著提升模型作为诊断工具的准确性和可靠性,这也是其在临床环境中应用的核心,因为准确的医疗诊断至关重要。
EfficientNetB7结构在本研究中表现优异,尤其是在...
Access restricted. Please log in or start a trial to view this content.
作者声明,关于本手稿的出版不存在利益冲突。本研究、结果或结论均未受到任何财务或个人关系的影响。
本研究由努拉·本特·阿卜杜勒拉赫曼公主大学研究支持项目编号(PNURSP2026R195)支持,沙特阿拉伯利雅得努拉·本特·阿卜杜勒拉赫曼公主大学。作者感谢哈立德国王大学研究与研究生院通过大型团队研究(资助编号为RGP2/749/46)资助这项工作。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| A100 GPU(CUDA) | NVIDIA | CUDA 版本 11.0 | GPU加速用于模型训练和评估。 |
| 卡格尔平台 | 谷歌 | 无 | 基于云的机器学习模型开发笔记本 |
| 克拉斯 | 张量流(谷歌) | 版本 2.6.0 | 基于TensorFlow运行的深度学习API。 |
| LC25000 | Borkowski AA、Bui MM、Thomas LB、Wilson CP、DeLand LA、Mastorides SM。肺癌和结肠癌组织病理图像数据集(LC25000) | 无 | 该数据集包含25,000张组织病理学图像,分为5个类别。所有图片尺寸为768 x 768像素,格式为jpeg文件。 |
| Matplotlib | Python 软件基础 | 版本 3.5.0 | 用于绘制结果的可视化库。 |
| 数字派 | Python 软件基础 | 版本 1.19.5 | 数值计算库。 |
| OpenCV | 开源 | 版本 4.5.4 | 图像处理与计算机视觉库。 |
| 熊猫 | Python 软件基础 | 版本 1.3.4 | 数据分析与作工具。 |
| Python(Anaconda 发行版) | 蟒蛇公司 | 版本 3.7.12 | 包含预装的软件包和环境管理工具。 |
| Scikit-learn | Python 软件基础 | 版本 0.23.2 | 用于绩效评估的机器学习工具。 |
| 张量流 | 谷歌 | 版本 2.6.2 | 扩散模型的深度学习框架。 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission