方法文章

基于混合卷积神经网络-Transformer深度学习模型的猴痘医学图像自动诊断方法

DOI:

10.3791/70533

2026年5月29日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

利用包含2,280张皮肤病变图像的精选数据集,建立了一种标准化的二分类深度学习工作流程,用于判断每张图像中是否存在猴痘病毒感染。在相同的预处理和训练流程背景下,比较了自定义模型、InceptionV3、ResNetV2、ResNet50、DenseNet121以及一种混合CNN-Transformer模型的性能。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

由于猴痘皮肤病变的外观与其他水疱性和脓疱性皮肤病相似,其视觉特征尚未明确建立。本文验证了以下假设:一种结合卷积和基于变换器特征编码器的混合深度学习模型,能够在统一的实验流程中自动分类猴痘图像。为确保模型与报告之间的一致性,主要分析被设定为二分类任务:猴痘 versus 其他具有相同或相似表现的疾病。这些基准数据包含2,280张图像:1,020张猴痘图像和1,260张非猴痘病变图像。图像被下采样至标准输入尺寸150 × 150像素,像素值范围为[0, 1]。在训练过程中,图像通过旋转、平移、剪切、缩放和水平翻转进行数据增强。研究比较了自定义的序列卷积神经网络(Sequential CNN)、InceptionV3、ResNetV2、ResNet50、DenseNet121以及所提出的混合CNN-变换器架构。所有基线模型均使用Adam优化器和二元交叉熵损失函数训练15个周期。尽可能测量了训练与验证准确率、损失值、精确率、召回率、F1分数以及受试者工作特征曲线下面积以评估模型性能。内部验证准确率最高的模型为Sequential CNN,而混合模型达到了98.50的精确率、98.50的召回率和98.58的F1分数,表现出均衡的判别能力。InceptionV3显示出过拟合迹象,ResNetV2未能提供足够的验证数据以支持稳健的泛化测试。总体而言,该混合模型可被视为一种可行且均衡的策略,但并不一定优于所有基线模型。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在临床实践中,猴痘的自动快速检测具有重要意义,因为该疾病在初始视觉评估时可能与其他多种水疱性或脓疱性皮疹相似。临床医生通常不会仅关注皮损的形态,而是会结合皮疹模式、分布特征、病史、暴露风险、流行病学背景以及实验室确诊结果进行综合判断1。然而,在皮肤科专业评估受限或延迟的环境中,计算工具可通过图像分析执行有效的初步分诊。这种方法在疫情追踪、远程皮肤病筛查以及资源有限但疑似病例数量较多、需优先安排确诊检测的场景中尤为适用。

基于深度学习的方法也逐渐成为该任务的热门选择,因为它们能够在无需手动创建描述符的情况下,识别出具有区分性的病变图像2。目前文献中最主流的方法仍是卷积神经网络,因其在局部纹理、颜色范围和病变边缘识别方面表现出色3。近年来的研究借助迁移学习、注意力机制和Transformer模块进一步发展了这一范式,旨在建模图像中更大范围的空间依赖性。然而,关于猴痘(mpox)的文献所报告的高性能结果应谨慎对待。大量研究使用了稀疏的公开数据集,采用不同且异构的类别集合,或在多种预处理和验证方案下进行结果比较4。因此,人们常常面临一个难题:性能的提升究竟是源于真正更优越的模型、理想的数据划分、充分的数据增强,还是由于底层任务定义的差异所致。

猴痘仍然是对公共卫生具有重大影响的重要传染病之一,因其皮肤感染引起的病变在初诊期间的眼部筛查过程中,可能与其他水疱性和脓疱性病变在表观上难以区分5。实际上,临床医生并不单纯依据病变形态(如模式、分布、病史、流行病学)进行猴痘诊断,实验室确诊同样是诊断决策的重要组成部分6。然而,在缺乏或难以获得皮肤科医生经验、诊断速度较慢的情况下,借助依赖图像的计算工具,临床医生仍可在分诊过程中发挥积极作用。这类工具可能适用于远程皮肤病学、需要开展筛查的疫情暴发场景,以及资源有限的地区——在这些地区,必须快速处理优先列表上的疑似病例7

基于深度学习的方法能够学习具有区分性的病灶表征,因此在该任务中颇具吸引力,因为它们无需依赖人工设计的描述符,而是根据输入图像的特征来学习此类表征8。在皮肤科图像领域,利用卷积神经网络(CNN)分析图像已成为研究热点,因为CNN具备编码局部纹理、病灶边缘以及精细形态学特征的能力。后续研究通过迁移学习、注意力机制以及基于Transformer的子模块,进一步拓展了这一范式,以学习更通用的空间关系和上下文趋势9。然而,目前关于猴痘(mpox)影像的研究仍缺乏一致性。性能表现不仅取决于网络结构的选择,还常受到数据集结构、数据增强方案、类别定义以及验证方式的影响,因此文献报道的结果存在异质性10。由此可见,优异的表面性能并不一定意味着模型泛化能力的提升。

在本研究中,该问题通过采用一种更具可感知性且内部一致的二分类猴痘图像分类基准得以解决11。本文并未以提出一种全新的混合架构的形式来讨论其贡献,因为CNN-Transformer方法在现有文献中已有广泛报道12。相反,本实验引入了一种标准比较方法,并明确进行初级二分类分解,以符合实验协议的方式综合考虑额外的多分类证据、预处理/训练过程以及模型性能,并且相对于实验环境,模型性能的评估采用了更为保守的标准13。在此范式下,CNN-Transformer模型仍具有功能上的重要性,因为CNN在捕捉局部病灶信息方面具有最优的结构优势,而基于Transformer的表征则有望描述皮肤科中感兴趣的长距离空间结构。

目前关于猴痘(mpox)图像分类的研究可大致分为三种主流方法,这些方法均基于特定的研究范式。第一种方法依赖于传统的卷积神经网络(CNN)和迁移学习,因其技术成熟、计算速度快,并能有效再现病灶特异性纹理而被广泛采用14。第二种方法探索基于注意力机制或Transformer模型,更适合学习病灶的全局上下文信息。第三种方法则在混合流程中整合卷积与注意力机制,在保留局部敏感性的同时实现更大范围的上下文建模。多项研究报道了较高的性能指标,但由于各研究在数据集规模、数据整理策略、类别结构、预处理方法及验证协议方面存在差异,其结果难以直接比较15。这些研究有的侧重于二分类任务,有的侧重于多类别皮肤病鉴别,且并非全部采用相同的评估指标。此外,公开的猴痘图像数据集可能包含近似重复或高度相似的图像,若数据划分控制不充分,可能导致表观性能被高估16

该分析基于一组受控的二分类皮肤病变图像数据集,共包含2,280张图像,其中1,020张为猴痘(mpox)图像,1,260张为其他病变(Other)图像。其他类别涵盖了肉眼观察下与非猴痘病变存在重叠的图像,因此该任务相较于完整的皮肤病定位系统,更符合临床中具有实际意义的早期分诊需求17。所有图像均经过调整尺寸、归一化、标准化和数据增强处理,并在典型的内部训练-验证流程中进行评估。主要目标是在透明的基准测试中比较传统深度学习模型与混合深度学习模型的表现,并判断所提出的混合架构是否相较于主流基线模型,在判别能力与可解释性之间实现了更优的平衡。

当前修订版本所解决的明确差距,并非仅仅展示混合模型本身,因为混合型 CNN-Transformer 的策略在现有文献中已有涵盖。真正存在的脱节在于,亟需一种更为明确且内部一致的评估指标,该指标应忽略主要的二分类任务和探索性的多分类输出,以可重复的方式刻画预处理和训练流程,并以不夸大模型新颖性或临床适用性的方式呈现模型性能18。在这方面,混合架构仍然值得考虑,因为卷积神经网络(CNN)在局部特征提取方面表现优异,而类 Transformer 的注意力机制理论上能够建模全局病灶构型及更长距离的空间关联,从而辅助视觉诊断19。实际关注的问题不在于混合设计相较于常规基线模型在相同 curated 数据维度上是否具有更优的判别能力、稳定性和可解释性平衡,而在于其是否在计算开销、稳定性和可解释性之间实现了良好平衡。

目前关于猴痘图像分析的最新研究可分为三种主要方法类别。第一类方法采用传统的卷积神经网络(CNN)和迁移学习架构,因其技术成熟、计算效率高,并能够学习病灶特异性的纹理和局部形态学特征20。第二类方法采用视觉Transformer或注意力增强模型,旨在捕捉病灶区域更广泛的空間关联,特别是在纹理斑块由病灶的上下文分布构成的情况下,这些空间关联的重要性可能与单个纹理斑块相当。第三类方法结合卷积与注意力机制,构建混合式处理流程,旨在保留CNN对局部特征的敏感性,同时利用注意力模块的上下文建模能力。

尽管大多数研究声称具有很高的准确性,但由于数据集在规模、整理策略、类别构成和验证设计方面存在差异,跨研究比较并非易事21。一些文献评估了二分类判别能力,而另一些则评估了多类皮肤病分类性能;部分研究在报告精确率和召回率时保持平衡,而另一些则侧重于准确率22。此外,已报道的猴痘数据集可能基于在线图像集合、人工整理的集合或增强子集,若训练集与验证集之间的数据泄露或近似重复图像未得到妥善处理,可能会人为提升报告的性能。因此,表1不仅作为以往研究的汇编,更被设计为模型家族、数据集限制以及本研究所提供方法潜在优势的示意图。

本研究的方法学价值以更为有限且更具可辩护性的方式得以体现。本文将借助所提供的 curated 数据集,探讨透明二元基准的必要性,报告预处理与训练流程,并将所提出的混合模型与主流基线模型进行直接比较23。这些改进还使得主要的二元实验与补充性的多类别证据得以区分,从而能够将性能声明与相应的实验背景准确关联24。这一区别在对模型行为、报告指标及实用性的论述分析中具有决定性意义。

本实验的主要内容是在一个经过人工整理的较小数据集上进行二分类实验,该数据集包含2280张皮肤病变图像。在此数据集中,被标注为mpox的图像数量为1,020张,归类为“其他”的图像数量为1,260张。“其他”类别涵盖了与mpox无关但具有相似视觉特征的皮肤病表现,主要是文中所称的水痘样和麻疹样病变25。这种双重命名方式使得该二分类组合在临床上具有重要意义,可作为初步筛查模型:该模型旨在检验算法是否能够区分疑似mpox病例与视觉上易混淆的其他病变,同时又比完整的多类别皮肤病基准测试更为简洁。

模型的训练必须标准化,所有图像在训练前均需进行预处理。调整大小、强度归一化、数据增强以及将分类标签转换为二分类标签等步骤在论文中也有提及。然而,根据更新后的含义,这些步骤被视为可重复性分析流程的组成部分,而非边缘性的备注说明。该数据集进一步划分为包含多个目录的训练集和验证集子集,所述性能指标应被理解为内部验证的性能表现,而非完全独立的外部测试组的评价指标。为更清晰起见,这组包含2,280张图像的数据将被视为进行主要分析的正式数据集。选择二分类框架是因为其反映了临床实践中常见的初步分诊问题:某张可疑皮损图像更可能是猴痘(mpox)而非其他视觉相似疾病的可能性?尽管相较于全面的皮肤科诊断,该框架存在一定局限性,但其作为比较性基准测试的一个有效且技术上可解释的初始起点是合理的。

数据集的更新描述还考虑到论文中包含了一些通过不同类别结构或某些富集子集获得的额外结果,这些结果如图1A–I所示。 manuscript 现在并未删除这些材料,而是将其直接置于上下文中,以便读者能够查看属于二元基准测试的结果以及属于次要实验的结果。该方法将保留本研究的全部文档记录,但不会允许将任何不相容的实验整合到单一结论中。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

注意:主实验请使用论文中描述的经过整理的猴痘二分类图像数据集。该数据集包含 2,280 张皮肤病变图像,其中包括 1,020 张猴痘图像和 1,260 张标注为“其他”的图像。仅进行二次图像分析;不得在本工作流程中开展直接的患者招募、临床干预、动物实验或新生物样本的制备。

1. 获取并整理数据集

  1. 定义一个包含两个类别的二元标注方案:猴痘和其他。
  2. 将视觉上相似的非猴痘病灶归入“其他”类别。
  3. 对所有图像进行可读性、类别识别性和适用于监督式图像分类的筛选。
  4. 在数据整理过程中排除不可用或模糊的图像。
  5. 将整理后的图像按类别组织到基于目录的文件夹中,以便后续通过图像生成器加载。

2. 调整图像大小并进行归一化

  1. 在模型训练前,将所有图像调整为 150 × 150 像素。
  2. 调整大小时采用双三次插值,以保持图像过渡平滑。
  3. 通过将每个像素值除以 255 来重新缩放像素强度。
  4. 将所有图像强度归一化至 [0,1] 范围。
    注意: 为确保不同架构之间的公平比较,所有模型应使用相同的空间分辨率和归一化方法。

3. 增强训练图像

  1. 仅对训练子集进行数据增强。
  2. 将旋转范围设置为 20°。
  3. 将宽度平移范围设置为 0.2。
  4. 将高度平移范围设置为 0.2。
  5. 将剪切范围设置为 0.2。
  6. 将缩放范围设置为 0.2。
  7. 启用水平翻转。
  8. 对增强过程中引入的新像素使用最近邻插值填充。
  9. 在训练过程中在线执行数据增强,而非通过永久复制图像文件实现。
    注意:不要对验证图像进行增强,仅对其进行缩放处理。

4. 编码标签并划分数据集

  1. 将两个类别编码为二进制标签。
  2. 使用基于目录的生成器以二分类模式加载图像。
  3. 将批量大小设置为 32。
  4. 将数据集划分为训练集和验证集。
    注意:该论文仅报告了内部训练-验证基准测试,未包含独立的外部测试队列。

5. 构建基线卷积神经网络模型

  1. 构建一个包含三个卷积模块的顺序卷积神经网络(CNN)基线模型。
  2. 在第一个卷积模块中使用32个滤波器,并在其后接最大池化层。
  3. 在第二个卷积模块中使用64个滤波器,并在其后接最大池化层。
  4. 在第三个卷积模块中使用128个滤波器,并在其后接最大池化层。
  5. 将提取的特征图进行展平处理。
  6. 添加一个包含512个神经元的全连接层。
  7. 应用 dropout,丢弃率为0.5。
  8. 使用 sigmoid 输出层进行二分类。
  9. 将 InceptionV3、ResNetV2、ResNet50 和 DenseNet121 作为对比基线架构。
    注意:在所有适用的基线比较中,使用相同的精选二分类数据集和预处理流程。

6. 定义混合卷积神经网络-变换器模型

  1. 使用卷积神经网络(CNN)模块作为局部特征编码器。
  2. 利用CNN组件提取病灶的纹理、边缘及局部形态学模式。
  3. 使用基于Transformer的模块作为上下文编码器。
  4. 通过Transformer组件对学习到的表征中的广泛空间依赖关系进行建模。
  5. 将CNN和Transformer的特征向量投影到相同的维度,并通过逐元素相加进行融合。
  6. 通过分类头将融合后的表征映射为二分类输出(猴痘 versus 其他)。
    注:若注意力头数量、嵌入维度和Transformer层数等参数未明确提供,应在模块层面报告该混合架构。

7. 培训过程与评估实践

  1. 使用实现的模型,结合 Adam 优化器、二元交叉熵损失函数,并以准确率为主要训练指标,构建二分类器。
  2. 在经过整理的猴痘 versus 其他数据集上,对明确定义的基线模型进行 15 个训练周期的训练。
  3. 在配备 GPU 的系统上基于 Python 的深度学习环境中开展所有实验,并在材料表中汇总软件资源和通用计算环境。
  4. 在训练过程中监控训练和验证损失曲线,并在条件允许时,为每个独立模型计算准确率、精确率、召回率、F1 分数和 AUC。
  5. 通过强调报告结果的一致性和泛化行为来解读模型性能,优先考虑灵敏度与特异性之间的平衡,而非单一的峰值准确率数值。
  6. 为每个模型提出两个评估问题:(i) 模型对训练数据的拟合程度;(ii) 所学习到的表征在来自相同整理数据源的独立验证图像上的迁移能力。
    注意:在论文中明确呈现这两个方面,以区分表征能力与有效的泛化能力。
  7. 将较高的训练准确率解释为模型具备足够表征能力的证据,而将较高且稳定的验证性能视为更有意义的有效泛化指标。

8. 实验分析

  1. 仅报告有记录输出直接支持的结果,避免超出已记录证据的推断。
  2. 在缺乏验证信息或表格反映不同类别结构的情况下,应明确说明其局限性。
  3. 将猴痘与非猴痘的二分类任务视为主要分析,并将其作为所有实验的内部参考标准。
  4. 将原始实现代码转化为叙述性实验方案并整理至表2,以简洁概括数据集、软件环境、模型族及训练配置,确保可重复性。
  5. 对硬件和软件的描述应进行泛化处理,以突出方法学的可重复性,而非依赖于某一特定厂商平台。
  6. 按模型架构引入的顺序呈现各模型的结果,以便于比较训练行为、验证行为及报告完整性。
  7. 将序列卷积神经网络(Sequential CNN)基线描述为在内部验证中表现极佳,但需指出这可能反映了有利的数据划分特性,未必能在外部推广。
  8. 将序列模型解读为一个强有力的内部参考,而非可部署诊断鲁棒性的最终证明。
  9. 说明保留独立的InceptionV3面板的合理性,因为损失和准确率的变化轨迹共同揭示了有效的训练优化过程,但验证行为不一致。
  10. 将ResNetV2描述为一个具有参考价值但部分结果未完整报告的基线模型,因其缺乏可比的验证指标。
  11. 将ResNet50多分类实验视为与主要二分类基准不同的补充性证据。
  12. 将DenseNet121解读为在所报告的二分类子集上表现具有竞争力但非主导地位的中间基准模型。
  13. 将混合型卷积神经网络-Transformer模型描述为在各类别判别能力上实现均衡,而非单一指标的片面提升。
  14. 避免声称混合模型在所有基线模型中具有普遍优越性,因为部分模型在不同的报告条件下进行评估。
  15. 将混合模型定位为在高验证性能与指标均衡性之间具有前景的折中方案,并建议在标准化的外部测试基准上进一步评估。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

超越标题准确性的比较

这些结果表明,在医学图像分析中对模型进行比较时,不应仅关注总体准确率,还应考察不同架构在多种指标和实验条件下的表现。在整个实验过程中,各模型的表现并不一致:简单的序列卷积神经网络(Sequential CNN)在内部验证集上表现极为出色,InceptionV3 出现了过拟合,ResNetV2 的验证结果报告不足,DenseNet121 性能相对较好但并未占据主导地位,而所提出的混合 CNN-Transformer 模型在多项指标上表现出稳健且均衡的性能。这种差异凸显了在报告训练、验证和评估条件时保持内部一致性的重要性,而非仅仅依赖单一的最高准确率数值。整体的训练与验证损失及准确率变化趋势如图 2A图 2B所示。

序列CNN基线:虚拟内部性能

序列卷积神经网络(Se...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究的关键结果是,使用本研究所采用的经过整理的数据集,对猴痘与外观相似的病变进行二分类(即自动化分类)是可行的,但此类成功在很大程度上依赖于对证据的解读27。通过合理区分实验设计,论文提供了证据表明,无论是传统架构还是所提出的混合架构,均可实现优异的性能28。因此,将混合模型视为适用于所有情况的通用解决方案是不恰当的,它应被视为一种平衡且具有前景的解决方案。

还存在若干关键的局限性。首先,主要发现基于对一个 curated 数据集集合的内部验证,其在不同医疗机构、设备、患者人群以及图像采集条件下的稳健性尚未得到证实29。其次,二分类模型简化了皮肤科鉴别诊断的临床图景,而实际中其他中间类型的病变以及不典型的表现形式也具有重要意义。第三,所提供的实现中缺少混合模型在某些架构设计和训练细节方面的内容30。最后但同样重要的是,原始稿件中二分类、多分类与增强摘要的混合使用,可能导致在实验设置未明确区分...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,他们不存在任何已知的可能影响本论文所报告工作的竞争性财务或非财务利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢 Vel Tech Rangarajan Dr. Sagunthala R&D Institute of Science and Technology 通过研究发展基金(RDF)提供的财政支持,资助编号为 VTU/RDF/FY2026-27/009。该支持对本研究工作的顺利实施起到了关键作用。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
数据集经过整理的猴痘图像数据集;主二分类基准包含2,280张图像(1,020张猴痘图像和1,260张其他图像)主要训练和内部验证来源
任务定义核心研究采用二分类;补充的多分类和增强结果摘要单独保留确保报告指标的一致性解释
编程环境基于Python的笔记本工作流程数据处理、模型训练和绘图
深度学习框架提交代码中报告的TensorFlow / Keras实现模型开发与优化
图像处理工具使用ImageDataGenerator进行重缩放和数据增强;用于训练曲线可视化的绘图库预处理、数据增强和可视化报告
基线架构序列卷积神经网络(Sequential CNN)、InceptionV3、ResNetV2、ResNet50、DenseNet121用于对比基准测试
提出架构混合卷积神经网络-Transformer分类器主要方法学贡献
训练设置输入尺寸150 × 150;批量大小32;Adam优化器;二元交叉熵损失函数;所提供基线代码报告训练15个周期核心工作流程的可重复性
计算环境支持GPU的计算系统;文中对硬件细节进行了概括描述训练过程中的模型加速

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章