利用包含2,280张皮肤病变图像的精选数据集,建立了一种标准化的二分类深度学习工作流程,用于判断每张图像中是否存在猴痘病毒感染。在相同的预处理和训练流程背景下,比较了自定义模型、InceptionV3、ResNetV2、ResNet50、DenseNet121以及一种混合CNN-Transformer模型的性能。
方法文章
利用包含2,280张皮肤病变图像的精选数据集,建立了一种标准化的二分类深度学习工作流程,用于判断每张图像中是否存在猴痘病毒感染。在相同的预处理和训练流程背景下,比较了自定义模型、InceptionV3、ResNetV2、ResNet50、DenseNet121以及一种混合CNN-Transformer模型的性能。
由于猴痘皮肤病变的外观与其他水疱性和脓疱性皮肤病相似,其视觉特征尚未明确建立。本文验证了以下假设:一种结合卷积和基于变换器特征编码器的混合深度学习模型,能够在统一的实验流程中自动分类猴痘图像。为确保模型与报告之间的一致性,主要分析被设定为二分类任务:猴痘 versus 其他具有相同或相似表现的疾病。这些基准数据包含2,280张图像:1,020张猴痘图像和1,260张非猴痘病变图像。图像被下采样至标准输入尺寸150 × 150像素,像素值范围为[0, 1]。在训练过程中,图像通过旋转、平移、剪切、缩放和水平翻转进行数据增强。研究比较了自定义的序列卷积神经网络(Sequential CNN)、InceptionV3、ResNetV2、ResNet50、DenseNet121以及所提出的混合CNN-变换器架构。所有基线模型均使用Adam优化器和二元交叉熵损失函数训练15个周期。尽可能测量了训练与验证准确率、损失值、精确率、召回率、F1分数以及受试者工作特征曲线下面积以评估模型性能。内部验证准确率最高的模型为Sequential CNN,而混合模型达到了98.50的精确率、98.50的召回率和98.58的F1分数,表现出均衡的判别能力。InceptionV3显示出过拟合迹象,ResNetV2未能提供足够的验证数据以支持稳健的泛化测试。总体而言,该混合模型可被视为一种可行且均衡的策略,但并不一定优于所有基线模型。
在临床实践中,猴痘的自动快速检测具有重要意义,因为该疾病在初始视觉评估时可能与其他多种水疱性或脓疱性皮疹相似。临床医生通常不会仅关注皮损的形态,而是会结合皮疹模式、分布特征、病史、暴露风险、流行病学背景以及实验室确诊结果进行综合判断1。然而,在皮肤科专业评估受限或延迟的环境中,计算工具可通过图像分析执行有效的初步分诊。这种方法在疫情追踪、远程皮肤病筛查以及资源有限但疑似病例数量较多、需优先安排确诊检测的场景中尤为适用。
基于深度学习的方法也逐渐成为该任务的热门选择,因为它们能够在无需手动创建描述符的情况下,识别出具有区分性的病变图像2。目前文献中最主流的方法仍是卷积神经网络,因其在局部纹理、颜色范围和病变边缘识别方面表现出色3。近年来的研究借助迁移学习、注意力机制和Transformer模块进一步发展了这一范式,旨在建模图像中更大范围的空间依赖性。然而,关于猴痘(mpox)的文献所报告的高性能结果应谨慎对待。大量研究使用了稀疏的公开数据集,采用不同且异构的类别集合,或在多种预处理和验证方案下进行结果比较4。因此,人们常常面临一个难题:性能的提升究竟是源于真正更优越的模型、理想的数据划分、充分的数据增强,还是由于底层任务定义的差异所致。
猴痘仍然是对公共卫生具有重大影响的重要传染病之一,因其皮肤感染引起的病变在初诊期间的眼部筛查过程中,可能与其他水疱性和脓疱性病变在表观上难以区分5。实际上,临床医生并不单纯依据病变形态(如模式、分布、病史、流行病学)进行猴痘诊断,实验室确诊同样是诊断决策的重要组成部分6。然而,在缺乏或难以获得皮肤科医生经验、诊断速度较慢的情况下,借助依赖图像的计算工具,临床医生仍可在分诊过程中发挥积极作用。这类工具可能适用于远程皮肤病学、需要开展筛查的疫情暴发场景,以及资源有限的地区——在这些地区,必须快速处理优先列表上的疑似病例7。
基于深度学习的方法能够学习具有区分性的病灶表征,因此在该任务中颇具吸引力,因为它们无需依赖人工设计的描述符,而是根据输入图像的特征来学习此类表征8。在皮肤科图像领域,利用卷积神经网络(CNN)分析图像已成为研究热点,因为CNN具备编码局部纹理、病灶边缘以及精细形态学特征的能力。后续研究通过迁移学习、注意力机制以及基于Transformer的子模块,进一步拓展了这一范式,以学习更通用的空间关系和上下文趋势9。然而,目前关于猴痘(mpox)影像的研究仍缺乏一致性。性能表现不仅取决于网络结构的选择,还常受到数据集结构、数据增强方案、类别定义以及验证方式的影响,因此文献报道的结果存在异质性10。由此可见,优异的表面性能并不一定意味着模型泛化能力的提升。
在本研究中,该问题通过采用一种更具可感知性且内部一致的二分类猴痘图像分类基准得以解决11。本文并未以提出一种全新的混合架构的形式来讨论其贡献,因为CNN-Transformer方法在现有文献中已有广泛报道12。相反,本实验引入了一种标准比较方法,并明确进行初级二分类分解,以符合实验协议的方式综合考虑额外的多分类证据、预处理/训练过程以及模型性能,并且相对于实验环境,模型性能的评估采用了更为保守的标准13。在此范式下,CNN-Transformer模型仍具有功能上的重要性,因为CNN在捕捉局部病灶信息方面具有最优的结构优势,而基于Transformer的表征则有望描述皮肤科中感兴趣的长距离空间结构。
目前关于猴痘(mpox)图像分类的研究可大致分为三种主流方法,这些方法均基于特定的研究范式。第一种方法依赖于传统的卷积神经网络(CNN)和迁移学习,因其技术成熟、计算速度快,并能有效再现病灶特异性纹理而被广泛采用14。第二种方法探索基于注意力机制或Transformer模型,更适合学习病灶的全局上下文信息。第三种方法则在混合流程中整合卷积与注意力机制,在保留局部敏感性的同时实现更大范围的上下文建模。多项研究报道了较高的性能指标,但由于各研究在数据集规模、数据整理策略、类别结构、预处理方法及验证协议方面存在差异,其结果难以直接比较15。这些研究有的侧重于二分类任务,有的侧重于多类别皮肤病鉴别,且并非全部采用相同的评估指标。此外,公开的猴痘图像数据集可能包含近似重复或高度相似的图像,若数据划分控制不充分,可能导致表观性能被高估16。
该分析基于一组受控的二分类皮肤病变图像数据集,共包含2,280张图像,其中1,020张为猴痘(mpox)图像,1,260张为其他病变(Other)图像。其他类别涵盖了肉眼观察下与非猴痘病变存在重叠的图像,因此该任务相较于完整的皮肤病定位系统,更符合临床中具有实际意义的早期分诊需求17。所有图像均经过调整尺寸、归一化、标准化和数据增强处理,并在典型的内部训练-验证流程中进行评估。主要目标是在透明的基准测试中比较传统深度学习模型与混合深度学习模型的表现,并判断所提出的混合架构是否相较于主流基线模型,在判别能力与可解释性之间实现了更优的平衡。
当前修订版本所解决的明确差距,并非仅仅展示混合模型本身,因为混合型 CNN-Transformer 的策略在现有文献中已有涵盖。真正存在的脱节在于,亟需一种更为明确且内部一致的评估指标,该指标应忽略主要的二分类任务和探索性的多分类输出,以可重复的方式刻画预处理和训练流程,并以不夸大模型新颖性或临床适用性的方式呈现模型性能18。在这方面,混合架构仍然值得考虑,因为卷积神经网络(CNN)在局部特征提取方面表现优异,而类 Transformer 的注意力机制理论上能够建模全局病灶构型及更长距离的空间关联,从而辅助视觉诊断19。实际关注的问题不在于混合设计相较于常规基线模型在相同 curated 数据维度上是否具有更优的判别能力、稳定性和可解释性平衡,而在于其是否在计算开销、稳定性和可解释性之间实现了良好平衡。
目前关于猴痘图像分析的最新研究可分为三种主要方法类别。第一类方法采用传统的卷积神经网络(CNN)和迁移学习架构,因其技术成熟、计算效率高,并能够学习病灶特异性的纹理和局部形态学特征20。第二类方法采用视觉Transformer或注意力增强模型,旨在捕捉病灶区域更广泛的空間关联,特别是在纹理斑块由病灶的上下文分布构成的情况下,这些空间关联的重要性可能与单个纹理斑块相当。第三类方法结合卷积与注意力机制,构建混合式处理流程,旨在保留CNN对局部特征的敏感性,同时利用注意力模块的上下文建模能力。
尽管大多数研究声称具有很高的准确性,但由于数据集在规模、整理策略、类别构成和验证设计方面存在差异,跨研究比较并非易事21。一些文献评估了二分类判别能力,而另一些则评估了多类皮肤病分类性能;部分研究在报告精确率和召回率时保持平衡,而另一些则侧重于准确率22。此外,已报道的猴痘数据集可能基于在线图像集合、人工整理的集合或增强子集,若训练集与验证集之间的数据泄露或近似重复图像未得到妥善处理,可能会人为提升报告的性能。因此,表1不仅作为以往研究的汇编,更被设计为模型家族、数据集限制以及本研究所提供方法潜在优势的示意图。
本研究的方法学价值以更为有限且更具可辩护性的方式得以体现。本文将借助所提供的 curated 数据集,探讨透明二元基准的必要性,报告预处理与训练流程,并将所提出的混合模型与主流基线模型进行直接比较23。这些改进还使得主要的二元实验与补充性的多类别证据得以区分,从而能够将性能声明与相应的实验背景准确关联24。这一区别在对模型行为、报告指标及实用性的论述分析中具有决定性意义。
本实验的主要内容是在一个经过人工整理的较小数据集上进行二分类实验,该数据集包含2280张皮肤病变图像。在此数据集中,被标注为mpox的图像数量为1,020张,归类为“其他”的图像数量为1,260张。“其他”类别涵盖了与mpox无关但具有相似视觉特征的皮肤病表现,主要是文中所称的水痘样和麻疹样病变25。这种双重命名方式使得该二分类组合在临床上具有重要意义,可作为初步筛查模型:该模型旨在检验算法是否能够区分疑似mpox病例与视觉上易混淆的其他病变,同时又比完整的多类别皮肤病基准测试更为简洁。
模型的训练必须标准化,所有图像在训练前均需进行预处理。调整大小、强度归一化、数据增强以及将分类标签转换为二分类标签等步骤在论文中也有提及。然而,根据更新后的含义,这些步骤被视为可重复性分析流程的组成部分,而非边缘性的备注说明。该数据集进一步划分为包含多个目录的训练集和验证集子集,所述性能指标应被理解为内部验证的性能表现,而非完全独立的外部测试组的评价指标。为更清晰起见,这组包含2,280张图像的数据将被视为进行主要分析的正式数据集。选择二分类框架是因为其反映了临床实践中常见的初步分诊问题:某张可疑皮损图像更可能是猴痘(mpox)而非其他视觉相似疾病的可能性?尽管相较于全面的皮肤科诊断,该框架存在一定局限性,但其作为比较性基准测试的一个有效且技术上可解释的初始起点是合理的。
数据集的更新描述还考虑到论文中包含了一些通过不同类别结构或某些富集子集获得的额外结果,这些结果如图1A–I所示。 manuscript 现在并未删除这些材料,而是将其直接置于上下文中,以便读者能够查看属于二元基准测试的结果以及属于次要实验的结果。该方法将保留本研究的全部文档记录,但不会允许将任何不相容的实验整合到单一结论中。
访问受限。请登录或开始试用以查看此内容。
注意:主实验请使用论文中描述的经过整理的猴痘二分类图像数据集。该数据集包含 2,280 张皮肤病变图像,其中包括 1,020 张猴痘图像和 1,260 张标注为“其他”的图像。仅进行二次图像分析;不得在本工作流程中开展直接的患者招募、临床干预、动物实验或新生物样本的制备。
1. 获取并整理数据集
2. 调整图像大小并进行归一化
3. 增强训练图像
4. 编码标签并划分数据集
5. 构建基线卷积神经网络模型
6. 定义混合卷积神经网络-变换器模型
7. 培训过程与评估实践
8. 实验分析
访问受限。请登录或开始试用以查看此内容。
超越标题准确性的比较
这些结果表明,在医学图像分析中对模型进行比较时,不应仅关注总体准确率,还应考察不同架构在多种指标和实验条件下的表现。在整个实验过程中,各模型的表现并不一致:简单的序列卷积神经网络(Sequential CNN)在内部验证集上表现极为出色,InceptionV3 出现了过拟合,ResNetV2 的验证结果报告不足,DenseNet121 性能相对较好但并未占据主导地位,而所提出的混合 CNN-Transformer 模型在多项指标上表现出稳健且均衡的性能。这种差异凸显了在报告训练、验证和评估条件时保持内部一致性的重要性,而非仅仅依赖单一的最高准确率数值。整体的训练与验证损失及准确率变化趋势如图 2A和图 2B所示。
序列CNN基线:虚拟内部性能
序列卷积神经网络(Se...
访问受限。请登录或开始试用以查看此内容。
本研究的关键结果是,使用本研究所采用的经过整理的数据集,对猴痘与外观相似的病变进行二分类(即自动化分类)是可行的,但此类成功在很大程度上依赖于对证据的解读27。通过合理区分实验设计,论文提供了证据表明,无论是传统架构还是所提出的混合架构,均可实现优异的性能28。因此,将混合模型视为适用于所有情况的通用解决方案是不恰当的,它应被视为一种平衡且具有前景的解决方案。
还存在若干关键的局限性。首先,主要发现基于对一个 curated 数据集集合的内部验证,其在不同医疗机构、设备、患者人群以及图像采集条件下的稳健性尚未得到证实29。其次,二分类模型简化了皮肤科鉴别诊断的临床图景,而实际中其他中间类型的病变以及不典型的表现形式也具有重要意义。第三,所提供的实现中缺少混合模型在某些架构设计和训练细节方面的内容30。最后但同样重要的是,原始稿件中二分类、多分类与增强摘要的混合使用,可能导致在实验设置未明确区分...
访问受限。请登录或开始试用以查看此内容。
作者声明,他们不存在任何已知的可能影响本论文所报告工作的竞争性财务或非财务利益。
作者衷心感谢 Vel Tech Rangarajan Dr. Sagunthala R&D Institute of Science and Technology 通过研究发展基金(RDF)提供的财政支持,资助编号为 VTU/RDF/FY2026-27/009。该支持对本研究工作的顺利实施起到了关键作用。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 数据集 | 经过整理的猴痘图像数据集;主二分类基准包含2,280张图像(1,020张猴痘图像和1,260张其他图像) | 主要训练和内部验证来源 | |
| 任务定义 | 核心研究采用二分类;补充的多分类和增强结果摘要单独保留 | 确保报告指标的一致性解释 | |
| 编程环境 | 基于Python的笔记本工作流程 | 数据处理、模型训练和绘图 | |
| 深度学习框架 | 提交代码中报告的TensorFlow / Keras实现 | 模型开发与优化 | |
| 图像处理工具 | 使用ImageDataGenerator进行重缩放和数据增强;用于训练曲线可视化的绘图库 | 预处理、数据增强和可视化报告 | |
| 基线架构 | 序列卷积神经网络(Sequential CNN)、InceptionV3、ResNetV2、ResNet50、DenseNet121 | 用于对比基准测试 | |
| 提出架构 | 混合卷积神经网络-Transformer分类器 | 主要方法学贡献 | |
| 训练设置 | 输入尺寸150 × 150;批量大小32;Adam优化器;二元交叉熵损失函数;所提供基线代码报告训练15个周期 | 核心工作流程的可重复性 | |
| 计算环境 | 支持GPU的计算系统;文中对硬件细节进行了概括描述 | 训练过程中的模型加速 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可