HMP-MUNet 提出了一种用于皮肤病变自动分割的混合深度学习框架。该框架通过融合状态空间模型与多尺度注意力机制,在提高分割精度的同时优化了计算效率,为临床环境中的皮肤癌诊断提供了稳健的解决方案。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
研究文章
* These authors contributed equally
HMP-MUNet 提出了一种用于皮肤病变自动分割的混合深度学习框架。该框架通过融合状态空间模型与多尺度注意力机制,在提高分割精度的同时优化了计算效率,为临床环境中的皮肤癌诊断提供了稳健的解决方案。
用于皮肤病变的计算机辅助诊断系统在实现高诊断准确性和计算效率方面面临重大挑战。当前的深度学习方法通常需要大量的计算资源,同时难以捕捉不同尺度下皮肤病变固有的复杂形态学变异。高阶多尺度并行视觉Mamba U-Net(HMP-MUNet)是一种新型深度学习框架,通过结合状态空间模型与先进的多尺度处理能力的创新架构设计,有效克服了这些局限性。
本研究中描述的方法整合了一种混合U-Net框架,该框架结合了用于全局上下文建模的高阶视觉状态空间模块、用于在多个感受野范围内进行分层特征提取的多尺度扩张注意力融合网络,以及用于计算优化的并行多深度灵活网络。该架构采用改进的U形编码器-解码器结构,通过增加通道维度和引入先进的注意力机制,以增强特征学习能力。
在基准数据集上的综合评估显示,该模型在PH2数据集上的Dice相似系数达到95.85%,在ISIC2018数据集上达到90.44%。该模型仅使用7.61M参数即实现了这一优异的精度,与现有的Vision Mamba架构相比,参数量显著减少了72.2%,同时保持了高分割精度。这种轻量级设计在各种临床环境和成像模式中具有部署潜力,从专业的皮肤科中心到基层医疗机构均可应用,但需进一步的临床验证。
HMP-MUNet 提供了一种用于皮肤病变分割的自动化解决方案,可提高诊断的一致性并支持临床工作流程,在临床应用中具有进一步验证的潜力。该方法将高阶建模能力与实际部署需求相结合,为改进皮肤癌筛查方案以及在计算机辅助诊断应用中扩大医疗可及性提供了潜在解决方案。
计算机辅助诊断(CAD)系统旨在改善临床各个专业领域的医学影像实践,提高疾病检测、诊断和治疗规划的水平1。在皮肤科领域,人工智能(AI)与先进成像技术的结合已成为提高诊断准确性和临床疗效的关键工具,尤其在皮肤癌的早期检测方面,皮肤癌约占所有皮肤恶性肿瘤的90%2。用于自动化皮肤病变分析的复杂算法方法的发展推动了精准医学的进步,能够在不同的医疗环境中提供标准化、可重复的诊断支持,从而增强临床决策能力3,4。
现代皮肤科影像学包含多种成像方式,包括皮肤镜、数字摄影、光学相干断层扫描和多光谱成像系统5医务人员利用皮肤镜图像,通过耗时且劳动密集型的手工方法诊断皮肤癌,该过程需要丰富的专业经验6在不同临床环境和成像条件下保持诊断一致性的挑战,推动了计算机辅助诊断(CAD)系统的发展,此类系统可对皮肤病变提供客观、定量的分析。从皮肤镜图像中对皮肤病变进行分割是一项关键的预处理步骤,直接影响后续分类的准确性及临床应用价值7通常,计算机辅助皮肤癌诊断包含五个步骤:图像获取、预处理、分割、特征提取和分类8精确的边界勾画对于准确的病灶表征至关重要,可使临床医生评估形态学特征,如不对称性、边界不规则、颜色变化和直径——这些是既定诊断标准中的关键参数。9.
状态空间模型(State-Space Models, SSMs)的出现,特别是Mamba架构,提供了线性的计算复杂度,在保持优异的长距离依赖建模能力的同时,提升了计算效率10皮肤病变分割的最新进展11,例如 U-Net9, Att-UNet12,UTNetV213,以及 UNet++14 在分割准确率方面表现出显著提升。例如,在ISIC2018数据集上,U-Net的Dice相似系数(DSC)达到87.55%,UNet++达到87.83%,Att-UNet达到87.91%。在PH2数据集上,U-Net的DSC达到90.6%,而C2SDG15 和 SCR-Net16分别达到90.3%和89.89%。HMP-MUNet通过引入多尺度注意力机制和并行处理能力,在参数量减少72.2%的同时,在PH2数据集上实现了95.85%的DSC,在ISIC2018数据集上实现了90.44%的DSC,性能优于上述模型。鉴于在视觉表征学习能力与计算资源消耗之间实现平衡的重要性,探索能够达到最优权衡的通用型医学图像分类架构,对于智能临床诊断系统的开发具有重要意义。17结构化空间SSMs框架通过优化状态转移矩阵、提升计算效率并降低内存开销,增强了传统的Mamba架构——这些特性对于在多种医学成像模式中实现临床部署至关重要。18.
近期研究表明,视觉Mamba架构(尤其是采用基于高阶视觉Mamba的切换方案H-VSS的架构)相比传统Transformer,在显著减少参数量的同时实现了更优的性能,因而特别适用于临床工作流程的整合19。然而,现有的视觉Mamba实现仍面临诸多挑战,包括在临床部署条件下内存消耗较高以及可扩展性受限等问题20。当前的医学图像分割方法通常分为卷积神经网络(CNN)和基于Transformer的模型两类,其中传统CNN受限于感受野范围,难以有效捕捉长距离依赖关系21。在医学影像中,区分病灶等关键区域与健康皮肤需要极高的精度,因此必须采用先进的技术手段以应对这些挑战22。现代分割架构已逐步发展以满足特定的临床需求,包括实现实时应用所需的计算效率、关键诊断任务所需的准确性,以及在不同成像协议下的鲁棒性23。结合了注意力机制、多尺度特征融合策略以及基于Transformer编码器的先进U-Net变体,在复杂的医学影像场景中展现出卓越的性能12,24。这些架构上的创新通过实现解剖结构的精确勾画、病理区域的准确识别以及定量生物标志物的提取,直接推动了临床应用的发展,而这些功能对于循证医学至关重要25,26。然而,整合过程中仍存在显著障碍,包括与现有电子病历系统(EMR)的接口兼容性、大尺寸图像的存储与调取,以及不同医疗机构系统之间的互操作性问题,这些因素严重制约了其在临床上的广泛应用27。
本文介绍了一种新型计算机辅助诊断系统——高阶多尺度并行视觉Mamba U-Net(High-order Multi-scale Parallel Vision Mamba U-Net,HMP-MUNet),专为临床实践中皮肤病变的自动化分割而设计。该框架通过引入创新的架构组件,解决了当前医学影像系统中的关键缺陷:多尺度扩张注意力融合网络(Multi-Scale Dilated Attention Fusion Network,MSDAFN)和并行多深度灵活网络(Parallel Multi-depth Flexible Network,PMFlex)。MSDAFN采用结合空间与通道注意力机制及多尺度扩张卷积的复杂特征提取策略,能够在不同尺度上增强对细微病变特征的检测能力——这对于临床实践中遇到的多种病变类型的准确诊断至关重要28。PMFlex引入了并行处理能力,可同时分析多个输入数据流,在保持临床级精度所必需的高阶建模能力的同时,显著提高了计算效率29。HMP-MUNet通过其创新的分割技术与计算策略,旨在推动皮肤癌诊断技术的边界,实现临床实时且准确的诊断30,31。
本研究的主要贡献与推动医学影像领域计算机辅助诊断(CAD)的核心目标相一致:通过多尺度双注意力融合网络(MSDAFN)增强全局上下文建模能力,提升特征提取与融合效率,从而在多种临床表现下实现精确的病灶定位;通过并行多灵活卷积模块(PMFlex)实现高效并行处理,在保持临床级准确率的同时降低计算开销,便于在资源受限的临床环境中部署;通过硬件感知设计优化临床部署,支持高分辨率皮肤镜图像的高效处理,满足实时临床工作流需求;通过在标准数据集上的全面评估验证临床性能,所采用的性能指标适用于临床整合;集成化诊断方案结合高阶建模、多尺度分析与并行计算,为精准皮肤科诊断提供全面解决方案。本研究通过提出创新且具有临床适用性的方法,解决了当代医疗环境中皮肤病变自动化分析在技术与实际应用方面的双重需求,推动了医学影像计算技术的发展。
该框架旨在处理高分辨率皮肤镜图像,通常输入分辨率为 256 × 256,在计算效率与图像细节之间实现了平衡。然而,设备和图像质量的差异,例如光照条件、皮肤色调以及毛发的存在,可能会影响分割性能。尽管存在这些挑战,该系统的设计已针对临床实时工作流程进行了优化,并可适配不同的成像设备,确保在多样化的临床环境中保持稳健的性能。
访问受限。请登录或开始试用以查看此内容。
本研究严格遵守机构关于计算研究和数据处理的指导原则。本研究未涉及人类受试者或脊椎动物。
数据集准备与预处理
数据集的收集与组织
皮肤镜图像来自 PH2、ISIC2018 和 ISIC2017 数据集,具体链接见材料表。PH2 数据集包含 200 张高分辨率图像(1000 × 1000 像素),ISIC2018 包含 2,594 张带对应分割掩膜的图像,ISIC2017 包含 2,150 张带分割掩膜的图像。数据按照标准协议划分为训练集、验证集和测试集,确保图像为兼容格式(例如 .jpg、.png 或 .tiff),并包含以二进制格式提供的对应真实标签掩膜。
数据按照标准协议划分为训练集、验证集和测试集。数据集的划分如下:ISIC2018 数据集中,1,815 张图像用于训练,259 张用于验证,520 张用于测试;ISIC2017 数据集中,1,500 张图像用于训练,220 张用于验证,430 张用于测试;PH2 数据集中,160 张图像用于训练,10 张用于验证,30 张用于测试。在整个预处理流程中,所有图像均保持一致的分辨率,即 256 × 256 像素。
数据增强与归一化
采用数据增强技术以提升模型的泛化能力。实施了水平翻转、垂直翻转以及在±15°范围内的随机旋转。伽马校正和对数变换的实施概率均为0.3。像素值使用ImageNet统计量进行归一化处理(均值 = [0.485, 0.456, 0.406],标准差 = [0.229, 0.224, 0.225])。
将所有输入图像调整为 256 × 256 像素:为确保计算效率,所有输入图像均被调整为统一的 256 × 256 像素分辨率。尽管高分辨率图像(例如数据集中 1000 × 1000 像素的图像)包含对病灶边界精确分割至关重要的精细细节和纹理信息,但提高分辨率并未显著提升模型性能。因此,未进一步提高分辨率,以在计算效率与模型准确性之间保持平衡。未来的研究可进一步探讨更高分辨率输入的影响,以确定其在分割精度上的潜在优势是否足以抵消增加的计算成本。必要时,图像被转换为 RGB 格式。预处理后的数据保存在结构化的目录中,同时保留原始数据集的划分方式。
HMP-MUNet 架构实现
网络架构设计
HMP-MUNet 采用如图1所示的层次化U形编码器-解码器结构进行配置。该网络在编码器各级中配置了逐步增加的通道数:8→16→32→64→128→256 个通道。
通过将网络深度从四个层次结构级别减少到两个,实现了显著的架构改进,这有助于简化模型并提高计算效率。尽管深度降低,但每一层的通道维度均有所增加,使网络能够捕获更丰富且更具表达力的特征。为进一步增强模型的特征学习能力,引入了注意力机制,使网络能够聚焦于多尺度下最相关的特征。这些注意力机制有效弥补了因网络架构变浅而可能导致的层次化特征抽象能力的损失。
编码器通过双 Conv2D 操作初始化,用于从输入张量 X(C, H×W) 中提取初始特征。实现了三个专用模块的交替结构:基于高阶视觉 Mamba 的切换方案(H-VSS)、并行多深度灵活网络(PMFlex)以及多尺度扩张注意力融合网络(MSDAFN)。
该模型采用ImageNet的统计量(均值和标准差)进行归一化处理,避免了针对每个数据集重新计算,从而提高了计算效率。通过利用ImageNet在计算机视觉任务中的广泛应用,该方法确保了模型的稳定性和泛化能力。这一选择简化了模型设计,降低了预处理的复杂性,同时增强了跨数据集的可迁移性,使模型能够有效泛化到多种多样的皮肤病变图像上。
基于高阶视觉Mamba的切换方案(H-VSS)实现
H-VSS 模块根据图2中的架构实现。层归一化(LN)和 Hardswish 激活函数(HS)通过残差连接进行配置,如公式(1)所示:

局部空间描述符(LSD)组件被用于保持空间一致性。空间选择性二维扫描(SS2D)模块根据公式(2)配置了多方向扫描模式:
![figure-protocol-2 静力平衡方程,Y=Pro(SS2D[X⨀LSD(Y)]),以数学公式形式展示。](/files/ftp_upload/69449/69449eq2.jpg)
根据公式(3)的规定,多层感知机(MLP)处理增加了残差连接:

高阶二维选择性扫描(H-SS2D)机制将输入特征投影到2C维空间,以增强上下文建模能力。
并行多深度柔性网络(PMFlex)实现
根据图3的规格配置了PMFlex模块。对输入特征图X(C, H×W)应用层归一化,然后沿通道维度按照公式(4)分为四个段:

每个分割特征 Y_i 均通过共享的视觉 Mamba(VMamba)模块进行处理。处理后的输出被拼接,并通过层归一化和投影进行优化,如公式(5)所述:

多尺度扩张注意力融合网络(MSDAFN)的实现
MSDAFN 模块按照图 4 的架构实现。并行卷积操作根据公式(6)设置膨胀率为 6、12 和 18,以进行多尺度特征提取:

多尺度特征通过通道拼接进行整合,如公式(7)所述:

采用双重注意力机制进行特征重校准。通道注意力权重通过全局平均池化计算,计算方法如公式(8)所示:

通道注意力加权按公式(9)所述进行应用:

空间注意力通过卷积操作按照公式(10)进行配置:

通道注意力与空间注意力按照公式(11)所述方式进行结合:

训练配置与优化
环境设置
实验环境配置在配备GPU(32 GB显存)的Ubuntu 20.04系统上,安装了Python 3.8、深度学习框架(RRID: SCR_018536)和CUDA 11.8。皮肤病变任务的输入图像尺寸设置为256 × 256像素。
损失函数与优化器配置
为训练优化实现了BceDice损失函数。AdamW优化器的初始学习率设置为0.001,批量大小为8,训练轮数为250。采用1 × 10⁻5的权重衰减进行正则化。
对于基线配置,本研究参考了 Liu 等人(2024)关于 Vmamba 模型的研究工作,该模型被用作医学图像分类任务的视觉状态空间模型11。实现 Vmamba 所采用的具体配置和脚本均基于其已发表的研究成果,并针对本研究进行了调整,以更好地适应医学影像数据集。
使用余弦退火配合热重启的方法设置学习率调度。初始重启周期 T_0 设为 10 个训练周期,周期倍增系数 T_mult 设为 2,最小学习率 η_min 设为 1 × 10⁻6。
超参数优化
为确保实验的可重复性和一致性,所有实验均使用固定的随机种子42进行。系统性超参数优化重点关注批量大小、学习率和丢弃路径率。评估的批量大小包括4、8、16和32。测试的学习率包括0.0005、0.001、0.0015和0.002。使用Dice相似性系数(DSC)作为主要指标来监测验证性能。在显存小于32 GB的GPU上,批量大小超过8可能导致内存溢出。
模型评估与性能评价
评估指标配置
采用了综合评估指标,包括平均交并比(mIoU)、Dice相似系数(DSC)、敏感性(Sen)、特异性(Spe)和准确率(Acc)。这些指标按以下公式进行计算:
平均交并比(mIoU)用于量化预测分割结果与真实标注分割之间的重叠程度:

Dice 相似性系数(DSC)用于衡量分割结果的一致性。其取值范围为 0 到 1,数值越高表示性能越好:

灵敏度(Sen)用于衡量模型检测阳性样本的能力:

特异性(Spe)用于评估对阴性样本的正确识别能力:

准确率(Acc)用于衡量整体预测的正确性:

参数(M)反映模型的复杂度,表示可训练参数的总量:

其中 Pi 表示第 i 层中的参数数量,N 为总层数。参数数量越少,表明模型更轻量,适合临床部署。
消融研究方案
进行了全面的消融实验,以验证按照实验设计的架构组件贡献 在 表1评估了四种架构变体:H-MUNet(无MSDAFN和PMFlex的基线模型)、HP-MUNet(无MSDAFN)、HM-MUNet(无PMFlex)和HMP-MUNet(完整模型)。
所有变体均采用相同的训练参数:学习率为 0.001,批量大小为 8,训练 250 个周期。监测了训练的收敛情况,并对每个组件添加后的性能提升进行了验证。
计算效率分析
对不同架构的计算效率指标(包括参数量、浮点运算次数和推理时间)进行了测量。在标准临床级 GPU 上对模型推理时间的评估表明,尽管该模型在高性能 GPU 上表现最佳,但在更常用的硬件上速度大约慢 70%。尽管如此,其仍具备高效的推理速度,适合实际临床部署。在训练过程中监控 GPU 显存使用情况,以确保系统稳定性。建议批处理大小为 8 时,GPU 显存至少 16 GB。
验证与分析
性能基准测试
HMP-MUNet 在两个数据集上的性能均与最先进的方法进行了比较。所有对比模型均在相同的数据划分、预处理、数据增强和训练协议下进行实现和训练,以确保性能差异仅源于网络架构的不同。定量结果显示,在 ISIC2018 和 PH2 数据集上的 DSC 分别提升了 2.89% 和 5.25%。研究证实,与 U-Net 基线相比,模型参数量减少了 4.55 倍。
统计分析
采用配对t检验进行统计显著性检验,以比较性能。对报告的指标计算了置信区间。通过使用不同随机种子进行多次训练运行,确保了结果的可重复性。
最优超参数配置记录为批量大小8和学习率0.001,在PH2数据集上实现了0.9585的最高DSC,在ISIC2018数据集上实现了0.9044的最高DSC,实验结果中已记录。确保了充足的验证数据以防止过拟合。通过监测验证损失曲线来应用早停准则。
访问受限。请登录或开始试用以查看此内容。
用于医学图像分割的 HMP-MUNet 架构设计
所提出的HMP-MUNet架构在皮肤病变自动分割任务中表现出卓越的性能。图1展示了完整的网络架构,呈现出从8到256通道逐步扩展的层次化U形编码器-解码器结构。三种专用模块以交替方式集成,被证明在捕获局部形态特征和全局上下文信息方面非常有效,这对于精确勾画病变边界至关重要。
实验验证表明,经过改进的U形设计在深度减小(从四个层级减少到两个层级)的情况下,成功保持了特征提取能力,同时显著降低了计算开销。用于初始特征提取的双重Conv2D操作有效处理了尺寸为256 × 256 × 3像素的输入张量,为后续处理阶段建立了稳健的基础特征。结合多尺度空洞注意力融合网络(MSDAFN)、空间注意力模块(SAB)和通道注意力模块(CAB)增强的跳跃连接,在信息流保留方面表现出优于传统U-Net架构的性能。
基于高阶视觉Mamba...
访问受限。请登录或开始试用以查看此内容。
本研究提出了HMP-MUNet(高阶多尺度并行视觉Mamba U-Net),这是一种新颖的深度学习框架,通过将状态空间模型(State-Space Models, SSMs)与先进的架构组件进行创新性融合,解决了皮肤病变分割中计算机辅助诊断(CAD)所面临的基本挑战1。本文所述方法表明,将高阶特征交互机制与多尺度注意力及并行处理相结合,可在显著降低计算开销的同时实现更优的诊断准确性——这是临床部署的关键要求。该框架成功弥合了先进人工智能(AI)能力与实际临床适用性之间的差距,在PH2数据集上实现了95.85%的Dice相似性系数(DSC)(95%置信区间:[95.5%, 96.2%]),在ISIC2018数据集上达到90.44%(95%置信区间:[89.9%, 90.9%]),优于现有的视觉Mamba架构,且参数量减少了72.2%。根据配对t检验结果,上述提升具有统计学显著性,PH2和ISIC2018数据集的p值分别为0.004和0.0311。如图4和
访问受限。请登录或开始试用以查看此内容。
作者声明,他们与本研究无任何利益冲突。作者与任何可能不当影响本稿件所述工作的商业实体之间不存在财务关系。本研究独立开展,研究结果和结论仅为作者个人观点。由于英语并非作者的母语,本稿件的文字在撰写过程中借助了 ChatGPT 进行修改和润色。作者确认,人工智能辅助仅限于语言编辑,未涉及任何可能影响本工作科学完整性的内容生成或分析。
作者衷心感谢辽宁省教育厅科学研究项目(项目编号:LJ212510149013)和辽宁省自然科学基金面上项目(项目编号:2024-MSLH-377)提供的经费支持,这些资助使本研究得以顺利开展。我们感谢参与本研究的研究对象以及相关机构,他们为本研究所使用的公开数据集作出了贡献,从而实现了对本文所提出方法的全面验证。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CUDA 11.8 | NVIDIA Corporation, Santa Clara, CA, USA | 软件 | |
| GPU(32 GB VRAM) | NVIDIA | 操作系统 | |
| ISIC2017 数据集 | ISIC 挑战赛 | https://challenge.isic-archive.com/data | 数据集 |
| ISIC2018 数据集 | ISIC 挑战赛 | https://challenge.isic-archive.com/data | 数据集 |
| NVIDIA V100 GPU | NVIDIA Corporation, Santa Clara, CA, USA | 硬件 | |
| PH2 数据集 | 波尔图大学 | https://www.fc.up.pt/addi/ph2 | 数据集 |
| Python 3.8 | Python | RRID:SCR_018536 | 软件 |
| PyTorch 1.13.0 | PyTorch | RRID:SCR_018536 | 软件 |
| Ubuntu 20.04 | Canonical | 硬件 |
访问受限。请登录或开始试用以查看此内容。