本方案描述了如何构建、训练和评估一种多视角视觉Mamba U形网络框架,用于医学图像分割,通过标准化的数据集准备、模型实现和性能评估,实现皮肤病变和腹部器官的可重复分割。
方法文章
本方案描述了如何构建、训练和评估一种多视角视觉Mamba U形网络框架,用于医学图像分割,通过标准化的数据集准备、模型实现和性能评估,实现皮肤病变和腹部器官的可重复分割。
医学图像分割需要计算方法能够准确捕捉全局上下文、局部边界以及多尺度解剖结构,同时在不同应用中保持可重复性。本文介绍了一种用于二维医学图像分割的多视图视觉Mamba U形网络框架的构建、训练与评估方案。该方案提供了一个可重复的工作流程,包括公开数据集获取、图像与掩膜预处理、网络构建、模型训练、检查点选择,以及定量与定性性能评估。该框架引入多视图特征扫描,以捕获互补的空间、轮廓、尺度和边界信息,并在U形编码器-解码器架构中应用多阶段特征融合,以提升分割过程中的特征整合能力。本方案通过公开的皮肤病变和腹部器官分割数据集进行演示。在所述的实现工作流程下,该框架在标准评估指标上表现出具有竞争力的分割性能。通过遵循本方案中提供的步骤,研究人员可复现模型实现,使用既定的实验设置训练网络,评估分割性能,并将该工作流程适配于需要可重复的基于深度学习分析的相关医学图像分割任务。
医学图像分割是计算机视觉和医学图像分析领域的基本任务1,2,3。该任务旨在将图像划分为多个区域或对象,以便进行进一步的分析和处理。这项技术在医学影像中尤为重要,因为它有助于临床医生识别和定位病灶区域,从而提高诊断准确性和治疗规划水平。随着磁共振成像(MRI)、计算机断层扫描(CT)和正电子发射断层扫描(PET)等医学成像技术的发展,对精确医学图像分割技术的需求持续增长。目前的医学图像分割方法大致可分为三类:基于卷积神经网络(CNN)的方法4、基于Transformer的方法5,以及基于状态空间模型(SSM)的方法6,7。基于CNN的方法通常采用U形网络结构进行医学图像分割。该类别中最广泛使用的架构是U-Net8,它验证了U形编码器-解码器结构在生物医学图像分割中的有效性。U-Net3+结合了UNet++9中的密集跳跃连接和全尺度跳跃连接,以增强多尺度特征聚合能力。然而,基于CNN的方法在捕捉长距离依赖关系方面能力有限,因此可能无法有效建模长距离上下文信息。
基于Transformer的方法通过自注意力机制有效捕捉长距离依赖关系,该机制支持并行计算,并为不同感兴趣区域分配不同的注意力权重。UNETR++10引入了高效的配对注意力(Efficient Paired Attention, EPA)模块,以减少参数数量和计算成本。nnFormer11结合了交错的卷积操作与自注意力操作,并提出了一种基于局部-全局体数据的自注意力机制,用于学习三维(3D)医学图像分割中的体素表示。H2Former12提出了一种高效的分层混合视觉Transformer,其在编码器中将注意力机制与基于CNN的特征提取相结合。然而,随着序列长度的增加,基于Transformer的方法表现出二次方的计算复杂度,导致计算成本显著升高。图1展示了MVM-UNet的设计动机,并将所提出的多视图扫描策略与现有的基于SSM的分割框架进行了比较。

图 1.MVM-UNet 与现有纯状态空间模型(SSM)分割架构的对比。 传统基于纯状态空间模型(SSM)的分割框架与所提出的多视角 Mamba U-Net(MVM-UNet)架构之间的对比。上方面板展示了 MVM-UNet,其中多视角四方向(MV4D)模块利用锯齿形、层次化、螺旋形和径向扫描对提取互补特征,并通过空间融合 Mamba(SFusion Mamba)进行整合;同时,多阶段融合 Mamba(MFusion Mamba)在解码前聚合多尺度编码器特征。下方面板展示了一种典型的基于纯 SSM 的架构,该架构采用带交叉扫描的二维选择性扫描(SS2D)模块。该图突出了传统基于 SSM 的分割网络与所提出的 MVM-UNet 在结构上的差异。请点击此处查看此图的放大版本。
基于SSM的方法结合了Transformer的全局建模能力与线性计算复杂度。Mamba架构利用选择性状态空间模型(Selective-SSM)选择性地处理输入信息,使模型能够根据输入动态调整参数,同时过滤无关信息并突出重要特征。Vim13 和 VMamba14 将Mamba架构适配于计算机视觉任务。U-Mamba15 采用混合CNN–SSM架构,探索SSM在医学图像分割中的应用,而Mamba-UNet16 则采用完全基于SSM的编码器-解码器架构进行医学图像分割。这些方法在使用显著更少参数的同时,达到了具有竞争力的性能。然而,当前基于SSM/Mamba的方法主要通过简单的图像块和SS2D扫描策略提取图像特征,这在医学图像分割中存在若干局限性。首先,SS2D和基于图像块的技术主要针对通用计算机视觉任务设计。Local Mamba17 和 Motion Mamba18 已指出,SS2D扫描策略并不适用于所有视觉任务,因为不同的扫描策略捕获不同类型的视觉信息。其次,SS2D扫描策略相对简单,仅依赖水平和垂直扫描方向,因此可能无法充分捕捉复杂的空间关系和精细的结构细节。医学图像分割需要同时建模全局空间上下文和精确的局部解剖特征。此外,当前基于SSM/Mamba的方法在编码器与解码器之间的特征融合能力有限。UNet++和FATNet等架构通过增强特征融合提高了分割精度,凸显了有效特征整合在医学图像分割中的重要性。
为解决这些局限性,本文提出了一种基于 Mamba 的新型医学图像分割框架,称为 MVM-UNet。如图1所示,所提出的多视角四方向(MV4D)模块是 MVM-UNet 的核心特征提取组件,专为医学图像分割设计,通过融合四种不同扫描策略的信息来实现。每种扫描策略提取互补的图像特征,并表示输入图像的不同视角。Zigzag 扫描19在每一行或列的末端交替遍历方向,从而平衡局部与全局空间信息。相比之下,螺旋和径向扫描策略20通过从中心向外扩展或从边缘向内延伸,实现全面覆盖。分层扫描18在多个尺度上捕获局部和全局特征。为提高每种扫描策略的鲁棒性,在输入 S6 Block 前先将扫描对进行合并。随后,扫描视角融合 Mamba(SFusion Mamba)模块整合来自四种扫描模式提取的特征。为有效利用多尺度编码器特征,本文进一步提出多尺度 Mamba 融合模块(MFusion Mamba),该模块在将融合后的特征传递给解码器之前,累积并融合每个编码器阶段的输出。MVM-UNet 在 ISIC 2017、ISIC 2018 和 Synapse 数据集上进行了评估。实验结果表明,MVM-UNet 在 ISIC 2017、ISIC 2018 和 Synapse 数据集上均取得了具有竞争力的分割性能。
具有代表性的分割架构进一步推动了医学图像分割的发展。U-Net 已成功应用于细胞计数、检测和形态测量等生物医学图像分析任务21。基于注意力机制增强的卷积神经网络架构(如 CA-Net22)通过综合性的注意力机制提升了特征表示能力。典型的基于 Transformer 的分割框架,包括 TransUNet23、Pyramid Medical Transformer24、Swin U-Net25、TransAttUNet26 和 TransCUNet27,进一步证明了基于注意力的全局特征建模在医学图像分割中的有效性。
MVM-UNet 的设计源于现有基于 SSM/Mamba 的分割方法存在的两个局限性。首先,当前许多视觉 Mamba 模型依赖于简单的二维扫描策略,这在处理包含不规则病灶边界、小目标区域和多尺度解剖结构的医学图像时可能表现不足。其次,传统的 U 形编码器-解码器架构主要通过对应的跳跃连接传递特征,限制了解码过程中对多阶段编码器信息的直接利用。因此,MVM-UNet 引入了 MV4D 以增强多视角空间建模能力,并采用 MFusion Mamba 显式聚合多阶段编码器特征。该设计旨在使基于 Mamba 的长距离建模能力更好地适应医学图像分割的具体需求。
尽管MVM-UNet基于通用的编码器-解码器范式和基于Mamba的序列建模,但其创新之处在于这些组件如何被针对性地改进并整合用于医学图像分割。该框架并非简单地将标准Mamba模块嵌入U形网络主干,而是通过多个面向任务的扫描对分支重新设计了空间建模过程,引入SFusion Mamba以融合特定扫描的表征,通过残差和投影路径增强MVV模块,并在编码器与解码器之间插入MFusion Mamba,以在解码前聚合多阶段的编码器特征。这种架构层面的设计旨在应对医学图像中常见的不规则边界、小目标区域以及多尺度解剖结构。
本方案最适合用于需要同时建模二维医学图像中长距离上下文信息、不规则物体边界以及多尺度解剖结构的分割任务。与基于卷积神经网络(CNN)的分割方法相比,基于 Mamba 的编码器-解码器设计在保留医学图像分割研究人员所熟悉的U形工作流程的同时,提供了有效的上下文建模机制。与基于Transformer的方法相比,所提出的框架避免了二次复杂度自注意力机制的直接使用,适用于希望采用相对高效的序列建模机制实现全局上下文建模的研究人员。因此,本方案适用于皮肤病变分割、腹部器官分割等二维医学图像分割任务,尤其适用于同时依赖全局结构信息与局部边界细节的场景。
该方案在使用前也存在一些应予以考虑的局限性。对于相对简单的分割任务,若轻量级卷积神经网络(CNN)已能提供足够的性能,则可能无需采用本方案。此外,若不进行架构上的调整,本方案并非直接适用于完整的三维体积分割。对于标注数据非常有限、图形处理器(GPU)资源有限,或需要高度可解释的经典模型的研究人员,也应在应用本方案前考虑这些限制条件。总体而言,本方法适用于希望复现并评估一种基于 Mamba 的 U 形分割框架的研究人员,该框架在长距离上下文建模、局部边界表征和多阶段特征融合之间实现了平衡。
主要贡献如下:
1. 本文提出了一种基于 Mamba 的新型医学图像分割框架,称为 MVM-UNet。与直接引入现有基于 SS2D 或标准 Mamba 模块的方法不同,MVM-UNet 引入了 MV4D 模块,从四种互补的扫描配对视角对医学图像特征进行建模,包括之字形、分层式、螺旋形和径向扫描。
2. 本文设计了SFusion Mamba和MVV模块,用于整合特定扫描的表征并增强特征变换。SFusion Mamba融合了来自不同扫描配对分支提取的特征,而MVV模块内的残差分支和上下投影分支则提供了互补的特征通路,以稳定并丰富特征表征。
3. 本文在编码器与解码器之间引入MFusion Mamba作为中间多阶段融合模块。与主要传递同阶段特征的传统跳跃连接不同,MFusion Mamba通过从粗到细的融合方式显式聚合多阶段编码器特征,为解码过程提供更丰富的信息。
4. 大量实验结果表明,所提出的 MVM-UNet 在 ISIC 2017 和 ISIC 2018 数据集上实现了具有竞争力的分割性能,在 Synapse 多器官分割数据集上表现出色。此外,全面的消融实验验证了 MVM-UNet 中各个组件的贡献。
本研究仅使用了公开且去标识化的医学图像数据集,包括 ISIC 2017、ISIC 2018 和 Synapse。本研究未收集任何新的受试者、动物实验对象或可识别的私人医疗记录。本研究所使用的 ISIC 2017 数据集为 ISIC 2017 挑战赛皮肤病变分割数据集,来源于国际皮肤影像协作组织官方挑战赛数据存储库(https://challenge.isic-archive.com/data/#2017)。本研究采用的数据集版本对应于 ISIC 2017 病变分割任务,包含官方提供的训练集、验证集和测试集。该数据集于 2024 年 3 月 15 日下载。本研究所使用的 ISIC 2018 数据集为 ISIC 2018 挑战赛任务 1 病变边界分割数据集,来源于国际皮肤影像协作组织官方挑战赛数据存储库(https://challenge.isic-archive.com/data/#2018)。本研究采用的数据集版本对应于 ISIC 2018 任务 1:病变边界分割。该数据集于 2024 年 7 月 8 日下载。
本研究所使用的 Synapse 数据集为来自 Synapse 仓库的“颅外多图谱标注腹部 CT 数据集”(Multi-Atlas Labeling Beyond the Cranial Vault abdominal CT dataset),获取自编号为 syn3193805 的数据集(https://www.synapse.org/Synapse:syn3193805)。本研究所用数据集对应于广泛使用的包含30例病例的腹部CT多器官分割数据集。下载的压缩包为编号 syn3193805 下的 Abdomen/RawData.zip。在下载时,该仓库未提供独立的版本号、发布标签或带日期的发布标记。按照先前研究中采用的标准划分方式,18例用于训练,12例用于测试。数据划分遵循 TransUNet<sup>23</sup> 所使用的病例列表。具体而言,训练病例为 case0031、case0007、case0009、case0005、case0026、case0039、case0024、case0034、case0033、case0030、case0023、case0040、case0010、case0021、case0006、case0027、case0028 和 case0037,测试病例为 case0008、case0022、case0038、case0036、case0032、case0002、case0029、case0003、case0001、case0004、case0025 和 case0035。该数据集于2024年7月9日下载。由于本研究仅使用公开可用的、去标识化的数据集,未涉及新的人类受试者数据或可识别私人信息的收集,因此本协议中所述的计算实验无需机构审查委员会批准。未获取正式的书面机构豁免认定。若当地机构政策有此要求,研究人员应在对公开可用数据集进行二次分析前获取机构豁免认定。本研究未提供机构伦理豁免编号或正式豁免文件。
1. 数据集的准备
(1)MVM-UNet 架构的构建
此处,C = 96。
∈ ℝB×H×W×K此处,K = 1 用于二分类病变分割,K = 8 用于 Synapse 多器官分割。
图 2.多视图 Mamba U-Net(MVM-UNet)的整体架构。本文提出的多视图 Mamba U-Net(MVM-UNet)架构概览。输入图像被转换为图像块嵌入,并通过四个编码器阶段进行处理,各阶段由图像块合并操作分隔,且包含多视图视觉(MVV)模块。编码器特征由多阶段融合 Mamba(MFusion Mamba)聚合后,通过跳跃连接传递至解码器。解码器通过图像块扩展操作逐步恢复空间分辨率,并经由投影层生成最终的分割图。请点击此处查看该图的放大版本。
3. MV4D 模块的构建

图 3。多视角四方向(MV4D)模块架构。 多视角四方向(MV4D)特征提取模块的结构。输入图像块通过四个互补的扫描对分支进行处理,包括之字形、分层、螺旋和径向扫描。从这四个分支中提取的特征被合并后,利用状态空间模块进行处理,并通过空间融合Mamba(SFusion Mamba)整合,以生成输出特征表示。请点击此处查看该图的放大版本。
4. MVV 区块的构建

图 4.多视角视觉(MVV)模块的结构。 多视角视觉(MVV)模块的结构。该模块包含一个主特征提取分支,该分支由多视角四方向(MV4D)模块以及深度卷积、归一化和线性投影层组成。一个辅助的上下投影分支通过逐元素相乘提供门控特征调制,随后进行残差相加以生成输出特征表示。请点击此处查看该图的放大版本。
5. MFusion Mamba 的构建

图5。多阶段融合Mamba(MFusion Mamba)模块的结构。 多阶段融合Mamba(MFusion Mamba)模块的结构示意图。多尺度编码器特征首先通过粗略融合进行合并,随后经由精细融合模块进一步优化;该模块包含线性投影、一维卷积(Conv1d)、Mamba模块以及特征投影层,最终生成解码器所使用的融合特征表示。请点击此处查看该图的放大版本。
6. 模型训练
7. 模型评估
(2)
(3)
(4)
(5)
(6)8. 损失函数定义
(7)
(8)
(9)
(10)
(11)
1 = 1.0 且
2 = 1.0。对于Synapse数据集,将CE损失和Dice损失的权重均设为1.0,即φ1 = 1.0 且 φ2 = 1.0。9. 可重复性设置与执行
预期结果与解释
当本方案正确实施时,训练好的 MVM-UNet 模型应在多次重复运行中表现出稳定的分割性能,大多数评估指标在不同随机种子下的结果仅存在微小差异。对于 ISIC 2017 和 ISIC 2018 数据集,成功的实验结果表现为较高的 DSC、mIoU、Acc、Sen 和 Spe 数值,同时预测的病灶掩膜能够紧密贴合真实标注的病灶边界(图 6 和图 7)。对于 Synapse 数据集,成功的实验结果表现为前景器官的平均 DSC 值较高,且 HD95 值较低(图 8)。在方案执行过程中,应将定量指标与相应的定性分割结果结合进行解读。若模型虽取得较高的 DSC 值,但存在边界渗漏、小结构遗漏或预测结果碎片化等现象,则应视为仅部分成功,需重新核查预处理流程、检查点选择及推理设置。

图6。在ISIC 2017数据集上的代表性定性分割结果。 在国际皮肤影像协作联盟(International Skin Imaging Collaboration, ISIC)2017皮肤病变分割数据集上获得的代表性定性分割结果。每个示例展示了原始皮肤镜图像(Image)、相应的真值分割掩膜(GT)以及MVM-UNet模型生成的预测结果(Pred)。代表性测试案例展示了模型对不同大小、形态及边界复杂度的病灶的分割性能。请点击此处查看该图的放大版本。

图7。在ISIC 2018数据集上的代表性定性分割结果。 在国际皮肤影像协作联盟(International Skin Imaging Collaboration, ISIC)2018皮肤病变分割数据集上获得的代表性定性分割结果。每个示例展示了原始皮肤镜图像(Image)、相应的真值分割掩膜(GT)以及MVM-UNet模型生成的预测结果(Pred)。代表性测试案例展示了模型在不同病变外观和边界特征下的分割性能。请点击此处查看该图的放大版本。

图8。Synapse多器官计算机断层扫描数据集上的代表性定性分割结果。 在Synapse多图谱标注超越颅腔范围数据集上获得的代表性定性多器官分割结果。每个示例展示了原始计算机断层扫描图像(图像)、相应的真值器官标注(GT)以及MVM-UNet生成的预测结果(Pred)。代表性示例说明了在多个腹部器官上预测分割结果与参考分割结果之间的一致性。请点击此处查看本图的高清版本。
在 ISIC 2017 上的性能表现
为评估 MVM-UNet 的可重复性,所有主要对比实验均使用三个独立的随机种子(1、52 和 100)重复进行,结果以均值 ± 标准差(mean ± SD)表示。统计学显著性通过 Wilcoxon 符号秩检验进行评估,该检验基于 ISIC 2017 和 ISIC 2018 的成对图像级结果以及 Synapse 数据集的成对病例级结果。统计分析采用成对的指标值,而非不同随机种子下的平均值。为确保公平比较,凡可能情况下,均使用官方实现代码,在相同的数据集划分、输入分辨率和评估指标条件下,重新生成以均值 ± 标准差形式报告的结果;而单值结果则直接取自相应的原始出版文献。
MVM-UNet 在 ISIC 2017 皮肤病变分割数据集上进行了评估,并与多种代表性分割方法进行了比较,包括 UNet8,21、TransUNet23、H-vmunet28、MISSFormer30、MaLUNet31、VM-UNet32、UNeXt-S33、HResFormer34、MedScale-Former35、MCAFT36 和 H2Former12(表 1)。在三次独立运行中,MVM-UNet 达到了 80.94 ± 1.01% 的 mIoU、91.32% ± 0.68% 的 DSC、96.58% ± 0.27% 的准确率、98.31% ± 0.23% 的特异性以及 91.65% ± 0.77% 的敏感性。与所评估的方法相比,MVM-UNet 在 mIoU、DSC 和敏感性方面均取得了最高性能。代表性定性分割结果如 图 6 所示,其中预测的掩膜在多个代表性测试图像上均紧密贴合真实病变边界。
| 模型 | 参考文献 | mIoU (%) | DSC (%) | 准确率 (%) | 特异性 (%) | 敏感性 (%) |
| UNet | 8 | 76.98 | 86.99 | 95.65 | 97.43 | 86.82 |
| TransUNet | 23 | 75.32 | 81.23 | 91.45 | 95.77 | 82.63 |
| MaLUNet | 31 | 78.78 | 88.13 | 96.18 | 98.47 | 84.78 |
| VM-UNet | 32 | 80.23 | 89.03 | 96.29 | 97.58 | 89.90 |
| UNeXt-S | 33 | 78.26 | 87.80 | 95.95 | 97.74 | 87.04 |
| HResFormer | 34 | 79.89 ± 1.05 | 88.82 ± 0.65 | 96.25 ± 0.24 | 97.73 ± 0.22 | 87.72 ± 0.79 |
| H-vmunet | 28 | 80.34 ± 1.02 | 90.68 ± 0.55 | 96.42 ± 0.18 | 98.23 ± 0.32 | 88.97 ± 0.88 |
| MISSFormer | 30 | 80.16 ± 0.78 | 89.27 ± 0.61 | 94.36 ± 0.28 | 97.52 ± 0.38 | 87.71 ± 0.69 |
| H2Former | 12 | 80.35 ± 0.95 | 88.56 ± 0.72 | 96.61 ± 0.19 | 98.15 ± 0.14 | 88.21 ± 0.81 |
| MedScale-Former | 35 | 80.31 ± 0.82 | 89.11 ± 0.59 | 95.68 ± 0.33 | 98.24 ± 0.21 | 89.96 ± 0.92 |
| MCAFT | 36 | 80.59 ± 0.93 | 89.27 ± 0.63 | 96.42 ± 0.20 | 97.95 ± 0.17 | 90.05 ± 0.84 |
| MVM-UNet(本研究) | — | 80.94 ± 1.01 | 91.32 ± 0.68 | 96.58 ± 0.27 | 98.31 ± 0.23 | 91.65 ± 0.77 |
表1:在ISIC 2017皮肤病变分割数据集上的性能比较。 MVM-UNet与代表性基于卷积神经网络(CNN)、Transformer和状态空间模型(SSM)的分割方法在平均交并比(mIoU)、Dice相似系数(DSC)、准确率(Acc.)、特异性(Spe.)和敏感性(Sen.)指标上的比较。MVM-UNet的结果以三次独立随机种子实验的均值±标准差形式报告。以单值形式报告的结果均来自相应原始文献的复现。
这些定性示例进一步表明,MVM-UNet 能够准确分割具有不规则边界的较小病灶和较大病灶。在这些代表性示例中,预测的掩膜与相应的真值标注高度一致,并且病灶边界保持完整,几乎无渗漏或碎片化现象。
为了进一步评估观察到的改进是否具有统计学显著性,采用配对的逐图像分割结果进行了Wilcoxon符号秩检验。在mIoU指标上,MVM-UNet相较于MCAFT表现出具有统计学意义的显著提升,p值为0.0114。在DSC指标上,MVM-UNet同样显著优于H-vmunet,p值为0.0031。这些结果表明,在ISIC 2017数据集上观察到的性能提升不太可能归因于随机变异。
总体而言,在ISIC 2017数据集上,MVM-UNet在mIoU、DSC和敏感性指标上的表现均优于其他对比方法(表1)。图6中展示的定性分割示例与这些定量结果一致。
在ISIC 2018上的性能表现
MVM-UNet在ISIC 2018皮肤病变分割数据集上进一步进行了评估,并与一系列具有代表性的分割方法进行了比较,包括UNet8,21、UNet++9、UTNetV237、SANet38、MaLUNet31、VM-UNet32、H-vmunet28、MISSFormer30、H2Former12、HResFormer34、MedScale-Former35和MCAFT36(表2)。在三次独立运行中,MVM-UNet取得了82.47% ± 1.28%的mIoU、90.65% ± 0.94%的DSC、96.02% ± 0.36%的准确率、97.06% ± 0.31%的特异性以及91.80% ± 0.82%的敏感性。这些结果表明,MVM-UNet在不同随机种子下均保持了稳定的性能表现。代表性定性分割结果如图7所示。
| 模型 | 参考文献 | 平均交并比 (%) | Dice 相似系数 (%) | 准确率 (%) | 特异性 (%) | 敏感性 (%) |
| UNet | 8 | 77.86 | 87.55 | 94.05 | 96.69 | 85.86 |
| UNet++ | 9 | 78.31 | 87.83 | 94.02 | 95.75 | 88.65 |
| UTNetV2 | 37 | 78.97 | 88.25 | 94.32 | 96.48 | 87.60 |
| SANet | 38 | 79.52 | 88.59 | 94.39 | 95.97 | 89.46 |
| MaLUNet | 31 | 80.25 | 89.04 | 94.62 | 96.19 | 89.74 |
| VM-UNet | 32 | 81.35 | 89.71 | 94.91 | 96.13 | 91.12 |
| H-vmunet | 28 | 81.93 ± 1.45 | 90.46 ± 0.62 | 95.19 ± 0.30 | 96.82 ± 0.21 | 88.37 ± 1.13 |
| MISSFormer | 30 | 80.27 ± 1.21 | 89.91 ± 0.46 | 94.76 ± 0.27 | 97.22 ± 0.15 | 90.84 ± 1.07 |
| H2Former | 12 | 80.40 ± 0.83 | 90.26 ± 0.73 | 94.89 ± 0.38 | 96.98 ± 0.25 | 91.57 ± 0.54 |
| HResFormer | 34 | 81.12 ± 1.18 | 88.86 ± 0.84 | 94.96 ± 0.33 | 96.43 ± 0.22 | 91.86 ± 1.01 |
| MedScale-Former | 35 | 80.97 ± 0.74 | 90.47 ± 0.68 | 95.02 ± 0.41 | 95.89 ± 0.26 | 90.65 ± 0.92 |
| MCAFT | 36 | 81.46 ± 1.03 | 89.06 ± 0.76 | 95.23 ± 0.29 | 96.72 ± 0.17 | 91.82 ± 0.57 |
| MVM-UNet(本文方法) | — | 82.47 ± 1.28 | 90.65 ± 0.94 | 96.02 ± 0.36 | 97.06 ± 0.31 | 91.80 ± 0.82 |
表2:在ISIC 2018皮肤病变分割数据集上的性能比较。 使用平均交并比(mIoU)、Dice相似性系数(DSC)、准确率(Acc.)、特异性(Spe.)和敏感性(Sen.)对MVM-UNet与具有代表性的基于CNN、Transformer和SSM的分割方法进行比较。MVM-UNet的结果以三次独立随机种子实验的均值±标准差形式报告。以单值形式报告的结果均来自相应原始文献的复现数据。
与H-vmunet相比,MVM-UNet的mIoU提高了0.54%。与MedScale-Former相比,MVM-UNet的DSC提高了0.18%。MVM-UNet在所有对比方法中也取得了最高的准确率。图中所示的代表性定性示例 图7 准确分割具有代表性的皮肤病变区域,包括小病灶区域及边界不规则的病变。
对于 ISIC 2018 数据集,采用 Wilcoxon 符号秩检验基于成对的逐图像分割结果来评估统计学显著性。在 mIoU 指标上,MVM-UNet 相较于 MCAFT 实现了具有统计学意义的显著提升,p 值为 < 0.001。这些结果表明,在 ISIC 2018 上观察到的性能提升不太可能归因于随机变异。
总体而言,在ISIC 2018数据集上,MVM-UNet在所比较的方法中取得了最高的mIoU、DSC和准确率(表2)。图7中展示的定性示例与这些定量结果的提升一致。
在 Synapse 数据集上的性能
本研究提出的方法还在 Synapse 多器官分割数据集上进行了评估,并与一系列代表性方法进行了比较,包括 UNet8,21、Attention U-Net39、TransUNet23、TransNorm40、Swin U-Net25、TransDeepLab41、MEW-UNet42、MISSFormer30、H2Former12、HResFormer34、MedScale-Former35 和 MCAFT36(表 3)。Synapse 数据集包含八个腹部器官:主动脉、胆囊、脾脏、左肾、右肾、肝脏、胰腺和胃。按照标准实验协议,使用 18 个病例(共 2,212 张轴向切片)进行训练,12 个病例(共 1,567 张轴向切片)用于测试。未单独设置验证集。测试病例仅用于最终评估,不参与模型训练、超参数调优或模型选择。代表性多器官分割的定性结果如 图 8 所示,定量比较结果汇总于 表 3。
| 模型 | 参考文献 | DSC | HD95 | 主动脉 | 胆囊 | 左肾 | 右肾 | 肝脏 | 胰腺 | 脾脏 | 胃 |
| UNet | 8 | 76.85 | 39.78 | 89.07 | 69.72 | 77.77 | 68.69 | 93.43 | 54.01 | 86.66 | 75.59 |
| Att-UNet | 39 | 77.77 | 36.02 | 89.54 | 68.88 | 77.98 | 71.11 | 93.57 | 58.04 | 87.31 | 75.74 |
| TransUNet | 23 | 77.48 | 31.69 | 87.23 | 63.13 | 81.87 | 77.02 | 94.08 | 55.84 | 85.06 | 75.62 |
| TransNorm | 40 | 78.4 | 30.25 | 86.23 | 65.18 | 82.18 | 78.63 | 94.22 | 55.32 | 89.53 | 76.02 |
| Swin U-Net | 25 | 79.13 | 21.55 | 85.47 | 66.53 | 83.28 | 79.61 | 94.29 | 56.58 | 90.62 | 76.59 |
| TransDeepLab | 41 | 80.16 | 21.25 | 86.04 | 69.16 | 84.08 | 79.88 | 93.53 | 61.15 | 89.01 | 78.36 |
| MEW-UNet | 42 | 78.92 | 21.68 | 86.68 | 65.32 | 82.87 | 80.02 | 93.63 | 58.38 | 90.16 | 74.27 |
| MISSFormer | 30 | 80.92 ± 4.23 | 20.09 ± 1.89 | 86.43 ± 0.98 | 69.81 ± 4.56 | 84.29 ± 2.11 | 81.03 ± 3.34 | 93.85 ± 0.89 | 61.11 ± 4.67 | 90.05 ± 3.78 | 80.62 ± 1.02 |
| H2Former | 12 | 81.05 ± 2.56 | 20.13 ± 7.23 | 86.61 ± 3.21 | 69.32 ± 1.23 | 85.12 ± 4.78 | 82.01 ± 2.89 | 94.09 ± 2.45 | 61.16 ± 0.76 | 89.97 ± 4.12 | 80.94 ± 3.56 |
| HResFormer | 34 | 80.65 ± 4.02 | 17.48 ± 6.89 | 89.16 ± 2.78 | 66.94 ± 0.78 | 84.61 ± 4.34 | 82.15 ± 2.56 | 93.11 ± 1.34 | 59.92 ± 4.12 | 91.08 ± 3.45 | 80.75 ± 2.01 |
| MedScale-Former | 35 | 80.78 ± 1.34 | 20.02 ± 3.78 | 88.79 ± 4.02 | 69.82 ± 2.56 | 85.13 ± 0.87 | 81.63 ± 4.78 | 94.10 ± 2.78 | 60.72 ± 1.89 | 90.14 ± 1.56 | 80.93 ± 4.56 |
| MCAFT | 36 | 81.03 ± 3.45 | 19.98 ± 5.12 | 89.76 ± 0.76 | 68.96 ± 3.89 | 84.54 ± 2.56 | 81.98 ± 3.12 | 94.32 ± 4.01 | 60.85 ± 3.67 | 89.06 ± 4.89 | 80.91 ± 1.78 |
| MVM-UNet(本研究) | — | 81.26 ± 1.89 | 18.72 ± 2.16 | 88.53 ± 3.22 | 69.84 ± 4.23 | 85.37 ± 2.69 | 82.67 ± 1.67 | 94.41 ± 3.56 | 61.02 ± 2.78 | 90.19 ± 0.67 | 81.48 ± 3.12 |
表3:在Synapse多器官分割数据集上的性能比较。 使用Dice相似系数(DSC)、95百分位Hausdorff距离(HD95)以及针对主动脉(Aor.)、胆囊(Gal.)、左肾(Kid. (L))、右肾(Kid. (R))、肝脏(Liv.)、胰腺(Pan.)、脾脏(Spl.)和胃(Sto.)的器官特异性Dice分数,对MVM-UNet与具有代表性的基于CNN、Transformer和SSM的分割方法进行比较。MVM-UNet的结果报告为三次独立随机种子实验的均值±标准差。以单个数值形式报告的结果均来自相应原始文献的复现。
MVM-UNet 在三次独立运行中取得了 81.26% ± 1.89% 的平均 DSC 和 18.72 ± 2.16 的平均 HD95。结果表明,该方法在 Synapse 数据集上具有稳定的分割性能。在所有被评估的方法中,MVM-UNet 取得了最高的平均 DSC 和第二低的平均 HD95。
对于 Synapse 数据集,统计学显著性通过基于成对病例 DSC 值的 Wilcoxon 符号秩检验进行评估。MVM-UNet 相较于 H2Former 表现出具有统计学意义的显著提升,p 值为 0.026,表明在分割性能上的改进具有统计学显著性。
代表性成功与次优结果
图6–8展示了典型的定性成功结果。成功的结果表现为预测的分割掩膜与真实标注高度一致,并能准确勾画出主要病灶或器官的边界。典型的次优结果可能出现在目标非常小、边界对比度低、病灶形状不规则、组织强度对比微弱或解剖结构边界模糊的情况下,通常表现为分割不足、过度分割、边界渗漏或不连续的掩膜碎片。当出现此类结果时,用户应验证图像缩放、归一化、掩膜插值、模型检查点选择、推理阈值设置(针对ISIC数据集)或argmax预测(针对Synapse数据集)以及指标计算流程是否与方案中所述步骤保持一致。
MV4D 模块的消融研究
通过逐步添加锯齿形、分层式、螺旋形和径向扫描对,并随后引入 SFusion Mamba 模块,评估了 MV4D 模块的贡献(表 4;图 9)。仅使用锯齿形扫描对时,分割性能有限。加入分层式扫描对后,性能显著提升,表明引入多尺度信息具有优势。进一步添加螺旋形和径向扫描对,通过增强轮廓和边界表征,进一步提高了分割性能。引入 SFusion Mamba 模块后,在所有评估的配置中达到了最高性能。
| 模型 | Zigzag 扫描对 | 分层扫描对 | 螺旋扫描对 | 径向扫描对 | SFusion Mamba | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | 56.75 | 72.46 | 58.03 | 73.45 | ||||
| MVM-UNet | ✓ | ✓ | 72.38 | 84.01 | 73.45 | 84.7 | |||
| MVM-UNet | ✓ | ✓ | ✓ | 75.69 | 86.20 | 76.94 | 86.94 | ||
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | 76.41 | 86.61 | 78.28 | 87.82 | |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | ✓ | 80.94 | 91.32 | 82.47 | 90.65 |
表4: 多视角四向(MV4D)模块的消融研究。 通过逐步引入分层、螺旋和径向扫描对,以及空间融合Mamba(SFusion Mamba)模块,在基线之字形扫描对架构上的性能表现。在ISIC 2017和ISIC 2018数据集上的性能以平均交并比(mIoU)和Dice相似性系数(DSC)进行报告。

图9.多视角四方向(MV4D)模块的消融研究。(A)在基线架构中依次引入分层扫描对、螺旋扫描对、径向扫描对以及空间融合Mamba(SFusion Mamba)后,平均交并比(mIoU)的变化情况。(B)在基线架构中依次引入分层扫描对、螺旋扫描对、径向扫描对以及空间融合Mamba(SFusion Mamba)后,Dice相似性系数(DSC)的变化情况。(C)在第二种实验设置下,在基线架构中依次引入分层扫描对、螺旋扫描对、径向扫描对以及空间融合Mamba(SFusion Mamba)后,mIoU的变化情况。(D)在第二种实验设置下,在基线架构中依次引入分层扫描对、螺旋扫描对、径向扫描对以及空间融合Mamba(SFusion Mamba)后,DSC的变化情况。请点击此处查看该图的放大版本。
在ISIC 2017数据集上,完整的MV4D模块达到了80.94%的mIoU和91.32%的DSC。相应的mIoU和DSC性能趋势分别如图9A和图9B所示。在ISIC 2018数据集上,完整的MV4D模块达到了82.47%的mIoU和90.65%的DSC。相应的性能趋势分别如图9C和图9D所示。
除非另有说明,所有消融实验均使用固定的随机种子100进行,而主要比较结果则基于三个独立的随机种子(1、52和100)报告为平均值±标准差。因此,消融实验的结果旨在在受控的单种子设置下比较各个组件的相对贡献,而不是重现主要比较实验中报告的多种子最终性能。
总体而言,逐步引入额外的扫描配对以及SFusion Mamba模块持续提升了分割性能,完整的MV4D配置在两个数据集上均达到了最高的性能水平。
多视角视觉(MVV)模块的消融研究
通过将基线架构与引入上下投影分支的版本进行比较,对 MVV 模块进行了评估(表5)。在 ISIC 2017 数据集上,引入上下投影分支后,mIoU 从 78.83% 提升至 80.96%,DSC 从 88.15% 提升至 91.02%。在 ISIC 2018 数据集上,mIoU 从 80.32% 提高到 82.46%,DSC 从 89.15% 提高到 90.57%。
| 模型 | 基线 MVV 模块 | 上下投影 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | 78.83 | 88.15 | 80.32 | 89.15 | |
| MVM-UNet | ✓ | ✓ | 80.96 | 91.02 | 82.46 | 90.57 |
表5:多视角视觉(MVV)模块的消融研究。 基线多视角视觉(MVV)模块在有无上下投影分支情况下的性能对比。在ISIC 2017和ISIC 2018数据集上的性能以平均交并比(mIoU)和Dice相似性系数(DSC)表示。
MVV模块消融实验采用固定的随机种子100进行。因此,包含上下投影分支的配置的性能反映了受控单种子消融设置,可能与主比较实验中报告的完整MVM-UNet模型的三种子平均性能略有差异。
总体而言,在两个数据集上,引入上下投影分支均持续提升了分割性能,mIoU 和 DSC 均有所提高。
多阶段融合 Mamba(MFusion Mamba)模块的消融研究
通过比较不同的粗粒度融合策略与精细融合组件的组合,对 MFusion Mamba 模块进行了评估(表6;图10)。在不使用 MFusion Mamba 的情况下,MVM-UNet 在 ISIC 2017 数据集上的 mIoU 为 75.47%,DSC 为 86.01%;在 ISIC 2018 数据集上的 mIoU 为 77.49%,DSC 为 87.29%。在所评估的粗粒度融合策略中,Hadamard 积实现了最大的性能提升。引入精细融合组件后,分割性能进一步提高。完整的 MFusion Mamba 配置在 ISIC 2017 上达到了 80.95% 的 mIoU 和 91.18% 的 DSC,在 ISIC 2018 上达到了 82.51% 的 mIoU 和 90.58% 的 DSC。
| 模型 | 粗粒度融合逐元素最大值 | 粗粒度融合逐元素相加 | 粗粒度融合哈达玛积 | 细粒度融合模块 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | 75.47 | 86.01 | 77.49 | 87.29 | ||||
| MVM-UNet | ✓ | 76.21 | 86.47 | 78.35 | 87.82 | |||
| MVM-UNet | ✓ | 76.83 | 86.86 | 79.11 | 88.30 | |||
| MVM-UNet | ✓ | 78.26 | 87.83 | 80.06 | 88.96 | |||
| MVM-UNet | ✓ | ✓ | 80.95 | 91.18 | 82.51 | 90.58 |
表6:多阶段融合Mamba(MFusion Mamba)模块的消融研究。 不同粗粒度融合策略的性能比较,包括最大值融合(Max)、逐元素相加(⊕)和哈达玛积(⊙),并结合完整的细粒度融合模块。在ISIC 2017和ISIC 2018数据集上,采用平均交并比(mIoU)和Dice相似性系数(DSC)报告性能。

图10.多阶段融合Mamba(MFusion Mamba)模块的消融研究。(A)采用不同的粗粒度融合策略(最大值、逐元素相加和哈达玛积)以及完整的精细融合模块时,所获得的平均交并比(mIoU)变化情况。(B)采用不同的粗粒度融合策略(最大值、逐元素相加和哈达玛积)以及完整的精细融合模块时,所获得的骰子相似性系数(DSC)变化情况。(C)在第二种实验设置下,采用不同的粗粒度融合策略(最大值、逐元素相加和哈达玛积)以及完整的精细融合模块时,所获得的mIoU变化情况。(D)在第二种实验设置下,采用不同的粗粒度融合策略(最大值、逐元素相加和哈达玛积)以及完整的精细融合模块时,所获得的DSC变化情况。请点击此处查看该图的放大版本。
在 ISIC 2017 数据集上,完整的 MFusion Mamba 配置达到了 80.95% 的 mIoU 和 91.18% 的 DSC。相应的 mIoU 与 DSC 性能趋势分别如图 10A和图 10B所示。在 ISIC 2018 数据集上,完整的 MFusion Mamba 配置达到了 82.51% 的 mIoU 和 90.58% 的 DSC。相应的性能趋势分别如图 10C和图 10D所示。MFusion Mamba 的消融实验采用固定的随机种子 100 进行。因此,完整的 MFusion Mamba 配置代表了单种子控制条件下的消融结果,可能与主比较实验中报告的 MVM-UNet 模型三种子平均性能略有差异。
总体而言,逐步引入Hadamard积粗融合策略和精细融合组件持续提升了分割性能,完整的MFusion Mamba配置在两个数据集上均达到了最佳性能。
消融实验总结
在各项消融实验中,逐步引入分层、螺旋和径向扫描对分支,并结合 SFusion Mamba 模块, consistently 提升了分割性能(表 4;图 9)。同样,在 MVV Block 中引入上下投影分支后,在 ISIC 2017 和 ISIC 2018 数据集上的 mIoU 和 DSC 指标均得到改善(表 5)。完整的 MFusion Mamba 配置在所评估的多阶段特征融合策略中也达到了最高性能(表 6;图 10)。
超参数的消融研究
在 ISIC 2017 和 ISIC 2018 数据集上评估了输入尺寸和丢弃率(dropout value)的影响(表7)。比较了三种输入分辨率(256 × 256、384 × 384 和 512 × 512)。在所评估的设置下,256 × 256 的输入分辨率在两个数据集上均实现了最高的分割性能。
| 模型 | 输入尺寸 256 × 256 | 输入尺寸 384 × 384 | 输入尺寸 512 × 512 | Dropout 0.0 | Dropout 0.1 | Dropout 0.2 | Dropout 0.3 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | ✓ | 80.02 | 88.91 | 81.76 | 89.92 | |||||
| MVM-UNet | ✓ | ✓ | 79.96 | 88.87 | 80.97 | 89.47 | |||||
| MVM-UNet | ✓ | ✓ | 77.48 | 87.28 | 78.76 | 88.11 | |||||
| MVM-UNet | ✓ | ✓ | 79.36 | 88.53 | 81.13 | 89.62 | |||||
| MVM-UNet | ✓ | ✓ | 80.94 | 90.15 | 82.49 | 90.50 | |||||
| MVM-UNet | ✓ | ✓ | 79.71 | 88.71 | 80.46 | 89.18 |
表7:输入图像尺寸与dropout值的消融研究。 使用不同输入图像尺寸和dropout值的MVM-UNet性能比较。在ISIC 2017和ISIC 2018数据集上,采用平均交并比(mIoU)和Dice相似系数(DSC)报告分割性能。
还评估了不同的丢弃率值。在测试的配置中,丢弃率值为 0.2 时在两个数据集上均达到了最高的分割性能,因此在主要实验中采用了该值。
编码器-解码器层配置的消融研究
评估了不同的编码器-解码器层配置,以考察网络深度对分割性能和计算成本的影响(表8)。在所评估的配置中,对称结构 {2, 2, 2, 2}-{2, 2, 2, 2} 在保持相对较低模型复杂度的同时,实现了最高的整体分割性能。将网络深度增加至 {2, 2, 9, 2}-{2, 9, 2, 2} 后,分割性能相当,但参数数量和计算成本均有所增加。
| 模型 | 编码器-解码器层配置 | 参数量(百万) | 浮点运算量(十亿) | ISIC 2017 平均交并比(%) | ISIC 2017 Dice 相似系数(%) | ISIC 2018 平均交并比(%) | ISIC 2018 Dice 相似系数(%) |
| MVM-UNet | {2,2,2,1}-{2,2,2,2} | 28.22 | 4.12 | 80.02 | 88.91 | 81.16 | 89.64 |
| MVM-UNet | {2,2,2,2}-{2,2,2,2} | 28.36 | 4.39 | 80.95 | 90.17 | 82.5 | 90.41 |
| MVM-UNet | {2,2,2,3}-{2,3,2,2} | 30.14 | 4.88 | 79.83 | 88.8 | 81.56 | 89.85 |
| MVM-UNet | {2,4,2,2}-{2,2,4,2} | 33.46 | 5.32 | 79.65 | 88.7 | 81.45 | 89.79 |
| MVM-UNet | {2,2,9,2}-{2,9,2,2} | 45.63 | 7.78 | 80.96 | 90.09 | 82.48 | 90.43 |
表8:编码器-解码器层配置的消融研究。 不同编码器-解码器层配置的性能比较。该表报告了模型参数数量(Parameters)、浮点运算次数(FLOPs)、在ISIC 2017和ISIC 2018数据集上的平均交并比(mIoU)以及Dice相似性系数(DSC)。
计算成本比较
在相同的硬件环境和输入分辨率下,对最终的 MVM-UNet 模型与若干代表性基线方法(包括 HResFormer、H-vmunet、MISSFormer、H2Former、MedScale-Former 和 MCAFT)的计算效率进行了比较(表9)。评估指标包括每训练周期耗时、每张图像推理耗时、训练期间峰值 GPU 内存占用、可训练参数数量(Params)以及浮点运算次数(FLOPs)。训练时间指完成一个训练周期所需的时间,推理时间指每张测试图像的平均处理时间,FLOPs 则基于单次前向传播过程进行计算。
| 方法 | 参考文献 | 训练时间(秒/轮次) | 推理时间(毫秒/图像) | 峰值 GPU 显存(GB) | 参数量(百万) | FLOPs(十亿) |
| HResFormer | 34 | 520 | 213.08 | 19.2 | 117.00 | 131.70 |
| H-vmunet | 28 | 88 | 27.00 | 5.0 | 10.74 | 8.97 |
| MISSFormer | 30 | 355 | 92.86 | 12.6 | 42.33 | 109.45 |
| H2Former | 12 | 130 | 29.02 | 8.8 | 33.71 | 33.56 |
| MedScale-Former | 35 | 80 | 23.50 | 5.9 | 4.96 | 3.79 |
| MCAFT | 36 | 145 | 34.00 | 8.7 | 30.00 | 12.00 |
| MVM-UNet (本研究) | — | 104 | 26.80 | 7.9 | 28.36 | 4.39 |
表9:MVM-UNet 与代表性基线方法的计算成本比较。 在相同硬件环境和输入分辨率下计算效率的比较。报告的指标包括每训练周期耗时、每张图像推理耗时、训练期间图形处理器(GPU)峰值内存占用、模型参数数量(Parameters)以及浮点运算次数(FLOPs)。对于有可用实现的方法,在可能的情况下均使用相同的实验环境进行评估。
如表9所示,MVM-UNet 每个训练周期耗时 104 秒,每张图像推理耗时 26.8 毫秒,峰值 GPU 内存占用为 7.9 GB,可训练参数数量为 2836 万,浮点运算量为 4.39 GFLOPs。与 HResFormer、MISSFormer、H2Former 和 MCAFT 相比,MVM-UNet 所需的训练时间更短、推理时间更短、峰值 GPU 内存占用更低,且 FLOPs 更少。与轻量级模型 H-vmunet 和 MedScale-Former 相比,MVM-UNet 的训练时间和内存占用更高,但保持了相当的推理速度,同时计算复杂度相对较低。
数据与代码可用性
ISIC 2017 和 ISIC 2018 数据集可从国际皮肤影像协作组织(International Skin Imaging Collaboration, ISIC)数据库公开获取,Synapse 数据集可从 Synapse 仓库公开获取。数据集获取详情见伦理声明部分。简而言之,ISIC 2017 数据集来自 ISIC 2017 挑战赛官方数据仓库(https://challenge.isic-archive.com/data/#2017),ISIC 2018 数据集来自 ISIC 2018 挑战赛任务1官方数据仓库(https://challenge.isic-archive.com/data/#2018),Synapse 数据集来自 Synapse 仓库,编号为 syn3193805(https://www.synapse.org/Synapse:syn3193805)。相应的下载日期已在伦理声明中注明。MVM-UNet 源代码的初始公开版本可在 https://github.com/LIXUEGUANG002/MVM-UNet 获取。该代码仓库包含模型实现、主要网络模块、配置文件、数据集组织说明、训练脚本和评估脚本。完整的可重复性数据包,包括最终确定的配置文件、完整实验脚本、附加文档以及训练好的模型检查点,将在论文发表后公开提供。
补充表1. 多视图视觉Mamba UNet(MVM-UNet)的逐层架构。 该表总结了MVM-UNet的顺序网络结构,包括输入层、图像块嵌入(patch embedding)、编码器阶段、多视图视觉(MVV)模块、图像块合并操作、多阶段融合Mamba(MFusion Mamba)、解码器阶段、最终上采样以及分割头。对于每个阶段,列出了相应的操作、主要参数和输出特征尺寸。E1–E4表示用于多阶段特征融合的编码器阶段特征图。B、H和W分别表示批量大小、图像高度和图像宽度,K表示输出类别数(皮肤病变二分类分割任务中K = 1,Synapse多类别分割任务中K = 9,包含一个背景类和八个前景器官类)。MFusion Mamba生成融合后的多阶段编码器特征,并在解码器重建过程中与对应的解码器特征进行整合。 请点击此处下载该文件。
补充文件1. 多视角四方向(MV4D)模块与多阶段融合Mamba(MFusion Mamba)的伪代码。 该补充文件展示了MVM-UNet中所使用的两个核心模块的算法流程。算法1描述了多视角四方向(MV4D)模块的完整处理流程,包括特征展平、构建四种扫描对序列(之字形、分层式、螺旋形和径向)、选择性状态空间(S6)处理、扫描视图融合Mamba(SFusion Mamba)以及输出特征图的重建。算法2描述了多阶段融合Mamba(MFusion Mamba)模块,包括多阶段编码器特征对齐、粗粒度融合、细粒度融合、解码器集成以及融合后解码器输入特征的生成。算法中定义了变量和张量维度。 请点击此处下载该文件。
补充代码文件 1. MVM-UNet(MVM-UNet-master)的源代码包。 该补充的 ZIP 压缩包包含本研究中使用的 MVM-UNet 完整源代码实现。该代码包包括网络架构、多视图四向(MV4D)模块和多阶段融合 Mamba(MFusion Mamba)模块、配置文件、用于 ISIC 2017、ISIC 2018 和 Synapse 数据集的训练与评估脚本、实用函数,以及重现本方案中所述实验所需的项目文档。该包还包含一份 README 文件,其中提供了安装说明、软件依赖项、数据集组织方式,以及训练和推理的工作流程。 请点击此处下载该文件。
本方案描述了一种基于 Mamba 架构的医学图像分割框架 MVM-UNet。该方法旨在解决现有分割模型的两个局限性。首先,传统的基于卷积神经网络(CNN)的方法在建模复杂医学图像中的长距离依赖关系和层次化上下文信息方面能力有限43。其次,基于 Transformer 的方法虽能建模全局上下文,但通常需要更高的计算成本23,25。MVM-UNet 采用 Mamba 架构13,14,15,16,17,18,19,20,以实现高效的长距离建模,并引入多视角扫描和多阶段特征融合策略以提升分割精度。从方案执行与可重复性的角度来看,若干步骤对于获得与本研究报道结果相当的效果至关重要。首先,数据集划分、图像缩放、掩码插值、归一化策略及通道转换应与本方案保持一致,因为预处理的差异可能直接影响输入分布和掩码边界。特别地,分割掩码应采用最近邻插值法进行缩放,以避免引入非整数标签值44。其次,在比较结果前,应核对训练配置,包括输入分辨率、批量大小、优化器设置、学习率调度、随机种子、损失权重系数、检查点选择规则以及推理阈值或 argmax 操作。若复现结果明显低于报道值,用户应首先验证数据集路径、标注格式、前景-背景标签约定、检查点加载、验证或测试集划分以及评估指标计算流程。边界泄漏、掩码碎片化或小结构缺失通常提示预处理、掩码插值、检查点选择或推理后处理过程中可能存在不一致。
MVM-UNet 的主要贡献在于 MV4D 模块。与以往基于状态空间模型的架构所采用的简单二维扫描策略14,15,16,17,18,19,20不同,MV4D 采用锯齿形、分层式、螺旋形和径向扫描对来捕获互补的视觉信息。锯齿形扫描对有助于平衡局部与全局空间信息,分层式扫描对增强了多尺度特征提取能力,螺旋形扫描对强化了全局轮廓表示,而径向扫描对则提升了局部边缘和边界特征的提取效果。随后,SFusion Mamba 对这些互补的扫描模态进行融合。代表性结果与消融实验(表4 和 表5;图9)表明,扫描模式的多样性以及融合机制均有助于提升分割性能。另一个重要组件是 MFusion Mamba,它作为编码器与解码器之间的特征融合模块。传统的U形架构,包括 U-Net8,21、V-Net44以及许多后续变体9,23,25,主要通过逐阶段的跳跃连接传递信息。这种策略可能无法充分挖掘多阶段编码器表征之间的互补性。MFusion Mamba 通过在解码前采用粗粒度融合与细粒度融合相结合的方式整合编码器特征,从而克服了这一局限性。代表性结果(表6;图10)显示,MFusion Mamba 能持续提升分割性能,表明显式的多阶段特征融合对医学图像分割具有积极意义。
MVM-UNet 的方法学贡献应被理解为一种架构层面的重新设计,而非从零开始发明每一项具体操作。U形编码器-解码器架构、残差连接、投影层以及Mamba/状态空间模型(SSM)模块在此前的研究中已被广泛探讨8,13,14,15,16,17,18,19,20,21,23,24,25,29,44。然而,直接组合这些组件并不一定能够解决医学图像分割所面临的特定挑战。MVM-UNet 的创新之处在于对三个方面进行协调设计。第一,MV4D 模块以四个互补的扫描对分支取代单一或有限的扫描模式,使模型能够捕捉空间连续性、多尺度结构、全局轮廓信息以及局部边界细节。第二,SFusion Mamba 与 MVV Block 在特征传递至下一网络阶段之前,对其进行特定扫描模式的融合与增强。第三,MFusion Mamba 在解码前显式聚合多阶段编码器特征,以补充传统的跳跃连接8,21,44,提升分层信息的利用效率。消融实验结果(表4–6;图9和图10)进一步支持了该设计思路,表明多视角扫描、特定扫描模式的特征融合、上下投影分支以及多阶段特征融合均对分割性能的提升有所贡献。因此,MVM-UNet 的贡献在于针对医学图像分割任务,实验验证了一种基于 Mamba 的空间建模与编码器-解码器特征融合的专门化整合方案。
尽管MVM-UNet表现出较强的性能,但仍存在若干局限性。首先,分割性能并未随着输入图像尺寸的增大而持续提升,表明当前网络架构可能未能充分挖掘高分辨率图像中的信息。其次,该模型在高噪声或低对比度成像条件下的评估尚不充分,而这些情况在临床实践中经常出现,可能影响分割的鲁棒性。第三,尽管该模型在三个公开可用的数据集上表现良好,但仍需在更大规模、更多样化的医学影像数据集上进行进一步验证。本方案可适配于其他医学图像分割任务,但需谨慎实施若干修改。对于新的二分类分割任务,用户应修改数据集加载器、归一化参数、输入分辨率和前景阈值,同时保持二分类BCE-Dice损失函数及评估流程不变。对于新的多类别分割任务,用户应更新输出类别数量、类别索引映射、独热编码标签转换、CE-Dice损失函数配置以及按类别的评估指标44。对于灰度数据集,应根据具体实现方式,通过采用单通道输入投影或将灰度图像重复三次以构成三通道输入,使输入通道配置与模型架构相匹配。当目标结构极小、边界模糊或不清晰、图像对比度与训练数据差异较大,或目标数据集存在显著域偏移时,该方法可能表现欠佳。在此类情况下,用户可能需要调整输入分辨率、数据增强策略、类别平衡、损失权重或微调计划,同时保持相同的评估协议,以确保比较的公平性。
在 Synapse 数据集上,MVM-UNet 在常用的 18 例训练和 12 例测试划分下实现了较强的多器官分割性能。尽管本研究评估的代表性基线方法中,所提出的方法取得了最高的平均 DSC(表 3),但一些更新的方法在不同的训练设置和评估协议下报告了更高的 Synapse 性能29。因此,我们避免将 MVM-UNet 描述为在 Synapse 上实现了全面的最先进性能,而是将其描述为在所评估的实验设置下实现了较强的性能。这些结果表明,MVM-UNet 的性能源于基于 Mamba 的建模在医学图像分割任务中的任务特异性适应13,14,15,16,17,18,19,20。MVM-UNet 并不依赖单一的扫描策略,而是将视觉特征建模分解为多个互补的扫描视角,并通过 SFusion Mamba 进行融合。此外,MFusion Mamba 通过显式聚合多阶段编码器特征,超越了传统的跳跃连接,从而改善了编码器与解码器之间的信息流动8,21,44。该设计使所提出的模型在二值皮肤病变分割和多器官分割任务中均实现了较强的性能。
未来的研究应聚焦于改进MVM-UNet以实现更高分辨率的医学图像分割。更深层或自适应的多尺度架构可能使模型更有效地利用高分辨率图像信息。后续研究还应评估MVM-UNet在噪声、低对比度以及域偏移成像条件下的鲁棒性。此外,所提出的多视角扫描策略可拓展至其他医学图像分析任务,包括病灶检测4、器官定位、肿瘤分类以及三维分割10,11。综上所述,MVM-UNet为医学图像分割提供了一个高效且可重复的框架。MV4D模块与MFusion Mamba的结合使模型能够捕获互补的空间信息、多尺度上下文、全局轮廓信息、局部边界细节以及多阶段语义特征。在ISIC 2017、ISIC 2018和Synapse数据集上取得的代表性结果验证了所提出架构的有效性。本实验方案为致力于开发基于SSM/Mamba的高效医学图像分割架构的研究人员提供了实用的参考13,14,15,16,17,18,19,20。
作者声明不存在任何竞争性经济利益。
本研究未获得外部资金支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 硬件 - GPU 工作站或 GPU 服务器 | 机构计算平台 / 本地工作站 | 自建本地 GPU 工作站;Ubuntu 22.04.1 操作系统,Linux 内核 6.8.0;Intel Core i9-13900K CPU;NVIDIA A800 GPU;128 GB 内存;512 GB 本地存储。 | 用于训练、验证、测试、消融实验及仅推理实验的计算平台。 |
| 硬件 - 图形处理器(GPU) | NVIDIA Corporation | NVIDIA A800 GPU(80 GB 显存)。 | 用于加速模型训练与推理。 |
| 硬件 - 中央处理器(CPU) | Intel Corporation / AMD | 第 13 代 Intel Core i9-13900K CPU。 | 用于数据加载、预处理和实验执行的主机处理器。 |
| 硬件 - 系统内存(RAM) | 机构计算平台 / 本地工作站 | 128 GB 系统内存 | 用于数据集加载、预处理和训练的内存空间。 |
| 硬件 - 存储设备 | 机构计算平台 / 本地工作站 | 2 TB NVMe 固态硬盘。 | 用于存储数据集、检查点、日志和生成的预测图像。 |
| 软件环境 - 操作系统 | Canonical Ltd. | 推荐:Ubuntu 22.04.1 LTS | 计算环境所使用的操作系统。 |
| 软件环境 - Conda 环境 | Anaconda, Inc. / Miniconda | 环境名称:mvmunet | 用于安装和隔离依赖项的 Python 环境。 |
| 软件环境 - Python | Python Software Foundation | Python 3.8 | 用于实现和执行实验的编程语言。 |
| 软件环境 - CUDA 工具包 | NVIDIA Corporation | CUDA Toolkit 11.8 | PyTorch 和 Mamba 相关包所需的 GPU 计算后端。 |
| 软件环境 - cuDNN | NVIDIA Corporation | cuDNN 8.7.0。 | 通过 PyTorch 使用的 GPU 加速深度学习基础操作。 |
| Python 包 - PyTorch | PyTorch | torch == 2.0.1 | 用于模型训练、损失计算、优化和推理的深度学习框架。 |
| Python 包 - Torchvision | PyTorch | torchvision == 0.14.0 | 在预处理和数据增强中使用的图像变换工具。 |
| Python 包 - Torchaudio | PyTorch | torchaudio == 0.13.0 | 随推荐的 PyTorch 环境一同安装。 |
| Python 包 - timm | timm 开发者 | timm == 0.4.12 | 在代码仓库环境说明中列出的模型组件或工具依赖项。 |
| Python 包 - triton | OpenAI / Triton 开发者 | triton == 2.0.0 | 由 GPU 加速序列建模组件使用的依赖项。 |
| Python 包 - causal-conv1d | causal-conv1d 开发者 | causal_conv1d == 1.0.0 | Mamba 实现所需的高效因果卷积依赖项。 |
| Python 包 - mamba-ssm | Mamba SSM 开发者 | mamba_ssm == 1.0.1 | 用于 Mamba/S6 相关组件的状态空间序列建模包。 |
| Python 包 - NumPy | NumPy 开发者 | NumPy 版本 1.24.3。 | 用于数值计算和数组操作。 |
| Python 包 - SciPy | SciPy 开发者 | SciPy 版本 1.10.1。 | 科学计算包;在 utils.py 中导入了 scipy.ndimage.zoom。 |
| Python 包 - SimpleITK | Insight Software Consortium | SimpleITK 版本 2.2.1。 | 在 utils.py 中导入的医学图像输入/输出和预处理工具。 |
| Python 包 - MedPy | MedPy 开发者 | MedPy 版本 0.4.0。 | 在 utils.py 中导入的医学图像度量计算包。 |
| Python 包 - scikit-image | scikit-image 开发者 | scikit-image 版本 0.21.0。 | 在 README 中列出的图像处理依赖项。 |
| Python 包 - scikit-learn | scikit-learn 开发者 | scikit-learn 版本 1.3.2。 | 在 README 中列出的机器学习工具包。 |
| Python 包 - matplotlib | Matplotlib 开发者 | Matplotlib 版本 3.7.2。 | 用于保存定性可视化图像。 |
| Python 包 - h5py | h5py 开发者 | h5py 版本 3.9.0。 | 为 Synapse 测试数据体提供 HDF5 文件支持。 |
| Python 包 - thop | THOP 开发者 | THOP 版本 0.1.1.post2209072238。 | 用于计算 FLOPs 和参数相关的计算成本。 |
| Python 包 - packaging | Python Packaging Authority | packaging 版本 23.1。 | 在 README 中列出的依赖项。 |
| Python 包 - pytest | pytest 开发者 | pytest 版本 7.4.0。 | 在 README 中列出的依赖项。 |
| Python 包 - chardet | chardet 开发者 | chardet 版本 5.2.0。 | 在 README 中列出的依赖项。 |
| Python 包 - yacs | YACS 开发者 | yacs 版本 0.1.8。 | 在 README 中列出的配置工具依赖项。 |
| Python 包 - termcolor | termcolor 开发者 | termcolor 版本 2.3.0。 | 在 README 中列出的日志/终端工具依赖项。 |
| Python 包 - submitit | submitit 开发者 | submitit 版本 1.4.5。 | 在 README 中列出的实验/任务工具依赖项。 |
| Python 包 - tensorboardX | tensorboardX 开发者 | tensorboardX 版本 2.6.2.2。 | 在 README 中列出的训练日志可视化工具。 |
| Python 包 - ml-collections | ml_collections 开发者 | ml-collections 版本 0.1.1。 | 被 configs/config_setting_synapse.py 导入。 |
| 数据集 - ISIC 2017 挑战赛数据集 | 国际皮肤影像协作组织 | ISIC 2017 皮肤病变分割数据集 | 公开的、去标识化的皮肤镜下皮肤病变图像和掩码,用于二分类分割任务。 |
| 数据集 - ISIC 2018 挑战赛任务 1 数据集 | 国际皮肤影像协作组织 | ISIC 2018 任务 1:病变边界分割 | 公开的、去标识化的皮肤镜下皮肤病变图像和掩码,用于二分类分割任务。 |
| 数据集 - Synapse 多图谱标注(超出颅腔范围)数据集 | Synapse / Sage Bionetworks | 访问编号:syn3193805 | 公开的腹部 CT 多器官分割数据集。 |
| 数据组织 - ISIC 2017 数据文件夹 | 作者 / 代码仓库结构 | data/isic2017/ | 预期的本地文件夹,包含训练和验证图像/掩码。 |
| 数据组织 - ISIC 2018 数据文件夹 | 作者 / 代码仓库结构 | data/isic2018/ | 预期的本地文件夹,包含训练和验证图像/掩码。 |
| 数据组织 - Synapse 数据文件夹 | 作者 / 代码仓库结构 | data/Synapse/ | 预期的本地文件夹,用于存放 Synapse 列表、train_npz 和 test_vol_h5。 |
| 源代码 - MVM-UNet 源代码仓库 | 作者 / GitHub | 分支:master;Git 提交哈希:ee891b42c2f083c4990eed72f1d4463adc5e103e。 | 本协议的完整源代码实现。 |
| 源代码 - ISIC 配置文件 | 作者 | configs/config_setting.py | 用于 ISIC 风格二分类分割的配置文件。 |
| 源代码 - Synapse 配置文件 | 作者 | configs/config_setting_synapse.py | 用于 Synapse 多器官分割的配置文件。 |
| 源代码 - ISIC 训练脚本 | 作者 | train.py | ISIC 风格二分类分割的训练和验证入口点。 |
| 源代码 - Synapse 训练脚本 | 作者 | train_synapse.py | Synapse 多类别分割的训练和验证入口点。 |
| 源代码 - ISIC 引擎文件 | 作者 | engine.py | 用于 ISIC 风格实验的训练/验证引擎。 |
| 源代码 - Synapse 引擎文件 | 作者 | engine_synapse.py | 用于 Synapse 实验的训练/验证引擎。 |
| 源代码 - 损失函数和工具函数 | 作者 | utils.py | 实现随机种子设置、优化器/调度器工具、BCE-DICE 损失、CE-DICE 损失、Dice 损失、数据变换以及定性图像保存功能。 |
| 源代码 - MVM-UNet 架构实现 | 作者 | models/mvmunet/mvmunet.py | MVM-UNet 网络的主要定义。 |
| 源代码 - 自定义模块实现 | 作者 | models/mvmunet/core.py | 实现 MV4D、MVV Block、SFusion Mamba、MFusion Mamba、S6/Mamba 相关组件以及扫描索引生成器。 |
| 训练配置 - ISIC 损失函数 | 作者 / PyTorch | BceDiceLoss(wb=1, wd=1) | 用于皮肤病变二分类分割的组合 BCE-DICE 损失。 |
| 训练配置 - Synapse 损失函数 | 作者 / PyTorch | CeDiceLoss(num_classes=9, loss_weight=[1,1]) | 用于多类别器官分割的组合 CE-DICE 损失。 |
| 训练配置 - 优化器 | PyTorch | AdamW | 默认配置文件中使用的优化器。 |
| 训练配置 - ISIC 学习率调度器 | PyTorch | CosineAnnealingLR | 默认 ISIC 配置中的学习率调度器。 |
| 训练配置 - Synapse 学习率调度器 | PyTorch | CosineAnnealingLR | 默认 Synapse 配置中的学习率调度器。 |
| 训练配置 - 随机种子控制 | 作者 / PyTorch / NumPy | utils.py 中的 set_seed(seed) | 用于设置 Python、NumPy、PyTorch CPU、PyTorch CUDA 和 cuDNN 的确定性行为的函数。 |
| 训练配置 - 混合精度设置 | 作者 / PyTorch | amp = False | 自动混合精度训练标志。 |
| 输出 - 训练结果目录 | 作者 / 代码仓库结构 | results/mvmunet_* | 用于存储检查点、日志和生成输出的目录。 |
| 输出 - 仅推理输出路径 | 作者 / 配置文件 | img_save_path | 在仅推理评估期间保存定性预测图像的目录。 |
| 输出 - 最佳检查点路径 | 作者 / 配置文件 | best_ckpt_path | 用于仅推理评估的检查点路径。 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可