本方案描述了一种高效的多器官分割方法,称为Swin-PSAxialNet,该方法相较于以往的分割方法具有优异的准确性。该流程的关键步骤包括数据集收集、环境配置、数据预处理、模型训练与比较,以及消融实验。
方法文章
本方案描述了一种高效的多器官分割方法,称为Swin-PSAxialNet,该方法相较于以往的分割方法具有优异的准确性。该流程的关键步骤包括数据集收集、环境配置、数据预处理、模型训练与比较,以及消融实验。
腹部多器官分割是医学图像分析领域中最重要的课题之一,在支持疾病诊断和治疗规划等临床工作流程中发挥着重要作用。本研究提出了一种基于nnU-Net架构的高效多器官分割方法Swin-PSAxialNet,专门用于CT图像中11个腹部器官的精确分割。 与nnU-Net相比,所提出的网络进行了以下改进:首先,引入了空间到深度(Space-to-depth, SPD)模块和参数共享的轴向注意力(parameter-shared axial attention, PSAA)特征提取模块,增强了三维图像特征提取能力;其次,采用多尺度图像融合方法以捕捉细节信息和空间特征,提升了对细微特征和边缘特征的提取能力;最后,引入参数共享策略,以降低模型的计算成本并提高训练速度。 该网络在涉及11个器官的分割任务中达到了平均 Dice 系数 0.93342。实验结果表明,Swin-PSAxialNet 显著优于此前主流的分割方法。该方法在主要腹部器官的分割中表现出优异的准确性和较低的计算成本。
当前的临床干预,包括疾病诊断、治疗方案制定以及治疗效果追踪,均依赖于医学图像的精确分割1。然而,腹部器官之间复杂的结构关系2使得实现多个腹部器官的准确分割成为一项具有挑战性的任务3。在过去的几十年中,医学成像与计算机视觉技术的蓬勃发展,为腹部多器官分割领域带来了新的机遇与挑战。先进的磁共振成像(MRI)4和计算机断层扫描(CT)技术5使我们能够获取高分辨率的腹部图像。从CT图像中对多个器官进行精确分割,对于肝脏、肾脏、脾脏、胰腺等重要器官的评估与治疗具有重要的临床价值6,7,8,9,10。然而,对这些解剖结构的手动标注,尤其是需要放射科医生或放射肿瘤科医生参与的操作,既耗时又容易受到主观因素的影响11。因此,迫切需要开发自动化且精确的腹部多器官分割方法。
以往的图像分割研究主要依赖卷积神经网络(CNN),通过堆叠网络层并引入 ResNet12 来提高分割效率。2020 年,谷歌研究团队提出了视觉 Transformer(VIT)模型13,首次成功将 Transformer 架构引入传统视觉领域,用于多种视觉任务14。卷积操作只能关注局部特征信息,而 Transformer 中的注意力机制则能够全面考虑全局特征信息。
鉴于基于Transformer的架构在性能上优于传统的卷积网络15,许多研究团队已广泛开展研究,致力于优化Transformer与卷积网络各自优势之间的协同作用16,17,18,19。Chen等人提出了用于医学图像分割任务的TransUNet模型16,该模型利用Transformer从图像中提取全局特征。然而,由于网络训练成本较高,且未能有效利用特征提取的层次化结构概念,Transformer的优势尚未得到充分发挥。
为了解决这些问题,许多研究人员开始尝试将Transformer作为训练分割网络的主干架构。Liu等人17提出了Swin Transformer,该模型采用分层构建方法进行多层级特征提取。该研究提出了窗口多头自注意力机制(Windows Multi-Head Self-Attention, W-MSA),显著降低了计算成本,尤其是在存在较大浅层特征图的情况下。尽管该方法减少了计算需求,但也导致了不同窗口之间信息传递的隔离。为解决这一问题,作者进一步引入了移位窗口多头自注意力机制(Shifted Windows Multi-Head Self-Attention, SW-MSA),实现了相邻窗口之间的信息传播。在此方法基础上,Cao等人提出了Swin-UNet18,将U-Net中的二维卷积替换为Swin模块,并在编码和解码过程中引入W-MSA和SW-MSA,取得了令人满意的分割效果。
相反,Zhou 等人强调,在处理高分辨率图像时,卷积操作的优势不容忽视19。他们提出的 nnFormer 采用基于局部三维图像块的自注意力计算方法,构建出一种具有十字形结构的 Transformer 模型。基于局部三维块的注意力机制显著降低了网络的训练负担。
鉴于上述研究存在的问题,本文提出了一种用于三维医学图像分割的高效混合分层结构,称为 Swin-PSAxialNet。该方法引入了一种下采样模块——空间到深度(Space-to-depth, SPD)20 模块,能够提取全局信息21。此外,还加入了一种参数共享的轴向注意力(parameter shared axial attention, PSAA)模块,可将学习参数数量从二次级降低至线性级,从而有效提升网络训练的准确性,并降低训练模型的复杂度22。
Swin-PSAxialNet 网络
该网络的整体架构采用 nnU-Net23 的 U 形结构,由编码器和解码器结构组成。这些结构负责局部特征提取,并对来自大尺度和小尺度图像的特征进行拼接,如图 1所示。

图 1:Swin-PSAxialNet 网络架构示意图。 请点击此处查看此图的放大版本。
在编码器结构中,传统的卷积模块(Conv block)与SPD模块20相结合,构成一个下采样单元。编码器的第一层引入了Patch Embedding模块,该模块将三维数据划分为三维图像块
,其中(P1, P2, P3) 表示此处的非重叠图像块,
表示三维图像块的序列长度。在嵌入层之后,下一步是一个非重叠的卷积下采样单元,该单元由卷积模块和SPD模块共同组成。在此结构中,卷积模块的步幅设为1,SPD模块用于图像缩放,从而实现分辨率降低为原来的四分之一,同时通道数增加为原来的两倍。
在解码器结构中,瓶颈特征层之后的每个上采样模块均由一个上采样模块和一个PSAA模块组合而成。在每两个解码阶段之间,特征图的分辨率提高两倍,通道数减半。为了恢复空间信息并增强特征表示,在上采样模块之间执行大尺度与小尺度图像之间的特征融合。最终,上采样结果被输入至输出头层,以恢复原始图像尺寸,输出尺寸为(H × W × D × C,C = 3)。
SPD 模块架构
在传统方法中,下采样部分采用步长为 2 的单一卷积操作。这种方法在图像的局部位置进行卷积池化,限制了感受野,使模型只能从微小图像块中提取特征。本文所采用的方法利用 SPD 模块,将原始图像在三维空间中进行精细划分。原始的三维图像沿 x、y 和 z 轴方向被均匀分割,生成四个子体积块。(图 2)随后,通过“cat”操作将这四个子体积块进行拼接,所得图像再经过 1 × 1 × 1 卷积,从而获得下采样后的图像20。

图 2:SPD 模块框图。 请点击此处查看此图的放大版本。
PSAA 模块架构
与传统的卷积神经网络(CNN)相比,所提出的 PSAA 模块在全局信息聚焦方面更加有效,同时在网络学习与训练中也更具效率,从而能够捕获更丰富的图像与空间特征。PSAA 模块包含基于参数共享的三维轴向注意力学习机制,这三个维度分别为:高度(Height)、宽度(Width)和深度(Depth)。相较于传统注意力机制对图像中每个像素单独进行注意力学习,该方法在三个维度上分别独立地执行注意力学习,使自注意力的计算复杂度从二次级降低至线性级。此外,该模块采用可学习的键-查询(keys-queries)参数共享机制,使网络能够在三个维度上并行执行注意力机制运算,从而实现更快、更优且更有效的特征表征。
本方案已获得南通大学伦理委员会批准。该方案涉及利用人工智能技术对获得的无创或微创多模态数据进行智能评估与研究,包括人体医学影像、肢体运动和血管成像数据。图3展示了多器官分割的整体流程图。所有必要的网络链接均列在材料表中。

图3:多器官分割的整体流程图。 请点击此处查看此图的放大版本。
1. 数据集收集
2. 环境配置
3. 数据预处理
4. 模型训练与比较
注意:作为图像分割领域广泛使用的基线方法,nnU-Net23 在本研究中被用作基准模型。具体模型比较过程如下。
5. 消融实验
本方案采用两个指标来评估模型:Dice 相似性分数(DSC)和 95% 豪斯多夫距离(HD95)。DSC 用于衡量体素分割预测结果与真实标签之间的重叠程度,而 95% HD 则用于评估体素分割预测边界与真实标签边界的重叠情况,并过滤掉 5% 的离群值。DSC26 的定义如下:
(1)
其中,T 和 P 分别表示所有体素的真值和预测值。95% HD26 的定义如下:
(2)
其中,dT,P, 表示真实体素与预测体素之间最大 HD95 的第95百分位距离,而 dT,P, 表示预测体素与真实体素之间最大 HD95 的第95百分位距离。
在表1中,Swin-PSAxialNet 与多种主流多器官分割算法进行了比较。结果表明,所提出的算法在腹部器官分割性能方面有所提升。该分割方法的 Dice 准确率比其他方法的平均 Dice 值高出 2-3 个百分点,甚至比 nnFormer 高出 1 个百分点。Swin-PSAxialNet 在边界分割方面也表现出较高的准确性,其平均 HD95 系数为 5.63,是所有对比算法中最低的。
| 方法 | Lkn | Spl | Liv | Pan | Aro | Bla | Sto | Gbd | Pos | Eso | Rkn | 平均值 | ||
| DSC | HD95 | |||||||||||||
| nnU-Net | 96.3 | 96.8 | 97.21 | 85.2 | 95.22 | 86.57 | 91.47 | 84.7 | 91.79 | 82.5 | 95.44 | 91.2 | 7.13 | |
| Swin-Unet | 96.03 | 96.68 | 97.22 | 85.74 | 95.3 | 87.82 | 91.77 | 84.64 | 91.67 | 83.26 | 96.14 | 91.48 | 9.68 | |
| TransUNet | 96.42 | 96.74 | 97.05 | 85.09 | 94.86 | 85.2 | 91.81 | 83.33 | 91.52 | 82.22 | 96.12 | 90.94 | 13.77 | |
| UNETR | 95.94 | 96.48 | 96.85 | 84.14 | 94.62 | 85.01 | 90.18 | 81.16 | 90.79 | 80.34 | 95.15 | 90.06 | 12.92 | |
| nnFormer | 96.59 | 97.22 | 97.33 | 86.79 | 95.31 | 89.74 | 92.82 | 84.88 | 92.43 | 84.24 | 96.32 | 92.15 | 6.59 | |
| Swin-PSAxialNet | 96.85 | 97.67 | 97.64 | 88.39 | 95.97 | 92.03 | 94.4 | 87.78 | 93.15 | 86.24 | 96.59 | 93.34 | 5.63 | |
表1:主流分割算法的比较。 缩写代表以下器官:Lkn 表示左肾,Spl 表示脾脏,Liv 表示肝脏,Pan 表示胰腺,Aro 表示主动脉,Bla 表示膀胱,Sto 表示胃,Gbd 表示胆囊,Pos 表示下腔静脉,Eso 表示食管,Rkn 表示右肾,DSC 表示平均 Dice 系数,HD95 表示平均 95% Hausdorff 距离。
此外,参数共享机制的引入以及对 Transformer 结构的改进,在模型复杂度和推理速度方面均带来了显著优势(表 2、图 4 和 图 5)。
| 模型 | 参数量 (M) | 浮点运算量 (G) | 推理时间 (s) |
| nn-Unet | 17.96 | 398.54 | 9.07 |
| UNETR | 89.58 | 39.67 | 12.51 |
| nnFormer | 134.78 | 152.43 | 11.24 |
| Swin-PSAxialNet | 37.64 | 43.15 | 10.31 |
表2:网络模型指标比较表。

图4:模型训练网络的 Dice 变化曲线。(A)当前网络。(B)nnFormer。(C)nnU-Net。(D)UNETR。请点击此处查看该图的放大版本。

图5:模型训练结果对比。 该图展示了当前网络的结果、nnFormer的结果、nnU-Net的结果以及UNETR的结果。请点击此处查看此图的放大版本。
本研究对算法网络进行了全面的消融实验,以PSAA模块和SPD模块作为变量,比较了单折训练与五折训练的效果。实验结果的Dice系数如表3所示。结果表明,与未修改的nnU-Net相比,使用SPD模块进行下采样、PSAA模块进行上采样能有效提升分割性能(图6)。
| 模型 | 整个网络的 PSAA 模块 | 整个网络的 SPD 模块 | 仅上采样部分使用 PSAA 模块 | 上采样部分使用 PSAA 模块,并采用 SPD |
| 单次折叠训练 | 92.17 | 90.51 | 92.24 | 92.39 |
| 五次折叠训练 | 92.82 | 91.26 | 92.79 | 93.34 |
表3:Swin-PSAxialNet消融实验的结果。 展示了Swin-PSAxialNet的消融实验结果。在消融实验中,比较了PSAA模块和SPD模块的使用情况,表中列出了DSC的训练结果。

图6:分割结果。 请点击此处查看此图的放大版本。
腹部器官的分割是一项复杂的工作。与其他人体内部结构(如大脑或心脏)相比,由于CT图像中对比度较低且器官形态变化较大,腹部器官的分割显得更具挑战性27,28。本文提出Swin-PSAxialNet以解决这一难题。
在数据收集步骤中,本研究从AMOS2022官方网站下载了200张图像24。在环境配置步骤中,实验环境包括Paddlepaddle框架及其对应的CUDA版本。在数据预处理步骤中,采用了随机裁剪和随机翻转以增强数据的鲁棒性。在模型训练与比较步骤中,基于基线模型nnU-Net,实验引入了SPD Block用于下采样,并引入PSAA特征提取模块用于上采样,取得了优异的分割效果。Swin-PSAxialNet与多种主流分割模型进行了比较,在公开数据集AMOS2022上表现出良好的性能,其分割精度高于本研究中提到的其他分割方法16,17,18,19。在消融实验部分,通过调整PSAA模块和SPD模块的使用方式,以寻找最优的分割网络结构。消融实验结果表明,仅在上采样阶段使用PSAA模块,其性能比在整个网络中使用该模块高出一个百分点。
本研究的创新之处如下:首先,将SPD模块引入网络,与Conv模块共同构成下采样单元,从而增强网络的特征提取能力。其次,引入PSAA特征提取模块,有效降低了网络复杂度,同时提高了训练精度。最后,引入参数共享机制,显著降低了训练模型的复杂性。
本研究在以下方面存在局限性:仅应用于AMOS2022数据集,尚未在其他数据集上验证结果。此外,尽管nnU-Net作为自动化分割框架经过一系列优化后在腹部器官分割任务中已取得较高性能,但部分参数仍具有一定的主观性,例如初始学习率、迭代次数、网络结构等。未来的研究将探索这些参数的自动计算方法29。
Swin-PSAxialNet 在腹部器官分割任务中取得了优异的分割效果,表现出强大的泛化能力和稳定性。在未来的研究中,将引入更多数据集以进一步探究该算法的泛化能力,并对模型进行相应调整。此外,该算法的结构还可进一步优化,以提升网络的整体精度和鲁棒性。目标是将该网络与多模态能力相结合,将其发展为一种医学多模态模型。
作者声明无利益冲突。
本研究得到了江苏省“333工程”项目([2022]21-003)、无锡市卫生健康委员会一般项目(M202205)以及无锡市科技发展基金(Y20212002-1)的资助,这些支持对本工作的顺利完成至关重要。" 作者感谢所有研究助理和研究参与者提供的支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AMOS2022 数据集 | 无 | 无 | 用于网络训练和测试的数据集。网络链接为:https://pan.baidu.com/s/1x2ZW5FiZtVap0er55Wk4VQ?pwd=xhpb |
| ASUS 主机 | ASUS | https://www.asusparts.eu/en/asus-13020-01910200 | |
| CUDA 版本 11.7 | NVIDIA | https://developer.nvidia.com/cuda-11-7-0-download-archive | |
| NVIDIA GeForce RTX 3090 | NVIDIA | https://www.nvidia.com/en-in/geforce/graphics-cards/30-series/rtx-3090-3090ti/ | |
| Paddlepaddle 环境 | Baidu | 无 | 网络训练的环境准备。网络链接为:https://www.paddlepaddle.org.cn/ |
| PaddleSeg | Baidu | 无 | 我们使用的基线模型:https://github.com/PaddlePaddle/PaddleSeg |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可