本研究提出了一种轻量级U-Net变体,通过混合卷积与通道注意力机制提升了分割精度,在MoNuseg和GlaS数据集上以更少的参数实现了最先进的性能。
方法文章
本研究提出了一种轻量级U-Net变体,通过混合卷积与通道注意力机制提升了分割精度,在MoNuseg和GlaS数据集上以更少的参数实现了最先进的性能。
近年来,基于人工神经网络的计算机图像处理技术迅速发展,并在多个领域得到广泛应用。在医学图像处理中,UNet 及其变体在病灶检测、细胞分割和息肉分割任务中表现出色。本研究提出了一种改进的U形网络,通过减小网络深度并增加网络通道,减少网络参数,从而增强模型的学习能力。为弥补因深度压缩导致的学习能力下降,引入了一种混合通道卷积模块,以替代原网络中的卷积模块。该模型在逐层卷积层与逐点卷积层之间引入了通道注意力机制,以提升实际的通道特征提取能力。文章还指出,采用混合深度卷积可有效解决分割目标尺寸跨度大导致单一模型难以适配多个数据集的问题。所提出的模型在两个广泛使用的公开数据集 MoNuseg 和 GlaS 上均取得了最先进的结果,平均 Dice 系数分别提升了 1.0% 和 1.37%。改进后模型的总参数量减少至 1.71M,相较于拥有 65.6M 参数的 UCtransNet 减少了 38.6 倍。
医学图像分割在多种临床应用中至关重要,包括疾病诊断、治疗规划和病情监测。基于特征工程算法的传统图像处理方法已不再适用于处理现代医疗环境中产生的大量数据。幸运的是,人工神经网络技术的进步以及计算机硬件性能的提升,使得训练和部署大规模神经网络模型成为可能。因此,基于机器学习模型的计算机视觉处理算法正在不断被开发并应用于各个领域。
在医学图像语义分割中最具代表性的模型结构是具有编码-解码架构的UNet1。该模型首先使用多级编码器从输入图像中提取不同尺度的特征,然后解码器在逐步上采样的同时,结合对应层级编码器输出的语义特征作为跳跃连接。然而,通过应用多种方法,UNet架构的性能还可进一步提升。例如,注意力机制已被证明在提升卷积神经网络性能方面具有显著效果。这些机制能够有选择性地增强输入数据中的关键特征,从而实现更优的表征学习和分割精度。
目前,许多研究人员致力于在解码阶段有效融合编码器提取的特征。UNet 的一些最常见变体包括 Attention UNet2、Recurrent UNet3 和 V-Net4。这些方法采用注意力机制5(例如空间注意力),以突出特征图中的信息丰富区域,并抑制无信息区域。此外,一些变体引入了循环神经网络,以建模医学图像的序列特性并提升特征表示能力。预训练模型(如 VGG6、ResNet7 和 DenseNet8)已被广泛用于提升 U 形网络的性能,利用其从大规模数据集中学习到的丰富知识。此外,Transformer 机制(如自注意力和多头注意力)被引入以建模长距离依赖关系,并捕获全局上下文信息,从而实现更优的分割性能。
然而,尽管这些变体相较于原始的 UNet1 有所改进,但在处理具有不同尺度和形状的复杂医学图像时仍存在一定的局限性。此外,这些变体复杂性的增加通常导致更高的计算成本和更长的训练时间,从而限制了其在实际应用中的适用性。
为了增强UNet1架构,提出了一种名为MixKNet(混合卷积核尺寸U形网络)的改进模型,该模型通过减少网络深度并增加通道数量来提升学习能力。然而,深度的降低可能导致整体性能下降。为缓解这一问题,引入了一种混合通道卷积模块,以替代原有的卷积神经模块。该模块在深度可分离卷积和逐点卷积层之间嵌入了通道注意力机制,旨在增强模型提取有效通道特征的能力。
为了指导实际应用,需要注意的是,该方法在规模相对较小的医学图像数据集上进行了评估,单个图像的分辨率范围为 500 × 500 至 1000 × 1000 像素。在模型训练过程中,所有图像均被调整为 224 × 224 像素。实验在单块 NVIDIA RTX 3090 GPU 上使用 PyTorch 实现。这些操作参数表明,该方法在计算上适用于中等规模的实验设置,并可适应有限的数据集规模。
综上所述,本文提出了一种对U型网络结构的新型改进,引入了混合通道卷积模块以及通道注意力机制,二者均显著提升了在医学图像数据集上的分割性能。本研究的主要贡献如下:(1)提出一种改进的U型网络结构,其中采用混合深度可分离卷积模块替代原有的卷积神经模块;(2)在深度可分离卷积层与逐点卷积层之间引入通道注意力机制,以增强模型对有效通道特征的提取能力;(3)在MoNuseg9细胞核分割数据集上,以显著更少的模型参数(相较于具有64M参数的UCtransNet10)同时在两个常用公开数据集上达到了最先进的性能,并在GlaS11腺体分割数据集上实现了性能提升。
本文其余部分组织如下。第2步全面回顾了关于UNet1及其在医学图像分割中各种变体的先前研究,分析了现有方法的优势与局限性,并综述了注意力机制、混合深度可分离卷积网络及其在分割模型中应用的相关工作。第3步详细描述了所提出的MixKNet模型的架构,包括对UNet结构的改进、通道注意力机制的引入以及混合深度卷积的使用。第4步报告了大量实验的结果,并结合讨论和消融实验对各个组件的贡献进行了评估。最后,第5步总结了本文内容,并展望了未来研究的潜在方向。
本节首先回顾了UNet及其变体在医学图像分割领域的先前研究,概述了现有方法的优势与局限性。此外,还讨论了注意力机制的相关研究及其在分割模型中的应用。同时探讨了近期利用深度可分离卷积技术提升分割性能的研究进展。在图1中展示了所提出的MixKNet (c) 与其他模型的对比分析,其中虚线表示跳跃连接。
UNet 及其变体
UNet 架构最初由 Ronneberger 等人于 2015 年提出1,此后被广泛应用于医学图像分割。该模型由编码路径和解码路径组成。编码器从输入图像中提取高层特征,而解码器则对特征进行上采样并融合,以生成分割图。此后,研究者对 UNet 架构进行了多种改进,以提升其在医学图像分割中的性能。其中最常见的改进之一是引入跳跃连接,已被证明可提高分割的准确性。Zhou 等人12提出了一种采用密集跳跃连接的 UNet 变体,使模型能够更好地保留空间信息。
对UNet架构的另一种流行改进是引入注意力机制。这些机制能够帮助模型选择性地突出最重要的特征,从而提升表征学习能力和分割精度。一些包含注意力机制的变体包括Attention UNet2、带注意力门的ResUNet13以及带注意力门的Dense-UNet14。除了上述改进之外,已有许多其他UNet架构变体被提出用于医学图像分割。UCTransNet10是一种结合了跳跃连接和Transformer模块的U-Net变体。UCTransNet10从通道维度重新设计了跳跃连接,从而实现更优的特征重用并减少参数数量。Transformer模块的引入旨在捕捉长距离依赖关系,提升转换性能。UCTransNet10在多个机器翻译基准任务上已展现出最先进的性能。Zihan等人提出了一种名为LViT15的深度学习模型,并将其应用于医学图像分析任务。为了扩展LViT15的半监督版本并弥补图像数据的质量缺陷,他们提出了指数伪标签迭代机制(Exponential Pseudo Label Iteration, EPI)。此外,为了保留图像的局部特征,他们还提出了像素级注意力模块(Pixel-Level Attention Module, PLAM),该模块可选择性地关注重要的图像特征。
注意力机制
注意力机制在机器学习领域得到了广泛研究,尤其在自然语言处理和计算机视觉中。近年来,注意力机制也被应用于医学图像分析任务,包括图像分割。Bahdanau 等人16在神经机器翻译中引入了注意力机制,以提升翻译质量。该机制使模型能够有选择性地关注输入序列中的相关部分,从而提高翻译准确性。自此之后,多种注意力机制被提出并用于图像分析任务。其中一种常见的注意力机制是空间注意力机制,它根据每个像素在特征图中的重要性为其分配权重。例如,Guo 等人17提出了一种用于视网膜血管分割任务的空间注意力机制。该机制利用门控机制调节空间特征的权重,增强模型区分血管与非血管像素的能力。另一种注意力机制是通道注意力机制,其重点在于调整跨通道特征图的权重。Hu 等人18提出了一种“压缩-激励网络”(squeeze-and-excitation network, SENet),通过对特征图施加通道级注意力,提升了图像分类任务的性能。最近,注意力机制还与卷积神经网络(CNNs)结合,用于图像分割任务。例如,Chen 等人19提出了一种注意力引导网络,用于脑肿瘤分割,该网络融合了空间注意力和通道注意力机制。
在医学图像分析和遥感领域,半监督学习与多模态学习的最新进展已展现出显著的性能提升。Yang 等人20提出了UMSCS,一种新颖的非配对多模态分割框架,该框架结合了跨模态生成学习与半监督策略。Zhang 等人引入了多项前沿技术:一种用于半监督分割的证据增强三分支一致性模型21,一种用于医学图像分割的自感知与跨样本原型学习框架22,以及一种面向航空航天领域合成孔径雷达(SAR)干扰识别的时频感知分层特征优化方法23。这些研究共同凸显了混合监督与领域感知特征建模在医学与工程成像任务中的重要性。
逐深度卷积
逐深度卷积旨在捕捉输入特征图的通道间相关性,已被证明可提高卷积神经网络的效率和准确性。
最早的、最具影响力的逐层卷积模型之一是 Howard 等人于 2017 年提出的 MobileNet24。MobileNet 采用逐层可分离卷积,即先进行逐层卷积,再进行逐点卷积,以减少卷积层所需的参数数量和计算量。这使得 MobileNet 在图像分类任务上能够达到最先进的精度,同时使用的参数量远少于传统的卷积神经网络。自 MobileNet 提出以来,已有多种其他逐层卷积架构被提出,包括 ShuffleNet25、Xception26 和 ResNeXt27。这些模型在逐层卷积的具体实现上有所不同,但共同目标都是在保持或提升精度的同时,降低卷积层的计算复杂度。逐层卷积还被应用于语义分割任务中,例如 PSPNet28 使用逐层可分离卷积来降低大规模卷积层的计算和内存需求。MixNet29 进一步扩展了逐层卷积的思想,引入了混合逐层卷积,利用多种卷积核尺寸来捕获不同尺度的特征。研究表明,MixNet 在保持参数量和浮点运算量(FLOPs)相当的情况下,性能优于其他最先进的模型。这些模型在多种语义分割任务上均展现出相较于传统卷积神经网络的显著精度与效率提升。
访问受限。请登录或开始试用以查看此内容。
本节介绍了用于医学图像分割的MixKNet架构。MixKNet模型在UNet架构的基础上进行了扩展,引入了注意力机制和混合深度可分离卷积层。本研究中使用的软件列于材料表中。
1. 整体结构
2. 扁平U形
注意:降低神经网络架构的深度可减少计算复杂性和模型大小,但需注意这可能会降低学习复杂数据表示的能力。
3. 编码器的混合卷积核大小
4. 通道注意力
5. 数据集
注意:本研究使用了两个公开可用的医学图像数据集,如表1和表2所示:GlaS(Sirinukunwattana 等人11)和 MoNuSeg(Kumar 等人9)。
6. 实施细节
访问受限。请登录或开始试用以查看此内容。
与现有最先进方法的比较
MixKNet 架构在两个医学图像分割数据集 GlaS 和 MoNuSeg 上进行了评估,并与该领域的现有最先进方法进行了对比。评估通过报告所提出方法及若干可比模型的 dice 分数和 IoU 分数进行,结果如表3所示。结果表明,MixKNet 架构优于其他模型,在两个数据集上均取得了最高的平均 dice 分数和 IoU 分数。在 GlaS11 数据集上,所提出的 MixKNet 达到了 91.18% 的平均 dice 分数和 84.51% 的平均 IoU 分数,均高于其他任何模型。在 MoNuSeg9 数据集上,所提出的 MixKNet 同样取得了最高的平均 dice 分数(80.45%)和 IoU 分数(67.55%)。这些结果表明,MixKNet 架构在医学图像分割中具有很高的有效性,并优于现有的最先进方法。值得注意的是,从图5和图6可以看出,Mix...
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种用于医学图像分割的 UNet1 架构新改进模型 MixKNet,通过融合混合深度卷积和通道注意力机制,在显著降低计算复杂度的同时提升了分割性能。混合通道卷积将多个卷积核结合,分别作用于不同的通道组。该设计使网络能够在同一层内不同感受野尺度上捕获多样化的空间和上下文特征,从而增强模型对局部和全局结构的表征能力。与标准卷积对所有通道进行统一处理的方式不同,这种混合策略以极小的计算代价增加实现了更高的表征灵活性。
同时,通道注意力的引入使模型能够根据特征图的相关性对其进行自适应重加权。理论上,该机制作为一种动态特征选择方法,可抑制信息量较少的激活,增强更为关键的激活。通过建模通道间的依赖关系,通道注意力促进了更优的梯度流动和更聚焦的特征学习,这在具有精细结构的复杂分割任务中尤为有益。
提出这些改进是为了在模型效率与分割精度之间取得平衡,尤其是在复杂的医学图像任务中。该方案的关键步骤包括数据预处理、模型架构设计、采用自适应学习率调度进行训练,以及在两个基准数据集 GlaS...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在竞争性财务利益或其他利益冲突。
宁波市2023年度第二批社会公益研究项目:基于本体与自然语言处理的电信网络诈骗识别关键技术研究与应用(2023S169)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Linux 操作系统 (Ubuntu 22.04) | 多种(开源社区) | 不适用(版本 22.04 LTS) | 用于开发的开源操作系统 https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | 用于深度学习的高性能 GPU https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python 软件基金会 | 不适用(版本 ≥ 3.8) | 用于人工智能/机器学习开发的编程语言 https://www.python.org/ |
| PyTorch | Meta AI | 不适用(版本 1.13) | 开源机器学习框架 https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | 不适用 | 轻量级且功能强大的代码编辑器 https://code.visualstudio.com/ |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可