方法文章

MixKNet:一种用于医学图像分割的混合通道卷积U形改进网络

DOI:

10.3791/68450

2025年7月15日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种轻量级U-Net变体,通过混合卷积与通道注意力机制提升了分割精度,在MoNuseg和GlaS数据集上以更少的参数实现了最先进的性能。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

近年来,基于人工神经网络的计算机图像处理技术迅速发展,并在多个领域得到广泛应用。在医学图像处理中,UNet 及其变体在病灶检测、细胞分割和息肉分割任务中表现出色。本研究提出了一种改进的U形网络,通过减小网络深度并增加网络通道,减少网络参数,从而增强模型的学习能力。为弥补因深度压缩导致的学习能力下降,引入了一种混合通道卷积模块,以替代原网络中的卷积模块。该模型在逐层卷积层与逐点卷积层之间引入了通道注意力机制,以提升实际的通道特征提取能力。文章还指出,采用混合深度卷积可有效解决分割目标尺寸跨度大导致单一模型难以适配多个数据集的问题。所提出的模型在两个广泛使用的公开数据集 MoNuseg 和 GlaS 上均取得了最先进的结果,平均 Dice 系数分别提升了 1.0% 和 1.37%。改进后模型的总参数量减少至 1.71M,相较于拥有 65.6M 参数的 UCtransNet 减少了 38.6 倍。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

医学图像分割在多种临床应用中至关重要,包括疾病诊断、治疗规划和病情监测。基于特征工程算法的传统图像处理方法已不再适用于处理现代医疗环境中产生的大量数据。幸运的是,人工神经网络技术的进步以及计算机硬件性能的提升,使得训练和部署大规模神经网络模型成为可能。因此,基于机器学习模型的计算机视觉处理算法正在不断被开发并应用于各个领域。

在医学图像语义分割中最具代表性的模型结构是具有编码-解码架构的UNet1。该模型首先使用多级编码器从输入图像中提取不同尺度的特征,然后解码器在逐步上采样的同时,结合对应层级编码器输出的语义特征作为跳跃连接。然而,通过应用多种方法,UNet架构的性能还可进一步提升。例如,注意力机制已被证明在提升卷积神经网络性能方面具有显著效果。这些机制能够有选择性地增强输入数据中的关键特征,从而实现更优的表征学习和分割精度。

目前,许多研究人员致力于在解码阶段有效融合编码器提取的特征。UNet 的一些最常见变体包括 Attention UNet2、Recurrent UNet3 和 V-Net4。这些方法采用注意力机制5(例如空间注意力),以突出特征图中的信息丰富区域,并抑制无信息区域。此外,一些变体引入了循环神经网络,以建模医学图像的序列特性并提升特征表示能力。预训练模型(如 VGG6、ResNet7 和 DenseNet8)已被广泛用于提升 U 形网络的性能,利用其从大规模数据集中学习到的丰富知识。此外,Transformer 机制(如自注意力和多头注意力)被引入以建模长距离依赖关系,并捕获全局上下文信息,从而实现更优的分割性能。

然而,尽管这些变体相较于原始的 UNet1 有所改进,但在处理具有不同尺度和形状的复杂医学图像时仍存在一定的局限性。此外,这些变体复杂性的增加通常导致更高的计算成本和更长的训练时间,从而限制了其在实际应用中的适用性。

为了增强UNet1架构,提出了一种名为MixKNet(混合卷积核尺寸U形网络)的改进模型,该模型通过减少网络深度并增加通道数量来提升学习能力。然而,深度的降低可能导致整体性能下降。为缓解这一问题,引入了一种混合通道卷积模块,以替代原有的卷积神经模块。该模块在深度可分离卷积和逐点卷积层之间嵌入了通道注意力机制,旨在增强模型提取有效通道特征的能力。

为了指导实际应用,需要注意的是,该方法在规模相对较小的医学图像数据集上进行了评估,单个图像的分辨率范围为 500 × 500 至 1000 × 1000 像素。在模型训练过程中,所有图像均被调整为 224 × 224 像素。实验在单块 NVIDIA RTX 3090 GPU 上使用 PyTorch 实现。这些操作参数表明,该方法在计算上适用于中等规模的实验设置,并可适应有限的数据集规模。

综上所述,本文提出了一种对U型网络结构的新型改进,引入了混合通道卷积模块以及通道注意力机制,二者均显著提升了在医学图像数据集上的分割性能。本研究的主要贡献如下:(1)提出一种改进的U型网络结构,其中采用混合深度可分离卷积模块替代原有的卷积神经模块;(2)在深度可分离卷积层与逐点卷积层之间引入通道注意力机制,以增强模型对有效通道特征的提取能力;(3)在MoNuseg9细胞核分割数据集上,以显著更少的模型参数(相较于具有64M参数的UCtransNet10)同时在两个常用公开数据集上达到了最先进的性能,并在GlaS11腺体分割数据集上实现了性能提升。

本文其余部分组织如下。第2步全面回顾了关于UNet1及其在医学图像分割中各种变体的先前研究,分析了现有方法的优势与局限性,并综述了注意力机制、混合深度可分离卷积网络及其在分割模型中应用的相关工作。第3步详细描述了所提出的MixKNet模型的架构,包括对UNet结构的改进、通道注意力机制的引入以及混合深度卷积的使用。第4步报告了大量实验的结果,并结合讨论和消融实验对各个组件的贡献进行了评估。最后,第5步总结了本文内容,并展望了未来研究的潜在方向。

本节首先回顾了UNet及其变体在医学图像分割领域的先前研究,概述了现有方法的优势与局限性。此外,还讨论了注意力机制的相关研究及其在分割模型中的应用。同时探讨了近期利用深度可分离卷积技术提升分割性能的研究进展。在图1中展示了所提出的MixKNet (c) 与其他模型的对比分析,其中虚线表示跳跃连接。

UNet 及其变体
UNet 架构最初由 Ronneberger 等人于 2015 年提出1,此后被广泛应用于医学图像分割。该模型由编码路径和解码路径组成。编码器从输入图像中提取高层特征,而解码器则对特征进行上采样并融合,以生成分割图。此后,研究者对 UNet 架构进行了多种改进,以提升其在医学图像分割中的性能。其中最常见的改进之一是引入跳跃连接,已被证明可提高分割的准确性。Zhou 等人12提出了一种采用密集跳跃连接的 UNet 变体,使模型能够更好地保留空间信息。

对UNet架构的另一种流行改进是引入注意力机制。这些机制能够帮助模型选择性地突出最重要的特征,从而提升表征学习能力和分割精度。一些包含注意力机制的变体包括Attention UNet2、带注意力门的ResUNet13以及带注意力门的Dense-UNet14。除了上述改进之外,已有许多其他UNet架构变体被提出用于医学图像分割。UCTransNet10是一种结合了跳跃连接和Transformer模块的U-Net变体。UCTransNet10从通道维度重新设计了跳跃连接,从而实现更优的特征重用并减少参数数量。Transformer模块的引入旨在捕捉长距离依赖关系,提升转换性能。UCTransNet10在多个机器翻译基准任务上已展现出最先进的性能。Zihan等人提出了一种名为LViT15的深度学习模型,并将其应用于医学图像分析任务。为了扩展LViT15的半监督版本并弥补图像数据的质量缺陷,他们提出了指数伪标签迭代机制(Exponential Pseudo Label Iteration, EPI)。此外,为了保留图像的局部特征,他们还提出了像素级注意力模块(Pixel-Level Attention Module, PLAM),该模块可选择性地关注重要的图像特征。

注意力机制
注意力机制在机器学习领域得到了广泛研究,尤其在自然语言处理和计算机视觉中。近年来,注意力机制也被应用于医学图像分析任务,包括图像分割。Bahdanau 等人16在神经机器翻译中引入了注意力机制,以提升翻译质量。该机制使模型能够有选择性地关注输入序列中的相关部分,从而提高翻译准确性。自此之后,多种注意力机制被提出并用于图像分析任务。其中一种常见的注意力机制是空间注意力机制,它根据每个像素在特征图中的重要性为其分配权重。例如,Guo 等人17提出了一种用于视网膜血管分割任务的空间注意力机制。该机制利用门控机制调节空间特征的权重,增强模型区分血管与非血管像素的能力。另一种注意力机制是通道注意力机制,其重点在于调整跨通道特征图的权重。Hu 等人18提出了一种“压缩-激励网络”(squeeze-and-excitation network, SENet),通过对特征图施加通道级注意力,提升了图像分类任务的性能。最近,注意力机制还与卷积神经网络(CNNs)结合,用于图像分割任务。例如,Chen 等人19提出了一种注意力引导网络,用于脑肿瘤分割,该网络融合了空间注意力和通道注意力机制。

在医学图像分析和遥感领域,半监督学习与多模态学习的最新进展已展现出显著的性能提升。Yang 等人20提出了UMSCS,一种新颖的非配对多模态分割框架,该框架结合了跨模态生成学习与半监督策略。Zhang 等人引入了多项前沿技术:一种用于半监督分割的证据增强三分支一致性模型21,一种用于医学图像分割的自感知与跨样本原型学习框架22,以及一种面向航空航天领域合成孔径雷达(SAR)干扰识别的时频感知分层特征优化方法23。这些研究共同凸显了混合监督与领域感知特征建模在医学与工程成像任务中的重要性。

逐深度卷积
逐深度卷积旨在捕捉输入特征图的通道间相关性,已被证明可提高卷积神经网络的效率和准确性。

最早的、最具影响力的逐层卷积模型之一是 Howard 等人于 2017 年提出的 MobileNet24。MobileNet 采用逐层可分离卷积,即先进行逐层卷积,再进行逐点卷积,以减少卷积层所需的参数数量和计算量。这使得 MobileNet 在图像分类任务上能够达到最先进的精度,同时使用的参数量远少于传统的卷积神经网络。自 MobileNet 提出以来,已有多种其他逐层卷积架构被提出,包括 ShuffleNet25、Xception26 和 ResNeXt27。这些模型在逐层卷积的具体实现上有所不同,但共同目标都是在保持或提升精度的同时,降低卷积层的计算复杂度。逐层卷积还被应用于语义分割任务中,例如 PSPNet28 使用逐层可分离卷积来降低大规模卷积层的计算和内存需求。MixNet29 进一步扩展了逐层卷积的思想,引入了混合逐层卷积,利用多种卷积核尺寸来捕获不同尺度的特征。研究表明,MixNet 在保持参数量和浮点运算量(FLOPs)相当的情况下,性能优于其他最先进的模型。这些模型在多种语义分割任务上均展现出相较于传统卷积神经网络的显著精度与效率提升。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本节介绍了用于医学图像分割的MixKNet架构。MixKNet模型在UNet架构的基础上进行了扩展,引入了注意力机制和混合深度可分离卷积层。本研究中使用的软件列于材料表中。

1. 整体结构

  1. 图2所示,MixKNet 架构遵循标准的 UNet 结构,由编码器和解码器组成。将输入尺寸设置为 224 × 224 × 3。在编码器中,使用两个 DownBlock 模块——每个模块包含一个 1×1 深度可分离卷积、一个 2×2 最大池化层,以及一个多核卷积(MDConv),其卷积核大小可选为 [1, 3, 5] 或 [3-13]。
  2. 在解码器中,使用两个 UpBlock 模块——每个模块执行双线性上采样、跳跃连接拼接、一个 1×1 深度可分离卷积,以及一个多核卷积。
  3. 在每个卷积模块后使用 ReLU 激活函数。应用一个最终的 1×1 卷积以生成输出,对于二分类分割任务,其后接 Sigmoid 激活函数;对于多分类任务,则不添加激活函数,交由外部 Softmax 处理。

2. 扁平U形

注意:降低神经网络架构的深度可减少计算复杂性和模型大小,但需注意这可能会降低学习复杂数据表示的能力。

  1. 将一个四层的UNet架构简化为两层版本,如图3所示,在保留核心编码和解码组件的同时减少模型参数数量。
    1. 通过从编码器和解码器路径中移除第3层和第4层来构建扁平化架构,并保留第2层的特征连接。
    2. 相应地调整下采样和上采样操作,以匹配减少后的深度——仅在瓶颈前使用一次下采样,在瓶颈后使用一次上采样。
      注意:深度的降低可能会削弱模型的学习能力,因为它可能无法捕捉输入与输出之间的复杂关系。增加每一层模型中基础卷积通道的数量有助于克服这一限制,从而提升模型学习判别性特征的能力。更多的卷积通道使模型能够捕捉输入数据中更复杂的模式和关系,弥补深度减少带来的影响,并提升性能。
  2. 需注意,增加卷积通道数量也可能提高模型的计算复杂度和内存占用,从而在训练和推理速度方面形成权衡。应在模型容量与计算效率之间找到适当的平衡。

3. 编码器的混合卷积核大小

  1. 为提升编码器性能,在DC-CA(深度可分离卷积与通道注意力)模块中采用混合卷积核尺寸方法,如图4所示。不依赖单一卷积核尺寸,而是并行使用多个不同卷积核尺寸(例如1、3、5、7、9、11、13)的深度可分离卷积,以在多个感受野尺度上提取特征。
  2. 在拼接前,对每个分支分别应用批归一化和ReLU激活函数,并沿通道维度拼接各卷积核分支的输出结果。
  3. 拼接后使用逐点1×1卷积融合特征,并将其投影到固定数量的输出通道,以保持与下一层预期输入尺寸的一致性。
    注意:混合深度可分离卷积层由多个具有不同卷积核尺寸的深度可分离卷积组成,后接一个逐点卷积。该设计能够捕获多尺度特征,这在医学图像分割任务中至关重要。第一个模块采用三种卷积核尺寸——1、3和5,以扩大感受野;第二个模块则使用更大的卷积核尺寸和更多分组,具体为3、5、7、9、11和13。

4. 通道注意力

  1. 在DC-CA模块中集成通道注意力机制以增强特征表示。
    1. 使用1×1卷积 "相同" 填充以生成通道注意力图。在空间维度上应用全局平均池化,为每个通道生成紧凑的特征描述符。
    2. 使用一个轻量级卷积网络,该网络由两个1×1卷积层组成,中间包含一个ReLU激活函数。避免在通道间共享权重——为每个通道学习独立的注意力权重。
    3. 对最终输出应用Sigmoid激活函数以获得归一化的注意力分数,重新加权输入特征图 通过 逐通道乘法
      注意:设输入张量为 x通道注意力通过以下表达式实现:
      (注意力)_张量 = σ(conv(ReLU(conv(x)))) (1)
      其中,σ 表示 S 型激活函数,conv 表示卷积操作,ReLU 表示修正线性单元激活函数。
  2. 通过对注意力张量执行自适应平均池化操作,然后将其扩展以匹配使用不同卷积核尺寸进行卷积后的输出张量的大小,从而获得注意力图 y:
    attention = expand(avg_pool([attention]_tensor), size(y)) (2)
  3. 计算输出张量 z 通过对接收的输入张量进行逐元素乘法运算 y 与注意力图:
    z = z * attention (3)
    其中 * 表示逐元素相乘

5. 数据集

注意:本研究使用了两个公开可用的医学图像数据集,如表1表2所示:GlaS(Sirinukunwattana 等人11)和 MoNuSeg(Kumar 等人9)。

  1. 使用通过数字病理扫描仪获取并经过人工标注以分割组织样本中单个腺体结构的腺体分割数据集(Gland Segmentation dataset,Sirinukunwattana 等11)。
    注意:该数据集包含 165 张图像,每张图像分辨率为 500 × 500 像素,并配有相应的真值分割掩膜。MoNuSeg 数据集(Kumar 等9)包含 51 张显微镜下的细胞核图像,每张图像分辨率为 1000 × 1000 像素。

6. 实施细节

  1. 在单个 NVIDIA RTX 3090 GPU 上使用 PyTorch 实现模型。操作系统采用 Ubuntu 22.04。
  2. 将所有输入图像调整为固定的 224 × 224 像素尺寸。应用数据增强技术以提高训练多样性。
    1. 按以下顺序随机应用增强操作:水平翻转 → 垂直翻转 → 旋转 → 伽马校正 → 对数变换 → 随机缩放。
    2. 以 0.5 的概率应用随机水平翻转,以 0.5 的概率应用垂直翻转,以 0.5 的概率在 ±15 度范围内进行旋转。
    3. 以 0.3 的概率应用伽马校正,以 0.3 的概率应用对数变换,以 0.3 的概率应用随机缩放,缩放因子介于 0.9 至 1.1 之间。
    4. 使用均值 [0.485, 0.456, 0.406] 和标准差 [0.229, 0.224, 0.225] 对图像进行归一化处理。
  3. 使用 Adam 优化器训练模型,学习率为 0.001,批量大小为 4。采用带热重启的余弦退火学习率调度策略,以引入学习率变化并防止收敛至局部最优解。
    注意:使用 PyTorch 内置的 torch.optim.lr_scheduler.CosineAnnealingWarmRestarts 调度器。优化器和调度器的实现如下:
    optimizer = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    scheduler = torch.optim.lr_scheduler.CosineAnnealingWarmRestarts(
    optimizer, T_0=10, T_mult=2, eta_min=1e-6)
    其中,T_0=10 表示第一次重启前的 epoch 数,T_mult=2 表示每个周期后重启周期加倍,eta_min=1e-6 设置最小学习率。通过在每个 epoch 结束时调用 scheduler.step() 来更新学习率。
  4. 使用二元交叉熵作为损失函数。应用早停法以防止过拟合。模型最多训练 5000 个 epoch。
  5. 使用平均交并比(mIoU)和 Dice 系数评估模型性能。
    Dice =(2|A∩B|)/(|A|+|B|) (4)
    IoU=(|A∩B|)/(|A∪B|) (5)
    注意:mIoU 是预测分割掩码与真实分割掩码之间交集与并集的比值。同时,Dice 系数是交集的两倍与预测和真实分割掩码之和的比值。
  6. 在小数据集上进行严格的评估,采用三轮 5 折交叉验证,共完成 15 次评估。在每轮中随机打乱交叉验证的划分,以确保各折之间的差异性。根据类别分布对折进行分层,以保持每折内的标签平衡。
  7. 计算各折的平均性能,以降低收敛至局部最优的风险。进行统计检验,证明所提出方法相较于可比方法具有统计学上的显著提升。
  8. 在训练过程中于 图 5 展示具有代表性的验证集预测结果,以说明分割质量的逐步提升。训练完成后,根据验证集性能(例如最高的 mIoU 和 Dice 分数)加载表现最佳的模型检查点。
    1. 使用保存的参数在验证集上运行模型,生成预测的分割掩码。
    2. 使用 Matplotlib 可视化结果,以并排形式显示输入图像、真实掩码和预测掩码。
    3. 在可视化图中用红色框标出代表性区域,突出所提出方法在分割性能上的优越性。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

与现有最先进方法的比较
MixKNet 架构在两个医学图像分割数据集 GlaS 和 MoNuSeg 上进行了评估,并与该领域的现有最先进方法进行了对比。评估通过报告所提出方法及若干可比模型的 dice 分数和 IoU 分数进行,结果如表3所示。结果表明,MixKNet 架构优于其他模型,在两个数据集上均取得了最高的平均 dice 分数和 IoU 分数。在 GlaS11 数据集上,所提出的 MixKNet 达到了 91.18% 的平均 dice 分数和 84.51% 的平均 IoU 分数,均高于其他任何模型。在 MoNuSeg9 数据集上,所提出的 MixKNet 同样取得了最高的平均 dice 分数(80.45%)和 IoU 分数(67.55%)。这些结果表明,MixKNet 架构在医学图像分割中具有很高的有效性,并优于现有的最先进方法。值得注意的是,从图5图6可以看出,Mix...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种用于医学图像分割的 UNet1 架构新改进模型 MixKNet,通过融合混合深度卷积和通道注意力机制,在显著降低计算复杂度的同时提升了分割性能。混合通道卷积将多个卷积核结合,分别作用于不同的通道组。该设计使网络能够在同一层内不同感受野尺度上捕获多样化的空间和上下文特征,从而增强模型对局部和全局结构的表征能力。与标准卷积对所有通道进行统一处理的方式不同,这种混合策略以极小的计算代价增加实现了更高的表征灵活性。

同时,通道注意力的引入使模型能够根据特征图的相关性对其进行自适应重加权。理论上,该机制作为一种动态特征选择方法,可抑制信息量较少的激活,增强更为关键的激活。通过建模通道间的依赖关系,通道注意力促进了更优的梯度流动和更聚焦的特征学习,这在具有精细结构的复杂分割任务中尤为有益。

提出这些改进是为了在模型效率与分割精度之间取得平衡,尤其是在复杂的医学图像任务中。该方案的关键步骤包括数据预处理、模型架构设计、采用自适应学习率调度进行训练,以及在两个基准数据集 GlaS...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在竞争性财务利益或其他利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

宁波市2023年度第二批社会公益研究项目:基于本体与自然语言处理的电信网络诈骗识别关键技术研究与应用(2023S169)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Linux 操作系统 (Ubuntu 22.04) 多种(开源社区)不适用(版本 22.04 LTS)用于开发的开源操作系统
https://releases.ubuntu.com/22.04/
NVIDIA RTX 3090 GPUNVIDIA3090用于深度学习的高性能 GPU
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython 软件基金会不适用(版本 ≥ 3.8)用于人工智能/机器学习开发的编程语言
https://www.python.org/
PyTorchMeta AI不适用(版本 1.13)开源机器学习框架
https://pytorch.org/
Visual Studio Code (VS Code)Microsoft不适用轻量级且功能强大的代码编辑器
https://code.visualstudio.com/

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

U Net
视频即将推出

相关文章