需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于风车卷积与双重注意力的息肉分割网络用于结直肠癌前病变诊断

51 次观看

DOI:

10.3791/71178

2026年6月26日

* These authors contributed equally

本文内容

摘要

本方案采用一种U形深度学习网络,结合卷针卷积、双重注意力机制和多尺度融合,用于分割结直肠息肉。

摘要

结直肠息肉的精确分割对于结直肠癌的早期预防与诊断至关重要。然而,由于息肉在形状、大小和纹理方面具有高度异质性,加之肠道环境复杂(如褶皱、镜面反射和粪便残留),现有方法在边界定位和小息肉检测方面仍面临显著挑战。为解决这些问题,本文提出了一种基于风车卷积与双重注意力的息肉分割网络(PWD-Net)。该网络采用U形编码器-解码器架构,其中使用预训练的ResNet作为编码器以提取多层级局部特征。具体而言,在瓶颈层引入风车卷积模块(PCM),通过多角度旋转卷积核捕捉息肉的全局几何结构和多方向上下文信息。设计了一种融合通道注意力与空间注意力的双重注意力机制(DAM),用于自适应抑制背景噪声并增强息肉区域特征。此外,采用多尺度特征融合(MSF)策略,将深层语义信息与浅层边界细节相结合,确保分割结果的完整性与精确性。在Kvasir-SEG和CVC-ClinicDB数据集上的实验表明,PWD-Net分别取得了0.865和0.944的平均Dice系数,以及0.765和0.892的IoU分数,显著优于现有的最先进方法。消融实验验证了各模块的有效性,跨数据集评估证实了模型具有较强的泛化能力。本研究为临床息肉分割提供了一种高精度且鲁棒的解决方案,对结直肠癌前病变的早期诊断及计算机辅助干预具有重要意义。

引言

结直肠癌是全球最常见的恶性肿瘤之一,其发病率和死亡率长期处于高位。研究表明,大多数结直肠癌由腺瘤性息肉发展而来,这一过程通常需要10–15年,为早期发现和干预提供了宝贵的时间窗口。腺瘤检出率(ADR)每提高1%,结直肠癌风险可降低约3%,显著减少患者死亡率1。结肠镜检查被视为结直肠癌筛查的金标准,可在检查过程中直接切除息肉,从而有效降低癌症的发病率和死亡率。

然而,传统的结肠镜检查在很大程度上依赖于内镜医师的经验和技术水平。主观判断、视觉疲劳和注意力分散等因素可能导致20%–30%的漏诊率,直接影响筛查效果2。因此,开发用于结直肠息肉自动分割的计算机辅助检测(CAD)系统,对于提高腺瘤检出率(ADR)并减少漏诊具有重要意义。近期的临床调查进一步强调了将人工智能整合到内镜病变评估工作流程中的需求,凸显了建立稳健且可重复的分割方法的必要性3

近年来,深度学习在医学图像分析领域取得了显著进展,尤其是卷积神经网络(CNN),其在图像分割任务的特征提取与表征方面表现出强大的能力4。作为经典的医学图像分割模型,U-Net 采用对称的编码器-解码器结构和跳跃连接,实现了精确的像素级分割,已成为该领域的基准模型5。在 U-Net 的基础上,许多改进架构被提出以应对复杂的医学图像分割任务。UNet++ 通过引入嵌套且密集的跳跃连接,减小了编码器与解码器特征图之间的语义差距6。ResUNet++ 融合了残差模块、压缩-激励模块、空洞卷积和注意力机制,在息肉分割任务中表现出优异性能7。U2-Net 采用两级嵌套的U形结构,以捕获多尺度特征信息8。最近,一种基于双编码器-解码器的深度息肉分割网络被提出,利用并行的编码与解码路径进一步提升分割精度9

同时,注意力机制的引入为特征增强和噪声抑制提供了新的解决方案。注意力U-Net采用注意力门机制,聚焦于目标区域,同时抑制无关的背景信息10。双注意力网络(DANet)自适应地对通道和空间两个维度的特征进行加权11,从而提升对关键特征的感知能力。三重注意力网络(TANet)通过自适应选择多尺度特征,进一步提高了分割性能12

随着Transformer架构在自然语言处理和计算机视觉领域的成功13,研究人员开始探索其在医学图像分割中的应用。TransUNet首次采用Transformer作为编码器,以有效建模长距离依赖关系14。Swin-UNet采用纯Transformer架构,通过移位窗口机制实现高效的全局信息聚合15。UTNet提出了一种混合架构,将卷积神经网络(CNN)的局部特征提取能力与Transformer的全局建模能力相结合16

在息肉分割领域,Polyp-PVT 采用金字塔视觉 Transformer 来捕获多尺度的全局语义信息17,而多尺度嵌套 UNet 通过融合 Transformer 结构增强了上下文理解能力18。近期研究还探索了用于跨域息肉分割的负相关学习策略19、Gompertz 增强型分割优化方法20,以及结合边界引导的注意力架构21。尽管这些方法在一定程度上提升了分割性能,息肉分割仍面临若干挑战。首先,息肉在形态、大小和纹理上具有高度异质性,尺寸范围从小于 5 mm 的微小息肉到超过 30 mm 的大型息肉,形状从圆形、椭圆形到高度不规则形态均有分布。其次,肠道环境复杂多变,黏膜皱襞、镜面反射、粪便残留物和食物残渣等因素会引入严重的背景干扰。第三,许多息肉边界模糊,可能被皱襞部分遮挡,或浸没在肠腔液体中,导致精确的边界定位极为困难22

现有方法在应对这些挑战时仍存在明显局限性。传统卷积神经网络(CNN)在提取局部纹理和边缘特征方面效果显著;然而,固定的方形卷积核难以有效捕捉多样化的几何形状23,尤其对于高度不规则的息肉,并且无法有效建模多方向的几何特征。基于Transformer的方法能够建模全局依赖关系,但在捕捉精细的局部细节和边界信息方面效果较差。此外,其较高的计算复杂度使其不太适用于临床实时应用24。近年来的息肉分割方法,例如PraNet(利用反向注意力模块精炼关键区域25)、基于边界的级联注意力网络(增强边界特征提取26)以及CAFE-Net(通过交叉注意力机制融合编码器与解码器特征27),在处理小息肉28、边界模糊及复杂背景时,仍面临特征表征不足和边界定位不准确的问题。此外,大多数方法忽略了几何形态特征,未能充分挖掘多方向上下文信息,导致对不规则形状息肉的分割效果不理想。

综上所述,当前基于卷积神经网络(CNN)的方法由于依赖固定的方形卷积核,难以捕捉多方向的几何特征。基于Transformer的方法虽能实现全局建模,但牺牲了局部边界的精确性,且计算成本较高。与此同时,现有的注意力增强和多尺度融合策略尚未在一个专为息肉分割设计的统一框架内实现联合优化29。这些不足促使我们开发一种能够同时解决几何特征建模、自适应噪声抑制和跨尺度特征融合的方法。

为解决这些问题,本方案提出了一种基于风车卷积与双重注意力机制的息肉分割网络(PWD-Net)。该网络融合了几何特征建模、多维注意力增强以及多尺度特征融合,能够实现对复杂息肉的精确分割。本研究的主要贡献总结如下:风车卷积模块(PCM)受风车结构启发,提出了一种新颖的旋转卷积核设计,通过在多个角度(0°、45°、90°、135°、180°、225°、270° 和 315°)进行卷积操作,捕捉息肉的多方向几何特征。该模块替代了传统瓶颈阶段的卷积层,能够有效感知多样化的边缘方向,显著提升不规则形状息肉的表征能力。双重注意力机制(DAM)用于应对结肠镜图像中的背景噪声,如褶皱、反光和粪便残留。设计了一种融合通道注意力与空间注意力的双重注意力模块。该模块嵌入于跳跃连接中,通过联合识别"什么"重要(通道维度)以及"目标位于何处"(空间维度),自适应地抑制背景干扰,并增强息肉区域的特征响应,确保仅有优化后的特征参与后续的融合过程。多尺度特征融合策略(MSF)通过解码器中引入的层次化机制,同时保留深层语义信息与浅层边界细节。通过逐步融合经DAM增强的编码器特征与上采样的解码器特征,该策略有效补偿了因下采样导致的空间细节丢失,实现了对微小息肉的准确检测及边界轮廓的精确划分。

访问受限。请登录或开始试用以查看此内容。

方案

本研究仅使用公开的、匿名的结肠镜图像数据集(Kvasir-SEG),未收集任何新的人类受试者数据。由于回顾性分析去标识化的公共数据集,根据机构审查政策,无需获得机构伦理批准和患者知情同意。

1. 数据准备

  1. 从官方仓库33(https://datasets.simula.no/kvasir-seg/)下载 Kvasir-SEG 数据集。该数据集包含 1,000 张息肉图像及其对应的像素级真实分割掩膜。
  2. 使用固定的随机种子(seed = 42),将数据集按 8:1:1 的比例随机划分为训练集(800 张图像)、验证集(100 张图像)和测试集(100 张图像)。验证三个子集之间无图像重叠,以防止数据泄露。
  3. 使用双线性插值将所有图像及其对应的掩膜调整为 352 × 352 像素,掩膜使用最近邻插值。
  4. 通过除以 255 将像素值归一化至 [0, 1] 范围,然后对图像应用 ImageNet 的通道均值减法(0.485, 0.456, 0.406)和标准差归一化(0.229, 0.224, 0.225)。
  5. 仅对训练集(不在验证集或测试集上)应用以下数据增强变换:随机水平翻转(概率 = 0.5);随机垂直翻转(概率 = 0.5);随机旋转(范围:−30° 至 +30°,概率 = 0.5);随机多尺度缩放(缩放因子:0.75 至 1.25,概率 = 0.5)。
    注意:对图像及其对应掩膜应用相同的空间变换,以保持对齐。在开始训练前,通过目视检查若干增强后的图像-掩膜对,验证增强操作的正确性。

2. 整体架构

注意: 有关 PWD-Net 的宏观编码器-解码器主干结构,请参见图 1;有关特征流中核心模块的集成与交互,请参见图 2。整体架构采用U形编码器-解码器设计,以应对结肠镜图像中息肉的尺度变化及背景干扰。

  1. 主干网络与编码路径(图1
    1. 采用在 ImageNet 上预训练的 ResNet-50(来自官方 PyTorch 模型库)作为主干编码器30。训练期间对所有编码器层进行微调。
    2. 将输入的结肠镜图像(调整大小为 352 × 352 像素)输入五级残差卷积块中,以提取分层特征。在五个阶段中,特征图的空间分辨率逐步下采样,而通道维度相应增加(64 → 128 → 256 → 512 → 1024)。
    3. 在瓶颈层(最深的编码器层),用Pinwheel卷积模块(PCM,见第3节)替代标准卷积层,以在低分辨率下捕获全局几何形态和多方向上下文信息。
      注意五个编码器阶段对应标准 ResNet-50 的层组:conv1、layer1、layer2、layer3 和 layer4。预训练权重提供了稳健的低级和中级特征初始化,减少了在小型医学数据集上的收敛时间。
  2. 关键组件与特征交互 图2 图3
    1. 在通过跳跃连接将每个编码器阶段的输出传递给解码器之前,应用双注意力机制(DAM,见第4节)。该步骤自适应地抑制由肠皱襞和镜面反射产生的背景噪声,同时增强息肉区域的特征响应。仅将滤波后的特征传递给对应的解码器层。
    2. 在解码器中,通过双线性上采样逐步恢复空间分辨率。在每个解码器层,将来自前一级解码器阶段的上采样特征与具有相同空间分辨率的DAM增强编码器特征进行拼接。
    3. 应用两个连续的卷积层(每个卷积层后接批归一化和 ReLU 激活函数)以融合多尺度信息。这构成了第5节中描述的多尺度特征融合(MSF)策略。
      注意解码器从深层到浅层(第5阶段 → 第1阶段)进行,确保在每一层有效整合深层语义定位信息和浅层边界细节信息。
  3. 输出生成
    1. 对最终解码器输出应用一个卷积层,后接 Sigmoid 激活函数,以生成预测掩码。
    2. 使用 0.5 的阈值对预测掩码进行二值化,得到最终分割结果,其中预测概率 ≥ 0.5 的像素被分类为息肉,其余像素被分类为背景。

3. 风车卷积模块 (图3)

  1. 卷积轮模块(Pinwheel Convolution Module, PCM)取代标准的瓶颈卷积,以捕获息肉的多方向几何特征。按以下方式实现该模块:
    1. 定义一个大小为 3 × 3 的基础卷积核 W,具有 Cin 个输入通道和 Cout 个输出通道。
    2. 定义旋转角度集合 Θ = {0°, 45°, 90°, …, 315°}。对于每个角度 θ ∈ Θ,通过对 W 应用基于双线性插值的旋转生成旋转后的卷积核 Wθ。全部八个旋转核共享相同的基础参数;仅权重的空间排列方式不同。
    3. 对于每个角度 θ,计算方向特异性特征图:
      卷积操作方程:\( Y_q=Conv(X,W_q) \),数学公式。
      其中 X 为输入特征图。
    4. 通过在通道轴上进行通道级联,聚合八个方向的特征图,生成维度为 (8 × Cout) × H × W 的张量。然后应用 1 × 1 卷积将通道维度降回到 Cout,随后进行批归一化和 ReLU 激活31
      静态平衡方程,Y_out=F_agg({Y_θ|θ∈Θ}),公式分析与拟合。
      注意:旋转和插值操作作用于卷积核权重,而非输入特征图。该设计可在不增加输入分辨率的前提下,实现参数高效的多方向特征提取。在当前实现中,瓶颈阶段的 Cin = 1024 且 Cout = 1024,与 ResNet-50 layer4 的输出通道维度一致。完整实现请参见补充代码包。

4. 双重注意力机制(图4

注意: 双重注意力机制(DAM)嵌入在每个跳跃连接中,用于从通道和空间两个维度抑制背景噪声,并增强息肉区域特征。

  1. 通道注意力
    通道注意力分支用于识别哪些特征通道最具信息量。给定输入特征 F ∈ ℝC×H×W
    1. 通过全局平均池化压缩空间维度,得到通道描述符 z ∈ ℝC×1×1
    2. 将 z 输入一个两层的多层感知机(全连接层),缩减比 r = 16。第一层使用 ReLU 激活函数,将维度从 C 降至 C/16;第二层使用 Sigmoid 激活函数,将维度从 C/16 恢复至 C,生成通道权重向量 Ac
      神经网络公式 A_t=σ(W_f*δ(W_t*AvgPool(F)));机器学习方程;研究背景。
      其中 δ 表示 ReLU,σ 表示 Sigmoid。
  2. 空间注意力
    空间注意力分支用于定位目标区域的位置:
    1. 沿通道维度分别应用最大池化和平均池化,生成两个大小为 1 × H × W 的二维特征图。
    2. 沿通道轴拼接这两个特征图,形成一个 2 × H × W 的张量。随后应用一个 7 × 7 的卷积层,并通过 Sigmoid 激活函数生成空间权重图 As ∈ ℝ1×H×W
      神经网络激活函数公式,As = σ(f’×(AvgPool(F);MaxPool(F)))。
  3. 特征融合
    1. 通过逐元素相乘的方式,将通道注意力和空间注意力的输出与输入特征进行融合:
      静态平衡方程,示意图,矢量力分析,ΣF=F⊗(αAe+βAs),物理学研究。
      其中 α 和 β 为可学习的平衡系数,初始值均设为 0.5,并在训练过程中通过基于梯度的优化方法与网络参数共同更新。
      注:完整实现请参考补充代码包(dam_module.py)。

5. 多尺度特征融合

  1. 在解码器中采用多尺度特征融合(MSF)策略,以解决深层特征中的空间细节丢失问题。在每一解码阶段,执行以下操作:
  2. 使用双线性插值将前一解码阶段的特征图上采样2倍。
  3. 沿通道维度将上采样的特征与对应空间分辨率的DAM增强编码器特征进行拼接。
  4. 应用两个连续的3×3卷积层(每个卷积层后接批归一化和ReLU激活函数32)以融合拼接后的特征。
    注意:这种跨层级融合可同时保留息肉的边界细节(由浅层编码器特征提供)和语义定位信息(由深层特征提供),从而生成精细的分割结果。

6. 损失函数与训练配置

  1. 损失函数
    1. 采用混合损失函数 L_total 联合优化网络,以解决息肉分割中普遍存在的前景-背景类别不平衡问题。
      二元交叉熵损失(LBCE)用于衡量像素级分类准确性:
      模型优化分析中二元交叉熵损失的数学公式。
      其中 N 为像素总数,yi ∈ {0,1} 为真实标签,ŷi ∈ [0,1] 为预测概率。
    2. Dice 损失(LDice)用于量化预测区域与真实区域之间的集合相似性:
      图像分割方法中使用的 Dice 损失公式 \(L_{\text{Dice}}\)。
      静态平衡公式 L_total=λL_BCE+(1−λ)L_Dice,用于教学目的。
      其中 ε 为平滑因子(设为 1 × 10⁻5),用于避免除零错误。
      设置 λ = 0.5 以平衡两项损失的贡献。
  2. 训练配置
    1. 使用 ImageNet 预训练的 ResNet-50 权重初始化编码器。使用 Kaiming 均匀初始化方法初始化所有解码器层、PCM 和 DAM 参数。
    2. 按如下方式配置优化器和训练计划:使用 Adam 优化器,β₁ = 0.9,β₂ = 0.999;初始学习率设为 1 × 10⁻⁴;采用余弦退火学习率调度策略,Tmax = 50,ηmin = 1 × 10⁻⁶;批量大小设为 16,模型训练 50 个周期。
    3. 在训练集(800 张图像)上训练模型 50 个周期。每个周期结束后,在验证集(100 张图像)上以 Dice 系数为主要监控指标评估模型性能。
    4. 保存在验证集上取得最高 Dice 系数的模型检查点。将此检查点作为最终模型,用于后续在测试集上的所有评估。
      ​注意:未显式应用早停策略。以验证集 Dice 系数最高的检查点作为模型选择标准。所有实验均在 材料表 中指定的硬件和软件环境中进行。在 800 张图像上训练 50 个周期约需 2 小时。所有报告结果均基于指定随机种子(seed = 42)的单次训练运行获得。完整训练脚本请参见补充代码包。

7. 伪代码

  1. 算法1作为PWD Net的完整工作流程图。将算法中的PCM、DAM、主架构和训练流程模块与补充代码包中的对应文件进行匹配。
  2. 实现第4至12行所示的PCM模块。定义一个基础的3×3卷积核,并使用双线性插值生成八个旋转角度分别为0°、45°、90°、135°、180°、225°、270°和315°的卷积核。
  3. 所有旋转后的PCM卷积核共享相同的基础可学习参数。对每个旋转角度,计算一个方向特异性的特征图。
  4. 沿通道维度拼接八个PCM特征图。应用1×1卷积、批归一化和ReLU激活函数,以恢复原始通道维度。
  5. 实现第14至19行所示的DAM模块。应用全局平均池化生成通道描述符,然后通过一个具有16倍压缩比的两层MLP获得通道权重。
  6. 通过对输入特征分别进行通道维度上的平均池化和最大池化生成空间注意力图。将这两个图拼接后,通过一个7×7卷积层和Sigmoid激活函数进行处理。
  7. 使用逐元素相乘的方式将DAM的通道注意力和空间注意力输出与输入特征融合。使用可学习系数α和β对两个注意力图进行加权,α和β的初始值均为0.5。
  8. 构建第21至32行所示的主PWD Net架构。将输入图像送入预训练的ResNet50编码器的五个阶段,得到e1至e5,其空间分辨率从H×W逐步降低至H/32×W/32。
  9. 在瓶颈层对e5应用PCM。在通过跳跃连接将e1至e4送入解码器之前,对这些特征应用DAM。
  10. 从深层到浅层逐步解码特征图。在每一解码层级,对前一级特征进行上采样,与对应的经DAM增强的编码器特征拼接,然后应用DoubleConv模块进行特征融合。
  11. 通过1×1卷积后接Sigmoid激活函数生成分割输出。将得到的像素级概率图作为预测掩码。
  12. 实现第34至39行所示的训练循环。在每个训练周期中,通过PWD Net进行前向传播并计算预测掩码。
  13. 将训练损失定义为0.5倍的二元交叉熵(BCE)损失加上0.5倍的Dice损失。通过反向传播,使用Adam优化器更新所有可学习参数。

算法 1:PWD-Net 息肉分割
1:输入: 结肠镜图像 I ∈ ℝH×W×3
2:输出: 分割掩膜 M ∈ {0,1}(高×宽)
3:
4:功能 PCM(X) ▷ 针轮卷积模块
5: 定义基核 W(3 × 3),角度 Θ = {0°, 45°, ..., 315°}
6: 对于每个 θ ∈ Θ
7: Wθ ← 双线性旋转(W, θ) ▷ 旋转核
8: Yθ ← Conv2d(X, W)θ方向特异性特征
9:结束循环
10: Y ← ReLU(BN(Conv1×1(Concat({Yθ})))) ▷ 聚集体
11:返回 Y
12:结束函数
13:
14:功能 DAM(F) ▷ 双重注意力机制
15: Ac ← Sigmoid(MLP(AvgPool(F))) ▷ 通道注意力(r=16)
16: As ← Sigmoid(Conv7×7([AvgPool(F); MaxPool(F)])) ▷ 空间注意力
17: F' ← F ⊗ (α · A)c + β · As) ▷ 使用可学习的 α、β 进行融合(初始化为 0.5)
18:返回 F'
19:结束函数
20:
21:功能 PWD-Net(I)
22:编码器: e1,e2,e3,e4,e5 ← ResNet50_阶段(I) ▷ 5阶段预训练编码器
23:瓶颈: b ← PCM(e5) ▷ 在瓶颈处应用相变材料
24:跳跃连接: si ← DAM(ei) 对于 i = 1, 2, 3, 4 ▷ 滤波器编码器特征
25:解码器
26: d4 ← 双重卷积(上采样(b)与s的拼接)4))
27: d3 ← DoubleConv(Concat(Up(d4),s3))
28: d2 ← DoubleConv(Concat(Up(d3),s2))
29: d1 ← DoubleConv(Concat(Up(d2),s1))
30: M ← Sigmoid(Conv1×1(d1))
31:返回 M
32:结束函数
33:
34:培训:
35:用于 每个周期
36: M̂ ← PWD-Net(I)
37: ℒ ← 0.5 · BCE(M̂, M)gt) + 0.5 · DiceLoss(M̂, Mgt) ▷ λ = 0.5

38: 通过反向传播更新参数(Adam 优化)r)
39:结束循环

访问受限。请登录或开始试用以查看此内容。

结果

实验设置
数据集

Kvasir SEG 数据集用于评估 PWD Net 在具有异质性息肉外观的结肠镜图像上的分割性能。该数据集包含 1,000 张带有像素级标注的息肉图像,涵盖了息肉在大小、形状、纹理、光照以及背景复杂性方面的变化,因此适用于评估小目标检测、边界定位以及对视觉干扰的鲁棒性。数据集被划分为训练集、验证集和测试子集,其中最终的测试集仅用于性能评估。图像的分布情况总结于表 1中。

实施细节

为确保可重复性所需的实施设置详见表2,完整的操作细节在数据准备步骤及方案的第5.2节中提供。在解释结果时,所有报告的实验均采用材料表中列出的相同输入分辨率、硬件环境和评估条件。材料表中所列条件保持一致。报告的数值基于单次运行(随机种子 seed = 42)所选定的验证Dice检查点,因此结果应被理解为在固定实验划分下的性能表现,而非交...

访问受限。请登录或开始试用以查看此内容。

讨论

PWD-Net 协议中的若干设计选择对于实现可靠的分割结果至关重要,在实施过程中需予以仔细关注。首先,编码器主干网络的选择与初始化直接影响收敛行为和最终性能。本协议采用在 ImageNet 上预训练的 ResNet-50 编码器,以提供稳健的低层和中层特征初始化。这一点在医学图像分割任务中尤为重要,因为可用的训练数据通常有限(本研究中为 800 张图像)。对所有编码器层进行微调而非冻结,可使网络能够将预训练特征适应结肠镜图像的特定特征,例如黏膜纹理和镜面反射。其次,每个核心模块在架构中的位置安排具有明确目的。Pinwheel 卷积模块(PCM)被置于网络瓶颈处,该位置空间分辨率最低但语义信息最丰富,从而能够在不过度增加计算成本的前提下高效捕获全局几何模式。双注意力机制(DAM)被嵌入在跳跃连接中而非解码器中,确保在特征传递至解码器之前就抑制背景噪声,防止受污染的特征在融合阶段传播。消融实验(表4)支持这一设计:DAM 带来了最大的单项性能提升(Dice:+2.0%),证实了在特征处理流程早期进行噪声抑制的重要性。第三,混合损失函数(0.5 · BCE + 0.5 · Dice)在像素级分类准确性与区域级...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

本研究由国家重点研发计划资助&中国国家重点研发计划(项目编号:2022YFC3500200 和 2022YFC3500204)

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Adam 优化器包含在 PyTorch 中
AlbumentationsAlbumentations 团队v1.0+数据增强库
CUDA ToolkitNVIDIAv11.3+GPU 加速
Kvasir-SEG 数据集SimulaMethttps://datasets.simula.no/kvasir-seg/
MatplotlibMatplotlib 社区v3.4+训练曲线可视化
NumPyNumPy 社区v1.21+数值计算
NVIDIA Tesla P100NVIDIAP100-PCIE-16GB用于训练和推理的 GPU
OpenCVOpenCV 社区v4.5+图像预处理
PythonPython 软件基金会v3.8+编程语言
PyTorchMeta Platformsv1.12+深度学习框架
ResNet-50 预训练权重PyTorch 模型库ImageNet-1K 预训练模型
UbuntuCanonical18.04+操作系统

重印与许可

标签

医学第232期第232期空值双注意力机制多尺度特征融合深度学习医学图像处理