本方案采用一种U形深度学习网络,结合卷针卷积、双重注意力机制和多尺度融合,用于分割结直肠息肉。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
方法文章
* These authors contributed equally
本方案采用一种U形深度学习网络,结合卷针卷积、双重注意力机制和多尺度融合,用于分割结直肠息肉。
结直肠息肉的精确分割对于结直肠癌的早期预防与诊断至关重要。然而,由于息肉在形状、大小和纹理方面具有高度异质性,加之肠道环境复杂(如褶皱、镜面反射和粪便残留),现有方法在边界定位和小息肉检测方面仍面临显著挑战。为解决这些问题,本文提出了一种基于风车卷积与双重注意力的息肉分割网络(PWD-Net)。该网络采用U形编码器-解码器架构,其中使用预训练的ResNet作为编码器以提取多层级局部特征。具体而言,在瓶颈层引入风车卷积模块(PCM),通过多角度旋转卷积核捕捉息肉的全局几何结构和多方向上下文信息。设计了一种融合通道注意力与空间注意力的双重注意力机制(DAM),用于自适应抑制背景噪声并增强息肉区域特征。此外,采用多尺度特征融合(MSF)策略,将深层语义信息与浅层边界细节相结合,确保分割结果的完整性与精确性。在Kvasir-SEG和CVC-ClinicDB数据集上的实验表明,PWD-Net分别取得了0.865和0.944的平均Dice系数,以及0.765和0.892的IoU分数,显著优于现有的最先进方法。消融实验验证了各模块的有效性,跨数据集评估证实了模型具有较强的泛化能力。本研究为临床息肉分割提供了一种高精度且鲁棒的解决方案,对结直肠癌前病变的早期诊断及计算机辅助干预具有重要意义。
结直肠癌是全球最常见的恶性肿瘤之一,其发病率和死亡率长期处于高位。研究表明,大多数结直肠癌由腺瘤性息肉发展而来,这一过程通常需要10–15年,为早期发现和干预提供了宝贵的时间窗口。腺瘤检出率(ADR)每提高1%,结直肠癌风险可降低约3%,显著减少患者死亡率1。结肠镜检查被视为结直肠癌筛查的金标准,可在检查过程中直接切除息肉,从而有效降低癌症的发病率和死亡率。
然而,传统的结肠镜检查在很大程度上依赖于内镜医师的经验和技术水平。主观判断、视觉疲劳和注意力分散等因素可能导致20%–30%的漏诊率,直接影响筛查效果2。因此,开发用于结直肠息肉自动分割的计算机辅助检测(CAD)系统,对于提高腺瘤检出率(ADR)并减少漏诊具有重要意义。近期的临床调查进一步强调了将人工智能整合到内镜病变评估工作流程中的需求,凸显了建立稳健且可重复的分割方法的必要性3。
近年来,深度学习在医学图像分析领域取得了显著进展,尤其是卷积神经网络(CNN),其在图像分割任务的特征提取与表征方面表现出强大的能力4。作为经典的医学图像分割模型,U-Net 采用对称的编码器-解码器结构和跳跃连接,实现了精确的像素级分割,已成为该领域的基准模型5。在 U-Net 的基础上,许多改进架构被提出以应对复杂的医学图像分割任务。UNet++ 通过引入嵌套且密集的跳跃连接,减小了编码器与解码器特征图之间的语义差距6。ResUNet++ 融合了残差模块、压缩-激励模块、空洞卷积和注意力机制,在息肉分割任务中表现出优异性能7。U2-Net 采用两级嵌套的U形结构,以捕获多尺度特征信息8。最近,一种基于双编码器-解码器的深度息肉分割网络被提出,利用并行的编码与解码路径进一步提升分割精度9。
同时,注意力机制的引入为特征增强和噪声抑制提供了新的解决方案。注意力U-Net采用注意力门机制,聚焦于目标区域,同时抑制无关的背景信息10。双注意力网络(DANet)自适应地对通道和空间两个维度的特征进行加权11,从而提升对关键特征的感知能力。三重注意力网络(TANet)通过自适应选择多尺度特征,进一步提高了分割性能12。
随着Transformer架构在自然语言处理和计算机视觉领域的成功13,研究人员开始探索其在医学图像分割中的应用。TransUNet首次采用Transformer作为编码器,以有效建模长距离依赖关系14。Swin-UNet采用纯Transformer架构,通过移位窗口机制实现高效的全局信息聚合15。UTNet提出了一种混合架构,将卷积神经网络(CNN)的局部特征提取能力与Transformer的全局建模能力相结合16。
在息肉分割领域,Polyp-PVT 采用金字塔视觉 Transformer 来捕获多尺度的全局语义信息17,而多尺度嵌套 UNet 通过融合 Transformer 结构增强了上下文理解能力18。近期研究还探索了用于跨域息肉分割的负相关学习策略19、Gompertz 增强型分割优化方法20,以及结合边界引导的注意力架构21。尽管这些方法在一定程度上提升了分割性能,息肉分割仍面临若干挑战。首先,息肉在形态、大小和纹理上具有高度异质性,尺寸范围从小于 5 mm 的微小息肉到超过 30 mm 的大型息肉,形状从圆形、椭圆形到高度不规则形态均有分布。其次,肠道环境复杂多变,黏膜皱襞、镜面反射、粪便残留物和食物残渣等因素会引入严重的背景干扰。第三,许多息肉边界模糊,可能被皱襞部分遮挡,或浸没在肠腔液体中,导致精确的边界定位极为困难22。
现有方法在应对这些挑战时仍存在明显局限性。传统卷积神经网络(CNN)在提取局部纹理和边缘特征方面效果显著;然而,固定的方形卷积核难以有效捕捉多样化的几何形状23,尤其对于高度不规则的息肉,并且无法有效建模多方向的几何特征。基于Transformer的方法能够建模全局依赖关系,但在捕捉精细的局部细节和边界信息方面效果较差。此外,其较高的计算复杂度使其不太适用于临床实时应用24。近年来的息肉分割方法,例如PraNet(利用反向注意力模块精炼关键区域25)、基于边界的级联注意力网络(增强边界特征提取26)以及CAFE-Net(通过交叉注意力机制融合编码器与解码器特征27),在处理小息肉28、边界模糊及复杂背景时,仍面临特征表征不足和边界定位不准确的问题。此外,大多数方法忽略了几何形态特征,未能充分挖掘多方向上下文信息,导致对不规则形状息肉的分割效果不理想。
综上所述,当前基于卷积神经网络(CNN)的方法由于依赖固定的方形卷积核,难以捕捉多方向的几何特征。基于Transformer的方法虽能实现全局建模,但牺牲了局部边界的精确性,且计算成本较高。与此同时,现有的注意力增强和多尺度融合策略尚未在一个专为息肉分割设计的统一框架内实现联合优化29。这些不足促使我们开发一种能够同时解决几何特征建模、自适应噪声抑制和跨尺度特征融合的方法。
为解决这些问题,本方案提出了一种基于风车卷积与双重注意力机制的息肉分割网络(PWD-Net)。该网络融合了几何特征建模、多维注意力增强以及多尺度特征融合,能够实现对复杂息肉的精确分割。本研究的主要贡献总结如下:风车卷积模块(PCM)受风车结构启发,提出了一种新颖的旋转卷积核设计,通过在多个角度(0°、45°、90°、135°、180°、225°、270° 和 315°)进行卷积操作,捕捉息肉的多方向几何特征。该模块替代了传统瓶颈阶段的卷积层,能够有效感知多样化的边缘方向,显著提升不规则形状息肉的表征能力。双重注意力机制(DAM)用于应对结肠镜图像中的背景噪声,如褶皱、反光和粪便残留。设计了一种融合通道注意力与空间注意力的双重注意力模块。该模块嵌入于跳跃连接中,通过联合识别"什么"重要(通道维度)以及"目标位于何处"(空间维度),自适应地抑制背景干扰,并增强息肉区域的特征响应,确保仅有优化后的特征参与后续的融合过程。多尺度特征融合策略(MSF)通过解码器中引入的层次化机制,同时保留深层语义信息与浅层边界细节。通过逐步融合经DAM增强的编码器特征与上采样的解码器特征,该策略有效补偿了因下采样导致的空间细节丢失,实现了对微小息肉的准确检测及边界轮廓的精确划分。
访问受限。请登录或开始试用以查看此内容。
本研究仅使用公开的、匿名的结肠镜图像数据集(Kvasir-SEG),未收集任何新的人类受试者数据。由于回顾性分析去标识化的公共数据集,根据机构审查政策,无需获得机构伦理批准和患者知情同意。
1. 数据准备
2. 整体架构
注意: 有关 PWD-Net 的宏观编码器-解码器主干结构,请参见图 1;有关特征流中核心模块的集成与交互,请参见图 2。整体架构采用U形编码器-解码器设计,以应对结肠镜图像中息肉的尺度变化及背景干扰。
3. 风车卷积模块 (图3)

4. 双重注意力机制(图4)
注意: 双重注意力机制(DAM)嵌入在每个跳跃连接中,用于从通道和空间两个维度抑制背景噪声,并增强息肉区域特征。


5. 多尺度特征融合
6. 损失函数与训练配置



7. 伪代码
算法 1:PWD-Net 息肉分割
1:输入: 结肠镜图像 I ∈ ℝH×W×3
2:输出: 分割掩膜 M ∈ {0,1}(高×宽)
3:
4:功能 PCM(X) ▷ 针轮卷积模块
5: 定义基核 W(3 × 3),角度 Θ = {0°, 45°, ..., 315°}
6: 对于每个 θ ∈ Θ 做
7: Wθ ← 双线性旋转(W, θ) ▷ 旋转核
8: Yθ ← Conv2d(X, W)θ方向特异性特征
9:结束循环
10: Y出 ← ReLU(BN(Conv1×1(Concat({Yθ})))) ▷ 聚集体
11:返回 Y出
12:结束函数
13:
14:功能 DAM(F) ▷ 双重注意力机制
15: Ac ← Sigmoid(MLP(AvgPool(F))) ▷ 通道注意力(r=16)
16: As ← Sigmoid(Conv7×7([AvgPool(F); MaxPool(F)])) ▷ 空间注意力
17: F' ← F ⊗ (α · A)c + β · As) ▷ 使用可学习的 α、β 进行融合(初始化为 0.5)
18:返回 F'
19:结束函数
20:
21:功能 PWD-Net(I)
22:编码器: e1,e2,e3,e4,e5 ← ResNet50_阶段(I) ▷ 5阶段预训练编码器
23:瓶颈: b ← PCM(e5) ▷ 在瓶颈处应用相变材料
24:跳跃连接: si ← DAM(ei) 对于 i = 1, 2, 3, 4 ▷ 滤波器编码器特征
25:解码器
26: d4 ← 双重卷积(上采样(b)与s的拼接)4))
27: d3 ← DoubleConv(Concat(Up(d4),s3))
28: d2 ← DoubleConv(Concat(Up(d3),s2))
29: d1 ← DoubleConv(Concat(Up(d2),s1))
30: M ← Sigmoid(Conv1×1(d1))
31:返回 M
32:结束函数
33:
34:培训:
35:用于 每个周期 做
36: M̂ ← PWD-Net(I)
37: ℒ ← 0.5 · BCE(M̂, M)gt) + 0.5 · DiceLoss(M̂, Mgt) ▷ λ = 0.5
38: 通过反向传播更新参数(Adam 优化)r)
39:结束循环
访问受限。请登录或开始试用以查看此内容。
实验设置
数据集
Kvasir SEG 数据集用于评估 PWD Net 在具有异质性息肉外观的结肠镜图像上的分割性能。该数据集包含 1,000 张带有像素级标注的息肉图像,涵盖了息肉在大小、形状、纹理、光照以及背景复杂性方面的变化,因此适用于评估小目标检测、边界定位以及对视觉干扰的鲁棒性。数据集被划分为训练集、验证集和测试子集,其中最终的测试集仅用于性能评估。图像的分布情况总结于表 1中。
实施细节
为确保可重复性所需的实施设置详见表2,完整的操作细节在数据准备步骤及方案的第5.2节中提供。在解释结果时,所有报告的实验均采用材料表中列出的相同输入分辨率、硬件环境和评估条件。材料表中所列条件保持一致。报告的数值基于单次运行(随机种子 seed = 42)所选定的验证Dice检查点,因此结果应被理解为在固定实验划分下的性能表现,而非交...
访问受限。请登录或开始试用以查看此内容。
PWD-Net 协议中的若干设计选择对于实现可靠的分割结果至关重要,在实施过程中需予以仔细关注。首先,编码器主干网络的选择与初始化直接影响收敛行为和最终性能。本协议采用在 ImageNet 上预训练的 ResNet-50 编码器,以提供稳健的低层和中层特征初始化。这一点在医学图像分割任务中尤为重要,因为可用的训练数据通常有限(本研究中为 800 张图像)。对所有编码器层进行微调而非冻结,可使网络能够将预训练特征适应结肠镜图像的特定特征,例如黏膜纹理和镜面反射。其次,每个核心模块在架构中的位置安排具有明确目的。Pinwheel 卷积模块(PCM)被置于网络瓶颈处,该位置空间分辨率最低但语义信息最丰富,从而能够在不过度增加计算成本的前提下高效捕获全局几何模式。双注意力机制(DAM)被嵌入在跳跃连接中而非解码器中,确保在特征传递至解码器之前就抑制背景噪声,防止受污染的特征在融合阶段传播。消融实验(表4)支持这一设计:DAM 带来了最大的单项性能提升(Dice:+2.0%),证实了在特征处理流程早期进行噪声抑制的重要性。第三,混合损失函数(0.5 · BCE + 0.5 · Dice)在像素级分类准确性与区域级...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
本研究由国家重点研发计划资助&中国国家重点研发计划(项目编号:2022YFC3500200 和 2022YFC3500204)
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Adam 优化器 | — | — | 包含在 PyTorch 中 |
| Albumentations | Albumentations 团队 | v1.0+ | 数据增强库 |
| CUDA Toolkit | NVIDIA | v11.3+ | GPU 加速 |
| Kvasir-SEG 数据集 | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib 社区 | v3.4+ | 训练曲线可视化 |
| NumPy | NumPy 社区 | v1.21+ | 数值计算 |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | 用于训练和推理的 GPU |
| OpenCV | OpenCV 社区 | v4.5+ | 图像预处理 |
| Python | Python 软件基金会 | v3.8+ | 编程语言 |
| PyTorch | Meta Platforms | v1.12+ | 深度学习框架 |
| ResNet-50 预训练权重 | PyTorch 模型库 | — | ImageNet-1K 预训练模型 |
| Ubuntu | Canonical | 18.04+ | 操作系统 |