需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

复杂环境中的显著目标检测端到端深度神经网络

1.5K 次观看

⸱

DOI:

10.3791/65554

⸱

2023年12月15日

本文内容

摘要

本方案描述了一种新颖的端到端显著物体检测算法。该算法利用深度神经网络,提高在复杂环境背景下显著物体检测的精度。

摘要

显著性目标检测已成为计算机视觉领域中一个新兴的研究热点。然而,现有算法在复杂多变的环境中检测显著性目标时,其精度往往显著下降。针对这一突出问题,本文提出了一种端到端的深度神经网络,旨在复杂环境中实现显著性目标的检测。该研究提出了一种端到端的深度神经网络,用于在复杂环境中检测显著性目标。该网络由两个相互关联的组件构成:像素级多尺度全卷积网络和深度编码器-解码器网络,通过融合上下文语义信息,在多尺度特征图上生成视觉对比度,同时结合深层与浅层图像特征,以提升目标边界的识别精度。此外,引入全连接条件随机场(CRF)模型,进一步增强了显著性图的空间一致性和轮廓清晰度。所提出的算法在SOD和ECSSD数据库上与10种当前主流算法进行了广泛对比评估。实验结果表明,该算法在精度与准确率方面均优于其他方法,验证了其在复杂环境中进行显著性目标检测的有效性。

引言

显著性物体检测模拟人类视觉注意力,能够快速识别图像中的关键区域,同时抑制背景信息。该技术广泛用作图像裁剪1、语义分割2和图像编辑3等任务的预处理工具。它可简化背景替换和前景提取等操作,提高编辑的效率与精度。此外,通过增强目标定位能力,显著性物体检测有助于提升语义分割的效果。显著性物体检测在提升计算效率和节约内存方面的潜力,凸显了其重要的研究价值与应用前景。

多年来,显著性物体检测已从早期的传统算法发展到深度学习算法的引入。这些进展的目标在于缩小显著性物体检测与人类视觉机制之间的差距。这促使研究者采用深度卷积网络模型来开展显著性物体检测的研究。Borji 等人4总结并归纳了大多数经典的传统算法,这些算法依赖于图像的底层特征。尽管检测精度有所提升,但在复杂环境中,人工经验与认知仍为显著性物体检测带来挑战。

卷积神经网络(CNN)在显著目标检测领域中被广泛使用。在此背景下,深度卷积神经网络通过自主学习实现权重更新。卷积神经网络利用级联的卷积层和池化层从图像中提取上下文语义信息,从而在更高层次上学习复杂的图像特征,这些特征在不同环境中对显著目标检测具有更强的判别能力和表征能力。

201....

访问受限。请登录或开始试用以查看此内容。

方案

1. 实验设置与操作步骤

  1. 加载预训练的 VGG16 模型。
    注意:第一步是从 Keras 库中加载预训练的 VGG16 模型6。
    1. 要在 Python 中使用 PyTorch 等流行的深度学习库(参见材料表)加载预训练的 VGG16 模型,请遵循以下通用步骤:
      1. 导入torch。导入torchvision.models 为 models。
      2. 加载预训练的 VGG16 模型。vgg16_model = models.vgg16(pretrained=True)。
      3. 确保 VGG16 模型的摘要为 "print(vgg16_model)"。
  2. 定义 DCL 和 DEDN 模型。
    1. 对于 DCL 算法的伪代码,提供输入:图像数据集 SOD和输出:训练好的 DCL 模型。
      1. 使用 VGG16 主干网络初始化DCL 模型。
      2. 预处理图像数据集 D(例如,调整大小、归一化)....

访问受限。请登录或开始试用以查看此内容。

结果

本研究提出了一种端到端的深度神经网络,该网络由两个互补的子网络组成:一种像素级多尺度全卷积网络和一种深度编码器-解码器网络。第一个网络通过融合上下文语义信息,从多尺度特征图中提取视觉对比度,从而解决了深度神经网络在不同层中感受野固定所带来的挑战。第二个网络利用深层和浅层图像特征,以缓解目标物体边界模糊的问题。最后,采用全连接条件随机场(CRF)模型,以提升显著性图的空间一致性和轮廓精度。

本研究对所提出的算法与领域内十种现有算法进行了定性和定量比较。实验结果表明,该算法在提升显著目标检测准确性方面具有有效性。此外,该算法在电力视觉任务中展现出潜在的应用价值,为智能电网领域内多种复杂环境下的应用提供了良好前景。

消融实验
本研究在 SOD 数据库上进行了一系列消融实验,以评估算法的有效性。这些实验的结果详见表 1。(1)用于比较模型的评估指标包括精确率-召回率曲线22、Fβ

访问受限。请登录或开始试用以查看此内容。

讨论

本文介绍了一种专门用于在复杂环境中检测显著物体的端到端深度神经网络。该网络由两个相互连接的组件构成:像素级多尺度全卷积网络(DCL)和深度编码器-解码器网络(DEDN)。这两个组件协同工作,通过引入上下文语义信息,在多尺度特征图中生成视觉对比度。此外,它们还利用深层和浅层图像特征,以提高物体边界划分的精度。通过整合全连接条件随机场(CRF)模型,进一步增强了显著性图和轮廓划分的空间一致性。

为实现这一目标,基于 VGG16 架构构建了两个深度网络,即深度上下文学习网络(Deep Context Learning, DCL)和深度编码器-解码器网络(Deep Encoder-Decoder Network, DEDN)。如操作步骤 1.2 所述,输入图像经 DCL 处理后生成具有不同尺度的特征图,其特点是具有不同的感受野。这些特征图随后与上下文语义信息相结合,最终生成尺寸为 W × H 且具备跨维度一致性的显著性图。具体而言,DCL11 采用一对卷积层,每层均配备 7 × 7 的卷积核,以替代原始 VGG16 网络中的最后一个池化层。该.......

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

本工作由2024年河南省高等学校重点科研项目资助计划(项目编号:24A520053)资助。本研究还得到河南省特色示范课程专项建设与融合创新项目的支持。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
MatlabMathWorksMatlab R2016aMATLAB 的编程接口提供了一系列开发工具,用于提升代码质量、可维护性并最大化性能。
它提供了使用自定义图形界面构建应用程序的工具。
它还提供了将基于 MATLAB 的算法与外部应用程序和语言集成的工具。
处理器 Intel11 代 Intel(R) Core(TM) i5-1135G7 @ 2.40GHz64 位 Win11 处理器 
PycharmJetBrainsPyCharm 3.0PyCharm 是一款 Python 集成开发环境(IDE)
所需的 Python 模块列表:
matplotlib
skimage
torch
os
time
pydensecrf
opencv
glob
PIL
torchvision
numpy
tkinter
PyTorch FacebookPyTorch 1.4 PyTorch 是一个基于 Torch 的开源 Python 机器学习库,用于自然语言处理及其他应用。PyTorch 既可被视为支持 GPU 的 NumPy,也可被视为具有自动微分功能的强大深度神经网络框架。

参考文献

  1. Wang, W. G., Shen, J. B., Ling, H. B. A deep network solution for attention and aesthetics aware photo cropping. IEEE Transactions on Pattern Analysis and Machine Intelligence. 41 (7), 1531-1544 (2018).
  2. Wang, W. G., Sun, G. L., Gool, L. V. Looking beyond single images for weakly supervised semantic segmentation learning.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

卷积神经网络编码器-解码器网络条件随机场图像分割SOD数据库VGG16骨干网络PyTorch模型