本方案描述了一种新颖的端到端显著物体检测算法。该算法利用深度神经网络,提高在复杂环境背景下显著物体检测的精度。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了一种新颖的端到端显著物体检测算法。该算法利用深度神经网络,提高在复杂环境背景下显著物体检测的精度。
显著性目标检测已成为计算机视觉领域中一个新兴的研究热点。然而,现有算法在复杂多变的环境中检测显著性目标时,其精度往往显著下降。针对这一突出问题,本文提出了一种端到端的深度神经网络,旨在复杂环境中实现显著性目标的检测。该研究提出了一种端到端的深度神经网络,用于在复杂环境中检测显著性目标。该网络由两个相互关联的组件构成:像素级多尺度全卷积网络和深度编码器-解码器网络,通过融合上下文语义信息,在多尺度特征图上生成视觉对比度,同时结合深层与浅层图像特征,以提升目标边界的识别精度。此外,引入全连接条件随机场(CRF)模型,进一步增强了显著性图的空间一致性和轮廓清晰度。所提出的算法在SOD和ECSSD数据库上与10种当前主流算法进行了广泛对比评估。实验结果表明,该算法在精度与准确率方面均优于其他方法,验证了其在复杂环境中进行显著性目标检测的有效性。
显著性物体检测模拟人类视觉注意力,能够快速识别图像中的关键区域,同时抑制背景信息。该技术广泛用作图像裁剪1、语义分割2和图像编辑3等任务的预处理工具。它可简化背景替换和前景提取等操作,提高编辑的效率与精度。此外,通过增强目标定位能力,显著性物体检测有助于提升语义分割的效果。显著性物体检测在提升计算效率和节约内存方面的潜力,凸显了其重要的研究价值与应用前景。
多年来,显著性物体检测已从早期的传统算法发展到深度学习算法的引入。这些进展的目标在于缩小显著性物体检测与人类视觉机制之间的差距。这促使研究者采用深度卷积网络模型来开展显著性物体检测的研究。Borji 等人4总结并归纳了大多数经典的传统算法,这些算法依赖于图像的底层特征。尽管检测精度有所提升,但在复杂环境中,人工经验与认知仍为显著性物体检测带来挑战。
卷积神经网络(CNN)在显著目标检测领域中被广泛使用。在此背景下,深度卷积神经网络通过自主学习实现权重更新。卷积神经网络利用级联的卷积层和池化层从图像中提取上下文语义信息,从而在更高层次上学习复杂的图像特征,这些特征在不同环境中对显著目标检测具有更强的判别能力和表征能力。
2016年,全卷积神经网络5作为一种显著目标检测的流行方法获得了广泛关注,研究人员在此基础上开始进行像素级的显著目标检测。许多模型通常基于现有网络(例如 VGG166、ResNet7)构建,旨在增强图像表征能力并提升边缘检测效果。
Liu 等人8采用一个预训练的神经网络作为框架,对图像进行全局计算,然后利用分层网络优化物体边界。两个网络的结合构成了最终的深度显著性网络。该方法通过将先前获得的显著图以迭代方式作为先验知识输入网络来实现。Zhang 等人9利用具有双向信息传递(从浅层到深层以及从深层到浅层)的深度网络,有效融合了图像的语义与空间信息。Wu 等人10提出了基于互学习深度模型的显著物体检测方法。该模型在卷积神经网络中利用前景和边缘信息以促进检测过程。Li 等人11采用神经网络的“空洞算法”(hole algorithm),以应对在显著物体检测背景下深度神经网络中不同层感受野固定所带来的挑战。然而,该方法使用超像素分割获取物体边缘,显著增加了计算量和计算时间。Ren 等人12设计了一种多尺度编码器-解码器网络用于显著物体检测,并利用卷积神经网络有效融合深层与浅层特征。尽管该方法解决了物体检测中边界模糊的问题,但多尺度信息融合不可避免地导致计算需求增加。
文献综述13总结了从传统方法到深度学习方法的显著性检测技术,清晰地展示了显著性目标检测从起源发展到深度学习时代的过程。已有研究14提出了多种基于RGB-D的显著性目标检测模型,这些模型表现出良好的性能。上述文献对显著性目标检测的各种算法进行了回顾与分类,并描述了其应用场景、所使用的数据库以及评估指标。本文还针对所提出的算法,在其推荐的数据库和评估指标基础上进行了定性与定量分析。
上述所有算法在公共数据库中均取得了显著成果,为复杂环境下的显著性目标检测提供了基础。尽管国内外在该领域已有大量研究成果,但仍存在一些亟待解决的问题。(1)传统的非深度学习算法由于依赖人工标注的特征(如颜色、纹理和频率等),容易受到主观经验和感知的影响,导致其准确性较低,从而削弱了显著性目标检测的精度。在复杂环境中,传统非深度学习算法难以应对复杂场景,使得显著性目标检测面临挑战。(2)传统的显著性目标检测方法因依赖人工标注的颜色、纹理和频率等特征,检测精度有限。此外,区域级检测计算成本较高,常忽略空间一致性,且对目标边界的检测效果较差。这些问题需加以解决,以提升显著性目标检测的准确性。(3)在复杂环境下进行显著性目标检测对大多数算法而言仍具挑战性。随着检测环境日益复杂(如背景与前景颜色相似、背景纹理复杂等)、检测目标尺寸不一、前景与背景边界定义模糊等不确定因素增多,大多数显著性目标检测算法面临严峻挑战。
目前大多数算法在检测具有相似前景与背景颜色、复杂背景纹理以及边缘模糊等复杂环境中的显著物体时,表现出较低的准确性。尽管基于深度学习的显著物体检测算法相较于传统检测方法具有更高的准确率,但其所利用的底层图像特征在有效表征语义特征方面仍存在不足,其性能仍有提升空间。
综上所述,本研究提出了一种用于显著性物体检测算法的端到端深度神经网络,旨在提高复杂环境下显著性物体检测的准确性,增强目标边缘,并更好地表征语义特征。本文的贡献如下:(1)首个网络采用 VGG16 作为基础网络,并使用“空洞算法”对其五个池化层进行修改11。该像素级多尺度全卷积神经网络能够从不同的空间尺度学习图像特征,解决了深度神经网络各层感受野固定所带来的挑战,从而提高了对场景中显著关注区域的检测精度。(2)近年来,为提高显著性物体检测的准确性,研究重点集中在利用更深层的神经网络(如 VGG16),以从编码器网络中提取深层特征,同时从解码器网络中获取浅层特征。该方法有效提升了物体边界的检测精度并增强了语义信息,尤其适用于背景多变、物体尺寸不一以及前景与背景边界模糊的复杂环境。(3)近期提升显著性物体检测精度的努力,强调使用更深层网络(包括 VGG16)来提取编码器网络的深层特征和解码器网络的浅层特征。该方法在检测物体边界和增强语义信息方面表现出显著改进,特别是在背景变化、物体尺寸差异以及前景与背景边界不清晰的复杂环境中效果更为突出。此外,还引入了全连接条件随机场(CRF)模型,以增强显著图的空间一致性和轮廓精度。该方法在具有复杂背景的 SOD 和 ECSSD 数据集上进行了评估,结果具有统计学显著性。
相关工作
Fu 等人15提出了一种结合 RGB 图像与深度学习的显著性目标检测联合方法。Lai 等人16引入了一种弱监督模型用于显著性目标检测,通过标注信息学习显著性,主要利用涂鸦标签以节省标注时间。尽管这些算法提出了两种互补网络的融合策略用于显著性目标检测,但对复杂场景下的显著性检测缺乏深入研究。Wang 等人17设计了一种双模式神经网络特征的迭代融合方法,同时结合自下而上和自上而下的信息流,逐步优化前一次迭代的结果直至收敛。Zhang 等人18利用具有双向信息传递机制的深度网络,分别从浅层到深层以及从深层到浅层有效融合了图像的语义与空间信息。Wu 等人19提出了基于互学习深度模型的显著性目标检测方法,该模型在卷积神经网络中利用前景和边缘信息以促进检测过程。这些基于深度神经网络的显著性目标检测模型在公开数据集上取得了显著性能,实现了复杂自然场景中的显著性目标检测。然而,设计性能更优的模型仍是该领域的重要研究目标,也是本研究的主要动机。
整体框架
如图1所示,该模型的示意图主要基于 VGG16 架构构建,融合了像素级多尺度全卷积神经网络(DCL)和深度编码器-解码器网络(DEDN)。该模型去除了 VGG16 的所有最终池化层和全连接层,可适应尺寸为 W × H 的输入图像。其运行机制首先通过 DCL 对输入图像进行初步处理,以提取深层特征,同时从 DEDN 网络中获取浅层特征。这些特征融合后,被输入至全连接条件随机场(CRF)模型,以增强所生成显著性图的空间连贯性和轮廓准确性。
为确定该模型的有效性,研究在具有复杂背景的 SOD20 和 ECSSD21 数据集上进行了测试与验证。输入图像经过 DCL 后,获得具有不同感受野的多尺度特征图,并结合上下文语义信息,生成具有跨维度一致性的 W × H 显著图。DCL 采用一对卷积层(卷积核为 7 × 7)替代原始 VGG16 网络的最终池化层,从而增强特征图中空间信息的保留。结合上下文语义,该结构可生成具有跨维度一致性的 W × H 显著图。类似地,深度编码器-解码器网络(DEDN)在解码器中使用 3 × 3 卷积核的卷积层,并在最后一个解码模块后添加单个卷积层。通过利用图像的深层与浅层特征,能够生成空间维度为 W × H 的显著图,以应对物体边界不清晰的挑战。本研究描述了一种创新的显著目标检测技术,将 DCL 与 DEDN 模型融合为一个统一的网络。这两个深度网络的权重通过训练过程学习获得,生成的显著图随后通过全连接条件随机场(CRF)进行融合与优化。该优化的主要目标是提升空间一致性与轮廓定位精度。
像素级多尺度全卷积神经网络
VGG16 架构最初包含五个池化层,每个池化层的步长为 2。每个池化层通过压缩图像尺寸来增加通道数量,从而获取更丰富的上下文信息。DCL 模型受文献13启发,是在 VGG16 框架基础上的改进。本文采用一种像素级 DCL 模型11,如图 2所示,该模型基于 VGG16 架构,是一种深度卷积神经网络。前四个最大池化层通过三个卷积核相互连接:第一个卷积核为 3 × 3 × 128;第二个卷积核为 1 × 1 × 128;第三个卷积核为 1 × 1 × 1。为了使前四个池化层连接三个卷积核后得到的特征图尺寸统一,且每个特征图尺寸均为原始图像的八分之一,将连接这四个最大池化层的第一个卷积核的步长分别设置为 4、2、1 和 1。
为了在不同卷积核中保持原始的感受野,采用文献中提出的“空洞算法”11,通过在卷积核中添加零值来扩展其尺寸,从而保持卷积核的完整性。这四个特征图以不同的步长连接至第一个卷积核。因此,最终阶段生成的特征图具有相同的维度。这四个特征图构成了一组来自不同尺度的多尺度特征,每个特征图代表不同大小的感受野。从四个中间层获得的特征图与从 VGG16 提取的最终特征图进行拼接,生成一个五通道输出。随后,该输出经过一个 1 × 1 × 1 卷积核并结合 Sigmoid 激活函数处理,最终生成显著图(分辨率为原始图像的八分之一)。通过双线性插值对图像进行上采样和放大,确保所得图像(即显著性图)与原始图像保持相同的分辨率。
深度编码器-解码器网络
同样,采用 VGG16 网络作为骨干网络。VGG16 的特点是浅层特征图通道数量较少但分辨率较高,深层特征通道数量较多但分辨率较低。池化层和下采样虽然提高了深层网络的计算速度,但代价是降低了特征图的分辨率。为解决这一问题,根据文献14中的分析,编码器网络被用于修改原始 VGG16 中最后一个池化层的全连接结构。该修改包括用两个具有 7 × 7 卷积核的卷积层替代原结构(较大的卷积核可扩大感受野)。这两个卷积核均配备归一化(BN)操作和修正线性单元(ReLU)。这一调整使得编码器输出的特征图能够更好地保留图像空间信息。
尽管编码器提升了显著物体全局定位的高层图像语义,但其显著物体的边界模糊问题并未得到有效改善。为解决这一问题,受边缘检测工作的启发12,将深层特征与浅层特征相融合,提出了如图3所示的编码器-解码器网络模型(DEDN)。编码器结构包含三个内核,它们与前四个内核相互连接,而解码器则通过从最大池化层获取的最大值,系统性地提升特征图的分辨率。
在这一显著性目标检测的创新方法中,在解码阶段,采用一个具有 3 × 3 卷积核的卷积层,并结合批量归一化层和自适应线性单元。在解码器结构的最终解码模块结束时,使用一个单通道卷积层以生成空间维度为 W × H 的显著图。该显著图通过编码器-解码器模型的协同融合结果与双重信息的互补融合(即深层信息与浅层信息的互补融合)共同生成。这种方法不仅实现了显著目标的精确定位并扩大了感受野,而且有效保留了图像的细节信息,增强了显著目标的边界。
整合机制
编码器架构包含三个卷积核,它们与 VGG16 模型的前四个最大池化层相关联。相比之下,解码器则被有意设计为通过利用相应池化层获得的最大值,逐步提升从上采样层获取的特征图的分辨率。在解码器中,首先使用一个 3×3 卷积核的卷积层、一个批归一化层以及一个修正线性单元,随后接一个单通道卷积层,以生成尺寸为 W × H 的显著性图。两个深度网络的权重通过交替训练周期进行学习。第一个网络的参数保持固定,而第二个网络的参数则总共训练了五十个周期。在此过程中,用于融合的显著性图权重(S1 和 S2)通过随机梯度进行更新。损失函数11 为:
(1)
在给定的表达式中,符号 G 表示人工标注的值,而 W 表示网络参数的完整集合。βi 作为平衡因子,用于调节在计算过程中显著像素与非显著像素的比例。
图像 I 由三个参数表征:|I|、|I|- 和 |I|+,它们分别表示像素总数、非显著像素的数量和显著像素的数量。
由于上述两个网络获得的显著图未考虑相邻像素的一致性,因此采用全连接的像素级显著性优化模型CRF15来提高空间一致性。其能量方程11如下,用于求解二值像素标记问题。
(2)
其中,L 表示分配给所有像素的二值标签(显著值或非显著值)。变量 P(li) 表示给定像素 xi 被赋予特定标签 li 的概率,即像素 xi 具有显著性的概率。初始时,P(1) = Si,且 P(0) = 1 - Si,其中 Si 表示融合显著图 S 中像素 xi 处的显著性值。θi,j(li,lj) 为成对势函数,定义如下。
(3)
其中,若 li ≠ lj,则 μ(li,lj) = 1,否则 μ(li,lj) = 0。计算 θi,j 时需使用两个核函数,第一个核函数依赖于像素位置 P 和像素强度 I,从而使颜色相近的像素具有相似的显著性值。两个参数 σα 和 σβ 用于调节颜色相似性和空间邻近性对结果的影响程度。第二个核函数的目的是消除孤立的小区域。通过高维滤波实现能量最小化,从而加速条件随机场(CRF)分布的均值场优化。计算完成后,所得到的显著图 Scrf 在检测到的显著性物体的区域中表现出更强的空间一致性与轮廓清晰度。
实验配置
本文使用 Python 构建了一种基于 VGG16 神经网络的显著目标检测深度网络。所提出的模型在 SOD20 和 ECSSD21 数据集上与其他方法进行了比较。SOD 图像数据库以其复杂的杂乱背景、前景与背景之间的颜色相似性以及较小的目标尺寸而著称。该数据集中的每幅图像均被赋予人工标注的真实值,用于定量和定性性能评估。另一方面,ECSSD 数据集主要由来自互联网的图像组成,包含更为复杂且真实的自然场景,图像背景与显著目标之间的对比度较低。
本文用于比较模型的评价指标包括常用的精确率-召回率曲线、Fβ 和 EMAE。为了定量评估预测的显著性图,通过将阈值从 0 到 255 变化以对显著性图进行二值化,从而绘制精确率-召回率(P-R)曲线22。Fβ 是一种综合评估指标,由二值化后的显著图与真实值图计算得到的精确率和召回率公式共同得出。
(4)
其中,β 为用于调节准确率与召回率的权重参数,设 β2 = 0.3。计算 EMAE 等价于计算所得显著性图与真实标注图之间的平均绝对误差,其数学表达式如下:
(5)
设 Ts(u,v) 表示显著图中像素 (u,v) 的提取值,TG(u,v) 表示真实图中对应像素 (u,v) 的值。
访问受限。请登录或开始试用以查看此内容。
1. 实验设置与操作步骤
2. 图像处理
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种端到端的深度神经网络,该网络由两个互补的子网络组成:一种像素级多尺度全卷积网络和一种深度编码器-解码器网络。第一个网络通过融合上下文语义信息,从多尺度特征图中提取视觉对比度,从而解决了深度神经网络在不同层中感受野固定所带来的挑战。第二个网络利用深层和浅层图像特征,以缓解目标物体边界模糊的问题。最后,采用全连接条件随机场(CRF)模型,以提升显著性图的空间一致性和轮廓精度。
本研究对所提出的算法与领域内十种现有算法进行了定性和定量比较。实验结果表明,该算法在提升显著目标检测准确性方面具有有效性。此外,该算法在电力视觉任务中展现出潜在的应用价值,为智能电网领域内多种复杂环境下的应用提供了良好前景。
消融实验
本研究在 SOD 数据库上进行了一系列消融实验,以评估算法的有效性。这些实验的结果详见表 1。(1)用于比较模型的评估指标包括精确率-召回率曲线22、Fβ
访问受限。请登录或开始试用以查看此内容。
本文介绍了一种专门用于在复杂环境中检测显著物体的端到端深度神经网络。该网络由两个相互连接的组件构成:像素级多尺度全卷积网络(DCL)和深度编码器-解码器网络(DEDN)。这两个组件协同工作,通过引入上下文语义信息,在多尺度特征图中生成视觉对比度。此外,它们还利用深层和浅层图像特征,以提高物体边界划分的精度。通过整合全连接条件随机场(CRF)模型,进一步增强了显著性图和轮廓划分的空间一致性。
为实现这一目标,基于 VGG16 架构构建了两个深度网络,即深度上下文学习网络(Deep Context Learning, DCL)和深度编码器-解码器网络(Deep Encoder-Decoder Network, DEDN)。如操作步骤 1.2 所述,输入图像经 DCL 处理后生成具有不同尺度的特征图,其特点是具有不同的感受野。这些特征图随后与上下文语义信息相结合,最终生成尺寸为 W × H 且具备跨维度一致性的显著性图。具体而言,DCL11 采用一对卷积层,每层均配备 7 × 7 的卷积核,以替代原始 VGG16 网络中的最后一个池化层。该...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
本工作由2024年河南省高等学校重点科研项目资助计划(项目编号:24A520053)资助。本研究还得到河南省特色示范课程专项建设与融合创新项目的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Matlab | MathWorks | Matlab R2016a | MATLAB 的编程接口提供了一系列开发工具,用于提升代码质量、可维护性并最大化性能。 它提供了使用自定义图形界面构建应用程序的工具。 它还提供了将基于 MATLAB 的算法与外部应用程序和语言集成的工具。 |
| 处理器 | Intel | 11 代 Intel(R) Core(TM) i5-1135G7 @ 2.40GHz | 64 位 Win11 处理器 |
| Pycharm | JetBrains | PyCharm 3.0 | PyCharm 是一款 Python 集成开发环境(IDE) 所需的 Python 模块列表: matplotlib skimage torch os time pydensecrf opencv glob PIL torchvision numpy tkinter |
| PyTorch | PyTorch 1.4 | PyTorch 是一个基于 Torch 的开源 Python 机器学习库,用于自然语言处理及其他应用。PyTorch 既可被视为支持 GPU 的 NumPy,也可被视为具有自动微分功能的强大深度神经网络框架。 |
访问受限。请登录或开始试用以查看此内容。