本研究提出了一种多模态深度学习框架,通过使用预训练的GARNN模型融合音视频特征来实现视频摘要。该系统利用GRU、AlexNet以及对抗式LSTM分类器,增强了关键帧检测能力,减少了冗余信息,并实现了较高的摘要准确率,平均F值达到0.985。
研究文章
本研究提出了一种多模态深度学习框架,通过使用预训练的GARNN模型融合音视频特征来实现视频摘要。该系统利用GRU、AlexNet以及对抗式LSTM分类器,增强了关键帧检测能力,减少了冗余信息,并实现了较高的摘要准确率,平均F值达到0.985。
视频摘要旨在通过保留关键内容,生成冗长视频的简洁版本。本研究提出一种多模态机器学习策略,通过采用预训练的门控循环神经网络架构(称为GARNN),结合门控循环单元(GRUs)与AlexNet,整合视觉与听觉信息,以提取音频、图像及视觉特征。通过去除冗余帧并应用运动补偿的特征降维,辅以可选的基于主成分分析(PCA)的降维方法,提升了关键帧检测效果。采用基于对抗编码器的长短期记忆网络(AE-LSTM)分类器进行时间建模,实现了高精度的摘要生成。通过敏感度、F值和阳性预测值对结果进行评估,该方法取得了平均0.985的F值。在多模态GARNN-AE-LSTM框架中引入了门控AlexNet,其中基于运动补偿的PCA降维消除了冗余,GRU记录时间序列变化,门控机制精细调节空间特征选择,共同构建了一个更准确、高效的视频摘要系统。提升后的F1分数表明该模型在生成具有实际意义的视频摘要方面具有良好的准确性。该方法凸显了多模态特征提取与先进深度学习技术在鲁棒性视频分析与压缩中的应用潜力。
多模态分析(Multimodal Analysis, MMA)系统逐渐兴起,通过整合音频、视频、文本和传感器数据等多种模态,深入揭示学生的学习过程1。这些技术可通过评估多模态数据,帮助全面理解学生的行为表现和参与程度2。然而,在构建高效的MMA系统时仍面临诸多挑战与限制3。随着互联网的发展和监控摄像头的普及,产生了海量的数字视频,迫切需要将这些视频整合至数据库中。在此背景下,视频摘要技术具有重要意义。视频摘要旨在生成原始视频的有效概要,有助于行为追踪、异常检测以及视频检索4。实现视频摘要可采用多种策略,这些方法通常分为两类5,即抽取式和生成式视频摘要。
由于视频摘要需要大量计算,因此需要高效的方法。如果对视频中的每一帧都进行分析以供选择,摘要过程可能会变得缓慢而耗时,并且处理资源可能被浪费在相同或相似的帧上。此外,为了加快处理速度并确保仅考虑重要特征,应对任何特征集进行降维处理6。根据生成并向最终用户展示的音视频信号类型7,或其输出形式,视频摘要技术可分为四大类。具体而言,视频摘要的计算结果可能包括:(i) 关键帧8,即按顺序显示的提取出的视频帧,通常称为静态摘要;(ii) 视频片段9,被称为动态摘要;(iii) 视觉信号10,通过向其他提示信息添加基于图形的语法来增强用户对摘要的理解;以及 (iv) 由计算机生成的文本注释11,旨在对视频信息提供高效的概括。
基于关键帧的摘要通常比基于关键片段的摘要更小。关键帧指的是从视频中选取的单个代表性画面。关键片段则指围绕关键帧分组的一段较短的连续视频帧。摘要类别是指分类器的输出结果,用于将帧或片段标记为信息性(需包含在摘要中)或非信息性(应排除)。然而,这种优势的代价是在摘要过程中可能遗漏重要细节。例如,在基于关键帧的摘要中,可能难以获取前一帧的上下文信息,同时也缺少原始声音。为解决这些问题,通常选择基于关键片段的视频摘要技术。基于关键片段的视频摘要技术可用于生成长格式或短格式视频的子集。短格式和长格式视频的时长通常分别少于和超过10分钟12。由于短格式视频本身的回放时间已很短暂,为其生成基于关键片段的子集并不现实,且可能无法取得理想效果。此外,长格式视频(尤其是电影或体育赛事视频)的播放时间可能超过90分钟。对于此类视频,基于关键片段的摘要技术在为用户提供简要概览方面更为有效和实用。
视频摘要的主观性使其成为一项艰巨的任务。这是因为即使面对相似的视频内容,每位用户也有各自不同的偏好。借助定制化的视频摘要方法,这一问题可以得到精准解决13。该算法的目标是为每位用户提供符合其兴趣的内容。然而,针对新的长视频(如体育赛事)生成具有理想时长的个性化摘要目前尚难以实现。现有方法14,15需要消耗大量计算资源,以实时评估用户偏好数据和视频内容,从而生成个性化的摘要。实时的个性化视频摘要通常依赖于集中式的专用服务器。Babu Veesam 和 Satish16对主要的视频摘要策略进行了全面的分类学分析,有效展示了广泛使用的方法如何压缩海量视频数据。该综述根据基本方法对各类技术进行了分类与评估,包括多模态融合策略、深度学习框架以及基于聚类的方法。其中值得注意的方法包括KDAN框架,该方法利用知识蒸馏实现有监督的摘要生成;以及SVS_MCO方法,该方法采用人工藻类算法优化的DBSCAN聚类。此外,综述还介绍了诸如视听循环网络(Audio-Visual Recurrent Network)和基于查询的深度非洲秃鹫学习(Query-based Deep African Vulture Learning)等先进模型,这些模型在应对动态且多模态的视频摘要问题方面表现出色。
本研究的创新之处在于引入了一种用于视频摘要的门控 AlexNet 循环神经网络(GARNN-AE-LSTM)多模态框架。该方法通过采用运动补偿的主成分分析(PCA)减少冗余、利用门控循环单元(GRU)捕捉时间动态特性,并结合门控机制优化空间特征选择,从而提高了视频摘要的准确性和效率。为实现复杂度降低且高效的视频摘要,本文做出了以下贡献:(i)多模态视频摘要:提出一种融合视觉与听觉信息的框架,通过结合门控循环神经网络与 AlexNet 的预训练 GARNN 模型生成简洁的视频摘要。(ii)用于特征优化的门控 AlexNet:在 AlexNet 的全连接层中引入一种新颖的门控机制(Sigmoid 门),以过滤无关的空间特征,从而增强高层视觉特征的提取能力;与循环神经网络(RNN)的结合可有效建模帧间的时间依赖关系。(iii)冗余帧消除:开发了一种基于运动补偿方差的方法,在关键帧检测前去除相同或相似的帧,并可选地采用基于 PCA 的降维方法以实现高效的特征表示。(iv)精确的关键帧检测:采用基于对抗编码器的 LSTM 分类器进行时间建模,平均 F 值达到 0.985,表明其摘要准确性显著优于基线方法。(v)相较于 Transformer 模型的高效性:结果表明,所提出的 GARNN 模型在计算上更为高效,其中 AlexNet 能有效捕捉空间特征,RNN 建模序列依赖关系,门控机制过滤不重要的帧,在特征选择与摘要性能上优于基于 Transformer 的替代方案。
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种多模态有监督视频摘要方法,属于通用视频摘要类别,通常称为视频快照。该方法包括旨在发现较长视频中关键片段的技术,以生成时间上压缩的版本。本研究建议采用一种有监督技术,将视频流按1秒片段进行分析,每个片段包含音频和视觉表征,如图1所示。这些片段随后被分类为“无趣”或“信息丰富”两类。与合成或模拟数据不同,“真实数据”现指实验中所使用的实际视频数据集。那些提供摘要所需重要音视频信号的视频片段——例如高运动量、语音或场景转换——被称为“信息丰富片段”。“无趣”部分则定义为重复或冗余的帧,对摘要内容无新贡献。
输入视频被分割成帧,然后使用所提出的 GARNN 模型从每一帧中提取多模态特征。音频和视觉特征被融合后作为输入送入降维阶段,在该阶段中移除冗余帧以进行后续处理。最后,将所提出的 AELSTM 应用于降维后的数据以实现视频摘要。为此,采用一种监督式二分类器,该分类器使用来自视觉、音频或混合模态(称为多模态)的特征表示进行训练。

图1:所提出的视频摘要模型的概述。该流程包括多模态特征提取、降维以及使用AELSTM生成摘要。请点击此处查看此图的放大版本。
数据集
所提出方法的有效性通过 VSUMM17 和 SumMe18 数据集进行评估,这两个数据集是静态视频摘要领域的基准数据集。其中包括使用 AlexNet 与 LSTM 生成的 CNN 特征以及真实数据。这些真实数据和数据集均向公众开放19。VSUMM 数据集包含来自 YouTube 等网站的 50 部影片,每部视频以每秒 30 帧的速度播放,总时长约为 110 分钟。这些视频涵盖多种类型,包括动画、新闻、体育、广告、电视剧和家庭录像。其中,25 个视频来自 YouTube 网站,内容涉及节日、庆典和体育活动,并由人工生成至少 15 个摘要(共 390 个),构成“SumMe”20 视频摘要数据集。视频的时长范围为 1 至 6 分钟。
原始视频被转换为 RGB 图像,并作为输入送入预训练的 GARNN 模型以进行特征提取。该模型由 AlexNet 和一个门控 RNN 组成。原始特征数量为 64,而来自 AlexNet 的特征具有 4100 个特征。
基于门控 AlexNet-RNN 的特征提取方法
视频摘要同时利用了视觉和听觉两种信息模式。为了在两种模态中实现特征表示,我们选取了常用于音频与视觉聚类及分类任务(如图像检索、视频分类、听觉场景分析和音乐信息检索)中的手工设计特征。目标是尽可能包含更多具有教学意义的视觉和听觉成分。图2 展示了用于提取音频和视觉模态特征的流程概念示意图。

图 2:基于多模态GARNN的特征提取方案。 视觉和音频模态的特征分别通过AlexNet和GARNN组件进行提取。请点击此处查看该图的放大版本。
门控 AlexNetRNN:(GARNN)
在虚拟图像分析中,卷积神经网络(CNN)是一种流行的深度学习模型21。通常,CNN 将图像作为输入,并将其划分为多个组。其结构由输入神经元、一系列包含卷积池化的层、全连接层以及归一化层组成22。卷积层中的神经元通过一个狭窄区域与前一层相连。其下方的层则与全连接层的激活神经元完全连接。公式(1)表示全连接函数的前向与反向传播过程。
(1)
(2)
何处
是 i 的激活th 神经元在 lth 层是,
是 i 的梯度th 神经元在 lth 层
是第 i 个的权重th l+1 层中的神经元th 层。随着近期研究的进展,多种卷积神经网络(CNN)设计相继出现。本研究采用了AlexNet。
AlexNet 的架构如图3所示,体现出精细且结构严谨的设计。其八层学习层由三个全连接层和五个卷积层组成。通过将最后一层的输出输入至 softmax 激活函数,生成分类标签。第二、第四和第五层的卷积核通过 GPU 共享方式与其前一层相连。第二层与第三层的卷积核彼此之间为全连接。归一化层连接在第一层和第二层之后的最大池化层之后。所有学习层均连接 ReLU 激活函数。

图 3:AlexNet 的结构。 该摘要模型采用五个卷积层和三个全连接层来处理视觉数据。 请点击此处查看该图的放大版本。
本研究的主要骨干网络为密集层 GARNN。该网络在深层 RNN 中包含三层结构,其中第一层包含 170 个神经元,第二层包含 80 个神经元,由两个全连接(fc)层构成。其后接批归一化层和 dropout 层。全连接层作为最后一层,由三个神经元组成,用于对图像进行分类分割。在 LSTM 之后的密集层用于划分脑肿瘤周围的区域。AlexNet 为 LSTM 层提供特征输入。数据集最多包含 20 个切片,等于已声明序列的总数。GARNN 的第一层包含 100 个隐含单元,而第三层包含 125 个隐含单元。
在我们提出的 GARNN-AE-LSTM 框架中,门控机制被引入到 AlexNet 的稠密(全连接)层中。AlexNet 通常处理卷积特征图,并将其直接送入全连接层进行分类。该方法对所有提取的空间特征(包括冗余或较不重要的模式)一视同仁。我们通过引入基于 sigmoid 函数的门控函数作为特征过滤器来解决这一问题。从数学上讲,门控向量 g = σ(wX) + b 对稠密层的输出进行调制,其中 σ 表示 sigmoid 函数。在训练过程中,该门控机制学习为不同特征激活分配 0 到 1 之间的权重,具体表现为:(i) 较低的门控值抑制无关特征(例如背景噪声或冗余纹理);(ii) 较高的门控值突出判别性特征(例如关键物体区域或对运动敏感的模式);(iii) 经优化后的特征集随后被 RNN 组件使用,使其能够更有效地捕捉时间依赖性,而不受无关空间信息的干扰;(iv) 在训练过程中,通过反向传播同步调整门控参数以及 AlexNet 和 RNN 的参数。这意味着模型会逐渐学习到除了应提取哪些特征之外,在视频摘要任务中哪些特征最为重要。
在图4中,变量 X 表示输入数据,C 表示细胞,H 表示隐藏状态。

图4:门控循环神经网络架构(GARNN)模型。 GARNN 融合了批量归一化、弃权层(dropout)以及多个全连接层,以实现高效的序列建模。请点击此处查看此图的放大版本。
在每个模块中,相应的权重,如 Iw、Rw 和偏置(分别称为输入权重、循环权重和偏置)已在公式(3)至公式(5)中使用
(3)
(4)
(5)
在某一时间戳 t 时,细胞的状态如公式(6)所示
(6)
何处
Hadamard积与隐含单元状态的乘积如公式(7)所示
(7)
因此,该方法利用 py Audio Analysis 模块,通过 ffmpeg(https: //github.com/tyiannak/pyaudioanalysis)23 计算从相应视频文件中提取的每个音频片段的片段级音频特征。提取的特征列于表 1中。根据此流程,首先临时进行音频特征提取。最终的表示部分由在第二层级上计算的片段级特征统计量构成。具体而言,对音频信号的每个片段执行短期处理,从而在每个片段级窗口(可重叠或不重叠)上计算出 68 个短期特征(34 个特征及其对应的 34 个 delta 特征)。除了从各视频的音频信号中提取听觉元素外,我们还使用了多种视觉特征来传达视觉信息的内容。该模态预计在摘要过程中起关键作用。为提取这些视觉元素,采用了 multimodal_movie_analysis 库(https://github.com/tyiannak/multimodal_movie_analysis)来提取反映视频视觉特性的特征。具体而言,每 0.2 秒从对应的帧中提取下文所列的 88 个视觉元素。在此基础上,对多模态特征进行融合,并在视频摘要过程中,使用共计 59 个特征进一步分析,以将视频分类为具有信息性或无趣。
使用主成分分析(PCA)进行特征降维
本研究通过应用主成分分析(PCA)降低了特征的维度。基本特征被转换为关键特征,以增强其显著性和重要性。PCA 已被众多研究者广泛应用于多个领域24。特征的选取依据其特征值来确定,保留特征值最高的特征,去除特征值最低的特征。
在去除冗余帧后,本研究将主成分分析(PCA)作为可选的特征降维步骤。PCA 通过将 GARNN 生成的高维特征向量压缩至低维子空间,抑制噪声和冗余信息。这提高了 AE-LSTM 的计算效率,同时确保关键帧检测由最具判别性的视觉和听觉线索主导。为了在视频摘要的可扩展性与准确性之间取得平衡,PCA 被用作一种有效的工具。该算法(算法 1)见补充文件 1。
任何与前一帧完全相同或极为相似的帧均被视为冗余。显然,改变帧率会影响被移除视频帧的比例。具体而言,随着帧率的增加,连续帧之间的相似性也随之增加,导致被移除的帧比例更高。现在,使用降维后的特征来训练机器学习模型,该模型称为对抗性 AE-LSTM 模型。
使用 AELSTM 进行训练
一种称为生成对抗网络(GAN)25 的神经网络由两个相互竞争的子网络组成:i) 一个“生成器”网络(G),用于生成类似于未知分布的数据;ii) 一个“判别器”网络(D),用于区分生成的样本与真实观测数据中的样本。其目标是找到一个生成器,使其在拟合真实数据分布的同时,最大化判别器犯错的可能性。
假设 X 为输入,E 为先验输入噪声,X’ = g(E) 为生成的样本。通过极小极大优化,学习过程被表述为:
(8)
其中 D 被设计为能够获得正确的分类概率。我们所构建的训练模型的各个组成部分如图5所示。选择器 LSTM 从输入视频序列 X 中选取帧的子集。所选帧通过编码器-LSTM 转换为固定长度的特征 E,随后利用解码器-LSTM 重建视频 X'。判别器-LSTM 对 X' 进行分类,判断其属于真实视频或摘要类别。在本研究中,采用具有生成对抗网络(GAN)结构的 AE-LSTM 实现高效、多样且结构化的视频摘要。自编码器(AE)可消除不必要的背景变化,LSTM 能够检测场景转换,而非将帧视为静态图像;在 GAN 中,生成器负责对视频进行摘要,而判别器则确保摘要内容的多样性。

图5:AELSTM摘要模型的架构。 包含选择器-LSTM(Selector-LSTM)、编码器-LSTM(Encoder-LSTM)、解码器-LSTM(Decoder-LSTM)和判别器-LSTM(Discriminator-LSTM),通过对抗训练优化视频摘要。 请点击此处查看该图的放大版本。
通过为输入视频 X 中每一帧提供 GARNN 特征,其中 X 表示为
,摘要生成器利用选择器 LSTM 来选取帧的子集,编码器将这些帧编码为 E,随后解码器在每一帧 xt 处将视频重构为 X'。选择器在选择帧时会利用重要性评分。特征通过评分赋予的权重值确定,然后传递给编码器。对于评分 st = 1 的每一帧,仅该子集被编码器接收。判别器通过估计 X 与 X' 之间的距离并分配标签,来判断视频属于原始视频或摘要视频。在此情况下,判别器计算原始视频与摘要视频之间的误差。算法 2(补充文件 2)描述了用于视频摘要的 AELSTM 训练过程的摘要方法。
后处理——视频摘要
在训练完成后,可利用分段级分类器生成视频摘要。实现此目标包含三个步骤:(i)确定每个视频片段的音频、视觉或融合特征;(ii)使用相应的音频、视觉或融合分类器对每个视频片段进行分类;(iii)对有序的分类器预测结果进行后处理,以避免明显的错误。
为满足这一需求,已开发出包含两种不同滤波器的流程,用于后处理步骤。首先,输入数组会经过长度为 N1 的中值滤波器处理,该滤波器利用局部窗口对序列分类器的预测结果进行平滑。随后,通过一种简单的硬性滤波方法确定最终预测结果:若某序列中包含至少 N2 个连续的正向预测(即信息片段),则保留该序列。换言之,该准则要求一个有效片段持续时间至少达到 N2 秒。
访问受限。请登录或开始试用以查看此内容。
基于GARNN的特征提取和基于AGLSTM的长视频摘要方法在两个数据集(即VSUMM和SumMe)上进行了实验。本节讨论实验结果,并与传统方法进行比较。对于判别器LSTM,我们采用具有两层、每层1024个隐含单元的LSTM。对于编码器LSTM和解码器LSTM,我们分别采用两个两层LSTM,每层包含2048个隐含单元。研究表明,旨在存储和合成逆序序列的解码器LSTM更易于训练26。我们的解码器LSTM也以逆序方式重构特征序列。编码器LSTM和解码器LSTM模型的初始化采用了在原始视频特征序列上预训练的循环自编码器模型的设置。我们发现,这种方法能够加快收敛速度,并有助于提高整体准确性。
评估指标
本研究采用的评估指标包括阳性预测值(PPV)、敏感性(SE)、F1 分数和总体准确率(OA)。视频摘要的目标是在减少冗余帧的同时选择出相关帧。由于准确率无法反映关键帧的不平衡问题,因此不适合用于评估视频摘要效果。阳性预测值用于避免选择过多不重要的帧,从而确保生成简洁且高质量的摘要。敏感性用于确保摘要不遗漏...
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种利用高效多模态机器学习(ML)与深度学习(DL)模型对长视频进行视频摘要的方法,该模型利用从输入数据中生成的音频、图像和视觉模态信息。通过训练二分类器,模型可学习区分重要片段(即生成的摘要部分)与被舍弃的“非重要”片段。模型在SumMe和VSUMM等数据集上进行训练,并通过各项指标验证了其可扩展性。首先,使用GARNN模型从视频中提取特征,再通过主成分分析(PCA)进一步处理以降低维度。采用基于AELSTM的分类器,从定量与定性两个方面对模型效率进行评估。为证明本模型的优越性,将其与四种现有的基于音频、图像和视频特征的ML与DL视频摘要方法进行了比较。实验结果表明,多模态特征的重要性显著提升了性能:在SumMe数据集上,PPv达到0.947,敏感度为0.982,F1分数为0.956,总体准确率(OA)为98.4%;在VSUMM数据集上,PPv为0.952,敏感度为0.971,F1分数为0.943,OA为98.5%,在敏感度、F1分数和OA方面均优于传统系统。模型在基准数据集上的卓越表现突显了多模态特征的关键作用。该方法不仅在监控监测、医学视频分析、教育视频压缩以及媒体内容摘要等方面具有实用价值,还为多模态表征学习与时间模...
访问受限。请登录或开始试用以查看此内容。
作者感谢四川电影电视大学电视学院的 Dr. Television School 提供实验室设施,以开展本研究工作。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AlexNet(预训练模型) | MATLAB / PyTorch | PyTorch Hub — AlexNet 预训练模型:https://pytorch.org/hub/pytorch_vision_alexnet/ | 用于视觉特征提取 |
| FFmpeg | FFmpeg.org | https://ffmpeg.org/ | 从视频中提取音频 |
| 基于 GRNN 的模型 | 自定义实现 | 库 “neupy” 实现了 GRNN:http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.html | 用于多模态特征融合 |
| LSTM(长短期记忆网络) | PyTorch | https://pytorch.org/docs/stable/generated/torch.nn.LSTM.html | 应用于选择器、编码器和解码器 |
| 多模态电影分析库(Multimodal_movie_analysis lib) | GitHub | https://github.com/tyiannak/multimodal_movie_analysis | 用于视觉特征提取 |
| NumPy | Python 软件基金会 | https://pypi.org/project/numpy/ | 数值计算与矩阵运算 |
| PCA(主成分分析) | Scikit-learn | https://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.html | 降维处理 |
| PyAudioAnalysis | GitHub | https://github.com/tyiannak/pyaudioanalysis | 音频特征提取 |
| PyTorch | PyTorch 基金会 | https://pytorch.org/ | 深度学习框架 |
| SumMe 数据集 | 公开数据集 | https://gyglim.github.io/me/vsum/index.html | 视频摘要基准数据集 |
| VSUMM 数据集 | 公开数据集 | http://www.vision.ime.usp.br/~creativision/vsumm/ | 视频摘要基准数据集 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可