研究文章

GARNN-AE-LSTM:一种用于高精度视频摘要的多模态深度学习方法

DOI:

10.3791/69097

2025年10月10日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种多模态深度学习框架,通过使用预训练的GARNN模型融合音视频特征,实现视频摘要。该系统利用门控循环单元(GRU)、AlexNet以及对抗性长短期记忆(LSTM)分类器,增强了关键帧检测能力,减少了冗余信息,并实现了较高的摘要准确率,平均F值达到0.985。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

视频摘要旨在通过保留关键内容,创建长视频的简洁版本。本研究提出了一种多模态机器学习策略,通过使用预训练的门控循环神经网络架构(称为GARNN),结合门控循环单元(GRUs)与AlexNet,整合视觉与听觉信息,以提取音频、图像及视觉特征。通过去除冗余帧并应用运动补偿的特征降维,辅以可选的基于主成分分析(PCA)的降维方法,提升了关键帧检测效果。采用基于对抗编码器的长短期记忆网络(AE-LSTM)分类器进行时间建模,实现了高精度的摘要生成。实验结果通过敏感性、F值和阳性预测值进行评估,该方法取得了平均0.985的F值。在多模态GARNN-AE-LSTM框架中引入了门控AlexNet,其中基于运动补偿的PCA降维消除了冗余,GRU记录时间序列变化,门控机制精细调节空间特征选择,共同构建了一个更准确、高效的视频摘要系统。提升后的F1分数表明该模型在生成具有语义连贯性的视频摘要方面具有有效性。该方法凸显了多模态特征提取与先进深度学习技术在鲁棒性视频分析与压缩中的应用潜力。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

多模态分析(MMA)系统已逐渐兴起,通过整合音频、视频、文本和传感器数据等多种模态,深入揭示学生的学习过程1。这些技术可通过评估多模态数据,帮助全面理解学生的行为表现和参与程度2。然而,在构建高效的MMA系统时仍面临诸多挑战与限制3。随着互联网的发展和监控摄像头的普及,产生了大量数字视频,迫切需要将这些视频整合至数据库中。在此背景下,视频摘要技术具有重要意义。视频摘要旨在生成原始视频的有效概要,有助于活动追踪、异常检测和视频检索4。实现视频摘要可采用多种策略,这些方法通常分为两类5抽取式视频摘要和生成式视频摘要。

由于视频摘要需要大量计算,因此需要高效的方法。如果对视频中的每一帧都进行分析以供选择,摘要过程可能会变得缓慢而冗长,并且处理资源可能被消耗在相同或相似的帧上。此外,为了加快处理速度并确保仅考虑重要特征,应对任何特征集进行降维处理6。根据生成并向最终用户展示的音视频信号类型7或其输出形式,视频摘要技术可分为四大类。具体而言,视频摘要的计算结果可能包括:(i) 关键帧

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

This study proposes a multimodal supervised video summarizing method that falls into the generic video summarization category, commonly referred to as video skimming. This includes techniques that concentrate on finding key segments of a larger video to create a temporally condensed version of it. This study suggests a supervised technique to analyze the video stream in 1 s sections that include audio and visual representations, as shown in Figure 1. These segments are then categorized as either "uninteresting" or "informative". As opposed to synthetic or simulated data, "real data" now refers to the actual video datasets utilized for exp....

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

基于GARNN的特征提取和基于AGLSTM的长视频摘要方法在两个数据集(即VSUMM和SumMe)上进行了实验。本节讨论实验结果,并与传统方法进行比较。对于判别器LSTM,我们采用具有两层、每层1024个隐含单元的LSTM。对于编码器LSTM和解码器LSTM,我们分别采用两个两层LSTM,每层包含2048个隐含单元。研究表明,试图存储并合成逆序序列的解码器LSTM更易于训练26。我们的解码器LSTM也以逆序方式重构特征序列。编码器LSTM和解码器LSTM模型的初始化采用了在原始视频特征序列上预训练的循环自编码器模型的设置。我们发现,这有助于加快收敛速度,并提升整体准确性。

评估指标
本研究采用的评估指标包括阳性预测值(PPV)、敏感性(SE)、F1 分数和总体准确率(OA)。视频摘要的目标是在减少冗余帧的同时选择出相关帧。由于准确率无法反映关键帧的不平衡问题,因此不适合作为视频摘要的评估指标。阳性预测值用于避免选择过多不重要的帧,从而确保生成简洁且高质量的摘要。敏感性用于确保摘要不遗漏关键片段.......

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种利用高效多模态机器学习(ML)与深度学习(DL)模型对长视频进行视频摘要的方法,该模型利用从输入数据生成的音频、图像和视觉模态信息。通过训练二分类器,模型可学习区分重要片段(即生成的摘要部分)与被舍弃的“非重要”片段。模型在SumMe和VSUMM等数据集上进行训练,并通过各项指标验证了其可扩展性。首先,采用GARNN模型从视频中提取特征,再通过主成分分析(PCA)进一步处理以降低维度。利用基于AELSTM的分类器,从定量与定性两个方面对模型效率进行评估。为证明该模型的优越性,将其与四种现有的基于音频、图像和视频特征的ML与DL视频摘要方法进行了比较。实验结果表明,多模态特征的重要性显著提升了模型性能:在SumMe数据集上,PPv达到0.947,敏感度为0.982,F1分数为0.956,总体准确率(OA)为98.4%;在VSUMM数据集上,PPv为0.952,敏感度为0.971,F1分数为0.943,OA为98.5%,在敏感度、F1分数和OA方面均优于传统系统。该模型在基准数据集上的卓越表现凸显了多模态特征的关键作用。该方法不仅在监控监测、医学视频分析、教育视频压缩以及媒体内容摘要等方面具有实用价值,还为多模态表征学习与时.......

访问受限。请登录或开始试用以查看此内容。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢四川电影电视大学电视学院的Dr. Television School提供实验室设施,以开展本研究工作。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
AlexNet(预训练模型)MATLAB / PyTorchPyTorch Hub — AlexNet 预训练模型:https://pytorch.org/hub/pytorch_vision_alexnet/用于视觉特征提取
FFmpegFFmpeg.orghttps://ffmpeg.org/从视频中提取音频
基于 GRNN 的模型自定义实现库 “neupy” 实现了 GRNN:http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.html用于多模态特征融合
LSTM(长短期记忆网络)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.html应用于选择器、编码器和解码器
多模态电影分析库(Multimodal_movie_analysis lib)GitHubhttps://github.com/tyiannak/multimodal_movie_analysis用于视觉特征提取
NumPyPython 软件基金会https://pypi.org/project/numpy/数值计算与矩阵运算
PCA(主成分分析)Scikit-learnhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.html降维处理
PyAudioAnalysisGitHubhttps://github.com/tyiannak/pyaudioanalysis音频特征提取
PyTorchPyTorch 基金会https://pytorch.org/深度学习框架
SumMe 数据集公开数据集https://gyglim.github.io/me/vsum/index.html视频摘要基准数据集
VSUMM 数据集公开数据集http://www.vision.ime.usp.br/~creativision/vsumm/视频摘要基准数据集

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J.

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

F1

相关文章