本研究提出了一种多模态深度学习框架,通过使用预训练的GARNN模型融合音视频特征,实现视频摘要。该系统利用门控循环单元(GRU)、AlexNet以及对抗性长短期记忆(LSTM)分类器,增强了关键帧检测能力,减少了冗余信息,并实现了较高的摘要准确率,平均F值达到0.985。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AlexNet(预训练模型) | MATLAB / PyTorch | PyTorch Hub — AlexNet 预训练模型:https://pytorch.org/hub/pytorch_vision_alexnet/ | 用于视觉特征提取 |
| FFmpeg | FFmpeg.org | https://ffmpeg.org/ | 从视频中提取音频 |
| 基于 GRNN 的模型 | 自定义实现 | 库 “neupy” 实现了 GRNN:http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.html | 用于多模态特征融合 |
| LSTM(长短期记忆网络) | PyTorch | https://pytorch.org/docs/stable/generated/torch.nn.LSTM.html | 应用于选择器、编码器和解码器 |
| 多模态电影分析库(Multimodal_movie_analysis lib) | GitHub | https://github.com/tyiannak/multimodal_movie_analysis | 用于视觉特征提取 |
| NumPy | Python 软件基金会 | https://pypi.org/project/numpy/ | 数值计算与矩阵运算 |
| PCA(主成分分析) | Scikit-learn | https://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.html | 降维处理 |
| PyAudioAnalysis | GitHub | https://github.com/tyiannak/pyaudioanalysis | 音频特征提取 |
| PyTorch | PyTorch 基金会 | https://pytorch.org/ | 深度学习框架 |
| SumMe 数据集 | 公开数据集 | https://gyglim.github.io/me/vsum/index.html | 视频摘要基准数据集 |
| VSUMM 数据集 | 公开数据集 | http://www.vision.ime.usp.br/~creativision/vsumm/ | 视频摘要基准数据集 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可