本文介绍了AQVSO(自适应质量视频流优化)框架,作为先进神经模型与优化模型的整合,旨在提升5G及下一代网络中的视频流。该框架提升视频质量,减少缓冲,并优化资源使用。
Method Article
本文介绍了AQVSO(自适应质量视频流优化)框架,作为先进神经模型与优化模型的整合,旨在提升5G及下一代网络中的视频流。该框架提升视频质量,减少缓冲,并优化资源使用。
AQVSO(自适应质量视频流优化)是一个新的视频流框架,旨在提升5G及以上网络中的视频流质量和资源利用率。本研究提出了一个端到端多神经网络,由四个相关模块组成,这些模块包含带策略驱动编码器的稀疏卷积网络(SCN-PDE)、稀疏图注意力卷积网络(SGA-ConvNet)、自适应尖峰神经网络(ASNN)以及带有蚂蚁群落优化的深度信念网络(DBN-ACO)。这些元素会根据数学模型动态调整网络变化,旨在平衡质量与资源使用。UCF-101数据集上的实验显示,AQVSO保持的SSIM分数与最先进算法BBA和BOLA相似(0.977),同时所需的带宽更少(4,936/8,000 kbps)。该框架在保持高感知质量(PSNR = 45.89 dB)的同时,可节省38%的带宽消耗,并且几乎消除了缓冲现象。该系统在移动、内容分发网络(CDN)和企业环境下实现了99.9%的流媒体确定性,为资源有限的视频传输系统带来了实际的性能提升。这得益于通过自适应、内容感知的流媒体决策,提供可管理的用户体验和高效利用网络资源。
本研究的目标是开发一个集成的多神经自适应流式流框架,称为AQVSO,能够共同优化动态5G及更高网络条件下的感知视频质量和带宽利用率。该方法旨在将内容分析、速率控制和资源分配统一为单一决策架构,以显著降低比特率要求实现一致的体验质量(QoE)。
自适应质量视频流优化(AQVSO)
在5G及以后时代,AQVSO专注于通过采用多神经网络模型,智能平衡感知质量与资源利用,提升视频流体验质量(QoE)。这种网络感知调度策略能够解决在时间变化或不稳定的网络环境中,降低带宽消耗和服务器拥堵的同时,提供高质量视频流的挑战。
截至2023年,视频流量占全球移动数据总量的80%以上,推动了高效的多媒体传输系统需求达到历史新高。3。传统网络正在转型为敏捷、虚拟化、基于软件的网络,这些网络由软件定义网络(SDN)、网络功能虚拟化(NFV)、多接入边缘计算(MEC)以及第五代(5G)环境中的云/边缘计算支持 4,5。这些进步使下一代应用能够实现更快的数据速率、更低延迟和更高的连接密度6.
鉴于竞争日益激烈,体验质量(QoE)已成为服务提供商最重要的衡量指标之一 7,8。QoE不仅包含传统的服务质量(QoS)指标,还增加了用户感知,并将客观的服务质量参数与用户的主观体验因素(如期望、情绪和偏好9、10、11)整合起来。在多媒体服务方面,QoE直接影响终端用户满意度,可视为整体质量评估的通用指标,将用户体验与应用和通信系统性能联系起来。
视频流的QoE依赖于延迟、码率和视觉质量等参数。数据增长和容量限制导致的网络拥堵影响了流媒体质量的连续性13,14。常见方法提供可变的视频属性(具有不同的帧率和分辨率),但用户移动性和无线频道变化需要更智能的管理策略 15,16,17。
当前的自适应流解决方案在动态条件下受到很大限制。基于HTTP的动态自适应流(DASH)依赖客户端启发式,这些方法在不可预测的无线环境中可能失效。有一些基于强化学习(RL)的方法,如Pensieve,有助于适应,但计算成本高且需要大量训练数据。基于缓冲区的算法(BBA)主要考虑缓冲区占用率,忽略内容复杂性和感知质量20。模型预测控制(MPC)高度依赖带宽预测,而带宽预测在移动环境中可能失效21。BOLA(基于缓冲区占用的Lyapunov算法)主要关注回放工具,未充分考虑质量公平性。
近期的进展包括SCA-PVNet23的跨模态注意力聚合、RES24中的边缘实时分析、高效的边缘云转码25 ,以及提升输入稳定性的混合去噪框架26,展示了智能多媒体处理的快速进展。 通过 2D-CNN时空学习27和基于变压器的视频建模28增强内容理解,以及通过CNN-RNN架构29实现自适应码率控制,为下一代流智能奠定了坚实基础。
AQVSO超越了这些具体进展,将内容分析、感知建模和网络感知决策统一为单一集成架构,在动态无线条件下持续提供卓越的服务质量。AQVSO与这些方案本质上不同。它协调地整合了视频编码、网络动态、数据流量以及资源分配和用户感知质量。这一全面的控制方案通过协调八个专用机制,克服了传统速率自适应方法的不足23.
范围与应用
AQVSO的范围包括移动5G及以上网络、CDN辅助流媒体环境以及企业云场景,实现大规模视频传输的冗余。该框架基于分布式边缘计算节点的假设,具备轻量级推理能力,类似于当今基于MEC的5G网络。将介绍上下文限制,如神经组件带来的计算成本以及对精确网络和QoE状态预测的依赖,具体说明AQVSO何时工作最佳。该系统也不适合没有边缘计算的超低资源环境,或需要低于10毫秒延迟的实时交互应用。
AQVSO由八种新颖技术组成:自适应尖峰神经网络(ASNN),用于内容和网络感知优化;设计用于实时调整码率的速率控制算法;深度信念网络(DBN)用于流量模式预测;蚁群优化(ACO)被利用来解决网络资源分配问题;稀疏图注意力网络(SGA),它在大规模上建模视频与网络拓扑之间的复杂关系;稀疏卷积网络(SCN),用于处理高维数据;策略驱动编码器(PDE)是一种自适应编码策略策略,利用对视频趋势的学习知识,以及Stream-Bayes Change Point Identifier(BCPI),一种检测网络和视频不同维度变化的过滤器。这些策略共同构成了AQVSO的核心,通过同时处理视频编码、流量管理、资源分配和感知质量适应,实现云、边缘和移动网络的整体优化。
总之,AQVSO提供了一个统一的多神经框架,共同优化5G+网络的感知QoE、内容感知编码和资源分配,实现卓越的质量比特率效率。
Access restricted. Please log in or start a trial to view this content.
所用软件列于 材料表中。
数据集设置
UCF-1013 数据集被获取并提取到 Videos/UCF-101 目录中。通过校验和验证或手动回放评估数据集完整性,任何损坏的文件均排除在后续处理之外。
计算环境
所有实验均在Windows 10/11或Ubuntu 20.04+上的Python 3.10中完成。软件环境包括tensorflow==2.17.0、opencv-python、scikit-image、numpy、pandas和tqdm。使用至少8GB内存,并在可用时采用GPU加速。
帧提取
视频帧通过 CV2读取。使用VideoCapture()和灰度转换,使用 cv2.cvtColor完成。生成的帧按顺序存储在 帧 目录中,以保持时间一致性。
基础特征网络
采用顺序卷积神经网络处理224×224个灰度帧。使用卷积层、池化层和密集层,模型通过Adam优化器和二元交叉熵损失训练五个纪元,以建立基线特征表示。
码率分配与压缩
通过估计像素级帧复杂度,并用于确定比例比特率分配。应用了带有自适应Q值的JPEG压缩,处理后的帧被保存在 处理 中目录以供进一步评估。
质量评估
对每个处理中的帧都进行了SSIM、PSNR和MSE的计算。所得的指标被编译成CSV文件,可视化图被生成并存储在 输出 目录中。
最终处决
整个工作流程通过 framework.run() 执行。该执行产生了最终处理后的帧、度量摘要和评估图。
1. 自适应质量视频流优化
1.1 系统架构概述
本文介绍了一种通过AQVSO框架专门优化5G及更高网络视频流的方法。该方法结合了多个前沿元素,彼此互补,以提升服务质量并最大化网络资源的利用。视频流处理采用了复杂的流程,每个组件专注于视频优化的特定领域。在整个流媒体流程中,系统确保了最佳的质量维护和均衡的处理。
1.2 视频预处理与初步分析
1.2.1 帧提取与质量基线
该优化框架建立在视频预处理步骤之上,该步骤利用先进的分析技术建立质量标准,并为后续处理准备视频内容。进入系统后,视频流会经过彻底的帧提取程序,将视频拆分为多个帧,并检查连续帧之间的时间相关性。这种初步处理捕捉了视频的时间动态,并为整个流设定了合适的处理参数。对于输入视频V,帧通过以下数学公式提取和处理:
(1)
帧分辨率以m计算,总帧数为n。在保持视频时间一致性的同时提取帧,以便后续阶段进行并行处理。通过实施一种新型融合方法,建立了质量基线。多个质量指标被整合,形成了全面的质量评估。整体初始QoE是通过指定的参数确定的。
(2)
该融合方法的重要性被考虑,因为它解决了个体质量指标的局限性。结构相似指数(SSIM)捕捉了传统指标可能忽略的感知质量方面,峰值信噪比(PSNR)提供了客观的质量衡量,均方误差(MSE)则提供了直接的像素级比较。权重因子α1,α 2,α 3并非静态;相反,它们会根据内容特性动态适应。第 i 个权重因子的计算方法如下:
(3)
其中,
Qi 是第 i 个参考系,i = 1,2...n
Qj 是第 j 个参考系,j = 1,2...n,i 不等于 j
我μ重要因素是通过 对各种视频内容类型的广泛实证分析确定的,以确保动态权重调整在不同视频内容和观看条件中保持相关的质量评估。考虑了运动复杂度、纹理密度以及不同区域的感知重要性等因素。
1.2.2 内容复杂度分析
内容复杂性被分析为框架的关键组成部分,采用多维方法量化视频内容的各个方面。这一分析对于后续阶段关于资源分配和压缩参数的明智决策至关重要。引入了一个全面的复杂度指标,考虑了视频内容的空间、时间和感知方面,具体为:
(4)
空间复杂度分量Cs(f)通过梯度分析分析每帧内的细节和纹理分布计算得出。该测量用于识别需要更高位配置以维持质量的领域。
(5)
计算时间复杂度分量C t(f) 用于量化连续帧间的运动强度,因为该测量对于预测压缩行为和确定适当缓冲区大小至关重要。
(6)
感知复杂性成分Cp(f)整合了人类视觉模型,优先考虑对观众具有感知意义的区域。
(7)
1.3 利用稀疏图注意力卷积网络进行特征提取
在AQVSO的特征提取阶段实现了一种新型稀疏图注意力卷积网络(SGA-ConvNet)架构,标志着视频处理相比传统卷积网络的显著改进。SGA-ConvNet 设计特别适合在资源受限环境中处理高维视频数据,通过将稀疏卷积的有效性和注意力机制的适应性相结合。这种网络架构解决了捕捉视频内容中时间和空间依赖的基本问题。在视频帧处理过程中构建了一个动态图,每个节点代表一个重要的特征点,边则表示这些特征之间的关系。与传统卷积网络相比,将资源集中在相关区域并保持稀疏连通性,显著降低了计算开销。每层的核心作通过以下方式定义:
(8)
H(l) 表示 l 层的特征表示,A ̃ 表示归一化注意力邻接矩阵。W(l) 包含可学习的权重矩阵,σ 表示非线性激活函数。网络能够在保持计算图稀疏性的同时学习层级特征表示。注意机制对于自适应特征处理至关重要,其计算方式包括:
(9)
αiJ表示节点 i 和 J之间的注意系数,[hi ∣∣ hj]表示它们特征向量的连接。LeakyReLU激活用于防止梯度消失,同时保持网络从负面特征中学习的能力。注意机制根据不同特征连接与当前帧内容的相关性动态调整其重要性。
1.4 通过自适应尖峰神经网络实现动态速率控制
动态速率控制通过 ASNN 架构实现于 AQVSO 框架(见图 1),这是一种 受生物启发的视频流速率管理方法。ASNN专门设计用于处理视频流的时间动态,同时适应快速变化的网络环境。该组件被认为对于在不同网络条件下保持流媒体质量和优化带宽使用至关重要。信息通过ASNN中的离散尖峰处理,模拟生物神经网络,这在能效和时间处理方面带来了多项优势。尖峰神经元的膜电位可根据以下方式演变:
(10)
V(t) 表示时间 t 的膜电位,V静止位设为静息电位,τm 定义为膜时间常数。I(t) 是根据网络条件和内容复杂度计算的。通过σ(t)N(0,1)引入了自适应噪声以提高鲁棒性。该噪声项帮助网络在面对网络条件快速波动时保持稳定。速率控制机制采用了复杂的适应方案:
(11)
R(t) 表示目标比特率, S(t) 表示神经网络的尖峰率, B(t) 表示可用带宽, E(t) 表示基于质量指标推导的误差项。指数项expp(-λE(t))用于在速率控制系统中实现对质量变化的平滑适应,同时防止振荡行为。
1.5 质量驱动压缩优化
在压缩优化阶段实施了一种新颖的方法,将感知质量指标与内容感知型压缩策略相结合。这一阶段对于在压缩视频流中实现质量与大小之间的最佳权衡至关重要。采用了区域自适应压缩方案,根据内容重要性和感知质量要求分配比特。
(12)
C (r,t) 表示区域 r 在时间 t 的压缩比,C base(r) 作为根据内容复杂度确定的基础压缩比。Q(r,t) 被定义为表示质量因子。φi(r,t)被用来表示各种调整因素,包括运动强度、边缘密度和感知重要性。
1.6 通过深度信念网络与蚂蚁群体优化进行资源分配
AQVSO中的资源分配机制被配置为实现深度信念网络(DBN)与蚁群优化(ACO)相结合的混合方法,为视频流系统中最优资源分配的复杂问题建立了新颖解决方案。深度信念网络的学习能力被用于资源使用的模式识别,而蚁群算法的优化优势则用于实时资源分配决策。DBN-ACO 系统旨在解决动态网络环境中平衡即时资源需求与长期优化目标的根本挑战。DBN组件采用由多个受限玻尔兹曼机(RBM)组成的层级学习结构实现,每一层捕捉资源利用中越来越抽象的模式。隐藏单位激活的概率分布通过以下方式建模:
(13)
hi 表示隐藏单位,v 表示可见单位,bi 表示偏置项,Wij 表示连接权重。这种概率建模被用来捕捉资源使用模式中的复杂依赖关系,同时保持对变化条件的适应性。ACO组件采用动态信息素优化策略实现。
(14)
(15)
τij 表示信息素水平,p 表示蒸发速率 Δτij (t)。定义为信息素更新, ηiJ 代表基于当前网络状况和资源可用性的启发式值。
1.7 自适应缓冲区管理与错误恢复
AQVSO框架中实现了复杂的缓冲区管理系统,能够动态调整以适应网络状况和内容特性的变化。该系统旨在保持流连续性,同时最小化延迟,防止缓冲区溢出或溢出情况。采用了一种新颖的自适应方法,同时考虑了网络统计和内容复杂性。
(16)
B(t)保持为目标缓冲区大小,QoE(t)作为当前体验质量,σ(t)作为网络稳定性指标跟踪,φ(σ(t))作为自适应函数实现,以根据网络变异调节缓冲区大小。错误恢复机制采用多层次方法执行,结合了主动的错误预防和被动的恢复策略。系统内保留了一个滑动的帧参考窗口。
(17)
p 表示单次恢复尝试的成功概率,n 为尝试次数,T(t) 表示错误检测后的时间。该指数衰减项用于确保恢复工作根据时间相关性得到适当优先排序。
1.8 质量评估与反馈整合
质量评估系统实施了综合方法,将多项质量指标与用户体验因素结合起来。这种集成对于保持高服务质量(QoE)以及优化资源利用至关重要。该系统实现了一种新颖的质量度规融合:
(18)
NB(t)以归一化缓冲比计算,SB(t)作为切换频率计算,M(t)作为运动质量因子计算。权重 wi 是根据内容类型和观看条件动态调整的。
(19)
θi 被表示为基础权重,f(C(t)) 作为内容相关的调整函数应用。反馈积分系统被实现为闭环控制机制。
(20)
e(t) 被设定为目标与实现质量指标之间的误差,K1、K2、K3 被定义为根据网络条件和内容特性调整的自适应增益参数。
Access restricted. Please log in or start a trial to view this content.
对拟议系统的性能进行全面分析,并报告实施结果。包含对比部分,以确认系统是否适合基于云的机器学习方法Neuro Cloud Stream。 图2 展示了AQVSO系统的工作流程。
数据集描述
评估AQVSO框架时,使用从10秒到2小时30分钟的多样化视频内容集合。该综合测试数据集包含UCF101数据,包含13,320个视频片段。将数据集分为训练(75%)、验证(12.5%)和测试(12.5%)三组,以确保评估的平衡。每个子文件夹应根据其剪辑的动作类进行标记,并附有包含每个子集目录的剪辑名称、路径和标签的CSV文件。这种多样化的时间范围和内容类型使得对框架在不同流媒体场景下的适应性和性能进行了全面评估。
所提模型的性能分析
图3展示了分...
Access restricted. Please log in or start a trial to view this content.
自适应质量视频流优化(AQVSO)框架是一个基于嵌入式多模块编解码器集成架构的多媒体处理引擎,用于动态提升无线网络中的感知视频质量和比特率自适应性。例如,与单个预测器或速率控制器不同,AQVSO利用SCN-PDE增强运动感知,SGA-ConvNet用于时空注意力建模,ASNN用于低延迟自适应速率控制,DBN-ACO用于全局优化比特分配。这种连贯的方法与大多数早期基于吞吐量或基于规则的ABR技术形成对比,如Darwich和Bayoumi¹或Yeo等人,后者主要基于带宽估计,缺乏感知或内容感知。AQVSO区别于基于下一帧的预测方法,将视觉质量建模与资源控制结合在单一决策循环内,以在真实流媒体动态下保持稳定性能。
影响方案成功的关键步骤
多个协议组件对系统的稳定性、视频质量一致性和可重复性有着重要影响。对下游建模必须可靠地提取语义和结构特征。预处理不准确(例如不当调整大小或归一化)直接降低了 SGA-ConvNet 和 ASNN 的...
Access restricted. Please log in or start a trial to view this content.
作者没有利益冲突可披露。
作者承认本文中使用了AI流程创建工具生成框架框图(图1)。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 8GB 内存 | 通用 | 运行实验所需的最小内存。 | |
| 英特尔Core i5处理器 | 英特尔公司 | 用于AQVSO评估流水线的CPU。 | |
| 数字派 | NumPy 开发者 | 数值计算与矩阵运算。 | |
| OpenCV-Python | OpenCV.org | 用于视频加载、帧提取和预处理。 | |
| 熊猫 | 熊猫开发团队 | 数据处理、CSV导出、度量表。 | |
| Python 3.10(编程语言) | Python 软件基础 | 执行AQVSO框架脚本和依赖库的必备工具。 | |
| scikit-image | Scikit-Image 开发者 | SSIM、PSNR、MSSE 计算。 | |
| 张量流 2.17.0 | 谷歌 | 用于构建神经模块(SCN、SGA-ConvNet、ASNN、DBN)的深度学习库。 | |
| TQDM | TQDM团队 | 管道执行的进度条。 | |
| Windows 10(64 位)作系统 | Microsoft公司 | 用于实验的作系统。 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission