Method Article

Optimización adaptativa de streaming de vídeo: un marco multineuronal inteligente para mejorar la calidad de la experiencia en redes 5G y más allá

DOI:

10.3791/69387

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este artículo presenta el marco AQVSO (Optimización de Calidad Adaptativa en Streaming de Vídeo) como una integración de modelos neuronales y de optimización avanzados diseñados para mejorar la transmisión de vídeo en redes 5G y de próxima generación. El framework mejora la calidad del vídeo, reduce el almacenamiento en búfer y optimiza el uso de recursos.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

AQVSO (Optimización de Streaming de Vídeo de Calidad Adaptativa) es un nuevo marco de streaming de vídeo que tiene como objetivo mejorar la calidad de la transmisión de vídeo y la utilización de recursos en redes 5G & Beyond. El estudio propone una red multineuronal de extremo a extremo compuesta por cuatro módulos corelacionados que incorporan redes convolucionales dispersas con codificadores orientados a políticas (SCN-PDE), una red convolucional de atención de grafos dispersos (SGA-ConvNet), redes neuronales adaptativas con picos (ASNN) y redes profundas de creencias con optimización por colonias de hormigas (DBN-ACO). Estos elementos se ajustan dinámicamente a los cambios de la red basándose en un modelo matemático que busca encontrar un equilibrio entre calidad y uso de recursos. Los experimentos con el conjunto de datos UCF-101 muestran que AQVSO conserva puntuaciones SSIM similares a las de los algoritmos de última generación BBA y BOLA (0,977), aunque requiere mucho menos ancho de banda (4.936/8.000 kbps). El framework puede ahorrar un 38% en el consumo de ancho de banda manteniendo una alta calidad perceptual (PSNR = 45,89 dB) y ha eliminado casi las ocurrencias de búfer. El sistema logra una certeza de streaming del 99,9% en condiciones móviles, CDN (Red de Distribución de Contenido) y empresariales, proporcionando una mejora real en rendimiento para los sistemas de entrega de vídeo en situaciones de recursos limitados. Esto es posible proporcionando una experiencia de usuario manejable y un uso eficiente de los recursos de red mediante decisiones de streaming adaptativas y conscientes del contenido.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El objetivo de este estudio es desarrollar un marco integrado de streaming adaptativo multineuronal, denominado AQVSO, que optimice conjuntamente la calidad perceptual del vídeo y la utilización del ancho de banda bajo 5G dinámico y más allá de las condiciones de red. El método pretende unificar el análisis de contenido, el control de tasas y la asignación de recursos en una única arquitectura de decisión para lograr una Calidad de Experiencia (QoE) consistente con requisitos de tasa de bits significativamente menores.

Optimización de Streaming de Vídeo de Calidad Adaptativa (AQVSO)

En la era del 5G y más allá, AQVSO se está centrando en mejorar la calidad de experiencia (QoE) de la transmisión de vídeo adoptando un modelo basado en redes multineuronales que equilibra inteligentemente la calidad perceptual y la utilizaciónde recursos 1. Esta estrategia de planificación consciente de la red puede abordar el reto de proporcionar flujos de vídeo de alta calidad en un entorno de red variable en el tiempo o inestable, con un menor consumo de ancho de banda y congestión de servidores2.

El tráfico de vídeo representa actualmente más del 80% del total de datos móviles a nivel mundial en 2023, lo que ha impulsado la necesidad de sistemas de entrega multimedia eficientes a un máximohistórico de 3. Las redes heredadas se están transformando en redes ágiles, virtualizadas y basadas en software, habilitadas por Redes Definidas por Software (SDN), Virtualización de Funciones de Red (NFV), Computación en Borde de Acceso Multiacceso (MEC) y computación en la nube/edge computing enel entorno 4,5 de quinta generación (5G). Estos avances permiten a aplicaciones de próxima generación con tasas de datos más rápidas, menor latencia y mayor densidadde conexión 6.

Dado el aumento de la competencia, la Calidad de la Experiencia (QoE) se ha convertido en una de las medidas más importantes para los proveedoresde servicios 7,8. La QoE no solo incluye las métricas tradicionales de Calidad de Servicio (QoS), sino que también añade percepción del usuario e integra parámetros objetivos de QoS con los factores subjetivos de la experiencia de los usuarios, como expectativas, emociones ypreferencias 9,10,11. En lo que respecta a los servicios multimedia, la QoE afecta directamente a la satisfacción del usuario final y puede considerarse una métrica universal para la evaluación global de la calidad que vincula la experiencia del usuario con el rendimiento de la aplicación y los sistemasde comunicación 12.

La calidad de calidad de la transmisión de vídeo depende de parámetros como la latencia, la tasa de bits y la calidad visual. La congestión de la red causada por el crecimiento de datos y las limitaciones de capacidad perjudica la continuidad de la calidad de transmisión13,14. Los enfoques comunes ofrecen atributos de vídeo variables (con tasas de fotogramas y resoluciones distintas), pero la movilidad del usuario y la variación inalámbrica de canales exigen estrategias de gestión másinteligentes 15, 16, 17.

Las soluciones actuales de streaming adaptativo están muy limitadas en condiciones dinámicas. El Streaming Adaptativo Dinámico sobre HTTP (DASH) se basa en heurísticas del lado del cliente que pueden fallar en entornos inalámbricosimpredecibles 18. Existen métodos basados en aprendizaje por refuerzo (RL), como Pensieve, que facilitan la adaptación pero son computacionalmente costosos y requieren abundantes datos deentrenamiento 19. El Algoritmo Basado en Búfer (BBA) considera principalmente la ocupación de búfer e ignora la complejidad del contenido y la calidadperceptual 20. El Control Predictivo de Modelos (MPC) depende en gran medida de las predicciones de ancho de banda, que pueden fallar en un entorno móvil21. BOLA (Algoritmo de Lyapunov basado en ocupación de búfer) se centra principalmente en la utilidad de reproducción y no tiene en cuenta la equidad de la calidad22.

Avances recientes, desde la agregación de atención multimodal en SCA-PVNet23, análisis en tiempo real habilitados para el borde en RES24 y la transcodificación eficiente en la nubeen el borde 25 , hasta marcos híbridos de eliminación de ruido que mejoran la estabilidadde entrada 26, demuestran el rápido progreso en el procesamiento multimedia inteligente. La comprensión mejorada del contenido mediante aprendizaje espaciotemporal 2D-CNN27 y modelado de vídeo basado entransformadores 28, junto con el control adaptativo de tasa de bits mediante las arquitecturas CNN-RNN29, constituye una base sólida para la inteligencia de streaming de próxima generación.

AQVSO va más allá de estos avances individuales unificando el análisis de contenido, el modelado perceptual y la toma de decisiones conscientes de la red en una única arquitectura integrada que ofrece una QoE consistentemente superior bajo condiciones inalámbricas dinámicas. AQVSO es fundamentalmente diferente de estos esquemas. En este sentido, integra la codificación de vídeo, la dinámica de la red, el tráfico de datos, la asignación de recursos y la calidad perceptiva del usuario de manera coordinada. Este esquema de control integral supera las deficiencias de los métodos tradicionales adaptativos a la tasa coordinando ocho mecanismosdedicados 23.

Alcance y aplicación

El alcance de AQVSO incluye redes móviles 5G y más allá, entornos de streaming asistido por CDN y escenarios empresariales en la nube para redundancia en la entrega de vídeo a gran escala. El marco se desarrolla bajo la suposición de nodos de computación en borde distribuidos con capacidades ligeras de inferencia, como ocurre en las redes 5G basadas en MEC actuales. Se presentarán limitaciones contextuales, como el coste computacional impuesto por componentes neuronales y la dependencia de la predicción precisa de la red y del estado de QoE, especificando cuándo AQVSO funciona mejor. El sistema tampoco es adecuado para entornos con muy pocos recursos sin edge computing, ni para aplicaciones interactivas en tiempo real que requieren una latencia inferior a 10 ms.

AQVSO está compuesto por ocho técnicas novedosas: Red Neuronal Adaptativa de Picos (ASNN) aprovechada para optimización consciente de contenido y red; Algoritmo de Control de Tasa diseñado para ajustar la tasa de bits en tiempo real; Red de Creencias Profundas (DBN) utilizada para la predicción de patrones de tráfico; Optimización de colonias de hormigas (ACO) explotada para abordar el problema de asignación de recursos en red en cuestión; La Red de Atención de Grafos Dispersa (SGA), que modela relaciones intrincadas entre el vídeo y la topología de la red a gran escala; Red Convolucional Dispersa (SCN), que procesa datos de alta dimensión; Policy-Driven Encoder (PDE), una política de estrategia de codificación adaptativa que aprovecha el conocimiento aprendido sobre tendencias de vídeo a lo largo del tiempo, y Stream Bayes Change Point Identifier (BCPI), un filtro que detecta cambios de diferentes dimensiones relacionadas con redes y vídeos. En conjunto, estas estrategias constituyen el núcleo de AQVSO y proporcionan una optimización holística en redes en la nube, edge y móviles al abordar simultáneamente la codificación de vídeo, la gestión del tráfico, la asignación de recursos y la adaptación de la calidad perceptual.

En resumen, AQVSO ofrece un marco multineuronal unificado que optimiza conjuntamente la QoE perceptiva, la codificación consciente del contenido y la asignación de recursos en redes 5G+, logrando una eficiencia superior en calidad y tasa de bits.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El software utilizado aparece en la Tabla de Materiales.

Configuración del conjunto de datos

El conjunto de datos UCF-1013 fue obtenido y extraído en el directorio Videos/UCF-101 . La integridad del conjunto de datos se evaluaba mediante verificación de suma de comprobación o reproducción manual, y cualquier archivo corrupto se excluía del procesamiento posterior.

Entorno computacional

Todos los experimentos se realizaron en Python 3.10 en Windows 10/11 o Ubuntu 20.04+. El entorno de software incluía tensorflow==2.17.0, opencv-python, scikit-image, numpy, pandas y tqdm. Se utilizaba un mínimo de 8 GB de RAM y se empleaba aceleración GPU cuando estaba disponible.

Extracción de bastidores

Los fotogramas de vídeo se leían usando CV2. VideoCapture() y conversión en escala de grises se realizó usando cv2.cvtColor. Los fotogramas resultantes se almacenaban en orden secuencial dentro del directorio de Marcos para preservar la consistencia temporal.

Red de características base

Se empleó una red neuronal convolucional secuencial para procesar los 224 × 224 marcos en escala de grises. Se utilizaron capas convolucionales, de agrupación y densas, y el modelo se entrenó durante cinco épocas con el optimizador Adam y la pérdida binaria de entropía cruzada para establecer representaciones de características base.

Asignación y compresión de tasa de bits

Se estimaba la complejidad de tramas a nivel de píxel, que se utilizaba para determinar la asignación proporcional de tasa de bits. Se aplicó compresión JPEG con valores Q adaptativos, y las tramas procesadas se guardaron en el directorio Procesados para una evaluación posterior.

Evaluación de calidad

Se realizaban cálculos SSIM, PSNR y MSE para cada trama procesada. Las métricas resultantes se compilaban en archivos CSV, y se generaban y almacenaban gráficos de visualización en el directorio Output .

Ejecución final

El flujo de trabajo completo se ejecutaba usando framework.run(). Esta ejecución produjo el conjunto final de tramas procesadas, resúmenes métricos y gráficos de evaluación.

1. Optimización adaptativa de la transmisión de vídeo

1.1 Resumen de la arquitectura del sistema

Aquí se presenta un método para optimizar la transmisión de vídeo específicamente para redes 5G y superiores a través del marco AQVSO. El enfoque combinaba varios elementos de vanguardia que se complementaban para mejorar la QoE y maximizar el uso de los recursos de red. Se utilizaba una tubería compleja para procesar flujos de vídeo, con cada componente especializado en un área concreta de optimización de vídeo. Durante todo el proceso de streaming, el sistema garantizó un mantenimiento de calidad óptimo y un procesamiento equilibrado.

1.2 Preprocesamiento de vídeo y análisis inicial

1.2.1 Extracción de tramas y línea base de calidad

El marco de optimización dado se basaba en el paso de preprocesamiento de vídeo, que utilizaba técnicas avanzadas de análisis para establecer estándares de calidad y preparar el contenido de vídeo para su procesamiento posterior. Al entrar en el sistema, un flujo de vídeo era sometido a un procedimiento exhaustivo de extracción de fotogramas que dividía el vídeo en fotogramas individuales y examinaba las correlaciones temporales entre fotogramas sucesivos. Este procesamiento preliminar capturó la dinámica temporal del vídeo y estableció los parámetros de procesamiento adecuados para toda la transmisión. Para un vídeo de entrada V, los fotogramas se extrajeron y procesaron mediante la siguiente formulación matemática:

Ecuación 101(1)

La resolución de fotogramas se calculaba como m y el total de fotogramas contaba como n. Los fotogramas se extrajeron preservando la coherencia temporal del vídeo para permitir el procesamiento paralelo en etapas posteriores. La línea base de calidad se estableció mediante la implementación de un enfoque novedoso de fusión. Se combinaron múltiples métricas de calidad para crear una evaluación integral de calidad. La QoE inicial global se determinó usando los parámetros especificados.

Ecuación 102(2)

Se consideró la importancia de este enfoque de fusión, ya que abordaba las limitaciones de las métricas de calidad individuales. El Índice de Similitud Estructural (SSIM) capturaba aspectos de la calidad perceptiva que las métricas tradicionales podrían haber pasado por alto, mientras que la Relación Señal-Ruido Máximo (PSNR) proporcionaba una medición objetiva de calidad, y el Error Cuadrático Medio (MSE) ofrecía una comparación directa a nivel de píxel. Los factores de ponderación α1.α 2.α 3 no eran estáticos; en su lugar, se adaptaron dinámicamente en función de las características del contenido. Elfactor de peso i se calculó usando:

Ecuación 103(3)

Dónde

Qi es el i-ésimo marco, i = 1,2... n

Qj es el j-ésimo marco, j = 1,2... n, i no es igual a j

Los factores importantes μyo se determinaron mediante un análisis empírico exhaustivo de varios tipos de contenido de vídeo para asegurar que el ajuste dinámico de peso mantuviera una evaluación de calidad relevante en distintos tipos de contenido y condiciones de visualización. Se consideraron factores como la complejidad del movimiento, la densidad de texturas y la importancia perceptiva de diferentes regiones.

1.2.2 Análisis de la complejidad de contenidos

La complejidad del contenido se analizó como un componente crucial del marco mediante un enfoque multidimensional que cuantificó diversos aspectos del contenido de vídeo. Este análisis fue fundamental para tomar decisiones informadas sobre la asignación de recursos y los parámetros de compresión en etapas posteriores. Se introdujo una métrica de complejidad completa que consideraba los aspectos espaciales, temporales y perceptivos del contenido de vídeo, que se expresaba por:

Ecuación 104(4)

El componente de complejidad espacial Cs(f) se calculó analizando el detalle y la distribución de texturas dentro de cada fotograma mediante análisis de gradientes. Esta medición se utilizó para identificar áreas que requerían una mayor asignación de bits para mantener la calidad.

Ecuación 105(5)

El componente de complejidad temporal Ct(f) se calculó para cuantificar la intensidad del movimiento entre fotogramas consecutivos, ya que esta medición era esencial para predecir el comportamiento de compresión y determinar tamaños de búfer apropiados.

Ecuación 106(6)

El componente de complejidad perceptual Cp(f) integró modelos de visión humana para priorizar regiones que eran perceptualmente significativas para los espectadores.

Ecuación 107(7)

1.3 Extracción de características usando redes convolucionales de atención de grafos dispersos

Una novedosa arquitectura de Red Convolucional de Atención de Grafos Dispersos (SGA-ConvNet) se implementó en la etapa de extracción de características de AQVSO, lo que supuso una mejora sustancial respecto a las redes convolucionales convencionales para procesamiento de vídeo. El SGA-ConvNet fue diseñado para ser especialmente adecuado para manejar datos de vídeo de alta dimensión en entornos con recursos limitados, combinando la efectividad de convoluciones dispersas con la adaptabilidad de los mecanismos de atención. Esta arquitectura de red abordaba el problema básico de capturar dependencias temporales y espaciales en el contenido de vídeo. Durante el procesamiento de fotogramas de vídeo se construyó un grafo dinámico, donde cada nodo representaba un punto de característica importante y aristas indicaban cómo se relacionaban entre sí. La sobrecarga computacional se redujo significativamente al concentrar los recursos en regiones relevantes mientras se mantenía la conectividad escasa, en contraste con las redes convolucionales convencionales. La operación del núcleo en cada capa se definió a través de:

Ecuación 108(8)

H(l) representaba las representaciones de características en la capa l, con A ̃ denotando la matriz de adyacencia de atención normalizada. W(l) contenía las matrices de pesos aprendibles, y σ representaba la función de activación no lineal. La red podía aprender representaciones jerárquicas de características manteniendo la esparsidad en el grafo de cómputo. El mecanismo de atención, crucial para el procesamiento adaptativo de características, se calculaba a través de:

Ecuación 109(9)

αij representaba el coeficiente de atención entre los nodos i y j, y [hi ∣∣ hj] denotaba la concatenación de sus vectores de características. La activación LeakyReLU se utilizó para evitar gradientes nulos mientras preservaba la capacidad de la red para aprender de características negativas. El mecanismo de atención ajustaba dinámicamente la importancia de las diferentes conexiones de características según su relevancia para el contenido actual del fotograma.

1.4 Control dinámico de tasa mediante redes neuronales adaptativas con picos

El control dinámico de tasas se implementó en el marco AQVSO (Figura 1) a través de la arquitectura ASNN, un enfoque biológicamente inspirado para gestionar las tasas de transmisión de vídeo. El ASNN fue diseñado específicamente para manejar la dinámica temporal de la transmisión de vídeo adaptándose a las condiciones de red que cambian rápidamente. Este componente se consideró crucial para preservar la calidad de la transmisión optimizando el uso del ancho de banda en diferentes condiciones de red. La información se procesaba mediante picos discretos en el ASNN, imitando redes neuronales biológicas, lo que proporcionaba varias ventajas en términos de eficiencia energética y procesamiento temporal. El potencial de membrana de las neuronas que se disparan se permitió evolucionar de la siguiente manera:

Ecuación 110(10)

V(t) representaba el potencial de membrana en el tiempo t, Vreposo se establecía como potencial de repouso y τm se definía como la constante de tiempo de membrana. I(t) se calculaba a partir de las condiciones de la red y la complejidad del contenido. El ruido adaptativo se introdujo mediante σ(t)N(0,1) para mejorar la robustez. Este término de ruido ayudaba a mantener la estabilidad de la red frente a fluctuaciones rápidas en las condiciones de red. El mecanismo de control de tasas se implementó mediante un sofisticado esquema de adaptación:

Ecuación 111(11)

R(t) representaba la tasa de bits objetivo, S(t) la tasa de picos de la red neuronal, B(t) denotaba el ancho de banda disponible y E(t) representaba el término de error derivado de métricas de calidad. El término exponencial expp(-λE(t)) se utilizó para proporcionar una adaptación suave a las variaciones de calidad mientras se evitaba el comportamiento oscilatorio en el sistema de control de velocidad.

1.5 Optimización de compresión impulsada por calidad

Se implementó un enfoque novedoso en la fase de optimización de compresión que combinaba métricas de calidad perceptiva con estrategias de compresión conscientes del contenido. Esta etapa se hizo fundamental para lograr los mejores compromisos entre calidad y tamaño en el flujo de vídeo comprimido. Se utilizó un esquema de compresión adaptativa a regiones que asignaba bits basándose tanto en la importancia del contenido como en los requisitos de calidad perceptual.

Ecuación 112(12)

C (r,t) representaba la relación de compresión para la región r en el tiempo t, y la base C (r) se usaba como la base de compresión determinada por la complejidad del contenido. Q(r,t) se definió para denotar el factor de calidad. φi (r,t) se implementó para representar varios factores de ajuste, incluyendo la intensidad del movimiento, la densidad de los bordes y la importancia perceptiva.

1.6 Asignación de recursos a través de redes profundas de creencias con optimización de colonias de hormigas

El mecanismo de asignación de recursos en AQVSO se configuró para implementar un enfoque híbrido que combina Redes Profundas de Creencias (DBN) con Optimización de Colonias de Hormigas (ACO), estableciendo una solución novedosa al complejo problema de la distribución óptima de recursos en sistemas de streaming de vídeo. Las capacidades de aprendizaje de las redes profundas de creencias se aprovecharon para el reconocimiento de patrones en el uso de recursos, mientras que las fortalezas de optimización de los algoritmos de colonia de hormigas se utilizaron para decisiones de asignación de recursos en tiempo real. El sistema DBN-ACO fue diseñado para abordar el desafío fundamental de equilibrar los requerimientos inmediatos de recursos con los objetivos de optimización a largo plazo en entornos de red dinámica. El componente DBN se implementó utilizando una estructura jerárquica de aprendizaje compuesta por múltiples Máquinas Boltzmann Restringidas (RBMs), con cada capa capturando patrones cada vez más abstractos en la utilización de recursos. La distribución de probabilidad de la activación de unidades ocultas se modeló a través de:

Ecuación 113(13)

hi representaba las unidades ocultas, v las visibles, bi los términos de sesgo y Wij los pesos de conexión. Este modelado probabilístico se utilizó para capturar dependencias complejas en los patrones de uso de recursos, manteniendo la adaptabilidad a condiciones cambiantes. El componente ACO se implementó con una estrategia dinámica de optimización basada en feromonas.

Ecuación 114(14)
Ecuación 115(15)

τij representaban los niveles de feromonas, con p sirviendo como la tasa de evaporación Δτij (t). se definía como la actualización de feromonas, y ηij representaba el valor heurístico basado en las condiciones actuales de la red y la disponibilidad de recursos.

1.7 Gestión adaptativa de búfer y recuperación de errores

Se implementó un sofisticado sistema de gestión de búferes en el marco AQVSO que se ajustaba dinámicamente a las condiciones de red y características de contenido variables. Este sistema fue diseñado para mantener la continuidad de transmisión minimizando la latencia y evitando condiciones de desbordamiento o desbordamiento en el búfer. Se desplegó un enfoque adaptativo novedoso que consideraba tanto las estadísticas de la red como la complejidad del contenido.

Ecuación 116(16)

B(t) se mantuvo como tamaño del búfer objetivo, QoE(t) se midió como la calidad actual de la experiencia, σ(t) se registró como métrica de estabilidad de red, y φ(σ(t)) se implementó como una función adaptativa para modular el tamaño del búfer en función de la variabilidad de la red. El mecanismo de recuperación de errores se ejecutó mediante un enfoque de múltiples capas que combinaba la prevención proactiva de errores con estrategias de recuperación reactiva. Se mantenía una ventana deslizante de referencias de marco dentro del sistema.

Ecuación 117(17)

p se usó para representar la probabilidad de éxito de un solo intento de recuperación, n se tomó como el número de intentos y T(t) se aplicó para representar el tiempo desde la detección de errores. Este término de decaimiento exponencial se utilizó para asegurar que los esfuerzos de recuperación se priorizaran correctamente según la relevancia temporal.

1.8 Evaluación de calidad e integración de retroalimentación

El sistema de evaluación de calidad implementó un enfoque integral que combinaba múltiples métricas de calidad con factores de experiencia del usuario. Esta integración fue crucial para mantener un alto QoE optimizando la utilización de recursos. El sistema implementó una novedosa fusión de métricas de calidad:

Ecuación 118(18)

NB(t) se calculó como la relación de almacenamiento en búfer normalizada, SB(t) como la frecuencia de conmutación y M(t) como el factor de calidad del movimiento. Los pesosse ajustaban dinámicamente según el tipo de contenido y las condiciones de visualización.

Ecuación 119(19)

Θi se representaba como los pesos base, y f(C(t)) se aplicaba como una función de ajuste dependiente del contenido. El sistema de integración por retroalimentación se implementó como un mecanismo de control en lazo cerrado.

Ecuación 120(20)

e(t) se estableció para representar el error entre las métricas objetivo y de calidad alcanzadas, y K1,K 2,K 3 se definieron como parámetros adaptativos de ganancia que se ajustaban en función de las condiciones de la red y las características del contenido.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Presentar un análisis exhaustivo del rendimiento del sistema propuesto e informar los resultados de la implementación. Incluye una sección de comparación para confirmar que el sistema es adecuado para Neuro Cloud Stream, un enfoque de aprendizaje automático basado en la nube. La Figura 2 ilustra el flujo de trabajo del sistema AQVSO.

Descripción del conjunto de datos

Para evaluar el marco AQVSO, utiliza una colección di...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El framework Adaptive Quality Video Streaming Optimization (AQVSO) es un motor de procesamiento multimedia basado en una arquitectura de integración de códecs multimódulo embebido para mejorar dinámicamente la calidad perceptual del vídeo y la adaptividad de la tasa de bits en redes inalámbricas. A diferencia de predictores individuales o controladores de tasa, por ejemplo, AQVSO utiliza SCN-PDE para mejorar la conciencia de movimiento, SGA-ConvNet para modelado espaciotemporal de atenci...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que revelar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores reconocen el uso de una herramienta de creación de flujos por IA para generar el diagrama de bloques del marco (Figura 1) presentado en este manuscrito.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
8 GB de RAMGenéricoMemoria mínima requerida para ejecutar los experimentos.
Procesador Intel Core i5Intel CorporationCPU utilizada para la tubería de evaluación AQVSO.
NumPyDesarrolladores NumPyCálculos numéricos y operaciones matriciales.
OpenCV-PythonOpenCV.orgSe utiliza para cargar vídeo, extraer fotogramas y preprocesar.
PandasEquipo de Desarrollo PandasGestión de datos, exportación CSV, tablas métricas.
Python 3.10 (Lenguaje de Programación)Fundación de Software PythonNecesario para ejecutar los scripts del framework AQVSO y las bibliotecas dependientes.
scikit-imageReveladores de imagen ScikitCálculo de SSIM, PSNR, MSE.
TensorFlow 2.17.0GoogleBiblioteca de aprendizaje profundo utilizada para construir módulos neuronales (SCN, SGA-ConvNet, ASNN, DBN).
QDMEquipo TQDMBarras de progreso para la ejecución en pipeline.
Sistema operativo Windows 10 (64 bits)Microsoft CorporationSistema operativo utilizado para experimentos.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Barakabitze, A. A., Walshe, R. SDN and NFV for QoE-driven multimedia services delivery: The road towards 6G and beyond networks. Comput Netw. 214, 109133(2022).
  2. Konstantoudakis, K., et al. Serverless streaming for emerging media: towards 5G network-driven cost optimization. Multimed Tools Appl. 81 (5), 7123-7162 (2022).
  3. Yang, J., Bashir, A. K., Guo, Z., Yu, K., Guizani, M. Intelligent cache and buffer optimization for mobile VR adaptive transmission. Digit Commun Netw. 9 (2), 456-468 (2023).
  4. Guzmán, P., Arce, P., Guerri, J. C. Automatic QoE evaluation for asymmetric encoding in DASH. Ad Hoc Netw. 106, 102184(2020).
  5. Al-Habashna, A. A., Wainer, G. QoE awareness in progressive caching and DASH-based D2D streaming. Wirel Netw. 26 (3), 2051-2073 (2020).
  6. Lai, P., et al. QoE-aware user allocation in edge computing systems. Future Gener Comput Syst. 112, 684-694 (2020).
  7. Piran, M. J., et al. Multimedia communication over cognitive radio networks. J Netw Comput Appl. 172, 102759(2020).
  8. Malekzadeh, M. QoE and QoS control model for mobile video. Telecommun Syst. 77 (3), 523-541 (2021).
  9. Bakhati, B., et al. Modified quality video TCP-friendly congestion control. Multimed Tools Appl. 80 (16), 20907-20928 (2021).
  10. Chapagain, B., et al. Real-time video and path quality for tele-training. Multimed Tools Appl. 80 (8), 9615-9638 (2021).
  11. Laghari, A. A., et al. QoE assessment of games. Entertain Comput. 34, 100362(2020).
  12. Seufert, A., Schröder, S., Seufert, M. Delivering user experience over networks. SN Comput Sci. 2 (1), 1-18 (2021).
  13. Liu, Z., Qiao, B., Fang, K. QoE-aware encrypted video caching. J Cloud Comput. 9 (1), 1-15 (2020).
  14. Baccour, E., et al. RL-OPRA for resource allocation in crowdsourced video. Future Gener Comput Syst. 112, 982-995 (2020).
  15. Huang, G., Zhang, B., Yao, Z., Li, C. Stochastic rate control for surveillance. Comput Netw. 190, 107904(2021).
  16. Moura, H. D., Macedo, D. F., Vieira, M. A. Wireless QoE control using RL. Comput Commun. 154, 331-346 (2020).
  17. Hung, Y. H., Wang, C. Y., Hwang, R. H. Live streaming optimization in MEC. IEEE Trans Mobile Comput. 19 (4), 922-934 (2020).
  18. Canovas, A., et al. SDN-based multimedia traffic management. J Netw Comput Appl. 150, 102498(2020).
  19. Yue, T., Wang, H., Cheng, S., Shao, J. DL-based QoE evaluation. Neurocomputing. 386, 179-190 (2020).
  20. Felici-Castell, S., Segura-Garcia, J., Garcia-Pineda, M. Adaptive QoE cloud media architecture. Clust Comput. 22 (1), 679-692 (2019).
  21. Saleem, M., Saleem, Y., Hayat, M. F. QoE-aware optimization for mobile cloud. Clust Comput. 23 (2), 1381-1396 (2020).
  22. Zhu, Z., Tan, L., Li, Y., Ji, C. PHDFS for deep learning platforms. J Syst Archit. 109, 101810(2020).
  23. Lin, D., et al. SCA-PVNet: Self- and cross-attention for 3D retrieval. arXiv. , (2023).
  24. Ali, M., et al. Real-time video analytics on edge-enhanced clouds. IEEE Trans Cloud Comput. 10 (2), 792-804 (2022).
  25. Gao, G., Wen, Y. Video transcoding for ABR streaming over edge-cloud. Digit Commun Netw. 7 (4), 598-604 (2021).
  26. Devi, B. A., Choudhry, M. D. Hybrid denoising for IoRT video. Automatika. 65 (2), 510-522 (2024).
  27. Parmar, P., Morris, B. HalluciNet spatiotemporal representation. Signals. 2 (3), 604-618 (2021).
  28. Video transformer without convolutions. Zhang, Y., et al. Proc IEEE/CVF Int Conf Comput Vis, , 13577-13587 (2021).
  29. Darwich, M., Bayoumi, M. Bitrate adaptation with CNN-RNN. Clust Comput. 27, 6355-6375 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Adaptive Video StreamingQuality Of Experience5G NetworksMulti Neural NetworkSparse Convolutional NetworkGraph Attention NetworkSpiking Neural NetworksDeep Belief NetworksBandwidth OptimizationContent Aware Streaming

Related Articles