$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El software utilizado aparece en la Tabla de Materiales.
Configuración del conjunto de datos
El conjunto de datos UCF-1013 fue obtenido y extraído en el directorio Videos/UCF-101 . La integridad del conjunto de datos se evaluaba mediante verificación de suma de comprobación o reproducción manual, y cualquier archivo corrupto se excluía del procesamiento posterior.
Entorno computacional
Todos los experimentos se realizaron en Python 3.10 en Windows 10/11 o Ubuntu 20.04+. El entorno de software incluía tensorflow==2.17.0, opencv-python, scikit-image, numpy, pandas y tqdm. Se utilizaba un mínimo de 8 GB de RAM y se empleaba aceleración GPU cuando estaba disponible.
Extracción de bastidores
Los fotogramas de vídeo se leían usando CV2. VideoCapture() y conversión en escala de grises se realizó usando cv2.cvtColor. Los fotogramas resultantes se almacenaban en orden secuencial dentro del directorio de Marcos para preservar la consistencia temporal.
Red de características base
Se empleó una red neuronal convolucional secuencial para procesar los 224 × 224 marcos en escala de grises. Se utilizaron capas convolucionales, de agrupación y densas, y el modelo se entrenó durante cinco épocas con el optimizador Adam y la pérdida binaria de entropía cruzada para establecer representaciones de características base.
Asignación y compresión de tasa de bits
Se estimaba la complejidad de tramas a nivel de píxel, que se utilizaba para determinar la asignación proporcional de tasa de bits. Se aplicó compresión JPEG con valores Q adaptativos, y las tramas procesadas se guardaron en el directorio Procesados para una evaluación posterior.
Evaluación de calidad
Se realizaban cálculos SSIM, PSNR y MSE para cada trama procesada. Las métricas resultantes se compilaban en archivos CSV, y se generaban y almacenaban gráficos de visualización en el directorio Output .
Ejecución final
El flujo de trabajo completo se ejecutaba usando framework.run(). Esta ejecución produjo el conjunto final de tramas procesadas, resúmenes métricos y gráficos de evaluación.
1. Optimización adaptativa de la transmisión de vídeo
1.1 Resumen de la arquitectura del sistema
Aquí se presenta un método para optimizar la transmisión de vídeo específicamente para redes 5G y superiores a través del marco AQVSO. El enfoque combinaba varios elementos de vanguardia que se complementaban para mejorar la QoE y maximizar el uso de los recursos de red. Se utilizaba una tubería compleja para procesar flujos de vídeo, con cada componente especializado en un área concreta de optimización de vídeo. Durante todo el proceso de streaming, el sistema garantizó un mantenimiento de calidad óptimo y un procesamiento equilibrado.
1.2 Preprocesamiento de vídeo y análisis inicial
1.2.1 Extracción de tramas y línea base de calidad
El marco de optimización dado se basaba en el paso de preprocesamiento de vídeo, que utilizaba técnicas avanzadas de análisis para establecer estándares de calidad y preparar el contenido de vídeo para su procesamiento posterior. Al entrar en el sistema, un flujo de vídeo era sometido a un procedimiento exhaustivo de extracción de fotogramas que dividía el vídeo en fotogramas individuales y examinaba las correlaciones temporales entre fotogramas sucesivos. Este procesamiento preliminar capturó la dinámica temporal del vídeo y estableció los parámetros de procesamiento adecuados para toda la transmisión. Para un vídeo de entrada V, los fotogramas se extrajeron y procesaron mediante la siguiente formulación matemática:
(1)
La resolución de fotogramas se calculaba como m y el total de fotogramas contaba como n. Los fotogramas se extrajeron preservando la coherencia temporal del vídeo para permitir el procesamiento paralelo en etapas posteriores. La línea base de calidad se estableció mediante la implementación de un enfoque novedoso de fusión. Se combinaron múltiples métricas de calidad para crear una evaluación integral de calidad. La QoE inicial global se determinó usando los parámetros especificados.
(2)
Se consideró la importancia de este enfoque de fusión, ya que abordaba las limitaciones de las métricas de calidad individuales. El Índice de Similitud Estructural (SSIM) capturaba aspectos de la calidad perceptiva que las métricas tradicionales podrían haber pasado por alto, mientras que la Relación Señal-Ruido Máximo (PSNR) proporcionaba una medición objetiva de calidad, y el Error Cuadrático Medio (MSE) ofrecía una comparación directa a nivel de píxel. Los factores de ponderación α1.α 2.α 3 no eran estáticos; en su lugar, se adaptaron dinámicamente en función de las características del contenido. Elfactor de peso i se calculó usando:
(3)
Dónde
Qi es el i-ésimo marco, i = 1,2... n
Qj es el j-ésimo marco, j = 1,2... n, i no es igual a j
Los factores importantes μyo se determinaron mediante un análisis empírico exhaustivo de varios tipos de contenido de vídeo para asegurar que el ajuste dinámico de peso mantuviera una evaluación de calidad relevante en distintos tipos de contenido y condiciones de visualización. Se consideraron factores como la complejidad del movimiento, la densidad de texturas y la importancia perceptiva de diferentes regiones.
1.2.2 Análisis de la complejidad de contenidos
La complejidad del contenido se analizó como un componente crucial del marco mediante un enfoque multidimensional que cuantificó diversos aspectos del contenido de vídeo. Este análisis fue fundamental para tomar decisiones informadas sobre la asignación de recursos y los parámetros de compresión en etapas posteriores. Se introdujo una métrica de complejidad completa que consideraba los aspectos espaciales, temporales y perceptivos del contenido de vídeo, que se expresaba por:
(4)
El componente de complejidad espacial Cs(f) se calculó analizando el detalle y la distribución de texturas dentro de cada fotograma mediante análisis de gradientes. Esta medición se utilizó para identificar áreas que requerían una mayor asignación de bits para mantener la calidad.
(5)
El componente de complejidad temporal Ct(f) se calculó para cuantificar la intensidad del movimiento entre fotogramas consecutivos, ya que esta medición era esencial para predecir el comportamiento de compresión y determinar tamaños de búfer apropiados.
(6)
El componente de complejidad perceptual Cp(f) integró modelos de visión humana para priorizar regiones que eran perceptualmente significativas para los espectadores.
(7)
1.3 Extracción de características usando redes convolucionales de atención de grafos dispersos
Una novedosa arquitectura de Red Convolucional de Atención de Grafos Dispersos (SGA-ConvNet) se implementó en la etapa de extracción de características de AQVSO, lo que supuso una mejora sustancial respecto a las redes convolucionales convencionales para procesamiento de vídeo. El SGA-ConvNet fue diseñado para ser especialmente adecuado para manejar datos de vídeo de alta dimensión en entornos con recursos limitados, combinando la efectividad de convoluciones dispersas con la adaptabilidad de los mecanismos de atención. Esta arquitectura de red abordaba el problema básico de capturar dependencias temporales y espaciales en el contenido de vídeo. Durante el procesamiento de fotogramas de vídeo se construyó un grafo dinámico, donde cada nodo representaba un punto de característica importante y aristas indicaban cómo se relacionaban entre sí. La sobrecarga computacional se redujo significativamente al concentrar los recursos en regiones relevantes mientras se mantenía la conectividad escasa, en contraste con las redes convolucionales convencionales. La operación del núcleo en cada capa se definió a través de:
(8)
H(l) representaba las representaciones de características en la capa l, con A ̃ denotando la matriz de adyacencia de atención normalizada. W(l) contenía las matrices de pesos aprendibles, y σ representaba la función de activación no lineal. La red podía aprender representaciones jerárquicas de características manteniendo la esparsidad en el grafo de cómputo. El mecanismo de atención, crucial para el procesamiento adaptativo de características, se calculaba a través de:
(9)
αij representaba el coeficiente de atención entre los nodos i y j, y [hi ∣∣ hj] denotaba la concatenación de sus vectores de características. La activación LeakyReLU se utilizó para evitar gradientes nulos mientras preservaba la capacidad de la red para aprender de características negativas. El mecanismo de atención ajustaba dinámicamente la importancia de las diferentes conexiones de características según su relevancia para el contenido actual del fotograma.
1.4 Control dinámico de tasa mediante redes neuronales adaptativas con picos
El control dinámico de tasas se implementó en el marco AQVSO (Figura 1) a través de la arquitectura ASNN, un enfoque biológicamente inspirado para gestionar las tasas de transmisión de vídeo. El ASNN fue diseñado específicamente para manejar la dinámica temporal de la transmisión de vídeo adaptándose a las condiciones de red que cambian rápidamente. Este componente se consideró crucial para preservar la calidad de la transmisión optimizando el uso del ancho de banda en diferentes condiciones de red. La información se procesaba mediante picos discretos en el ASNN, imitando redes neuronales biológicas, lo que proporcionaba varias ventajas en términos de eficiencia energética y procesamiento temporal. El potencial de membrana de las neuronas que se disparan se permitió evolucionar de la siguiente manera:
(10)
V(t) representaba el potencial de membrana en el tiempo t, Vreposo se establecía como potencial de repouso y τm se definía como la constante de tiempo de membrana. I(t) se calculaba a partir de las condiciones de la red y la complejidad del contenido. El ruido adaptativo se introdujo mediante σ(t)N(0,1) para mejorar la robustez. Este término de ruido ayudaba a mantener la estabilidad de la red frente a fluctuaciones rápidas en las condiciones de red. El mecanismo de control de tasas se implementó mediante un sofisticado esquema de adaptación:
(11)
R(t) representaba la tasa de bits objetivo, S(t) la tasa de picos de la red neuronal, B(t) denotaba el ancho de banda disponible y E(t) representaba el término de error derivado de métricas de calidad. El término exponencial expp(-λE(t)) se utilizó para proporcionar una adaptación suave a las variaciones de calidad mientras se evitaba el comportamiento oscilatorio en el sistema de control de velocidad.
1.5 Optimización de compresión impulsada por calidad
Se implementó un enfoque novedoso en la fase de optimización de compresión que combinaba métricas de calidad perceptiva con estrategias de compresión conscientes del contenido. Esta etapa se hizo fundamental para lograr los mejores compromisos entre calidad y tamaño en el flujo de vídeo comprimido. Se utilizó un esquema de compresión adaptativa a regiones que asignaba bits basándose tanto en la importancia del contenido como en los requisitos de calidad perceptual.
(12)
C (r,t) representaba la relación de compresión para la región r en el tiempo t, y la base C (r) se usaba como la base de compresión determinada por la complejidad del contenido. Q(r,t) se definió para denotar el factor de calidad. φi (r,t) se implementó para representar varios factores de ajuste, incluyendo la intensidad del movimiento, la densidad de los bordes y la importancia perceptiva.
1.6 Asignación de recursos a través de redes profundas de creencias con optimización de colonias de hormigas
El mecanismo de asignación de recursos en AQVSO se configuró para implementar un enfoque híbrido que combina Redes Profundas de Creencias (DBN) con Optimización de Colonias de Hormigas (ACO), estableciendo una solución novedosa al complejo problema de la distribución óptima de recursos en sistemas de streaming de vídeo. Las capacidades de aprendizaje de las redes profundas de creencias se aprovecharon para el reconocimiento de patrones en el uso de recursos, mientras que las fortalezas de optimización de los algoritmos de colonia de hormigas se utilizaron para decisiones de asignación de recursos en tiempo real. El sistema DBN-ACO fue diseñado para abordar el desafío fundamental de equilibrar los requerimientos inmediatos de recursos con los objetivos de optimización a largo plazo en entornos de red dinámica. El componente DBN se implementó utilizando una estructura jerárquica de aprendizaje compuesta por múltiples Máquinas Boltzmann Restringidas (RBMs), con cada capa capturando patrones cada vez más abstractos en la utilización de recursos. La distribución de probabilidad de la activación de unidades ocultas se modeló a través de:
(13)
hi representaba las unidades ocultas, v las visibles, bi los términos de sesgo y Wij los pesos de conexión. Este modelado probabilístico se utilizó para capturar dependencias complejas en los patrones de uso de recursos, manteniendo la adaptabilidad a condiciones cambiantes. El componente ACO se implementó con una estrategia dinámica de optimización basada en feromonas.
(14)
(15)
τij representaban los niveles de feromonas, con p sirviendo como la tasa de evaporación Δτij (t). se definía como la actualización de feromonas, y ηij representaba el valor heurístico basado en las condiciones actuales de la red y la disponibilidad de recursos.
1.7 Gestión adaptativa de búfer y recuperación de errores
Se implementó un sofisticado sistema de gestión de búferes en el marco AQVSO que se ajustaba dinámicamente a las condiciones de red y características de contenido variables. Este sistema fue diseñado para mantener la continuidad de transmisión minimizando la latencia y evitando condiciones de desbordamiento o desbordamiento en el búfer. Se desplegó un enfoque adaptativo novedoso que consideraba tanto las estadísticas de la red como la complejidad del contenido.
(16)
B(t) se mantuvo como tamaño del búfer objetivo, QoE(t) se midió como la calidad actual de la experiencia, σ(t) se registró como métrica de estabilidad de red, y φ(σ(t)) se implementó como una función adaptativa para modular el tamaño del búfer en función de la variabilidad de la red. El mecanismo de recuperación de errores se ejecutó mediante un enfoque de múltiples capas que combinaba la prevención proactiva de errores con estrategias de recuperación reactiva. Se mantenía una ventana deslizante de referencias de marco dentro del sistema.
(17)
p se usó para representar la probabilidad de éxito de un solo intento de recuperación, n se tomó como el número de intentos y T(t) se aplicó para representar el tiempo desde la detección de errores. Este término de decaimiento exponencial se utilizó para asegurar que los esfuerzos de recuperación se priorizaran correctamente según la relevancia temporal.
1.8 Evaluación de calidad e integración de retroalimentación
El sistema de evaluación de calidad implementó un enfoque integral que combinaba múltiples métricas de calidad con factores de experiencia del usuario. Esta integración fue crucial para mantener un alto QoE optimizando la utilización de recursos. El sistema implementó una novedosa fusión de métricas de calidad:
(18)
NB(t) se calculó como la relación de almacenamiento en búfer normalizada, SB(t) como la frecuencia de conmutación y M(t) como el factor de calidad del movimiento. Los pesosse ajustaban dinámicamente según el tipo de contenido y las condiciones de visualización.
(19)
Θi se representaba como los pesos base, y f(C(t)) se aplicaba como una función de ajuste dependiente del contenido. El sistema de integración por retroalimentación se implementó como un mecanismo de control en lazo cerrado.
(20)
e(t) se estableció para representar el error entre las métricas objetivo y de calidad alcanzadas, y K1,K 2,K 3 se definieron como parámetros adaptativos de ganancia que se ajustaban en función de las condiciones de la red y las características del contenido.