$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O software utilizado está listado na Tabela de Materiais.
Configuração do conjunto de dados
O conjunto de dados UCF-1013 foi obtido e extraído no diretório Videos/UCF-101 . A integridade do conjunto de dados era avaliada por meio de verificação de soma de verificação ou reprodução manual, e quaisquer arquivos corrompidos eram excluídos do processamento subsequente.
Ambiente computacional
Todos os experimentos foram realizados em Python 3.10 no Windows 10/11 ou Ubuntu 20.04+. O ambiente de software incluía tensorflow==2.17.0, opencv-python, scikit-image, numpy, pandas e tqdm. Era usado no mínimo 8 GB de RAM, e a aceleração da GPU era empregada quando disponível.
Extração de quadro
Os quadros de vídeo eram lidos usando CV2. VideoCapture() e conversão em tons de cinza foram realizadas usando cv2.cvtColor. Os quadros resultantes eram armazenados em ordem sequencial dentro do diretório Frames para preservar a consistência temporal.
Rede de recursos base
Uma rede neural convolucional sequencial foi empregada para processar os 224 × 224 quadros em tons de cinza. Camadas convolucional, pooling e densa foram usadas, e o modelo foi treinado por cinco épocas com o otimizador Adam e a perda de Entropia Cruzada Binária para estabelecer representações de características de linha base.
Alocação e compressão de taxa de bits
A complexidade de quadros em nível de pixel foi estimada e usada para determinar a alocação proporcional da taxa de bits. A compressão JPEG com Q-values adaptativos era aplicada, e os quadros processados eram salvos no diretório Processado para avaliação adicional.
Avaliação de qualidade
Cálculos SSIM, PSNR e MSE foram realizados para cada quadro processado. As métricas resultantes foram compiladas em arquivos CSV, e gráficos de visualização foram gerados e armazenados no diretório Output .
Execução final
O fluxo de trabalho completo era executado usando framework.run(). Essa execução produziu o conjunto final de quadros processados, resumos de métricas e gráficos de avaliação.
1. Otimização de Streaming de Vídeo de Qualidade Adaptativa
1.1 Visão geral da arquitetura do sistema
Um método é apresentado aqui para otimizar o streaming de vídeo especificamente para redes 5G e ultrapassadas por meio do framework AQVSO. A abordagem combinava vários elementos de ponta que se complementavam para melhorar a QoE e maximizar o uso dos recursos da rede. Um pipeline complexo era utilizado para processar fluxos de vídeo, com cada componente especializado em uma área específica de otimização de vídeo. Durante todo o processo de streaming, o sistema garantiu manutenção de qualidade ideal e processamento balanceado.
1.2 Pré-processamento de vídeo e análise inicial
1.2.1 Extração de quadros e linha de base de qualidade
A estrutura de otimização dada foi construída sobre a etapa de pré-processamento de vídeo, que utilizava técnicas avançadas de análise para estabelecer padrões de qualidade e preparar o conteúdo do vídeo para processamento subsequente. Ao entrar no sistema, um fluxo de vídeo era submetido a um procedimento completo de extração de quadros que dividia o vídeo em quadros individuais e examinava correlações temporais entre quadros sucessivos. Esse processamento preliminar capturou a dinâmica temporal do vídeo e definiu os parâmetros de processamento apropriados para todo o fluxo. Para um vídeo de entrada V, os quadros foram extraídos e processados pela seguinte formulação matemática:
(1)
A resolução do quadro era calculada como m e o total de quadros contando como n. Os quadros eram extraídos preservando a coerência temporal do vídeo para permitir o processamento paralelo em estágios posteriores. A linha de base de qualidade foi estabelecida pela implementação de uma abordagem inovadora de fusão. Múltiplas métricas de qualidade foram combinadas para criar uma avaliação abrangente de qualidade. A QoE inicial geral foi determinada usando os parâmetros especificados.
(2)
A importância dessa abordagem de fusão foi considerada, pois abordava as limitações das métricas individuais de qualidade. O Índice de Similaridade Estrutural (SSIM) capturou aspectos da qualidade perceptiva que métricas tradicionais poderiam ter deixado passar, enquanto a Relação Sinal-Ruído Máxima (PSNR) fornecia uma medição objetiva de qualidade, e o Erro Quadrático Médio (MSE) oferecia uma comparação direta em nível de pixel. Os fatores de ponderação α1.α 2.α 3 não eram estáticos; em vez disso, adaptaram-se dinamicamente com base nas características do conteúdo. Oi-ésimo fator de peso foi calculado usando:
(3)
Onde,
Qi é o i-ésimo referencial, i = 1,2... n
Qj é o j-ésimo referencial, j = 1,2... n, i não é igual a j
Os fatores importantesμ foram determinados por meio de análise empírica extensa de vários tipos de conteúdo de vídeo para garantir que o ajuste dinâmico do peso mantivesse uma avaliação relevante de qualidade em diferentes tipos de conteúdo e condições de visualização. Fatores como complexidade de movimento, densidade de textura e a importância perceptiva de diferentes regiões foram considerados.
1.2.2 Análise da complexidade de conteúdo
A complexidade do conteúdo foi analisada como um componente crucial da estrutura por meio de uma abordagem multidimensional que quantificou vários aspectos do conteúdo de vídeo. Essa análise foi fundamental para decisões informadas sobre alocação de recursos e parâmetros de compressão em estágios posteriores. Foi introduzida uma métrica abrangente de complexidade que considerava aspectos espaciais, temporais e perceptivos do conteúdo de vídeo, apresentada por:
(4)
O componente de complexidade espacial Cs(f) foi calculado analisando a distribuição de detalhes e texturas dentro de cada quadro por meio de análise de gradiente. Essa medição foi usada para identificar áreas que exigiam uma alocação de bits maior para manter a qualidade.
(5)
O componente de complexidade temporal Ct(f) foi calculado para quantificar a intensidade do movimento entre quadros consecutivos, pois essa medição era essencial para prever o comportamento de compressão e determinar tamanhos apropriados de buffer.
(6)
O componente de complexidade perceptiva Cp(f) integrou modelos de visão humana para priorizar regiões que eram perceptualmente significativas para os observadores.
(7)
1.3 Extração de características usando redes convolucionais de atenção de grafos esparsos
Uma nova arquitetura de Rede Convolucional de Atenção de Grafos Esparsa (SGA-ConvNet) foi implementada na etapa de extração de características do AQVSO, marcando uma melhoria substancial em relação às redes convolucionais convencionais para processamento de vídeo. O SGA-ConvNet foi projetado para ser especialmente adequado para lidar com dados de vídeo de alta dimensão em ambientes com recursos limitados, combinando a eficácia de convoluções esparsas com a adaptabilidade dos mecanismos de atenção. Essa arquitetura de rede abordou o problema básico de capturar dependências temporais e espaciais em conteúdo de vídeo. Um grafo dinâmico foi construído durante o processamento de quadros de vídeo, com cada nó representando um ponto de característica importante e arestas indicando como essas características se relacionam entre si. A sobrecarga computacional foi significativamente reduzida ao concentrar recursos em regiões relevantes, preservando a conectividade escassa, em contraste com redes convolucionais convencionais. A operação do núcleo em cada camada foi definida por:
(8)
H(l) representava as representações de características na camada l, com A ̃ denotando a matriz de adjacência de atenção normalizada. W(l) continha as matrizes de pesos aprendíveis, e σ representava a função de ativação não linear. A rede era habilitada a aprender representações hierárquicas de características enquanto mantinha a esparsidade no grafo de computação. O mecanismo de atenção, crucial para o processamento adaptativo de características, foi calculado por meio de:
(9)
αij representava o coeficiente de atenção entre os nós i e j, e [hi ∣∣ h j] denotava a concatenação de seus vetores de características. A ativação LeakyReLU foi usada para evitar gradientes nulos enquanto preservava a capacidade da rede de aprender com características negativas. O mecanismo de atenção ajustava dinamicamente a importância das diferentes conexões de características com base em sua relevância para o conteúdo do quadro atual.
1.4 Controle dinâmico de taxa por meio de redes neurais adaptativas com picos
O controle de taxa dinâmica foi implementado no framework AQVSO (Figura 1) via arquitetura ASNN, uma abordagem biologicamente inspirada para gerenciar taxas de streaming de vídeo. A ASNN foi projetada especificamente para lidar com a dinâmica temporal do streaming de vídeo enquanto se adaptava às condições da rede em rápida mudança. Esse componente foi considerado crucial para preservar a qualidade do streaming enquanto otimizava o uso da largura de banda em diferentes condições de rede. A informação era processada por meio de picos discretos no ASNN, imitando redes neurais biológicas, o que proporcionava várias vantagens em termos de eficiência energética e processamento temporal. O potencial de membrana dos neurônios que disparam foi permitido evoluir de acordo com:
(10)
V(t) representava o potencial de membrana no tempo t, Vrepouso era definido como potencial de repouso, e τm era definido como a constante de tempo da membrana. I(t) foi calculado a partir das condições da rede e da complexidade do conteúdo. O ruído adaptativo foi introduzido através do σ(t)N(0,1) para melhorar a robustez. Esse termo de ruído ajudava a rede a manter a estabilidade diante de flutuações rápidas nas condições da rede. O mecanismo de controle de taxa foi implementado usando um esquema sofisticado de adaptação:
(11)
R(t) representava a taxa de bits alvo, S(t) representava a taxa de picos da rede neural, B(t) denotava a largura de banda disponível, e E(t) representava o termo de erro derivado de métricas de qualidade. O termo exponencial expp(-λE(t)) foi usado para proporcionar adaptação suave às variações de qualidade, ao mesmo tempo em que evitava o comportamento oscilatório no sistema de controle de taxa.
1.5 Otimização de compressão orientada pela qualidade
Uma abordagem inovadora foi implementada na fase de otimização de compressão, combinando métricas de qualidade perceptiva com estratégias de compressão conscientes do conteúdo. Essa etapa foi tornada fundamental para alcançar os melhores equilíbrios entre qualidade e tamanho no fluxo de vídeo comprimido. Foi utilizado um esquema de compressão adaptativa à região que alocava bits com base tanto na importância do conteúdo quanto nos requisitos de qualidade perceptiva.
(12)
C (r,t) representava a razão de compressão para a região r no tempo t, e C base(r) era usada como a razão de compressão base determinada pela complexidade do conteúdo. Q(r,t) foi definido para denotar o fator de qualidade. φi (r,t) foi implementado para representar vários fatores de ajuste, incluindo intensidade do movimento, densidade de arestas e importância perceptual.
1.6 Alocação de recursos por meio de redes profundas de crenças com otimização por colônia de formigas
O mecanismo de alocação de recursos no AQVSO foi configurado para implementar uma abordagem híbrida combinando Redes Profundas de Crença (DBN) com Otimização de Colônias de Formigas (ACO), estabelecendo uma solução inovadora para o complexo problema da distribuição ótima de recursos em sistemas de streaming de vídeo. As capacidades de aprendizado das redes profundas de crenças foram aproveitadas para o reconhecimento de padrões no uso de recursos, enquanto as forças de otimização dos algoritmos de colônia de formigas foram utilizadas para decisões de alocação de recursos em tempo real. O sistema DBN-ACO foi projetado para enfrentar o desafio fundamental de equilibrar os requisitos imediatos de recursos com objetivos de otimização de longo prazo em ambientes de rede dinâmicos. O componente DBN foi implementado usando uma estrutura de aprendizado hierárquica composta por múltiplas Máquinas de Boltzmann Restritas (RBMs), com cada camada capturando padrões cada vez mais abstratos na utilização dos recursos. A distribuição de probabilidade da ativação das unidades ocultas foi modelada através de:
(13)
hi representava as unidades ocultas, v representava as unidades visíveis, bi representava os termos de viés, e Wij representava os pesos da conexão. Essa modelagem probabilística foi usada para capturar dependências complexas em padrões de uso de recursos, mantendo a adaptabilidade a condições mutáveis. O componente ACO foi implementado com uma estratégia dinâmica de otimização baseada em feromônios.
(14)
(15)
τij representava os níveis de feromônio, com p servindo como a taxa de evaporação Δτij (t). foi definido como a atualização de feromônios, e ηIJ representou o valor heurístico baseado nas condições atuais da rede e na disponibilidade de recursos.
1.7 Gerenciamento adaptativo de buffers e recuperação de erros
Um sofisticado sistema de gerenciamento de buffers foi implementado no framework AQVSO que se ajustava dinamicamente às diferentes condições da rede e características de conteúdo. Esse sistema foi projetado para manter a continuidade do streaming minimizando a latência e prevenindo condições de subfluxo ou transbordamento do buffer. Foi implementada uma abordagem adaptativa inovadora que considerou tanto estatísticas de rede quanto complexidade de conteúdo.
(16)
B(t) foi mantido como o tamanho do buffer alvo, QoE(t) foi medido como a qualidade atual da experiência, σ(t) foi acompanhado como métrica de estabilidade da rede, e φ(σ(t)) foi implementado como uma função adaptativa para modular o tamanho do buffer com base na variabilidade da rede. O mecanismo de recuperação de erros foi executado usando uma abordagem em múltiplas camadas que combinava prevenção proativa de erros com estratégias de recuperação reativa. Uma janela deslizante de referências de quadro era mantida dentro do sistema.
(17)
p foi usado para representar a probabilidade de sucesso de uma única tentativa de recuperação, n foi tomado como o número de tentativas, e T(t) foi aplicado para representar o tempo desde a detecção de erros. Esse termo de decaimento exponencial foi usado para garantir que os esforços de recuperação fossem devidamente priorizados com base na relevância temporal.
1.8 Avaliação de qualidade e integração de feedback
O sistema de avaliação de qualidade implementou uma abordagem abrangente que combinava múltiplas métricas de qualidade com fatores de experiência do usuário. Essa integração foi crucial para manter alta QoE enquanto otimizava a utilização dos recursos. O sistema implementou uma nova fusão de métricas de qualidade:
(18)
NB(t) foi calculado como a razão de buffering normalizada, SB(t) como a frequência de comutação, e M(t) como o fator de qualidade de movimento. Os pesos wi foram ajustados dinamicamente com base no tipo de conteúdo e nas condições de visualização.
(19)
Θi foi representado como os pesos base, e f(C(t)) foi aplicado como uma função de ajuste dependente do conteúdo. O sistema de integração por realimentação foi implementado como um mecanismo de controle em malha fechada.
(20)
e(t) foi definido para representar o erro entre as métricas de qualidade alvo e alcançadas, e K 1,K 2,K 3 foram definidos como parâmetros adaptativos de ganho que ajustavam com base nas condições da rede e nas características do conteúdo.