$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Le logiciel utilisé est listé dans le tableau des matériaux.
Configuration des jeux de données
Le jeu de données UCF-1013 a été obtenu et extrait dans le répertoire Videos/UCF-101 . L’intégrité du jeu de données était évaluée par vérification par somme de contrôle ou lecture manuelle, et tout fichier corrompu était exclu du traitement ultérieur.
Environnement informatique
Toutes les expériences ont été réalisées en Python 3.10 sous Windows 10/11 ou Ubuntu 20.04+. L’environnement logiciel comprenait tensorflow==2.17.0, opencv-python, scikit-image, numpy, pandas et tqdm. Un minimum de 8 Go de RAM était utilisé, et l’accélération GPU était employée lorsque cela était disponible.
Extraction de châssis
Les images vidéo étaient lues à l’aide de CV2. VideoCapture() et la conversion en niveaux de gris ont été réalisées à l’aide de cv2.cvtColor. Les trames résultantes étaient stockées dans l’ordre séquentiel dans le répertoire des trames afin de préserver la cohérence temporelle.
Réseau de fonctionnalités de base
Un réseau de neurones convolutionnel séquentiel a été utilisé pour traiter les 224 × 224 images en niveaux de gris. Des couches convolutionnelles, de pooling et denses ont été utilisées, et le modèle a été entraîné pendant cinq époques avec l’optimiseur Adam et la perte binaire d’entropie croisée afin d’établir des représentations de caractéristiques de base.
Allocation du débit binaire et compression
La complexité d’image au niveau du pixel a été estimée et utilisée pour déterminer l’allocation proportionnelle du débit binaire. La compression JPEG avec des valeurs Q adaptatives était appliquée, et les trames traitées étaient sauvegardées dans le répertoire Traité pour une évaluation ultérieure.
Évaluation qualité
Des calculs SSIM, PSNR et MSE étaient effectués pour chaque trame traitée. Les métriques résultantes étaient compilées en fichiers CSV, et des graphiques de visualisation étaient générés et stockés dans le répertoire Output .
Exécution finale
Le flux de travail complet était exécuté à l’aide de framework.run(). Cette exécution a produit l’ensemble final de trames traitées, de résumés métriques et de graphiques d’évaluation.
1. Optimisation adaptative du streaming vidéo de qualité
1.1 Présentation de l’architecture système
Une méthode est présentée ici pour optimiser le streaming vidéo spécifiquement pour les réseaux 5G et au-delà via le cadre AQVSO. Cette approche combinait plusieurs éléments de pointe qui se complétaient mutuellement afin d’améliorer la QoE et de maximiser l’utilisation des ressources réseau. Un pipeline complexe était utilisé pour traiter les flux vidéo, chaque composant se spécialisant dans un domaine particulier de l’optimisation vidéo. Tout au long du processus de streaming, le système garantissait un maintien optimal de la qualité et un traitement équilibré.
1.2 Prétraitement vidéo et analyse initiale
1.2.1 Extraction de trames et référence de qualité
Le cadre d’optimisation donné était construit sur l’étape de prétraitement vidéo, qui utilisait des techniques d’analyse avancées pour établir des standards de qualité et préparer le contenu vidéo pour un traitement ultérieur. À l’entrée dans le système, un flux vidéo était soumis à une procédure d’extraction d’images approfondie qui divisait la vidéo en images individuelles et examinait les corrélations temporelles entre les images successives. Ce traitement préliminaire a capturé la dynamique temporelle de la vidéo et défini les paramètres de traitement appropriés pour l’ensemble du flux. Pour une vidéo en entrée V, les images étaient extraites et traitées selon la formulation mathématique suivante :
(1)
La résolution des images était calculée en m et le nombre total d’images en n. Les images étaient extraites tout en préservant la cohérence temporelle de la vidéo afin de permettre un traitement parallèle aux étapes ultérieures. La base de qualité a été établie en mettant en œuvre une nouvelle approche de fusion. Plusieurs indicateurs de qualité ont été combinés pour créer une évaluation complète de la qualité. La QoE initiale globale était déterminée à l’aide des paramètres spécifiés.
(2)
L’importance de cette approche fusion a été prise en compte, car elle répondait aux limites des indicateurs de qualité individuels. L’Indice de similarité structurelle (SSIM) a capturé des aspects de la qualité perceptive que les métriques traditionnelles auraient pu manquer, tandis que le rapport signal sur bruit (PSNR) de crête fournissait une mesure objective de la qualité, et l’erreur quadratique moyenne (MSE) offrait une comparaison directe au niveau des pixels. Les facteurs de pondération α1 α2 α3 n’étaient pas statiques ; au contraire, ils se sont adaptés dynamiquement en fonction des caractéristiques du contenu. Leième facteur de poids a été calculé en utilisant :
(3)
Où,
Qi est le ième référentiel, i = 1,2... n
Qj est le j-ième référentiel, j = 1,2... N, i n’est pas égal à J
Les facteurs importantsμ i ont été déterminés grâce à une analyse empirique approfondie de différents types de contenus vidéo afin de garantir que l’ajustement dynamique du poids maintienne une évaluation de qualité pertinente selon différents types de contenus vidéo et conditions de visionnage. Des facteurs tels que la complexité du mouvement, la densité de texture et l’importance perceptive des différentes régions ont été pris en compte.
1.2.2 Analyse de la complexité du contenu
La complexité du contenu a été analysée comme un élément crucial du cadre à travers une approche multidimensionnelle qui quantifiait divers aspects du contenu vidéo. Cette analyse a été fondamentale pour des décisions éclairées concernant l’allocation des ressources et les paramètres de compression aux étapes ultérieures. Une métrique de complexité complète a été introduite, prenant en compte les aspects spatiaux, temporels et perceptifs du contenu vidéo, donnée par :
(4)
La composante de complexité spatiale Cs(f) a été calculée en analysant la distribution des détails et des textures au sein de chaque image via une analyse de gradient. Cette mesure servait à identifier les zones nécessitant une allocation de bits plus élevée pour maintenir la qualité.
(5)
La composante de complexité temporelle Ct(f) a été calculée pour quantifier l’intensité du mouvement entre images consécutives, car cette mesure était essentielle pour prédire le comportement de compression et déterminer les tailles de tampon appropriées.
(6)
La composante de complexité perceptuelle Cp(f) intégrait des modèles de vision humaine pour prioriser les régions perceptuellement significatives pour les spectateurs.
(7)
1.3 Extraction de caractéristiques en utilisant des réseaux convolutionnels d’attention de graphes clairsemés
Une nouvelle architecture SGA-ConvNet (Sparse Graph Attention Convolutional Network) a été implémentée lors de l’étape d’extraction de caractéristiques d’AQVSO, marquant une amélioration substantielle par rapport aux réseaux convolutionnels conventionnels pour le traitement vidéo. Le SGA-ConvNet a été conçu pour être particulièrement adapté à la gestion de données vidéo de haute dimension dans des environnements limités en ressources, en combinant l’efficacité des convolutions clairsemées avec l’adaptabilité des mécanismes d’attention. Cette architecture réseau a répondu au problème fondamental de la capture des dépendances temporelles et spatiales dans le contenu vidéo. Un graphe dynamique a été construit lors du traitement des images vidéo, chaque nœud représentant un point de caractéristique important et les arêtes indiquant comment ces caractéristiques se rapportent entre elles. La surcharge computationnelle a été significativement réduite en concentrant les ressources sur les régions pertinentes tout en préservant une connectivité clairsemée, contrairement aux réseaux convolutionnels conventionnels. Le fonctionnement du cœur à chaque couche était défini par :
(8)
H(l) représentait les représentations des caractéristiques à la couche l, avec A ̃ désignant la matrice d’adjacence de l’attention normalisée. W(l) contenait les matrices de poids apprenables, et σ représentait la fonction d’activation non linéaire. Le réseau était capable d’apprendre les représentations hiérarchiques des caractéristiques tout en maintenant la parciune dans le graphe de calcul. Le mécanisme d’attention, crucial pour le traitement adaptatif des caractéristiques, était calculé par :
(9)
αij représentait le coefficient d’attention entre les nœuds i et j, et [hi ∣∣ hj] désignait la concaténation de leurs vecteurs de traits. L’activation LeakyReLU a été utilisée pour empêcher la disparition des gradients tout en préservant la capacité du réseau à apprendre à partir des caractéristiques négatives. Le mécanisme d’attention ajustait dynamiquement l’importance des différentes connexions de caractéristiques en fonction de leur pertinence pour le contenu de la trame en cours.
1.4 Contrôle du débit dynamique via des réseaux neuronaux adaptatifs à pics
Le contrôle du débit dynamique a été implémenté dans le cadre AQVSO (Figure 1) via l’architecture ASNN, une approche biologiquement inspirée pour gérer les débits de streaming vidéo. L’ASNN a été conçu spécifiquement pour gérer la dynamique temporelle du streaming vidéo tout en s’adaptant aux conditions réseau changeantes rapidement. Ce composant a été jugé crucial pour préserver la qualité du streaming tout en optimisant l’utilisation de la bande passante selon les conditions réseau variées. L’information était traitée par des pics discrets dans l’ASNN, imitant les réseaux neuronaux biologiques, ce qui offrait plusieurs avantages en termes d’efficacité énergétique et de traitement temporel. Le potentiel membranaire des neurones en pic a été laissé évoluer selon :
(10)
V(t) représentait le potentiel de membrane au temps t, Vrepos était fixé comme potentiel de repos, et τm comme la constante de temps de la membrane. I(t) a été calculée à partir des conditions du réseau et de la complexité du contenu. Le bruit adaptatif a été introduit via σ(t)N(0,1) pour améliorer la robustesse. Ce terme de bruit aidait le réseau à maintenir la stabilité face à des fluctuations rapides des conditions réseau. Le mécanisme de contrôle du taux a été mis en œuvre à l’aide d’un schéma d’adaptation sophistiqué :
(11)
R(t) représentait le débit cible, S(t) le taux de pic du réseau de neurones, B(t) la bande passante disponible, et E(t) représentait le terme d’erreur dérivé des indicateurs de qualité. Le terme exponentiel expp(-λE(t)) a été utilisé pour permettre une adaptation fluide aux variations de qualité tout en empêchant le comportement oscillatoire dans le système de contrôle de débit.
1.5 Optimisation de la compression basée sur la qualité
Une approche novatrice a été mise en œuvre lors de l’optimisation de la compression, combinant des métriques de qualité perceptive avec des stratégies de compression conscientes du contenu. Cette étape a été rendue fondamentale pour obtenir des compromis optimaux entre qualité et taille dans le flux vidéo compressé. Un schéma de compression régionale adaptatif a été utilisé, allouant les bits en fonction à la fois de l’importance du contenu et des exigences de qualité perceptuelle.
(12)
C (r,t) représentait le rapport de compression pour la région r au temps t, et C base(r) était utilisé comme rapport de compression de base déterminé par la complexité du contenu. Q(r,t) a été défini pour désigner le facteur qualité. φi (r,t) a été mis en œuvre pour représenter divers facteurs d’ajustement, notamment l’intensité du mouvement, la densité des contours et l’importance perceptuelle.
1.6 Allocation des ressources via des réseaux de croyances profonds avec optimisation des colonies de fourmis
Le mécanisme d’allocation des ressources dans AQVSO a été configuré pour mettre en œuvre une approche hybride combinant les Deep Belief Networks (DBN) et l’Optimisation des colonies de fourmis (ACO), établissant une solution novatrice au problème complexe de la répartition optimale des ressources dans les systèmes de streaming vidéo. Les capacités d’apprentissage des réseaux de croyances profondes ont été exploitées pour la reconnaissance de motifs dans l’utilisation des ressources, tandis que les forces d’optimisation des algorithmes de colonie de fourmis ont été utilisées pour les décisions d’allocation des ressources en temps réel. Le système DBN-ACO a été conçu pour relever le défi fondamental d’équilibrer les besoins immédiats en ressources avec les objectifs d’optimisation à long terme dans des environnements de réseau dynamiques. Le composant DBN a été implémenté à l’aide d’une structure d’apprentissage hiérarchique composée de multiples machines de Boltzmann restreintes (RBM), chaque couche capturant des schémas de plus en plus abstraits dans l’utilisation des ressources. La distribution de probabilité de l’activation des unités cachées a été modélisée ainsi :
(13)
hi représentait les unités cachées, v les unités visibles, bi les termes de biais, et Wij représentait les poids de connexion. Cette modélisation probabiliste a été utilisée pour capturer des dépendances complexes dans les schémas d’utilisation des ressources tout en maintenant une adaptabilité aux conditions changeantes. La composante ACO a été mise en œuvre avec une stratégie d’optimisation dynamique basée sur les phéromones.
(14)
(15)
τij représentait les niveaux de phéromones, p servant de taux d’évaporation Δτij (t). était défini comme la mise à jour des phéromones, et ηij représentait la valeur heuristique basée sur les conditions actuelles du réseau et la disponibilité des ressources.
1.7 Gestion adaptative des tampons et récupération des erreurs
Un système sophistiqué de gestion des tampons a été mis en œuvre dans le cadre AQVSO, s’adaptant dynamiquement aux différentes conditions réseau et aux caractéristiques du contenu. Ce système a été conçu pour maintenir la continuité du streaming tout en minimisant la latence et en évitant les conditions de débordement ou de débordement de tampon. Une approche adaptative novatrice a été déployée, prenant en compte à la fois les statistiques du réseau et la complexité du contenu.
(16)
B(t) était maintenu comme taille cible du tampon buffer, QoE(t) mesuré comme qualité actuelle de l’expérience, σ(t) était suivi comme métrique de stabilité réseau, et φ(σ(t)) était implémenté comme une fonction adaptative pour moduler la taille du tampon en fonction de la variabilité du réseau. Le mécanisme de récupération des erreurs a été exécuté selon une approche à plusieurs niveaux combinant prévention proactive des erreurs et stratégies de récupération réactive. Une fenêtre coulissante de références de cadres était conservée dans le système.
(17)
p était utilisé pour représenter la probabilité de réussite d’une seule tentative de récupération, n était pris comme le nombre de tentatives, et T(t) était appliqué pour représenter le temps écoulé depuis la détection d’erreurs. Ce terme de décroissance exponentielle a été utilisé pour garantir que les efforts de récupération étaient correctement priorisés en fonction de leur pertinence temporelle.
1.8 Évaluation de la qualité et intégration des retours d’information
Le système d’évaluation qualité a mis en œuvre une approche globale combinant plusieurs indicateurs de qualité avec des facteurs d’expérience utilisateur. Cette intégration était cruciale pour maintenir une QoE élevée tout en optimisant l’utilisation des ressources. Le système a mis en œuvre une fusion métrique de qualité nouvelle :
(18)
NB(t) était calculé comme le rapport de tampon normalisé, SB(t) comme la fréquence de commutation, et M(t) comme facteur de qualité de mouvement. Les poids wi ont été ajustés dynamiquement en fonction du type de contenu et des conditions de visionnage.
(19)
Θi était représenté comme les poids de base, et f(C(t)) était appliqué comme une fonction d’ajustement dépendante du contenu. Le système d’intégration par rétroaction a été mis en œuvre comme un mécanisme de contrôle en boucle fermée.
(20)
e(t) était défini pour représenter l’erreur entre les métriques de qualité cible et atteintes, et K 1,K 2,K 3 étaient définis comme des paramètres de gain adaptatifs ajustés en fonction des conditions du réseau et des caractéristiques du contenu.