$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Méthodologie QTSMixer
Soit
une série temporelle multivariée de longueur sl et de nombre de canaux c. La tâche de prévision multivariée est définie comme la prédiction de valeurs
futures compte tenu d’un certain historique
par un modèle
de prévision , qui peut être formulé comme suit :

Où
est la longueur de la séquence de prévision et
désigne la valeur de prédiction. Dans QTSMixer, soit XL×C la série temporelle multivariée d’origine de longueur L et le nombre de canaux c. Nous saisissons la série chronologique multivariée par mini-lot
, où sl ≤ L et b est la taille du lot. Comme le montre la figure 1, le modèle QTSMixer se compose de quatre composants : la normalisation, l’intégration de patchs, le mélange des couches et la prévision. Dans la phase d’entraînement, la perte du modèle est calculée par la fonction
de perte d’erreur quadratique moyenne (MSE) pour obtenir le meilleur ajustement. Le QTSMixer peut être caractérisé comme

Où θ est le vecteur de paramètre pouvant être entraîné et est mis à jour par la descente de gradient stochastique.

Figure 1 : L’architecture de haut niveau de QTSMixer. Ici, nous divisons QTSMixer en quatre composants : la normalisation, l’intégration de patchs, le mélange des couches et la prévision. Veuillez cliquer ici pour voir une version agrandie de cette figure.
Ensuite, nous détaillerons les composants du modèle de QTSMixer.
Normalisation
Le processus de propagation vers l’avant de QTSMixer commence par la réception des données
de série chronologique d’entrée. Tout d’abord, les données d’entrée sont normalisées et normalisées par le PatchTSMixer StandardScaler8 ou d’autres scalers afin d’éliminer les différences dimensionnelles entre les fonctionnalités et de garantir la stabilité des performances des données pendant l’entraînement.
Intégration de correctifs
Tout d’abord, les données de séries chronologiques normalisées sont divisées en plusieurs segments de longueur fixe (patchs) via le module de patching. La conception de ce modèle est inspirée d’Ekambaram et al.8, et la capacité à capturer les caractéristiques locales est améliorée grâce à la division des patchs. Grâce à la division des correctifs, QTSMixer peut gérer efficacement des modèles de données de séries chronologiques complexes, réduire le nombre de jetons d’entrée de modèle et obtenir de meilleurs résultats dans un temps d’entraînement plus court. Le mini-lot
est remodelé en
, où n est le nombre de patchs et pl désigne la longueur du patch. Soit s la foulée de patching, alors
.
Pour augmenter la puissance expressive du modèle, chaque patch est mappé à un espace de dimension supérieure par le biais d’une couche linéaire. Ensuite, les données sont remodelées par
transformation
linéaire , où hf est le nombre de caractéristiques cachées. La matrice de poids a une dimension de pl × hf .
Mélange des couches
Dans cette partie, les dimensions du patch, de la fonction et du canal sont mélangées à travers plusieurs couches de mixage. En fonction de la dimension mise au point dans chaque couche de mixage, l’entrée est d’abord permutée en conséquence pour apprendre la corrélation le long de la dimension ciblée. Ensuite, les informations sont extraites par la normalisation de couche, MLP, QNN et le mécanisme d’attention fermée (GA) pour extraire des informations plus complètes sur les caractéristiques.
Dans la couche de mixage de patch, l’entrée est d’abord remodelée en
, dans laquelle nous nous concentrons sur la dimension du patch (c’est-à-dire la dernière dimension), puis la normalisation de la couche est effectuée. Ensuite, ce module utilise un MLP partagé (dimension de poids n × n) pour apprendre la corrélation entre les différents patchs. Pendant ce temps, le QNN est réalisé par la technologie de re-téléchargement quantique20 pour améliorer la capacité d’expression de la couche quantique. Le circuit quantique dans QNN a un total de couches ql , et la ièmecouche contient un circuit de codage Ux et un ansatz
, où θi est le vecteur de paramètre entraînable et i = 1, 2, ..., ql. Suite à une opération d’addition pondérée, le modèle produit une structure hybride de MLP et de QNN, formulée comme
pour le ièmecomposant de la dimension patch, afin d’intégrer efficacement les capacités d’extraction de caractéristiques classiques et quantiques. Notez qu’ici αi est un paramètre entraînable avec une valeur initiale de 0, ce qui indique la force avec laquelle le comportement quantique est introduit. Enfin, le GA8 augmente de manière probabiliste les caractéristiques dominantes et réduit les caractéristiques sans importance. La couche de mixage de fonctions et la couche de mixage de canaux fonctionnent de la même manière.
Après plusieurs couches de mélange, les données sont traitées comme .
Prévision
Dans la couche de prévision, les données sont d’abord remodelées en
. Les valeurs futures sont prédites à l’aide d’une tête de prédiction classique8 : les caractéristiques codées sont aplaties et introduites dans une couche linéaire classique avec abandon pour générer une prédiction
des valeurs futures.
Résultats expérimentaux
Nous avons effectué une analyse empirique détaillée de l’ensemble de données du monde réel, c’est-à-dire l’ensemble de données LTNTF (Long-Term Network Traffic Forecasting)21 et trois autres ensembles de données publics populaires. La première expérience est basée sur l’ensemble de données LTNTF21, qui fournit des données de trafic horaire et des informations sur les jours fériés pour trois villes A, B et C, dans le réseau réel du 1er janvier 2017 au 20 février 2019. La tâche consiste à utiliser des données historiques pour construire un modèle approprié afin de prédire les valeurs de trafic horaire pour chaque ville pour les 95 prochains jours. L’unicité de l’ensemble de données réside dans son authenticité et sa nature à long terme, offrant des données horaires détaillées sur le trafic du réseau couvrant plusieurs villes pendant plus de 800 jours. Les résultats expérimentaux sont résumés dans le tableau 1, la figure 2 et la figure 3. Pour reproduire l’expérience, reportez-vous à README.md en Experiment_1_LTNFT dans le fichier supplémentaire 1.
Tableau 1 : Comparaison des performances entre QTSMixer et TSMixer dans l’ensemble de données LTNTF. Ici, la MAPE et la RMSE sont utilisées comme principales mesures d’évaluation, et des valeurs inférieures indiquent de meilleures performances. Veuillez cliquer ici pour télécharger ce tableau.

Figure 2 : Comparaison des résultats de prédiction de TSMixer et de QTSMixer. Ici, nous sélectionnons au hasard trois échantillons dans trois villes et donnons la comparaison visuelle entre les valeurs réelles et les valeurs prédites de TSMixer et QTSMixer. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 3 : Comparaison des résultats de prédiction d’un cas particulier de TSMixer et de QTSMixer. Ici, les échantillons avec les meilleures performances de QTSMixer sont sélectionnés. Veuillez cliquer ici pour voir une version agrandie de cette figure.
La deuxième expérience est basée sur le cadre BasicTS+ (Basic Time Series)22, qui est une bibliothèque de référence et une boîte à outils pour la prévision de séries chronologiques. Il prend en charge une variété de tâches et d’ensembles de données, tels que les prévisions spatio-temporelles et les prévisions de longues séries, et couvre les modèles statistiques, les modèles d’apprentissage automatique, les modèles d’apprentissage profond et d’autres algorithmes. BasicTS+ fournit une plate-forme équitable et complète pour la réplication et la comparaison de modèles d’apprentissage profond populaires grâce à un processus unifié et standardisé. Le benchmark BasicTS comprend sept ensembles de données de séries chronologiques multivariées (MTS) soigneusement sélectionnés couvrant divers domaines du monde réel pour permettre une évaluation rigoureuse des modèles de prévision. La collection comprend des ensembles de données sur le trafic (PEMS04/08 pour la surveillance des flux), des enregistrements de consommation d’énergie (Electricity/Etth1/Ettm1), des indicateurs économiques (Exchange-Rate) et des mesures environnementales (Beijing Air Quality). Les résultats expérimentaux sont présentés dans le tableau 2. Pour reproduire l’expérience, reportez-vous à README.md en Experiment_2_Basicts dans le fichier supplémentaire 1.
Tableau 2 : Comparaisons de performances entre QTSMixer et d’autres modèles sur divers ensembles de données du framework BasicTS+. Ici, MAE, WAPE et RMSE sont utilisés comme métriques d’évaluation, et des valeurs inférieures indiquent de meilleures performances. Les modèles avec des nombres de paramètres similaires sont regroupés. Veuillez cliquer ici pour télécharger ce tableau.
La troisième expérience consiste en une analyse comparative entre le simulateur quantique et un ordinateur quantique réel. Cette expérience compare les performances de Qiskit et du framework DQ en évaluant leurs implémentations respectives de QTSMixer. La précision et l’efficacité d’exécution des deux cadres dans les tâches de prévision ont été évaluées. L’ordinateur quantique supraconducteur, ibm_brisbane, est utilisé dans cette expérience. Les résultats expérimentaux sont présentés à la figure 4 et au tableau 3. Pour reproduire l’expérience, reportez-vous à README.md en Experiment_3_Qiskit dans le fichier supplémentaire 1.

Figure 4 : Comparaison des résultats de prédiction de Qiskit (sur le matériel quantique) et de DQ (sur le simulateur). Comparaison entre les valeurs réelles et les prédictions, avec des prédictions dérivées des expériences Qiskit et DQ. Veuillez cliquer ici pour voir une version agrandie de cette figure.
Tableau 3 : Comparaison des performances de QTSMixer entre le matériel quantique et les expériences de simulation. Ici, le MAPE et le RMSE sont utilisés comme principales métriques d’évaluation, et des valeurs inférieures indiquent de meilleures performances. Veuillez cliquer ici pour télécharger ce tableau.