$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Metodologia QTSMixer
Sia
una serie storica multivariata di lunghezza sl e numero di canali c. Il compito di previsione multivariata è definito come la previsione di valori
futuri data una certa storia
da un modello
di previsione, che può essere formulato come

Dove
è la lunghezza della sequenza di previsione e
indica il valore di stima. In QTSMixer, sia XL×C la serie temporale multivariata originale di lunghezza L e il numero di canali c. Inseriamo la serie temporale multivariata per minibatch
, dove sl ≤ L e b è la dimensione del batch. Come mostrato nella Figura 1, il modello QTSMixer è costituito da quattro componenti: normalizzazione, incorporamento di patch, strati di miscelazione e previsione. Nella fase di addestramento, la perdita del modello viene calcolata dalla funzione
di perdita dell'errore quadratico medio (MSE) per ottenere l'adattamento migliore. Il QTSMixer può essere caratterizzato come

Dove θ è il vettore del parametro addestrabile e viene aggiornato dalla discesa stocastica del gradiente.

Figura 1: L'architettura di alto livello di QTSMixer. Qui dividiamo QTSMixer in quattro componenti: normalizzazione, incorporamento di patch, strati di miscelazione e previsione. Clicca qui per visualizzare una versione più grande di questa figura.
Successivamente, descriveremo in dettaglio i componenti del modello di QTSMixer.
Normalizzazione
Il processo di propagazione in avanti di QTSMixer inizia con la ricezione dei dati
delle serie temporali di input. Innanzitutto, i dati di input vengono normalizzati e standardizzati da PatchTSMixer StandardScaler8 o altri scaler per eliminare le differenze dimensionali tra le funzionalità e garantire la stabilità delle prestazioni dei dati durante l'addestramento.
Incorporamento di patch
Innanzitutto, i dati delle serie temporali standardizzate vengono suddivisi in più segmenti di lunghezza fissa (patch) attraverso il modulo di patching. Il design di questo modello si ispira a Ekambaram et al.8 e la capacità di catturare le caratteristiche locali è migliorata attraverso la divisione delle patch. Attraverso la divisione delle patch, QTSMixer è in grado di gestire efficacemente modelli di dati di serie temporali complesse, ridurre il numero di token di input del modello e ottenere risultati migliori in un tempo di addestramento più breve. Il minibatch
viene rimodellato in
, dove n è il numero di patch e pl denota la lunghezza della patch. Indichiamo il passo del rattoppo, quindi
.
Per aumentare la potenza espressiva del modello, ogni patch viene mappata su uno spazio dimensionale superiore attraverso un livello lineare. Quindi, i dati vengono rimodellati in
mediante trasformazione
lineare , dove hf è il numero di caratteristiche nascoste. La matrice dei pesi ha una dimensione di pl × hf .
Miscelazione degli strati
In questa parte, le dimensioni della patch, della feature e del canale vengono mixate attraverso più livelli di mixaggio. In base alla dimensione sotto fuoco in ogni livello del mixer, l'input viene prima permutato di conseguenza per apprendere la correlazione lungo la dimensione focalizzata. Quindi, le informazioni vengono estratte mediante normalizzazione dei livelli, MLP, QNN e meccanismo GATED Attention (GA) per estrarre informazioni più complete sulle funzionalità.
Nel livello di miscelazione delle patch, l'input viene prima rimodellato in
, in cui ci concentriamo sulla dimensione della patch (cioè l'ultima dimensione); quindi, viene eseguita la normalizzazione del livello. Successivamente, questo modulo utilizza una MLP condivisa (dimensione del peso n × n) per apprendere la correlazione tra diverse patch. Nel frattempo, il QNN è realizzato con la tecnologia di ricarica quantistica20 per migliorare la capacità di espressione dello strato quantistico. Il circuito quantistico in QNN ha un totale di ql strati e l'iesimo strato contiene un circuito di codifica Ux e un ansatz
, dove θi è il vettore del parametro addestrabile e i = 1, 2, ..., ql. A seguito di un'operazione di addizione ponderata, il modello produce una struttura ibrida di MLP e QNN, formulata come
per l'i-esimocomponente della dimensione patch, per integrare efficacemente le capacità di estrazione di caratteristiche classiche e quantistiche. Si noti che qui α i è un parametro addestrabile con un valore iniziale pari a 0, che indica la forza con cui viene introdotto il comportamento quantistico. Infine, il GA8 aumenta probabilisticamente le caratteristiche dominanti e ridimensiona le caratteristiche non importanti. Il livello di mixaggio delle funzioni e il livello di mixaggio dei canali funzionano in modo simile.
Dopo aver mescolato più livelli, i dati vengono elaborati come
.
Previsione
Nel livello di previsione, i dati vengono prima rimodellati in
. I valori futuri vengono previsti attraverso una classica testadi previsione 8: le caratteristiche codificate vengono appiattite e inserite in un classico strato lineare con dropout per generare una previsione
dei valori futuri.
Risultati sperimentali
Abbiamo condotto un'analisi empirica dettagliata sul set di dati del mondo reale, ovvero il set di dati LTNTF (Long-Term Network Traffic Forecasting)21 e altri tre popolari set di dati pubblici. Il primo esperimento si basa sul set di dati LTNTF21, che fornisce dati sul traffico orario e informazioni sulle vacanze per tre città A, B e C, nella rete del mondo reale dal 1° gennaio 2017 al 20 febbraio 2019. L'attività consiste nell'utilizzare i dati storici per costruire un modello appropriato per prevedere i valori orari del traffico per ogni città per i successivi 95 giorni. L'unicità del set di dati risiede nella sua autenticità e nella sua natura a lungo termine, in quanto offre dati dettagliati sul traffico di rete orario che coprono più città per più di 800 giorni. I risultati sperimentali sono riassunti nella Tabella 1, nella Figura 2 e nella Figura 3. Per riprodurre l'esperimento, fare riferimento a README.md in Experiment_1_LTNFT nel file supplementare 1.
Tabella 1: Confronto delle prestazioni tra QTSMixer e TSMixer nel set di dati LTNTF. In questo caso, il MAPE e l'RMSE sono utilizzati come metriche di valutazione principali e valori più bassi indicano prestazioni migliori. Clicca qui per scaricare questa tabella.

Figura 2: Confronto dei risultati di previsione di TSMixer e QTSMixer. Qui selezioniamo casualmente tre campioni da tre città e forniamo il confronto visivo tra i valori reali e i valori previsti di TSMixer e QTSMixer. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 3: Confronto dei risultati predittivi di un caso speciale di TSMixer e QTSMixer. Qui vengono selezionati i campioni con le migliori prestazioni di QTSMixer. Clicca qui per visualizzare una versione più grande di questa figura.
Il secondo esperimento si basa sul framework BasicTS+ (Basic Time Series)22 , che è una libreria di riferimento e una cassetta degli attrezzi per la previsione delle serie temporali. Supporta una varietà di attività e set di dati, come le previsioni spazio-temporali e le previsioni di serie lunghe, e copre modelli statistici, modelli di machine learning, modelli di deep learning e altri algoritmi. BasicTS+ fornisce una piattaforma equa e completa per la replica e il confronto dei modelli di deep learning più diffusi attraverso un processo unificato e standardizzato. Il benchmark BasicTS comprende sette set di dati di serie temporali multivariate (MTS) accuratamente curati che coprono diversi domini del mondo reale per consentire una valutazione rigorosa dei modelli di previsione. La raccolta include set di dati sul traffico (PEMS04/08 per il monitoraggio del flusso), record di consumo energetico (Electricity/Etth1/Ettm1), indicatori economici (Exchange-Rate) e misurazioni ambientali (Beijing Air Quality). I risultati sperimentali sono riportati nella Tabella 2. Per riprodurre l'esperimento, fare riferimento a README.md in Experiment_2_Basicts nel File supplementare 1.
Tabella 2: Confronti delle prestazioni tra QTSMixer e altri modelli su vari set di dati del framework BasicTS+. In questo caso MAE, WAPE e RMSE vengono utilizzati come metriche di valutazione e valori più bassi indicano prestazioni migliori. I modelli con conteggi di parametri simili vengono raggruppati. Clicca qui per scaricare questa tabella.
Il terzo esperimento prevede un'analisi comparativa tra il simulatore quantistico e un vero computer quantistico. Questo esperimento confronta le prestazioni di Qiskit e del framework DQ valutando le rispettive implementazioni di QTSMixer. Sono state valutate l'accuratezza e l'efficienza di esecuzione di entrambi i framework nelle attività di previsione. In questo esperimento viene utilizzato il computer quantistico superconduttore, ibm_brisbane. I risultati sperimentali sono mostrati nella Figura 4 e nella Tabella 3. Per riprodurre l'esperimento, fare riferimento a README.md in Experiment_3_Qiskit nel file supplementare 1.

Figura 4: Confronto tra i risultati delle previsioni di Qiskit (su hardware quantistico) e DQ (sul simulatore). Confronto tra valori effettivi e previsioni, con previsioni derivate da esperimenti Qiskit e DQ. Clicca qui per visualizzare una versione più grande di questa figura.
Tabella 3: Confronto delle prestazioni di QTSMixer tra hardware quantistico ed esperimenti di simulazione. In questo caso, il MAPE e l'RMSE sono utilizzati come metriche di valutazione principali e valori più bassi indicano prestazioni migliori. Clicca qui per scaricare questa tabella.