$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Metodología QTSMixer
Sea
una serie temporal multivariante de longitud sl y número de canales c. La tarea de predicción multivariante se define como la predicción de valores
futuros dados
por un modelo
de predicción , que se puede formular como

Donde
es la longitud de la secuencia de predicción y
denota el valor de predicción. En QTSMixer, sea XL×C la serie temporal multivariante original de longitud L y el número de canales c. Introducimos las series temporales multivariante por minilote
, donde sl ≤ L y b es el tamaño del lote. Como se muestra en la Figura 1, el modelo QTSMixer consta de cuatro componentes: normalización, incrustación de parches, mezcla de capas y previsión. En la fase de entrenamiento, la pérdida del modelo se calcula mediante la función
de pérdida de error cuadrático medio (MSE) para lograr el mejor ajuste. El QTSMixer se puede caracterizar como:

Donde θ es el vector de parámetros entrenable y se actualiza mediante el descenso de gradiente estocástico.

Figura 1: Arquitectura de alto nivel de QTSMixer. Aquí dividimos QTSMixer en cuatro componentes: normalización, incrustación de parches, mezcla de capas y previsión. Haga clic aquí para ver una versión más grande de esta figura.
A continuación, detallaremos los componentes del modelo de QTSMixer.
Normalización
El proceso de propagación hacia adelante de QTSMixer comienza con la recepción de los datos
de series temporales de entrada. En primer lugar, los datos de entrada se normalizan y estandarizan mediante el PatchTSMixer StandardScaler8 u otros escaladores para eliminar las diferencias dimensionales entre las características y garantizar la estabilidad del rendimiento de los datos durante el entrenamiento.
Incrustación de parches
En primer lugar, los datos de series temporales estandarizadas se dividen en varios segmentos de longitud fija (parches) a través del módulo de parches. Este diseño de modelo está inspirado en Ekambaram et al.8, y la capacidad de capturar características locales se mejora a través de la división de parches. A través de la división de parches, QTSMixer puede manejar de manera efectiva patrones de datos de series temporales complejas, reducir la cantidad de tokens de entrada del modelo y lograr mejores resultados en un tiempo de entrenamiento más corto. El minilote
se remodela en
, donde n es el número de parches y pl denota la longitud del parche. Denotemos el paso de la parcheo, entonces
.
Para aumentar la potencia expresiva del modelo, cada parche se asigna a un espacio de mayor dimensión a través de una capa lineal. Luego, los datos se remodelan mediante
transformación
lineal , donde hf es el número de características ocultas. La matriz de peso tiene una dimensión de pl × hf .
Mezcla de capas
En esta parte, las dimensiones del parche, la entidad y el canal se mezclan a través de varias capas de mezcla. En función de la dimensión que se encuentra en el foco en cada capa del mezclador, la entrada se permuta primero en consecuencia para aprender la correlación a lo largo de la dimensión enfocada. A continuación, la información se extrae mediante la normalización de capas, MLP, QNN y el mecanismo de atención cerrada (GA) para extraer información de características más completa.
En la capa de mezcla de parches, primero se cambia la forma de la entrada a
, en la que nos centramos en la dimensión del parche (es decir, la última dimensión); luego, se realiza la normalización de la capa. Después de eso, este módulo emplea un MLP compartido (dimensión de peso n × n) para aprender la correlación entre diferentes parches. Mientras tanto, el QNN se realiza mediante la tecnología de recarga cuántica20 para mejorar la capacidad de expresión de la capa cuántica. El circuito cuántico en QNN tiene un total de capas ql, y la iésima capa contiene un circuito de codificación Ux y un ansatz
, donde θi es el vector de parámetros entrenable e i = 1, 2, ..., ql. Después de una operación de adición ponderada, el modelo produce una estructura híbrida de MLP y QNN, formulada como
para el i-ésimo componente de la dimensión de parche, para integrar eficazmente las capacidades de extracción de características clásicas y cuánticas. Tenga en cuenta que aquí αi es un parámetro entrenable con un valor inicial de 0, que indica la fuerza con la que se introduce el comportamiento cuántico. Por último, el GA8 aumenta probabilísticamente las características dominantes y reduce las características sin importancia. La capa de mezcla de características y la capa de mezcla de canales funcionan de manera similar.
Después de varias capas de mezcla, los datos se procesan como
.
Previsión
En la capa de previsión, primero se cambia la forma de los datos a
. Los valores futuros se predicen a través de una cabeza de predicción clásica8: las características codificadas se aplanan y se introducen en una capa lineal clásica con abandono para generar una predicción
de valores futuros.
Resultados experimentales
Llevamos a cabo un análisis empírico detallado del conjunto de datos del mundo real, es decir, el conjunto de datos Long-Term Network Traffic Forecasting (LTNTF)21, y otros tres conjuntos de datos públicos populares. El primer experimento se basa en el conjunto de datos LTNTF21, que proporciona datos de tráfico por hora e información de vacaciones para tres ciudades A, B y C, en la red del mundo real desde el 1 de enero de 2017 hasta el 20 de febrero de 2019. La tarea consiste en utilizar datos históricos para crear un modelo adecuado que permita predecir los valores de tráfico por hora de cada ciudad durante los próximos 95 días. La singularidad del conjunto de datos radica en su autenticidad y naturaleza a largo plazo, ya que ofrece datos detallados de tráfico de red por hora que cubren varias ciudades durante más de 800 días. Los resultados experimentales se resumen en la Tabla 1, Figura 2 y Figura 3. Para reproducir el experimento, consulte README.md en Experiment_1_LTNFT en el Archivo Suplementario 1.
Tabla 1: Comparación de rendimiento entre QTSMixer y TSMixer en el conjunto de datos LTNTF. En este caso, el MAPE y el RMSE se utilizan como principales métricas de evaluación, y los valores más bajos indican un mejor rendimiento. Haga clic aquí para descargar esta tabla.

Figura 2: Comparación de los resultados de predicción de TSMixer y QTSMixer. Aquí seleccionamos aleatoriamente tres muestras de tres ciudades y damos la comparación visual entre los valores reales y los valores pronosticados de TSMixer y QTSMixer. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Comparación de los resultados de predicción de un caso especial de TSMixer y QTSMixer. Aquí se seleccionan las muestras con los mejores rendimientos de QTSMixer. Haga clic aquí para ver una versión más grande de esta figura.
El segundo experimento se basa en el marco BasicTS+(Basic Time Series)22 , que es una biblioteca de referencia y una caja de herramientas para la predicción de series temporales. Admite una variedad de tareas y conjuntos de datos, como la previsión espaciotemporal y la previsión de series largas, y cubre modelos estadísticos, modelos de aprendizaje automático, modelos de aprendizaje profundo y otros algoritmos. BasicTS+ proporciona una plataforma justa y completa para la replicación y comparación de modelos populares de aprendizaje profundo a través de un proceso unificado y estandarizado. El punto de referencia de BasicTS comprende siete conjuntos de datos de series temporales multivariantes (MTS) cuidadosamente seleccionados que abarcan diversos dominios del mundo real para permitir una evaluación rigurosa de los modelos de predicción. La colección incluye conjuntos de datos de tráfico (PEMS04/08 para el monitoreo de flujo), registros de consumo de energía (Electricidad/Etth1/Ettm1), indicadores económicos (Tipo de cambio) y mediciones ambientales (Calidad del aire de Beijing). Los resultados experimentales se muestran en la Tabla 2. Para reproducir el experimento, consulte README.md en Experiment_2_Basicts en el Archivo Suplementario 1.
Tabla 2: Comparaciones de rendimiento entre QTSMixer y otros modelos en varios conjuntos de datos del marco BasicTS+. En este caso, MAE, WAPE y RMSE se utilizan como métricas de evaluación, y los valores más bajos indican un mejor rendimiento. Se agrupan los modelos con recuentos de parámetros similares. Haga clic aquí para descargar esta tabla.
El tercer experimento consiste en un análisis comparativo entre el simulador cuántico y un ordenador cuántico real. Este experimento compara el rendimiento de Qiskit y el marco DQ evaluando sus respectivas implementaciones de QTSMixer. Se evaluó la precisión y la eficiencia de ejecución de ambos marcos en las tareas de predicción. La computadora cuántica superconductora, ibm_brisbane, se utiliza en este experimento. Los resultados experimentales se muestran en la Figura 4 y la Tabla 3. Para reproducir el experimento, consulte README.md en Experiment_3_Qiskit en el Archivo Suplementario 1.

Figura 4: Comparación de los resultados de predicción de Qiskit (en hardware cuántico) y DQ (en el simulador). Comparación entre valores reales y predicciones, con predicciones derivadas de experimentos Qiskit y DQ. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 3: Comparación del rendimiento de QTSMixer entre hardware cuántico y experimentos de simulación. Aquí, el MAPE y el RMSE se utilizan como las principales métricas de evaluación, y los valores más bajos indican un mejor rendimiento. Haga clic aquí para descargar esta tabla.