$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Metodologia QTSMixer
Seja
uma série temporal multivariada de comprimento sl e número de canais c. A tarefa de previsão multivariada é definida como a previsão de valores
futuros dados algum histórico
por um modelo
de previsão, que pode ser formulado como

Onde
é o comprimento da sequência de previsão e
denota o valor de previsão. No QTSMixer, seja XL×C denotar a série temporal multivariada original de comprimento L e o número de canais c. Inserimos a série temporal multivariada por minilote
, onde sl ≤ L e b é o tamanho do lote. Conforme mostrado na Figura 1, o modelo QTSMixer consiste em quatro componentes: normalização, incorporação de patches, camadas de mistura e previsão. Na fase de treinamento, a perda do modelo é calculada pela função
de perda de erro quadrático médio (MSE) para obter o melhor ajuste. O QTSMixer pode ser caracterizado como

Onde θ é o vetor de parâmetro treinável e é atualizado pelo gradiente descendente estocástico.

Figura 1: A arquitetura de alto nível do QTSMixer. Aqui, dividimos o QTSMixer em quatro componentes: normalização, incorporação de patches, camadas de mistura e previsão. Clique aqui para ver uma versão maior desta figura.
A seguir, detalharemos os componentes do modelo do QTSMixer.
Normalização
O processo de propagação direta do QTSMixer começa com o recebimento dos dados
de série temporal de entrada. Primeiro, os dados de entrada são normalizados e padronizados pelo PatchTSMixer StandardScaler8 ou outros escaladores para eliminar as diferenças dimensionais entre os recursos e garantir a estabilidade do desempenho dos dados durante o treinamento.
Incorporação de patch
Primeiro, os dados de séries temporais padronizados são divididos em vários segmentos de comprimento fixo (patches) por meio do módulo de patch. Este design de modelo é inspirado em Ekambaram et al.8, e a capacidade de capturar características locais é aprimorada por meio da divisão de patches. Por meio da divisão de patches, o QTSMixer pode lidar efetivamente com padrões complexos de dados de séries temporais, reduzir o número de tokens de entrada de modelo e obter melhores resultados em um tempo de treinamento mais curto. O minilote
é remodelado em
, onde n é o número de patches e pl denota o comprimento do patch. Vamos denotar o passo do patch, então
.
Para aumentar o poder expressivo do modelo, cada patch é mapeado para um espaço de dimensão superior por meio de uma camada linear. Em seguida, os dados são remodelados em
por transformação
linear , onde hf é o número de recursos ocultos. A matriz de peso tem uma dimensão de pl × hf .
Camadas de mistura
Nesta parte, as dimensões de patch, recurso e canal são misturadas por meio de várias camadas de mistura. Com base na dimensão em foco em cada camada do mixer, a entrada é primeiro permutada de acordo para aprender a correlação ao longo da dimensão focada. Em seguida, as informações são extraídas por normalização de camada, MLP, QNN e mecanismo de Gated Attention (GA) para extrair informações de recursos mais abrangentes.
Na camada de mistura de patches, a entrada é primeiro remodelada para
, na qual nos concentramos na dimensão do patch (ou seja, a última dimensão); em seguida, a normalização da camada é executada. Depois disso, este módulo emprega um MLP compartilhado (dimensão de peso n × n) para aprender a correlação entre diferentes patches. Enquanto isso, o QNN é realizado pela tecnologia de reupload quântico20 para aumentar a capacidade de expressão da camada quântica. O circuito quântico em QNN tem um total de camadas ql, e a iésima camada contém um circuito de codificação Ux e um ansatz
, onde θi é o vetor de parâmetro treinável e i = 1, 2, ..., ql. Após uma operação de adição ponderada, o modelo produz uma estrutura híbrida de MLP e QNN, formulada como
para o i-ésimo componente da dimensão do patch, para integrar efetivamente os recursos de extração de recursos clássicos e quânticos. Observe que aqui αi é um parâmetro treinável com um valor inicial de 0, o que indica a intensidade com que o comportamento quântico é introduzido. Finalmente, o GA8 aumenta probabilisticamente as características dominantes e reduz as características sem importância. A camada de mistura de recursos e a camada de mistura de canais funcionam de maneira semelhante.
Após várias camadas de mistura, os dados são processados como
.
Previsão
Na camada de previsão, os dados são primeiro reformulados para
. Os valores futuros são previstos por meio de uma cabeça de previsão clássica8 - os recursos codificados são achatados e alimentados em uma camada linear clássica com dropout para gerar uma previsão
de valores futuros.
Resultados experimentais
Realizamos uma análise empírica detalhada no conjunto de dados do mundo real, ou seja, o conjunto de dados Long-Term Network Traffic Forecasting (LTNTF)21 e três outros conjuntos de dados públicos populares. O primeiro experimento é baseado no conjunto de dados LTNTF21, que fornece dados de tráfego por hora e informações de férias para três cidades A, B e C, na rede do mundo real de 1º de janeiro de 2017 a 20 de fevereiro de 2019. A tarefa é usar dados históricos para construir um modelo apropriado para prever os valores de tráfego por hora para cada cidade nos próximos 95 dias. A singularidade do conjunto de dados reside em sua autenticidade e natureza de longo prazo, oferecendo dados detalhados de tráfego de rede por hora cobrindo várias cidades ao longo de mais de 800 dias. Os resultados experimentais estão resumidos na Tabela 1, Figura 2 e Figura 3. Para reproduzir o experimento, consulte README.md em Experiment_1_LTNFT no Arquivo Suplementar 1.
Tabela 1: Comparação de desempenho entre QTSMixer e TSMixer no conjunto de dados LTNTF. Aqui o MAPE e o RMSE são usados como as principais métricas de avaliação, e valores mais baixos indicam melhor desempenho. Clique aqui para baixar esta tabela.

Figura 2: Comparação dos resultados de previsão do TSMixer e do QTSMixer. Aqui, selecionamos aleatoriamente três amostras de três cidades e fornecemos a comparação visual entre os valores reais e os valores previstos de TSMixer e QTSMixer. Clique aqui para ver uma versão maior desta figura.

Figura 3: Comparação dos resultados de previsão de um caso especial de TSMixer e QTSMixer. Aqui são selecionadas as amostras com os melhores desempenhos do QTSMixer. Clique aqui para ver uma versão maior desta figura.
O segundo experimento é baseado na estrutura BasicTS+(Basic Time Series)22 , que é uma biblioteca de benchmark e uma caixa de ferramentas para previsão de séries temporais. Ele suporta uma variedade de tarefas e conjuntos de dados, como previsão espaço-temporal e previsão de séries longas, e abrange modelos estatísticos, modelos de aprendizado de máquina, modelos de aprendizado profundo e outros algoritmos. O BasicTS+ fornece uma plataforma justa e abrangente para a replicação e comparação de modelos populares de aprendizado profundo por meio de um processo unificado e padronizado. O benchmark BasicTS compreende sete conjuntos de dados de séries temporais multivariadas (MTS) cuidadosamente selecionados, abrangendo diversos domínios do mundo real para permitir uma avaliação rigorosa dos modelos de previsão. A coleção inclui conjuntos de dados de tráfego (PEMS04/08 para monitoramento de fluxo), registros de consumo de energia (Eletricidade/Etth1/Ettm1), indicadores econômicos (Taxa de câmbio) e medições ambientais (Qualidade do ar em Pequim). Os resultados experimentais são mostrados na Tabela 2. Para reproduzir o experimento, consulte README.md em Experiment_2_Basicts no Arquivo Suplementar 1.
Tabela 2: Comparações de desempenho entre o QTSMixer e outros modelos em vários conjuntos de dados da estrutura BasicTS+. Aqui MAE, WAPE e RMSE são usados como métricas de avaliação, e valores mais baixos indicam melhor desempenho. Os modelos com contagens de parâmetros semelhantes são agrupados. Clique aqui para baixar esta tabela.
O terceiro experimento envolve uma análise comparativa entre o simulador quântico e um computador quântico real. Este experimento compara o desempenho do Qiskit e da estrutura DQ avaliando suas respectivas implementações do QTSMixer. A precisão e a eficiência de execução de ambas as estruturas nas tarefas de previsão foram avaliadas. O computador quântico supercondutor, ibm_brisbane, é usado neste experimento. Os resultados experimentais são mostrados na Figura 4 e na Tabela 3. Para reproduzir o experimento, consulte README.md em Experiment_3_Qiskit no Arquivo Suplementar 1.

Figura 4: Comparação dos resultados de previsão do Qiskit (no hardware quântico) e DQ (no simulador). Comparação entre valores reais e previsões, com previsões derivadas de experimentos Qiskit e DQ. Clique aqui para ver uma versão maior desta figura.
Tabela 3: Comparação de desempenho do QTSMixer entre hardware quântico e experimentos de simulação. Aqui, o MAPE e o RMSE são usados como as principais métricas de avaliação, e valores mais baixos indicam melhor desempenho. Clique aqui para baixar esta tabela.