$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Методология QTSMixer
Пусть
— многомерный временной ряд длины sl и числа каналов c. Задача многомерного прогнозирования определяется как прогнозирование будущих значений
с учетом некоторой истории
с помощью модели
прогнозирования , которая может быть сформулирована как

Где
— длина последовательности прогноза и
обозначает значение прогноза. В QTSMixer пусть XL×C обозначает исходный многомерный временной ряд длины L и числа каналов c. Мы вводим многомерные временные ряды с помощью minibatch
, где sl ≤ L и b — размер партии. Как показано на рисунке 1, модель QTSMixer состоит из четырех компонентов: нормализация, встраивание патчей, смешивание слоев и прогнозирование. На этапе обучения потери модели вычисляются с помощью функции
потерь при среднеквадратичной ошибке (MSE) для достижения наилучшего соответствия. QTSMixer можно охарактеризовать следующим образом:

Где θ является обучаемым вектором параметра и обновляется по стохастическому градиентному спуску.

Рисунок 1: Высокоуровневая архитектура QTSMixer. Здесь мы разделим QTSMixer на четыре компонента: нормализация, встраивание патчей, микширование слоев и прогнозирование. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Далее мы подробно рассмотрим компоненты модели QTSMixer.
Нормализация
Процесс прямого распространения QTSMixer начинается с получения входных данных
временных рядов. Во-первых, входные данные нормализуются и стандартизируются с помощью PatchTSMixer StandardScaler8 или других скейлеров, чтобы устранить различия в размерах между признаками и обеспечить стабильность производительности данных во время обучения.
Встраивание патчей
Во-первых, стандартизированные данные временных рядов разбиваются на несколько сегментов фиксированной длины (патчей) с помощью модуля коммутации. Этот дизайн модели вдохновлен Экамбарамом и др.8, а возможность улавливания локальных особенностей улучшена за счет разделения участков. Благодаря разделению патчей QTSMixer может эффективно работать со сложными шаблонами данных временных рядов, уменьшать количество входных токенов модели и достигать лучших результатов за более короткое время обучения. Мини-пакет
преобразуется в
, где n — количество патчей, а pl обозначает длину патча. Обозначим шаг заплатки, тогда
.
Чтобы повысить выразительность модели, каждый участок сопоставляется с пространством более высокой размерности с помощью линейного слоя. Затем данные преобразуются с
помощью линейного преобразования
, где hf — количество скрытых признаков. Весовая матрица имеет размерность pl × hf .
Смешивание слоев
В этой части размеры патча, функции и канала смешиваются с помощью нескольких слоев микширования. В зависимости от размера, находящегося в фокусе в каждом слое микшера, входные данные сначала переставляются соответствующим образом, чтобы изучить корреляцию вдоль сфокусированного измерения. Затем информация извлекается с помощью нормализации слоев, MLP, QNN и механизма Gated Attention (GA) для извлечения более полной информации о признаках.
В слое микширования патчей входные данные сначала преобразуются в
, в котором мы фокусируемся на размерности патча (т. е. на последней размерности); затем выполняется нормализация слоя. После этого этот модуль использует общий MLP (весовое измерение n × n) для изучения корреляции между различными патчами. Между тем, QNN реализуется с помощью технологии квантовой повторной загрузки20 для повышения экспрессивной способности квантового слоя. Квантовая схема в QNN имеет общее количество слоев ql, а i-йслой содержит кодирующую схему Ux и ansatz
, где θi — вектор обучаемого параметра, а i = 1, 2, ..., ql. После операции взвешенного сложения модель создает гибридную структуру MLP и QNN, сформулированную как
i-йкомпонент размерности патча, для эффективной интеграции классических и квантовых возможностей извлечения признаков. Обратите внимание, что здесь α i является обучаемым параметром с начальным значением 0, которое указывает, насколько сильно внедряется квантовое поведение. Наконец, GA8 вероятностно увеличивает доминирующие признаки и уменьшает несущественные. Слой микширования функций и слой микширования каналов работают аналогичным образом.
После нескольких слоев смешивания данные обрабатываются как
.
Прогнозирование
На слое прогнозирования данные сначала преобразуются в
. Будущие значения прогнозируются с помощью классической прогностической головки8 — закодированные признаки выравниваются и подаются в классический линейный слой с отпадением для создания прогноза
будущих значений.
Экспериментальные результаты
Мы провели подробный эмпирический анализ реального набора данных, т. е. набора данных Long-Term Network Traffic Forecasting (LTNTF)21, и трех других популярных общедоступных наборов данных. Первый эксперимент основан на наборе данных LTNTF21, который предоставляет почасовые данные о дорожном движении и информацию о праздниках для трех городов A, B и C в реальной сети с 1 января 2017 года по 20 февраля 2019 года. Задача состоит в том, чтобы на основе исторических данных построить подходящую модель для прогнозирования почасовых значений трафика для каждого города на ближайшие 95 дней. Уникальность набора данных заключается в его подлинности и долгосрочном характере, он предлагает подробные почасовые данные о сетевом трафике, охватывающие несколько городов за более чем 800 дней. Результаты эксперимента обобщены в таблицах 1, 2 и 3. Чтобы воспроизвести эксперимент, обратитесь к README.md в Experiment_1_LTNFT в Дополнительном файле 1.
Таблица 1: Сравнение производительности между QTSMixer и TSMixer в наборе данных LTNTF. Здесь MAPE и RMSE используются в качестве основных метрик оценки, а более низкие значения указывают на более высокую производительность. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Рисунок 2: Сравнение результатов прогнозирования TSMixer и QTSMixer. Здесь мы случайным образом выбираем три выборки из трех городов и даем визуальное сравнение между реальными значениями и прогнозируемыми значениями TSMixer и QTSMixer. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 3: Сравнение результатов прогнозирования частного случая TSMixer и QTSMixer. Здесь отбираются образцы с наилучшими характеристиками QTSMixer. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Второй эксперимент основан на фреймворке BasicTS+(Basic Time Series)22 , который представляет собой эталонную библиотеку и набор инструментов для прогнозирования временных рядов. Он поддерживает различные задачи и наборы данных, такие как пространственно-временное прогнозирование и прогнозирование длинных рядов, а также охватывает статистические модели, модели машинного обучения, модели глубокого обучения и другие алгоритмы. BasicTS+ предоставляет справедливую и комплексную платформу для репликации и сравнения популярных моделей глубокого обучения с помощью унифицированного и стандартизированного процесса. Тест BasicTS состоит из семи тщательно отобранных наборов данных многомерных временных рядов (MTS), охватывающих различные реальные области, чтобы обеспечить тщательную оценку моделей прогнозирования. Коллекция включает в себя наборы данных о дорожном движении (PEMS04/08 для мониторинга потоков), данные о потреблении энергии (Electricity/Etth1/Ettm1), экономические показатели (Exchange-Rate) и измерения окружающей среды (Качество воздуха в Пекине). Результаты экспериментов приведены в таблице 2. Чтобы воспроизвести эксперимент, обратитесь к README.md в Experiment_2_Basicts в Дополнительном файле 1.
Таблица 2: Сравнение производительности QTSMixer и других моделей на различных наборах данных фреймворка BasicTS+. Здесь MAE, WAPE и RMSE используются в качестве метрик оценки, а более низкие значения указывают на более высокую производительность. Модели с похожим количеством параметров группируются. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Третий эксперимент включает в себя сравнительный анализ квантового симулятора и реального квантового компьютера. В этом эксперименте сравнивается производительность Qiskit и фреймворка DQ путем оценки их соответствующих реализаций QTSMixer. Была проведена оценка точности и эффективности выполнения обеих систем в задачах прогнозирования. В этом эксперименте используется сверхпроводящий квантовый компьютер ibm_brisbane. Результаты эксперимента представлены на рисунке 4 и в таблице 3. Чтобы воспроизвести эксперимент, обратитесь к README.md в Experiment_3_Qiskit в Дополнительном файле 1.

Рисунок 4: Сравнение результатов прогнозирования Qiskit (на квантовом оборудовании) и DQ (на симуляторе). Сравнение фактических значений с прогнозами, полученными в результате экспериментов Qiskit и DQ. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Таблица 3: Сравнение производительности QTSMixer между квантовым оборудованием и имитационными экспериментами. Здесь MAPE и RMSE используются в качестве основных метрик оценки, а более низкие значения указывают на более высокую производительность. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.