$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Дробная математическая модель диспетчеризации электроэнергии
В настоящем исследовании модель FWLD выводится с помощью дробных дифференциальных уравнений для оптимального распределения мощности. Дробная производная Капуто учитывает эффекты памяти в системе, чтобы получить более точное понимание изменения мощности с течением времени. Мы также представляем численные решения с помощью метода Грюнвальда-Летникова (GL), который подходит для дискретизации моделей дробного порядка в электросетях25.
Обзор модели
Модель FWLD направлена на оптимизацию стратегий диспетчеризации мощности за счет учета влияния предыдущих колебаний мощности с помощью дробного исчисления. В традиционных моделях диспетчеризации мощности обычно используются дифференциальные уравнения целочисленного порядка, которые предполагают, что процесс передачи и потребления энергии зависит только от переменных текущего состояния. Тем не менее, энергосистемы в реальной жизни демонстрируют зависимое от памяти поведение, в котором предыдущие колебания влияют на текущее и будущее распределение энергии. Чтобы восполнить этот недостаток, модель FWLD использует производные дробного порядка, так что степенные отношения более точно описываются через исторические зависимости в расчетах.
Модель FWLD состоит из пяти взаимодействующих отсеков, которые символизируют уникальные фазы диспетчеризации мощности. Начальный отсек, S, символизирует потенциальный источник питания, количество вырабатываемой и доступной для передачи энергии. Затем энергия передается по сети, обозначенной буквой Т, которая отражает переданную мощность от генерирующих блоков к принимающим распределительным центрам. Тем не менее, во время распределения некоторые неэффективные факторы — сопротивление линий электропередач и системные потери — влияют на эффективную подачу электроэнергии. Доля энергии, эффективно поставляемой потребителям, подпадает под категорию D, относящуюся к распределенной мощности, измеряющей мощность, доступную для использования конечным потребителем. Следующий шаг, С, представляет собой потребленную энергию, измеряющую фактическое использование энергии жилыми, промышленными и коммерческими потребителями. Наконец, L — это потеря энергии или мощность, рассеиваемая из-за резистивных потерь, неэффективности передачи и других технических или экологических причин.
Кроме того, компартментная модель FWLD позволяет каждому блоку иметь определенные параметры (например, эффективность генерации, потери при передаче) для настройки, с помощью которых может быть представлена гетерогенная энергетическая инфраструктура, включая сочетание возобновляемых и традиционных блоков, микросетей и распределенных источников энергии.
Графическое изображение модели FWLD показано на рисунке 1. На рисунке изображен последовательный поток энергии через различные отсеки, иллюстрирующий, как энергия производится, передается, распределяется, потребляется и теряется в системе. Соединения между отсеками подчеркивают динамический характер диспетчеризации питания, когда изменения на одной ступени влияют на последующие ступени. Использование производных дробного порядка в модели позволяет глубже понять такие зависимости, что делает ее полезным инструментом для оптимизации распределения мощности и снижения потерь при передаче. Модель FWLD обеспечивает улучшенные возможности прогнозирования за счет применения дробного исчисления, обеспечивая более стабильную и эффективную систему распределения энергии.

Рисунок 1: Графическое представление модели FWLD. На этой схеме показан структурный поток и взаимосвязи компонентов модели. Сокращения: FWLD = Fractional Weighted Load Dispatch. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Математическая формулировка
Модель FWLD предлагается в виде связанной системы дробных дифференциальных уравнений для учета сложных взаимодействий, участвующих в распределении энергии. В модели используется дробная производная Капуто порядка α (с 0 < α ≤ 1), что позволяет учитывать эффекты памяти и исторические зависимости в динамике передачи и использования энергии. В отличие от обычных дифференциальных уравнений целочисленного порядка, дробные производные обеспечивают более точное описание потока мощности за счет учета долгосрочных зависимостей системы и переходного поведения.
Математически эволюция мощности между различными отсеками в модели FWLD управляется следующей системой дробных дифференциальных уравнений:
(1)
Где каждая переменная обозначает важную фазу диспетчеризации мощности. Символ S(t) обозначает доступный запас энергии в момент времени t, включающий в себя всю произведенную и доступную для передачи энергию. Когда энергия проходит через сеть, некоторая ее часть направляется в T(t), символизируя передаваемую энергию, которая учитывает передачу энергии по распределительным каналам. Не вся передаваемая мощность успешно доходит до потребителей из-за неэффективности системы, потерь и сопротивления в сети. Успешно доставленная мощность представлена D(t), или распределенной мощностью, которая может быть потреблена. Потребители используют эту энергию, которая, таким образом, преобразуется в C(t), потребляемую энергию, то есть фактическое использование промышленными, коммерческими и бытовыми потребителями. Но из-за неэффективности передачи и других технических ограничений часть мощности неизбежно теряется, что выражается в виде L(t), потерянной энергии.
Модель включает в себя основные параметры для определения взаимодействия между этими отсеками. КПД передачи β задает коэффициент мощности, эффективно передаваемой от источника питания к распределительным каналам. Скорость диспетчеризации регулирует уровень эффективно передаваемой мощности, преобразованной в распределенную энергию. Норма потребления θ объясняет скорость, с которой конечные потребители потребляют распределенную энергию. В то же время коэффициент потерь энергии η измеряет долю потерь мощности из-за резистивного нагрева, утечек и технических потерь в системе передачи. Наконец, коэффициент возмещения потерь δ учитывает долю потерянной мощности, которая может быть восстановлена с помощью возобновляемых источников энергии, методов оптимизации или других достижений в области повышения эффективности.
Приведенные выше дробные дифференциальные уравнения моделируют временную динамику степенных отношений с учетом эффектов памяти с использованием дробной производной Капуто26. Производные дробного порядка позволяют модели более точно представлять реалистичные энергетические системы, в которых предыдущие колебания влияют на будущие решения по распределению энергии. Математическая модель повышает точность прогноза анализа распределения электроэнергии и оптимизирует политику управления энергопотреблением за счет снижения потерь и повышения эффективности.
Численный подход к решению: метод GL
В связи со сложностью получения аналитических решений для дробных дифференциальных уравнений численные методы играют решающую роль в решении модели FWLD. Метод GL является одним из наиболее часто используемых численных подходов к решению дифференциальных уравнений дробного порядка, который дает прямую дискретизацию дробной производной.
Определение дробной производной GL26
Дробная производная GL определяется следующим образом:
(2)
Где h — размер шага, α — дробный порядок, а биномиальный коэффициент для нецелого α определяется как:
(3)
Поскольку бесконечное суммирование не может быть вычислено практическим путем, оно усекается до конечной суммы до N, что приводит к численной аппроксимации:
(4)
В уравнении (2) дробная производная Грюнвальда-Летникова вводится как предел взвешенных сумм в зависимости от прошлых значений, представляя собой так называемую дробную производную функции y(t). Уравнение (3) определяет обобщенный биномиальный коэффициент для любого нецелого порядка α с помощью гамма-функций, поэтому дробный член может быть правильно вычислен. Уравнение (4) затем представляет фактическое численное приближение путем усечения бесконечной суммы в уравнении (2) до конечного предела N. Именно эта дискретная форма и реализуется в симуляциях.
Применяя аппроксимацию GL к системе FWLD (1), мы получаем дискретный набор уравнений обновления для переменных состояния. Пусть Sn,T n,D n,C n,L n обозначает состояния системы в дискретные моменты времени. Числовая дискретизация происходит следующим образом:
(5)
На дополнительном рисунке S1 (см. дополнительный файл 1) показана графическая визуализация дискретизации GL и то, как она оценивает дробную производную из значений прошлой функции. Он использует взвешенное суммирование старых данных, подчеркивая эффект внутренней памяти в дробном исчислении. Рисунок также, вероятно, показывает, как эволюция системы изменяется в результате α дробного порядка, демонстрируя, как решение отклоняется от обычных производных целочисленного порядка. Представляя постепенное изменение и влияние предыдущих состояний, дискретизация эффективно моделирует реальные процессы с долгосрочными зависимостями. Эта визуализация помогает понять численную реализацию систем дробного порядка и их приложения.
Численная реализация
В этом разделе процесс численного решения применяется к модели FWLD с использованием метода GL в Python для эффективного вычисления дробных производных и итеративного обновления состояний системы. В данной работе используется подход дискретизации времени на малые приращения и аппроксимации дробных производных с помощью биномиальных коэффициентов GL уравнения (3). Сначала была выполнена дискретизация временной области с постоянным шагом h для обеспечения стабильности и правильного представления динамики системы. Используя определения дробных производных GL, они могут быть аппроксимированы как конечное суммирование в соответствии с уравнением (4). В терминах гамма-функции биномиальные коэффициенты были вычислены, как определено в уравнении (3). Кроме того, рекурсивная формулировка этих биномиальных коэффициентов для нецелочисленных порядков дифференцирования была использована для обеспечения реалистичного представления дробного поведения. После того, как коэффициенты были известны, мы итеративно вычисляли переменные состояния Sn,T n,D n,C n,L n на каждом временном шаге на основе полученных дробных разностных уравнений, полученных из системы FWLD (Уравнения (1) и (5)). После итерационных вычислений прослеживалась эволюция системы с течением времени. В каждом случае значения предыдущего состояния использовались бы при определении следующего состояния, что полностью согласуется со схемой GL (уравнение (4)). Для изучения влияния на динамику системы была построена временная эволюция всех переменных состояния для различных дробных порядков α. Графический результат, демонстрирующий поведение модели FWLD с использованием дробного исчисления, включал графики временных рядов каждой переменной. Временные графики определяли устойчивость и сходимость, а также в целом влияние дробного дифференцирования на систему. Этот количественный метод помог продемонстрировать подход GL (уравнения (2)–(5)) для моделирования реальных динамических систем, дав мотивацию относительно того, почему производные дробного порядка необходимы для более тщательной количественной оценки сложных процессов.
Блок-схема на дополнительном рисунке S2 (см. дополнительный файл 1) схематически изображает пошаговый процесс вычисления дробной производной с приближением GL. Он начинается с инициализации параметров, таких как указание дробного порядка α и размера шага h, а затем указание начальных условий для переменных состояния. Итерационный алгоритм вычисляет биномиальные коэффициенты, применяет правило GL и обновляет состояния системы на каждом шаге. На каждой итерации применяется проверка сходимости, что позволяет продолжить процесс до последнего шага, после которого вычисленные результаты накапливаются и визуализируются. Программная нотация позволяет ясно понимать вычислительную процедуру и ее последующие выполнения.
Для воспроизводимости в численных экспериментах необходимо упомянуть стандартные параметры и настройки, принятые в моделировании. Дробный порядок был выбран как α = 0,85, что отражает субдиффузионную динамику, часто наблюдаемую в реальных энергетических системах. Размер временного шага h = 0,01 был выбран для обеспечения численной стабильности и адекватного временного разрешения, в то время как суммирование GL было усечено на N = 50 членов для поддержания вычислительной эффективности без существенной потери точности. Коэффициенты системы были выбраны как β = 0,03; γ = 0.25; θ = 0.2; η = 0.15; и δ = 0,1. Начальные условия были заданы как S(0) = 1000 МВт, T(0), D(0) = 0, C(0) = 0 и L(0) = 0. Общая продолжительность моделирования составила 24 часа, разделенных на 2400 временных шагов. Эти явные значения параметров будут полезны другим исследователям для воспроизведения численного подхода к решению и, таким образом, проверки результата.
Основной скрипт содержит функции для вычисления биномиальных коэффициентов Грюнвальда-Летникова, GL_binomial(), для обновления переменных состояния, fractional_update(), и для построения графиков временных рядов с помощью plot_states(). Пользователи могут открыть блокнот в Colab, ввести параметры в ячейку ввода (α, h, N и т. д.), запустить ячейку инициализации параметров, запустить функцию GL_binomial(), запустить ячейку цикла fractional_update() и запустить ячейку plot_states() для получения результатов. Установка на месте не требуется; Для выполнения всех команд шаг за шагом требуется только веб-браузер и учетная запись Google.
Расчет устойчивости
Чтобы убедиться в численной стабильности модели FWLD, мы проанализировали собственные значения ее матрицы системы. Устойчивость динамической системы тесно связана с динамикой ее собственных значений, так как они показывают, как система изменяется с течением времени. Системная матрица модели FWLD определяется как:
(6)
Устойчивость системы вычисляется путем изучения собственных значений λ матрицы A. Система считается численно устойчивой, если все собственные значения удовлетворяют следующему условию:
Re(λ) ≤ 0
Это условие гарантирует, что возмущения или отклонения состояния системы не будут увеличиваться со временем и позволят избежать численной нестабильности. Если все собственные значения обладают неположительными действительными частями, то система сходится к устойчивому состоянию без неограниченного роста переменных состояния. Если собственное значение обладает положительной вещественной частью, то система потенциально неустойчива и может приводить к дивергенции в численных решениях.
Чтобы обеспечить стабильность, мы рассчитали собственные значения A для различных дробных порядков α и значений параметров. Численное моделирование подтвердило, что при подходящих значениях параметров система стабильна. График собственных значений для анализа устойчивости представлен на дополнительном рисунке S3 (см. дополнительный файл 1), на котором положение собственных значений в комплексной плоскости дает представление о свойствах устойчивости системы. Если все собственные значения находятся в левой части комплексной плоскости, система стабильна; В противном случае может возникнуть нестабильность. Этот анализ является ключом к обеспечению надежности численной реализации метода GL при применении к модели FWLD.
Анализ сходимости
Чтобы определить сходимость численной схемы, мы рассмотрим, как численные решения подходят к задаче, когда размер шага h стремится к нулю. Принцип сходимости говорит нам, что если h → 0, то численное решение должно сходиться к точному решению задачи. Чтобы сделать это количественно, мы вычислим абсолютную ошибку между двумя последовательными приближениями с разными размерами шага:
(7)
Если En → 0 как , h → 0, то метод называется сходящимся. Другими словами, сходящееся поведение численного решения подтверждает правильность метода GL. На дополнительном рисунке S4 (см. Дополнительный файл 1) показана абсолютная погрешность дробной производной в зависимости от размера шага h в численной аппроксимации. Численное приближение становится все тоньше и тоньше по мере уменьшения размера шага h абсолютная ошибка значительно уменьшается; это предполагает согласованность метода GL и сходимость, в пределах бесконечной утонченности, к истинному решению. Из отображаемой кривой видно, что дальнейшая грануляция после определенной точки приводит к снижению отдачи, тем самым представляя собой компромисс между вычислительной стоимостью и точностью. Затем анализ сходимости свидетельствует о надежности численного метода, используемого для решения системы FWLD.
Визуализация и интерпретация
Графические графики важны с точки зрения интерпретации поведения системы и проверки численной точности. Различные формы визуализации дают больше информации о поведении систем дробного порядка. Графики временных рядов показывают временную эволюцию переменных состояния Sn,T n,D n,C n,L n, что позволяет анализировать тренды и свойства устойчивости. Графики в фазовом пространстве представляют собой взаимодействие различных переменных состояния и помогают понять системные взаимодействия и возможные паттерны аттракторов. Графики анализа ошибок показывают сравнения между численными и эталонными решениями и показывают, где находятся расхождения, оценивая точность численного метода. На рисунке 2 представлен график временных рядов, показывающий изменение переменных состояния в течение всего времени моделирования. По этому графику можно оценить устойчивость численного решения и его долгосрочную эволюцию.

Рисунок 2: График временного ряда, показывающий эволюцию переменных состояния для различных дробных порядков α = 0.4,0.7,0.9. Траектории показывают, как изменение дробного порядка влияет на динамическую реакцию системы. Сокращения: α = дробный порядок. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Графики временных рядов на рисунке 2 показывают эволюцию пяти переменных состояния S, T, D, C и L на горизонте моделирования. Поставка S падает при передаче и потреблении энергии; T передачи первоначально увеличивается из-за потерь в сети и задержек распределения, прежде чем успокоиться. Распределенная мощность D подвержена той же динамике, что и передача, но несколько затухает из-за резистивных потерь. Потребляемая мощность C плавно увеличивается и насыщается, что указывает на эффективную доставку нагрузки конечным пользователям. Потери энергии L колеблются и затухают под действием эффекта дробной памяти, подчеркивая, как прошлые состояния влияют на уровни текущих потерь. Сравнение различных дробных порядков α подтверждает, что стабилизация происходит быстрее для высоких порядков, но эффект памяти менее выражен, в то время как, напротив, низкие значения α сохраняют сильный исторический эффект с более плавным переходом. Этот анализ производительности подтверждает способность модели фиксировать реалистичное поведение нелокального времени в сценариях диспетчеризации питания.
Сравнение с другими методами
Чтобы доказать точность метода GL, мы сравним его результаты с другими численными дробными методами. Методы предиктора-корректора на основе Капуто и дробного метода Эйлера обычно используются для решения дробных дифференциальных уравнений. Метод предиктора-корректора на основе Капуто более точен из-за его адаптивных шагов коррекции, но он требует больших вычислительных ресурсов. Дробный метод Эйлера проще в реализации, но имеет меньшую точность, чем дискретизация GL. Сравнение показано на рисунке 3, где выходные данные метода GL сравниваются с выходными данными этих других методов. Сравнение определяет компромисс между вычислительными затратами и численной точностью, подтверждая, что метод GL хорошо подходит для решения систем дробного порядка.

Рисунок 3: Сравнение метода GL с другими дробными численными подходами. На рисунке показаны различия в точности и стабильности между методами. Сокращения: GL = Grünwald-Letnikov. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
На рисунке 3 показаны компромиссы между затратами и точностью для модели FWLD с использованием метода GL. По мере уменьшения размера шага h и увеличения предела усечения N численные ошибки значительно уменьшаются, что обеспечивает убедительное подтверждение сходимости и повышает точность. Тем не менее, требуются большие вычисления, потому что диапазон чисел велик. Кроме того, необходимо использовать меньшие временные шаги с уменьшающимся размером шага, что приводит к дальнейшим вычислениям. Как видно из графика, баланс между ними должен быть достигнут там, где допустимая ошибка все еще присутствует без слишком большой вычислительной нагрузки. Для данного исследования шаг с шагом h 0,01 и N = 50 позволили получить стабильные результаты с очень малой погрешностью и управляемым временем выполнения, что делает метод GL точным и вычислительно жизнеспособным для моделирования дробного порядка в реальном времени в приложениях диспетчеризации питания. Модель FWLD с использованием метода GL была использована для сравнения численных результатов, касающихся стандартной разностной схемы в системах целочисленного порядка. Метод GL представляет собой среднее снижение абсолютной ошибки на 18% по сравнению с FDS в течение равного времени, сохраняя приемлемое вычислительное время. Это подтверждает точность моделирования дробного порядка для систем, зависящих от памяти, поскольку это преимущество не требует серьезных вычислительных затрат.
Метод дробного ГЛ имеет множество преимуществ по сравнению с традиционными моделями целочисленного порядка. Во-первых, он обладает лучшими возможностями прогнозирования, поскольку учет эффектов памяти делает дробные модели способными лучше иллюстрировать реальное поведение диспетчеризации нагрузки. Во-вторых, этот метод улучшает анализ устойчивости, поскольку дробные производные дают лучшее представление о стабильности системы и механизмах управления. Еще одним существенным преимуществом является его гибкость в моделировании, где дробный порядок может быть настроен для представления различных рабочих условий; Таким образом, модель очень гибкая для адаптации к различным сценариям диспетчеризации нагрузки. Метод GL является эффективным численным методом для решения модели FWLD. В настоящем исследовании используется реализация Python для точного расчета эволюции системы, подтверждения ее стабильности и доказательства сходимости. Будущие усовершенствования могут быть направлены на максимизацию вычислительной эффективности и расширение применения метода к более совершенным дробным системам, повышая его потенциал в практических приложениях.
Сбор и предварительная обработка данных
В этой статье мы подробно обсудим набор данных, используемый для прогнозирования нагрузки мощности, включая методологии сбора данных и необходимые шаги предварительной обработки, предпринятые для совершенствования и организации данных. Качественный сбор данных и систематическая предварительная обработка являются неотъемлемой частью разработки точной и стабильной прогностической модели при сохранении согласованности в прогнозировании силовой нагрузки. Данные состоят из значений диспетчерской нагрузки в режиме реального времени, зарегистрированных на нескольких фидерных станциях в течение длительного периода времени в несколько месяцев. Показания снимаются на почасовой основе, что дает отличное понимание сдвигов в спросе на электроэнергию, вызванных многочисленными факторами, такими как смена сезонов, повседневные профили нагрузки и атмосферные условия. Сезонные колебания влияют на спрос на электроэнергию из-за различных погодных условий, что приводит к увеличению спроса на летнее охлаждение и зимнее отопление. Модели ежедневных нагрузок учитывают вариации в зависимости от рабочего времени, пиковых часов спроса и снижения использования в ночное время. Изменения также происходят из-за внешних факторов, таких как резкие изменения погоды, сроки технического обслуживания и деятельность отраслей.
Необработанные данные о силовой нагрузке обычно страдают от несоответствий, таких как отсутствующие значения, выбросы и масштабирование, которые необходимо исправить перед применением моделей машинного обучения для достижения правильного прогнозирования. Конвейер предварительной обработки включал обработку отсутствующих значений, масштабирование нагрузок питания, обнаружение аномалий и проектирование признаков, необходимых для повышения производительности прогнозирования. Пропущенные значения, возникшие в результате отказа передачи или датчика, обрабатывались с помощью методов интерполяции и статистического условия. Значения силовой нагрузки также были нормализованы для обеспечения согласованности между различными фидерными станциями и предотвращения смещения во время обучения модели. Выбросы из-за неисправных датчиков или ненормальных режимов работы были отброшены с помощью эффективных методов удаления выбросов. Соответствующие функции, такие как временные индикаторы, такие как час суток, день недели и сезонные тенденции, также были разработаны для повышения производительности модели.
Сбор данных
Информация, использованная в этом исследовании, была собрана с различных фидерных станций, которым было поручено следить за распределением электроэнергии в различных регионах. Фидерные станции расположены стратегически таким образом, чтобы они могли эффективно регистрировать изменения силовой нагрузки и балансировать подачу электроэнергии. Потребляемая мощность регистрируется каждой фидерной станцией через определенные промежутки времени и передается в центральную систему мониторинга. Это автоматизированная система, консолидирующая данные из нескольких источников и обеспечивающая всестороннее изучение различий в нагрузках между разными географическими районами.
Каждая точка в наборе данных включает в себя три важные характеристики: название фидера, отличительное название системы распределения электроэнергии, измеряемую мощность нагрузки в мегаваттах (МВт) и временную метку точного времени проведения измерения. Набор данных представляет собой запись о потреблении энергии с отметкой времени, которая позволяет выявлять тенденции и закономерности во времени. В таблице 1 представлено небольшое подмножество собранных данных, состоящее из частей часовых нагрузок мощности, взятых на фидерной станции 11 кВ REC I1.
| FEEDER_NAME | СТОИМОСТЬ (МВТ) | ВРЕМЯ |
| КВ РЕК I1 | 34.6089 | 1/12/2022 1:00 |
| КВ РЕК I1 | 32.2761 | 1/12/2022 2:00 |
| КВ РЕК I1 | 30.2142 | 1/12/2022 3:00 |
Таблица 1: Пример собранных данных об отправке груза.
Данные были получены из централизованной системы диспетчерского управления и сбора данных (SCADA), которая консолидирует данные с нескольких фидерных станций. Данные передаются с помощью автоматизированных счетчиков, что обеспечивает непрерывный мониторинг изменений силовой нагрузки в режиме реального времени. Тем не менее, из-за ограничений в работе возникают проблемы со сбором данных о сбоях передачи, неисправностях датчиков и внешних возмущениях. Сбой передачи может привести к отсутствию значений, поэтому для обеспечения целостности набора данных необходимо использовать методы условного расчета. Неисправности датчика могут привести к неправильным измерениям; Таким образом, необходимо обнаружение и коррекция аномалий с помощью статистических методов. Отключения электроэнергии и резкие изменения нагрузки усложняют обработку данных. Чтобы решить эти проблемы, этап предварительной обработки включал строгие методы проверки данных, такие как обнаружение аномалий, сглаживание данных и коррекция выбросов, чтобы сделать набор данных подходящим для моделей прогнозирования на основе машинного обучения. После этого очищенный набор данных был готов к дополнительному извлечению признаков и обучению модели.
Набор данных состоял из исторических почасовых данных о нагрузке, собранных за 12 месяцев с помощью общедоступного эталонного инструмента интеллектуальных сетей. Обучающее разделение составило 80% данных, в то время как 20% данных было отложено для целей тестирования. Дробное взвешивание разностного оператора Dα было принято с шагом по времени 1 ч, при этом α = 0,85 для представления Капуто. Входные объекты масштабировались в диапазоне от 0 до 1. Впоследствии модель обучалась с помощью 200-эпохального цикла и подавалась мини-партиями размером 32. Пользователь может запросить полную статистику набора данных и скрипты предварительной обработки в целях воспроизводимости.
Работа с недостающими данными
В реальных наборах данных отсутствующие значения в большинстве случаев являются серьезной проблемой, возникающей в результате временной потери подключения, сбоев оборудования или неправильной передачи данных. Если отсутствующие значения не обрабатываются, они приводят к искажению статистического анализа и созданию предвзятых прогностических моделей. Успешная обработка отсутствующих значений гарантирует согласованность и достоверность набора данных, тем самым повышая производительность модели. В данном исследовании было использовано несколько методов условного расчета в зависимости от распространенности набора данных и типа пропусков. Для временных пробелов в наборе данных использовалась линейная интерполяция. Он оценивает пропущенные значения на основе соседних наблюдаемых точек, обеспечивая плавный переход между известными точками данных. Недостающее значение в момент времени t вычисляется следующим образом:
(8)
Где X(t-1) и X(t+1) — непосредственно предшествующие и следующие наблюдаемые величины соответственно. Линейная интерполяция очень хорошо работает для коротких промежутков, но не является удовлетворительной для больших последовательностей отсутствующих данных. Для увеличения пропущенных интервалов использовались передовые методы. Информация, использованная в этом исследовании, была собрана с различных фидерных станций, которым было поручено контролировать распределение электроэнергии в различных регионах. Фидерные станции расположены стратегически таким образом, чтобы они могли эффективно регистрировать изменения силовой нагрузки и балансировать подачу электроэнергии. Потребляемая мощность регистрируется каждой фидерной станцией через определенные промежутки времени и передается в центральную систему мониторинга. Это автоматизированная система, консолидирующая данные из нескольких источников и обеспечивающая всестороннее изучение различий в нагрузках между разными географическими районами. Информация, использованная в этом исследовании, была собрана с различных фидерных станций, которым было поручено следить за распределением электроэнергии в различных регионах. Фидерные станции расположены стратегически таким образом, чтобы они могли эффективно регистрировать изменения силовой нагрузки и балансировать подачу электроэнергии. Потребляемая мощность регистрируется каждой фидерной станцией через определенные промежутки времени и передается в центральную систему мониторинга. Это автоматизированная система, консолидирующая данные из нескольких источников и всесторонне изучающая различия нагрузок между разными географическими районами.
Каждая точка в наборе данных включает в себя три важные характеристики: название фидера, отличительное название системы распределения электроэнергии, измеряемую мощность нагрузки в мегаваттах (МВт) и временную метку точного времени проведения измерения. Набор данных представляет собой запись о потреблении энергии с отметкой времени, которая позволяет выявлять тенденции и закономерности во времени. В таблице 1 представлено небольшое подмножество собранных данных, состоящее из части часовых нагрузок мощности, взятых на фидерной станции 11 кВ REC I1.
Полиномиальная интерполяция использовалась для оценки недостающих значений на кривых полиномов более высокой степени, которые были подогнаны к окружающим точкам данных. Методы импутации на основе машинного обучения, такие как K-ближайшие соседи (KNN) и регрессия случайного леса, также использовались для восстановления пропущенных значений. Эти методы учитывают исторические закономерности и корреляции признаков для более точного условного расчета. Метод импутации KNN заполняет отсутствующее значение путем усреднения k ближайших соседей в пространстве признаков, в то время как регрессия случайного леса создает ансамбль деревьев решений для прогнозирования недостающих значений из других предоставленных атрибутов.
Нормализация данных
Ненормализованные значения ненормализованных нагрузок отражают большие колебания величины в зависимости от колебаний мощности фидера и местного спроса на электроэнергию. Прямой ввод ненормализованных значений в алгоритмы машинного обучения приводит к численной нестабильности и смещению результатов. Чтобы противостоять этому, было использовано масштабирование Min-Max, чтобы реструктурировать все значения в стандартизированный интервал от 0 до 1, который сохраняет относительные различия, но обеспечивает однородность между объектами. Формула нормализации следующая:
(9)
Где Xmin и Xmax представляют минимальную и максимальную наблюдаемые силовые нагрузки в наборе данных. Это преобразование гарантирует, что все признаки вносят пропорциональный вклад в модель без доминирования какой-либо одной переменной из-за различий в масштабе.

Рисунок 4: Сравнение исходных и нормализованных значений нагрузки. Нормализация выявляет основные тенденции и уменьшает влияние различий в масштабе. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
На рисунке 4 показано преобразование исходных значений нагрузки мощности в нормализованный диапазон, что подчеркивает влияние масштабирования Min-Max на распределение данных. Значения исходной нагрузки имеют широкий диапазон величин из-за различий в энергопотреблении между фидерными станциями. Моделям машинного обучения будет трудно интерпретировать эти различия без нормализации, что приведет к несбалансированной важности признаков и снижению скорости сходимости во время обучения. При использовании минимального и максимального масштабирования все значения силовой нагрузки нормализуются в диапазоне [0,1], сохраняя исходное распределение, но устраняя численные различия, которые могут непропорционально повлиять на модель. Этот метод нормализации улучшает способность модели достаточно хорошо обобщать по различным фидерам и временным периодам, а также повышает общую точность прогнозирования. Кроме того, он защищает от численной нестабильности при применении в алгоритмах оптимизации для тех моделей, которые используют методы обучения на основе градиента. Диаграмма предлагает сравнительное визуальное представление, позволяющее выявить способы, с помощью которых нормализация нормализует нагрузки, сохраняя при этом ключевые модели спроса на электроэнергию.
Обнаружение и удаление выбросов
Выбросы в данных о силовой нагрузке могут возникать из-за резких скачков нагрузки, неисправных датчиков или непредвиденных аномалий в работе. Если оставить такие аномалии без внимания, они могут исказить статистические распределения и отрицательно повлиять на производительность модели. Чтобы обеспечить целостность данных, для обнаружения и устранения выбросов использовались как статистические, так и основанные на машинном обучении методы. Одним из наиболее распространенных статистических методов обнаружения выбросов является подход межквартильного диапазона (IQR), который устанавливает приемлемый интервал на основе квартили данных. IQR рассчитывается следующим образом:
(10)
Где Q1 и Q3 представляют первый и третий квартили набора данных. Любая точка данных, лежащая за пределами диапазона, считается выбросом и исключается из набора данных.
(11)
Метод IQR успешно удаляет значения экстремальных отклонений от центрального распределения. Для более сложных шаблонов выбросов использовались подходы, основанные на машинном обучении. Алгоритм Isolation Forest, основанный на семействе аномалий, был использован для поиска и изоляции наблюдений выбросов. Isolation Forest строит ряд деревьев решений и находит выбросы, оценивая, насколько изолированной становится точка данных от оставшегося набора данных. Аномалии, будучи своеобразными по своей природе, имеют тенденцию изолироваться с меньшим количеством расщеплений и могут быть обнаружены соответствующим образом.
Кроме того, метод Local Outlier Factor (LOF) также использовался для идентификации аномалий в качестве меры плотности точки по отношению к ее соседям. LOF возвращает оценку аномалии для каждой записи в зависимости от несходства локальной плотности точки по сравнению с соседними точками данных. Он дает более высокое значение LOF точке данных, если точка сильно отличается от соседних точек, поэтому имеет большое право на исключение. Интеграция методов IQR, Isolation Forest и LOF обеспечивает надежную стратегию обнаружения выбросов, поддержания качества данных и производительности модели. После удаления выбросов набор данных был использован для обучения и оценки, что привело к более точным и надежным результатам прогнозирования.
Проектирование характеристик
Проектирование признаков — это строительный блок машинного обучения, который повышает производительность модели за счет создания информативных представлений данных. В этом исследовании, помимо значений силовых нагрузок, учитывались и другие внешние погодные условия, такие как температура, влажность и скорость ветра. Эти условия окружающей среды оказывают широкомасштабное влияние на потребление электроэнергии, поскольку изменения температуры регулируют потребности в отоплении и охлаждении, в то время как скорость ветра может влиять на интеграцию возобновляемых источников энергии в сеть. Используя такие функции, модель выявляет более эффективные базовые модели потребления энергии. Кроме того, были выведены временные функции для фиксации циклических закономерностей в потреблении электроэнергии. Ежедневные и еженедельные модели использования имеют сильные циклические закономерности из-за рутины человеческой деятельности, рабочих дней и производственной деятельности. Чтобы успешно представить эти временные отношения, были использованы синусоидальные преобразования в час дня и день недели:
(12)
Где t представляет метку времени в часах. Это преобразование обеспечивает сохранение циклической временной информации, что позволяет модели эффективно распознавать повторяющиеся тенденции спроса на электроэнергию.
На дополнительном рисунке S5 (см. Дополнительный файл 1) показано синусоидальное кодирование, используемое для часовых функций, основанных на времени. Этот процесс помогает модели распознавать различное время суток без потери внутреннего циклического аспекта спроса на электроэнергию. Простое категориальное кодирование может быть ограничено в улавливании непрерывности между различными временами (например, часом 23 и часом 0), но синусоидальное кодирование обеспечивает плавные переходы, тем самым повышая точность прогнозирования.
Разделение набора данных
После завершения предварительной обработки набор данных был систематически разделен на три набора: обучающий набор, проверочный набор и тестовый набор, основанный на разделении 80-10-10. Обучающий набор, содержащий 80 % данных, был использован для обучения модели машинного обучения. Проверочный набор, составляющий 10% данных, использовался для настройки гиперпараметров, чтобы модель не переобучала обучающие данные и могла эффективно обобщать на новые экземпляры. Наконец, тестовый набор, также 10% данных, был оставлен для финального теста, который предлагал объективную оценку прогностических способностей модели. Этот метод секционирования обеспечивает равное представление данных по всем трем наборам, сохраняя временной порядок данных без препятствования обучению и проверке модели. Соблюдение хронологического порядка при разделении позволяет избежать утечки данных, при которой информация из будущего может случайно загрязнить процесс обучения, что приведет к чрезмерно оптимистичным оценкам производительности.
На дополнительном рисунке S6 (см. Дополнительный файл 1) показано визуальное представление разделения набора данных на обучающий, валидационный и тестовый наборы данных. Используя этот структурированный подход, модель обучается на большом фрагменте набора данных, оставляя достаточно данных для объективного тестирования. Правильное разбиение наборов данных в задачах прогнозирования временных рядов гарантирует, что производительность модели при обучении отражает истинные случаи на практике, когда будущие наблюдения не видны при обучении. Благодаря этим этапам предварительной обработки, от проектирования признаков до правильного разделения набора данных, мы обеспечили чистоту, хорошо структурированный и хорошо представленный полезными функциями. Этот хорошо подготовленный набор данных служит хорошей основой для обучения моделей машинного обучения, которые смогут правильно прогнозировать тенденции диспетчеризации силовой нагрузки, тем самым в конечном итоге способствуя эффективному управлению энергией и стабильности сети.