Исследовательская статья

Ретроспективное прогнозирование с использованием данных провинциальной сети и гибридной физико-интеллектуальной модели на основе квот

22 просмотров

DOI:

10.3791/72395

28 августа 2026 г.

В этой статье

Краткое содержание

В данном исследовании предлагается гибридная модель прогнозирования затрат для энергосетей, которая сочетает физические квоты затрат с динамическими макроэкономическими/технологическими корректировками и компенсацией остатков на основе XGBoost. При достижении MAPE 2,34% модель обеспечивает баланс между точностью и интерпретируемостью, отвечая требованиям регуляторной прозрачности при установлении тарифов.

Аннотация

Глобальный энергетический переход и текущие реформы рынка электроэнергии требуют от предприятий электросетевого хозяйства обеспечения баланса между надежностью электроснабжения и все более строгими правилами регулирования тарифов на передачу и распределение энергии. Традиционные методы бюджетирования, основанные на исторической экстраполяции, часто не отражают физическую основу эксплуатации активов, в то время как модели машинного обучения на основе данных обеспечивают высокую точность прогнозирования, но лишены прозрачности, необходимой для регуляторной верификации затрат. Чтобы решить проблему компромисса между точностью прогнозирования и интерпретируемостью, в данном исследовании предлагается гибридная модель прогнозирования затрат, основанная на квотах затрат. В данной структуре в качестве физической базы бюджетирования используются стандартизированные эксплуатационные квоты, а также внедрен динамический механизм эволюции квот, обусловленный макроэкономическими условиями и технологическим прогрессом. Для выявления нелинейных остатков, выходящих за рамки оценок на основе квот, применяется метод Extreme Gradient Boosting (XGBoost), а для интерпретации вклада ключевых факторов затрат используется метод SHAP (Shapley Additive exPlanations). Модель была оценена с использованием анонимизированных эксплуатационных данных за 16 лет из провинциальной электросети Китая. Была достигнута средняя абсолютная ошибка в процентах (MAPE) на уровне 2.34%, что позволило снизить ошибки прогнозирования на 61.8%, 46.6% и 34.1% по сравнению с моделями SARIMAX, автономным XGBoost и Attention-LSTM соответственно. Предложенная структура объединяет инженерные принципы квотирования затрат с объяснимым искусственным интеллектом, обеспечивая как точные долгосрочные прогнозы затрат, так и прозрачный инструмент поддержки принятия решений для верификации допустимых регуляторных затрат.

Введение

Глобальный энергетический переход меняет подходы к управлению активами и операционную практику в электросетях за счет интеграции распределенной возобновляемой генерации, учащения экстремальных погодных явлений и повсеместного внедрения технологий IoT, что требует большей операционной гибкости и дополнительных ресурсов для технического обслуживания с целью обеспечения надежности системы1,2. В то же время органы регулирования электроэнергетики ужесточили надзор за тарифами на передачу и распределение электроэнергии с помощью таких механизмов, как RIIO в Великобритании и обзоры нормы прибыли Федеральной комиссии по регулированию энергетики США, уделяя особое внимание прозрачности обоснования затрат3. Китай аналогичным образом внедрил механизм регулирования по принципу «допустимые затраты плюс разумная прибыль», требующий от коммунальных служб демонстрации четкой связи между инженерно-техническими мероприятиями и финансовыми расходами4. Однако электросетевым компаниям зачастую не хватает прозрачных количественных инструментов, связывающих эксплуатацию физических активов с прогнозами затрат, что ограничивает эффективность регуляторной проверки расходов5.

Существующие подходы к прогнозированию имеют серьезные ограничения в данной среде6. Традиционные методы, включая инкрементальное бюджетирование и модели на основе ARIMA, предполагают относительную стабильность исторических закономерностей и часто демонстрируют низкую эффективность при структурных изменениях, вызванных экономическими колебаниями или экстремальными погодными условиями7. С другой стороны, современные модели машинного обучения, такие как архитектуры LSTM и Transformer, обеспечивают высокую точность краткосрочного прогнозирования, но им не хватает инженерной интерпретируемости, необходимой для принятия регуляторных решений8,9. Хотя современные гибридные подходы к прогнозированию сочетают методы статистики и машинного обучения, они, как правило, игнорируют стандартизированные инженерные квоты затрат, лежащие в основе систем учета энергосетей10. Для устранения этих ограничений в данной работе предлагается гибридная структура прогнозирования на основе квот, которая сочетает динамическую эволюцию квот с коррекцией остатков на базе машинного обучения, что позволяет сохранить инженерную интерпретируемость при повышении точности прогнозирования.

Одно из основных направлений исследований вытекает из регулирования стимулов в отраслях с естественной монополией, включая механизм RPI-X в Великобритании и систему верификации допустимых затрат в Китае11. В этих работах операционная эффективность оценивается преимущественно с помощью анализа оболочки данных (DEA) и стохастического анализа границы (SFA)12. В предыдущих исследованиях изучались долгосрочные взаимосвязи между капитальными затратами (CAPEX), операционными расходами (OPEX) и эффективностью затрат для обоснования тарифного регулирования13,14. Хотя такие подходы дают ценную макроэкономическую информацию, их результаты обычно выражаются в виде показателей относительной эффективности, а не в виде денежных прогнозов, пригодных для ежегодного бюджетного планирования15,16. Кроме того, граничные модели обычно предполагают относительно стабильную структуру физических активов и условий эксплуатации, что ограничивает их способность фиксировать резкие изменения затрат, вызванные старением активов, заменой инфраструктуры или стремительным ростом спроса17,18.

Второе направление исследований сосредоточено на моделях прогнозирования на основе статистики и искусственного интеллекта. В ранних работах для прогнозирования затрат применялись множественная линейная регрессия и модели авторегрессионного интегрированного скользящего среднего с экзогенными переменными (ARIMAX)19. В последнее время модели регрессии на основе метода опорных векторов, случайные леса, XGBoost, LSTM и трансформеры значительно повысили точность прогнозирования за счет использования нелинейных зависимостей и многомерных пространств признаков20,21,22. В этих подходах часто учитываются такие макроэкономические показатели, как спрос на электроэнергию, индексы цен производителей (PPI) и климатические переменные23. Однако эксплуатационные расходы электросетей обусловлены инженерной деятельностью, износом активов, графиками технического обслуживания и управленческими решениями, а не только макроэкономическими переменными24. Следовательно, чисто эмпирические модели, основанные на данных, часто функционируют как «черные ящики», что затрудняет обоснование прогнозируемых затрат в ходе регуляторных проверок или верификации разрешенных расходов25,26.

Управление нормами инженерных затрат предлагает потенциальное решение этой проблемы27. Метод расчета затрат по видам деятельности (ABC) долгое время опирался на стандартизированные эксплуатационные нормы для оценки потребностей в трудовых ресурсах, материалах, оборудовании и техническом обслуживании при проведении рутинных операций в электросетях28. Крупные китайские коммунальные предприятия разработали комплексные базы данных норм, охватывающие деятельность по осмотру, техническому обслуживанию, испытаниям, ремонту и замене оборудования. Тем не менее, эти инженерные стандарты используются преимущественно для расчета окончательной стоимости проектов и аудита, а не для динамического долгосрочного прогнозирования29,30. Более того, нормы стандартов обычно пересматриваются лишь раз в несколько лет, что делает их недостаточно гибкими в условиях меняющихся цен на сырье, технологического прогресса и изменения эксплуатационной практики31. Применение систем норм для миллионов распределенных активов также создает значительные вычислительные сложности при крупномасштабном прогнозировании32.

Несмотря на значительные успехи в области статистического прогнозирования, машинного обучения и управления инженерными затратами, на сегодняшний день не существует структуры, которая эффективно объединяла бы стандартизированные квоты инженерных затрат, динамическую макроэкономическую корректировку и объяснимое машинное обучение в единую прогностическую модель для верификации нормативных затрат. Была выдвинута гипотеза, что сочетание динамически изменяющихся квот затрат с остаточным обучением на базе XGBoost позволит повысить точность долгосрочного прогнозирования, сохраняя при этом инженерную прозрачность, необходимую для принятия регуляторных решений. Для проверки этой гипотезы была разработана гибридная структура прогнозирования на основе квот, интегрирующая физическое моделирование затрат, механизмы макроэкономической и технологической корректировки, компенсацию остатков с помощью XGBoost и интерпретацию модели на основе SHAP. Предложенный подход направлен на обеспечение как точных долгосрочных прогнозов затрат, так и прозрачных доказательств для подтверждения допустимых затрат в условиях современного регулирования рынка электроэнергии.

Протокол

В данном исследовании использовались анонимизированные операционные и финансовые данные, собранные в провинциальной электросети на востоке Китая. Все данные были агрегированы и обезличены перед анализом; персональная информация или конфиденциальные данные на индивидуальном уровне не включались. Таким образом, этическое одобрение не требовалось. Доступ к данным и их анализ осуществлялись в соответствии с применимыми правилами защиты данных и институциональными соглашениями, регулирующими информацию в электроэнергетическом секторе.

Обзор структуры прогнозирования

Для интеграции подходов к прогнозированию на основе физических моделей и анализа данных была разработана гибридная система прогнозирования, сочетающая инженерные квоты затрат с машинным обучением. Вместо простого объединения нескольких алгоритмов, данная система основана на принципе, согласно которому физические модели формируют базовый прогноз, в то время как машинное обучение компенсирует остаточные ошибки. Такая архитектура гарантирует, что процесс прогнозирования опирается на физические механизмы, лежащие в основе процессов производства и эксплуатации энергосистемы, а не основывается исключительно на экстраполяции исторических затрат.

В рамках данной структуры сначала устанавливается иерархическое соответствие между активами энергосистемы, стандартизированными операционными действиями и счетами финансовых затрат. Затраты на производство и эксплуатацию рассматриваются как денежное выражение ресурсов, потребляемых физическими активами — включая подстанции, линии электропередачи, распределительные фидеры, приборы учета и оборудование для цифрового контроля — в ходе выполнения таких рутинных работ, как осмотр, техническое обслуживание, испытания, ремонт и замена. Нормативы затрат служат связующим звеном между измеримым объемом инженерных работ и соответствующими финансовыми расходами.

Как показано на Рисунке 1, квоты затрат функционируют как стандартизированные учетные единицы, интегрированные во весь процесс эксплуатации и технического обслуживания активов, а не как абстрактные правила распределения финансовых средств. Рабочие нагрузки по активам нижнего уровня преобразуются в стандартизированные эксплуатационные квоты и в дальнейшем сопоставляются с категориями затрат, включая трудозатраты, материалы, строительную технику, сторонние услуги и аварийные запасы. Такое иерархическое сопоставление обеспечивает инженерную интерпретируемость и нормативную прослеживаемость на протяжении всего процесса прогнозирования, а также создает физическую основу для построения статической базовой модели квот.

Обзор методологического процесса

Предлагаемая структура прогнозирования состоит из трех последовательных этапов: (1) построение физической базы с использованием квот рабочей нагрузки на уровне активов, (2) динамическое изменение квот затрат посредством макроэкономических и технологических корректировок и (3) компенсация остатков на основе машинного обучения для учета систематических нелинейных эффектов. Как показано на Рисунке 1, данная структура устанавливает иерархическое отображение от активов нижнего уровня и стандартизированных операционных действий к прогнозам затрат на производство и эксплуатацию. Детали реализации каждого этапа описаны в следующих подразделах.

Модель базовой физической стоимости на основе рабочих нагрузок на уровне активов

Затраты на производство и эксплуатацию энергосистемы, Ctotal, включают расходы, связанные с многочисленными видами хозяйственной деятельности, в том числе с эксплуатацией подстанций, техническим обслуживанием линий электропередачи, управлением распределительными сетями, обслуживанием клиентов и вспомогательными системами. В данном исследовании предполагается, что базовые эксплуатационные расходы определяются объемом работ, создаваемым каждым стандартизированным видом операционной деятельности, и соответствующей квотой затрат.

Статическая базовая стоимость рассчитывается следующим образом:

Математическая формула для расчета C_base,t с символами суммирования; используется при анализе данных.   (1)

где Vi,k,t обозначает объем работ, связанный с i-м активом или операционной задачей в рамках бизнес-категории k в период t, а Qi,k представляет соответствующую стандартизированную единичную стоимость, определенную системой инженерных квот затрат. Бизнес-категория включает основные операционные функции, такие как техническое обслуживание подстанций, инспекция линий электропередачи, эксплуатация распределительных сетей и обслуживание клиентов. Двойное суммирование объединяет затраты на все стандартизированные операционные действия для оценки теоретического базового уровня расходов, необходимых для поддержания нормального функционирования энергосети.

Уравнение (1) устанавливает физическую взаимосвязь между инженерным объемом работ и финансовыми затратами путем прямого сопоставления стандартизированных операционных действий с соответствующими счетами затрат. В отличие от чисто статистических моделей прогнозирования, данная формулировка обеспечивает интерпретируемую инженерную базу, которая служит основой для последующей динамической корректировки квот и исправления остаточных отклонений на основе машинного обучения. Уравнение было разработано на основе операционной практики и системы стоимостных квот, используемых предприятиями провинциальных электросетей Китая. В Таблице 1 приведены обозначения, используемые в уравнении (1), включая объем работ (Vi,k,t), стандартизированную единичную стоимость (Qi,k), количество операционных задач (Nk) и индекс категории бизнеса (k).

Механизм динамической эволюции квот при внешних воздействиях окружающей среды

Стандартизированные квоты затрат (Qi,k) обеспечивают физически интерпретируемую базовую линию, однако они не учитывают изменения макроэкономических условий или технологический прогресс. Для повышения их долгосрочной применимости был внедрен механизм динамической эволюции для корректировки базовых квот в ответ как на ценовую инфляцию, так и на рост эффективности, обусловленный технологическим развитием.

Первая корректировка учитывает изменения затрат на закупки, вызванные макроэкономической инфляцией. Эксплуатация и техническое обслуживание электросетей в значительной степени зависят от основных материалов, включая медь, алюминий и электротехническую сталь, цены на которые тесно связаны с колебаниями индекса цен производителей (PPI). Поскольку Уравнение для расчета экономического индекса, включающее индикатор уровня цен, символ I{PPI,t}. представляет собой индекс с базовым значением 100, он сначала преобразуется в стандартизированный уровень инфляции:

Формула индекса цен, расчет PPI, уравнение для анализа инфляции и экономических исследований.   (2)

На этом основании функция коррекции цены Формула статического равновесия Φ(I[PPI],t), уравнение, физика, принцип баланса, исследовательский анализ. определяется следующим образом:

Формула статического равновесия, нотация произведения Σ, образовательная математическая концепция, анализ уравнения.   (3)

где Статическое равновесие, ΣF=0, MA=0; на диаграмме показаны сбалансированные силы для структурного анализа, образовательные цели. — вектор груза-противовеса длиной L, удовлетворяющий

Формула статического равновесия, Σωτ=1, ωτ≥0, математическое уравнение для суммационного анализа.

Структура лага представляет собой отложенную передачу макроэкономической инфляции на затраты по закупкам в цепочке поставок электросетевого хозяйства. Преобразование индекса PPI в стандартизированный уровень инфляции позволяет сохранить кумулятивный эффект изменения цен, избегая при этом систематической ошибки масштабирования, связанной с прямым использованием значений индекса. Уравнения (2) и (3) адаптированы из общепринятых моделей корректировки макроэкономической инфляции, при этом структура лага откалибрована с учетом циклов закупок в энергетическом секторе33,34.

Технологический прогресс был учтен с помощью коэффициента снижения затрат, который отражал повышение операционной эффективности в результате внедрения таких достижений, как инспекции с помощью беспилотных летательных аппаратов, интеллектуальная робототехника и технологии цифрового технического обслуживания. Коэффициент технологической корректировки определяется следующим образом:

Уравнение экономической модели, Γ(E_tech,t)=1-α·ln(1+β·E_tech,t), иллюстрирующее технологический рост.  (4)

В данной части α и β представляют собой эмпирические коэффициенты эластичности, оцененные на основе исторических панельных данных с помощью метода нелинейных наименьших квадратов. Чтобы фактор технологического прогресса всегда соответствовал обоснованному снижению удельных затрат по квоте, процесс оценки параметров ограничивает значение 0 < Γ(Etech,t) ≤ 1. Следует отметить, что этот фактор в первую очередь отражает долгосрочное повышение эффективности, resulting from замены технологий на более зрелые. Уравнение (4) является оригинальным для данной работы и адаптирует концепцию кривой обучения из литературы по стоимости энергетических технологий35,36 к операциям по техническому обслуживанию электросетей. Дополнительные затраты, которые могут возникнуть на раннем этапе внедрения цифрового оборудования, такие как параллельная работа старых и новых систем, интеграция платформ, тестирование связи и дополнительное техническое обслуживание, не вычитаются принудительно из базовой квоты; вместо этого они определяются последующим модулем компенсации остатков на основе машинного обучения:

Формула статического равновесия, C_quota,t = C_base,t · Φ(PPI,t) · Γ(E_tech,t), уравнения, анализ.  (5)

где Cbase,t обозначает статическую базовую стоимость, рассчитанную на основе рабочих нагрузок активов нижнего уровня и стандартизированных квот на эксплуатационные расходы; Формула статического равновесия Φ(I[PPI],t), уравнение, физика, принцип баланса, исследовательский анализ. отражает эффект передачи макроэкономических колебаний цен на стоимость материалов, оборудования и внешних услуг; а Γ(Etech,t) отражает снижение удельных затрат на эксплуатацию и техническое обслуживание за счет повышения эффективности после достижения технологической зрелости. Благодаря вышеописанному механизму динамической эволюции базовая квота перестает быть статическим бухгалтерским показателем и может адаптивно корректироваться при изменении экономических условий и технологических факторов. Уравнение (5) является оригинальным для данной работы и представляет собой новую интеграцию ценовых и технологических поправок в структуру базовой квоты.

Систематический захват нелинейных остатков при наличии квотных ограничений

Несмотря на сложные эволюционные корректировки, модель квотирования неизбежно вызывает систематические отклонения при возникновении непредсказуемых погодных сбоев, связанных с катастрофами, и внезапных политических директив, таких как увеличение затрат на обработку жалоб клиентов в периоды временного снижения тарифов. Это отклонение формирует остаточный член по обе стороны уравнения:

Rt=Cactual,t-Cquota,t  (6)

Поскольку традиционные физические законы не могут объяснить этот аспект, для преодоления данных ограничений может быть использовано машинное обучение. Чтобы избежать «проклятия размерности», вызванного многомерными признаками, в данном исследовании для моделирования нелинейной зависимости Rt37,38 используется алгоритм XGBoost, основанный на ансамблях деревьев решений. Определена матрица признаков сильного возмущения Xt, включающая такие метеорологические признаки, как количество дней с экстремальными морозами в году Dice , а также интенсивность макроэкономической политики.

Для нелинейного компенсатора, состоящего из деревьев регрессии, логика генерации прогнозируемого остатка Символ R-hat для анализа сходимости, иллюстрирующий статистический метод, формула в графическом формате. может быть выражена следующим образом39:

Уравнение прогнозирования градиентного бустинга, математическая формула, Σ fm(Xt), алгоритм, моделирование данных.   (7)

где F обозначает пространство всех возможных структур деревьев классификации и регрессии. Для обеспечения баланса между точностью подгонки и предотвращением переобучения на m-й итерации строится и минимизируется регуляризованная целевая функция, содержащая член штрафа за структурную сложность:

Уравнение математической оптимизации, выражающее сумму для подбора данных при анализе.   (8)

где Кет-нотация квантовой суперпозиции |0⟩, формула квантовой механики, используется в физических диаграммах. представляет собой выпуклую функцию потерь, измеряющую разницу между истинным и прогнозируемым остатком. В данной работе используется функция потерь Хубера (Huber Loss) для повышения устойчивости модели к аномальным пикам расходов. Регуляризационный член Символ закона Ома; функция Омега в математическом уравнении; представление формулы. используется для ограничения сложности структуры дерева и определяется следующим образом:

Уравнение оптимизации Ω(fm)=γTm+(1/2)λ||wm||^2; математическая формула; для образовательных целей.   (9)

где Tm представляет собой количество листовых узлов в m-ом дереве, wm представляет соответствующий вектор весов листьев, а γ и λ обозначают коэффициент штрафа за количество листовых узлов и коэффициент регуляризации весов соответственно.

Итоговое уравнение прогнозирования имеет следующий вид:

Уравнение экономического моделирования, формула распределения ресурсов, метод финансового анализа, изображение уравнения.   (10)

Дальнейшая расшифровка:

Уравнение базовой динамической квоты; нелинейная компенсация остатка; метод анализа формул.   (11)

Приведенная выше формула математически представляет структуру с замкнутым контуром предлагаемой модели прогнозирования. Итоговый спрос на затраты на производство и эксплуатацию не генерируется моделью машинного обучения напрямую; вместо этого он получается путем наложения нелинейной компенсации остатков, определенной модулем машинного обучения, на динамическую базовую линию квоты. Среди этих компонентов ценовые и технологические факторы в первую очередь отражают динамическую эволюцию базовой линии квоты, в то время как факторы, которые трудно эксплицитно охарактеризовать с помощью правил, такие как климатические потрясения, политические сбои и резкое увеличение количества случаев ремонта, фиксируются модулем компенсации остатков на основе машинного обучения. Уравнения (10) и (11) являются оригинальными для данной работы и объединяют физическую базовую линию с захватом остатков на базе ML в единую структуру прогнозирования.

Рисунок 2 показывает, что результаты прогнозирования предлагаемой модели демонстрируют четкую иерархическую логику генерации. С одной стороны, базовая квота обеспечивает стабильный, прозрачный и проверяемый физический фундамент для спроса на затраты; с другой стороны, корректировка цен, технологические эффекты и остатки внешних шоков позволяют модели адаптироваться к динамическим изменениям в сложных условиях. По сравнению с моделями «черного ящика», которые напрямую выдают прогнозируемые значения, такая структура декомпозиции позволяет четко выявить причины роста или снижения затрат, тем самым повышая интерпретируемость результатов модели при анализе бюджета и регулировании тарифов на передачу и распределение электроэнергии.

Источники данных и процедуры сбора

Теоретические модели должны проходить строгую валидацию с помощью эмпирических данных для подтверждения их практической полезности. Поскольку основные финансовые данные энергетического сектора содержат конфиденциальную информацию, касающуюся функционирования национальной инфраструктуры, в данном исследовании используются высокоточные анонимизированные ежемесячные данные бухгалтерского учета типичной провинциальной электросети в восточном Китае (для удобства именуемой E-Grid), охватывающие 16 последовательных календарных лет с 2010 по 2025 год. В этой провинции наблюдался типичный экономический цикл перехода от роста, стимулируемого традиционной тяжелой промышленностью, к высокотехнологичному производству, при этом совокупный среднегодовой темп роста масштаба активов сети достиг 7,4%. Таким образом, сложная эволюция структуры ее затрат может иметь значение для других быстроразвивающихся сетевых систем. Данные получены из трех основных источников: (1) внутренних журналов эксплуатации и технического обслуживания, в которых фиксируются объемы работ на уровне активов, частота осмотров и случаи ремонта; (2) систем финансового учета, предоставляющих ежемесячные отчеты о затратах на оплату труда, материалы, оборудование и сторонние услуги; и (3) внешних баз данных об окружающей среде, включая метеорологические записи Метеорологической администрации Китая и макроэкономические показатели Национального бюро статистики.

Контроль качества и обработка пропущенных данных

Для более чем 130 исходных показателей, интегрированных из многоисточниковых систем, была внедрена строгая процедура контроля качества. Пропуски в данных, составляющие менее 3% от общего объема наблюдений, обрабатывались с помощью линейной интерполяции для непрерывных переменных с временными трендами и импутации модой для категориальных показателей. Выбросы определялись методом межквартильного размаха (IQR); значения, превышающие верхний квартиль более чем на 3,0 IQR, подвергались винзоризации до 99-го процентиля для сохранения целостности данных и минимизации искажений, вызванных экстремальными значениями.

Обоснование размера выборки

Набор данных состоит из 192 ежемесячных наблюдений (январь 2010 г. – декабрь 2025 г.), из которых 156 наблюдений (2010–2022 гг.) распределены для обучения и валидации, а 36 наблюдений (2023–2025 гг.) зарезервированы для тестирования на выборке вне обучающего набора. Хотя такой размер выборки относительно невелик для приложений глубокого обучения, он подходит для алгоритма XGBoost, который специально разработан для эффективной работы с табличными данными малого и среднего объема благодаря механизмам регуляризации и прунинга деревьев. Для минимизации рисков переобучения были применены следующие меры: (1) строгие штрафы регуляризации (γ = 0.1, λ = 1.0), (2) ранняя остановка с параметром patience = 50 раундов и (3) консервативные ограничения глубины дерева (max depth = 5). В совокупности эти меры обеспечивают стабильность и обобщающую способность модели, несмотря на ограниченный размер выборки.

Сегментация данных и гетерогенная интеграция из нескольких источников

Для строгого тестирования данные с января 2010 по декабрь 2022 года были отнесены к интервалу обучения-валидации, содержащему 156 наблюдений, который используется для обучения факторов эволюции квот и остаточной сети компенсации квот. Период с января 2023 по декабрь 2025 года зарезервирован в качестве отложенного внешней выборки для тестирования, содержащей 36 наблюдений. Почему этот период был выбран в качестве финального полигона для тестирования? Причина заключается в том, что эти три года совпали с ускорением строительства энергосистем нового типа, что было осложнено масштабными экстремальными высокотемпературными явлениями, связанными с Эль-Ниньо, а также быстрым и неравномерным ростом распределенной генерации из возобновляемых источников энергии. Энергосистема столкнулась с беспрецедентным давлением в цепочках поставок материалов и распределении ремонтного персонала.

Научный отбор и количественное определение факторов, влияющих на стоимость, являются основой для обеспечения того, чтобы остаточная сеть машинного обучения могла эффективно фиксировать систематические колебания. Основываясь на логике управления стандартными эксплуатационными расходами в энергосистемах, в данном исследовании преодолевается одномерность традиционного финансового прогнозирования, которое опирается только на исторические денежные потоки; вместо этого проектирование признаков перестраивается на базе четырех основных границ: масштаба физических активов, условий эксплуатации и технического обслуживания, макроэкономической эволюции и внешней климатической среды с использованием оригинальных эксплуатационных журналов и внешних системных реестров. В процессе фактического моделирования для более чем 130 исходных показателей, полученных в результате интеграции многоисточниковых систем, в данном исследовании используются тесты корреляции Пирсона для исключения высококоллинеарных избыточных переменных с пороговым значением |r| > 0.85. На основе априорных знаний ведущих экспертов по электросетям для формирования матрицы признаков Xt в конечном итоге были выбраны 42 основные входные характеристики. Для наглядного представления базовой структуры данных и распределения входного тензора в Таблице 2 выбраны 12 репрезентативных основных признаков из четырех вышеупомянутых измерений оценки и обобщены их описательные статистики за период наблюдения.

Для дальнейшей иллюстрации пространственно-топологической основы многоисточниковой системы признаков на рисунке 3 представлена анонимизированная схематическая топология исследуемой провинциальной энергосистемы. На рисунке наложены подстанции различных уровней напряжения, коридоры линий электропередачи, кластеры распределенных возобновляемых источников энергии, центры нагрузки и репрезентативные зоны воздействия факторов окружающей среды. Топология помогает объяснить, почему затраты на производство и эксплуатацию совместно зависят от масштаба активов, структуры сети, интенсивности аварийно-восстановительных работ и внешних климатических воздействий. Она также служит основой для пространственной интерпретации переменных, определяющих остатки, которые используются в модуле компенсации XGBoost.

Таблица 2 показывает, что объясняющие переменные по различным бизнес-измерениям имеют заметно различающиеся статистические формы. Переменные физических активов, представляющие эндогенную динамику развития предприятия, такие как мощность подстанций и протяженность линий, имеют относительно стабильные значения стандартного отклонения и коэффициента асимметрии в диапазоне от 0,1 до 0,8. Их общая структура данных приближена к нормальному распределению, что объективно отражает характеристику устойчивого развития энергосистемы в цикле строительства инфраструктуры. Резким контрастом выступают переменные метеорологических и внешних факторов окружающей среды в нижней части таблицы. Например, совокупное количество дней с предупредительным уровнем высокой температуры за последние 90 дней и индекс воздействия отключений линий демонстрируют крайне сильную правостороннюю асимметрию с коэффициентами асимметрии 2,15 и 2,45 соответственно. Такое типичное распределение с «тяжелыми хвостами» подтверждает объективную проблему, которую нельзя игнорировать при фактической эксплуатации и техническом обслуживании энергосистемы: хотя экстремальные погодные катастрофы происходят относительно редко в годовом исчислении, при их возникновении часто наблюдается экспоненциальный рост затрат трудовых ресурсов на ремонт и расхода запасных частей. С другой стороны, высокая неоднородность и асимметрия экстремальных значений в распределении этих многоисточниковых признаков выявляют теоретические ограничения традиционных линейных моделей временных рядов, таких как ARIMAX, которые основаны на предположениях о нормальности и гомоскедастичности при отслеживании сложных затрат энергосистемы. Это не только дополнительно обосновывает целесообразность внедрения модуля машинного обучения сверх базового физического учета, но и обеспечивает серьезную статистическую поддержку выбору в данной работе древовидной модели XGBoost, которая способна эффективно обрабатывать разреженные распределения признаков и нелинейные отображения для аппроксимации остатков затрат.

Настройка системы оптимизации гиперпараметров и оценки

После определения пространства входных признаков настройка гиперпараметров модели напрямую влияет на эффективность аппроксимации в сети остаточного приближения. Поскольку компенсационная сеть XGBoost включает множество параметров, в том числе глубину дерева (max depth), скорость обучения и штрафные члены регуляризации, которые имеют нелинейные взаимодействия, традиционный поиск по сетке не только обладает высокой вычислительной сложностью, но и склонен к попаданию в локальные минимумы в многомерных пространствах. Поэтому в процессе настройки параметров в данной работе используется метод байесовской оптимизации — древовидный парзеновский оцениватель (Tree-structured Parzen Estimator, TPE). Алгоритм TPE может динамически направлять последующий отбор выборок, используя обратную связь по функции потерь из предыдущих итераций. Путем построения апостериорной оценки ядерной плотности (KDE) целевой переменной он адаптивно сужает пространство поиска параметров, что позволяет модели приблизиться к глобально оптимальной конфигурации гиперпараметров без чрезмерных вычислительных затрат. Целью оптимизации TPE была минимизация RMSE на валидационной выборке в течение 100 итераций с применением ранней остановки после 50 раундов без улучшения результата.

После завершения оптимизации параметров на внутреннем валидационном наборе данных, для объективной оценки итоговой эффективности каждой модели на внешней тестовой выборке и в соответствии с требованиями регуляторов по количественной оценке для верификации затрат, в данном исследовании используется средняя абсолютная процентная ошибка (MAPE) для количественного определения относительного отклонения в прогнозируемой последовательности. В то же время, для решения практической задачи по контролю критических ошибок прогнозирования затрат в операционной деятельности, также вводится среднеквадратическая ошибка (RMSE), чтобы обеспечить более строгий штраф за более крупные ошибки. Наконец, коэффициент детерминации, R2, количественно определяет общую объясняющую способность регрессии относительно истинной дисперсии целевой переменной.

Математические определения показателей следующие:

Формула средней абсолютной ошибки в процентах (MAPE); статистический анализ; расчет измерения ошибки.   (12)

Уравнение среднеквадратической ошибки (RMSE); статистическое измерение ошибки; иллюстрация формулы.    (13)

Формула R² для статистического регрессионного анализа; диаграмма уравнения для оценки точности аппроксимации данных.   (14)

где Уравнение динамического предела текучести, символ C_actual,t в математическом выражении, механика материалов. представляет собой фактические затраты на производство и эксплуатацию в периоде t, Уравнение общей концентрации с крышкой, \( \hat{C}_{total,t} \), в контексте научного анализа. представляет собой стоимость, предсказанную моделью, Уравнение в векторной записи, C_actual, со стрелкой над C, относится к физическим концепциям. представляет собой средние фактические затраты в тестовой выборке, а N — количество образцов в тестовом наборе.

Результаты

Панорамное сравнение точности прогнозирования с использованием снижения размерности

При оценке всех моделей, оптимизированных с помощью алгоритма Tree-structured Parzen Estimator (TPE), на вневыборочном тестовом наборе данных за 2023–2025 гг., который включал колебания в период постпандемийного восстановления и экстремальные высокотемпературные явления, стало возможным объективно сравнить эффективность основных алгоритмов прогнозирования. Для обеспечения строгого и всестороннего анализа были включены четыре эталонные модели, представляющие различные методологические подходы: традиционное экспоненциальное сглаживание, представляющее стандартное финансовое прогнозирование; SARIMAX, представляющий линейное моделирование сезонных временных рядов; отдельная регрессия XGBoost, представляющая чисто основанный на данных подход без квотных ограничений; и Attention-LSTM — сеть долгой краткосрочной памяти с механизмом внимания, широко используемая для прогнозирования длинных последовательностей.

Как показано в Таблице 3, предложенная модель Quota-ML превзошла все эталонные модели при прогнозировании производственных и эксплуатационных затрат за вневыборочный период 2023–2025 гг. Модель достигла MAPE 2.34%, что снизило ошибку прогнозирования на 61.8% по сравнению с SARIMAX (6.12%) и на 34.1% по сравнению с моделью Attention-LSTM (3.55%). Значения её RMSE (15.69 млн CNY) и MaxAE (23.05 млн CNY) были менее чем в два раза ниже, чем у следующей по эффективности нейронной сети, в то время как значение R2, равное 0.957, указало на то, что модель объясняет более 95% дисперсии наблюдаемых затрат. Эти результаты демонстрируют, что интеграция инженерных квот затрат, динамической эволюции квот и компенсации остатков на основе XGBoost существенно повышает как точность прогнозирования, так и устойчивость по сравнению с традиционными методами анализа временных рядов и чисто эмпирическими моделями.

Как показано на рисунке 4, фактические затраты на производство и эксплуатацию демонстрировали выраженные сезонные колебания и несколько отчетливых пиковых периодов в течение тестового интервала. В частности, затраты резко возросли во время экстремальных высокотемпературных явлений в июле и августе 2024 года. Хотя модель Attention-LSTM зафиксировала общую сезонную тенденцию, ее прогнозы были относительно сглаженными и недооценивали резкие скачки затрат, связанные с аварийным ремонтом, высокой нагрузкой на оборудование и повышенным расходом аварийных запасов. Автономная модель XGBoost более эффективно реагировала на локальные колебания, но в течение нескольких месяцев отклонялась от наблюдаемой траектории из-за отсутствия ограничений по инженерным квотам. Напротив, предложенная модель Quota-ML точно следовала наблюдаемой траектории затрат на протяжении всего тестового периода и верно воспроизвела как всплеск затрат летом 2024 года, так и вторичный летний пик в 2025 году.

Превосходные показатели модели Quota-ML демонстрируют преимущество объединения инженерных квот затрат с коррекцией остатков на основе машинного обучения. Динамическая базовая линия квот обеспечивает физически интерпретируемый фундамент, отражающий эволюцию активов энергосистемы и операционных нагрузок, что предотвращает неограниченное обучение на ограниченных данных финансовых временных рядов. Сеть компенсации остатков затем фокусируется на нелинейных возмущениях, которые трудно представить только с помощью правил инженерных квот, включая метеорологические явления, всплески заказов на техническое обслуживание и изменения в политике. В результате предлагаемая модель достигла самых низких значений MAPE и RMSE среди всех оцениваемых методов (Таблица 3) и обеспечила наиболее точное отслеживание сезонных пиков затрат и экстремальных событий (Рисунок 4), что подтверждает ее пригодность для долгосрочного прогнозирования производственных и эксплуатационных затрат.

Валидация путем абляции основных архитектурных компонентов

В сложной гибридной структуре, состоящей из вложенных субмодулей, основной вопрос при академическом рецензировании обычно касается того, не страдает ли модель от «избыточного проектирования» (over-engineering). Для изучения истинных взаимосвязей и уровня вклада каждого модуля необходимо проведение внутренних абляционных экспериментов путем удаления основных компонентов. В данном исследовании для архитектуры определены два пути деградации. Во-первых, Структура A, в которой удален механизм динамической эволюции: базовый уровень квоты принудительно ограничивается прошлыми статическими физическими стандартами, что исключает влияние факторов накопления макроинфляции и дефляции технологического прогресса последних лет, и только исторический статический базовый уровень Уравнения статического равновесия, C_base,t; математическая формула стабильности; образовательная диаграмма. подключается к остаточной сети. Во-вторых, Структура B, в которой удален модуль нелинейного остаточного отслеживания: модель полностью вырождается в актуарийский подход, разрывая цикл захвата случайных колебаний под управлением ИИ и принимая в качестве конечного результата чистое расчетное значение динамической квоты Уравнение хроматографии, C_quota,t, анализ спектрального соответствия, научно-исследовательская диаграмма. после коррекции с учетом макросреды. Коэффициент потери объясненной дисперсии рассчитывается на основе относительного снижения R2 между полной и деградированной моделями и определяется следующим образом:

Формула потерь объясненной дисперсии; статистический анализ; метод расчета R²; интерпретация данных.   (15)

Таблица 4’s анализ абляции показывает, что оба компонента предложенной структуры вносят значительный вклад в точность прогнозирования, однако компенсация остатков с помощью машинного обучения играет более критическую роль. Удаление механизма динамической эволюции цены и технологий (вариант A) увеличивает MAPE до 4,15% (снижение точности на 1,81 процентного пункта) и снижает R2 до 0,837, что объясняет на 12,5% меньше дисперсии, чем полная модель. Напротив, исключение компенсации остатков ML (вариант B) вызывает гораздо более резкое снижение: MAPE возрастает до 5,62% (+3,28 п. п.), R2 снижается до 0,686, а коэффициент потери объясненной дисперсии достигает 28,3%. Эти результаты демонстрируют, что, хотя динамическое обновление квот повышает базовую точность, коррекция остатков на основе XGBoost является незаменимой для учета нелинейных факторов стоимости, что в совокупности формирует синергетическую гибридную архитектуру.

Для облегчения сравнения эффективности моделей в ходе экспериментов по абляции была построена нормализованная лепестковая диаграмма для визуализации пяти метрик оценки: MAPE, RMSE, R2, MaxAE и робастности. Метрики, основанные на ошибке (MAPE, RMSE и MaxAE), прошли обратную нормализацию, чтобы меньшие значения ошибок соответствовали более высоким баллам, тогда как положительные метрики (R2 и робастность) были нормализованы таким образом, чтобы более высокие значения соответствовали более высоким баллам. После нормализации все показатели представляют собой сопоставимые оценки эффективности, при этом значения, более близкие к внешней границе, указывают на более высокую общую производительность.

Как показано на рисунке 5, полная модель Quota-ML продемонстрировала стабильно высокие показатели по всем пяти измерениям эффективности, сформировав самый большой и сбалансированный радарный профиль. Этот результат указывает на то, что предложенная структура обеспечивает эффективный баланс между контролем относительной погрешности, общей точностью прогнозирования, объяснительной способностью, подавлением экстремальных ошибок и робастностью при различных условиях эксплуатации.

Напротив, вариант A, в котором механизм динамической эволюции квот был исключен при сохранении компенсации остатков на основе машинного обучения, продемонстрировал заметное снижение общей эффективности. Этот результат указывает на то, что один лишь статический базовый уровень квот не может адекватно учесть структурные изменения, вызванные колебаниями цен на сырье и технологическим прогрессом. Еще более значительное снижение эффективности наблюдалось для варианта B, в котором модуль компенсации остатков был удален, а прогнозирование основывалось исключительно на динамическом базовом уровне квот. В этом случае показатели существенно ухудшились, особенно в отношении метрик погрешности и робастности.

Как показано в Таблице 4, MAPE для варианта B увеличилась с 2,34% для полной модели до 5,62%, что представляет собой рост на 3,28 процентных пункта, в то время как значение R2 снизилось на 28,3%. Эти результаты указывают на то, что, хотя модель динамической квоты учитывает макроэкономическую инфляцию и корректировки эффективности, обусловленные технологиями, она не может полностью отразить резкие колебания затрат, связанные с экстремальными погодными условиями, экстренным техническим обслуживанием, изменениями в политике и аномальными условиями эксплуатации.

В целом, анализ абляции демонстрирует, что оба основных компонента предлагаемой структуры являются необходимыми. Механизм динамической эволюции квот адаптирует инженерную базу к изменениям макроэкономических условий и технологическому прогрессу, в то время как модуль компенсации остатков на основе машинного обучения фиксирует нелинейные отклонения, которые не могут быть явно представлены инженерными правилами квот. Вместе эти взаимодополняющие компоненты образуют интегрированную систему прогнозирования, которая сочетает физически интерпретируемую базовую линию квот с обучением остатков на основе данных для достижения точного и надежного долгосрочного прогнозирования затрат.

Валидация интерпретируемости модели компенсации остатков

Хотя сравнение точности прогнозирования и эксперименты по абляции продемонстрировали важность модуля компенсации остатков на основе машинного обучения, одних только показателей ошибки недостаточно, чтобы определить, имеют ли выявленные нелинейные зависимости значимую физическую или эксплуатационную интерпретацию. Поэтому для интерпретации остаточной модели XGBoost был применен метод SHAP (Shapley Additive exPlanations)40. SHAP широко используется для объяснения моделей машинного обучения в прогнозировании мощности и энергии, а также в смежных сложных системах41,42. Количественно оценивая вклад каждого входного признака в прогнозы модели, SHAP позволяет определить, соответствуют ли изученные закономерности остатков инженерным знаниям.

Как показано на рисунке 6, внешние переменные возмущения — включая кумулятивное количество дней с температурой высокого уровня предупреждения за предыдущие 90 дней, индекс отключений линий, вызванных сильной конвекцией и тайфунами, продолжительность ледяного дождя и снегопадов, а также количество случаев внепланового ремонта — продемонстрировали сильные положительные значения SHAP. Образцы с высокими значениями этих переменных были сосредоточены в положительной области SHAP, что указывает на то, что экстремальные погодные условия и мероприятия по экстренному техническому обслуживанию последовательно увеличивали фактические затраты сверх базового динамического квотирования. Эти результаты доказывают, что модуль остаточной компенсации фиксирует значимые экологические и эксплуатационные возмущения, а не просто подстраивается под случайный шум.

Несколько дополнительных переменных, включая продолжительность работы при высокой нагрузке, индекс цен на металлы PPI, долю цифровых инвестиций, установленную мощность распределенных фотоэлектрических систем и длину линий электропередачи, также внесли существенный вклад в прогнозы остатков. Эти результаты указывают на то, что отклонения от базовой квоты находятся под совместным влиянием краткосрочных погодных явлений, расширения активов, передачи цен на сырьевые товары, трансформации энергосистемы и цифровизации. Примечательно, что в некоторых наблюдениях доля цифровых инвестиций положительно влияла на остаточные затраты, что позволяет предположить, что цифровая трансформация на ранних этапах может временно увеличить расходы из-за системной интеграции, обслуживания платформ и параллельного функционирования устаревших и вновь развернутых систем. В целом, анализ SHAP подтверждает бизнес-интерпретируемость модуля компенсации остатков и дает эмпирическое обоснование для понимания влияния экстремальных погодных явлений и цифровой трансформации на производственные и эксплуатационные затраты.

Проверка статистической значимости улучшений прогноза

Для определения того, были ли статистически значимыми улучшения в прогнозировании, достигнутые с помощью предложенной структуры, были проведены формальные тесты сравнения прогнозов. В соответствии с общепринятой практикой в области прогнозирования энергопотребления и эконометрики, для сравнения точности прогнозов предложенной модели с каждым из эталонных вариантов использовался тест Диболда–Мариано (DM). Тест DM хорошо подходит для прогнозирования временных рядов, так как он учитывает автокорреляцию ошибок прогноза, не требуя нормального распределения остатков.

Для каждого сравнения нулевая гипотеза предполагала, что предлагаемая и эталонная модели обладают равной прогностической точностью, в то время как альтернативная гипотеза предполагала, что предлагаемая модель дает меньшие ошибки прогноза. Односторонние тесты Ди-Мартино (DM) проводились с использованием квадрата ошибки прогноза в качестве функции потерь. Для учета гетероскедастичности и автокорреляции в ряде разностей потерь применялись стандартные ошибки Ньюи–Уэста с автоматическим выбором лага. Кроме того, в качестве непараметрической альтернативы, не опирающейся на допущения о распределении, был проведен критерий знаковых рангов Уилкоксона. Совокупность этих взаимодополняющих тестов обеспечивает надежную оценку статистической значимости наблюдаемого улучшения качества прогнозирования.

Как показано в Таблице 5, предлагаемая структура прогнозирования обеспечила статистически значимое улучшение по сравнению со всеми эталонными моделями. Положительные значения статистики DM указывают на стабильно более низкие ошибки прогноза по сравнению с конкурирующими подходами. Наибольшее улучшение наблюдалось относительно модели ARIMA (DM = 3.842, p < 0.001), что демонстрирует преимущество включения квот на инженерные затраты в структуру прогнозирования. По сравнению с ARIMAX, которая включает экзогенные переменные, предлагаемая модель также показала значительное улучшение (DM = 3.215, p < 0.001), что подчеркивает дополнительную ценность сочетания динамической базовой линии квот с компенсацией остатков на основе машинного обучения.

Предложенная модель также значительно превзошла эталонные модели глубокого обучения. Улучшения в прогнозировании были значительными по сравнению с моделью LSTM (DM = 2.876, p = 0.002) и моделью Transformer (DM = 2.543, p = 0.011). Хотя улучшение по сравнению с отдельной моделью XGBoost было меньше (DM = 2.187, p = 0.029), оно оставалось статистически значимым. Поскольку обе модели используют обучение на основе деревьев, этот результат демонстрирует, что интеграция динамической базовой линии квот обеспечивает дополнительную прогностическую ценность по сравнению с чисто основанным на данных подходом. Критерий знаковых рангов Вилкоксона показал уровни значимости, согласующиеся с результатами теста DM, что служит дополнительным доказательством статистической устойчивости улучшений прогнозирования в рамках предложенной структуры.

ДОСТУПНОСТЬ ДАННЫХ:

Наборы данных, использованные в данном исследовании, были загружены в общедоступный репозиторий (DOI: https://doi.org/10.5281/zenodo.21645584).

Схема процесса управления активами энергосети; активы, квоты на работы, счета затрат и прогноз спроса.
Рисунок 1: Связь между активами энергосети, стандартными эксплуатационными квотами и счетами затрат. На данном рисунке показано, что квоты затрат представляют собой не просто абстрактные правила финансового распределения, а стандартизированные единицы учета, интегрированные во весь процесс эксплуатации и технического обслуживания активов энергосети. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Диаграмма стабильности энергосети с рисками высоких температур, тайфунов и ледяного дождя; отмечены критические точки чрезвычайных ситуаций.
Рисунок 3: Анонимизированная схематическая топология исследуемой провинциальной энергосети и слои возмущений, влияющих на затраты. На данном рисунке представлена анонимизированная схематическая топология исследуемой провинциальной энергосети. На схеме наложены подстанции различных уровней напряжения, коридоры линий электропередачи, кластеры распределенной возобновляемой энергетики, центры нагрузки и репрезентативные зоны воздействия факторов окружающей среды. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в увеличенном размере.

Диаграмма сравнения эксплуатационных затрат, 2023–2025 гг. Модели: Attention-LSTM, XGBoost, анализ Quota-ML.
Рисунок 4: Траектории прогнозирования основных моделей и фактические затраты в течение интервала вневыборочного тестирования 2023–2025 гг. На данном рисунке показано, что фактические производственные и эксплуатационные затраты в тестовый период демонстрируют явные сезонные колебания и внезапные пики. В период экстремального высокотемпературного шока в июле и августе 2024 года фактические затраты значительно выросли. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Лепестковая диаграмма, сравнивающая MAPE, RMSE, R², MaxAE и робастность трех вариантов моделей ML.
Рисунок 5: Нормированное сравнение качества прогнозирования различных вариантов абляции. Лепестковые диаграммы позволяют сравнить нормированную эффективность полной модели Quota-ML и двух вариантов абляции по пяти метрикам оценки: MAPE, RMSE, R2, MaxAE и показателю робастности. Метрики на основе ошибок (MAPE, RMSE и MaxAE) были подвергнуты обратной нормировке, чтобы более высокие значения указывали на меньшие ошибки прогнозирования, в то время как R2 и робастность были нормированы так, чтобы более высокие значения свидетельствовали о лучшей работе модели. Более широкий профиль лепестковой диаграммы полной модели Quota-ML демонстрирует превосходное общее качество прогнозирования по сравнению с обоими вариантами абляции. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

График значений SHAP для анализа влияния признаков на стабильность энергосети; визуализация и анализ данных.
Рисунок 6: Сводный график SHAP, показывающий вклад признаков в прогнозирование остаточных затрат. Сводный график SHAP (Shapley Additive exPlanations), иллюстрирующий вклад наиболее влиятельных переменных в модель компенсации остатков XGBoost. Каждая точка представляет одно наблюдение, где цвет указывает на значение признака (синий = низкое; красный = высокое), а горизонтальное положение соответствует значению SHAP. Более высокие значения признаков для таких переменных, как количество дней с экстремальной жарой, индекс отключений, связанных с тайфунами, продолжительность ледяного шторма и количество случаев внепланового ремонта, в целом связаны с более положительными значениями SHAP, что указывает на увеличение остаточных затрат на производство и эксплуатацию. График демонстрирует, что как экологические возмущения, так и эксплуатационные факторы вносят существенный вклад в отклонения от базовой динамической квоты. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Таблица 1: Описание основных переменных и параметров модели. В данной таблице представлены ключевые переменные предлагаемой модели прогнозирования затрат Quota-ML с разграничением между фактическими и прогнозируемыми затратами; статическими и динамическими базовыми уровнями квот; параметрами рабочей нагрузки и квот; факторами макроэкономической корректировки (PPI и технологический прогресс); а также остаточными компонентами. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Таблица 2: Классификация и описательная статистика основных входных признаков модели прогнозирования. 
Эта таблица показывает, что объясняющие переменные в различных бизнес-измерениях имеют различные статистические формы. В таблице обобщены данные описательной статистики репрезентативных переменных физических активов, операционных, макроэкономических и экологических показателей, используемых в качестве входных данных модели. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

МоделиMAPE %RMSE (CNY, млн)R² коэффициент детерминацииMaxAE (CNY, млн)
Традиционное экспоненциальное сглаживание8.7554.220.651125.04
Модель временных рядов SARIMAX6.1238.540.76884.21
Регрессия Pure XGBoost4.3829.160.85251.06
Нейронная сеть Attention-LSTM3.5524.020.89440.53
Предлагаемая модель Quota-ML2.3415.690.95723.05

Таблица 3: Сравнение общей эффективности различных моделей на контрольной выборке за 2023–2025 гг. Эта таблица демонстрирует, что предложенная модель Quota-ML значительно превосходит все эталонные модели по точности прогнозирования затрат на производство и эксплуатацию электросетей за вневыборочный период 2023–2025 гг.

Экспериментальный вариантУдаленный основной компонентПоказатель деградации MAPEКоэффициент потери объясненной дисперсии
Вариант AОтсутствие динамической эволюции цены / технологии4.15% (+1.81 p.p.)0.83712.50%
Вариант BОтсутствие компенсации остатков с помощью ML5.62% (+3.28 p.p.)0.68628.30%
Полная модельПолная предлагаемая структура Quota-ML2.34%0.957Базовый уровень

Таблица 4: Результаты абляционного эксперимента интегрированной структуры на основе квоты и машинного обучения. В данной таблице показано, что оба компонента предлагаемой структуры вносят значительный вклад в точность прогнозирования, однако компенсация остатков с помощью машинного обучения играет более важную роль.

СравнениеТест Диболда — МарианоКритерий знаковых рангов Уилкоксона
Предлагаемая модель в сравнении с ARIMADM = 3,842*** (p < 0.001)W = 486,0*** (p < 0.001)
Предлагаемая модель в сравнении с ARIMAXDM = 3,215*** (p < 0.001)W = 452,0*** (p < 0.001)
Предлагаемая модель в сравнении с LSTMDM = 2,876** (p = 0,002)W = 398,0** (p = 0,003)
Предлагаемая модель в сравнении с TransformerDM = 2,543* (p = 0,011)W = 364,0* (p = 0,014)
Предлагаемая модель в сравнении с XGBoost (чистое машинное обучение)DM = 2,187* (p = 0,029)W = 328,0* (p = 0,031)

Таблица 5: Результаты теста на статистическую значимость для сравнения прогнозов. Статистика теста Диболда-Мариано при нулевой гипотезе следует стандартному нормальному распределению. Положительные значения DM указывают на более высокую точность прогноза предлагаемой модели. Все тесты являются односторонними с альтернативной гипотезой о том, что предлагаемая модель имеет меньшую ошибку прогноза, чем эталонная. Статистика W критерия знаковых рангов Вилкоксона приведена с соответствующими значениями p. Функция потерь = квадрат ошибки прогноза.

Обсуждение

Данное исследование демонстрирует, что интеграция промышленных квот на затраты с методами машинного обучения обеспечивает интерпретируемую и точную основу для долгосрочного прогнозирования затрат в электросетях. Результаты показывают, что климатические переменные, в частности количество дней с экстремально высокими температурами и индексы влияния отключений линий, являются доминирующими факторами остаточных затрат, что подчеркивает растущее влияние внешних воздействий на расходы коммунальных служб. Эти выводы позволяют предположить, что затраты, связанные с погодными условиями, больше не должны рассматриваться как случайные эксплуатационные расходы, а должны включаться в специализированные резервы на непредвиденные расходы, при этом активация резервов должна быть связана с прогнозируемыми климатическими рисками. Выявление влияния отключений линий как основного фактора затрат дополнительно подчеркивает значимость стратегий предиктивного технического обслуживания и мониторинга состояния оборудования для снижения как эксплуатационных сбоев, так и волатильности затрат.

Анализ также показывает, что цифровая трансформация может привести к увеличению операционных расходов на ранних этапах внедрения из-за переходного периода одновременного функционирования двух систем, а не к немедленному повышению эффективности. Этот результат говорит о том, что предприятия коммунального хозяйства должны оценивать инвестиции в цифровизацию с помощью оценки стоимости жизненного цикла, а не на основе краткосрочных финансовых показателей, и должны предусматривать временное дублирование затрат при развертывании интеллектуального мониторинга, передовых систем управления распределением или цифровых подстанций. Предложенная структура компенсации остаточных затрат также может быть расширена для определения момента, когда цифровые инвестиции начнут приносить чистую экономию средств, что обеспечит более эффективное планирование технологий и принятие инвестиционных решений.

Помимо операционной деятельности коммунальных служб, предлагаемая структура имеет важные регуляторные последствия. Количественно оценивая влияние внешних факторов на остаточные затраты, модель обеспечивает объективную основу для формирования резервов на непредвиденные расходы с поправкой на климатические условия и оценки бюджетных запросов коммунальных предприятий. Разделение базовых затрат, обусловленных квотами, и остатков, вызванных внешними воздействиями, также способствует более эффективному регулированию на основе показателей эффективности за счет разграничения контролируемой операционной эффективности и неконтролируемых внешних шоков. Кроме того, система прогнозирования на основе квот обеспечивает большую прозрачность и проверяемость по сравнению с чисто статистическими моделями или моделями искусственного интеллекта по принципу «черного ящика», позволяя напрямую связать прогнозируемые затраты с физическими условиями эксплуатации и инженерными параметрами в ходе пересмотра тарифов и регуляторных слушаний.

Следует признать несколько ограничений. Эмпирический анализ основан на данных одной провинциальной электросети в восточной части Китая, что может ограничить возможность обобщения результатов для регионов с иными климатическими условиями, нормативно-правовой базой или структурой сети. Хотя набора данных за 192 месяца достаточно для модели XGBoost, он остается относительно небольшим для фиксации редких, но высокозначимых событий, а эффективность прогнозирования зависит от качества и согласованности используемых баз данных квот на затраты. Кроме того, механизм динамических квот опирается на агрегированный индекс цен производителей и факторы технологического прогресса, которые могут не в полной мере отражать региональные колебания затрат или вариации по отдельным компонентам. Несмотря на то, что анализ SHAP повышает интерпретируемость модели, представленный вклад признаков отражает прогностические связи, а не причинно-следственные отношения, и поэтому должен интерпретироваться с надлежащей осторожностью.

Будущие исследования должны быть сосредоточены на интеграции неструктурированных записей о техническом обслуживании с помощью специализированных больших языковых моделей, внедрении пространственно-временных графовых нейронных сетей для отслеживания распространения возмущений в взаимосвязанных сетях, расширении валидации на несколько регионов для повышения обобщаемости, а также внедрении количественной оценки неопределенности для поддержки принятия регуляторных решений с учетом рисков. Эти направления соответствуют последним достижениям в области среднесрочного и долгосрочного прогнозирования энергопотребления и интеграции возобновляемых источников энергии, в которых подчеркивается важность сочетания интеллектуальных методов анализа данных с физически обоснованными моделями для надежной эксплуатации энергосистем43,44.

Раскрытие информации

Все авторы заявляют об отсутствии конфликта интересов.

ВКЛАД АВТОРОВ:
Xiaohui Wang разработала концепцию и дизайн исследования, разработала методологию, провела формальный анализ и подготовила черновик рукописи. Tong Li участвовал в курировании данных, реализации программного обеспечения и валидации. Yanchao Lu внес вклад в разработку методологии, проведение исследования и интерпретацию данных. Quanfeng Lv предоставил ресурсы, контролировал сбор данных и провел критический обзор рукописи. Fan Liu руководил проектом, участвовал в концептуализации и интерпретации результатов, обеспечил финансирование и критически переработал рукопись. Все авторы ознакомились с окончательным вариантом рукописи и одобрили его

Благодарности

Данная работа была поддержана технологическим проектом Государственной электросетевой корпорации Китая под названием «Исследование анализа распределения производственных и эксплуатационных затрат и технологии асинхронной оптимизации» (номер проекта: 520600250029-183-ZN).

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Анонимизированный ежемесячный набор данных бухгалтерского учета E-GridПровинциальная энергосеть в восточном КитаеН/ПАнонимизированный набор данных по ежемесячному производству и эксплуатационным расходам (2010–2025), включающий 192 наблюдения, в том числе данные о физических активах, эксплуатации и техническом обслуживании, макроэкономические и экологические данные. Использовался для разработки модели (156 наблюдений) и вневыборочного тестирования (36 наблюдений).
Библиотека для построения графиков MatplotlibКоманда разработчиков Matplotlib3.5.2Использовалась для создания рисунков к рукописи и графических результатов, включая графики эффективности модели, визуализации топологии, диагностику остатков, лепестковые диаграммы и визуальные сводки на основе SHAP.
Библиотека для численных вычислений NumPyРазработчики NumPy1.22.3Использовалась для операций с числовыми массивами, матричных вычислений и контроля воспроизводимости. В соответствующих случаях применялся фиксированный случайный seed 42.
Библиотека для манипулирования данными PandasКоманда разработчиков pandas1.4.2Использовалась для импорта, интеграции, реструктуризации, фильтрации и предобработки данных, включая импутацию пропущенных значений, выравнивание временных рядов и подготовку входных переменных модели.
Среда программирования PythonPython Software Foundation3.9.13Среда программирования, использованная для реализации полного рабочего процесса прогнозирования, включая предобработку данных, проектирование признаков, обучение модели, оптимизацию гиперпараметров, прогнозирование, статистическое тестирование и оценку эффективности.
Библиотека машинного обучения Scikit-learnКонтрибьюторы scikit-learn1.0.2Использовалась для предобработки данных, разделения на обучающую и валидационную выборки, вспомогательной оценки модели и статистических процедур, включая корреляционный анализ Пирсона и расчет выбранных показателей эффективности.
Библиотека для научных вычислений SciPyКонтрибьюторы SciPy1.9.0Использовалась для статистических вычислений, включая корреляционный анализ Пирсона и вспомогательные процедуры обработки выбросов и винзоризации.
Реализация метода Tree-structured Parzen EstimatorКонтрибьюторы Optuna3.1.0Реализация байесовской оптимизации, использованная для настройки гиперпараметров XGBoost, включая максимальную глубину дерева, скорость обучения и параметры регуляризации. Tree-structured Parzen Estimator был реализован с помощью пакета с открытым исходным кодом Optuna.
Программная библиотека XGBoostКонтрибьюторы DMLC / XGBoost1.7.1Библиотека ансамблевого обучения на основе деревьев решений, использованная для нелинейной компенсации остатков. В модели была реализована регуляризованная целевая функция с функцией потерь Хьюбера и штрафами за сложность дерева, как описано в уравнениях 7–9.

Ссылки

  1. Rao H, Li J, Sun X. Demand forecasting and allocation optimization of green power grid supply chain based on machine learning algorithm: A study based on the whole-process data of power grid materials. Sustainability. 2025;17(3):1247.
  2. Huang C, et al. Demand response for industrial micro-grid considering photovoltaic power uncertainty and battery operational cost. IEEE Trans Smart Grid. 2021;12(4):3043-3055.
  3. Phuangpornpitak N, Prommee W. A study of load demand forecasting models in electric power system operation and planning. GMSARN Int J. 2016;10:19-24.
  4. Nasir J, et al. A hybrid LMD–ARIMA–machine learning framework for enhanced forecasting of financial time series: Evidence from the NASDAQ Composite Index. Mathematics. 2025;13(15):2389.
  5. Matos C, et al. Model for integrating the electricity cost consumption and power demand into aggregate production planning. Appl Sci. 2022;12(15):7577.
  6. Valenzuela J, Mazumdar M, Kapoor A. Influence of temperature and load forecast uncertainty on estimates of power generation production costs. IEEE Trans Power Syst. 2000;15(2):668-674.
  7. Khan F, et al. A hybrid vector autoregressive model for accurate macroeconomic forecasting: An application to the US economy. Mathematics. 2025;13(11):1706.
  8. Fatema I, Kong X, Fang G. Electricity demand and price forecasting model for sustainable smart grid using comprehensive long short-term memory. Int J Sustain Eng. 2021;14(6):1714-1732.
  9. Singh AK, Ibraheem SK, Muazzam M, Chaturvedi DK. An overview of electricity demand forecasting techniques. Netw Complex Syst. 2013;3(3):38-48.
  10. Iftikhar H, et al. A novel hybrid framework for forecasting stock indices based on nonlinear time series models. Comput Stat. 2025;40(8):4163-4186.
  11. Jiang P, Li R, Lu H, Zhang X. Modeling of electricity demand forecast for power system. Neural Comput Appl. 2020;32(11):6857-6875.
  12. Chan SC, et al. Load/price forecasting and managing demand response for smart grids: Methodologies and challenges. IEEE Signal Process Mag. 2012;29(5):68-85.
  13. Hernandez L, et al. A survey on electric power demand forecasting: Future trends in smart grids, microgrids and smart buildings. IEEE Commun Surv Tutor. 2014;16(3):1460-1495.
  14. Zareipour H, Canizares CA, Bhattacharya K. Economic impact of electricity market price forecasting errors: A demand-side analysis. IEEE Trans Power Syst. 2009;25(1):254-262.
  15. Botterud A. Forecasting renewable energy for grid operations. In: Renewable Energy Integration. Academic Press; 2017:133-143.
  16. Mirowski P, Chen S, Ho TK, Yu CN. Demand forecasting in smart grids. Bell Labs Tech J. 2014;18(4):135-158.
  17. Sobu A, Wu G. Optimal operation planning method for isolated micro grid considering uncertainties of renewable power generations and load demand. In: IEEE PES Innovative Smart Grid Technologies [conference proceedings]. IEEE; 2012. Available at: https://ieeexplore.ieee.org/
  18. Han B, et al. Optimal design of an on-grid microgrid considering long-term load demand forecasting: A case study. Distrib Gener Altern Energy J. 2020;35:345-362.
  19. Tripathy SC. Demand forecasting in a power system. Energy Convers Manag. 1997;38(14):1475-1481.
  20. Adshead NS, Price DH. Demand forecasting and cost performance in a model of a real manufacturing unit. Int J Prod Res. 1987;25(9):1251-1265.
  21. Gellert A, et al. A study on forecasting electricity production and consumption in smart cities and factories. Int J Inf Manage. 2019;49:546-556.
  22. Hernández L, et al. A multi-agent system architecture for smart grid management and forecasting of energy demand in virtual power plants. IEEE Commun Mag. 2013;51(1):106-113.
  23. Klingler AL, Teichtmann L. Impacts of a forecast-based operation strategy for grid-connected PV storage systems on profitability and the energy system. Sol Energy. 2017;158:861-868.
  24. Ghalehkhondabi I, Ardjmand E, Weckman GR, Young WA. An overview of energy demand forecasting methods published in 2005–2015. Energy Syst. 2017;8(2):411-447.
  25. Aderibigbe AO, et al. Enhancing energy efficiency with AI: A review of machine learning models in electricity demand forecasting. Eng Sci Technol J. 2023;4(6):341-356.
  26. Arumugham V, et al. An artificial-intelligence-based renewable energy prediction program for demand-side management in smart grids. Sustainability. 2023;15(6):5453.
  27. Dudek G, Piotrowski P, Baczyński D. Intelligent forecasting and optimization in electrical power systems: Advances in models and applications. Energies. 2023;16(7):3024.
  28. Liu N, et al. A hybrid forecasting model with parameter optimization for short-term load forecasting of micro-grids. Appl Energy. 2014;129:336-345.
  29. Mohammad AA, et al. Mathematical and statistical modelling of electricity demand forecasting using artificial neural networks and SARIMA: Implications for energy supply chain planning. Alex Eng J. 2026;139:98-108.
  30. Singh AR, et al. A blockchain-enabled multi-agent deep reinforcement learning framework for real-time demand response in renewable energy grids. Energy Strateg Rev. 2025;62:101905.
  31. Lu R, et al. Data-driven real-time price-based demand response for industrial facilities energy management. Appl Energy. 2021;283:116291.
  32. Kondaiah VY, Saravanan B, Sanjeevikumar P, Khan B. A review on short-term load forecasting models for micro-grid application. J Eng. 2022;2022(7):665-689.
  33. Lee BL, Wilson C, Simshauser P, Majiwa E. Deregulation, efficiency and policy determination: An analysis of Australia's electricity distribution sector. Energy Econ. 2021;98:105210.
  34. Wang Y, et al. Transmission network expansion planning considering wind power and load uncertainties based on multi-agent DDQN. Energies. 2021;14(19):6073.
  35. Ding Q, Zhao H. Study on e-commerce logistics cost control methods in the context of COVID-19 prevention and control. Soft Comput. 2021;25(18):11955-11963.
  36. Duan Y, Xu Z, Chen H, Wang Y. Novel machine learning approach for enhanced smart grid power use and price prediction using advanced Shark Smell-tuned flexible support vector machine. Sci Rep. 2025;15(1):20909.
  37. Chen T, Guestrin C. XGBoost: A scalable tree boosting system. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining [conference proceedings]. San Francisco, CA, USA; 2016. Available at: https://doi.org/10.1145/2939672.2939785
  38. Lin KY, et al. Predictive maintenance in industrial systems: An XGBoost-based approach for failure time estimation and resource optimization. J Ind Prod Eng. 2025;42(8):876-899.
  39. Ajayi OO, Kurien AM, Djouani K, Dieng L. A proactive predictive model for machine failure forecasting. Machines. 2025;13(8):663.
  40. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  41. Chen H, Gao T, Wang L, Guo P. Explainable machine learning methods for predicting electricity consumption in a long-distance crude oil pipeline. Sci Rep. 2025;15(1):43305.
  42. Neubauer A, Brandt S, Kriegel M. Explainable multi-step heating load forecasting: Using SHAP values and temporal attention mechanisms for enhanced interpretability. Energy AI. 2025;20:100480.
  43. Ahmad T, Chen H. Potential of three variant machine-learning models for forecasting district-level medium-term and long-term energy demand in smart grid environment. Energy. 2018;160:1008-1020.
  44. Masa-Bote D, et al. Improving photovoltaics grid integration through short-time forecasting and self-consumption. Appl Energy. 2014;125:103-113.

Перепечатки и разрешения

Теги

Прогнозирование затратданные электросетейпрогнозирование на основе норм затратмодель XGBoostинтерпретация SHAPреформа электроэнергетического рынкатарифы на передачу электроэнергиирегуляторная проверка затратпрогнозирование с помощью машинного обучения