В данном исследовании использовались анонимизированные операционные и финансовые данные, собранные в провинциальной электросети на востоке Китая. Все данные были агрегированы и обезличены перед анализом; персональная информация или конфиденциальные данные на индивидуальном уровне не включались. Таким образом, этическое одобрение не требовалось. Доступ к данным и их анализ осуществлялись в соответствии с применимыми правилами защиты данных и институциональными соглашениями, регулирующими информацию в электроэнергетическом секторе.
Обзор структуры прогнозирования
Для интеграции подходов к прогнозированию на основе физических моделей и анализа данных была разработана гибридная система прогнозирования, сочетающая инженерные квоты затрат с машинным обучением. Вместо простого объединения нескольких алгоритмов, данная система основана на принципе, согласно которому физические модели формируют базовый прогноз, в то время как машинное обучение компенсирует остаточные ошибки. Такая архитектура гарантирует, что процесс прогнозирования опирается на физические механизмы, лежащие в основе процессов производства и эксплуатации энергосистемы, а не основывается исключительно на экстраполяции исторических затрат.
В рамках данной структуры сначала устанавливается иерархическое соответствие между активами энергосистемы, стандартизированными операционными действиями и счетами финансовых затрат. Затраты на производство и эксплуатацию рассматриваются как денежное выражение ресурсов, потребляемых физическими активами — включая подстанции, линии электропередачи, распределительные фидеры, приборы учета и оборудование для цифрового контроля — в ходе выполнения таких рутинных работ, как осмотр, техническое обслуживание, испытания, ремонт и замена. Нормативы затрат служат связующим звеном между измеримым объемом инженерных работ и соответствующими финансовыми расходами.
Как показано на Рисунке 1, квоты затрат функционируют как стандартизированные учетные единицы, интегрированные во весь процесс эксплуатации и технического обслуживания активов, а не как абстрактные правила распределения финансовых средств. Рабочие нагрузки по активам нижнего уровня преобразуются в стандартизированные эксплуатационные квоты и в дальнейшем сопоставляются с категориями затрат, включая трудозатраты, материалы, строительную технику, сторонние услуги и аварийные запасы. Такое иерархическое сопоставление обеспечивает инженерную интерпретируемость и нормативную прослеживаемость на протяжении всего процесса прогнозирования, а также создает физическую основу для построения статической базовой модели квот.
Обзор методологического процесса
Предлагаемая структура прогнозирования состоит из трех последовательных этапов: (1) построение физической базы с использованием квот рабочей нагрузки на уровне активов, (2) динамическое изменение квот затрат посредством макроэкономических и технологических корректировок и (3) компенсация остатков на основе машинного обучения для учета систематических нелинейных эффектов. Как показано на Рисунке 1, данная структура устанавливает иерархическое отображение от активов нижнего уровня и стандартизированных операционных действий к прогнозам затрат на производство и эксплуатацию. Детали реализации каждого этапа описаны в следующих подразделах.
Модель базовой физической стоимости на основе рабочих нагрузок на уровне активов
Затраты на производство и эксплуатацию энергосистемы, Ctotal, включают расходы, связанные с многочисленными видами хозяйственной деятельности, в том числе с эксплуатацией подстанций, техническим обслуживанием линий электропередачи, управлением распределительными сетями, обслуживанием клиентов и вспомогательными системами. В данном исследовании предполагается, что базовые эксплуатационные расходы определяются объемом работ, создаваемым каждым стандартизированным видом операционной деятельности, и соответствующей квотой затрат.
Статическая базовая стоимость рассчитывается следующим образом:
(1)
где Vi,k,t обозначает объем работ, связанный с i-м активом или операционной задачей в рамках бизнес-категории k в период t, а Qi,k представляет соответствующую стандартизированную единичную стоимость, определенную системой инженерных квот затрат. Бизнес-категория включает основные операционные функции, такие как техническое обслуживание подстанций, инспекция линий электропередачи, эксплуатация распределительных сетей и обслуживание клиентов. Двойное суммирование объединяет затраты на все стандартизированные операционные действия для оценки теоретического базового уровня расходов, необходимых для поддержания нормального функционирования энергосети.
Уравнение (1) устанавливает физическую взаимосвязь между инженерным объемом работ и финансовыми затратами путем прямого сопоставления стандартизированных операционных действий с соответствующими счетами затрат. В отличие от чисто статистических моделей прогнозирования, данная формулировка обеспечивает интерпретируемую инженерную базу, которая служит основой для последующей динамической корректировки квот и исправления остаточных отклонений на основе машинного обучения. Уравнение было разработано на основе операционной практики и системы стоимостных квот, используемых предприятиями провинциальных электросетей Китая. В Таблице 1 приведены обозначения, используемые в уравнении (1), включая объем работ (Vi,k,t), стандартизированную единичную стоимость (Qi,k), количество операционных задач (Nk) и индекс категории бизнеса (k).
Механизм динамической эволюции квот при внешних воздействиях окружающей среды
Стандартизированные квоты затрат (Qi,k) обеспечивают физически интерпретируемую базовую линию, однако они не учитывают изменения макроэкономических условий или технологический прогресс. Для повышения их долгосрочной применимости был внедрен механизм динамической эволюции для корректировки базовых квот в ответ как на ценовую инфляцию, так и на рост эффективности, обусловленный технологическим развитием.
Первая корректировка учитывает изменения затрат на закупки, вызванные макроэкономической инфляцией. Эксплуатация и техническое обслуживание электросетей в значительной степени зависят от основных материалов, включая медь, алюминий и электротехническую сталь, цены на которые тесно связаны с колебаниями индекса цен производителей (PPI). Поскольку
представляет собой индекс с базовым значением 100, он сначала преобразуется в стандартизированный уровень инфляции:
(2)
На этом основании функция коррекции цены
определяется следующим образом:
(3)
где
— вектор груза-противовеса длиной L, удовлетворяющий

Структура лага представляет собой отложенную передачу макроэкономической инфляции на затраты по закупкам в цепочке поставок электросетевого хозяйства. Преобразование индекса PPI в стандартизированный уровень инфляции позволяет сохранить кумулятивный эффект изменения цен, избегая при этом систематической ошибки масштабирования, связанной с прямым использованием значений индекса. Уравнения (2) и (3) адаптированы из общепринятых моделей корректировки макроэкономической инфляции, при этом структура лага откалибрована с учетом циклов закупок в энергетическом секторе33,34.
Технологический прогресс был учтен с помощью коэффициента снижения затрат, который отражал повышение операционной эффективности в результате внедрения таких достижений, как инспекции с помощью беспилотных летательных аппаратов, интеллектуальная робототехника и технологии цифрового технического обслуживания. Коэффициент технологической корректировки определяется следующим образом:
(4)
В данной части α и β представляют собой эмпирические коэффициенты эластичности, оцененные на основе исторических панельных данных с помощью метода нелинейных наименьших квадратов. Чтобы фактор технологического прогресса всегда соответствовал обоснованному снижению удельных затрат по квоте, процесс оценки параметров ограничивает значение 0 < Γ(Etech,t) ≤ 1. Следует отметить, что этот фактор в первую очередь отражает долгосрочное повышение эффективности, resulting from замены технологий на более зрелые. Уравнение (4) является оригинальным для данной работы и адаптирует концепцию кривой обучения из литературы по стоимости энергетических технологий35,36 к операциям по техническому обслуживанию электросетей. Дополнительные затраты, которые могут возникнуть на раннем этапе внедрения цифрового оборудования, такие как параллельная работа старых и новых систем, интеграция платформ, тестирование связи и дополнительное техническое обслуживание, не вычитаются принудительно из базовой квоты; вместо этого они определяются последующим модулем компенсации остатков на основе машинного обучения:
(5)
где Cbase,t обозначает статическую базовую стоимость, рассчитанную на основе рабочих нагрузок активов нижнего уровня и стандартизированных квот на эксплуатационные расходы;
отражает эффект передачи макроэкономических колебаний цен на стоимость материалов, оборудования и внешних услуг; а Γ(Etech,t) отражает снижение удельных затрат на эксплуатацию и техническое обслуживание за счет повышения эффективности после достижения технологической зрелости. Благодаря вышеописанному механизму динамической эволюции базовая квота перестает быть статическим бухгалтерским показателем и может адаптивно корректироваться при изменении экономических условий и технологических факторов. Уравнение (5) является оригинальным для данной работы и представляет собой новую интеграцию ценовых и технологических поправок в структуру базовой квоты.
Систематический захват нелинейных остатков при наличии квотных ограничений
Несмотря на сложные эволюционные корректировки, модель квотирования неизбежно вызывает систематические отклонения при возникновении непредсказуемых погодных сбоев, связанных с катастрофами, и внезапных политических директив, таких как увеличение затрат на обработку жалоб клиентов в периоды временного снижения тарифов. Это отклонение формирует остаточный член по обе стороны уравнения:
Rt=Cactual,t-Cquota,t (6)
Поскольку традиционные физические законы не могут объяснить этот аспект, для преодоления данных ограничений может быть использовано машинное обучение. Чтобы избежать «проклятия размерности», вызванного многомерными признаками, в данном исследовании для моделирования нелинейной зависимости Rt37,38 используется алгоритм XGBoost, основанный на ансамблях деревьев решений. Определена матрица признаков сильного возмущения Xt, включающая такие метеорологические признаки, как количество дней с экстремальными морозами в году Dice , а также интенсивность макроэкономической политики.
Для нелинейного компенсатора, состоящего из деревьев регрессии, логика генерации прогнозируемого остатка
может быть выражена следующим образом39:
(7)
где F обозначает пространство всех возможных структур деревьев классификации и регрессии. Для обеспечения баланса между точностью подгонки и предотвращением переобучения на m-й итерации строится и минимизируется регуляризованная целевая функция, содержащая член штрафа за структурную сложность:
(8)
где
представляет собой выпуклую функцию потерь, измеряющую разницу между истинным и прогнозируемым остатком. В данной работе используется функция потерь Хубера (Huber Loss) для повышения устойчивости модели к аномальным пикам расходов. Регуляризационный член
используется для ограничения сложности структуры дерева и определяется следующим образом:
(9)
где Tm представляет собой количество листовых узлов в m-ом дереве, wm представляет соответствующий вектор весов листьев, а γ и λ обозначают коэффициент штрафа за количество листовых узлов и коэффициент регуляризации весов соответственно.
Итоговое уравнение прогнозирования имеет следующий вид:
(10)
Дальнейшая расшифровка:
(11)
Приведенная выше формула математически представляет структуру с замкнутым контуром предлагаемой модели прогнозирования. Итоговый спрос на затраты на производство и эксплуатацию не генерируется моделью машинного обучения напрямую; вместо этого он получается путем наложения нелинейной компенсации остатков, определенной модулем машинного обучения, на динамическую базовую линию квоты. Среди этих компонентов ценовые и технологические факторы в первую очередь отражают динамическую эволюцию базовой линии квоты, в то время как факторы, которые трудно эксплицитно охарактеризовать с помощью правил, такие как климатические потрясения, политические сбои и резкое увеличение количества случаев ремонта, фиксируются модулем компенсации остатков на основе машинного обучения. Уравнения (10) и (11) являются оригинальными для данной работы и объединяют физическую базовую линию с захватом остатков на базе ML в единую структуру прогнозирования.
Рисунок 2 показывает, что результаты прогнозирования предлагаемой модели демонстрируют четкую иерархическую логику генерации. С одной стороны, базовая квота обеспечивает стабильный, прозрачный и проверяемый физический фундамент для спроса на затраты; с другой стороны, корректировка цен, технологические эффекты и остатки внешних шоков позволяют модели адаптироваться к динамическим изменениям в сложных условиях. По сравнению с моделями «черного ящика», которые напрямую выдают прогнозируемые значения, такая структура декомпозиции позволяет четко выявить причины роста или снижения затрат, тем самым повышая интерпретируемость результатов модели при анализе бюджета и регулировании тарифов на передачу и распределение электроэнергии.
Источники данных и процедуры сбора
Теоретические модели должны проходить строгую валидацию с помощью эмпирических данных для подтверждения их практической полезности. Поскольку основные финансовые данные энергетического сектора содержат конфиденциальную информацию, касающуюся функционирования национальной инфраструктуры, в данном исследовании используются высокоточные анонимизированные ежемесячные данные бухгалтерского учета типичной провинциальной электросети в восточном Китае (для удобства именуемой E-Grid), охватывающие 16 последовательных календарных лет с 2010 по 2025 год. В этой провинции наблюдался типичный экономический цикл перехода от роста, стимулируемого традиционной тяжелой промышленностью, к высокотехнологичному производству, при этом совокупный среднегодовой темп роста масштаба активов сети достиг 7,4%. Таким образом, сложная эволюция структуры ее затрат может иметь значение для других быстроразвивающихся сетевых систем. Данные получены из трех основных источников: (1) внутренних журналов эксплуатации и технического обслуживания, в которых фиксируются объемы работ на уровне активов, частота осмотров и случаи ремонта; (2) систем финансового учета, предоставляющих ежемесячные отчеты о затратах на оплату труда, материалы, оборудование и сторонние услуги; и (3) внешних баз данных об окружающей среде, включая метеорологические записи Метеорологической администрации Китая и макроэкономические показатели Национального бюро статистики.
Контроль качества и обработка пропущенных данных
Для более чем 130 исходных показателей, интегрированных из многоисточниковых систем, была внедрена строгая процедура контроля качества. Пропуски в данных, составляющие менее 3% от общего объема наблюдений, обрабатывались с помощью линейной интерполяции для непрерывных переменных с временными трендами и импутации модой для категориальных показателей. Выбросы определялись методом межквартильного размаха (IQR); значения, превышающие верхний квартиль более чем на 3,0 IQR, подвергались винзоризации до 99-го процентиля для сохранения целостности данных и минимизации искажений, вызванных экстремальными значениями.
Обоснование размера выборки
Набор данных состоит из 192 ежемесячных наблюдений (январь 2010 г. – декабрь 2025 г.), из которых 156 наблюдений (2010–2022 гг.) распределены для обучения и валидации, а 36 наблюдений (2023–2025 гг.) зарезервированы для тестирования на выборке вне обучающего набора. Хотя такой размер выборки относительно невелик для приложений глубокого обучения, он подходит для алгоритма XGBoost, который специально разработан для эффективной работы с табличными данными малого и среднего объема благодаря механизмам регуляризации и прунинга деревьев. Для минимизации рисков переобучения были применены следующие меры: (1) строгие штрафы регуляризации (γ = 0.1, λ = 1.0), (2) ранняя остановка с параметром patience = 50 раундов и (3) консервативные ограничения глубины дерева (max depth = 5). В совокупности эти меры обеспечивают стабильность и обобщающую способность модели, несмотря на ограниченный размер выборки.
Сегментация данных и гетерогенная интеграция из нескольких источников
Для строгого тестирования данные с января 2010 по декабрь 2022 года были отнесены к интервалу обучения-валидации, содержащему 156 наблюдений, который используется для обучения факторов эволюции квот и остаточной сети компенсации квот. Период с января 2023 по декабрь 2025 года зарезервирован в качестве отложенного внешней выборки для тестирования, содержащей 36 наблюдений. Почему этот период был выбран в качестве финального полигона для тестирования? Причина заключается в том, что эти три года совпали с ускорением строительства энергосистем нового типа, что было осложнено масштабными экстремальными высокотемпературными явлениями, связанными с Эль-Ниньо, а также быстрым и неравномерным ростом распределенной генерации из возобновляемых источников энергии. Энергосистема столкнулась с беспрецедентным давлением в цепочках поставок материалов и распределении ремонтного персонала.
Научный отбор и количественное определение факторов, влияющих на стоимость, являются основой для обеспечения того, чтобы остаточная сеть машинного обучения могла эффективно фиксировать систематические колебания. Основываясь на логике управления стандартными эксплуатационными расходами в энергосистемах, в данном исследовании преодолевается одномерность традиционного финансового прогнозирования, которое опирается только на исторические денежные потоки; вместо этого проектирование признаков перестраивается на базе четырех основных границ: масштаба физических активов, условий эксплуатации и технического обслуживания, макроэкономической эволюции и внешней климатической среды с использованием оригинальных эксплуатационных журналов и внешних системных реестров. В процессе фактического моделирования для более чем 130 исходных показателей, полученных в результате интеграции многоисточниковых систем, в данном исследовании используются тесты корреляции Пирсона для исключения высококоллинеарных избыточных переменных с пороговым значением |r| > 0.85. На основе априорных знаний ведущих экспертов по электросетям для формирования матрицы признаков Xt в конечном итоге были выбраны 42 основные входные характеристики. Для наглядного представления базовой структуры данных и распределения входного тензора в Таблице 2 выбраны 12 репрезентативных основных признаков из четырех вышеупомянутых измерений оценки и обобщены их описательные статистики за период наблюдения.
Для дальнейшей иллюстрации пространственно-топологической основы многоисточниковой системы признаков на рисунке 3 представлена анонимизированная схематическая топология исследуемой провинциальной энергосистемы. На рисунке наложены подстанции различных уровней напряжения, коридоры линий электропередачи, кластеры распределенных возобновляемых источников энергии, центры нагрузки и репрезентативные зоны воздействия факторов окружающей среды. Топология помогает объяснить, почему затраты на производство и эксплуатацию совместно зависят от масштаба активов, структуры сети, интенсивности аварийно-восстановительных работ и внешних климатических воздействий. Она также служит основой для пространственной интерпретации переменных, определяющих остатки, которые используются в модуле компенсации XGBoost.
Таблица 2 показывает, что объясняющие переменные по различным бизнес-измерениям имеют заметно различающиеся статистические формы. Переменные физических активов, представляющие эндогенную динамику развития предприятия, такие как мощность подстанций и протяженность линий, имеют относительно стабильные значения стандартного отклонения и коэффициента асимметрии в диапазоне от 0,1 до 0,8. Их общая структура данных приближена к нормальному распределению, что объективно отражает характеристику устойчивого развития энергосистемы в цикле строительства инфраструктуры. Резким контрастом выступают переменные метеорологических и внешних факторов окружающей среды в нижней части таблицы. Например, совокупное количество дней с предупредительным уровнем высокой температуры за последние 90 дней и индекс воздействия отключений линий демонстрируют крайне сильную правостороннюю асимметрию с коэффициентами асимметрии 2,15 и 2,45 соответственно. Такое типичное распределение с «тяжелыми хвостами» подтверждает объективную проблему, которую нельзя игнорировать при фактической эксплуатации и техническом обслуживании энергосистемы: хотя экстремальные погодные катастрофы происходят относительно редко в годовом исчислении, при их возникновении часто наблюдается экспоненциальный рост затрат трудовых ресурсов на ремонт и расхода запасных частей. С другой стороны, высокая неоднородность и асимметрия экстремальных значений в распределении этих многоисточниковых признаков выявляют теоретические ограничения традиционных линейных моделей временных рядов, таких как ARIMAX, которые основаны на предположениях о нормальности и гомоскедастичности при отслеживании сложных затрат энергосистемы. Это не только дополнительно обосновывает целесообразность внедрения модуля машинного обучения сверх базового физического учета, но и обеспечивает серьезную статистическую поддержку выбору в данной работе древовидной модели XGBoost, которая способна эффективно обрабатывать разреженные распределения признаков и нелинейные отображения для аппроксимации остатков затрат.
Настройка системы оптимизации гиперпараметров и оценки
После определения пространства входных признаков настройка гиперпараметров модели напрямую влияет на эффективность аппроксимации в сети остаточного приближения. Поскольку компенсационная сеть XGBoost включает множество параметров, в том числе глубину дерева (max depth), скорость обучения и штрафные члены регуляризации, которые имеют нелинейные взаимодействия, традиционный поиск по сетке не только обладает высокой вычислительной сложностью, но и склонен к попаданию в локальные минимумы в многомерных пространствах. Поэтому в процессе настройки параметров в данной работе используется метод байесовской оптимизации — древовидный парзеновский оцениватель (Tree-structured Parzen Estimator, TPE). Алгоритм TPE может динамически направлять последующий отбор выборок, используя обратную связь по функции потерь из предыдущих итераций. Путем построения апостериорной оценки ядерной плотности (KDE) целевой переменной он адаптивно сужает пространство поиска параметров, что позволяет модели приблизиться к глобально оптимальной конфигурации гиперпараметров без чрезмерных вычислительных затрат. Целью оптимизации TPE была минимизация RMSE на валидационной выборке в течение 100 итераций с применением ранней остановки после 50 раундов без улучшения результата.
После завершения оптимизации параметров на внутреннем валидационном наборе данных, для объективной оценки итоговой эффективности каждой модели на внешней тестовой выборке и в соответствии с требованиями регуляторов по количественной оценке для верификации затрат, в данном исследовании используется средняя абсолютная процентная ошибка (MAPE) для количественного определения относительного отклонения в прогнозируемой последовательности. В то же время, для решения практической задачи по контролю критических ошибок прогнозирования затрат в операционной деятельности, также вводится среднеквадратическая ошибка (RMSE), чтобы обеспечить более строгий штраф за более крупные ошибки. Наконец, коэффициент детерминации, R2, количественно определяет общую объясняющую способность регрессии относительно истинной дисперсии целевой переменной.
Математические определения показателей следующие:
(12)
(13)
(14)
где
представляет собой фактические затраты на производство и эксплуатацию в периоде t,
представляет собой стоимость, предсказанную моделью,
представляет собой средние фактические затраты в тестовой выборке, а N — количество образцов в тестовом наборе.