Deze studie maakte gebruik van geanonimiseerde operationele en financiële gegevens verzameld van een provinciaal elektriciteitsnet in Oost-China. Alle gegevens werden geaggregeerd en gedeïdentificeerd vóór de analyse, en er werden geen persoonlijk identificeerbare of gevoelige informatie op individueel niveau opgenomen. Daarom was ethische goedkeuring niet vereist. De toegang tot en analyse van de gegevens waren in overeenstemming met de geldende gegevensbeschermingsvoorschriften en institutionele overeenkomsten die betrekking hebben op informatie in de energiesector.
Overzicht van het voorspellingskader
Om natuurkundig gebaseerde en datagestuurde voorspellingsbenaderingen te integreren, is een hybride voorspellingsraamwerk ontwikkeld dat technische kostenquota combineert met machine learning. In plaats van simpelweg meerdere algoritmen te combineren, volgt het raamwerk het principe dat fysische modellen de basisvoorspelling vaststellen, terwijl machine learning de residuele fouten compenseert. Dit ontwerp zorgt ervoor dat het voorspellingsproces is gebaseerd op de fysische mechanismen die ten grondslag liggen aan de productie- en operationele activiteiten van het elektriciteitsnet, in plaats van uitsluitend te vertrouwen op extrapolatie van historische kosten.
Het raamwerk stelt eerst een hiërarchische koppeling vast tussen activa van het elektriciteitsnet, gestandaardiseerde operationele activiteiten en financiële kostenrekeningen. Productie- en exploitatiekosten worden beschouwd als monetaire representaties van de middelen die door fysieke activa worden verbruikt—waaronder onderstations, transmissieleidingen, distributieverdelers, meetapparaten en digitale inspectieapparatuur—tijdens routinematige activiteiten zoals inspectie, onderhoud, testen, reparatie en vervanging. Kostenquota dienen als de schakel tussen meetbare technische werklasten en de bijbehorende financiële uitgaven.
Zoals geïllustreerd in Figuur 1, fungeren kostenquota als gestandaardiseerde accounting-eenheden die zijn ingebed in het gehele proces van exploitatie en onderhoud van activa, in plaats van als abstracte regels voor financiële allocatie. Werkbelastingen van activa op het laagste niveau worden omgezet in gestandaardiseerde exploitatiequota en vervolgens gekoppeld aan kostencategorieën, waaronder arbeid, materialen, bouwmachines, uitbesteelde diensten en noodvoorraden. Deze hiërarchische koppeling behoudt de technische interpreteerbaarheid en regelgevende traceerbaarheid gedurende het voorspellingsproces en biedt de fysieke basis voor het construeren van het statische basisquotamodel.
Overzicht van de methodologische workflow
Het voorgestelde voorspellingskader bestaat uit drie opeenvolgende fasen: (1) de constructie van een fysieke basislijn met behulp van workloadquota op activaniveau, (2) de dynamische evolutie van kostenquota via macro-economische en technologische aanpassingen, en (3) machinaal leren-gebaseerde residuele compensatie om systematische niet-lineaire effecten vast te leggen. Zoals geïllustreerd in Figuur 1, stelt het kader een hiërarchische mapping vast van activa op het laagste niveau en gestandaardiseerde operationele activiteiten naar voorspellingen van productie- en exploitatiekosten. De implementatiedetails van elke fase worden beschreven in de volgende subsecties.
Fysiek basiskostenmodel gebaseerd op workloads op activaniveau
De productie- en exploitatiekosten van een elektriciteitsnet, Ctotal, bestaan uit uitgaven die verbonden zijn aan meerdere bedrijfsactiviteiten, waaronder het beheer van onderstations, het onderhoud van transmissielijnen, het beheer van het distributienetwerk, klantenservice en ondersteunende systemen. In deze studie wordt ervan uitgegaan dat de basisexploitatiekosten worden bepaald door de werklast die wordt gegenereerd door elke gestandaardiseerde operationele activiteit en het bijbehorende kostenquotum.
De statische basislijnkost wordt als volgt berekend:
(1)
waarbij Vi,k,t de werklast aanduidt die geassocieerd is met het i-de actief of de operationele taak binnen bedrijfscategorie k tijdens periode t, en Qi,k de overeenkomstige gestandaardiseerde eenheidskost vertegenwoordigt zoals gedefinieerd door het engineering-kostenquotumsysteem. De bedrijfscategorie omvat belangrijke operationele functies zoals het onderhoud van onderstations, inspectie van transmissieleidingen, exploitatie van het distributienetwerk en klantenservice. De dubbele sommatie aggregeert de kosten van alle gestandaardiseerde operationele activiteiten om de theoretische basisuitgaven te schatten die nodig zijn om een normale netbedrijfsvoering te handhaven.
Vergelijking (1) stelt de fysieke relatie vast tussen technische werklasten en financiële uitgaven door gestandaardiseerde operationele activiteiten direct te koppelen aan kostenrekeningen. In tegenstelling tot puur statistische voorspellingsmodellen biedt deze formulering een interpreteerbare technische basis die dient als fundament voor daaropvolgende dynamische quotumaanpassingen en residuele correcties op basis van machine learning. De vergelijking is ontwikkeld op basis van de operationele praktijken en het kostenquotumsysteem dat wordt gebruikt door provinciale elektriciteitsnetbedrijven in China. Tabel 1 vat de notatie samen die in Vergelijking (1) wordt gebruikt, inclusief werklast (Vi,k,t), gestandaardiseerde eenheidskosten (Qi,k), het aantal operationele taken (Nk) en de index voor de bedrijfscategorie (k).
Dynamisch evolutiemechanisme van quota onder externe omgevingsverstoringen
Gestandaardiseerde kostenquota (Qi,k) bieden een fysiek interpreteerbare basislijn, maar houden geen rekening met veranderingen in macro-economische omstandigheden of technologische vooruitgang. Om hun toepasbaarheid op lange termijn te verbeteren, is een dynamisch evolutiemechanisme geïntroduceerd om de basisquota aan te passen in reactie op zowel prijsinflatie als technologiegestuurde efficiëntiewinsten.
De eerste aanpassing houdt rekening met veranderingen in de inkoopkosten als gevolg van macro-economische inflatie. De exploitatie en het onderhoud van het elektriciteitsnet zijn sterk afhankelijk van bulkmaterialen, waaronder koper, aluminium en siliciumstaal, waarvan de prijzen nauw verbonden zijn met schommelingen in de producentenprijsindex (PPI). Omdat
is een index met een basiswaarde van 10, wordt deze eerst omgezet in een gestandaardiseerd inflatiecijfer:
(2)
Op basis hiervan, de prijscorrectiefunctie
wordt gedefinieerd als:
(3)
waar
is een lag-gewichtsvector met een lengte van L bevredigend

De vertragingsstructuur representeert de vertraagde overdracht van macro-economische inflatie naar de inkoopkosten binnen de toeleveringsketen van het elektriciteitsnet. Door de PPI-index om te zetten in een gestandaardiseerd inflatiepercentage wordt het cumulatieve effect van prijsveranderingen behouden, terwijl schaalvertekening die gepaard gaat met het directe gebruik van indexwaarden wordt vermeden. Vergelijkingen (2) and (3) zijn aangepast van gevestigde macro-economische inflatiecorrectiemodellen, waarbij de vertragingsstructuur is gekalibreerd voor inkoopcycli in de energiesector3,34.
Technologische vooruitgang werd geïmplementeerd via een kostenreductiefactor die de verbeteringen in de operationele efficiëntie weerspiegelt als gevolg van vorderingen zoals inspectie met onbemande luchtvaartuigen, intelligente robotica en digitale onderhoudstechnologieën. De technologische aanpassingsfactor is als volgt gedefinieerd:
(4)
In dit gedeelte zijn α en β empirische elasticiteitscoëfficiënten die zijn geschat uit historische panelgegevens met behulp van niet-lineaire kleinste kwadraten. Om ervoor te zorgen dat de factor technologische vooruitgang altijd een redelijke vermindering van de kosten per eenheidskota vertegenwoordigt, beperkt het proces van parameterestimatie 0 < Γ(Etech,t) ≤ 1. Er dient te worden opgemerkt dat deze factor primair de langetermijnverbetering van de efficiëntie weerspiegelt die voortvloeit uit de substitutie van volwassen technologie. Vergelijking (4) is oorspronkelijk voor dit werk ontwikkeld, waarbij het concept van de leercurve uit de literatuur over energietechnologiekosten35,36 is aangepast aan netonderhoudswerkzaamheden. Aanvullende kosten die kunnen ontstaan tijdens de vroege fase van de implementatie van digitale apparatuur, zoals de parallelle werking van oude en nieuwe systemen, platformintegratie, communicatietests en extra onderhoud, worden niet geforceerd afgetrokken van het basisquota; in plaats daarvan worden deze geïdentificeerd door de daaropvolgende compensatiemodule voor residuen op basis van machine learning:
(5)
waarbij Cbasis,t duidt de statische basiskosten aan, berekend op basis van workloads van assets op het laagste niveau en gestandaardiseerde quota voor operationele kosten;
legt het transmissie-effect van macro-prijsfluctuaties op de prijzen van materialen, apparatuur en externe diensten vast; en Γ(Etechniek,t) weerspiegelt de op efficiëntie gebaseerde reductie in de eenheidskosten voor exploitatie en onderhoud na technologische rijping. Door middel van het bovenstaande mechanisme van dynamische evolutie blijft de quotumbaseline niet langer een statische boekhoudkundige basis, maar kan deze adaptief worden aangepast aan veranderingen in economische omgevingen en technologische omstandigheden. Vergelijking (5) is origineel voor dit werk en vertegenwoordigt de innovatieve integratie van prijs- en technologiecorrecties in het raamwerk van de quotumbaseline.
Systematische niet-lineaire residu-vastlegging onder quotumbeperkingen
Ondanks complexe evolutionaire correcties genereert het quotamodel onvermijdelijk systematische afwijkingen bij onvoorspelbare weersomstandigheden gerelateerd aan rampen en plotselinge beleidsrichtlijnen, zoals verhoogde kosten voor de afhandeling van klachten van klanten tijdens tijdelijke perioden van tariefvermindering. Deze afwijking vormt de residuterm aan beide zijden van de vergelijking:
Rt=Cactual,t-Cquota,t (6)
Aangezien conventionele fysische regels dit aspect niet kunnen verklaren, kan machine learning deze beperkingen aanpakken. Om de vloek van dimensionaliteit die wordt veroorzaakt door hoogdimensionale kenmerken te vermijden, gebruikt deze studie het XGBoost-algoritme op basis van beslisboom-ensembles om de niet-lineaire relatie Rt37,38 te modelleren. Er is een kenmerkmatrix voor sterke verstoringen Xt gedefinieerd, inclusief meteorologische kenmerken zoals het aantal extreme vorstdagen per jaar Dice en de intensiteit van het macrobeleid.
Voor een niet-lineaire compensator die bestaat uit regressiebomen, de generatielogica van het voorspelde residu
kan worden uitgedrukt als39:
(7)
waarbij F de ruimte van alle mogelijke classificatie- en regressieboomstructuren aanduidt. Om de balans tussen passingsnauwkeurigheid en het voorkomen van overfitting te bewaken, wordt in de m-de iteratie een geregulariseerde doelfunctie geconstrueerd en geminimaliseerd, die een strafterm voor structurele complexiteit bevat:
(8)
waar
is een convexe verliesfunctie die het verschil tussen het werkelijke residu en het voorspelde residu meet. In dit artikel wordt Huber Loss gebruikt om de robuustheid van het model tegen abnormale piekuitgaven te verbeteren. De regularisatieterm
wordt gebruikt om de complexiteit van de boomstructuur te beperken en is als volgt gedefinieerd:
(9)
waarbij Tm het aantal bladknooppunten in de m-de boom vertegenwoordigt, wm de overeenkomstige bladgewichtsvector vertegenwoordigt, en γ en λ respectievelijk de strafcoëfficiënt voor het aantal bladknooppunten en de regularisatiecoëfficiënt voor het gewicht aanduiden.
De definitieve voorspellingsvergelijking is:
(10)
Verder uitgebreid als:
(11)
De bovenstaande formule stelt de gesloten-lusstructuur van het voorgestelde voorspellingsmodel wiskundig voor. De uiteindelijke vraag naar productie- en operationele kosten wordt niet direct door het machine learning-model gegenereerd; in plaats daarvan wordt deze verkregen door de niet-lineaire residuele compensatie, geïdentificeerd door de machine learning-module, op te tellen bij de dynamische quota-basislijn. Van deze componenten weerspiegelen prijs- en technologiefactoren primair de dynamische evolutie van de quota-basislijn, terwijl factoren die moeilijk expliciet via regels te karakteriseren zijn, zoals klimaatshocks, beleidsverstoringen en pieken in reparatiegebeurtenissen, worden vastgelegd door de residuele compensatiemodule voor machine learning. Vergelijkingen (10) en (1) zijn origineel voor dit werk en synthetiseren de fysieke basislijn met de op ML gebaseerde residuele vastlegging tot een geünificeerd voorspellingskader.
Figuur 2 laat zien dat de voorspellingsresultaten van het voorgestelde model een duidelijke hiërarchische generatielogica vertonen. Enerzijds biedt het basisquotum een stabiele, transparante en controleerbare fysieke basis voor de kostenbehoefte; anderzijds maken prijsaanpassingen, technologie-effecten en residuen van externe schokken het mogelijk voor het model om zich aan te passen aan dynamische veranderingen in complexe omgevingen. In vergelijking met black-box-modellen die direct voorspelde waarden genereren, kan deze decompositiestructuur duidelijk onthullen "waarom kosten stijgen of dalen", waardoor de interpreteerbaarheid van de modelresultaten bij budgetbeoordelingen en de regulering van transport- en distributietarieven wordt verbeterd.
Gegevensbronnen en verzamelprocedures
Theoretische modellen moeten strikt worden gevalideerd aan de hand van empirische gegevens om hun praktische bruikbaarheid aan te tonen. Aangezien de kernfinanciële gegevens van de energiesector gevoelige informatie bevatten over de operaties van de nationale infrastructuur, extraheert deze studie hoogpreciese, geanonimiseerde maandelijkse boekhoudgegevens van een typisch provinciaal elektriciteitsnet in Oost-China, omwille van het gemak aangeduid als E-Grid, over een periode van 16 opeenvolgende kalenderjaren van 2010 tot 2025. Deze provincie heeft een typische economische cyclus doorgemaakt, waarbij de verschuiving plaatsvond van groei gedreven door traditionele zware industrie naar hoogwaardige productie, waarbij het samengestelde jaarlijkse groeipercentage van de schaal van de netactiva 7,4% bedroeg. De complexe evolutie van de kostenstructuur is daarom mogelijk relevant voor andere snel ontwikkelende netwerksystemen. De gegevens zijn afkomstig uit drie primaire bronnen: (1) interne exploitatie- en onderhoudslogboeken waarin werkbelasting op activaniveau, inspectiefrequenties en reparatiegebeurtenissen zijn vastgelegd; (2) financieel-boekhoudkundige systemen die maandelijkse kostenoverzichten verschaffen voor arbeid, materialen, apparatuur en uitbesteelde diensten; en (3) externe milieudatabanken, waaronder meteorologische gegevens van de China Meteorological Administration en macro-economische indicatoren van het National Bureau of Statistics.
Kwaliteitscontrole en behandeling van ontbrekende gegevens
Voor meer dan 130 initiële indicatoren, geïntegreerd uit systemen uit meerdere bronnen, is een strikte kwaliteitscontroleprocedure geïmplementeerd. Ontbrekende datapunten, die minder dan 3% van de totale waarnemingen besloegen, werden behandeld via lineaire interpolatie voor continue variabelen met temporele trends, en via modus-imputatie voor categorische indicatoren. Uitschieters werden geïdentificeerd met de methode van het interkwartielafstand (IQR); waarden die meer dan 3,0 keer de IQR boven het derde kwartiel uitkwamen, werden gewinsoriseerd tot het 99ste percentiel om de data-integriteit te waarborgen en vervorming door extreme waarden te beperken.
Overwegingen met betrekking tot de steekproefomvang
De dataset bestaat uit 192 maandelijkse waarnemingen (januari 2010–december 2025), waarvan 156 waarnemingen (2010–202) zijn toegewezen voor training en validatie en 36 waarnemingen (2023–2025) zijn gereserveerd voor out-of-sample testen. Hoewel deze steekproefomvang relatief bescheiden is voor deep learning-toepassingen, is deze geschikt voor het XGBoost-algoritme, dat specifiek is ontworpen om goed te presteren met kleine tot middelgrote tabulaire datasets door middel van regularisatie- en tree-pruning-mechanismen. Om potentiële risico's op overfitting te beperken, zijn (1) strikte regularisatieboetes toegepast (γ = 0.1, λ = 1.0), (2) early stopping met een patience van 50 rondes, en (3) conservatieve beperkingen voor de boomdiepte (max depth = 5). Deze maatregelen waarborgen gezamenlijk de stabiliteit en generalisatie van het model, ondanks de beperkte steekproefomvang.
Datasegmentatie en heterogene integratie uit meerdere bronnen
Voor een rigoureuze toetsing werden de gegevens van januari 2010 tot en met december 202 toegewezen aan het trainings-validatieinterval, bestaande uit 156 waarnemingen, dat wordt gebruikt om de quota-evolutiefactoren en het quota-compensatieresidueelnetwerk te trainen. De periode januari 2023–december 2025 is gereserveerd als de externe out-of-sample testset, bestaande uit 36 waarnemingen. Waarom is deze periode gekozen als definitief testgebied? De reden is dat deze drie jaar samenvielen met de versnelling van de constructie van nieuwe typen energiesystemen, verergerd door grootschalige extreme hittegolven gerelateerd aan El Niño en de snelle en ongelijkmatige groei van gedistribueerde hernieuwbare energieopwekking. Het elektriciteitsnet stond onder ongekende druk wat betreft de toeleveringsketens van materialen en de toewijzing van reparatiepersoneel.
De wetenschappelijke selectie en kwantitatieve definitie van kostendrijvende factoren vormen de basis om ervoor te zorgen dat het residuale netwerk van machine learning systematische schommelingen effectief kan vastleggen. Op basis van de beheerslogica van standaardexploitatiekosten in energiesystemen doorbreekt deze studie de eendimensionale benadering van traditionele financiële prognoses, die enkel rusten op historische kasstromen, en reconstrueert in plaats daarvan de feature engineering vanuit vier kerngrenzen: de schaal van fysieke activa, exploitatie- en onderhoudsomstandigheden, macro-economische evolutie en de externe klimatologische omgeving, gebruikmakend van oorspronkelijke exploitatielogboeken en externe systeemhoofdboeken. In het feitelijke modelleringsproces is voor meer dan 130 oorspronkelijke indicatoren die voortvloeien uit multi-bron systeemintegratie gebruikgemaakt van Pearson-correlatietesten om hoogcollineaire redundante variabelen te elimineren, met een drempelwaarde van |r| > 0,85. Op basis van de voorkennis van senior experts uit het energienet zijn uiteindelijk 42 kerninputfeatures geselecteerd om de featurematrix Xt te vormen. Om de onderliggende datastructuur en distributie van de inputtensor duidelijk weer te geven, selecteert Tabel 2 12 representatieve kernfeatures uit de vier bovengenoemde evaluatiedimensies en vat hun beschrijvende statistieken over de observatieperiode samen.
Om de ruimtelijk-topologische basis van het multi-bron kenkensysteem verder te illustreren, presenteert Figuur 3 een geanonimiseerde schematische topologie van het onderzochte provinciale elektriciteitsnet. De figuur toont de overlay van onderstations op spanningsniveau, transmissiecorridors, gedistribueerde clusters van hernieuwbare energie, lastcentra en representatieve zones met omgevingsverstoringen. De topologie helpt verklaren waarom productie- en exploitatiekosten gezamenlijk worden beïnvloed door de schaal van activa, de netwerkstructuur, de intensiteit van noodreparaties en externe klimatologische schokken. Het biedt tevens een basis voor de ruimtelijke interpretatie van de residu-sturende variabelen die in de XGBoost-compensatiemodule worden gebruikt.
Tabel 2 laat zien dat verklarende variabelen over verschillende bedrijfsdimensies duidelijk verschillende statistische vormen vertonen. Variabelen voor fysieke activa die endogene dynamiek van ondernemingsontwikkeling vertegenwoordigen, zoals onderstationcapaciteit en lijnlengte, hebben relatief stabiele standaarddeviaties en scheefheidswaarden geconcentreerd tussen 0,1 en 0,8. Hun algemene datastructuur is ongeveer normaal verdeeld, wat objectief de eigenschap van een gestage ontwikkeling van het elektriciteitsnet in de cyclus van infrastructuurconstructie weerspiegelt. In scherp contrast hiermee staan de meteorologische variabelen en externe omgevingsstoringsvariabelen onderaan de tabel. Bijvoorbeeld, het cumulatieve aantal dagen met een waarschuwingsniveau voor hoge temperaturen over de afgelopen 90 dagen en de impactindex voor lijnuitschakelingen vertonen een extreem sterke rechtsscheefheid, met scheefheidswaarden van respectievelijk 2,15 en 2,45. Deze typische heavy-tailed distributie bevestigt een objectief pijnpunt dat in de werkelijke exploitatie en het onderhoud van het elektriciteitsnet niet genegeerd kan worden: hoewel extreme weersomstandigheden relatief zelden voorkomen over een jaarlijkse tijdlijn, veroorzaken ze zodra ze optreden vaak exponentiële stijgingen in de inzet van reparatiearbeid en het verbruik van reserveonderdelen. Vanuit een ander perspectief onthullen de hoge nonuniformiteit en extreme-waarde scheefheid in de distributie van deze multi-source kenmerken de theoretische beperkingen van traditionele lineaire tijdreeksmodellen, zoals ARIMAX, die gebaseerd zijn op aannames van normaliteit en homoscedasticiteit bij het traceren van complexe kosten van het elektriciteitsnet. Dit bevestigt niet alleen verder de rationaliteit van het introduceren van een machine learning-module buiten de fysieke boekhoudkundige basislijn, maar biedt ook solide statistische ondersteuning voor de keuze van het XGBoost-boommodel in dit artikel, dat efficiënt om kan gaan met ijle kenmerkdistributies en niet-lineaire mappings om kostenresiduen te benaderen.
Opzet van het systeem voor hyperparameteroptimalisatie en evaluatie
Na het bepalen van de inputruimte van de kenmerken heeft de instelling van de modelhyperparameters direct invloed op de fitningsprestaties van het residu-benaderingsnetwerk. Aangezien het XGBoost-compensatienetwerk meerdere parameters bevat, waaronder de boomdiepte (max depth), de leersnelheid en regularisatieboetetermen, en deze parameters niet-lineaire interacties vertonen, heeft conventionele grid search niet alleen een hoge computationele complexiteit, maar neigt deze in hoogdimensionale ruimtes ook vast te lopen in lokale minima. Daarom introduceert deze studie de Tree-structured Parzen Estimator (TPE), een Bayesiaanse optimalisatiemethode, in het proces van parameteroptimalisatie. Het TPE-algoritme kan opeenvolgende bemonsteringsrichtingen dynamisch sturen met behulp van feedback van de verliesfunctie uit eerdere evaluaties. Door een posterior kernel density estimate (KDE) van de doelvariabele te construeren, wordt de zoekruimte voor parameters adaptief vernauwd, waardoor het model de globale optimale hyperparameterconfiguratie kan benaderen zonder hoge computationele kosten te maken. Het optimalisatiedoel van TPE was het minimaliseren van de RMSE van de validatie over 100 iteraties, met vroege stopzetting (early stopping) na 50 ronden zonder verbetering.
Na het voltooien van de parameteroptimalisatie op de interne validatieset, wordt in deze studie de gemiddelde absolute procentuele afwijking (MAPE) gebruikt om de relatieve afwijking in de voorspelde sequentie te kwantificeren. Dit is gedaan om de uiteindelijke prestaties van elk model objectief te evalueren op de out-of-sample testset en om te voldoen aan de kwantitatieve beoordelingsvereisten van regelgevers voor kostenverificatie. Tegelijkertijd is de root-mean-square error (RMSE) geïntroduceerd om tegemoet te komen aan de praktische behoefte om extreme fouten bij kostenvoorspellingen in de bedrijfsvoering te beheersen, door zwaardere straffen op te leggen aan grotere fouten. Tot slot kwantificeert de determinatiecoëfficiënt, R2, de algemene verklarende kracht van de regressie ten opzichte van de werkelijke variantie van het doelonderwerp.
De wiskundige definities van de indicatoren zijn als volgt:
(12)
(13)
(14)
waar
staat voor de werkelijke productie- en exploitatiekosten in periode t,
staat voor de door het model voorspelde kosten,
staat voor de gemiddelde werkelijke kosten in de teststeekproef, en N is het aantal monsters in de testset.