Forschungsartikel

Retrospektive Prognose unter Verwendung von Provinzgitterdaten und einem quotenbasierten hybriden Physikalisch-KI-Modell

22 Aufrufe

DOI:

10.3791/72395

28. August 2026

In diesem Artikel

Zusammenfassung

Diese Studie schlägt ein hybrides Kostenprognosemodell für Stromnetze vor, das physikalische Kostenquoten mit dynamischen makroökonomischen und technologischen Anpassungen sowie einer XGBoost-basierten Restkompensation kombiniert. Mit einem MAPE von 2,34 % bietet es eine Balance zwischen Genauigkeit und Interpretierbarkeit und trägt damit den Anforderungen an regulatorische Transparenz bei der Tarifgestaltung Rechnung.

Zusammenfassung

Der globale Energieübergang und die laufenden Reformen des Strommarktes erfordern, dass Stromnetzbetreiber eine zuverlässige Stromversorgung mit immer strengeren Vorgaben zu Übertragungs- und Verteiltarifen in Einklang bringen. Traditionelle Budgetierungsverfahren, die auf historischen Extrapolationen basieren, spiegeln oft nicht die physikalische Grundlage des Anlagenbetriebs wider, während datengetriebene maschinelle Lernmodelle eine hohe Vorhersagegenauigkeit erreichen, aber an Transparenz mangeln, die für die regulatorische Kostenprüfung erforderlich ist. Um den Kompromiss zwischen Vorhersagegenauigkeit und Interpretierbarkeit zu überwinden, schlägt diese Studie ein hybrides Kostenprognosemodell auf Basis von Kostenkontingenten vor. Der Ansatz verwendet standardisierte Betriebskontingente als physikalische Budgetierungsgrundlage und integriert einen dynamischen Mechanismus zur Weiterentwicklung der Kontingente, der von makroökonomischen Bedingungen und technologischem Fortschritt gesteuert wird. Extreme Gradient Boosting (XGBoost) wird eingesetzt, um nichtlineare Residuen jenseits der kontingentbasierten Schätzungen abzubilden, während SHAP (Shapley Additive exPlanations) zur Interpretation des Beitrags wesentlicher Kostenfaktoren verwendet wird. Das Modell wurde anhand von 16 Jahren anonymisierter Betriebsdaten eines Provinzstromnetzes in China evaluiert. Es erreichte einen mittleren absoluten prozentualen Fehler (MAPE) von 2,34 % und reduzierte die Prognosefehler um 61,8 %, 46,6 % bzw. 34,1 % im Vergleich zu SARIMAX-, eigenständigen XGBoost- und Attention-LSTM-Modellen. Der vorgeschlagene Ansatz verbindet ingenieurtechnische Kostenkontingentprinzipien mit erklärbarer künstlicher Intelligenz und liefert sowohl genaue langfristige Kostenprognosen als auch ein transparentes Entscheidungsunterstützungsinstrument für die regulatorische Genehmigung von Kosten.

Einleitung

Der globale Energiewandel verändert das Anlagenmanagement und die Betriebspraktiken von Stromnetzen durch die Integration verteilter erneuerbarer Erzeugung, zunehmende Extremwetterereignisse und den flächendeckenden Einsatz von IoT-Technologien, wodurch insgesamt eine größere betriebliche Flexibilität und mehr Wartungsressourcen erforderlich sind, um die Systemzuverlässigkeit sicherzustellen1,2. Gleichzeitig haben die Stromregulierungsbehörden die Aufsicht über Übertragungs- und Verteiltarife durch Rahmenbedingungen wie das britische RIIO-Modell und die Renditeprüfungen der US Federal Energy Regulatory Commission verstärkt und dabei die Transparenz bei der Kostenrechtfertigung betont3. Auch China hat einen Regulierungsmechanismus nach dem Prinzip „zugelassene Kosten plus angemessene Rendite“ eingeführt, der von den Energieversorgungsunternehmen verlangt, klare Zusammenhänge zwischen technischen Maßnahmen und finanziellen Aufwendungen nachzuweisen4. Viele Versorger verfügen jedoch häufig über keine transparenten quantitativen Werkzeuge, die physische Anlagenbetriebsdaten mit Kostenvorhersagen verknüpfen, was die Wirksamkeit der regulatorischen Kostenüberprüfung einschränkt5.

Bestehende Prognoseansätze weisen in diesem Umfeld wichtige Einschränkungen auf6. Traditionelle Methoden, darunter inkrementelle Budgetierung und ARIMA-basierte Modelle, gehen von relativ stabilen historischen Mustern aus und erzielen bei strukturellen Veränderungen, die durch wirtschaftliche Schwankungen oder extreme Wetterbedingungen verursacht werden, häufig schlechte Ergebnisse7. Im Gegensatz dazu bieten moderne maschinelle Lernmodelle wie LSTM- und Transformer-Architekturen eine hohe Vorhersagegenauigkeit für kurzfristige Prognosen, weisen jedoch die für regulatorische Entscheidungsfindung erforderliche ingenieurstechnische Interpretierbarkeit nicht auf8,9. Obwohl neuere hybride Prognoseansätze statistische Verfahren mit Techniken des maschinellen Lernens kombinieren, wird dabei in der Regel die standardisierte ingenieurstechnische Kostenkalkulation, die den Buchhaltungssystemen von Stromnetzen zugrunde liegt, außer Acht gelassen10. Um diese Einschränkungen zu überwinden, schlägt diese Studie einen quotenbasierten hybriden Prognoseansatz vor, der die dynamische Entwicklung von Quoten mit einer auf maschinellem Lernen basierenden Residualkorrektur verbindet und dabei die ingenieurstechnische Interpretierbarkeit erhält, gleichzeitig aber die Prognosegenauigkeit verbessert.

Eine wichtige Forschungsrichtung ergibt sich aus der Anreizregulierung in natürlichen Monopolbranchen, einschließlich des britischen RPI-X-Mechanismus und des chinesischen Rahmens zur Überprüfung zulässiger Kosten11. Diese Studien bewerten die betriebliche Effizienz hauptsächlich mithilfe der Data Envelopment Analysis (DEA) und der Stochastic Frontier Analysis (SFA)12. Bisherige Untersuchungen haben langfristige Zusammenhänge zwischen Kapitalaufwendungen (CAPEX), Betriebsaufwendungen (OPEX) und Kosteneffizienz analysiert, um die Tarifregulierung zu unterstützen13,14. Obwohl diese Ansätze wertvolle makroökonomische Erkenntnisse liefern, werden ihre Ergebnisse in der Regel als relative Effizienzwerte und nicht als monetäre Prognosen dargestellt, die für die jährliche Budgetplanung geeignet wären15,16. Darüber hinaus setzen Grenzmodellansätze im Allgemeinen relativ stabile physische Anlagenstrukturen und Betriebsbedingungen voraus, was ihre Fähigkeit einschränkt, plötzliche Kostenänderungen infolge von Anlagenalterung, Infrastrukturaustausch oder schnellem Nachfragewachstum abzubilden17,18.

Eine zweite Forschungsrichtung konzentriert sich auf statistische und auf künstlicher Intelligenz basierende Prognosemodelle. Frühe Studien verwendeten multiple lineare Regression sowie Modelle mit autoregressiver Integration und gleitendem Durchschnitt mit exogenen Variablen (ARIMAX) zur Kostenprognose19. In jüngerer Zeit haben Support-Vektor-Regression, Zufallswälder, XGBoost, LSTM- und Transformer-Modelle die Prognosegenauigkeit deutlich verbessert, indem sie nichtlineare Zusammenhänge und hochdimensionale Merkmalsräume ausnutzen20,21,22. Diese Ansätze integrieren häufig makroökonomische Indikatoren wie den Stromverbrauch, Erzeugerpreisindizes (PPI) und klimatische Variablen23. Die Betriebskosten von Stromnetzen ergeben sich jedoch aus ingenieurtechnischen Tätigkeiten, dem Verschleiß von Anlagen, der Wartungsplanung und Managemententscheidungen und nicht allein aus makroökonomischen Variablen24. Daher wirken rein datengetriebene Modelle oft wie „Black Boxes“, was die Erklärung prognostizierter Kosten im Rahmen behördlicher Prüfungen oder der Überprüfung genehmigter Kosten erschwert25,26.

Das Management von Ingenieurkostenquoten bietet eine mögliche Lösung für diese Herausforderung27. Die auf Aktivitäten basierende Kostenrechnung (Activity-based costing, ABC) stützt sich seit langem auf standardisierte betriebliche Quoten, um den Bedarf an Arbeitskraft, Material, Ausrüstung und Wartung für routinemäßige Netzoperationen abzuschätzen28. Große chinesische Versorgungsunternehmen haben umfassende Quotendatenbanken entwickelt, die Inspektion, Wartung, Prüfung, Reparatur und den Austausch von Geräten abdecken. Diese ingenieurtechnischen Standards werden jedoch hauptsächlich für Projektabrechnungen und Prüfungen genutzt, nicht aber für dynamische Langzeitprognosen29,30. Zudem werden Quotenstandards typischerweise nur alle paar Jahre überarbeitet, wodurch sie unzureichend auf sich ändernde Rohstoffpreise, technologische Fortschritte und veränderte Betriebspraktiken reagieren können31. Die Anwendung von Quotensystemen auf Millionen verteilter Anlagen stellt außerdem erhebliche rechentechnische Herausforderungen für Prognosen im großen Maßstab dar32.

Trotz erheblicher Fortschritte bei statistischen Prognosen, maschinellem Lernen und der Kostenmanagement-Methodik existiert bisher kein Rahmenmodell, das standardisierte ingenieurtechnische Kostenquoten, dynamische makroökonomische Anpassungen und erklärbares maschinelles Lernen effektiv in ein einheitliches Prognosemodell für die regulatorische Kostenüberprüfung integriert. Es wurde die Hypothese aufgestellt, dass die Kombination sich dynamisch weiterentwickelnder Kostenquoten mit einem XGBoost-basierten Residual-Learning-Ansatz die Genauigkeit langfristiger Prognosen verbessern kann, gleichzeitig aber die für regulatorische Entscheidungsfindung erforderliche ingenieurtechnische Transparenz bewahrt. Um diese Hypothese zu überprüfen, wurde ein hybrides, quotenbasiertes Prognosemodell entwickelt, das physikalisches Kostenmodellieren, Mechanismen zur makroökonomischen und technologischen Anpassung, XGBoost-basierte Kompensation von Residuen sowie die Modellinterpretation mittels SHAP integriert. Der vorgeschlagene Ansatz zielt darauf ab, sowohl genaue langfristige Kostenprognosen als auch transparente Belege zur Unterstützung der Überprüfung genehmigter Kosten im Rahmen der modernen Elektrizitätsmarktregulierung bereitzustellen.

Protokoll

Diese Studie verwendete anonymisierte Betriebs- und Finanzdaten, die von einem Provinz-Stromnetz in Ostchina gesammelt wurden. Alle Daten wurden vor der Analyse aggregiert und anonymisiert, und es wurden keine personenbezogenen oder sensiblen individuellen Informationen einbezogen. Daher war keine ethische Genehmigung erforderlich. Der Zugriff auf die Daten und deren Analyse erfolgten in Übereinstimmung mit den geltenden Datenschutzvorschriften und institutionellen Vereinbarungen zur Regelung von Informationen im Stromsektor.

Überblick über den Prognoseansatz

Um physikbasierte und datengetriebene Prognoseansätze zu verbinden, wurde ein hybrider Prognoserahmen entwickelt, der ingenieurtechnische Kostenansätze mit maschinellem Lernen kombiniert. Anstatt lediglich mehrere Algorithmen zusammenzuführen, folgt der Rahmen dem Prinzip, dass physikalische Modelle die Basisprognose liefern, während maschinelles Lernen die verbleibenden Fehler ausgleicht. Diese Gestaltung stellt sicher, dass der Prognoseprozess auf den physikalischen Mechanismen beruht, die den Erzeugungs- und Betriebsabläufen im Stromnetz zugrunde liegen, anstatt allein auf der Extrapolation historischer Kosten.

Der Rahmen schafft zunächst eine hierarchische Zuordnung zwischen Anlagen des Stromnetzes, standardisierten Betriebsaktivitäten und finanziellen Kostenstellen. Produktions- und Betriebskosten werden als monetäre Darstellung der Ressourcen betrachtet, die von physischen Anlagen – einschließlich Umspannwerken, Übertragungsleitungen, Verteilungssträngen, Messgeräten und digitalen Inspektionsgeräten – bei routinemäßigen Tätigkeiten wie Inspektion, Wartung, Prüfung, Reparatur und Ersetzung verbraucht werden. Kostenkontingente dienen als Verbindung zwischen messbaren technischen Arbeitsmengen und den entsprechenden finanziellen Ausgaben.

Wie in Abbildung 1 veranschaulicht, fungieren Kostenkontingente als standardisierte Recheneinheiten, die in den gesamten Betriebs- und Wartungsprozess von Vermögenswerten integriert sind, anstatt als abstrakte finanzielle Zuweisungsregeln. Arbeitseinsätze auf unterster Ebene der Vermögenswerte werden in standardisierte Betriebskontingente umgewandelt und anschließend Kostenkategorien zugeordnet, darunter Arbeitskraft, Materialien, Baumaschinen, ausgelagerte Dienstleistungen und Notfallvorräte. Diese hierarchische Zuordnung erhält die ingenieurstechnische Interpretierbarkeit und behördliche Nachvollziehbarkeit während des Prognoseprozesses bei und bildet die physikalische Grundlage für die Erstellung des statischen Basis-Kontingentmodells.

Überblick über den methodischen Arbeitsablauf

Der vorgeschlagene Prognoseansatz umfasst drei aufeinanderfolgende Stufen: (1) die Erstellung einer physikalischen Basislinie anhand von Workload-Quoten auf Asset-Ebene, (2) die dynamische Anpassung der Kostenquoten durch makroökonomische und technologische Korrekturen und (3) eine auf maschinellem Lernen basierende Restkompensation zur Erfassung systematischer nichtlinearer Effekte. Wie in Abbildung 1 veranschaulicht, schafft der Ansatz eine hierarchische Zuordnung von Assets und standardisierten Betriebsaktivitäten auf unterster Ebene hin zu Prognosen für Produktions- und Betriebskosten. Die Implementierungsdetails jeder Stufe werden in den folgenden Unterkapiteln beschrieben.

Physikalisches Basiskostenmodell basierend auf werksspezifischen Arbeitslasten

Die Erzeugungs- und Betriebskosten eines Stromnetzes, Ctotal, umfassen Ausgaben, die mit mehreren geschäftlichen Aktivitäten verbunden sind, darunter der Betrieb von Umspannwerken, die Wartung von Übertragungsleitungen, das Management von Verteilnetzen, Kundenservice und unterstützende Systeme. In dieser Studie wird angenommen, dass die grundlegenden Betriebskosten durch die Arbeitslast bestimmt werden, die durch jede standardisierte Betriebsaktivität erzeugt wird, sowie durch die entsprechende Kostenquote.

Die statische Grundkosten werden wie folgt berechnet:

Mathematische Formel zur Berechnung von C_base,t mit Summationssymbolen; verwendet in der Datenanalyse.   (1)

wobei Vi,k,t die mit der i-ten Anlage oder Betriebsaufgabe innerhalb der Geschäftskategorie k im Zeitraum t verbundene Arbeitslast bezeichnet und Qi,k die entsprechenden standardisierten Stückkosten darstellt, die durch das ingenieurtechnische Kostenquotensystem festgelegt sind. Die Geschäftskategorie umfasst wesentliche Betriebsfunktionen wie die Unterhaltsarbeiten an Umspannwerken, die Inspektion von Übertragungsleitungen, den Betrieb des Verteilnetzes und den Kundenservice. Die Doppelsumme aggregiert die Kosten aller standardisierten betrieblichen Aktivitäten, um den theoretischen Grundbedarf an Ausgaben abzuschätzen, der erforderlich ist, um den normalen Netzbetrieb aufrechtzuerhalten.

Gleichung (1) stellt den physikalischen Zusammenhang zwischen technischen Arbeitslasten und finanziellen Ausgaben her, indem standardisierte Betriebsaktivitäten direkt Kostenkonten zugeordnet werden. Im Gegensatz zu rein statistischen Prognosemodellen bietet diese Formulierung eine interpretierbare technische Grundlage, die als Fundament für nachfolgende dynamische Kontingentanpassungen und eine auf maschinellem Lernen basierende Korrektur von Residuen dient. Die Gleichung wurde aus den betrieblichen Praktiken und dem Kostenkontingent-System abgeleitet, das von provinziellen Stromnetzunternehmen in China angewandt wird. Tabelle 1 fasst die in Gleichung (1) verwendete Notation zusammen, einschließlich der Arbeitslast (Vi,k,t), der standardisierten Einheitskosten (Qi,k), der Anzahl der Betriebsaufgaben (Nk) und des Geschäftssegment-Index (k).

Dynamischer Evolutionsmechanismus von Quoten unter externen Umweltstörungen

Standardisierte Kostenquoten (Qi,k) liefern eine physikalisch interpretierbare Basis, berücksichtigen jedoch keine Änderungen der makroökonomischen Bedingungen oder des technologischen Fortschritts. Um ihre Langzeitanwendbarkeit zu verbessern, wurde ein dynamischer Entwicklungsmechanismus eingeführt, um die Basisquoten als Reaktion sowohl auf Preisinflation als auch auf technologiebedingte Effizienzsteigerungen anzupassen.

Die erste Anpassung berücksichtigt Änderungen der Beschaffungskosten aufgrund makroökonomischer Inflation. Der Betrieb und die Wartung von Stromnetzen hängen stark von Massenmaterialien ab, darunter Kupfer, Aluminium und Siliziumstahl, deren Preise eng mit Schwankungen des Erzeugerpreisindex (EPI) verknüpft sind. Da Gleichung zur Berechnung des Wirtschaftsindex, die einen Preisniveauindikator, Symbol I{PPI,t}, beinhaltet. ein Index mit einem Basiswert von 100 ist, wird er zunächst in eine standardisierte Inflationsrate umgerechnet:

Preisindexformel, PPI-Berechnung, Gleichung für die Inflationsanalyse und wirtschaftswissenschaftliche Forschung.   (2)

Darauf basierend wird die Preis-Korrektur-Funktion Formel für das statische Gleichgewicht Φ(I[PPI],t), Gleichung, Physik, Gleichgewichtsprinzip, Forschungsanalyse. wie folgt definiert:

Formel für statisches Gleichgewicht, Produkt-Schreibweise, pädagogisches Mathematikkonzept, Gleichungsanalyse.   (3)

wobei Statisches Gleichgewicht, ΣF=0, MA=0; Diagramm zeigt für die Strukturanalyse ausgeglichene Kräfte, für den Bildungseinsatz. ein Lag-Gewichtsvektor der Länge L ist, der folgende Bedingung erfüllt

Formel für das statische Gleichgewicht, Σωτ=1, ωτ≥0, mathematische Gleichung für die Summationsanalyse.

Die Verzögerungsstruktur stellt die verzögerte Übertragung der makroökonomischen Inflation auf die Beschaffungskosten innerhalb der Stromnetz-Lieferkette dar. Die Umrechnung des PPI-Index in eine standardisierte Inflationsrate bewahrt den kumulativen Effekt von Preisänderungen und vermeidet gleichzeitig Skalierungsverzerrungen, die mit der direkten Verwendung von Indexwerten verbunden sind. Die Gleichungen (2) und (3) wurden aus etablierten makroökonomischen Modellen zur Inflationsanpassung übernommen, wobei die Verzögerungsstruktur auf die Beschaffungszyklen des Stromsektors kalibriert wurde33,34.

Der technologische Fortschritt wurde über einen Kostenreduktionsfaktor berücksichtigt, der Verbesserungen der betrieblichen Effizienz widerspiegelt, die sich aus Fortschritten wie der Inspektion mittels unbemannter Luftfahrzeuge, intelligenter Robotik und digitaler Wartungstechnologien ergeben. Der Technologieanpassungsfaktor ist definiert als:

Gleichung des ökonomischen Modells, Γ(E_tech,t)=1-α·ln(1+β·E_tech,t), zur Veranschaulichung des Technologiewachstums.  (4)

In diesem Teil sind α und β empirische Elastizitätskoeffizienten, die anhand historischer Paneldaten mittels nichtlinearer Kleinster-Quadrate-Schätzung ermittelt wurden. Um sicherzustellen, dass der technologische Fortschrittsfaktor stets eine plausible Verringerung der Stückkosten der Quoten darstellt, beschränkt der Parameterschätzprozess 0 < Γ(Etech,t) ≤ 1. Es ist darauf hinzuweisen, dass dieser Faktor vor allem die langfristige Effizienzsteigerung widerspiegelt, die sich aus der Substitution ausgereifter Technologien ergibt. Gleichung (4) ist neu in dieser Arbeit und übernimmt das Konzept der Lernkurve aus der Literatur zu den Kosten energietechnischer Systeme35,36 auf die Netzwartungsoperationen. Zusätzliche Kosten, die in der Anfangsphase der Einführung digitaler Geräte entstehen können, wie beispielsweise der parallele Betrieb alter und neuer Systeme, die Plattformintegration, die Kommunikationstests sowie zusätzliche Wartungsarbeiten, werden nicht zwangsläufig von der Basisquote abgezogen; stattdessen werden sie durch das nachfolgende Modul zur Kompensation von Residuen mittels maschinellen Lernens erfasst:

Formel für das stationäre Gleichgewicht, C_quota,t = C_base,t · Φ(PPI,t) · Γ(E_tech,t), Gleichungen, Analyse.  (5)

wobei Cbase,t die statische Basislastkosten bezeichnet, die aus den Arbeitsschwerpunkten der untersten Ebene und standardisierten Betriebskostenquoten berechnet werden; Formel für das statische Gleichgewicht Φ(I[PPI],t), Gleichung, Physik, Gleichgewichtsprinzip, Forschungsanalyse den Übertragungseffekt makroökonomischer Preisschwankungen auf Material-, Ausrüstungs- und Außenkostenpreise erfasst; und Γ(Etech,t) die effizienzbezogene Senkung der Einheitsbetriebs- und Wartungskosten nach Erreichen der technologischen Reife widerspiegelt. Durch den oben beschriebenen dynamischen Evolutionsmechanismus bleibt die Quotenbasis nicht länger auf einer statischen Buchhaltungsbasis, sondern kann sich adaptiv an Veränderungen in den wirtschaftlichen Rahmenbedingungen und technologischen Gegebenheiten anpassen. Gleichung (5) stammt ursprünglich aus dieser Arbeit und stellt die neuartige Integration von Preis- und Technologiekorrekturen in das Rahmenwerk der Quotenbasis dar.

Systematische nichtlineare Restmengenerfassung unter Quotenbeschränkungen

Trotz komplexer evolutionärer Korrekturen erzeugt das Quotenmodell zwangsläufig systematische Abweichungen, wenn unvorhersehbare wetterbedingte Störungen infolge von Katastrophen oder plötzliche politische Vorgaben auftreten, beispielsweise erhöhte Kosten für die Bearbeitung von Kundenreklamationen während vorübergehender Tarifsenkungsphasen. Diese Abweichung bildet das Residuum auf beiden Seiten der Gleichung:

Rt=Cactual,t-Cquota,t  (6)

Da herkömmliche physikalische Gesetze diesen Aspekt nicht erklären können, kann maschinelles Lernen diese Einschränkungen beheben. Um dem Fluch der Dimensionalität, der durch hochdimensionale Merkmale verursacht wird, entgegenzuwirken, verwendet diese Studie den XGBoost-Algorithmus, der auf Entscheidungsbaum-Ensembles basiert, um die nichtlineare Beziehung Rt37,38 zu modellieren. Es wird eine Merkmalsmatrix Xt mit starken Störungen definiert, die meteorologische Merkmale wie jährliche extreme Frosttage Dice sowie die Intensität makropolitischer Maßnahmen umfasst.

Für einen nichtlinearen Kompensator, der aus Regressionsbäumen besteht, kann die Erzeugungslogik des vorhergesagten Residuums R-Dach-Symbol für die Konvergenzanalyse, veranschaulicht statistische Methode, Formel in grafischer Form ausgedrückt werden als39:

Gradient-Boosting-Vorhersagegleichung, mathematische Formel, Σ fm(Xt), Algorithmus, Datenmodellierung   (7)

wobei F den Raum aller möglichen Klassifizierungs- und Regressionsbaumstrukturen bezeichnet. Um die Anpassungsgenauigkeit und die Verhinderung von Überanpassung auszugleichen, wird eine regularisierte Zielfunktion konstruiert und in der m-ten Iteration minimiert, die einen Strafterm für strukturelle Komplexität enthält:

Mathematische Optimierungsgleichung, die eine Summation zur Datenanalyseanpassung ausdrückt.   (8)

wobei Quantenüberlagerung Ket-Notation |0⟩, Quantenmechanik-Formel, verwendet in Physik-Diagrammen. eine konvexe Verlustfunktion ist, die den Unterschied zwischen dem tatsächlichen Rest und dem vorhergesagten Rest misst. In dieser Arbeit wird der Huber-Verlust verwendet, um die Robustheit des Modells gegenüber abnormalen Spitzenausgaben zu erhöhen. Der Regularisierungsterm Ohmsches Gesetz-Symbol; Omega-Funktion in mathematischer Gleichung; Formeldarstellung. dient zur Beschränkung der Komplexität der Baumstruktur und ist definiert als:

Optimierungsgleichung Ω(fm)=γTm+(1/2)λ||wm||^2; mathematische Formel; für Bildungszwecke   (9)

wobei Tm die Anzahl der Blattknoten im m-ten Baum darstellt, wm den entsprechenden Blattgewichtsvektor darstellt und γ und λ den Bestrafungskoeffizienten für die Anzahl der Blattknoten bzw. den Regularisierungskoeffizienten für das Gewicht bezeichnen.

Die endgültige Prognosegleichung lautet:

Ökonomisches Modellierungsgleichung, Formel zur Ressourcenallokation, Methode der Finanzanalyse, Abbildung der Gleichung.   (10)

Weitere Erweiterung als:

Dynamische Gleichung für die Quoten-Basislinie; nichtlineare Restkompensation; Formelanalysemethode.   (11)

Die obige Formel stellt mathematisch die geschlossene Struktur des vorgeschlagenen Prognosemodells dar. Die endgültige Nachfrage nach Produktions- und Betriebskosten wird nicht direkt vom maschinellen Lernmodell erzeugt, sondern ergibt sich durch Überlagerung der durch das Modul des maschinellen Lernens identifizierten nichtlinearen Restkompensation auf die dynamische Mengenrahmenbasis. Dabei spiegeln die Faktoren Preis und Technologie hauptsächlich die dynamische Entwicklung der Mengenrahmenbasis wider, während Faktoren, die sich nur schwer explizit durch Regeln beschreiben lassen – wie Klimastöße, politische Störungen und plötzliche Anstiege von Reparaturereignissen – durch das Modul zur Restkompensation mittels maschinellem Lernen erfasst werden. Die Gleichungen (10) und (11) sind neu in dieser Arbeit und verbinden die physikalische Basislinie mit der auf maschinellem Lernen basierenden Erfassung von Residuen zu einem einheitlichen Prognoserahmenwerk.

Abbildung 2 zeigt, dass die Prognoseergebnisse des vorgeschlagenen Modells eine klare hierarchische Generierungslogik aufweisen. Einerseits bietet die Baseline-Quote eine stabile, transparente und überprüfbare physikalische Grundlage für die Kostennachfrage; andererseits ermöglichen Preisänderungen, technologische Effekte und Restgrößen externer Schocks dem Modell, sich an dynamische Veränderungen unter komplexen Umweltbedingungen anzupassen. Im Vergleich zu Black-Box-Modellen, die direkt prognostizierte Werte ausgeben, kann diese dekomponierte Struktur klar aufzeigen, „warum Kosten steigen oder fallen“, wodurch die Interpretierbarkeit der Modelleergebnisse bei der Haushaltsprüfung sowie bei der Regulierung von Netznutzungsentgelten verbessert wird.

Datenquellen und Sammelverfahren

Theoretische Modelle müssen durch empirische Daten streng validiert werden, um ihre praktische Nützlichkeit nachzuweisen. Da die Kernfinanzdaten des Stromsektors sensible Informationen zu den Betriebsabläufen nationaler Infrastrukturen enthalten, extrahiert diese Studie hochpräzise, anonymisierte monatliche Buchhaltungsdaten aus einem typischen Provinz-Stromnetz in Ostchina, das der Einfachheit halber als E-Grid bezeichnet wird, über einen Zeitraum von 16 aufeinanderfolgenden Kalenderjahren von 2010 bis 2025. Diese Provinz hat einen typischen Wirtschaftszyklus durchlaufen, der sich von einem wachstumsgetriebenen traditionellen Schwerindustrie-Modell hin zur hochwertigen Fertigung verlagert hat, wobei die durchschnittliche jährliche Wachstumsrate des Netzzellenvolumens 7,4 % erreichte. Die komplexe Entwicklung ihrer Kostenstruktur ist daher möglicherweise auch für andere sich schnell entwickelnde Netzzellen-Systeme von Bedeutung. Die Daten stammen aus drei Hauptquellen: (1) internen Betriebs- und Wartungsprotokollen, die arbeitsspezifische Lasten, Inspektionshäufigkeiten und Reparaturereignisse auf Ebene der Anlagen erfassen; (2) Finanzbuchhaltungssystemen, die monatliche Kostenberichte über Arbeitskräfte, Materialien, Ausrüstung und ausgelagerte Dienstleistungen bereitstellen; und (3) externen Umweltdatenbanken, einschließlich Wetteraufzeichnungen des Chinesischen Wetteramtes und makroökonomischer Indikatoren des Nationalen Statistikamtes.

Qualitätskontrolle und Umgang mit fehlenden Daten

Für über 130 anfängliche Indikatoren, die aus mehrquelligen Systemen integriert wurden, wurde ein strenges Verfahren zur Qualitätskontrolle angewandt. Fehlende Datenpunkte, die weniger als 3 % der Gesamtbeobachtungen ausmachten, wurden mithilfe linearer Interpolation bei kontinuierlichen Variablen mit zeitlichen Trends sowie durch Modus-Imputation bei kategorialen Indikatoren behandelt. Ausreißer wurden anhand der Interquartilsabstandsmethode (IQR) identifiziert; Werte, die das 3,0-Fache des IQR über dem dritten Quartil überschritten, wurden auf das 99. Perzentil winsorisiert, um die Datenintegrität zu bewahren und Verzerrungen durch Extremwerte zu verringern.

Überlegungen zur Stichprobengröße

Der Datensatz umfasst 192 monatliche Beobachtungen (Januar 2010–Dezember 2025), wobei 156 Beobachtungen (2010–2022) für Training und Validierung verwendet werden und 36 Beobachtungen (2023–2025) für Out-of-Sample-Tests reserviert sind. Obwohl diese Stichprobengröße für Deep-Learning-Anwendungen relativ gering ist, eignet sie sich gut für den XGBoost-Algorithmus, der speziell dafür entwickelt wurde, aufgrund seiner Regularisierungs- und Baum-Pruning-Mechanismen gut mit kleinen bis mittleren tabellarischen Datensätzen zu arbeiten. Um potenzielle Überanpassungsrisiken zu verringern, wurden (1) strenge Regularisierungsstrafen angewendet (γ = 0.1, λ = 1.0), (2) ein Early Stopping mit einer Geduld von 50 Runden und (3) konservative Beschränkungen der Baumtiefe (maximale Tiefe = 5). Diese Maßnahmen gewährleisten gemeinsam die Stabilität und Generalisierungsfähigkeit des Modells trotz der begrenzten Stichprobengröße.

Datensegmentierung und Integration heterogener Datenquellen

Für eine gründliche Überprüfung wurden die Daten von Januar 2010 bis Dezember 2022 dem Trainings-Validierungszeitraum zugeordnet, der 156 Beobachtungen umfasst und zur Schulung der Quotenentwicklungs-Faktoren sowie des Quotenausgleichs-Residualnetzwerks verwendet wird. Der Zeitraum Januar 2023–Dezember 2025 ist als separater Out-of-Sample-Testdatensatz reserviert, der 36 Beobachtungen enthält. Warum wurde dieser Zeitraum als abschließende Testphase gewählt? Der Grund liegt darin, dass diese drei Jahre mit der Beschleunigung des Aufbaus eines neuen Typs von Stromnetzsystem zusammenfielen, verstärkt durch großflächige, mit El Niño verbundene Extremereignisse mit hohen Temperaturen sowie das schnelle und ungleichmäßige Wachstum der dezentralen Erzeugung erneuerbarer Energien. Das Stromnetz stand dabei vor beispiellosem Druck hinsichtlich der Materialversorgungsketten und der Zuteilung von Reparaturpersonal.

Die wissenschaftliche Auswahl und quantitative Definition kostenbestimmender Faktoren bildet die Grundlage dafür, dass das maschinelle Lern-Residualnetzwerk systematische Schwankungen effektiv erfassen kann. Basierend auf der Managementlogik der standardmäßigen Betriebskosten in Stromnetzen durchbricht diese Studie die eindimensionale traditionelle Finanzprognose, die allein auf historischen Cashflows beruht, und rekonstruiert stattdessen das Feature-Engineering anhand von vier zentralen Dimensionen: physischer Anlagenumfang, Betriebs- und Wartungsbedingungen, makroökonomische Entwicklung sowie externes Klimaumfeld, unter Verwendung ursprünglicher Betriebsprotokolle und externer Systembuchführungen. Im eigentlichen Modellierungsprozess werden für mehr als 130 ursprüngliche Indikatoren, die aus der Integration mehrerer Quellsysteme resultieren, mittels Pearson-Korrelationstests stark kollineare, redundante Variablen mit einem Schwellenwert von |r| > 0,85 eliminiert. Auf Grundlage des Vorwissens erfahrener Stromnetzexperten werden letztendlich 42 zentrale Eingangsmerkmale ausgewählt, um die Merkmalsmatrix Xt zu bilden. Um die zugrundeliegende Datenstruktur und Verteilung des Eingabetensors klar darzustellen, wählt Tabelle 2 12 repräsentative Kernmerkmale aus den vier oben genannten Bewertungsdimensionen aus und fasst deren deskriptive Statistiken über den Beobachtungszeitraum zusammen.

Um die räumlich-topologische Grundlage des Mehrquellen-Merkmalsystems weiter zu veranschaulichen, zeigt Abbildung 3 eine anonymisierte schematische Topologie des untersuchten provincialen Stromnetzes. Die Abbildung überlagert Umspannwerke verschiedener Spannungsebenen, Übertragungskorridore, dezentrale regenerative Energieanlagen, Lastzentren sowie repräsentative Zonen umweltbedingter Störungen. Die Topologie hilft zu erklären, warum Produktions- und Betriebskosten gemeinsam von der Anlagengröße, der Netzstruktur, der Intensität von Notfallreparaturen und externen klimatischen Schocks beeinflusst werden. Zudem liefert sie eine räumliche Interpretationsgrundlage für die im XGBoost-Kompensationsmodul verwendeten residualtreibenden Variablen.

Tabelle 2 zeigt, dass erklärende Variablen aus verschiedenen Geschäftsbereichen deutlich unterschiedliche statistische Formen aufweisen. Variablen für physische Vermögenswerte, die endogene Unternehmensentwicklungsprozesse widerspiegeln, wie beispielsweise Umspannwerkskapazität und Leitungslänge, weisen relativ stabile Standardabweichungen auf, und ihre Schiefe-Werte liegen konzentriert zwischen 0,1 und 0,8. Ihre gesamte Datenstruktur ist annähernd normalverteilt und spiegelt objektiv das Merkmal einer stabilen Stromnetzentwicklung im Infrastrukturbauzyklus wider. Im starken Gegensatz dazu stehen die meteorologischen und externen Umweltstörvariablen am unteren Ende der Tabelle. Beispielsweise weisen die kumulierte Anzahl von warnstufenrelevanten Hitzetagen der letzten 90 Tage sowie der Leitungsabschaltungs-Impakt-Index eine extrem starke Rechtsschiefe auf, mit Schiefe-Werten von 2,15 bzw. 2,45. Diese typische Verteilung mit schwerem Tail bestätigt einen nicht zu vernachlässigenden, objektiven Engpass in der praktischen Betriebs- und Instandhaltung von Stromnetzen: Obwohl extreme Wetterereignisse im Jahresverlauf relativ selten auftreten, führen sie bei Eintreten oft zu exponentiellen Anstiegen beim Arbeitsaufwand für Reparaturen und beim Verbrauch von Ersatzteilen. Aus einer anderen Perspektive offenbaren die hohe Inhomogenität und die Extremwertschiefe in der Verteilung dieser multimodalen Merkmale die theoretischen Grenzen traditioneller linearer Zeitreihenmodelle wie ARIMAX, die auf den Annahmen der Normalverteilung und Homoskedastizität basieren, wenn es darum geht, komplexe Stromnetzkosten nachzuvollziehen. Dies unterstreicht nicht nur weiter die Rationalität, ein maschinelles Lernmodul über die physische Buchhaltungsbasis hinaus einzuführen, sondern liefert auch fundierte statistische Argumente für die in dieser Arbeit getroffene Auswahl des XGBoost-Baummodells, das in der Lage ist, spärliche Merkmalsverteilungen und nichtlineare Abbildungen effizient zu verarbeiten, um Kostenresiduen zu approximieren.

Einrichtung des Hyperparameter-Optimierungs- und Evaluierungssystems

Nach der Bestimmung des Merkmals-Eingaberaums beeinflusst die Festlegung der Modell-Hyperparameter direkt die Anpassungsgüte des Residual-Approximationsnetzwerks. Da das XGBoost-Kompensationsnetzwerk mehrere Parameter umfasst – darunter die Baumtiefe (max depth), die Lernrate und Regularisierungsstrafterme – und diese Parameter nichtlineare Wechselwirkungen aufweisen, weist die herkömmliche Gitterrastersuche (Grid Search) nicht nur eine hohe Rechenkomplexität auf, sondern neigt zudem dazu, in hochdimensionalen Räumen in lokalen Minima stecken zu bleiben. Daher führt diese Studie den Tree-structured Parzen Estimator (TPE), ein bayessches Optimierungsverfahren, in den Parameterabstimmungsprozess ein. Der TPE-Algorithmus kann mithilfe von Rückmeldungen der Verlustfunktion aus vorherigen Bewertungen die nachfolgenden Stichprobenrichtungen dynamisch steuern. Durch die Erstellung einer posterioren Kerndichteschätzung (KDE) der Zielvariablen verengt er adaptiv den Parameter-Suchraum, wodurch das Modell die global optimale Hyperparameter-Konfiguration annähern kann, ohne hohe Rechenkosten zu verursachen. Das Optimierungsziel von TPE bestand darin, den Validierungs-RMSE über 100 Iterationen zu minimieren, mit einer vorzeitigen Beendigung nach 50 Runden ohne Verbesserung.

Nach der Parameteroptimierung anhand des internen Validierungssatzes erfolgt zur objektiven Bewertung der endgültigen Leistung jedes Modells auf dem Out-of-Sample-Testdatensatz und zur Erfüllung der regulatorischen Anforderungen an die quantitative Bewertung der Kostenverifizierung die Verwendung des mittleren absoluten prozentualen Fehlers (MAPE), um die relative Abweichung der vorhergesagten Sequenz zu quantifizieren. Gleichzeitig wird zur Berücksichtigung des praktischen Bedarfs, extreme Fehler bei der Kostenprognose im Betrieb zu kontrollieren, der Root-Mean-Square-Fehler (RMSE) hinzugezogen, der größere Abweichungen stärker bestraft. Schließlich quantifiziert das Bestimmtheitsmaß R2 die gesamte Erklärungskraft der Regression im Verhältnis zur tatsächlichen Zielvarianz.

Die mathematischen Definitionen der Indikatoren lauten wie folgt:

Formel für den mittleren absoluten prozentualen Fehler (MAPE); statistische Analyse; Berechnung der Fehlermessung.   (12)

Gleichung des mittleren quadratischen Fehlers (RMSE); statistische Fehlermessung; Formelabbildung.    (13)

R²-Formel für die statistische Regressionsanalyse; Gleichungsdiagramm zur Beurteilung der Datenanpassungsgenauigkeit   (14)

wobei Gleichung der dynamischen Fließspannung, C_aktuell,t, Symbol in mathematischer Gleichung, Werkstoffmechanik. die tatsächlichen Produktions- und Betriebskosten im Zeitraum t darstellt, Gleichung der Gesamtkonzentration mit Dächern, \( \hat{C}_{total,t} \), im Kontext der wissenschaftlichen Analyse. die vom Modell vorhergesagten Kosten darstellt, Vektornotation-Gleichung, C_aktuell, mit Pfeil über dem C, relevant für physikalische Konzepte. die durchschnittlichen tatsächlichen Kosten in der Teststichprobe darstellt und N die Anzahl der Proben im Testdatensatz ist.

Ergebnisse

Vergleich der Vorhersagegenauigkeit in panaromatisch reduzierter Dimension

Als alle mit dem baumstrukturierten Parzen-Schätzer (TPE) optimierten Modelle auf dem außerhalb der Stichprobe liegenden Testdatensatz aus den Jahren 2023–2025 bewertet wurden, der Erholungsschwankungen nach der Pandemie sowie Extremereignisse mit sehr hohen Temperaturen umfasste, konnte die Leistungsfähigkeit gängiger Prognosealgorithmen objektiv verglichen werden. Zur strengen und umfassenden Bewertung wurden vier Benchmark-Modelle einbezogen, die unterschiedliche methodische Ansätze repräsentieren: die traditionelle exponentielle Glättung als Vertreter konventioneller Finanzprognosen; SARIMAX als Vertreter linearer saisonaler Zeitreihenmodelle; die eigenständige XGBoost-Regression als Vertreter eines rein datengetriebenen Ansatzes ohne Quotenbeschränkungen; sowie Attention-LSTM, ein attention-verbessertes Long-Short-Term-Memory-Netzwerk, das weithin für die Prognose langer Sequenzen verwendet wird.

Wie in Tabelle 3 dargestellt, übertraf das vorgeschlagene Quota-ML-Modell alle Vergleichsmodelle bei der Prognose von Produktions- und Betriebskosten im außerhalb der Stichprobe liegenden Zeitraum 2023–2025. Das Modell erreichte eine MAPE von 2,34 % und verringerte damit den Prognosefehler um 61,8 % im Vergleich zu SARIMAX (6,12 %) und um 34,1 % gegenüber dem Attention-LSTM-Modell (3,55 %). Sein RMSE (15,69 Millionen CNY) und MaxAE (23,05 Millionen CNY) waren weniger als halb so hoch wie die des nächstbesten neuronalen Netzwerks, während ein R2-Wert von 0,957 darauf hindeutet, dass das Modell mehr als 95 % der Varianz der beobachteten Kosten erklärt. Diese Ergebnisse zeigen, dass die Integration von ingenieurgebundenen Kostenquoten, dynamischer Quotenentwicklung und XGBoost-basierter Residualkompensation die Prognosegenauigkeit und -robustheit im Vergleich zu traditionellen Zeitreihenmethoden und rein datengetriebenen Modellen erheblich verbessert.

Wie in Abbildung 4 dargestellt, zeigten die tatsächlichen Produktions- und Betriebskosten deutliche saisonale Schwankungen sowie mehrere ausgeprägte Hochphasen während des Testzeitraums. Insbesondere stiegen die Kosten während der extremen Hitzephasen im Juli und August 2024 stark an. Obwohl das Attention-LSTM-Modell den allgemeinen saisonalen Trend erfasste, waren seine Vorhersagen relativ glatt und unterschätzten plötzliche Kostenanstiege, die mit Notreparaturen, starker Beanspruchung von Geräten und erhöhtem Verbrauch von Notfallmaterialien verbunden waren. Das eigenständige XGBoost-Modell reagierte effektiver auf lokale Schwankungen, wies jedoch in mehreren Monaten Abweichungen von der beobachteten Kurve auf, da ihm ingenieurtechnische Quotenbeschränkungen fehlten. Im Gegensatz dazu verfolgte das vorgeschlagene Quota-ML-Modell während des gesamten Testzeitraums genau die beobachtete Kostenentwicklung und reproduzierte sowohl den Kostenanstieg im Sommer 2024 als auch den sekundären Sommerspitzenwert 2025 korrekt.

Die überlegene Leistung des Quota-ML-Modells zeigt den Vorteil der Kombination von ingenieurtechnischen Kostenquoten mit einer auf maschinellem Lernen basierenden Restfehlerkorrektur. Die dynamische Quoten-Basis bietet eine physikalisch interpretierbare Grundlage, die die Entwicklung von Stromnetz-Assets und betrieblichen Arbeitslasten widerspiegelt und ein unbeschränktes Lernen aus begrenzten finanziellen Zeitreihendaten verhindert. Das Restfehler-Kompensationsnetzwerk konzentriert sich anschließend auf nichtlineare Störungen, die allein mit ingenieurtechnischen Quotenregeln nur schwer darstellbar sind, wie meteorologische Ereignisse, plötzliche Anstiege bei Wartungsaufträgen und politisch bedingte Änderungen. Folglich erzielte das vorgeschlagene Modell den niedrigsten MAPE- und RMSE-Wert unter allen evaluierten Methoden (Tabelle 3) und ermöglichte die präziseste Nachverfolgung saisonaler Kostenhöchststände und extremer Ereignisse (Abbildung 4), was seine Eignung für die langfristige Prognose von Produktions- und Betriebskosten belegt.

Validierung der Ablation zentraler architektonischer Komponenten

In einem komplexen hybriden Framework, das aus geschachtelten Untermodulen besteht, konzentriert sich die zentrale akademische Überprüfung gewöhnlich darauf, ob das Modell unter einer „Überkonstruktion“ leidet. Es ist notwendig, interne Ablationsstudien durchzuführen, bei denen Kernkomponenten entfernt werden, um die tatsächlichen Wechselbeziehungen und den Beitrag jedes einzelnen Moduls zu untersuchen. Diese Studie definiert zwei Degradationspfade für die Architektur. Erstens Struktur A, bei der der Mechanismus der dynamischen Entwicklung entfernt wird: Die Quoten-Basislinie wird zwangsweise auf frühere statische physikalische Standards beschränkt, wodurch die Einflüsse der makroökonomischen Inflationsakkumulation und der Deflationseffekte des technologischen Fortschritts der letzten Jahre ausgeschlossen werden; lediglich die historische statische Basislinie Gleichgewichts-Statikgleichungen, C_base,t; mathematische Formel für Stabilität; pädagogisches Diagramm. wird mit dem Residualnetzwerk verbunden. Zweitens Struktur B, bei der das nichtlineare Residual-Tracking-Modul entfernt wird: Das Modell degeneriert vollständig zu einem versicherungsmathematischen Ansatz, wobei die KI-gestützte Schleife zur Erfassung zufälliger Schwankungen unterbrochen wird und direkt der reine dynamische Quotenberechnungswert Chromatographie-Gleichung, C_quota,t, spektrale Anpassungsanalyse, wissenschaftliches Forschungsdiagramm., nach Korrektur durch makroökonomische Umweltfaktoren, als Endausgabe verwendet wird. Das Verhältnis des Erklärungsvarianz-Verlusts wird basierend auf dem relativen Rückgang von R2 zwischen dem vollständigen Modell und dem degradierten Modell berechnet und wie folgt definiert:

Formel für den Erklärten Varianzverlust; statistische Analyse; Methode zur Berechnung von R²; Dateninterpretation   (15)

Tabelle 4’s Eine Ablationsstudie zeigt, dass beide Komponenten des vorgeschlagenen Frameworks signifikant zur Vorhersagegenauigkeit beitragen, wobei die maschinelle Lern-Kompensation der Residuen eine entscheidendere Rolle spielt. Der Wegfall des Mechanismus zur dynamischen Entwicklung von Preis und Technologie (Variante A) erhöht die MAPE auf 4,15 % (eine Verschlechterung um 1,81 Prozentpunkte) und verringert das R2 auf 0,837, wodurch 12,5 % weniger Varianz erklärt werden als im vollständigen Modell. Im Gegensatz dazu führt die Eliminierung der ML-Restkompen­sation (Variante B) zu einem deutlich stärkeren Anstieg: Der MAPE steigt auf 5,62 % (+3,28 Prozentpunkte), R2 sinkt auf 0,686, und das Verhältnis des erklärten Varianzverlusts erreicht 28,3 %. Diese Ergebnisse zeigen, dass zwar die dynamische Quotenaktualisierung die Baseline-Genauigkeit verbessert, die auf XGBoost basierende Residualkorrektur jedoch unverzichtbar ist, um nichtlineare Kostenfaktoren zu erfassen; zusammen bilden sie eine synergistische hybride Architektur.

Um den Vergleich der Modellleistung über die Ablationsexperimente hinweg zu erleichtern, wurde ein normalisiertes Radardiagramm erstellt, um fünf Evaluierungsmetriken zu visualisieren: MAPE, RMSE, R2, MaxAE und Robustheit. Fehlerbasierte Metriken (MAPE, RMSE und MaxAE) wurden invers normalisiert, sodass geringere Fehler höheren Bewertungen entsprechen, während positive Metriken (R2 und Robustheit) normalisiert wurden, sodass höhere Werte höheren Bewertungen entsprechen. Nach der Normalisierung stellen alle Indikatoren vergleichbare Leistungswerte dar, wobei Werte, die näher an der äußeren Grenze liegen, eine überlegene Gesamtleistung anzeigen.

Wie in Abbildung 5 gezeigt, erzielte das vollständige Quota-ML-Modell über alle fünf Leistungsdimensionen hinweg durchweg hohe Werte und bildete damit das größte und ausgewogenste Radarprofil. Dieses Ergebnis zeigt, dass der vorgeschlagene Ansatz eine wirksame Balance zwischen der Kontrolle relativer Fehler, der Gesamtvorhersagegenauigkeit, der Erklärungskraft, der Unterdrückung extremer Fehler und der Robustheit unter wechselnden Betriebsbedingungen bietet.

Im Gegensatz dazu wies Variante A, die den Mechanismus der dynamischen Quotenanpassung ausschloss, jedoch die auf maschinellem Lernen basierende Restkompensation beibehielt, eine deutliche Verringerung der Gesamtleistung auf. Dieses Ergebnis legt nahe, dass eine statische Quotenbasis allein strukturelle Veränderungen aufgrund von Rohstoffpreisschwankungen und technologischem Fortschritt nicht ausreichend berücksichtigen kann. Noch stärker fiel der Leistungsabfall bei Variante B aus, bei der das Modul für die Restkompensation entfernt wurde und die Prognose allein auf der dynamischen Quotenbasis basierte. In diesem Fall verschlechterte sich die Leistung erheblich, insbesondere bei fehlerbezogenen Metriken und der Robustheit.

Wie in Tabelle 4 zusammengefasst, stieg der MAPE von Variante B von 2,34 % für das vollständige Modell auf 5,62 %, was einer Erhöhung um 3,28 Prozentpunkte entspricht, während der R2-Wert um 28,3 % sank. Diese Ergebnisse zeigen, dass das dynamische Quotenmodell, obwohl es makroökonomische Inflation und technologiebedingte Effizienzverbesserungen berücksichtigt, plötzliche Kostenänderungen, die mit extremen Wetterbedingungen, Notfallwartungen, politischen Änderungen und abnormalen Betriebszuständen verbunden sind, nicht vollständig erfassen kann.

Insgesamt zeigt die Ablationsanalyse, dass beide Hauptkomponenten des vorgeschlagenen Frameworks unerlässlich sind. Der Mechanismus der dynamischen Quotenanpassung passt die ingenieurtechnische Basislinie an Veränderungen der makroökonomischen Bedingungen und des technologischen Fortschritts an, während das Modul für die kompensatorische maschinelle Lernung nichtlineare Abweichungen erfasst, die durch ingenieurtechnische Quotenregeln nicht explizit abgebildet werden können. Zusammen bilden diese komplementären Komponenten ein integriertes Prognoseframework, das eine physikalisch interpretierbare Quotenbasislinie mit datengestütztem Lernen der Residuen kombiniert, um genaue und robuste Langzeitkostenprognosen zu ermöglichen.

Überprüfbarkeit der Validierung des Restkompensationsmodells

Obwohl der Vergleich der Vorhersagegenauigkeit und Ablationsexperimente die Bedeutung des Machine-Learning-Residualkompensationsmoduls gezeigt haben, können Fehlermetriken allein nicht bestimmen, ob die erfassten nichtlinearen Beziehungen sinnvolle physikalische oder betriebliche Interpretationen besitzen. Daher wurde SHAP (Shapley Additive exPlanations) angewendet, um das XGBoost-Residualmodell40 zu interpretieren. SHAP wird häufig zur Erklärung von Machine-Learning-Modellen in der Leistungs- und Energieprognose sowie in verwandten komplexen Systemen verwendet41,42. Indem SHAP den Beitrag jeder Eingangsgröße für die Modellvorhersagen quantifiziert, ermöglicht es die Beurteilung, ob die erlernten Residualmuster mit ingenieurtechnischem Wissen übereinstimmen.

Wie in Abbildung 6 gezeigt, wiesen externe Störvariablen – darunter die kumulative Anzahl von warnstufenrelevanten Hochtemperaturtagen während der vorangegangenen 90 Tage, der index für schwerwiegende konvektive Ereignisse und typhoonbedingte Leitungsausfälle, die Dauer von Glatteis- und Schneefallperioden sowie die Anzahl ungeplanter Reparaturereignisse – starke positive SHAP-Werte auf. Proben mit hohen Werten dieser Variablen konzentrierten sich im positiven SHAP-Bereich, was darauf hinweist, dass extremer Wettereinfluss und Notfallwartungsmaßnahmen die tatsächlichen Kosten über die dynamische Sollkostenbasis hinaus konstant erhöhten. Diese Ergebnisse zeigen, dass das Residualkompensationsmodul aussagekräftige umweltbedingte und betriebliche Störungen erfasst, anstatt lediglich zufälliges Rauschen anzupassen.

Mehrere zusätzliche Variablen, darunter die Dauer des Betriebs unter hoher Last, der Metallpreisindex für PPI, der Anteil der digitalen Investitionen, die installierte Kapazität verteilter Photovoltaikanlagen und die Länge der Übertragungsleitungen, trugen ebenfalls erheblich zu den verbleibenden Vorhersagen bei. Diese Ergebnisse zeigen, dass Abweichungen von der Quotenbasis gemeinsam durch kurzfristige Wetterereignisse, Vermögensausbau, die Weitergabe von Rohstoffpreisen, die Umgestaltung des Stromsystems und die Digitalisierung beeinflusst werden. Insbesondere trug der Anteil der digitalen Investitionen bei einigen Beobachtungen positiv zu den verbleibenden Kosten bei, was darauf hindeutet, dass eine Digitalisierung im Anfangsstadium die Ausgaben vorübergehend aufgrund der Systemintegration, des Plattformbetriebs und des parallelen Betriebs von Alt- und neu installierten Systemen erhöhen kann. Insgesamt bestätigt die SHAP-Analyse die betriebswirtschaftliche Interpretierbarkeit des Moduls für Restkostenentschädigung und liefert empirische Belege für das Verständnis der Auswirkungen extremer Wetterereignisse und der Digitalisierung auf Produktions- und Betriebskosten.

Statistische Signifikanzprüfung von Verbesserungen der Vorhersage

Um zu bestimmen, ob die durch das vorgeschlagene Framework erzielten Verbesserungen bei der Prognose statistisch signifikant waren, wurden formale Prognosevergleichstests durchgeführt. Gemäß etablierter Praxis im Bereich der Energieprognose und der Ökonometrie wurde der Diebold–Mariano-Test (DM-Test) verwendet, um die Vorhersagegenauigkeit des vorgeschlagenen Modells mit der jeweiligen Benchmark zu vergleichen. Der DM-Test eignet sich besonders gut für die Zeitreihenprognose, da er die Autokorrelation der Prognosefehler berücksichtigt, ohne dass normalverteilte Residuen erforderlich sind.

Für jeden Vergleich wurde die Nullhypothese angenommen, dass die vorgeschlagene und das Referenzmodell eine gleiche Vorhersagegenauigkeit aufweisen, während die Alternativhypothese annahm, dass das vorgeschlagene Modell geringere Prognosefehler erzeugt. Einseitige DM-Tests wurden unter Verwendung des quadrierten Prognosefehlers als Verlustfunktion durchgeführt. Um Heteroskedastizität und Autokorrelation in der Verlustdifferenzreihe zu berücksichtigen, wurden Newey–West-Standardfehler mit automatischer Lag-Auswahl angewendet. Zusätzlich wurde der Wilcoxon-Vorzeichen-Rang-Test als nichtparametrische Alternative durchgeführt, die keine Verteilungsannahmen benötigt. Zusammen liefern diese komplementären Tests eine robuste Bewertung der statistischen Signifikanz der beobachteten Verbesserungen in der Prognosegenauigkeit.

Wie in Tabelle 5 zusammengefasst, erzielte der vorgeschlagene Prognoseansatz statistisch signifikante Verbesserungen gegenüber allen Benchmark-Modellen. Die positiven DM-Statistiken weisen auf systematisch geringere Prognosefehler im Vergleich zu den konkurrierenden Ansätzen hin. Die größte Verbesserung zeigte sich relativ zum ARIMA-Modell (DM = 3,842, p < 0,001), was den Vorteil der Einbindung von ingenieurtechnischen Kostenquoten in den Prognoseansatz belegt. Im Vergleich zu ARIMAX, das exogene Variablen einbezieht, wies das vorgeschlagene Modell ebenfalls eine signifikante Verbesserung auf (DM = 3,215, p < 0,001), was den zusätzlichen Nutzen der Kombination einer dynamischen Quotenbasis mit einer auf maschinellem Lernen basierenden Restfehlerkompensation unterstreicht.

Das vorgeschlagene Modell schnitt auch im Vergleich zu den Deep-Learning-Benchmarks deutlich besser ab. Die Verbesserungen bei der Prognose waren signifikant im Vergleich zum LSTM-Modell (DM = 2,876, p = 0,002) und zum Transformer-Modell (DM = 2,543, p = 0,011). Obwohl die Verbesserung gegenüber dem eigenständigen XGBoost-Modell geringer ausfiel (DM = 2,187, p = 0,029), blieb sie statistisch signifikant. Da beide Modelle ein baumbasiertes Lernen verwenden, zeigt dieses Ergebnis, dass die Integration der dynamischen Quoten-Basislinie einen zusätzlichen prädiktiven Mehrwert gegenüber einem rein datengetriebenen Ansatz bietet. Der Wilcoxon-Test für verbundene Ränge ergab Signifikanzniveaus, die mit denen des DM-Tests übereinstimmten, und lieferte damit weitere Belege dafür, dass die Prognoseverbesserungen des vorgeschlagenen Frameworks statistisch robust sind.

VERFÜGBARKEIT VON DATEN:

Die in dieser Studie verwendeten Datensätze wurden in ein öffentliches Repository hochgeladen (DOI: https://doi.org/10.5281/zenodo.21645584).

Diagramm zum Ressourcenmanagement im Stromnetz; Ressourcen, Arbeitskontingente, Kostenstellen und Bedarfsprognose
Abbildung 1: Darstellung der Beziehungen zwischen Stromnetzressourcen, standardisierten Arbeitskontingenten und Kostenstellen. Diese Abbildung zeigt, dass Kostenkontingente keine bloß abstrakten finanziellen Zuweisungsregeln sind, sondern standardisierte Rechnungseinheiten, die in den gesamten Betriebs- und Wartungsprozess von Stromnetzressourcen eingebettet sind. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Schemadiagramm der Stromnetzstabilität mit Risiken durch hohe Temperaturen, Taifune und Eisregen; Notfall-Hotspots markiert.
Abbildung 3: Anonymisierte schematische Topologie des untersuchten provincialen Stromnetzes und kostenbestimmende Störungsschichten. Diese Abbildung zeigt eine anonymisierte schematische Topologie des untersuchten provincialen Stromnetzes. Die Abbildung überlagert Umspannwerke nach Spannungsebene, Übertragungskorridore, dezentrale regenerative Energieanlagen, Lastzentren und repräsentative Zonen umweltbedingter Störungen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Diagramm zum Vergleich der Betriebskosten, 2023–2025. Modelle: Attention-LSTM, XGBoost, Quota-ML-Analyse.
Abbildung 4: Vorhersageverläufe der Kernmodelle und tatsächliche Kosten während des Out-of-Sample-Testzeitraums 2023–2025. Dieses Diagramm zeigt, dass die tatsächlichen Produktions- und Betriebskosten im Testzeitraum deutliche saisonale Schwankungen sowie plötzliche Spitzen aufweisen. Während des extremen Hitzeschocks im Juli und August 2024 stiegen die tatsächlichen Kosten signifikant an. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Radar-Diagramm zum Vergleich von MAPE, RMSE, R², MaxAE und Robustheit dreier ML-Modellvarianten.
Abbildung 5: Normalisierter Vergleich der Prognoseleistung zwischen den Ablationsvarianten. Die Radar-Diagramme vergleichen die normalisierte Leistung des vollständigen Quota-ML-Modells mit zwei Ablationsvarianten anhand von fünf Evaluierungsmetriken: MAPE-Score, RMSE-Score, R2-Score, MaxAE-Score und Robustheitsscore. Fehlerbasierte Metriken (MAPE, RMSE und MaxAE) wurden invers normalisiert, sodass höhere Werte geringere Vorhersagefehler anzeigen, während R2 und Robustheit so normalisiert wurden, dass höhere Werte eine bessere Modellleistung anzeigen. Das breitere Radarprofil des vollständigen Quota-ML-Modells zeigt eine überlegene Gesamtleistung bei der Prognose im Vergleich zu beiden Ablationsvarianten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

SHAP-Wert-Diagramm der Merkmalswirkungsanalyse zur Stabilität des Stromnetzes; Datenvisualisierung und -analyse.
Abbildung 6: SHAP-Zusammenfassungsdiagramm, das die Beiträge der Merkmale zur Vorhersage der Restkosten zeigt. SHAP-Zusammenfassungsdiagramm (Shapley Additive exPlanations), das die Beiträge der einflussreichsten Variablen zum XGBoost-Modell für Restkosten darstellt. Jeder Punkt repräsentiert eine Beobachtung, wobei die Farbe den Merkmalswert (blau = niedrig; rot = hoch) und die horizontale Position den SHAP-Wert angibt. Höhere Merkmalswerte für Variablen wie Extremhitze-Tage, sturmbedingter Ausfallindex, Dauer von Eisschlagereignissen und ungeplante Reparaturereignisse sind im Allgemeinen mit positiveren SHAP-Werten verbunden, was auf erhöhte Restkosten für Produktion und Betrieb hinweist. Das Diagramm zeigt, dass sowohl Umweltstörungen als auch betriebliche Faktoren wesentlich zu Abweichungen von der dynamischen Sollvorgabe beitragen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Tabelle 1: Beschreibung der Kernmodellvariablen und -parameter. Diese Tabelle stellt die wichtigsten Variablen des vorgeschlagenen Quota-ML-Kostenprognosemodells dar und unterscheidet dabei zwischen tatsächlichen und vorhergesagten Kosten; statischen und dynamischen Quotenbaselines; Arbeitslast- und Quotenparametern; makroökonomischen Anpassungsfaktoren (PPI und technologischer Fortschritt); sowie Restkomponenten. Bitte klicken Sie hier, um diese Tabelle herunterzuladen.

Tabelle 2: Klassifizierung und deskriptive Statistiken der zentralen Eingangsmerkmale des Prognosemodells. 
Diese Tabelle zeigt, dass erklärende Variablen aus verschiedenen Geschäftsbereichen unterschiedliche statistische Formen aufweisen. Sie fasst die deskriptiven Statistiken repräsentativer physikalischer Vermögenswerte, operativer, makroökonomischer und umweltbezogener Variablen zusammen, die als Modellinputs verwendet werden. Bitte klicken Sie hier, um diese Tabelle herunterzuladen.

ModelleMAPE %RMSE (CNY, Millionen)R²-AnpassungsgüteMaxAE (CNY, Millionen)
Traditionelle exponentielle Glättung8.7554.220.651125.04
SARIMAX-Zeitreihenmodell6.1238.540.76884.21
Reine XGBoost-Regression4.3829.160.85251.06
Attention-LSTM-Neuronales Netzwerk3.5524.020.89440.53
Vorgeschlagenes Quota-ML-Modell2.3415.690.95723.05

Tabelle 3: Vergleich der Gesamtleistung verschiedener Modelle auf dem Out-of-Sample-Testdatensatz für den Zeitraum 2023–2025. Diese Tabelle zeigt, dass das vorgeschlagene Quota-ML-Modell alle Vergleichsmodelle hinsichtlich der Vorhersagegenauigkeit für die Stromnetzproduktion und -betriebskosten im Out-of-Sample-Zeitraum 2023–2025 deutlich übertrifft.

Experimentelle VarianteEntfernte KernelementMAPE-AbbauleistungVerhältnis des erklärten Varianzverlusts
Variante AKeine dynamische Preis-/Technologieentwicklung4,15 % (+1,81 Prozentpunkte)0,83712,50 %
Variante BKeine ML-Restfehlerkompensation5,62 % (+3,28 Prozentpunkte)0,68628,30 %
Vollständiges ModellVollständiger vorgeschlagener Quoten-ML-Rahmen2,34 %0,957Referenzwert

Tabelle 4: Ergebnisse des Ablationsexperiments des Quoten-Maschinenlern-Integrationsframeworks. Diese Tabelle zeigt, dass beide Komponenten des vorgeschlagenen Frameworks maßgeblich zur Vorhersagegenauigkeit beitragen, wobei die Restfehlerkompensation durch maschinelles Lernen eine noch entscheidendere Rolle spielt.

VergleichDiebold-Mariano-TestWilcoxon-Vorzeichen-Rang-Test
Vorgeschlagenes Modell vs. ARIMADM = 3,842*** (p < 0,001)W = 486,0*** (p < 0,001)
Vorgeschlagenes Modell vs. ARIMAXDM = 3,215*** (p < 0,001)W = 452,0*** (p < 0,001)
Vorgeschlagenes Modell vs. LSTMDM = 2,876** (p = 0,002)W = 398,0** (p = 0,003)
Vorgeschlagenes Modell vs. TransformerDM = 2,543* (p = 0,011)W = 364,0* (p = 0,014)
Vorgeschlagenes Modell vs. XGBoost (rein ML)DM = 2,187* (p = 0,029)W = 328,0* (p = 0,031)

Tabelle 5: Ergebnisse der statistischen Signifikanztests für Prognosevergleiche. Die Teststatistik von Diebold-Mariano folgt einer Standardnormalverteilung unter der Nullhypothese. Positive DM-Werte deuten auf eine überlegenere Prognosegenauigkeit des vorgeschlagenen Modells hin. Alle Tests sind einseitig, mit der Alternativhypothese, dass das vorgeschlagene Modell einen geringeren Prognosefehler aufweist als das Referenzmodell. Die Teststatistik W des Wilcoxon-Vorzeichen-Rang-Tests wird zusammen mit den entsprechenden p-Werten angegeben. Verlustfunktion = quadrierter Prognosefehler.

Diskussion

Diese Studie zeigt, dass die Integration industrieller Kostenquoten mit maschinellem Lernen einen interpretierbaren und genauen Rahmen für die langfristige Kostenprognose von Stromnetzen bietet. Die Ergebnisse zeigen, dass klimabedingte Variablen, insbesondere Tage mit extremen Hochtemperaturen und Leitungsabschalt-Einflussindizes, die Haupttreiber der Kostenresiduen sind, wodurch der zunehmende Einfluss externer Störungen auf die Betriebsausgaben von Versorgungsunternehmen verdeutlicht wird. Diese Erkenntnisse legen nahe, dass wetterbedingte Kosten nicht länger als unbeabsichtigte Betriebsausgaben behandelt werden sollten, sondern vielmehr in eigens eingerichtete Risikorücklagen einzubeziehen sind, wobei die Inanspruchnahme dieser Rücklagen an prognostizierte Klimarisiken geknüpft werden sollte. Die Identifizierung von Leitungsabschalt-Einflüssen als wesentliche Kostentreiber unterstreicht zudem den Wert prädiktiver Wartungsstrategien und Zustandsüberwachung zur Verringerung sowohl betrieblicher Störungen als auch der Kostenvolatilität.

Die Analyse zeigt außerdem, dass die digitale Transformation in den frühen Implementierungsphasen aufgrund des Übergangs-Betriebs mit zwei Systemen die Betriebskosten erhöhen kann, anstatt unmittelbare Effizienzgewinne zu bringen. Dieses Ergebnis legt nahe, dass Versorger digitale Investitionen anhand einer Lebenszykluskostenbewertung statt anhand kurzfristiger finanzieller Leistung beurteilen und vorübergehende Kostenüberschneidungen bei der Einführung intelligenter Überwachungssysteme, fortschrittlicher Netzmanagementlösungen oder digitaler Umspannwerke einkalkulieren sollten. Der vorgeschlagene Rahmen für die Restkostenkompensation könnte zudem erweitert werden, um den Zeitpunkt abzuschätzen, ab dem digitale Investitionen netto Kosteneinsparungen erzielen, wodurch eine effektivere Technologieplanung und fundiertere Investitionsentscheidungen unterstützt würden.

Neben den betrieblichen Anwendungen hat der vorgeschlagene Rahmen wichtige regulatorische Implikationen. Indem das Modell die Auswirkungen externer Einflussfaktoren auf Kostenresiduen quantifiziert, liefert es eine objektive Grundlage für die Festlegung klimabedingt angepasster Risikorücklagen und die Bewertung von Budgetanträgen der Versorgungsunternehmen. Die Trennung von grundlegenden, quotenbedingten Kosten und störungsbedingten Restwerten unterstützt außerdem eine effektivere leistungsorientierte Regulierung, indem zwischen kontrollierbarer betrieblicher Effizienz und nicht kontrollierbaren externen Schocks unterschieden wird. Darüber hinaus bietet der quotenbasierte Prognoserahmen eine höhere Transparenz und Nachvollziehbarkeit als rein statistische oder Black-Box-KI-Modelle, wodurch prognostizierte Kosten in Tarifüberprüfungen und regulatorischen Anhörungen direkt mit den physikalischen Betriebsbedingungen und ingenieurtechnischen Parametern verknüpft werden können.

Mehrere Einschränkungen sollten berücksichtigt werden. Die empirische Analyse basiert auf einem einzelnen Provinz-Stromnetz in Ostchina, was die Übertragbarkeit auf Regionen mit anderen klimatischen Bedingungen, regulatorischen Umgebungen oder Netzwerkstrukturen einschränken könnte. Obwohl der Datensatz mit 192 Monaten für das XGBoost-Modell ausreichend ist, bleibt er relativ klein, um seltene, aber stark wirkende Ereignisse abzubilden, und die Vorhersageleistung hängt von der Qualität und Konsistenz der zugrunde liegenden Kostenanrechnungsdatenbanken ab. Zudem stützt sich der dynamische Anrechnungsmechanismus auf den aggregierten Erzeugerpreisindex und Faktoren des technologischen Fortschritts, die regionale oder komponentenspezifische Kostenunterschiede möglicherweise nicht vollständig erfassen. Obwohl die SHAP-Analyse die Modellinterpretierbarkeit verbessert, stellen die angegebenen Merkmalsbeiträge prädiktive Assoziationen und keine kausalen Zusammenhänge dar und sollten daher mit der gebotenen Vorsicht interpretiert werden.

Zukünftige Forschung sollte darauf abzielen, unstrukturierte Wartungsdaten mithilfe domänenspezifischer großer Sprachmodelle zu integrieren, spatiotemporale graphbasierte neuronale Netze einzubeziehen, um die Ausbreitung von Störungen in vernetzten Stromnetzen abzubilden, die Validierung auf mehrere Regionen auszudehnen, um die Verallgemeinerbarkeit zu verbessern, und die Quantifizierung von Unsicherheiten einzuführen, um risikobewusste regulatorische Entscheidungsfindung zu unterstützen. Diese Entwicklungen stehen im Einklang mit jüngsten Fortschritten in der mittel- und langfristigen Energieprognose sowie der Integration erneuerbarer Energien, bei denen die Kombination datengetriebener Intelligenz mit physikalisch begründeten Modellierungsansätzen für einen zuverlässigen Betrieb von Stromsystemen betont wird43,44.

Offenlegungen

Alle Autoren geben an, dass kein Interessenkonflikt besteht.

BEITRAG DER AUTOREN:
Xiaohui Wang hat die Studie konzipiert und entworfen, die Methodologie entwickelt, die formale Analyse durchgeführt und den ursprünglichen Manuskriptentwurf verfasst. Tong Li trug zur Datenpflege, Software-Implementierung und Validierung bei. Yanchao Lu beteiligte sich an der Entwicklung der Methodologie, Durchführung der Untersuchungen und Interpretation der Daten. Quanfeng Lv stellte Ressourcen bereit, überwachte die Datenerfassung und überprüfte das Manuskript kritisch. Fan Liu leitete das Projekt, trug zur Konzeption und Interpretation der Ergebnisse bei, sicherte die Finanzierung und überarbeitete das Manuskript kritisch. Alle Autoren haben die endgültige Version des Manuskripts geprüft und genehmigt.

Danksagungen

Diese Arbeit wurde unterstützt durch das Technologieprojekt der State Grid Corporation of China mit dem Titel „Forschung zur Analyse der Zuweisung von Produktions- und Betriebskosten und zur asynchronen Optimierungstechnologie“ (Projektnummer: 520600250029-183-ZN).

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Anonymisierte monatliche Abrechnungsdatensatz E-GridProvinziales Stromnetz in OstchinaN/VAnonymisierter monatlicher Datensatz zur Erzeugung und Betriebskosten (2010–2025) mit 192 Beobachtungen, einschließlich Daten zu physischen Anlagen, Instandhaltung, makroökonomischen und Umwelteinflüssen. Verwendet zur Modellentwicklung (156 Beobachtungen) und zur Out-of-Sample-Testung (36 Beobachtungen).
Matplotlib-Plotting-BibliothekMatplotlib-Entwicklungsteam3.5.2Wird zur Erstellung der Abbildungen und grafischen Ausgaben in der Manuskripterstellung verwendet, einschließlich Modellleistungsdiagrammen, Visualisierungen der Topologie, Residualdiagnosen, Radar-Diagrammen und zusammenfassenden Darstellungen im Zusammenhang mit SHAP.
NumPy-Bibliothek für numerisches RechnenNumPy-Entwickler1.22.3Wird für numerische Array-Operationen, Matrixberechnungen und die Kontrolle der Reproduzierbarkeit verwendet. Bei Bedarf wurde ein fester Zufallsstartwert (Seed) von 42 angewendet.
Pandas-Bibliothek zur Datenmanipulationpandas-Entwicklungsteam1.4.2Wird zum Import, zur Integration, Umstrukturierung, Filterung und Vorverarbeitung von Daten verwendet, einschließlich der Imputation fehlender Werte, der Ausrichtung von Zeitreihen und der Vorbereitung der Eingabevariablen für das Modell.
Python-ProgrammierumgebungPython Software Foundation3.9.13Programmierumgebung, die zur Implementierung des gesamten Prognosearbeitsablaufs verwendet wurde, einschließlich Daten-Vorverarbeitung, Merkmalsentwicklung, Modelltraining, Hyperparameter-Optimierung, Vorhersage, statistischer Tests und Leistungsbewertung.
Scikit-learn-Bibliothek für maschinelles Lernenscikit-learn-Mitwirkende1.0.2Wird für die Daten-Vorverarbeitung, Aufteilung in Trainings- und Validierungsdaten, ergänzende Modellbewertung und statistische Verfahren verwendet, einschließlich der Pearson-Korrelationsanalyse und der Berechnung ausgewählter Leistungskennzahlen.
SciPy-Bibliothek für wissenschaftliches RechnenSciPy-Mitwirkende1.9.0Wird für statistische Berechnungen verwendet, einschließlich der Pearson-Korrelationsanalyse sowie unterstützender Verfahren zur Behandlung von Ausreißern und Winsorisierung.
Implementierung des baumstrukturierten Parzen-EstimatorsOptuna-Mitwirkende3.1.0Bayessche Optimierungsmethode zur Anpassung der Hyperparameter von XGBoost, einschließlich maximaler Baumtiefe, Lernrate und Regularisierungsparameter. Der baumstrukturierte Parzen-Estimator wurde über das Open-Source-Paket Optuna implementiert.
XGBoost-SoftwarebibliothekDMLC / XGBoost-Mitwirkende1.7.1Ensemble-Lernbibliothek auf Basis von Entscheidungsbäumen, die zur nichtlinearen Restkompen­sation verwendet wird. Das Modell implementierte eine regularisierte Zielfunktion mit Huber-Verlust und Bestrafung der Baumkomplexität, wie in den Gleichungen 7–9 beschrieben.

Referenzen

  1. Rao H, Li J, Sun X. Demand forecasting and allocation optimization of green power grid supply chain based on machine learning algorithm: A study based on the whole-process data of power grid materials. Sustainability. 2025;17(3):1247.
  2. Huang C, et al. Demand response for industrial micro-grid considering photovoltaic power uncertainty and battery operational cost. IEEE Trans Smart Grid. 2021;12(4):3043-3055.
  3. Phuangpornpitak N, Prommee W. A study of load demand forecasting models in electric power system operation and planning. GMSARN Int J. 2016;10:19-24.
  4. Nasir J, et al. A hybrid LMD–ARIMA–machine learning framework for enhanced forecasting of financial time series: Evidence from the NASDAQ Composite Index. Mathematics. 2025;13(15):2389.
  5. Matos C, et al. Model for integrating the electricity cost consumption and power demand into aggregate production planning. Appl Sci. 2022;12(15):7577.
  6. Valenzuela J, Mazumdar M, Kapoor A. Influence of temperature and load forecast uncertainty on estimates of power generation production costs. IEEE Trans Power Syst. 2000;15(2):668-674.
  7. Khan F, et al. A hybrid vector autoregressive model for accurate macroeconomic forecasting: An application to the US economy. Mathematics. 2025;13(11):1706.
  8. Fatema I, Kong X, Fang G. Electricity demand and price forecasting model for sustainable smart grid using comprehensive long short-term memory. Int J Sustain Eng. 2021;14(6):1714-1732.
  9. Singh AK, Ibraheem SK, Muazzam M, Chaturvedi DK. An overview of electricity demand forecasting techniques. Netw Complex Syst. 2013;3(3):38-48.
  10. Iftikhar H, et al. A novel hybrid framework for forecasting stock indices based on nonlinear time series models. Comput Stat. 2025;40(8):4163-4186.
  11. Jiang P, Li R, Lu H, Zhang X. Modeling of electricity demand forecast for power system. Neural Comput Appl. 2020;32(11):6857-6875.
  12. Chan SC, et al. Load/price forecasting and managing demand response for smart grids: Methodologies and challenges. IEEE Signal Process Mag. 2012;29(5):68-85.
  13. Hernandez L, et al. A survey on electric power demand forecasting: Future trends in smart grids, microgrids and smart buildings. IEEE Commun Surv Tutor. 2014;16(3):1460-1495.
  14. Zareipour H, Canizares CA, Bhattacharya K. Economic impact of electricity market price forecasting errors: A demand-side analysis. IEEE Trans Power Syst. 2009;25(1):254-262.
  15. Botterud A. Forecasting renewable energy for grid operations. In: Renewable Energy Integration. Academic Press; 2017:133-143.
  16. Mirowski P, Chen S, Ho TK, Yu CN. Demand forecasting in smart grids. Bell Labs Tech J. 2014;18(4):135-158.
  17. Sobu A, Wu G. Optimal operation planning method for isolated micro grid considering uncertainties of renewable power generations and load demand. In: IEEE PES Innovative Smart Grid Technologies [conference proceedings]. IEEE; 2012. Available at: https://ieeexplore.ieee.org/
  18. Han B, et al. Optimal design of an on-grid microgrid considering long-term load demand forecasting: A case study. Distrib Gener Altern Energy J. 2020;35:345-362.
  19. Tripathy SC. Demand forecasting in a power system. Energy Convers Manag. 1997;38(14):1475-1481.
  20. Adshead NS, Price DH. Demand forecasting and cost performance in a model of a real manufacturing unit. Int J Prod Res. 1987;25(9):1251-1265.
  21. Gellert A, et al. A study on forecasting electricity production and consumption in smart cities and factories. Int J Inf Manage. 2019;49:546-556.
  22. Hernández L, et al. A multi-agent system architecture for smart grid management and forecasting of energy demand in virtual power plants. IEEE Commun Mag. 2013;51(1):106-113.
  23. Klingler AL, Teichtmann L. Impacts of a forecast-based operation strategy for grid-connected PV storage systems on profitability and the energy system. Sol Energy. 2017;158:861-868.
  24. Ghalehkhondabi I, Ardjmand E, Weckman GR, Young WA. An overview of energy demand forecasting methods published in 2005–2015. Energy Syst. 2017;8(2):411-447.
  25. Aderibigbe AO, et al. Enhancing energy efficiency with AI: A review of machine learning models in electricity demand forecasting. Eng Sci Technol J. 2023;4(6):341-356.
  26. Arumugham V, et al. An artificial-intelligence-based renewable energy prediction program for demand-side management in smart grids. Sustainability. 2023;15(6):5453.
  27. Dudek G, Piotrowski P, Baczyński D. Intelligent forecasting and optimization in electrical power systems: Advances in models and applications. Energies. 2023;16(7):3024.
  28. Liu N, et al. A hybrid forecasting model with parameter optimization for short-term load forecasting of micro-grids. Appl Energy. 2014;129:336-345.
  29. Mohammad AA, et al. Mathematical and statistical modelling of electricity demand forecasting using artificial neural networks and SARIMA: Implications for energy supply chain planning. Alex Eng J. 2026;139:98-108.
  30. Singh AR, et al. A blockchain-enabled multi-agent deep reinforcement learning framework for real-time demand response in renewable energy grids. Energy Strateg Rev. 2025;62:101905.
  31. Lu R, et al. Data-driven real-time price-based demand response for industrial facilities energy management. Appl Energy. 2021;283:116291.
  32. Kondaiah VY, Saravanan B, Sanjeevikumar P, Khan B. A review on short-term load forecasting models for micro-grid application. J Eng. 2022;2022(7):665-689.
  33. Lee BL, Wilson C, Simshauser P, Majiwa E. Deregulation, efficiency and policy determination: An analysis of Australia's electricity distribution sector. Energy Econ. 2021;98:105210.
  34. Wang Y, et al. Transmission network expansion planning considering wind power and load uncertainties based on multi-agent DDQN. Energies. 2021;14(19):6073.
  35. Ding Q, Zhao H. Study on e-commerce logistics cost control methods in the context of COVID-19 prevention and control. Soft Comput. 2021;25(18):11955-11963.
  36. Duan Y, Xu Z, Chen H, Wang Y. Novel machine learning approach for enhanced smart grid power use and price prediction using advanced Shark Smell-tuned flexible support vector machine. Sci Rep. 2025;15(1):20909.
  37. Chen T, Guestrin C. XGBoost: A scalable tree boosting system. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining [conference proceedings]. San Francisco, CA, USA; 2016. Available at: https://doi.org/10.1145/2939672.2939785
  38. Lin KY, et al. Predictive maintenance in industrial systems: An XGBoost-based approach for failure time estimation and resource optimization. J Ind Prod Eng. 2025;42(8):876-899.
  39. Ajayi OO, Kurien AM, Djouani K, Dieng L. A proactive predictive model for machine failure forecasting. Machines. 2025;13(8):663.
  40. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  41. Chen H, Gao T, Wang L, Guo P. Explainable machine learning methods for predicting electricity consumption in a long-distance crude oil pipeline. Sci Rep. 2025;15(1):43305.
  42. Neubauer A, Brandt S, Kriegel M. Explainable multi-step heating load forecasting: Using SHAP values and temporal attention mechanisms for enhanced interpretability. Energy AI. 2025;20:100480.
  43. Ahmad T, Chen H. Potential of three variant machine-learning models for forecasting district-level medium-term and long-term energy demand in smart grid environment. Energy. 2018;160:1008-1020.
  44. Masa-Bote D, et al. Improving photovoltaics grid integration through short-time forecasting and self-consumption. Appl Energy. 2014;125:103-113.

Nachdrucke und Genehmigungen

Tags

KostenprognoseStromnetzdatenquotenbasierte PrognoseXGBoost-ModellSHAP-InterpretationStrommarktreformÜbertragungstariferegulatorische KostenprüfungMachine-Learning-Prognose