Questo studio ha utilizzato dati operativi e finanziari anonimizzati raccolti da una rete elettrica provinciale nell'est della Cina. Tutti i dati sono stati aggregati e depurati da informazioni identificabili prima dell'analisi, e non sono state incluse informazioni personali identificabili o sensibili a livello individuale. Pertanto, non era richiesta l'approvazione etica. L'accesso ai dati e la loro analisi hanno rispettato le normative vigenti in materia di protezione dei dati e gli accordi istituzionali che regolano le informazioni del settore energetico.
Panoramica del framework di previsione
Per integrare approcci previsionali basati sulla fisica e approcci basati sui dati, è stato sviluppato un framework ibrido che combina quote di costo ingegneristiche con l'apprendimento automatico. Piuttosto che semplicemente combinare più algoritmi, il framework segue il principio secondo cui i modelli fisici stabiliscono la previsione di base, mentre l'apprendimento automatico compensa gli errori residui. Questa progettazione garantisce che il processo di previsione sia basato sui meccanismi fisici sottostanti alle attività di produzione e gestione della rete elettrica, anziché basarsi esclusivamente sull'estrapolazione dei costi storici.
Il framework stabilisce innanzitutto una mappatura gerarchica tra le risorse della rete elettrica, le attività operative standardizzate e i relativi conti di costo finanziario. I costi di produzione e di esercizio sono considerati rappresentazioni monetarie delle risorse consumate dalle infrastrutture fisiche—tra cui sottostazioni, linee di trasmissione, alimentatori di distribuzione, dispositivi di misurazione e apparecchiature digitali per ispezioni—durante le attività di routine come ispezione, manutenzione, collaudo, riparazione e sostituzione. Le quote di costo fungono da collegamento tra carichi di lavoro ingegneristici misurabili e le corrispondenti spese finanziarie.
Come illustrato nella Figura 1, i parametri di costo funzionano come unità contabili standardizzate incorporate in tutto il processo di esercizio e manutenzione delle attività, piuttosto che come regole astratte di allocazione finanziaria. I carichi di lavoro relativi alle attività a livello più basso vengono convertiti in parametri operativi standardizzati e successivamente associati a categorie di costo, tra cui manodopera, materiali, attrezzature per la costruzione, servizi esterni e forniture di emergenza. Questo mapping gerarchico preserva l'interpretabilità ingegneristica e la tracciabilità normativa durante l'intero processo di previsione, fornendo al contempo la base fisica per la costruzione del modello statico di riferimento dei parametri.
Panoramica del flusso di lavoro metodologico
Il framework di previsione proposto si compone di tre fasi sequenziali: (1) costruzione di una baseline fisica utilizzando quote di carico di lavoro a livello di asset, (2) evoluzione dinamica delle quote di costo mediante aggiustamenti macroeconomici e tecnologici, e (3) compensazione basata sull'apprendimento automatico per catturare gli effetti sistematici non lineari. Come illustrato in Figura 1, il framework stabilisce un mapping gerarchico dagli asset e dalle attività operative standardizzate di livello inferiore fino alle previsioni dei costi di produzione e di esercizio. I dettagli implementativi di ciascuna fase sono descritti nei sottoparagrafi seguenti.
Modello di costo base fisico basato sui carichi di lavoro a livello di asset
La produzione e il costo operativo di una rete elettrica, Ctotal, comprendono spese associate a numerose attività commerciali, tra cui l'esercizio della sottostazione, la manutenzione delle linee di trasmissione, la gestione della rete di distribuzione, il servizio clienti e i sistemi di supporto. In questo studio, si assume che il costo operativo di base sia determinato dal carico di lavoro generato da ciascuna attività operativa standardizzata e dalla relativa quota di costo.
Il costo statico di base è calcolato come:
(1)
dove Vi,k,t indica il carico di lavoro associato all'attività operativa o all'asset i-esimo all'interno della categoria aziendale k durante il periodo t, e Qi,k rappresenta il corrispondente costo unitario standardizzato definito dal sistema di quotazione dei costi ingegneristici. La categoria aziendale comprende le principali funzioni operative come la manutenzione delle sottostazioni, l'ispezione delle linee di trasmissione, l'esercizio della rete di distribuzione e il servizio al cliente. La doppia sommatoria aggrega i costi di tutte le attività operative standardizzate per stimare la spesa teorica di base necessaria a mantenere il normale funzionamento della rete.
L'equazione (1) stabilisce la relazione fisica tra carichi di lavoro ingegneristici e spese finanziarie, associando direttamente attività operative standardizzate a conti di costo. A differenza dei modelli puramente statistici di previsione, questa formulazione fornisce una base ingegneristica interpretabile, che costituisce il fondamento per successivi aggiustamenti dinamici delle quote e correzioni residue basate sull'apprendimento automatico. L'equazione è stata sviluppata a partire dalle pratiche operative e dal sistema di quote di costo adottato dalle imprese provinciali di rete elettrica in Cina. Tabella 1 riassume la notazione utilizzata nell'equazione (1), inclusi il carico di lavoro (Vi,k,t), il costo unitario standardizzato (Qi,k), il numero di attività operative (Nk) e l'indice di categoria aziendale (k).
Meccanismo di evoluzione dinamica delle quote in presenza di perturbazioni ambientali esterne
I parametri di costo standardizzati (Qi,k) forniscono una base di riferimento fisicamente interpretabile, ma non tengono conto dei cambiamenti nelle condizioni macroeconomiche né dei progressi tecnologici. Per migliorarne l'applicabilità a lungo termine, è stato introdotto un meccanismo di evoluzione dinamica per aggiustare i parametri di riferimento in risposta sia all'inflazione dei prezzi sia ai guadagni di efficienza legati al progresso tecnologico.
La prima correzione tiene conto delle variazioni dei costi di approvvigionamento derivanti dall'inflazione macroeconomica. Il funzionamento e la manutenzione della rete elettrica dipendono fortemente da materiali in massa, tra cui rame, alluminio e acciaio al silicio, i cui prezzi sono strettamente correlati alle fluttuazioni dell'Indice dei Prezzi alla Produzione (PPI). Poiché
è un indice con valore base pari a 100, viene inizialmente convertito in un tasso di inflazione standardizzato:
(2)
Sulla base di ciò, la funzione di correzione del prezzo
è definita come:
(3)
dove
è un vettore di pesi ritardati di lunghezza L che soddisfa

La struttura di ritardo rappresenta la trasmissione ritardata dell'inflazione macroeconomica ai costi di approvvigionamento all'interno della catena di fornitura della rete elettrica. La conversione dell'indice PPI in un tasso d'inflazione standardizzato preserva l'effetto cumulativo delle variazioni di prezzo, evitando al contempo i bias di scala associati all'uso diretto dei valori dell'indice. Le equazioni (2) e (3) sono adattate da modelli consolidati di aggiustamento dell'inflazione macroeconomica, con la struttura di ritardo calibrata per i cicli di approvvigionamento del settore energetico33,34.
I progressi tecnologici sono stati incorporati attraverso un fattore di riduzione dei costi che riflette i miglioramenti nell'efficienza operativa derivanti da avanzamenti come l'ispezione mediante veicoli aerei senza pilota, la robotica intelligente e le tecnologie digitali di manutenzione. Il fattore di aggiustamento tecnologico è definito come:
(4)
In questa parte, α e β sono coefficienti empirici di elasticità stimati a partire da dati storici panel mediante il metodo dei minimi quadrati non lineari. Per garantire che il fattore di progresso tecnologico rappresenti sempre una riduzione ragionevole del costo unitario del preventivo, il processo di stima dei parametri impone il vincolo 0 < Γ(Etech,t) ≤ 1. Va osservato che questo fattore riflette principalmente il miglioramento dell'efficienza a lungo termine derivante dalla sostituzione con tecnologie mature. L'equazione (4) è originale di questo studio e adatta il concetto di curva di apprendimento presente nella letteratura sui costi delle tecnologie energetiche35,36 alle operazioni di manutenzione della rete. I costi aggiuntivi che possono emergere nella fase iniziale di implementazione di apparecchiature digitali, come l'esercizio parallelo di sistemi vecchi e nuovi, l'integrazione delle piattaforme, i test di comunicazione e la manutenzione supplementare, non vengono sottratti forzatamente dal preventivo di base; piuttosto, vengono identificati dal successivo modulo di compensazione dei residui basato sull'apprendimento automatico:
(5)
dove Cbase,t indica il costo statico di base calcolato a partire dai carichi di lavoro delle risorse di livello inferiore e dalle quote standardizzate dei costi operativi;
rappresenta l'effetto di trasmissione delle fluttuazioni macroeconomiche sui prezzi di materiali, attrezzature e servizi esterni; e Γ(Etech,t) riflette la riduzione dei costi operativi e di manutenzione per unità ottenuta grazie all'efficienza raggiunta con la maturazione tecnologica. Attraverso questo meccanismo di evoluzione dinamica, la base della quota non rimane più su una semplice base contabile statica, ma può adattarsi in modo dinamico ai cambiamenti nelle condizioni economiche e tecnologiche. L'equazione (5) è originale di questo studio e rappresenta l'innovativa integrazione delle correzioni per prezzi e tecnologia all'interno del quadro di riferimento della quota.
Cattura sistematica di residui non lineari sotto vincoli di quota
Nonostante complesse correzioni evolutive, il modello delle quote genera inevitabilmente deviazioni sistematiche quando si confronta con interruzioni meteorologiche imprevedibili legate a disastri e con direttive politiche improvvise, come l'aumento dei costi di gestione dei reclami dei clienti durante periodi temporanei di riduzione delle tariffe. Questa deviazione costituisce il termine residuo su entrambi i lati dell'equazione:
Rt=Cactual,t-Cquota,t (6)
Poiché le regole fisiche convenzionali non riescono a spiegare questo aspetto, il machine learning può superare tali limitazioni. Per evitare la maledizione della dimensionalità causata da caratteristiche ad alta dimensionalità, questo studio utilizza l'algoritmo XGBoost basato su insiemi di alberi decisionali per modellare la relazione non lineare Rt37,38. Viene definita una matrice di caratteristiche con forti perturbazioni Xt, comprendente parametri meteorologici come i giorni estremi di gelo annuale Dice e l'intensità delle politiche macroeconomiche.
Per un compensatore non lineare composto da alberi di regressione, la logica di generazione del residuo predetto
può essere espressa come39:
(7)
dove F indica lo spazio di tutte le possibili strutture degli alberi di classificazione e regressione. Per bilanciare l'accuratezza di adattamento e la prevenzione dell'overfitting, viene costruita e minimizzata nell'm-esima iterazione una funzione obiettivo regolarizzata contenente un termine di penalizzazione per la complessità strutturale:
(8)
dove
è una funzione di perdita convessa che misura la differenza tra il residuo reale e il residuo previsto. In questo articolo viene adottata la perdita di Huber per migliorare la robustezza del modello nei confronti di picchi di spesa anomali. Il termine di regolarizzazione
viene utilizzato per limitare la complessità della struttura dell'albero ed è definito come:
(9)
dove Tm rappresenta il numero di nodi foglia nell'albero m-esimo, wm rappresenta il corrispondente vettore dei pesi delle foglie, e γ e λ indicano rispettivamente il coefficiente di penalizzazione del numero di nodi foglia e il coefficiente di regolarizzazione del peso.
L'equazione finale di previsione è:
(10)
Espanso ulteriormente come:
(11)
La formula sopra rappresenta matematicamente la struttura ad anello chiuso del modello di previsione proposto. La domanda finale relativa ai costi di produzione e di esercizio non è generata direttamente dal modello di apprendimento automatico; piuttosto, si ottiene sovrapponendo la compensazione residua non lineare identificata dal modulo di apprendimento automatico alla baseline dinamica della quota. Tra questi componenti, i fattori di prezzo e tecnologia riflettono principalmente l'evoluzione dinamica della baseline della quota, mentre fattori difficili da caratterizzare esplicitamente tramite regole, come gli shock climatici, le perturbazioni politiche e gli aumenti improvvisi degli interventi di riparazione, sono catturati dal modulo di compensazione residua basato sull'apprendimento automatico. Le equazioni (10) e (11) sono originali di questo studio e integrano la baseline fisica con la cattura residua basata sull'apprendimento automatico in un framework unificato di previsione.
Figura 2 mostra che i risultati di previsione del modello proposto esibiscono una chiara logica gerarchica di generazione. Da un lato, la quota di base fornisce una solida base fisica, trasparente e verificabile per la domanda di costi; dall'altro lato, gli aggiustamenti dei prezzi, gli effetti tecnologici e i residui degli shock esterni consentono al modello di adattarsi ai cambiamenti dinamici in ambienti complessi. Rispetto ai modelli a scatola nera che producono direttamente valori predetti, questa struttura di decomposizione può rivelare chiaramente "perché i costi aumentano o diminuiscono", migliorando così l'interpretabilità dei risultati del modello nella revisione del bilancio e nella regolamentazione delle tariffe di trasmissione e distribuzione.
Fonti dei dati e procedure di raccolta
I modelli teorici devono essere rigorosamente validati attraverso dati empirici per dimostrare la loro utilità pratica. Poiché i dati finanziari fondamentali del settore energetico contengono informazioni sensibili relative alle operazioni delle infrastrutture nazionali, questo studio estrae dati contabili mensili ad alta precisione e anonimizzati da una tipica rete elettrica provinciale nella Cina orientale, indicata per comodità come E-Grid, che coprono 16 anni solari consecutivi dal 2010 al 2025. Questa provincia ha attraversato un ciclo economico tipico, passando da una crescita trainata dalle tradizionali industrie pesanti a una manifatturiera di alto livello, con un tasso di crescita annuo composto della scala delle attività della rete pari al 7,4%. L'evoluzione complessa della sua struttura dei costi, pertanto, potrebbe essere rilevante anche per altri sistemi di rete in rapido sviluppo. I dati provengono da tre fonti principali: (1) registri interni di esercizio e manutenzione che documentano i carichi di lavoro a livello di attività, le frequenze di ispezione e gli interventi di riparazione; (2) sistemi contabili finanziari che forniscono estratti conto mensili relativi a costi per manodopera, materiali, attrezzature e servizi esternalizzati; e (3) basi di dati ambientali esterne, incluse le registrazioni meteorologiche dell'Amministrazione Meteorologica Cinese e gli indicatori macroeconomici dell'Ufficio Nazionale di Statistica.
Controllo della qualità e trattamento dei dati mancanti
Per oltre 130 indicatori iniziali integrati da sistemi multi-fonte, è stata implementata una rigorosa procedura di controllo qualità. I dati mancanti, che rappresentano meno del 3% del totale delle osservazioni, sono stati gestiti mediante interpolazione lineare per le variabili continue con andamenti temporali e mediante imputazione della moda per gli indicatori categorici. Gli outlier sono stati identificati utilizzando il metodo dell'intervallo interquartile (IQR); i valori superiori a 3,0 volte l'IQR rispetto al terzo quartile sono stati winsorizzati al 99° percentile per preservare l'integrità dei dati e ridurre al minimo la distorsione causata da valori estremi.
Considerazioni sulla dimensione del campione
Il set di dati comprende 192 osservazioni mensili (gennaio 2010 – dicembre 2025), con 156 osservazioni (2010–2022) assegnate per l'addestramento e la validazione e 36 osservazioni (2023–2025) riservate per il test su campioni esterni. Sebbene questa dimensione campionaria sia relativamente modesta per applicazioni di deep learning, è adeguata per l'algoritmo XGBoost, progettato specificamente per prestazioni elevate con set di dati tabulari di dimensioni ridotte o medie grazie ai suoi meccanismi di regolarizzazione e potatura degli alberi. Per ridurre al minimo i rischi di overfitting, (1) sono state applicate penalità rigorose di regolarizzazione (γ = 0,1, λ = 1,0), (2) è stato utilizzato l'arresto anticipato con una tolleranza di 50 cicli e (3) sono state imposte restrizioni conservative sulla profondità degli alberi (profondità massima = 5). Queste misure garantiscono collettivamente stabilità e capacità di generalizzazione del modello nonostante la dimensione limitata del campione.
Segmentazione dei dati e integrazione eterogenea multiprovenienza
Per un test rigoroso, i dati da gennaio 2010 a dicembre 2022 sono stati assegnati all'intervallo di addestramento e validazione, contenente 156 osservazioni, utilizzato per addestrare i fattori di evoluzione della quota e la rete residua di compensazione della quota. Il periodo da gennaio 2023 a dicembre 2025 è riservato come insieme di test fuori campione trattenuto, contenente 36 osservazioni. Perché questo periodo è stato scelto come fase finale di verifica? Il motivo è che questi tre anni hanno coinciso con l'accelerazione della costruzione di un nuovo tipo di sistema elettrico, aggravata da eventi su larga scala di temperature elevate legati a fenomeni estremi di El Niño e dalla crescita rapida e disomogenea della generazione distribuita di energia rinnovabile. La rete elettrica ha affrontato pressioni senza precedenti nelle catene di approvvigionamento di materiali e nell'allocazione della manodopera per le riparazioni.
La selezione scientifica e la definizione quantitativa dei fattori determinanti i costi costituiscono la base per garantire che la rete residuale di apprendimento automatico possa catturare efficacemente le fluttuazioni sistematiche. Sulla base della logica gestionale dei costi operativi standard nei sistemi elettrici, questo studio supera la singola dimensione della previsione finanziaria tradizionale, basata esclusivamente sui flussi di cassa storici, ricostruendo l'ingegnerizzazione delle caratteristiche a partire da quattro confini fondamentali: dimensione delle attività fisiche, condizioni di esercizio e manutenzione, evoluzione macroeconomica e ambiente climatico esterno, utilizzando registri operativi originali e contabilità di sistemi esterni. Nel processo effettivo di modellazione, per oltre 130 indicatori originali derivanti dall'integrazione di sistemi multi-sorgente, lo studio impiega test di correlazione di Pearson per eliminare le variabili ridondanti fortemente collineari, con una soglia di |r| > 0,85. Sulla base delle conoscenze pregresse di esperti senior di reti elettriche, vengono infine selezionate 42 caratteristiche principali di ingresso per formare la matrice delle caratteristiche Xt. Per presentare chiaramente la struttura e la distribuzione sottostante dei dati nel tensore di ingresso, Tabella 2 seleziona 12 caratteristiche principali rappresentative dalle quattro dimensioni di valutazione sopra indicate e ne riassume le statistiche descrittive nel periodo di osservazione.
Per illustrare ulteriormente la base spaziale e topologica del sistema di caratteristiche multiprovenienza, Figura 3 presenta una topologia schematica anonimizzata della rete elettrica provinciale oggetto di studio. La figura sovrappone sottostazioni per livello di tensione, corridoi di trasmissione, cluster distribuiti di fonti rinnovabili, centri di carico e zone rappresentative di disturbi ambientali. La topologia aiuta a spiegare perché i costi di produzione e di esercizio sono influenzati congiuntamente dalla scala delle infrastrutture, dalla struttura della rete, dall'intensità degli interventi di riparazione d'emergenza e dagli shock climatici esterni. Inoltre, fornisce una base di interpretazione spaziale per le variabili trainanti i residui utilizzate nel modulo di compensazione XGBoost.
Tabella 2 mostra che le variabili esplicative appartenenti a diverse dimensioni aziendali presentano forme statistiche nettamente differenti. Le variabili relative alle risorse fisiche, che rappresentano la dinamica endogena dello sviluppo aziendale, come la capacità delle sottostazioni e la lunghezza delle linee, presentano deviazioni standard relativamente stabili e valori di asimmetria concentrati tra 0,1 e 0,8. La struttura complessiva dei dati è approssimativamente distribuita in modo normale, riflettendo oggettivamente l'attributo di uno sviluppo stabile della rete elettrica nel ciclo di costruzione delle infrastrutture. In netto contrasto si collocano le variabili meteorologiche e relative agli agenti esterni di disturbo riportate in fondo alla tabella. Ad esempio, il numero cumulativo di giorni con temperature di livello di allerta negli ultimi 90 giorni e l'indice di impatto dei distacchi delle linee mostrano un'elevata asimmetria verso destra, con valori di asimmetria pari a 2,15 e 2,45 rispettivamente. Questa tipica distribuzione a coda pesante conferma un punto critico oggettivo, impossibile da ignorare nella gestione reale della manutenzione della rete elettrica: sebbene i disastri causati dal maltempo estremo si verifichino relativamente di rado nel corso dell'anno, una volta innescati provocano spesso un aumento esponenziale dell'impegno di manodopera per le riparazioni e del consumo di ricambi. Da un altro punto di vista, l'elevata non uniformità e l'asimmetria verso valori estremi nella distribuzione di queste caratteristiche provenienti da fonti multiple rivelano i limiti teorici dei tradizionali modelli lineari di serie temporali, come ARIMAX, basati sull'ipotesi di normalità ed omoschedasticità, quando si tratta di modellare costi complessi della rete elettrica. Questo non solo rafforza ulteriormente la ragionevolezza dell'introduzione di un modulo basato sull'apprendimento automatico al di là della contabilità fisica di base, ma fornisce anche un solido supporto statistico alla scelta, da parte di questo articolo, del modello ad alberi XGBoost, in grado di gestire efficacemente distribuzioni sparse di caratteristiche e mappe non lineari per approssimare i residui di costo.
Configurazione del sistema di ottimizzazione e valutazione degli iperparametri
Dopo aver determinato lo spazio di ingresso delle caratteristiche, l'impostazione degli iperparametri del modello influenza direttamente le prestazioni di adattamento della rete di approssimazione residua. Poiché la rete di compensazione XGBoost comprende numerosi parametri, tra cui la profondità dell'albero (max depth), il tasso di apprendimento e i termini di penalizzazione per la regolarizzazione, e poiché tali parametri presentano interazioni non lineari, la ricerca a griglia convenzionale non solo comporta un'elevata complessità computazionale, ma tende anche a rimanere intrappolata in minimi locali negli spazi ad alta dimensione. Pertanto, questo studio introduce l'Estimatore di Parzen ad Albero (Tree-structured Parzen Estimator, TPE), un metodo di ottimizzazione bayesiana, nel processo di taratura dei parametri. L'algoritmo TPE può guidare dinamicamente le successive direzioni di campionamento sfruttando il feedback della funzione di perdita ottenuto dalle valutazioni precedenti. Costruendo una stima della densità kernel a posteriori (KDE) della variabile obiettivo, restringe in modo adattivo lo spazio di ricerca dei parametri, consentendo al modello di avvicinarsi alla configurazione ottimale globale degli iperparametri senza incorrere in costi computazionali elevati. L'obiettivo dell'ottimizzazione TPE era minimizzare l'RMSE di validazione su 100 iterazioni, con interruzione anticipata dopo 50 cicli senza miglioramenti.
Dopo aver completato l'ottimizzazione dei parametri sul set di validazione interno, per valutare oggettivamente le prestazioni finali di ciascun modello sul set di test fuori campione e soddisfare i requisiti di valutazione quantitativa degli enti regolatori per la verifica dei costi, questo studio utilizza l'errore percentuale assoluto medio (MAPE) per quantificare la deviazione relativa nella sequenza predetta. Nel frattempo, per affrontare l'esigenza pratica di controllare i gravi errori di previsione dei costi nelle operazioni, viene introdotto anche l'errore quadratico medio (RMSE), che impone penalità maggiori agli errori più grandi. Infine, il coefficiente di determinazione, R2, quantifica il potere esplicativo complessivo della regressione rispetto alla varianza reale del bersaglio.
Le definizioni matematiche degli indicatori sono le seguenti:
(12)
(13)
(14)
dove
rappresenta il costo effettivo di produzione e di esercizio nel periodo t,
rappresenta il costo previsto dal modello,
rappresenta il costo effettivo medio nel campione di prova e N è il numero di campioni nel set di prova.