Cette étude a utilisé des données opérationnelles et financières anonymisées, collectées auprès d'un réseau électrique provincial dans l'est de la Chine. Toutes les données ont été regroupées et désidentifiées avant l'analyse, et aucune information personnelle identifiable ou sensible au niveau individuel n'a été incluse. Par conséquent, une approbation éthique n'était pas requise. L'accès aux données et leur analyse se sont conformés aux réglementations applicables en matière de protection des données ainsi qu'aux accords institutionnels régissant les informations du secteur électrique.
Aperçu du cadre de prévision
Afin d'intégrer les approches prévisionnelles fondées sur la physique et celles basées sur les données, un cadre prévisionnel hybride a été mis au point, combinant les quotas de coûts d'ingénierie avec l'apprentissage automatique. Plutôt que de simplement combiner plusieurs algorithmes, ce cadre suit le principe selon lequel les modèles physiques établissent la prévision de base, tandis que l'apprentissage automatique compense les erreurs résiduelles. Cette conception garantit que le processus de prévision s'appuie sur les mécanismes physiques sous-jacents aux activités de production et d'exploitation du réseau électrique, plutôt que de se fonder uniquement sur une extrapolation historique des coûts.
Le cadre établit d'abord une correspondance hiérarchique entre les actifs du réseau électrique, les activités opérationnelles normalisées et les comptes de coûts financiers. Les coûts de production et d'exploitation sont considérés comme des représentations monétaires des ressources consommées par les actifs physiques — notamment les sous-stations, les lignes de transport, les alimentations de distribution, les dispositifs de mesure et l'équipement numérique d'inspection — lors d'activités courantes telles que l'inspection, la maintenance, les essais, les réparations et les remplacements. Les quotas de coût constituent le lien entre les charges de travail techniques mesurables et les dépenses financières correspondantes.
Comme illustré dans la Figure 1, les quotas de coût fonctionnent comme des unités comptables normalisées intégrées à l'ensemble du processus d'exploitation et de maintenance des actifs, plutôt que comme des règles abstraites d'allocation financière. Les charges de travail des actifs au niveau le plus bas sont converties en quotas opérationnels normalisés, puis associées à des catégories de coûts, notamment la main-d'œuvre, les matériaux, les équipements de construction, les services externalisés et les fournitures d'urgence. Ce mappage hiérarchique préserve l'interprétabilité technique et la traçabilité réglementaire tout au long du processus de prévision, et fournit la base physique pour la construction du modèle statique de quota de référence.
Aperçu du flux de travail méthodologique
Le cadre de prévision proposé comprend trois étapes séquentielles : (1) la construction d'une référence physique à partir de quotas de charge de travail par ressource, (2) l'évolution dynamique des quotas de coût par ajustements macroéconomiques et technologiques, et (3) une compensation des résidus fondée sur l'apprentissage automatique afin de capturer les effets non linéaires systématiques. Comme illustré dans Figure 1, le cadre établit une correspondance hiérarchique allant des ressources et activités opérationnelles normalisées de niveau inférieur jusqu'aux prévisions des coûts de production et d'exploitation. Les détails de mise en œuvre de chaque étape sont décrits dans les sous-sections suivantes.
Modèle de coût de base physique fondé sur les charges de travail au niveau des actifs
Le coût de production et d'exploitation d'un réseau électrique, Ctotal, comprend les dépenses associées à plusieurs activités commerciales, notamment l'exploitation des sous-stations, l'entretien des lignes de transport, la gestion du réseau de distribution, le service à la clientèle et les systèmes d'appui. Dans cette étude, on suppose que le coût d'exploitation de base est déterminé par la charge de travail générée par chaque activité opérationnelle normalisée et par son quota de coût correspondant.
Le coût de base statique est calculé comme suit :
(1)
où Vi,k,t désigne la charge de travail associée à la i-ème ressource ou tâche opérationnelle dans la catégorie commerciale k pendant la période t, et Qi,k représente le coût unitaire normalisé correspondant défini par le système de quotas de coûts techniques. La catégorie commerciale inclut les principales fonctions opérationnelles telles que la maintenance des postes électriques, l'inspection des lignes de transport, l'exploitation du réseau de distribution et le service à la clientèle. La double sommation agrège les coûts de toutes les activités opérationnelles normalisées afin d'estimer la dépense théorique de base nécessaire au maintien d'un fonctionnement normal du réseau.
L'équation (1) établit la relation physique entre les charges de travail d'ingénierie et les dépenses financières en associant directement des activités opérationnelles normalisées à des comptes de coûts. Contrairement aux modèles prévisionnels purement statistiques, cette formulation fournit une référence d'ingénierie interprétable qui sert de fondement aux ajustements dynamiques ultérieurs des quotas et à la correction des résidus basée sur l'apprentissage automatique. Cette équation a été élaborée à partir des pratiques opérationnelles et du système de quotas de coûts utilisés par les entreprises provinciales de réseau électrique en Chine. Tableau 1 résume les notations utilisées dans l'équation (1), incluant la charge de travail (Vi,k,t), le coût unitaire normalisé (Qi,k), le nombre de tâches opérationnelles (Nk) et l'indice de catégorie d'activité (k).
Mécanisme d'évolution dynamique des quotas en cas de perturbations environnementales externes
Les quotas de coût standardisés (Qi,k) fournissent une référence interprétable sur le plan physique, mais ne tiennent pas compte des changements des conditions macroéconomiques ni des progrès technologiques. Afin d'améliorer leur pertinence à long terme, un mécanisme d'évolution dynamique a été introduit pour ajuster les quotas de référence en fonction à la fois de l'inflation des prix et des gains d'efficacité liés à la technologie.
Le premier ajustement tient compte des variations des coûts d'approvisionnement résultant de l'inflation macroéconomique. L'exploitation et la maintenance du réseau électrique dépendent fortement de matières premières en vrac, telles que le cuivre, l'aluminium et l'acier au silicium, dont les prix sont étroitement liés aux fluctuations de l'indice des prix à la production (IPP). Étant donné que
est un indice ayant une valeur de base de 100, il est d'abord converti en un taux d'inflation normalisé :
(2)
Sur cette base, la fonction de correction des prix
est définie comme suit :
(3)
où
est un vecteur de poids retardé de longueur L satisfaisant

La structure de décalage représente la transmission différée de l'inflation macroéconomique aux coûts d'approvisionnement dans la chaîne d'approvisionnement du réseau électrique. La conversion de l'indice IPP en un taux d'inflation normalisé préserve l'effet cumulatif des variations de prix tout en évitant les biais d'échelle associés à l'utilisation directe des valeurs de l'indice. Les équations (2) et (3) sont adaptées de modèles établis de correction de l'inflation macroéconomique, la structure de décalage étant calibrée pour les cycles d'approvisionnement du secteur électrique33,34.
Les progrès technologiques ont été intégrés au moyen d’un facteur de réduction des coûts reflétant l'amélioration de l'efficacité opérationnelle résultant d'avancées telles que l'inspection par véhicules aériens sans pilote, la robotique intelligente et les technologies numériques de maintenance. Le facteur d'ajustement technologique est défini comme suit :
(4)
Dans cette partie, α et β sont des coefficients d'élasticité empiriques estimés à partir de données de panel historiques en utilisant la méthode des moindres carrés non linéaires. Afin de garantir que le facteur de progrès technologique représente toujours une réduction raisonnable du coût unitaire du quota, le processus d'estimation des paramètres impose la contrainte 0 < Γ(Etech,t) ≤ 1. Il convient de noter que ce facteur reflète principalement l'amélioration d'efficacité à long terme découlant du remplacement par des technologies matures. L'équation (4) est originale à cette étude, adaptant le concept de courbe d'apprentissage provenant de la littérature sur les coûts des technologies énergétiques35,36 aux opérations de maintenance du réseau. Les coûts supplémentaires pouvant survenir au stade initial du déploiement d'équipements numériques, tels que l'exploitation parallèle des anciens et nouveaux systèmes, l'intégration des plateformes, les tests de communication et la maintenance supplémentaire, ne sont pas déduits de force du quota de référence ; au lieu de cela, ils sont identifiés par le module ultérieur de compensation des résidus basé sur l'apprentissage automatique :
(5)
où Cbase,t désigne le coût de base statique calculé à partir des charges de travail des ressources de base et des quotas de coûts de fonctionnement standardisés ;
capture l'effet de transmission des fluctuations macroéconomiques des prix sur les matériaux, l'équipement et les prix des services externes ; et Γ(Etech,t) reflète la réduction des coûts unitaires d'exploitation et de maintenance fondée sur l'efficacité après la maturation technologique. Grâce à ce mécanisme d'évolution dynamique, la référence de quota ne demeure plus sur une base comptable statique, mais peut s'ajuster de manière adaptative aux changements des environnements économiques et des conditions technologiques. L'équation (5) est originale à cette étude et représente l'intégration novatrice des corrections de prix et de technologie dans le cadre de référence des quotas.
Capture systématique des résidus non linéaires dans le cadre de contraintes de quota
Malgré des corrections évolutives complexes, le modèle de quota génère inévitablement des écarts systématiques lorsqu'il est confronté à des perturbations météorologiques imprévues liées à des catastrophes et à des directives politiques soudaines, telles que l'augmentation des coûts liés au traitement des réclamations des clients pendant les périodes de réduction temporaire des tarifs. Cet écart constitue le terme résiduel des deux côtés de l'équation :
Rt=Cactual,t-Cquota,t (6)
Étant donné que les règles physiques conventionnelles ne peuvent pas expliquer cet aspect, l'apprentissage automatique peut pallier ces limitations. Afin d'éviter le fléau de la dimensionnalité provoqué par des caractéristiques en haute dimension, cette étude utilise l'algorithme XGBoost, basé sur des ensembles d'arbres de décision, pour modéliser la relation non linéaire Rt37,38. Une matrice de caractéristiques fortes perturbations Xt, incluant des paramètres météorologiques tels que le nombre annuel de jours extrêmement froids Dice et l'intensité des politiques macroéconomiques, est définie.
Pour un compensateur non linéaire composé d'arbres de régression, la logique de génération du résidu prédit
peut s'exprimer comme suit39 :
(7)
où F désigne l'espace de toutes les structures possibles d'arbres de classification et de régression. Afin d'équilibrer précision de l'ajustement et prévention du surajustement, une fonction objective régularisée contenant un terme de pénalité de complexité structurelle est construite et minimisée à la m-ième itération :
(8)
où
est une fonction de perte convexe mesurant l'écart entre le résidu réel et le résidu prédit. Cet article adopte la perte de Huber afin d'améliorer la robustesse du modèle face aux dépenses anormalement élevées. Le terme de régularisation
est utilisé pour limiter la complexité de la structure de l'arbre et est défini par :
(9)
où Tm représente le nombre de nœuds feuilles dans l'arbre m-ième, wm représente le vecteur de poids correspondant des feuilles, et γ et λ désignent respectivement le coefficient de pénalité du nombre de nœuds feuilles et le coefficient de régularisation des poids.
L'équation finale de prévision est la suivante :
(10)
Étendu davantage comme suit :
(11)
La formule ci-dessus représente mathématiquement la structure en boucle fermée du modèle de prévision proposé. La demande finale de coût de production et d'exploitation n'est pas directement générée par le modèle d'apprentissage automatique ; elle est plutôt obtenue en superposant la compensation résiduelle non linéaire identifiée par le module d'apprentissage automatique à la référence dynamique du quota. Parmi ces composantes, les facteurs de prix et de technologie reflètent principalement l'évolution dynamique de la référence du quota, tandis que les facteurs difficiles à caractériser explicitement par des règles, tels que les chocs climatiques, les perturbations politiques et les pics d'événements de réparation, sont captés par le module de compensation résiduelle basé sur l'apprentissage automatique. Les équations (10) et (11) sont originales à cette étude et combinent la référence physique avec la capture résiduelle fondée sur l'apprentissage automatique dans un cadre unifié de prévision.
Figure 2 montre que les résultats de prévision du modèle proposé présentent une logique claire de génération hiérarchique. D'une part, le quota de référence fournit une base physique stable, transparente et vérifiable pour la demande de coût ; d'autre part, les ajustements de prix, les effets technologiques et les résidus de chocs externes permettent au modèle de s'adapter aux changements dynamiques dans des environnements complexes. Contrairement aux modèles boîte noire qui produisent directement des valeurs prédites, cette structure de décomposition peut clairement révéler « pourquoi les coûts augmentent ou diminuent », renforçant ainsi l'interprétabilité des résultats du modèle dans le cadre de l'examen budgétaire et de la régulation des tarifs de transport et de distribution.
Sources de données et procédures de collecte
Les modèles théoriques doivent être rigoureusement validés par des données empiriques afin de démontrer leur utilité pratique. Étant donné que les données financières fondamentales du secteur électrique impliquent des informations sensibles liées au fonctionnement des infrastructures nationales, cette étude extrait des données comptables mensuelles précises et anonymisées provenant d'un réseau électrique provincial typique dans l'est de la Chine, désigné pour plus de commodité comme E-Grid, couvrant 16 années civiles consécutives allant de 2010 à 2025. Cette province a connu un cycle économique typique marqué par un passage d'une croissance tirée par les industries lourdes traditionnelles à une croissance axée sur la fabrication de haute technologie, le taux de croissance annuel composé de l'échelle des actifs du réseau atteignant 7,4 %. L'évolution complexe de sa structure de coûts présente donc une pertinence potentielle pour d'autres systèmes électriques en développement rapide. Les données proviennent de trois sources principales : (1) les journaux internes d'exploitation et de maintenance, enregistrant les charges de travail au niveau des actifs, les fréquences d'inspection et les interventions de réparation ; (2) les systèmes comptables financiers fournissant des états mensuels des coûts relatifs à la main-d'œuvre, aux matériaux, à l'équipement et aux services externalisés ; et (3) les bases de données environnementales externes, incluant les relevés météorologiques de l'Administration météorologique de Chine et les indicateurs macroéconomiques du Bureau national des statistiques.
Contrôle de qualité et traitement des données manquantes
Pour plus de 130 indicateurs initiaux intégrés à partir de systèmes multiples, une procédure rigoureuse de contrôle de qualité a été mise en œuvre. Les données manquantes, représentant moins de 3 % des observations totales, ont été traitées par interpolation linéaire pour les variables continues présentant des tendances temporelles, et par imputation par la valeur modale pour les indicateurs catégoriels. Les valeurs aberrantes ont été identifiées à l’aide de la méthode de l’intervalle interquartile (IIQ), les valeurs dépassant 3,0 fois l’IIQ au-dessus du troisième quartile étant winsorisées au 99e centile afin de préserver l’intégrité des données et d’atténuer la distorsion due aux valeurs extrêmes.
Considérations relatives à la taille de l'échantillon
Le jeu de données comprend 192 observations mensuelles (janvier 2010 à décembre 2025), dont 156 observations (2010–2022) attribuées à l'entraînement et à la validation, et 36 observations (2023–2025) réservées à des tests hors échantillon. Bien que cette taille d'échantillon soit relativement modeste pour des applications d'apprentissage profond, elle convient bien à l'algorithme XGBoost, spécifiquement conçu pour offrir de bonnes performances avec des jeux de données tabulaires de petite à moyenne taille grâce à ses mécanismes de régularisation et d'élagage des arbres. Afin d'atténuer les risques éventuels de surapprentissage, (1) des pénalités strictes de régularisation ont été appliquées (γ = 0,1, λ = 1,0), (2) un arrêt précoce avec une tolérance de 50 cycles a été mis en œuvre, et (3) des contraintes conservatrices sur la profondeur des arbres ont été imposées (profondeur maximale = 5). Ces mesures garantissent conjointement la stabilité du modèle et sa capacité de généralisation, malgré la taille limitée de l'échantillon.
Segmentation des données et intégration hétérogène multiprovenance
Pour un test rigoureux, les données de janvier 2010 à décembre 2022 ont été attribuées à l'intervalle d'apprentissage-validation, contenant 156 observations, qui sert à entraîner les facteurs d'évolution des quotas et le réseau résiduel de compensation des quotas. La période de janvier 2023 à décembre 2025 est réservée comme ensemble de test hors échantillon mis à part, comprenant 36 observations. Pourquoi cette période a-t-elle été choisie comme ultime banc d'essai ? La raison est que ces trois années coïncident avec l'accélération de la construction de systèmes électriques de nouveau type, amplifiée par des événements de haute température à grande échelle liés à un fort phénomène El Niño, ainsi qu'une croissance rapide et inégale de la production d'énergie renouvelable distribuée. Le réseau électrique a fait face à des pressions sans précédent en matière de chaînes d'approvisionnement matériel et d'allocation de la main-d'œuvre pour les réparations.
La sélection scientifique et la définition quantitative des facteurs déterminants des coûts constituent la base permettant de garantir que le réseau résiduel d'apprentissage automatique puisse efficacement capturer les fluctuations systématiques. En se fondant sur la logique de gestion des coûts opérationnels standards dans les systèmes électriques, cette étude franchit la dimension unique de la prévision financière traditionnelle, qui repose uniquement sur les flux de trésorerie historiques, et reconstruit plutôt l'ingénierie des caractéristiques à partir de quatre limites fondamentales : l'échelle des actifs physiques, les conditions d'exploitation et de maintenance, l'évolution macroéconomique et l'environnement climatique externe, en utilisant des journaux d'exploitation originaux et des comptes de systèmes externes. Dans le processus réel de modélisation, pour plus de 130 indicateurs initiaux issus de l'intégration de systèmes multiples, cette étude utilise des tests de corrélation de Pearson afin d'éliminer les variables redondantes fortement colinéaires, avec un seuil de |r| > 0,85. Sur la base des connaissances préalables d'experts chevronnés en réseaux électriques, 42 caractéristiques d'entrée fondamentales sont finalement sélectionnées pour former la matrice de caractéristiques Xt. Afin de présenter clairement la structure sous-jacente et la distribution du tenseur d'entrée, Tableau 2 sélectionne 12 caractéristiques fondamentales représentatives parmi les quatre dimensions d'évaluation ci-dessus et résume leurs statistiques descriptives sur la période d'observation.
Afin d'illustrer davantage la base spatiale et topologique du système de caractéristiques multipoints, Figure 3 présente une topologie schématique anonymisée du réseau électrique provincial étudié. La figure superpose les postes électriques par niveau de tension, les corridors de transport, les grappes de sources renouvelables distribuées, les centres de charge et des zones représentatives de perturbations environnementales. Cette topologie permet d'expliquer pourquoi les coûts de production et d'exploitation sont conjointement influencés par l'échelle des actifs, la structure du réseau, l'intensité des réparations d'urgence et les chocs climatiques externes. Elle fournit également une base d'interprétation spatiale pour les variables pilotes des résidus utilisées dans le module de compensation XGBoost.
Tableau 2 montre que les variables explicatives issues de différentes dimensions économiques présentent des formes statistiques nettement distinctes. Les variables relatives aux actifs physiques, représentant la dynamique endogène du développement des entreprises, telles que la capacité des postes électriques et la longueur des lignes, possèdent des écarts types relativement stables et des coefficients d’asymétrie concentrés entre 0,1 et 0,8. L’ensemble de leur structure de données suit approximativement une distribution normale, reflétant objectivement une caractéristique de développement stable du réseau électrique au cours du cycle de construction des infrastructures. En net contraste figurent, en bas du tableau, les variables météorologiques et les perturbations environnementales externes. Par exemple, le nombre cumulé de jours de température élevée atteignant le seuil d’alerte au cours des 90 derniers jours et l’indice d’impact des déclenchements de lignes présentent une asymétrie fortement orientée vers la droite, avec des coefficients d’asymétrie respectifs de 2,15 et 2,45. Cette distribution typiquement à queue lourde confirme un point critique objectif, impossible à ignorer dans l’exploitation et la maintenance réelles du réseau électrique : bien que les catastrophes météorologiques extrêmes soient relativement rares sur une échelle annuelle, une fois déclenchées, elles provoquent souvent des augmentations exponentielles des besoins en main-d’œuvre de réparation et en consommation de pièces de rechange. D’un autre point de vue, la forte hétérogénéité et l’asymétrie marquée vers les valeurs extrêmes dans la distribution de ces caractéristiques multiples révèlent les limites théoriques des modèles traditionnels de séries chronologiques linéaires, tels que ARIMAX, qui reposent sur les hypothèses de normalité et d’homoscédasticité lorsqu’ils tentent de modéliser les coûts complexes du réseau électrique. Ceci établit non seulement plus fermement la pertinence de l’introduction d’un module d’apprentissage automatique allant au-delà de la base comptable physique, mais fournit également un soutien statistique solide au choix, par cet article, du modèle arborescent XGBoost, capable de traiter efficacement les distributions creuses de caractéristiques et les applications non linéaires afin d’approcher les résidus de coût.
Configuration du système d'optimisation et d'évaluation des hyperparamètres
Après avoir déterminé l'espace d'entrée des caractéristiques, le réglage des hyperparamètres du modèle influence directement les performances d'ajustement du réseau d'approximation des résidus. Étant donné que le réseau de compensation XGBoost implique plusieurs paramètres, tels que la profondeur des arbres (max depth), le taux d'apprentissage et les termes de pénalité de régularisation, et que ces paramètres présentent des interactions non linéaires, la méthode classique de recherche en grille n'entraîne pas seulement une complexité calculatoire élevée, mais risque également de rester piégée dans des minima locaux dans des espaces de grande dimension. Par conséquent, cette étude introduit l'estimateur par densité de noyau structuré en arbre (Tree-structured Parzen Estimator, TPE), une méthode d'optimisation bayésienne, dans le processus d'ajustement des paramètres. L'algorithme TPE peut orienter dynamiquement les directions d'échantillonnage suivantes à l'aide des retours de la fonction de perte issus des évaluations précédentes. En construisant une estimation de la densité de noyau a posteriori (KDE) de la variable objective, il réduit de manière adaptative l'espace de recherche des paramètres, permettant ainsi au modèle de s'approcher de la configuration optimale globale des hyperparamètres sans coût calculatoire élevé. L'objectif d'optimisation TPE consistait à minimiser l'erreur quadratique moyenne (RMSE) sur l'ensemble de validation sur 100 itérations, avec arrêt précoce après 50 tours sans amélioration.
Après avoir terminé l'optimisation des paramètres sur le jeu de validation interne, afin d'évaluer objectivement la performance finale de chaque modèle sur le jeu de test hors échantillon et de répondre aux exigences quantitatives des régulateurs en matière de vérification des coûts, cette étude utilise l'erreur moyenne absolue en pourcentage (MAPE) pour quantifier l'écart relatif dans la séquence prédite. Parallèlement, afin de répondre au besoin pratique de contrôler les échecs extrêmes de prédiction des coûts dans les opérations, l'erreur quadratique moyenne (RMSE) est également introduite afin d'imposer des pénalités plus fortes aux erreurs plus importantes. Enfin, le coefficient de détermination, R2, quantifie le pouvoir explicatif global de la régression par rapport à la variance réelle de la cible.
Les définitions mathématiques des indicateurs sont les suivantes :
(12)
(13)
(14)
où
représente le coût réel de production et d'exploitation pendant la période t,
représente le coût prédit par le modèle,
représente le coût réel moyen dans l'échantillon de test, et N est le nombre d'échantillons dans l'ensemble de test.