Article de recherche

Prévision rétrospective utilisant des données de grille provinciales et un modèle hybride Physique-IA basé sur des quotas

22 vues

DOI :

10.3791/72395

28 août 2026

Dans cet article

Résumé

Cette étude propose un modèle hybride de prévision des coûts pour les réseaux électriques qui combine des quotas de coûts physiques avec des ajustements dynamiques macroéconomiques et technologiques, ainsi qu'une compensation des résidus basée sur XGBoost. Atteignant une MAPE de 2,34 %, il équilibre précision et interprétabilité, répondant ainsi aux besoins de transparence réglementaire dans l'établissement des tarifs.

Résumé

La transition énergétique mondiale et les réformes en cours sur les marchés de l'électricité obligent les entreprises de réseau électrique à concilier une fourniture d'énergie fiable avec des réglementations tarifaires de transport et de distribution de plus en plus strictes. Les méthodes traditionnelles de budgétisation fondées sur l'extrapolation historique reflètent souvent mal la base physique du fonctionnement des actifs, tandis que les modèles d'apprentissage automatique pilotés par les données atteignent une grande précision prédictive mais manquent de transparence nécessaire à la vérification réglementaire des coûts. Pour surmonter ce compromis entre précision prévisionnelle et interprétabilité, cette étude propose un modèle hybride de prévision des coûts basé sur des quotas de coût. Le cadre utilise des quotas opérationnels normalisés comme référence physique pour la budgétisation et intègre un mécanisme dynamique d'évolution des quotas piloté par les conditions macroéconomiques et les progrès technologiques. Le modèle Extreme Gradient Boosting (XGBoost) est utilisé pour capturer les résidus non linéaires échappant aux estimations fondées sur les quotas, tandis que la méthode SHAP (Shapley Additive exPlanations) permet d'interpréter la contribution des principaux facteurs de coût. Le modèle a été évalué à l'aide de 16 ans de données opérationnelles anonymisées provenant d'un réseau électrique provincial en Chine. Il a atteint une erreur moyenne absolue en pourcentage (MAPE) de 2,34 %, réduisant les erreurs de prévision de 61,8 %, 46,6 % et 34,1 % par rapport aux modèles SARIMAX, XGBoost seul et Attention-LSTM, respectivement. Le cadre proposé intègre les principes d'ingénierie des quotas de coût avec une intelligence artificielle explicative, offrant à la fois des prévisions précises des coûts à long terme et un outil de décision transparent pour la vérification réglementaire des coûts autorisés.

Introduction

La transition énergétique mondiale redéfinit la gestion des actifs du réseau électrique et les pratiques opérationnelles par l'intégration de la production décentralisée d'énergie renouvelable, l'augmentation des événements météorologiques extrêmes et le déploiement généralisé des technologies de l'Internet des objets, éléments qui exigent tous une plus grande flexibilité opérationnelle et davantage de ressources de maintenance afin d'assurer la fiabilité du système1,2. Parallèlement, les organismes de régulation de l'électricité ont renforcé la surveillance des tarifs de transport et de distribution à travers des cadres tels que le RIIO au Royaume-Uni et les examens du taux de rendement de la Federal Energy Regulatory Commission aux États-Unis, en mettant l'accent sur la transparence dans la justification des coûts3. La Chine a adopté de manière similaire un mécanisme réglementaire de « coût autorisé plus rendement raisonnable », exigeant des services publics qu'ils démontrent des liens clairs entre les activités d'ingénierie et les dépenses financières4. Toutefois, les services publics manquent souvent d'outils quantitatifs transparents reliant les opérations physiques des actifs aux prévisions de coûts, ce qui limite l'efficacité de la vérification réglementaire des coûts5.

Les approches prévisionnelles existantes présentent des limitations importantes dans ce contexte6. Les méthodes traditionnelles, notamment la budgétisation incrémentielle et les modèles basés sur ARIMA, supposent des tendances historiques relativement stables et donnent souvent de mauvais résultats en cas de changements structurels provoqués par des fluctuations économiques ou des conditions météorologiques extrêmes7. En revanche, les modèles modernes d'apprentissage automatique, tels que les architectures LSTM et Transformer, offrent une grande précision prédictive pour les prévisions à court terme, mais manquent de l'interprétabilité ingénierique nécessaire à la prise de décision réglementaire8,9. Bien que des approches hybrides récentes combinent des techniques statistiques et d'apprentissage automatique, elles négligent généralement les quotas normalisés de coûts d'ingénierie qui sont à la base des systèmes comptables des réseaux électriques10. Pour remédier à ces limites, cette étude propose un cadre prévisionnel hybride fondé sur les quotas, qui associe une évolution dynamique des quotas à une correction résiduelle basée sur l'apprentissage automatique, préservant ainsi l'interprétabilité ingénierique tout en améliorant la précision des prévisions.

Une importante direction de recherche découle de la régulation incitative dans les industries en monopole naturel, notamment le mécanisme RPI-X au Royaume-Uni et le cadre chinois de vérification des coûts autorisés11. Ces études évaluent principalement l'efficacité opérationnelle à l'aide de l'analyse par enveloppement des données (DEA) et de l'analyse stochastique de frontière (SFA)12. Des travaux antérieurs ont examiné les relations à long terme entre les dépenses en capital (CAPEX), les dépenses d'exploitation (OPEX) et l'efficacité des coûts afin d'appuyer la régulation tarifaire13,14. Bien que ces approches fournissent des aperçus macroéconomiques précieux, leurs résultats sont généralement exprimés sous forme de scores d'efficacité relative plutôt que de prévisions monétaires adaptées à la budgétisation annuelle15,16. En outre, les modèles de frontière supposent généralement des structures d'actifs physiques et des conditions d'exploitation relativement stables, ce qui limite leur capacité à capturer les changements brusques des coûts provoqués par le vieillissement du matériel, le remplacement des infrastructures ou une croissance rapide de la demande17,18.

Une deuxième direction de recherche s'intéresse aux modèles prévisionnels fondés sur la statistique et l'intelligence artificielle. Les premières études utilisaient la régression linéaire multiple et les modèles autorégressifs intégrés à moyenne mobile avec variables exogènes (ARIMAX) pour la prédiction des coûts19. Plus récemment, la régression par vecteurs de support, les forêts aléatoires, les modèles XGBoost, LSTM et Transformer ont nettement amélioré les performances prévisionnelles en exploitant les relations non linéaires et les espaces de caractéristiques en haute dimension20,21,22. Ces approches intègrent fréquemment des indicateurs macroéconomiques tels que la demande d'électricité, les indices des prix à la production (PPI) et des variables climatiques23. Toutefois, les coûts de fonctionnement du réseau électrique découlent d'activités d'ingénierie, de la détérioration des équipements, de la planification de la maintenance et de décisions de gestion, et non pas uniquement de variables macroéconomiques24. Par conséquent, les modèles purement basés sur les données agissent souvent comme des « boîtes noires », ce qui rend difficile l'explication des coûts prévus lors des examens réglementaires ou de la vérification des coûts autorisés25,26.

La gestion des quotas de coûts techniques offre une solution potentielle à ce défi27. La méthode de calcul des coûts par activité (ABC) s'appuie depuis longtemps sur des quotas opérationnels standardisés pour estimer les besoins en main-d'œuvre, en matériaux, en équipements et en maintenance pour les opérations courantes du réseau28. Les principales entreprises électriques chinoises ont élaboré des bases de données complètes couvrant les activités d'inspection, de maintenance, d'essai, de réparation et de remplacement d'équipements. Toutefois, ces normes techniques sont principalement utilisées pour le règlement des projets et les audits, plutôt que pour des prévisions dynamiques à long terme29,30. De plus, les normes de quotas ne sont généralement révisées que tous les quelques années, ce qui les rend insuffisamment réactives face à l'évolution des prix des matières premières, aux progrès technologiques et aux pratiques opérationnelles31. L'application de systèmes de quotas à des millions d'actifs distribués pose également des défis informatiques considérables pour les prévisions à grande échelle32.

Malgré des progrès significatifs dans la prévision statistique, l'apprentissage automatique et la gestion des coûts en ingénierie, aucun cadre existant n'intègre efficacement les quotas normalisés de coûts en ingénierie, l'ajustement dynamique de la macroéconomie et l'apprentissage automatique explicatif au sein d'un modèle unifié de prévision pour la vérification réglementaire des coûts. On a émis l'hypothèse que la combinaison de quotas de coûts en évolution dynamique avec un apprentissage résiduel fondé sur XGBoost pourrait améliorer la précision des prévisions à long terme tout en préservant la transparence technique requise pour la prise de décision réglementaire. Afin de tester cette hypothèse, un cadre hybride de prévision fondé sur les quotas a été développé, intégrant la modélisation physique des coûts, des mécanismes d'ajustement macroéconomique et technologique, une compensation résiduelle par XGBoost et une interprétation du modèle basée sur SHAP. L'approche proposée vise à fournir à la fois des prévisions précises des coûts à long terme et des preuves transparentes afin d'appuyer la vérification des coûts autorisés dans le cadre de la réglementation moderne des marchés de l'électricité.

Protocole

Cette étude a utilisé des données opérationnelles et financières anonymisées, collectées auprès d'un réseau électrique provincial dans l'est de la Chine. Toutes les données ont été regroupées et désidentifiées avant l'analyse, et aucune information personnelle identifiable ou sensible au niveau individuel n'a été incluse. Par conséquent, une approbation éthique n'était pas requise. L'accès aux données et leur analyse se sont conformés aux réglementations applicables en matière de protection des données ainsi qu'aux accords institutionnels régissant les informations du secteur électrique.

Aperçu du cadre de prévision

Afin d'intégrer les approches prévisionnelles fondées sur la physique et celles basées sur les données, un cadre prévisionnel hybride a été mis au point, combinant les quotas de coûts d'ingénierie avec l'apprentissage automatique. Plutôt que de simplement combiner plusieurs algorithmes, ce cadre suit le principe selon lequel les modèles physiques établissent la prévision de base, tandis que l'apprentissage automatique compense les erreurs résiduelles. Cette conception garantit que le processus de prévision s'appuie sur les mécanismes physiques sous-jacents aux activités de production et d'exploitation du réseau électrique, plutôt que de se fonder uniquement sur une extrapolation historique des coûts.

Le cadre établit d'abord une correspondance hiérarchique entre les actifs du réseau électrique, les activités opérationnelles normalisées et les comptes de coûts financiers. Les coûts de production et d'exploitation sont considérés comme des représentations monétaires des ressources consommées par les actifs physiques — notamment les sous-stations, les lignes de transport, les alimentations de distribution, les dispositifs de mesure et l'équipement numérique d'inspection — lors d'activités courantes telles que l'inspection, la maintenance, les essais, les réparations et les remplacements. Les quotas de coût constituent le lien entre les charges de travail techniques mesurables et les dépenses financières correspondantes.

Comme illustré dans la Figure 1, les quotas de coût fonctionnent comme des unités comptables normalisées intégrées à l'ensemble du processus d'exploitation et de maintenance des actifs, plutôt que comme des règles abstraites d'allocation financière. Les charges de travail des actifs au niveau le plus bas sont converties en quotas opérationnels normalisés, puis associées à des catégories de coûts, notamment la main-d'œuvre, les matériaux, les équipements de construction, les services externalisés et les fournitures d'urgence. Ce mappage hiérarchique préserve l'interprétabilité technique et la traçabilité réglementaire tout au long du processus de prévision, et fournit la base physique pour la construction du modèle statique de quota de référence.

Aperçu du flux de travail méthodologique

Le cadre de prévision proposé comprend trois étapes séquentielles : (1) la construction d'une référence physique à partir de quotas de charge de travail par ressource, (2) l'évolution dynamique des quotas de coût par ajustements macroéconomiques et technologiques, et (3) une compensation des résidus fondée sur l'apprentissage automatique afin de capturer les effets non linéaires systématiques. Comme illustré dans Figure 1, le cadre établit une correspondance hiérarchique allant des ressources et activités opérationnelles normalisées de niveau inférieur jusqu'aux prévisions des coûts de production et d'exploitation. Les détails de mise en œuvre de chaque étape sont décrits dans les sous-sections suivantes.

Modèle de coût de base physique fondé sur les charges de travail au niveau des actifs

Le coût de production et d'exploitation d'un réseau électrique, Ctotal, comprend les dépenses associées à plusieurs activités commerciales, notamment l'exploitation des sous-stations, l'entretien des lignes de transport, la gestion du réseau de distribution, le service à la clientèle et les systèmes d'appui. Dans cette étude, on suppose que le coût d'exploitation de base est déterminé par la charge de travail générée par chaque activité opérationnelle normalisée et par son quota de coût correspondant.

Le coût de base statique est calculé comme suit :

Formule mathématique pour le calcul de C_base,t avec des symboles de sommation ; utilisée dans l'analyse des données.   (1)

Vi,k,t désigne la charge de travail associée à la i-ème ressource ou tâche opérationnelle dans la catégorie commerciale k pendant la période t, et Qi,k représente le coût unitaire normalisé correspondant défini par le système de quotas de coûts techniques. La catégorie commerciale inclut les principales fonctions opérationnelles telles que la maintenance des postes électriques, l'inspection des lignes de transport, l'exploitation du réseau de distribution et le service à la clientèle. La double sommation agrège les coûts de toutes les activités opérationnelles normalisées afin d'estimer la dépense théorique de base nécessaire au maintien d'un fonctionnement normal du réseau.

L'équation (1) établit la relation physique entre les charges de travail d'ingénierie et les dépenses financières en associant directement des activités opérationnelles normalisées à des comptes de coûts. Contrairement aux modèles prévisionnels purement statistiques, cette formulation fournit une référence d'ingénierie interprétable qui sert de fondement aux ajustements dynamiques ultérieurs des quotas et à la correction des résidus basée sur l'apprentissage automatique. Cette équation a été élaborée à partir des pratiques opérationnelles et du système de quotas de coûts utilisés par les entreprises provinciales de réseau électrique en Chine. Tableau 1 résume les notations utilisées dans l'équation (1), incluant la charge de travail (Vi,k,t), le coût unitaire normalisé (Qi,k), le nombre de tâches opérationnelles (Nk) et l'indice de catégorie d'activité (k).

Mécanisme d'évolution dynamique des quotas en cas de perturbations environnementales externes

Les quotas de coût standardisés (Qi,k) fournissent une référence interprétable sur le plan physique, mais ne tiennent pas compte des changements des conditions macroéconomiques ni des progrès technologiques. Afin d'améliorer leur pertinence à long terme, un mécanisme d'évolution dynamique a été introduit pour ajuster les quotas de référence en fonction à la fois de l'inflation des prix et des gains d'efficacité liés à la technologie.

Le premier ajustement tient compte des variations des coûts d'approvisionnement résultant de l'inflation macroéconomique. L'exploitation et la maintenance du réseau électrique dépendent fortement de matières premières en vrac, telles que le cuivre, l'aluminium et l'acier au silicium, dont les prix sont étroitement liés aux fluctuations de l'indice des prix à la production (IPP). Étant donné que Équation pour le calcul de l'indice économique, impliquant un indicateur du niveau des prix, symbole I{PPI,t}. est un indice ayant une valeur de base de 100, il est d'abord converti en un taux d'inflation normalisé :

Formule de l'indice des prix, calcul de l'IPPI, équation pour l'analyse de l'inflation et la recherche économique.   (2)

Sur cette base, la fonction de correction des prix Formule d'équilibre statique Φ(I[PPI],t), équation, physique, principe d'équilibre, analyse de recherche. est définie comme suit :

Formule d'équilibre statique, notation du produit Σ, concept mathématique éducatif, analyse d'équation.   (3)

où Équilibre statique, ΣF=0, MA=0 ; le schéma montre des forces équilibrées pour l'analyse structurelle, usage pédagogique. est un vecteur de poids retardé de longueur L satisfaisant

Formule d'équilibre statique, Σωτ=1, ωτ≥0, équation mathématique pour l'analyse par sommation.

La structure de décalage représente la transmission différée de l'inflation macroéconomique aux coûts d'approvisionnement dans la chaîne d'approvisionnement du réseau électrique. La conversion de l'indice IPP en un taux d'inflation normalisé préserve l'effet cumulatif des variations de prix tout en évitant les biais d'échelle associés à l'utilisation directe des valeurs de l'indice. Les équations (2) et (3) sont adaptées de modèles établis de correction de l'inflation macroéconomique, la structure de décalage étant calibrée pour les cycles d'approvisionnement du secteur électrique33,34.

Les progrès technologiques ont été intégrés au moyen d’un facteur de réduction des coûts reflétant l'amélioration de l'efficacité opérationnelle résultant d'avancées telles que l'inspection par véhicules aériens sans pilote, la robotique intelligente et les technologies numériques de maintenance. Le facteur d'ajustement technologique est défini comme suit :

Équation du modèle économique, Γ(E_tech,t)=1-α·ln(1+β·E_tech,t), illustrant la croissance technologique.  (4)

Dans cette partie, α et β sont des coefficients d'élasticité empiriques estimés à partir de données de panel historiques en utilisant la méthode des moindres carrés non linéaires. Afin de garantir que le facteur de progrès technologique représente toujours une réduction raisonnable du coût unitaire du quota, le processus d'estimation des paramètres impose la contrainte 0 < Γ(Etech,t) ≤ 1. Il convient de noter que ce facteur reflète principalement l'amélioration d'efficacité à long terme découlant du remplacement par des technologies matures. L'équation (4) est originale à cette étude, adaptant le concept de courbe d'apprentissage provenant de la littérature sur les coûts des technologies énergétiques35,36 aux opérations de maintenance du réseau. Les coûts supplémentaires pouvant survenir au stade initial du déploiement d'équipements numériques, tels que l'exploitation parallèle des anciens et nouveaux systèmes, l'intégration des plateformes, les tests de communication et la maintenance supplémentaire, ne sont pas déduits de force du quota de référence ; au lieu de cela, ils sont identifiés par le module ultérieur de compensation des résidus basé sur l'apprentissage automatique :

Formule d'équilibre statique, C_quota,t = C_base,t · Φ(PPI,t) · Γ(E_tech,t), équations, analyse.  (5)

où Cbase,t désigne le coût de base statique calculé à partir des charges de travail des ressources de base et des quotas de coûts de fonctionnement standardisés ; Formule d'équilibre statique Φ(I[PPI],t), équation, physique, principe d'équilibre, analyse de recherche. capture l'effet de transmission des fluctuations macroéconomiques des prix sur les matériaux, l'équipement et les prix des services externes ; et Γ(Etech,t) reflète la réduction des coûts unitaires d'exploitation et de maintenance fondée sur l'efficacité après la maturation technologique. Grâce à ce mécanisme d'évolution dynamique, la référence de quota ne demeure plus sur une base comptable statique, mais peut s'ajuster de manière adaptative aux changements des environnements économiques et des conditions technologiques. L'équation (5) est originale à cette étude et représente l'intégration novatrice des corrections de prix et de technologie dans le cadre de référence des quotas.

Capture systématique des résidus non linéaires dans le cadre de contraintes de quota

Malgré des corrections évolutives complexes, le modèle de quota génère inévitablement des écarts systématiques lorsqu'il est confronté à des perturbations météorologiques imprévues liées à des catastrophes et à des directives politiques soudaines, telles que l'augmentation des coûts liés au traitement des réclamations des clients pendant les périodes de réduction temporaire des tarifs. Cet écart constitue le terme résiduel des deux côtés de l'équation :

Rt=Cactual,t-Cquota,t  (6)

Étant donné que les règles physiques conventionnelles ne peuvent pas expliquer cet aspect, l'apprentissage automatique peut pallier ces limitations. Afin d'éviter le fléau de la dimensionnalité provoqué par des caractéristiques en haute dimension, cette étude utilise l'algorithme XGBoost, basé sur des ensembles d'arbres de décision, pour modéliser la relation non linéaire Rt37,38. Une matrice de caractéristiques fortes perturbations Xt, incluant des paramètres météorologiques tels que le nombre annuel de jours extrêmement froids Dice et l'intensité des politiques macroéconomiques, est définie.

Pour un compensateur non linéaire composé d'arbres de régression, la logique de génération du résidu prédit Symbole R-chapeau pour l'analyse de convergence, illustrant la méthode statistique, formule en format graphique. peut s'exprimer comme suit39 :

Équation de prédiction par boosting gradient, formule mathématique, Σ fm(Xt), algorithme, modélisation de données.   (7)

où F désigne l'espace de toutes les structures possibles d'arbres de classification et de régression. Afin d'équilibrer précision de l'ajustement et prévention du surajustement, une fonction objective régularisée contenant un terme de pénalité de complexité structurelle est construite et minimisée à la m-ième itération :

Équation d'optimisation mathématique, exprimant une somme pour l'ajustement de l'analyse de données.   (8)

Notation en ket de superposition quantique |0⟩, formule de mécanique quantique, utilisée dans les schémas physiques. est une fonction de perte convexe mesurant l'écart entre le résidu réel et le résidu prédit. Cet article adopte la perte de Huber afin d'améliorer la robustesse du modèle face aux dépenses anormalement élevées. Le terme de régularisation Symbole de la loi d'Ohm ; fonction Oméga dans une équation mathématique ; représentation de formule. est utilisé pour limiter la complexité de la structure de l'arbre et est défini par :

Équation d'optimisation Ω(fm)=γTm+(1/2)λ||wm||^2 ; formule mathématique ; usage pédagogique.   (9)

où Tm représente le nombre de nœuds feuilles dans l'arbre m-ième, wm représente le vecteur de poids correspondant des feuilles, et γ et λ désignent respectivement le coefficient de pénalité du nombre de nœuds feuilles et le coefficient de régularisation des poids.

L'équation finale de prévision est la suivante :

Équation de modélisation économique, formule d'allocation des ressources, méthode d'analyse financière, image d'équation.   (10)

Étendu davantage comme suit :

Équation de référence dynamique du quota ; compensation non linéaire des résidus ; méthode d'analyse de formule.   (11)

La formule ci-dessus représente mathématiquement la structure en boucle fermée du modèle de prévision proposé. La demande finale de coût de production et d'exploitation n'est pas directement générée par le modèle d'apprentissage automatique ; elle est plutôt obtenue en superposant la compensation résiduelle non linéaire identifiée par le module d'apprentissage automatique à la référence dynamique du quota. Parmi ces composantes, les facteurs de prix et de technologie reflètent principalement l'évolution dynamique de la référence du quota, tandis que les facteurs difficiles à caractériser explicitement par des règles, tels que les chocs climatiques, les perturbations politiques et les pics d'événements de réparation, sont captés par le module de compensation résiduelle basé sur l'apprentissage automatique. Les équations (10) et (11) sont originales à cette étude et combinent la référence physique avec la capture résiduelle fondée sur l'apprentissage automatique dans un cadre unifié de prévision.

Figure 2 montre que les résultats de prévision du modèle proposé présentent une logique claire de génération hiérarchique. D'une part, le quota de référence fournit une base physique stable, transparente et vérifiable pour la demande de coût ; d'autre part, les ajustements de prix, les effets technologiques et les résidus de chocs externes permettent au modèle de s'adapter aux changements dynamiques dans des environnements complexes. Contrairement aux modèles boîte noire qui produisent directement des valeurs prédites, cette structure de décomposition peut clairement révéler « pourquoi les coûts augmentent ou diminuent », renforçant ainsi l'interprétabilité des résultats du modèle dans le cadre de l'examen budgétaire et de la régulation des tarifs de transport et de distribution.

Sources de données et procédures de collecte

Les modèles théoriques doivent être rigoureusement validés par des données empiriques afin de démontrer leur utilité pratique. Étant donné que les données financières fondamentales du secteur électrique impliquent des informations sensibles liées au fonctionnement des infrastructures nationales, cette étude extrait des données comptables mensuelles précises et anonymisées provenant d'un réseau électrique provincial typique dans l'est de la Chine, désigné pour plus de commodité comme E-Grid, couvrant 16 années civiles consécutives allant de 2010 à 2025. Cette province a connu un cycle économique typique marqué par un passage d'une croissance tirée par les industries lourdes traditionnelles à une croissance axée sur la fabrication de haute technologie, le taux de croissance annuel composé de l'échelle des actifs du réseau atteignant 7,4 %. L'évolution complexe de sa structure de coûts présente donc une pertinence potentielle pour d'autres systèmes électriques en développement rapide. Les données proviennent de trois sources principales : (1) les journaux internes d'exploitation et de maintenance, enregistrant les charges de travail au niveau des actifs, les fréquences d'inspection et les interventions de réparation ; (2) les systèmes comptables financiers fournissant des états mensuels des coûts relatifs à la main-d'œuvre, aux matériaux, à l'équipement et aux services externalisés ; et (3) les bases de données environnementales externes, incluant les relevés météorologiques de l'Administration météorologique de Chine et les indicateurs macroéconomiques du Bureau national des statistiques.

Contrôle de qualité et traitement des données manquantes

Pour plus de 130 indicateurs initiaux intégrés à partir de systèmes multiples, une procédure rigoureuse de contrôle de qualité a été mise en œuvre. Les données manquantes, représentant moins de 3 % des observations totales, ont été traitées par interpolation linéaire pour les variables continues présentant des tendances temporelles, et par imputation par la valeur modale pour les indicateurs catégoriels. Les valeurs aberrantes ont été identifiées à l’aide de la méthode de l’intervalle interquartile (IIQ), les valeurs dépassant 3,0 fois l’IIQ au-dessus du troisième quartile étant winsorisées au 99e centile afin de préserver l’intégrité des données et d’atténuer la distorsion due aux valeurs extrêmes.

Considérations relatives à la taille de l'échantillon

Le jeu de données comprend 192 observations mensuelles (janvier 2010 à décembre 2025), dont 156 observations (2010–2022) attribuées à l'entraînement et à la validation, et 36 observations (2023–2025) réservées à des tests hors échantillon. Bien que cette taille d'échantillon soit relativement modeste pour des applications d'apprentissage profond, elle convient bien à l'algorithme XGBoost, spécifiquement conçu pour offrir de bonnes performances avec des jeux de données tabulaires de petite à moyenne taille grâce à ses mécanismes de régularisation et d'élagage des arbres. Afin d'atténuer les risques éventuels de surapprentissage, (1) des pénalités strictes de régularisation ont été appliquées (γ = 0,1, λ = 1,0), (2) un arrêt précoce avec une tolérance de 50 cycles a été mis en œuvre, et (3) des contraintes conservatrices sur la profondeur des arbres ont été imposées (profondeur maximale = 5). Ces mesures garantissent conjointement la stabilité du modèle et sa capacité de généralisation, malgré la taille limitée de l'échantillon.

Segmentation des données et intégration hétérogène multiprovenance

Pour un test rigoureux, les données de janvier 2010 à décembre 2022 ont été attribuées à l'intervalle d'apprentissage-validation, contenant 156 observations, qui sert à entraîner les facteurs d'évolution des quotas et le réseau résiduel de compensation des quotas. La période de janvier 2023 à décembre 2025 est réservée comme ensemble de test hors échantillon mis à part, comprenant 36 observations. Pourquoi cette période a-t-elle été choisie comme ultime banc d'essai ? La raison est que ces trois années coïncident avec l'accélération de la construction de systèmes électriques de nouveau type, amplifiée par des événements de haute température à grande échelle liés à un fort phénomène El Niño, ainsi qu'une croissance rapide et inégale de la production d'énergie renouvelable distribuée. Le réseau électrique a fait face à des pressions sans précédent en matière de chaînes d'approvisionnement matériel et d'allocation de la main-d'œuvre pour les réparations.

La sélection scientifique et la définition quantitative des facteurs déterminants des coûts constituent la base permettant de garantir que le réseau résiduel d'apprentissage automatique puisse efficacement capturer les fluctuations systématiques. En se fondant sur la logique de gestion des coûts opérationnels standards dans les systèmes électriques, cette étude franchit la dimension unique de la prévision financière traditionnelle, qui repose uniquement sur les flux de trésorerie historiques, et reconstruit plutôt l'ingénierie des caractéristiques à partir de quatre limites fondamentales : l'échelle des actifs physiques, les conditions d'exploitation et de maintenance, l'évolution macroéconomique et l'environnement climatique externe, en utilisant des journaux d'exploitation originaux et des comptes de systèmes externes. Dans le processus réel de modélisation, pour plus de 130 indicateurs initiaux issus de l'intégration de systèmes multiples, cette étude utilise des tests de corrélation de Pearson afin d'éliminer les variables redondantes fortement colinéaires, avec un seuil de |r| > 0,85. Sur la base des connaissances préalables d'experts chevronnés en réseaux électriques, 42 caractéristiques d'entrée fondamentales sont finalement sélectionnées pour former la matrice de caractéristiques Xt. Afin de présenter clairement la structure sous-jacente et la distribution du tenseur d'entrée, Tableau 2 sélectionne 12 caractéristiques fondamentales représentatives parmi les quatre dimensions d'évaluation ci-dessus et résume leurs statistiques descriptives sur la période d'observation.

Afin d'illustrer davantage la base spatiale et topologique du système de caractéristiques multipoints, Figure 3 présente une topologie schématique anonymisée du réseau électrique provincial étudié. La figure superpose les postes électriques par niveau de tension, les corridors de transport, les grappes de sources renouvelables distribuées, les centres de charge et des zones représentatives de perturbations environnementales. Cette topologie permet d'expliquer pourquoi les coûts de production et d'exploitation sont conjointement influencés par l'échelle des actifs, la structure du réseau, l'intensité des réparations d'urgence et les chocs climatiques externes. Elle fournit également une base d'interprétation spatiale pour les variables pilotes des résidus utilisées dans le module de compensation XGBoost.

Tableau 2 montre que les variables explicatives issues de différentes dimensions économiques présentent des formes statistiques nettement distinctes. Les variables relatives aux actifs physiques, représentant la dynamique endogène du développement des entreprises, telles que la capacité des postes électriques et la longueur des lignes, possèdent des écarts types relativement stables et des coefficients d’asymétrie concentrés entre 0,1 et 0,8. L’ensemble de leur structure de données suit approximativement une distribution normale, reflétant objectivement une caractéristique de développement stable du réseau électrique au cours du cycle de construction des infrastructures. En net contraste figurent, en bas du tableau, les variables météorologiques et les perturbations environnementales externes. Par exemple, le nombre cumulé de jours de température élevée atteignant le seuil d’alerte au cours des 90 derniers jours et l’indice d’impact des déclenchements de lignes présentent une asymétrie fortement orientée vers la droite, avec des coefficients d’asymétrie respectifs de 2,15 et 2,45. Cette distribution typiquement à queue lourde confirme un point critique objectif, impossible à ignorer dans l’exploitation et la maintenance réelles du réseau électrique : bien que les catastrophes météorologiques extrêmes soient relativement rares sur une échelle annuelle, une fois déclenchées, elles provoquent souvent des augmentations exponentielles des besoins en main-d’œuvre de réparation et en consommation de pièces de rechange. D’un autre point de vue, la forte hétérogénéité et l’asymétrie marquée vers les valeurs extrêmes dans la distribution de ces caractéristiques multiples révèlent les limites théoriques des modèles traditionnels de séries chronologiques linéaires, tels que ARIMAX, qui reposent sur les hypothèses de normalité et d’homoscédasticité lorsqu’ils tentent de modéliser les coûts complexes du réseau électrique. Ceci établit non seulement plus fermement la pertinence de l’introduction d’un module d’apprentissage automatique allant au-delà de la base comptable physique, mais fournit également un soutien statistique solide au choix, par cet article, du modèle arborescent XGBoost, capable de traiter efficacement les distributions creuses de caractéristiques et les applications non linéaires afin d’approcher les résidus de coût.

Configuration du système d'optimisation et d'évaluation des hyperparamètres

Après avoir déterminé l'espace d'entrée des caractéristiques, le réglage des hyperparamètres du modèle influence directement les performances d'ajustement du réseau d'approximation des résidus. Étant donné que le réseau de compensation XGBoost implique plusieurs paramètres, tels que la profondeur des arbres (max depth), le taux d'apprentissage et les termes de pénalité de régularisation, et que ces paramètres présentent des interactions non linéaires, la méthode classique de recherche en grille n'entraîne pas seulement une complexité calculatoire élevée, mais risque également de rester piégée dans des minima locaux dans des espaces de grande dimension. Par conséquent, cette étude introduit l'estimateur par densité de noyau structuré en arbre (Tree-structured Parzen Estimator, TPE), une méthode d'optimisation bayésienne, dans le processus d'ajustement des paramètres. L'algorithme TPE peut orienter dynamiquement les directions d'échantillonnage suivantes à l'aide des retours de la fonction de perte issus des évaluations précédentes. En construisant une estimation de la densité de noyau a posteriori (KDE) de la variable objective, il réduit de manière adaptative l'espace de recherche des paramètres, permettant ainsi au modèle de s'approcher de la configuration optimale globale des hyperparamètres sans coût calculatoire élevé. L'objectif d'optimisation TPE consistait à minimiser l'erreur quadratique moyenne (RMSE) sur l'ensemble de validation sur 100 itérations, avec arrêt précoce après 50 tours sans amélioration.

Après avoir terminé l'optimisation des paramètres sur le jeu de validation interne, afin d'évaluer objectivement la performance finale de chaque modèle sur le jeu de test hors échantillon et de répondre aux exigences quantitatives des régulateurs en matière de vérification des coûts, cette étude utilise l'erreur moyenne absolue en pourcentage (MAPE) pour quantifier l'écart relatif dans la séquence prédite. Parallèlement, afin de répondre au besoin pratique de contrôler les échecs extrêmes de prédiction des coûts dans les opérations, l'erreur quadratique moyenne (RMSE) est également introduite afin d'imposer des pénalités plus fortes aux erreurs plus importantes. Enfin, le coefficient de détermination, R2, quantifie le pouvoir explicatif global de la régression par rapport à la variance réelle de la cible.

Les définitions mathématiques des indicateurs sont les suivantes :

Formule de l'erreur absolue moyenne en pourcentage (MAPE) ; analyse statistique ; calcul de la mesure d'erreur.   (12)

Équation de l'erreur quadratique moyenne (RMSE) ; mesure d'erreur statistique ; illustration de la formule.    (13)

Formule R² pour l'analyse de régression statistique ; diagramme d'équation pour l'évaluation de la précision de l'ajustement des données.   (14)

Équation de la contrainte d'écoulement dynamique, C_actual,t, symbole dans une expression mathématique, mécanique des matériaux. représente le coût réel de production et d'exploitation pendant la période t, Équation de la concentration totale avec chapeaux, \( \hat{C}_{total,t} \), dans un contexte d'analyse scientifique. représente le coût prédit par le modèle, Équation en notation vectorielle, C_actual, avec une flèche au-dessus du C, en lien avec des concepts de physique. représente le coût réel moyen dans l'échantillon de test, et N est le nombre d'échantillons dans l'ensemble de test.

Résultats

Comparaison panoramique à dimensions réduites de la précision des prévisions

Lorsque tous les modèles optimisés par l'estimateur par zones parétiques (Tree-structured Parzen Estimator, TPE) ont été évalués sur le jeu de test hors échantillon 2023–2025, incluant les fluctuations liées à la reprise post-pandémique et les événements extrêmes de fortes températures, il a été possible de comparer objectivement la performance d'algorithmes courants de prévision. Afin d'effectuer une évaluation rigoureuse et complète, quatre modèles de référence représentant différentes approches méthodologiques ont été inclus : la lissage exponentiel traditionnel, représentant la prévision financière classique ; le modèle SARIMAX, représentant la modélisation linéaire des séries chronologiques saisonnières ; la régression XGBoost seule, représentant une approche entièrement basée sur les données et sans contrainte de quota ; et le réseau Attention-LSTM, un réseau à mémoire à long court terme amélioré par un mécanisme d'attention, couramment utilisé pour la prévision de longues séquences.

Comme indiqué dans le Tableau 3, le modèle Quota-ML proposé a surpassé tous les modèles de référence dans la prévision des coûts de production et d'exploitation pendant la période hors échantillon 2023–2025. Le modèle a atteint un MAPE de 2,34 %, réduisant ainsi l'erreur de prévision de 61,8 % par rapport au modèle SARIMAX (6,12 %) et de 34,1 % par rapport au modèle Attention-LSTM (3,55 %). Ses valeurs de RMSE (15,69 millions de CNY) et de MaxAE (23,05 millions de CNY) étaient inférieures à la moitié de celles du meilleur réseau neuronal suivant, tandis qu'une valeur de R2 de 0,957 indiquait que le modèle expliquait plus de 95 % de la variance des coûts observés. Ces résultats démontrent que l'intégration des quotas de coûts techniques, de l'évolution dynamique des quotas et d'une compensation des résidus basée sur XGBoost améliore considérablement la précision et la robustesse des prévisions par rapport aux méthodes classiques de séries chronologiques et aux modèles purement basés sur les données.

Comme illustré dans la Figure 4, les coûts réels de production et d'exploitation ont présenté des fluctuations saisonnières marquées ainsi que plusieurs périodes de pointe prononcées au cours de la période d'essai. En particulier, les coûts ont augmenté fortement pendant les épisodes de températures extrêmement élevées des mois de juillet et août 2024. Bien que le modèle Attention-LSTM ait capté la tendance saisonnière globale, ses prévisions étaient relativement lisses et sous-estimaient les augmentations soudaines des coûts liées aux réparations d'urgence, à la surcharge des équipements et à la consommation accrue de fournitures de secours. Le modèle XGBoost autonome a réagi plus efficacement aux fluctuations locales, mais s'est écarté de la trajectoire observée pendant plusieurs mois, faute de contraintes basées sur les quotas techniques. En revanche, le modèle Quota-ML proposé a suivi de près l'évolution des coûts observés tout au long de la période d'essai et a reproduit avec précision à la fois la forte hausse des coûts de l'été 2024 et le pic secondaire de l'été 2025.

Les performances supérieures du modèle Quota-ML démontrent l'intérêt de combiner les quotas de coûts d'ingénierie avec une correction résiduelle fondée sur l'apprentissage automatique. La référence dynamique de quota fournit une base physiquement interprétable qui reflète l'évolution des actifs du réseau électrique et des charges opérationnelles, empêchant ainsi un apprentissage non contraint à partir de séries chronologiques financières limitées. Le réseau de compensation résiduelle se concentre ensuite sur les perturbations non linéaires difficiles à représenter uniquement à l'aide de règles de quota d'ingénierie, notamment les événements météorologiques, les pics de demandes de travaux de maintenance et les changements liés aux politiques. En conséquence, le modèle proposé a obtenu les valeurs les plus faibles de MAPE et de RMSE parmi toutes les méthodes évaluées (Tableau 3) et a permis le suivi le plus précis des pics de coûts saisonniers et des événements extrêmes (Figure 4), démontrant ainsi son adéquation pour la prévision des coûts opérationnels et de production à long terme.

Validation par ablation des composants architecturaux fondamentaux

Dans un cadre hybride complexe comprenant des sous-modules imbriqués, la préoccupation académique principale porte généralement sur la question de savoir si le modèle souffre d’un « surdimensionnement ». Il est nécessaire de réaliser des expériences d’ablation internes en supprimant les composants essentiels afin d’explorer les véritables interrelations et niveaux de contribution de chaque module. Cette étude définit deux trajectoires de dégradation pour l’architecture. Premièrement, la Structure A, qui supprime le mécanisme d’évolution dynamique : la référence de quota est contrainte de force aux anciennes normes physiques statiques, en éliminant toute prise en compte de l’accumulation macroéconomique de l’inflation et des effets déflationnistes liés aux progrès technologiques des dernières années, et seule la référence statique historique Équations statiques d'équilibre, C_base,t ; formule mathématique de stabilité ; schéma éducatif. est raccordée au réseau résiduel. Deuxièmement, la Structure B, qui supprime le module de suivi résiduel non linéaire : le modèle dégénère complètement en une approche actuarielle, en interrompant la boucle de capture des fluctuations aléatoires pilotée par l’intelligence artificielle, et en prenant directement la valeur purement dynamique du calcul du quota Équation de chromatographie, C_quota,t, analyse d'ajustement spectral, schéma de recherche scientifique., après correction pour l’environnement macroéconomique, comme sortie finale. Le ratio de perte de variance expliquée est calculé à partir de la diminution relative du R2 entre le modèle complet et le modèle dégradé, défini comme suit :

Formule de la perte de variance expliquée ; analyse statistique ; méthode de calcul du R² ; interprétation des données.   (15)

Tableau 4’s une étude d'ablation révèle que les deux composantes du cadre proposé contribuent de manière significative à la précision des prévisions, mais la compensation résiduelle par apprentissage automatique joue un rôle plus déterminant. La suppression du mécanisme d'évolution dynamique des prix et de la technologie (Variante A) augmente le MAPE à 4,15 % (une dégradation de 1,81 point de pourcentage) et réduit le R2 à 0,837, expliquant 12,5 % de variance en moins par rapport au modèle complet. En revanche, l'élimination de la compensation résiduelle par apprentissage machine (variante B) entraîne une baisse beaucoup plus marquée : le MAPE augmente à 5,62 % (+3,28 points de pourcentage), R2 passe à 0,686, et le taux de perte de variance expliquée atteint 28,3 %. Ces résultats démontrent que, bien que la mise à jour dynamique du quota améliore la précision de la ligne de base, la correction résiduelle fondée sur XGBoost est indispensable pour capturer les facteurs de coût non linéaires, formant ainsi conjointement une architecture hybride synergique.

Afin de faciliter la comparaison des performances du modèle lors des expériences d'ablation, un graphique radar normalisé a été construit pour visualiser cinq métriques d'évaluation : MAPE, RMSE, R2, MaxAE et la robustesse. Les métriques fondées sur les erreurs (MAPE, RMSE et MaxAE) ont été normalisées de manière inversée, de sorte que des erreurs plus faibles correspondent à des scores plus élevés, tandis que les métriques positives (R2 et la robustesse) ont été normalisées de manière à ce que des valeurs plus élevées correspondent à des scores plus élevés. Après normalisation, tous les indicateurs représentent des scores de performance comparables, les valeurs les plus proches de la limite extérieure indiquant une performance globale supérieure.

Comme le montre la Figure 5, le modèle complet Quota-ML a obtenu des scores constamment élevés dans les cinq dimensions de performance, formant le profil radar le plus grand et le plus équilibré. Ce résultat indique que le cadre proposé assure un équilibre efficace entre le contrôle de l'erreur relative, la précision globale des prédictions, le pouvoir explicatif, la suppression des erreurs extrêmes et la robustesse dans des conditions de fonctionnement variables.

En revanche, la variante A, qui excluait le mécanisme d'évolution dynamique du quota tout en conservant la compensation résiduelle fondée sur l'apprentissage automatique, a présenté une réduction notable de la performance globale. Ce résultat suggère qu'un seuil de quota statique seul ne peut pas correctement prendre en compte les changements structurels provoqués par les fluctuations des prix des matières premières et par les progrès technologiques. Un déclin encore plus marqué de la performance a été observé pour la variante B, dans laquelle le module de compensation résiduelle a été supprimé, et où la prévision reposait uniquement sur le seuil de quota dynamique. Dans ce cas, la performance s'est fortement dégradée, en particulier pour les métriques liées aux erreurs et à la robustesse.

Comme résumé dans le Tableau 4, le MAPE de la variante B est passé de 2,34 % pour le modèle complet à 5,62 %, soit une augmentation de 3,28 points de pourcentage, tandis que la valeur de R2 a diminué de 28,3 %. Ces résultats indiquent que, bien que le modèle de quota dynamique intègre des ajustements liés à l'inflation macroéconomique et à l'efficacité découlant des progrès technologiques, il ne parvient pas entièrement à rendre compte des variations brutales des coûts associées aux conditions météorologiques extrêmes, à la maintenance d'urgence, aux changements de politique et aux conditions de fonctionnement anormales.

Dans l'ensemble, l'analyse d'ablation démontre que les deux composants principaux du cadre proposé sont essentiels. Le mécanisme d'évolution dynamique du quota adapte la référence d'ingénierie aux changements des conditions macroéconomiques et aux progrès technologiques, tandis que le module d'apprentissage automatique de compensation des résidus capte les écarts non linéaires qui ne peuvent pas être représentés explicitement par les règles de quota d'ingénierie. Ensemble, ces composants complémentaires forment un cadre prévisionnel intégré qui combine une référence de quota interprétable sur le plan physique avec un apprentissage résiduel fondé sur les données, afin d'obtenir une prévision précise et robuste des coûts à long terme.

Validation de l'interprétabilité du modèle de compensation des résidus

Bien que la comparaison de la précision des prévisions et les expériences d'ablation aient démontré l'importance du module de compensation résiduelle par apprentissage automatique, les métriques d'erreur seules ne permettent pas de déterminer si les relations non linéaires capturées possèdent des interprétations physiques ou opérationnelles significatives. Par conséquent, la méthode SHAP (Shapley Additive exPlanations) a été appliquée pour interpréter le modèle résiduel XGBoost40. SHAP est largement utilisée pour expliquer les modèles d'apprentissage automatique dans les domaines de la prévision énergétique et électrique ainsi que dans les systèmes complexes associés41,42. En quantifiant la contribution de chaque caractéristique d'entrée aux prédictions du modèle, SHAP permet d'évaluer si les motifs résiduels appris sont cohérents avec les connaissances en génie.

Comme illustré dans la Figure 6, les variables de perturbation externe — notamment le nombre cumulé de jours de température élevée atteignant le niveau d'alerte au cours des 90 jours précédents, l'indice de coupures de ligne liées aux phénomènes convectifs intenses et aux typhons, la durée des précipitations de pluie verglaçante et de neige, ainsi que le nombre d'événements de réparation non planifiés — présentaient des valeurs SHAP fortement positives. Les échantillons ayant des valeurs élevées pour ces variables étaient concentrés dans la région SHAP positive, indiquant que les conditions météorologiques extrêmes et les activités de maintenance d'urgence augmentaient systématiquement les coûts réels au-delà du seuil de référence dynamique. Ces résultats montrent que le module de compensation résiduelle capte des perturbations environnementales et opérationnelles significatives, et ne se contente pas d'ajuster un bruit aléatoire.

Plusieurs variables supplémentaires, notamment la durée de fonctionnement à charge élevée, l'indice des prix des métaux PPI, la proportion de l'investissement numérique, la capacité installée en photovoltaïque distribué et la longueur des lignes de transport, ont également apporté des contributions substantielles aux prévisions résiduelles. Ces résultats indiquent que les écarts par rapport à la référence du quota sont conjointement influencés par des événements météorologiques à court terme, l'expansion des actifs, la transmission des prix des matières premières, la transformation du système électrique et la numérisation. Notamment, la proportion d'investissement numérique a contribué positivement aux coûts résiduels dans certaines observations, suggérant qu'une transformation numérique en phase initiale pourrait temporairement augmenter les dépenses en raison de l'intégration des systèmes, de la maintenance des plateformes et du fonctionnement parallèle des anciens systèmes et des nouveaux systèmes déployés. Dans l'ensemble, l'analyse SHAP valide l'interprétabilité commerciale du module de compensation résiduelle et fournit un soutien empirique pour comprendre les impacts des événements météorologiques extrêmes et de la transformation numérique sur les coûts de production et d'exploitation.

Test de significativité statistique des améliorations des prévisions

Afin de déterminer si les améliorations prévisionnelles obtenues par le cadre proposé étaient statistiquement significatives, des tests formels de comparaison des prévisions ont été réalisés. Conformément aux pratiques établies en prévision énergétique et en économétrie, le test de Diebold–Mariano (DM) a été utilisé pour comparer la précision prédictive du modèle proposé à celle de chaque modèle de référence. Le test DM est particulièrement adapté à la prévision de séries chronologiques, car il tient compte de l'autocorrélation des erreurs de prévision sans exiger que les résidus suivent une distribution normale.

Pour chaque comparaison, l'hypothèse nulle supposait que les modèles proposé et de référence avaient une précision prédictive égale, tandis que l'hypothèse alternative supposait que le modèle proposé produisait des erreurs de prévision plus faibles. Des tests DM unilatéraux ont été réalisés en utilisant le carré de l'erreur de prévision comme fonction de perte. Afin de tenir compte de l'hétéroscédasticité et de l'autocorrélation dans la série des différences de perte, des erreurs standards de Newey–West avec sélection automatique du retard ont été appliquées. En outre, le test de Wilcoxon des rangs signés a été effectué comme alternative non paramétrique ne reposant sur aucune hypothèse de distribution. Ensemble, ces tests complémentaires permettent d'évaluer de manière robuste la signification statistique des améliorations observées en matière de prévision.

Comme résumé dans le Tableau 5, le cadre de prévision proposé a permis des améliorations statistiquement significatives par rapport à tous les modèles de référence. Les valeurs positives des statistiques DM indiquent des erreurs de prévision systématiquement plus faibles que celles des approches concurrentes. L'amélioration la plus importante a été observée par rapport au modèle ARIMA (DM = 3,842, p < 0,001), démontrant l'avantage d'intégrer les quotas de coûts d'ingénierie dans le cadre de prévision. Par rapport à ARIMAX, qui inclut des variables exogènes, le modèle proposé a également montré une amélioration significative (DM = 3,215, p < 0,001), soulignant la valeur ajoutée de combiner une base dynamique de quotas avec une compensation des résidus fondée sur l'apprentissage automatique.

Le modèle proposé a également nettement surpassé les références en apprentissage profond. Les améliorations prévisionnelles étaient significatives par rapport au modèle LSTM (DM = 2,876, p = 0,002) et au modèle Transformeur (DM = 2,543, p = 0,011). Bien que l'amélioration par rapport au modèle XGBoost autonome ait été plus faible (DM = 2,187, p = 0,029), elle restait statistiquement significative. Étant donné que les deux modèles utilisent un apprentissage basé sur les arbres, ce résultat montre que l'intégration de la référence dynamique de quota apporte une valeur prédictive supplémentaire par rapport à une approche purement fondée sur les données. Le test de Wilcoxon signé a produit des niveaux de signification cohérents avec ceux du test DM, fournissant ainsi une preuve supplémentaire que les améliorations prévisionnelles du cadre proposé sont statistiquement robustes.

DISPONIBILITÉ DES DONNÉES :

Les jeux de données utilisés dans cette étude ont été déposés dans un référentiel public (DOI : https://doi.org/10.5281/zenodo.21645584).

Schéma du processus de gestion des actifs du réseau ; actifs, quotas de travail, comptes de coûts et prévision de la demande.
Figure 1 : Relation entre les actifs du réseau électrique, les quotas d'opération standard et les comptes de coûts. Cette figure montre que les quotas de coûts ne sont pas simplement des règles abstraites d'allocation financière, mais des unités comptables normalisées intégrées à l'ensemble du processus d'exploitation et de maintenance des actifs du réseau électrique. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Schéma de stabilité du réseau électrique avec risques de température élevée, typhon, pluie verglaçante ; zones critiques d'urgence signalées.
Figure 3 : Topologie schématique anonymisée du réseau électrique provincial étudié et couches de perturbations responsables des coûts. Cette figure présente une topologie schématique anonymisée du réseau électrique provincial étudié. Elle superpose les postes électriques par niveau de tension, les couloirs de transport, les grappes de renouvelables distribués, les centres de charge et les zones représentatives de perturbations environnementales. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Graphique de comparaison des coûts d'exploitation, 2023-2025. Modèles : analyse Attention-LSTM, XGBoost, Quota-ML.
Figure 4 : Trajectoires de prédiction des modèles principaux et coûts réels durant l'intervalle de test hors échantillon 2023–2025. Ce graphique montre que les coûts de production et d'exploitation réels durant la période de test présentent des fluctuations saisonnières marquées ainsi que des pics soudains. Lors du choc extrême de température élevée en juillet et août 2024, les coûts réels ont augmenté de manière significative. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Graphique en radar comparant le MAPE, le RMSE, le R², le MaxAE et la robustesse de trois variantes de modèles d'apprentissage automatique.
Figure 5 : Comparaison normalisée des performances prévisionnelles selon les variantes de désassemblage. Les graphiques en radar comparent les performances normalisées du modèle complet Quota-ML et de deux variantes de désassemblage à l’aide de cinq métriques d’évaluation : le score MAPE, le score RMSE, le score R2, le score MaxAE et le score de robustesse. Les métriques fondées sur les erreurs (MAPE, RMSE et MaxAE) ont été inversées de manière normalisée afin que des scores plus élevés indiquent des erreurs de prédiction plus faibles, tandis que le R2 et la robustesse ont été normalisés de sorte que des scores plus élevés reflètent de meilleures performances du modèle. Le profil radar plus étendu du modèle complet Quota-ML démontre des performances prévisionnelles globalement supérieures par rapport aux deux variantes de désassemblage. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Graphique des valeurs SHAP de l'analyse d'impact des caractéristiques sur la stabilité du réseau électrique ; visualisation et analyse des données.
Figure 6 : Graphique récapitulatif SHAP montrant les contributions des caractéristiques à la prédiction des coûts résiduels. Le graphique récapitulatif SHAP (Shapley Additive exPlanations) illustre les contributions des variables les plus influentes au modèle de compensation résiduelle XGBoost. Chaque point représente une observation, la couleur indiquant la valeur de la caractéristique (bleu = faible ; rouge = élevée) et la position horizontale représentant la valeur SHAP. Des valeurs plus élevées pour des variables telles que les journées de chaleur extrême, l'indice de coupure lié aux typhons, la durée des tempêtes de verglas et les événements de réparation non planifiés sont généralement associées à des valeurs SHAP plus positives, indiquant une augmentation des coûts de production et d'exploitation résiduels. Ce graphique montre que les perturbations environnementales ainsi que les facteurs opérationnels contribuent fortement aux écarts par rapport à la référence dynamique du quota. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Tableau 1 : Description des variables et paramètres fondamentaux du modèle. Ce tableau présente les variables clés du modèle de prévision des coûts Quota-ML proposé, en distinguant les coûts réels des coûts prévus ; les seuils de quota statiques et dynamiques ; les paramètres de charge de travail et de quota ; les facteurs de correction macroéconomiques (IPP et progrès technologique) ; ainsi que les composantes résiduelles. Veuillez cliquer ici pour télécharger ce tableau.

Tableau 2 : Classification et statistiques descriptives des caractéristiques principales en entrée du modèle de prévision. 
Ce tableau montre que les variables explicatives provenant de différentes dimensions commerciales présentent des formes statistiques distinctes. Il résume les statistiques descriptives des variables représentatives d'actifs physiques, opérationnelles, macroéconomiques et environnementales utilisées comme entrées du modèle. Veuillez cliquer ici pour télécharger ce tableau.

ModèlesMAPE %RMSE (CNY, Millions)Ajustement R²MaxAE (CNY, Millions)
Lissage exponentiel traditionnel8.7554.220.651125.04
Modèle de séries chronologiques SARIMAX6.1238.540.76884.21
Régression XGBoost pure4.3829.160.85251.06
Réseau de neurones Attention-LSTM3.5524.020.89440.53
Modèle Quota-ML proposé2.3415.690.95723.05

Tableau 3 : Comparaison globale des performances des différents modèles sur l'ensemble de test hors échantillon 2023–2025. Ce tableau montre que le modèle Quota-ML proposé surpasse nettement tous les modèles de référence en matière de prévision de la production et des coûts d'exploitation du réseau électrique pendant la période hors échantillon 2023–2025.

Variant expérimentalComposant central suppriméPerformance de dégradation MAPERatio de perte de variance expliquée
Variant AAbsence d'évolution dynamique des prix / technologies4,15 % (+1,81 p.p.)0,83712,50 %
Variant BAbsence de compensation des résidus par apprentissage automatique5,62 % (+3,28 p.p.)0,68628,30 %
Modèle completCadre complet proposé de quota-ML2,34 %0,957Référence

Tableau 4 : Résultats des expériences d'ablation du cadre intégré de quota et d'apprentissage automatique. Ce tableau montre que les deux composants du cadre proposé contribuent de manière significative à la précision des prévisions, mais la compensation résiduelle par apprentissage automatique joue un rôle plus déterminant.

ComparaisonTest de Diebold-MarianoTest de Wilcoxon
Modèle proposé vs. ARIMADM = 3,842*** (p < 0,001)W = 486,0*** (p < 0,001)
Modèle proposé vs. ARIMAXDM = 3,215*** (p < 0,001)W = 452,0*** (p < 0,001)
Modèle proposé vs. LSTMDM = 2,876** (p = 0,002)W = 398,0** (p = 0,003)
Modèle proposé vs. TransformerDM = 2,543* (p = 0,011)W = 364,0* (p = 0,014)
Modèle proposé vs. XGBoost (apprentissage automatique pur)DM = 2,187* (p = 0,029)W = 328,0* (p = 0,031)

Tableau 5 : Résultats des tests de significativité statistique pour les comparaisons des prévisions. La statistique du test de Diebold-Mariano suit une distribution normale standard sous l'hypothèse nulle. Des valeurs DM positives indiquent une précision prévisionnelle supérieure du modèle proposé. Tous les tests sont unilatéraux, avec comme hypothèse alternative que le modèle proposé présente une erreur de prévision inférieure à celle du modèle de référence. La statistique W du test des rangs signés de Wilcoxon est indiquée avec les p-valeurs correspondantes. Fonction de perte = erreur de prévision au carré.

Discussion

Cette étude démontre que l'intégration des quotas de coûts industriels avec l'apprentissage automatique fournit un cadre interprétable et précis pour la prévision à long terme des coûts du réseau électrique. Les résultats montrent que les variables liées au climat, en particulier les jours de températures extrêmement élevées et les indices d'impact des déclenchements de ligne, sont les facteurs prédominants des résidus de coût, soulignant l'influence croissante des perturbations externes sur les dépenses des services publics. Ces résultats suggèrent que les coûts liés aux conditions météorologiques ne devraient plus être considérés comme des frais d'exploitation accessoires, mais plutôt intégrés à des réserves de contingence dédiées, dont l'activation serait liée aux risques climatiques prévus. L'identification de l'impact des déclenchements de ligne comme principal facteur de coût souligne davantage l'importance des stratégies de maintenance prédictive et de surveillance de l'état pour réduire à la fois les interruptions opérationnelles et la volatilité des coûts.

L'analyse révèle également que la transformation numérique peut accroître les coûts opérationnels durant les premières étapes de mise en œuvre en raison d'une exploitation transitoire en double système, plutôt que d'apporter immédiatement des gains d'efficacité. Cette observation suggère que les services publics devraient évaluer les investissements numériques à l'aide d'une analyse des coûts sur tout le cycle de vie, plutôt que selon la performance financière à court terme, et qu'ils doivent anticiper des chevauchements temporaires de coûts lors du déploiement de systèmes de surveillance intelligents, de systèmes avancés de gestion de distribution ou de postes électriques numériques. Le cadre proposé de compensation résiduelle pourrait également être étendu afin d'estimer le moment où les investissements numériques commencent à générer des économies nettes de coûts, soutenant ainsi une planification technologique et des décisions d'investissement plus efficaces.

Au-delà des opérations utilitaires, le cadre proposé a des implications réglementaires importantes. En quantifiant les effets des facteurs externes sur les résidus de coût, le modèle fournit une base objective pour établir des réserves d'appoint ajustées au climat et évaluer les demandes budgétaires des services publics. La séparation des coûts liés à la quote-part de base des résidus induits par les perturbations soutient également une réglementation plus efficace fondée sur la performance, en distinguant l'efficacité opérationnelle contrôlable des chocs externes incontrôlables. En outre, le cadre prévisionnel fondé sur les quotas offre une transparence et une vérifiabilité accrues par rapport aux modèles purement statistiques ou d'intelligence artificielle « boîte noire », permettant de relier directement les coûts prévus aux conditions opérationnelles physiques et aux paramètres techniques lors des examens tarifaires et des audiences réglementaires.

Plusieurs limites doivent être reconnues. L'analyse empirique repose sur un seul réseau électrique provincial dans l'est de la Chine, ce qui pourrait limiter la généralisabilité à des régions ayant des conditions climatiques, des environnements réglementaires ou des structures de réseau différentes. Bien que l'ensemble de données de 192 mois soit suffisant pour le modèle XGBoost, il reste relativement petit pour capturer des événements rares mais à fort impact, et la performance des prévisions dépend de la qualité et de la cohérence des bases de données sous-jacentes sur les quotas de coûts. De plus, le mécanisme dynamique de quotas s'appuie sur l'indice agrégé des prix à la production et sur des facteurs de progrès technologique qui pourraient ne pas refléter pleinement les variations de coûts spécifiques à une région ou à un composant. Bien que l'analyse SHAP améliore l'interprétabilité du modèle, les contributions des caractéristiques rapportées représentent des associations prédictives et non des relations causales, et doivent donc être interprétées avec la prudence requise.

Les recherches futures devraient se concentrer sur l'intégration de dossiers de maintenance non structurés à l'aide de grands modèles linguistiques spécifiques à un domaine, l'incorporation de réseaux neuronaux graphiques spatiotemporels afin de capturer la propagation des perturbations à travers des réseaux interconnectés, l'extension de la validation à plusieurs régions pour améliorer la généralisabilité, et l'introduction de la quantification des incertitudes pour soutenir la prise de décision réglementaire tenant compte des risques. Ces développements sont conformes aux progrès récents dans les prévisions énergétiques à moyen et long terme et l'intégration des énergies renouvelables, qui soulignent l'importance de combiner l'intelligence basée sur les données avec des cadres de modélisation physiquement informés pour un fonctionnement fiable des systèmes électriques43,44.

Déclarations de divulgation

Tous les auteurs déclarent ne pas avoir de conflits d'intérêts.

CONTRIBUTION DES AUTEURS :
Xiaohui Wang a conçu et planifié l'étude, développé la méthodologie, effectué l'analyse formelle et rédigé le manuscrit initial. Tong Li a contribué à la gestion des données, à la mise en œuvre logicielle et à la validation. Yanchao Lu a contribué au développement de la méthodologie, à l'investigation et à l'interprétation des données. Quanfeng Lv a fourni les ressources, supervisé l'acquisition des données et relu de manière critique le manuscrit. Fan Liu a supervisé le projet, contribué à la conceptualisation et à l'interprétation des résultats, obtenu le financement et révisé de manière critique le manuscrit. Tous les auteurs ont examiné et approuvé la version finale du manuscrit.

Remerciements

Ce travail a été soutenu par le projet technologique de la State Grid Corporation of China, intitulé « Recherche sur l'analyse de l'allocation des coûts de production et d'exploitation et sur la technologie d'optimisation asynchrone » (numéro de projet : 520600250029-183-ZN).

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Jeu de données comptables mensuelles anonymisées E-GridRéseau électrique provincial de Chine orientaleN/AJeu de données anonymisées sur les coûts mensuels de production et d'exploitation (2010–2025) comprenant 192 observations, incluant des données sur les actifs physiques, la maintenance, les données macroéconomiques et environnementales. Utilisé pour le développement du modèle (156 observations) et les tests hors échantillon (36 observations).
Bibliothèque de tracé MatplotlibÉquipe de développement de Matplotlib3.5.2Utilisée pour générer les figures du manuscrit et les sorties graphiques, notamment les graphiques de performance du modèle, les visualisations de topologie, les diagnostics des résidus, les graphiques radars et les résumés visuels liés à SHAP.
Bibliothèque de calcul numérique NumPyDéveloppeurs de NumPy1.22.3Utilisée pour les opérations sur tableaux numériques, les calculs matriciels et le contrôle de la reproductibilité. Une graine aléatoire fixe de 42 a été appliquée lorsque pertinent.
Bibliothèque de manipulation de données PandasÉquipe de développement de pandas1.4.2Utilisée pour l'importation, l'intégration, la restructuration, le filtrage et le prétraitement des données, notamment l'imputation des valeurs manquantes, l'alignement des séries temporelles et la préparation des variables d'entrée du modèle.
Environnement de programmation PythonFondation Python Software Foundation3.9.13Environnement de programmation utilisé pour implémenter l'ensemble du flux de travail de prévision, incluant le prétraitement des données, l'ingénierie des caractéristiques, l'entraînement du modèle, l'optimisation des hyperparamètres, la prédiction, les tests statistiques et l'évaluation des performances.
Bibliothèque d'apprentissage automatique Scikit-learnContributeurs de scikit-learn1.0.2Utilisée pour le prétraitement des données, la séparation entraînement-validation, l'évaluation de modèles auxiliaires et les procédures statistiques, notamment l'analyse de corrélation de Pearson et le calcul de métriques de performance sélectionnées.
Bibliothèque de calcul scientifique SciPyContributeurs de SciPy1.9.0Utilisée pour les calculs statistiques, notamment l'analyse de corrélation de Pearson et les procédures d'appui pour le traitement des valeurs aberrantes et la winsorisation.
Implémentation de l'estimateur par noyaux de Parzen structuré en arbreContributeurs d'Optuna3.1.0Implémentation d'optimisation bayésienne utilisée pour ajuster les hyperparamètres de XGBoost, notamment la profondeur maximale des arbres, le taux d'apprentissage et les paramètres de régularisation. L'estimateur par noyaux de Parzen structuré en arbre a été implémenté via le package open source Optuna.
Bibliothèque logicielle XGBoostDMLC / Contributeurs de XGBoost1.7.1Bibliothèque d'apprentissage ensembliste basée sur les arbres de décision utilisée pour la compensation non linéaire des résidus. Le modèle implémente une fonction objective régularisée avec une perte de Huber et des pénalités de complexité des arbres, comme décrit dans les équations 7–9.

Références

  1. Rao H, Li J, Sun X. Demand forecasting and allocation optimization of green power grid supply chain based on machine learning algorithm: A study based on the whole-process data of power grid materials. Sustainability. 2025;17(3):1247.
  2. Huang C, et al. Demand response for industrial micro-grid considering photovoltaic power uncertainty and battery operational cost. IEEE Trans Smart Grid. 2021;12(4):3043-3055.
  3. Phuangpornpitak N, Prommee W. A study of load demand forecasting models in electric power system operation and planning. GMSARN Int J. 2016;10:19-24.
  4. Nasir J, et al. A hybrid LMD–ARIMA–machine learning framework for enhanced forecasting of financial time series: Evidence from the NASDAQ Composite Index. Mathematics. 2025;13(15):2389.
  5. Matos C, et al. Model for integrating the electricity cost consumption and power demand into aggregate production planning. Appl Sci. 2022;12(15):7577.
  6. Valenzuela J, Mazumdar M, Kapoor A. Influence of temperature and load forecast uncertainty on estimates of power generation production costs. IEEE Trans Power Syst. 2000;15(2):668-674.
  7. Khan F, et al. A hybrid vector autoregressive model for accurate macroeconomic forecasting: An application to the US economy. Mathematics. 2025;13(11):1706.
  8. Fatema I, Kong X, Fang G. Electricity demand and price forecasting model for sustainable smart grid using comprehensive long short-term memory. Int J Sustain Eng. 2021;14(6):1714-1732.
  9. Singh AK, Ibraheem SK, Muazzam M, Chaturvedi DK. An overview of electricity demand forecasting techniques. Netw Complex Syst. 2013;3(3):38-48.
  10. Iftikhar H, et al. A novel hybrid framework for forecasting stock indices based on nonlinear time series models. Comput Stat. 2025;40(8):4163-4186.
  11. Jiang P, Li R, Lu H, Zhang X. Modeling of electricity demand forecast for power system. Neural Comput Appl. 2020;32(11):6857-6875.
  12. Chan SC, et al. Load/price forecasting and managing demand response for smart grids: Methodologies and challenges. IEEE Signal Process Mag. 2012;29(5):68-85.
  13. Hernandez L, et al. A survey on electric power demand forecasting: Future trends in smart grids, microgrids and smart buildings. IEEE Commun Surv Tutor. 2014;16(3):1460-1495.
  14. Zareipour H, Canizares CA, Bhattacharya K. Economic impact of electricity market price forecasting errors: A demand-side analysis. IEEE Trans Power Syst. 2009;25(1):254-262.
  15. Botterud A. Forecasting renewable energy for grid operations. In: Renewable Energy Integration. Academic Press; 2017:133-143.
  16. Mirowski P, Chen S, Ho TK, Yu CN. Demand forecasting in smart grids. Bell Labs Tech J. 2014;18(4):135-158.
  17. Sobu A, Wu G. Optimal operation planning method for isolated micro grid considering uncertainties of renewable power generations and load demand. In: IEEE PES Innovative Smart Grid Technologies [conference proceedings]. IEEE; 2012. Available at: https://ieeexplore.ieee.org/
  18. Han B, et al. Optimal design of an on-grid microgrid considering long-term load demand forecasting: A case study. Distrib Gener Altern Energy J. 2020;35:345-362.
  19. Tripathy SC. Demand forecasting in a power system. Energy Convers Manag. 1997;38(14):1475-1481.
  20. Adshead NS, Price DH. Demand forecasting and cost performance in a model of a real manufacturing unit. Int J Prod Res. 1987;25(9):1251-1265.
  21. Gellert A, et al. A study on forecasting electricity production and consumption in smart cities and factories. Int J Inf Manage. 2019;49:546-556.
  22. Hernández L, et al. A multi-agent system architecture for smart grid management and forecasting of energy demand in virtual power plants. IEEE Commun Mag. 2013;51(1):106-113.
  23. Klingler AL, Teichtmann L. Impacts of a forecast-based operation strategy for grid-connected PV storage systems on profitability and the energy system. Sol Energy. 2017;158:861-868.
  24. Ghalehkhondabi I, Ardjmand E, Weckman GR, Young WA. An overview of energy demand forecasting methods published in 2005–2015. Energy Syst. 2017;8(2):411-447.
  25. Aderibigbe AO, et al. Enhancing energy efficiency with AI: A review of machine learning models in electricity demand forecasting. Eng Sci Technol J. 2023;4(6):341-356.
  26. Arumugham V, et al. An artificial-intelligence-based renewable energy prediction program for demand-side management in smart grids. Sustainability. 2023;15(6):5453.
  27. Dudek G, Piotrowski P, Baczyński D. Intelligent forecasting and optimization in electrical power systems: Advances in models and applications. Energies. 2023;16(7):3024.
  28. Liu N, et al. A hybrid forecasting model with parameter optimization for short-term load forecasting of micro-grids. Appl Energy. 2014;129:336-345.
  29. Mohammad AA, et al. Mathematical and statistical modelling of electricity demand forecasting using artificial neural networks and SARIMA: Implications for energy supply chain planning. Alex Eng J. 2026;139:98-108.
  30. Singh AR, et al. A blockchain-enabled multi-agent deep reinforcement learning framework for real-time demand response in renewable energy grids. Energy Strateg Rev. 2025;62:101905.
  31. Lu R, et al. Data-driven real-time price-based demand response for industrial facilities energy management. Appl Energy. 2021;283:116291.
  32. Kondaiah VY, Saravanan B, Sanjeevikumar P, Khan B. A review on short-term load forecasting models for micro-grid application. J Eng. 2022;2022(7):665-689.
  33. Lee BL, Wilson C, Simshauser P, Majiwa E. Deregulation, efficiency and policy determination: An analysis of Australia's electricity distribution sector. Energy Econ. 2021;98:105210.
  34. Wang Y, et al. Transmission network expansion planning considering wind power and load uncertainties based on multi-agent DDQN. Energies. 2021;14(19):6073.
  35. Ding Q, Zhao H. Study on e-commerce logistics cost control methods in the context of COVID-19 prevention and control. Soft Comput. 2021;25(18):11955-11963.
  36. Duan Y, Xu Z, Chen H, Wang Y. Novel machine learning approach for enhanced smart grid power use and price prediction using advanced Shark Smell-tuned flexible support vector machine. Sci Rep. 2025;15(1):20909.
  37. Chen T, Guestrin C. XGBoost: A scalable tree boosting system. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining [conference proceedings]. San Francisco, CA, USA; 2016. Available at: https://doi.org/10.1145/2939672.2939785
  38. Lin KY, et al. Predictive maintenance in industrial systems: An XGBoost-based approach for failure time estimation and resource optimization. J Ind Prod Eng. 2025;42(8):876-899.
  39. Ajayi OO, Kurien AM, Djouani K, Dieng L. A proactive predictive model for machine failure forecasting. Machines. 2025;13(8):663.
  40. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  41. Chen H, Gao T, Wang L, Guo P. Explainable machine learning methods for predicting electricity consumption in a long-distance crude oil pipeline. Sci Rep. 2025;15(1):43305.
  42. Neubauer A, Brandt S, Kriegel M. Explainable multi-step heating load forecasting: Using SHAP values and temporal attention mechanisms for enhanced interpretability. Energy AI. 2025;20:100480.
  43. Ahmad T, Chen H. Potential of three variant machine-learning models for forecasting district-level medium-term and long-term energy demand in smart grid environment. Energy. 2018;160:1008-1020.
  44. Masa-Bote D, et al. Improving photovoltaics grid integration through short-time forecasting and self-consumption. Appl Energy. 2014;125:103-113.

Réimpressions et autorisations

Étiquettes

Prévision des coûtsdonnées de réseau électriqueprévision basée sur des quotasmodèle XGBoostinterprétation SHAPréforme du marché de l'électricitétarifs de transportvérification réglementaire des coûtsprévision par apprentissage automatique