Este estudio utilizó datos operativos y financieros anonimizados recopilados de una red eléctrica provincial en el este de China. Todos los datos fueron agregados y desidentificados antes del análisis, y no se incluyó ninguna información personal identificable ni datos sensibles a nivel individual. Por lo tanto, no se requirió aprobación ética. El acceso y análisis de los datos cumplieron con las regulaciones aplicables de protección de datos y los acuerdos institucionales que rigen la información del sector eléctrico.
Descripción general del marco de predicción
Para integrar enfoques de predicción basados en la física y en datos, se desarrolló un marco híbrido de predicción que combina cuotas de costos de ingeniería con aprendizaje automático. En lugar de simplemente combinar múltiples algoritmos, el marco sigue el principio de que los modelos físicos establecen la predicción de referencia, mientras que el aprendizaje automático compensa los errores residuales. Este diseño asegura que el proceso de predicción se base en los mecanismos físicos subyacentes a las actividades de producción y operación de la red eléctrica, en lugar de depender únicamente de la extrapolación histórica de costos.
El marco establece primero una asignación jerárquica entre los activos de la red eléctrica, las actividades operativas estandarizadas y las cuentas de costos financieros. Los costos de producción y operación se consideran representaciones monetarias de los recursos consumidos por los activos físicos —incluyendo subestaciones, líneas de transmisión, alimentadores de distribución, dispositivos de medición y equipos digitales de inspección— durante actividades rutinarias como inspección, mantenimiento, pruebas, reparación y reemplazo. Las cuotas de costos sirven como vínculo entre las cargas de trabajo de ingeniería medibles y los gastos financieros correspondientes.
Como se ilustra en la Figura 1, las cuotas de costo funcionan como unidades contables estandarizadas integradas en todo el proceso de operación y mantenimiento de los activos, en lugar de reglas abstractas de asignación financiera. Las cargas de trabajo de los activos a nivel inferior se convierten en cuotas operativas estandarizadas y posteriormente se asignan a categorías de costos, incluyendo mano de obra, materiales, equipos de construcción, servicios subcontratados y suministros de emergencia. Esta asignación jerárquica preserva la interpretabilidad ingenieril y la trazabilidad regulatoria durante todo el proceso de pronóstico, y proporciona la base física para la construcción del modelo estático de cuota de referencia.
Resumen del flujo de trabajo metodológico
El marco de previsión propuesto consta de tres etapas secuenciales: (1) la construcción de una línea de base física utilizando cuotas de carga de trabajo a nivel de activos, (2) la evolución dinámica de las cuotas de costos mediante ajustes macroeconómicos y tecnológicos, y (3) la compensación basada en aprendizaje automático para capturar efectos sistemáticos no lineales. Como se ilustra en Figura 1, el marco establece una asignación jerárquica desde los activos de nivel inferior y las actividades operativas estandarizadas hasta las previsiones de costos de producción y operación. Los detalles de implementación de cada etapa se describen en las siguientes secciones.
Modelo de costo básico físico basado en cargas de trabajo a nivel de activos
La producción y el costo operativo de una red eléctrica, Ctotal, comprenden gastos asociados con múltiples actividades comerciales, incluyendo la operación de subestaciones, el mantenimiento de líneas de transmisión, la gestión de redes de distribución, el servicio al cliente y los sistemas de apoyo. En este estudio, se asume que el costo operativo de referencia está determinado por la carga de trabajo generada por cada actividad operativa estandarizada y su cuota de costo correspondiente.
El costo estático de referencia se calcula como:
(1)
donde Vi,k,t denota la carga de trabajo asociada con la tarea operativa o el activo i-ésimo dentro de la categoría empresarial k durante el período t, y Qi,k representa el costo unitario estandarizado correspondiente definido por el sistema de cuotas de costos de ingeniería. La categoría empresarial incluye funciones operativas principales como mantenimiento de subestaciones, inspección de líneas de transmisión, operación de redes de distribución y servicio al cliente. La doble sumatoria agrega los costos de todas las actividades operativas estandarizadas para estimar el gasto teórico básico necesario para mantener el funcionamiento normal de la red.
La ecuación (1) establece la relación física entre las cargas de trabajo de ingeniería y los gastos financieros al asociar directamente actividades operativas estandarizadas con cuentas de costos. A diferencia de los modelos puramente estadísticos de pronóstico, esta formulación proporciona una base de ingeniería interpretable que sirve como fundamento para el ajuste dinámico posterior de cuotas y la corrección residual basada en aprendizaje automático. La ecuación fue desarrollada a partir de las prácticas operativas y el sistema de cuotas de costos utilizados por empresas provinciales de redes eléctricas en China. Tabla 1 resume la notación utilizada en la ecuación (1), incluyendo la carga de trabajo (Vi,k,t), el costo unitario estandarizado (Qi,k), el número de tareas operativas (Nk) y el índice de categoría empresarial (k).
Mecanismo dinámico de evolución de cuotas bajo perturbaciones ambientales externas
Las cuotas de coste estandarizadas (Qi,k) proporcionan una referencia físicamente interpretable, pero no tienen en cuenta los cambios en las condiciones macroeconómicas ni el progreso tecnológico. Para mejorar su aplicabilidad a largo plazo, se introdujo un mecanismo de evolución dinámica para ajustar las cuotas de referencia en respuesta tanto a la inflación de precios como a las ganancias de eficiencia impulsadas por la tecnología.
El primer ajuste tiene en cuenta los cambios en los costos de adquisición derivados de la inflación macroeconómica. La operación y el mantenimiento de la red eléctrica dependen en gran medida de materiales en grandes volúmenes, como el cobre, el aluminio y el acero al silicio, cuyos precios están estrechamente relacionados con las fluctuaciones del Índice de Precios al Productor (PPI). Dado que
es un índice con un valor base de 100, primero se convierte en una tasa de inflación estandarizada:
(2)
Sobre esta base, se define la función de corrección de precio
como:
(3)
donde
es un vector de pesos retardados de longitud L que satisface

La estructura de rezago representa la transmisión diferida de la inflación macroeconómica a los costos de adquisición dentro de la cadena de suministro de la red eléctrica. Convertir el índice PPI en una tasa de inflación estandarizada conserva el efecto acumulativo de los cambios de precios, al tiempo que evita el sesgo de escala asociado con el uso directo de los valores del índice. Las ecuaciones (2) y (3) se adaptaron a partir de modelos establecidos de ajuste de inflación macroeconómica, con la estructura de rezago calibrada para los ciclos de adquisición del sector eléctrico33,34.
El progreso tecnológico se incorporó mediante un factor de reducción de costos que reflejaba mejoras en la eficiencia operativa derivadas de avances como la inspección mediante vehículos aéreos no tripulados, la robótica inteligente y las tecnologías digitales de mantenimiento. El factor de ajuste tecnológico se define como:
(4)
En esta parte, α y β son coeficientes empíricos de elasticidad estimados a partir de datos históricos de panel mediante mínimos cuadrados no lineales. Para garantizar que el factor de progreso tecnológico represente siempre una reducción razonable en el costo unitario de la cuota, el proceso de estimación de parámetros restringe 0 < Γ(Etech,t) ≤ 1. Cabe señalar que este factor refleja principalmente la mejora de eficiencia a largo plazo derivada del reemplazo por tecnología madura. La ecuación (4) es original de este trabajo, adaptando el concepto de curva de aprendizaje proveniente de la literatura sobre costos de tecnologías energéticas35,36 a las operaciones de mantenimiento de redes. Los costos adicionales que pueden surgir en la etapa inicial de implementación de equipos digitales, como la operación paralela de sistemas antiguos y nuevos, la integración de plataformas, las pruebas de comunicación y el mantenimiento adicional, no se deducen forzosamente de la cuota base; en cambio, se identifican mediante el módulo subsiguiente de compensación de residuos basado en aprendizaje automático:
(5)
donde Cbase,t denota el costo estático de referencia calculado a partir de las cargas de trabajo de los activos de nivel inferior y de las cuotas estándar de costos operativos;
captura el efecto de transmisión de las fluctuaciones macroeconómicas de precios sobre los materiales, equipos y precios de servicios externos; y Γ(Etech,t) refleja la reducción basada en la eficiencia de los costos unitarios de operación y mantenimiento tras la madurez tecnológica. A través del anterior mecanismo de evolución dinámica, la cuota de referencia ya no permanece en una base contable estática, sino que puede ajustarse adaptativamente ante cambios en los entornos económicos y las condiciones tecnológicas. La ecuación (5) es original de este trabajo y representa la integración novedosa de correcciones por precios y tecnología en el marco de la cuota de referencia.
Captura sistemática de residuos no lineales bajo restricciones de cuota
A pesar de las correcciones evolutivas complejas, el modelo de cuota genera inevitablemente desviaciones sistemáticas al enfrentar interrupciones climáticas impredecibles relacionadas con desastres y directrices políticas repentinas, como el aumento de los costos de manejo de quejas de servicio al cliente durante períodos temporales de reducción de tarifas. Esta desviación forma el término residual en ambos lados de la ecuación:
Rt=Cactual,t-Ccuota,t (6)
Dado que las reglas físicas convencionales no pueden explicar este aspecto, el aprendizaje automático puede abordar estas limitaciones. Para evitar la maldición de la dimensionalidad provocada por características de alta dimensionalidad, este estudio utiliza el algoritmo XGBoost basado en conjuntos de árboles de decisión para modelar la relación no lineal Rt37,38. Se define una matriz de características de fuerte perturbación Xt, que incluye características meteorológicas como los días anuales extremos de congelación Dice y la intensidad de políticas macroeconómicas.
Para un compensador no lineal compuesto por árboles de regresión, la lógica de generación del residuo predicho
puede expresarse como39:
(7)
donde F denota el espacio de todas las estructuras posibles de árboles de clasificación y regresión. Para equilibrar la precisión del ajuste y la prevención del sobreajuste, se construye y minimiza en la m-ésima iteración una función objetivo regularizada que contiene un término de penalización por complejidad estructural:
(8)
donde
es una función de pérdida convexa que mide la diferencia entre el residuo verdadero y el residuo predicho. En este artículo se adopta la pérdida de Huber para mejorar la robustez del modelo frente a gastos máximos anómalos. El término de regularización
se utiliza para restringir la complejidad de la estructura del árbol y se define como:
(9)
donde Tm representa el número de nodos hoja en el árbol m-ésimo, wm representa el vector de pesos de las hojas correspondiente, y γ y λ denotan el coeficiente de penalización del número de nodos hoja y el coeficiente de regularización de pesos, respectivamente.
La ecuación final de predicción es:
(10)
Ampliado adicionalmente como:
(11)
La fórmula anterior representa matemáticamente la estructura de bucle cerrado del modelo de pronóstico propuesto. La demanda final de costos de producción y operación no es generada directamente por el modelo de aprendizaje automático; en cambio, se obtiene superponiendo la compensación residual no lineal identificada por el módulo de aprendizaje automático sobre la línea base dinámica de cuota. Entre estos componentes, los factores de precio y tecnología reflejan principalmente la evolución dinámica de la línea base de cuota, mientras que los factores difíciles de caracterizar explícitamente mediante reglas, como los impactos climáticos, las perturbaciones políticas y los aumentos repentinos en eventos de reparación, son capturados por el módulo de compensación residual basado en aprendizaje automático. Las ecuaciones (10) y (11) son originales de este trabajo y sintetizan la línea base física con la captura residual basada en aprendizaje automático en un marco unificado de pronóstico.
Figura 2 muestra que los resultados de pronóstico del modelo propuesto exhiben una lógica clara de generación jerárquica. Por un lado, la cuota base proporciona una base física estable, transparente y auditada para la demanda de costos; por otro lado, los ajustes de precios, los efectos tecnológicos y los residuos de choques externos permiten que el modelo se adapte a cambios dinámicos en entornos complejos. En comparación con modelos de caja negra que generan directamente valores predichos, esta estructura de descomposición puede revelar claramente «por qué aumentan o disminuyen los costos», mejorando así la interpretabilidad de los resultados del modelo en la revisión presupuestaria y la regulación de tarifas de transmisión y distribución.
Fuentes de datos y procedimientos de recopilación
Los modelos teóricos deben validarse rigurosamente mediante datos empíricos para demostrar su utilidad práctica. Dado que los datos financieros centrales del sector eléctrico incluyen información sensible relacionada con la operación de infraestructuras nacionales, este estudio extrae datos contables mensuales anónimos y de alta precisión de una red eléctrica provincial típica del este de China, denominada E-Grid para facilitar su referencia, que abarcan 16 años calendario consecutivos desde 2010 hasta 2025. Esta provincia ha experimentado un ciclo económico típico al pasar de un crecimiento impulsado por industrias pesadas tradicionales a una manufactura de alto nivel, con una tasa de crecimiento anual compuesta de la escala de activos de la red del 7,4 %. Por lo tanto, la evolución compleja de su estructura de costos tiene una posible relevancia para otros sistemas de red en rápido desarrollo. Los datos provienen de tres fuentes principales: (1) registros internos de operación y mantenimiento que registran cargas de trabajo a nivel de activos, frecuencias de inspección y eventos de reparación; (2) sistemas contables financieros que proporcionan estados mensuales de costos en mano de obra, materiales, equipos y servicios subcontratados; y (3) bases de datos ambientales externas que incluyen registros meteorológicos de la Administración Meteorológica de China e indicadores macroeconómicos de la Oficina Nacional de Estadísticas.
Control de calidad y tratamiento de datos faltantes
Para más de 130 indicadores iniciales integrados a partir de sistemas múltiples, se implementó un procedimiento riguroso de control de calidad. Los datos faltantes, que representan menos del 3 % del total de observaciones, se manejaron mediante interpolación lineal para variables continuas con tendencias temporales, y mediante imputación por la moda para indicadores categóricos. Los valores atípicos se identificaron utilizando el método del rango intercuartílico (IQR); los valores que excedían 3,0 veces el IQR por encima del tercer cuartil se ajustaron al percentil 99 para preservar la integridad de los datos y mitigar la distorsión por valores extremos.
Consideraciones sobre el tamaño de la muestra
El conjunto de datos comprende 192 observaciones mensuales (enero de 2010 a diciembre de 2025), con 156 observaciones (2010–2022) asignadas para entrenamiento y validación y 36 observaciones (2023–2025) reservadas para pruebas fuera de la muestra. Aunque este tamaño de muestra es relativamente modesto para aplicaciones de aprendizaje profundo, es adecuado para el algoritmo XGBoost, que está diseñado específicamente para funcionar bien con conjuntos de datos tabulares pequeños a medianos mediante sus mecanismos de regularización y poda de árboles. Para mitigar los posibles riesgos de sobreajuste, (1) se emplearon penalizaciones estrictas de regularización (γ = 0,1, λ = 1,0), (2) detención temprana con una tolerancia de 50 rondas y (3) restricciones conservadoras de profundidad de árbol (profundidad máxima = 5). Estas medidas garantizan colectivamente la estabilidad y la capacidad de generalización del modelo a pesar del tamaño limitado de la muestra.
Segmentación de datos e integración heterogénea de múltiples fuentes
Para una prueba rigurosa, los datos desde enero de 2010 hasta diciembre de 2022 se asignaron al intervalo de entrenamiento y validación, que contiene 156 observaciones, utilizado para entrenar los factores de evolución de la cuota y la red residual de compensación de la cuota. El período de enero de 2023 a diciembre de 2025 se reserva como el conjunto de prueba independiente fuera de la muestra, que contiene 36 observaciones. ¿Por qué se selecciona este período como escenario final de prueba? La razón es que estos tres años coincidieron con la aceleración de la construcción de sistemas eléctricos de nuevo tipo, agravada por eventos a gran escala de altas temperaturas relacionados con el fenómeno extremo de El Niño y el crecimiento rápido y desigual de la generación distribuida de energías renovables. La red eléctrica enfrentó una presión sin precedentes en las cadenas de suministro de materiales y en la asignación de mano de obra para reparaciones.
La selección científica y la definición cuantitativa de los factores determinantes de costos son la base para garantizar que la red residual de aprendizaje automático pueda captar eficazmente las fluctuaciones sistemáticas. Basándose en la lógica de gestión de los costos operativos estándar en los sistemas eléctricos, este estudio supera la única dimensión de la previsión financiera tradicional, que depende únicamente de los flujos de efectivo históricos, y en su lugar reconstruye la ingeniería de características a partir de cuatro límites fundamentales: escala de activos físicos, condiciones de operación y mantenimiento, evolución macroeconómica y entorno climático externo, utilizando registros operativos originales y libros contables de sistemas externos. En el proceso real de modelado, para más de 130 indicadores originales resultantes de la integración de sistemas múltiples, este estudio emplea pruebas de correlación de Pearson para eliminar variables redundantes altamente colineales, con un umbral de |r| > 0,85. Con base en el conocimiento previo de expertos senior en redes eléctricas, se seleccionan finalmente 42 características principales de entrada para formar la matriz de características Xt. Para presentar claramente la estructura y distribución subyacentes de los datos del tensor de entrada, Tabla 2 selecciona 12 características principales representativas de las cuatro dimensiones de evaluación anteriores y resume sus estadísticas descriptivas durante el período de observación.
Para ilustrar mejor la base espacial y topológica del sistema de características multifuente, Figura 3 presenta una topología esquemática anonimizada de la red eléctrica provincial objeto de estudio. La figura superpone subestaciones por nivel de voltaje, corredores de transmisión, agrupaciones distribuidas de energías renovables, centros de carga y zonas representativas de perturbaciones ambientales. Esta topología ayuda a explicar por qué los costos de producción y operación se ven afectados conjuntamente por la escala de los activos, la estructura de la red, la intensidad de las reparaciones de emergencia y los impactos climáticos externos. Asimismo, proporciona una base de interpretación espacial para las variables impulsoras de residuos utilizadas en el módulo de compensación XGBoost.
Tabla 2 muestra que las variables explicativas de distintas dimensiones empresariales presentan formas estadísticas claramente diferentes. Las variables de activos físicos que representan dinámicas endógenas del desarrollo empresarial, como la capacidad de subestaciones y la longitud de líneas, tienen desviaciones estándar relativamente estables y valores de asimetría concentrados entre 0,1 y 0,8. Su estructura general de datos se distribuye aproximadamente de forma normal, reflejando objetivamente el atributo de un desarrollo estable de la red eléctrica durante el ciclo de construcción de infraestructuras. En marcado contraste están las variables meteorológicas y de perturbación ambiental externa en la parte inferior de la tabla. Por ejemplo, el número acumulado de días con temperaturas extremas que han alcanzado el nivel de alerta en los últimos 90 días y el índice de impacto por interrupciones en las líneas presentan una asimetría marcadamente positiva, con valores de 2,15 y 2,45, respectivamente. Esta distribución típicamente de cola pesada confirma un punto crítico objetivo que no puede ignorarse en la operación y mantenimiento reales de la red eléctrica: aunque los desastres meteorológicos extremos ocurren con relativa infrecuencia dentro de una escala temporal anual, cuando se desencadenan suelen provocar aumentos exponenciales en la mano de obra de reparación y en el consumo de repuestos. Desde otra perspectiva, la alta no uniformidad y la asimetría de valores extremos en la distribución de estas características multifuente revelan las limitaciones teóricas de los modelos tradicionales de series temporales lineales, como ARIMAX, que se basan en supuestos de normalidad y homocedasticidad al rastrear costos complejos de la red eléctrica. Esto no solo refuerza aún más la racionalidad de introducir un módulo de aprendizaje automático más allá de la base contable física, sino que también proporciona un sólido respaldo estadístico para la selección en este artículo del modelo de árboles XGBoost, capaz de manejar eficientemente distribuciones dispersas de características y mapeos no lineales para aproximar los residuos de costos.
Configuración del sistema de optimización y evaluación de hiperparámetros
Después de determinar el espacio de entrada de características, la configuración de los hiperparámetros del modelo afecta directamente el rendimiento de ajuste de la red de aproximación residual. Dado que la red de compensación XGBoost incluye múltiples parámetros, como la profundidad del árbol (max depth), la tasa de aprendizaje y los términos de penalización de regularización, y estos parámetros presentan interacciones no lineales, la búsqueda convencional por cuadrícula no solo tiene una alta complejidad computacional, sino que también tiende a quedar atrapada en mínimos locales en espacios de alta dimensión. Por lo tanto, este estudio introduce el estimador parzen estructurado en árbol (Tree-structured Parzen Estimator, TPE), un método de optimización bayesiana, en el proceso de ajuste de parámetros. El algoritmo TPE puede guiar dinámicamente las direcciones de muestreo posteriores utilizando la retroalimentación de la función de pérdida obtenida en evaluaciones previas. Al construir una estimación de densidad de kernel posterior (KDE) de la variable objetivo, reduce de forma adaptativa el espacio de búsqueda de parámetros, permitiendo que el modelo se aproxime a la configuración óptima global de hiperparámetros sin incurrir en un alto costo computacional. El objetivo de optimización TPE fue minimizar el RMSE de validación durante 100 iteraciones, con detención anticipada tras 50 rondas sin mejora.
Después de completar la optimización de parámetros en el conjunto de validación interno, para evaluar objetivamente el rendimiento final de cada modelo en el conjunto de prueba fuera de la muestra y cumplir con los requisitos de evaluación cuantitativa de los reguladores para la verificación de costos, este estudio utiliza el error porcentual absoluto medio (MAPE) para cuantificar la desviación relativa en la secuencia predicha. Mientras tanto, para abordar la necesidad práctica de controlar fallos extremos en la predicción de costos durante las operaciones, también se introduce el error cuadrático medio (RMSE) para imponer penalizaciones más severas a los errores mayores. Finalmente, el coeficiente de determinación, R2, cuantifica el poder explicativo general de la regresión en relación con la varianza real del objetivo.
Las definiciones matemáticas de los indicadores son las siguientes:
(12)
(13)
(14)
donde
representa el costo real de producción y operación en el período t,
representa el costo predicho por el modelo,
representa el costo real promedio en la muestra de prueba, y N es el número de muestras en el conjunto de prueba.