Este estudo utilizou dados operacionais e financeiros anonimizados coletados de uma rede elétrica provincial no leste da China. Todos os dados foram agregados e desidentificados antes da análise, e nenhuma informação pessoal identificável ou sensível em nível individual foi incluída. Portanto, não foi necessária aprovação ética. O acesso e a análise dos dados cumpriram as regulamentações aplicáveis de proteção de dados e os acordos institucionais que regem as informações do setor elétrico.
Visão geral da estrutura de previsão
Para integrar abordagens de previsão baseadas na física e orientadas por dados, foi desenvolvido um framework híbrido de previsão que combina cotações de custos de engenharia com aprendizado de máquina. Em vez de simplesmente combinar múltiplos algoritmos, o framework segue o princípio de que modelos físicos estabelecem a previsão de referência, enquanto o aprendizado de máquina compensa os erros residuais. Esse design garante que o processo de previsão seja fundamentado nos mecanismos físicos subjacentes às atividades de produção e operação da rede elétrica, em vez de depender exclusivamente da extrapolação de custos históricos.
A estrutura estabelece inicialmente um mapeamento hierárquico entre ativos da rede elétrica, atividades operacionais padronizadas e contas de custos financeiros. Os custos de produção e operação são tratados como representações monetárias dos recursos consumidos por ativos físicos — incluindo subestações, linhas de transmissão, alimentadores de distribuição, dispositivos de medição e equipamentos digitais de inspeção — durante atividades rotineiras, como inspeção, manutenção, testes, reparos e substituições. As cotas de custo funcionam como elo entre as cargas de trabalho de engenharia mensuráveis e as despesas financeiras correspondentes.
Conforme ilustrado na Figura 1, as cotas de custo funcionam como unidades contábeis padronizadas incorporadas em todo o processo de operação e manutenção de ativos, em vez de regras abstratas de alocação financeira. As cargas de trabalho dos ativos no nível inferior são convertidas em cotas operacionais padronizadas e posteriormente associadas a categorias de custo, incluindo mão de obra, materiais, equipamentos de construção, serviços terceirizados e suprimentos de emergência. Esse mapeamento hierárquico preserva a interpretabilidade técnica e a rastreabilidade regulatória durante todo o processo de previsão e fornece a base física para a construção do modelo estático de cota de referência.
Visão geral do fluxo de trabalho metodológico
A estrutura de previsão proposta consiste em três etapas sequenciais: (1) construção de uma linha de base física utilizando cotas de carga de trabalho por ativo, (2) evolução dinâmica das cotas de custo por meio de ajustes macroeconômicos e tecnológicos e (3) compensação baseada em aprendizado de máquina para capturar efeitos não lineares sistemáticos. Conforme ilustrado na Figura 1, a estrutura estabelece um mapeamento hierárquico dos ativos e atividades operacionais padronizadas no nível inferior até as previsões de custos de produção e operação. Os detalhes de implementação de cada etapa são descritos nas subseções a seguir.
Modelo de custo básico físico baseado em cargas de trabalho em nível de ativo
A produção e o custo operacional de uma rede elétrica, Ctotal, compreendem despesas associadas a múltiplas atividades comerciais, incluindo operação de subestações, manutenção de linhas de transmissão, gerenciamento da rede de distribuição, atendimento ao cliente e sistemas de apoio. Neste estudo, assume-se que o custo operacional de referência é determinado pela carga de trabalho gerada por cada atividade operacional padronizada e pela sua respectiva cota de custo.
O custo básico estático é calculado como:
(1)
em que Vi,k,t denota a carga de trabalho associada à tarefa operacional ou ao ativo i dentro da categoria empresarial k durante o período t, e Qi,k representa o custo unitário padronizado correspondente definido pelo sistema de cota de custo de engenharia. A categoria empresarial inclui funções operacionais principais, como manutenção de subestações, inspeção de linhas de transmissão, operação da rede de distribuição e atendimento ao cliente. A dupla somatória agrega os custos de todas as atividades operacionais padronizadas para estimar a despesa teórica de referência necessária para manter a operação normal da rede.
A Equação (1) estabelece a relação física entre cargas de trabalho de engenharia e despesas financeiras ao associar atividades operacionais padronizadas diretamente a contas de custo. Diferentemente dos modelos puramente estatísticos de previsão, esta formulação fornece uma linha de base de engenharia interpretável que serve como fundamento para ajustes dinâmicos subsequentes de cotas e correção residual baseada em aprendizado de máquina. A equação foi desenvolvida a partir das práticas operacionais e do sistema de cotas de custo utilizados por empresas provinciais de rede elétrica na China. Tabela 1 resume a notação utilizada na Equação (1), incluindo carga de trabalho (Vi,k,t), custo unitário padronizado (Qi,k), número de tarefas operacionais (Nk) e índice de categoria de negócio (k).
Mecanismo dinâmico de evolução de cotas sob perturbações ambientais externas
As cotas de custo padronizadas (Qi,k) fornecem uma referência fisicamente interpretável, mas não levam em conta mudanças nas condições macroeconômicas ou no progresso tecnológico. Para melhorar sua aplicabilidade a longo prazo, foi introduzido um mecanismo de evolução dinâmica para ajustar as cotas de referência em resposta tanto à inflação de preços quanto aos ganhos de eficiência impulsionados pela tecnologia.
O primeiro ajuste leva em conta as alterações nos custos de aquisição decorrentes da inflação macroeconômica. A operação e manutenção da rede elétrica dependem fortemente de materiais em grande escala, incluindo cobre, alumínio e aço silício, cujos preços estão estreitamente relacionados às flutuações no Índice de Preços ao Produtor (PPI). Como
é um índice com valor base de 100, ele é inicialmente convertido em uma taxa de inflação padronizada:
(2)
Com base nisso, a função de correção de preço
é definida como:
(3)
em que
é um vetor de pesos defasado de comprimento L que satisfaz

A estrutura de defasagem representa a transmissão retardada da inflação macroeconômica para os custos de aquisição na cadeia de suprimentos da rede elétrica. A conversão do índice IGP em uma taxa de inflação padronizada preserva o efeito cumulativo das alterações de preços, ao mesmo tempo que evita o viés de escala associado ao uso direto dos valores do índice. As equações (2) e (3) foram adaptadas de modelos estabelecidos de ajuste de inflação macroeconômica, com a estrutura de defasagem calibrada para os ciclos de aquisição do setor elétrico33,34.
O progresso tecnológico foi incorporado por meio de um fator de redução de custos que refletiu melhorias na eficiência operacional decorrentes de avanços como inspeção por veículos aéreos não tripulados, robótica inteligente e tecnologias digitais de manutenção. O fator de ajuste tecnológico é definido como:
(4)
Nesta parte, α e β são coeficientes empíricos de elasticidade estimados a partir de dados históricos em painel utilizando mínimos quadrados não lineares. Para garantir que o fator de progresso tecnológico represente sempre uma redução razoável no custo unitário da cota, o processo de estimação de parâmetros restringe 0 < Γ(Etech,t) ≤ 1. Deve-se notar que esse fator reflete principalmente a melhoria de eficiência de longo prazo decorrente da substituição por tecnologia madura. A Equação (4) é original neste trabalho, adaptando o conceito de curva de aprendizado da literatura sobre custos de tecnologias energéticas35,36 para operações de manutenção de redes. Custos adicionais que podem surgir no estágio inicial de implantação de equipamentos digitais, como operação paralela de sistemas antigos e novos, integração de plataformas, testes de comunicação e manutenção extra, não são deduzidos obrigatoriamente da cota de referência; ao invés disso, são identificados pelo módulo subsequente de compensação por resíduos de aprendizado de máquina:
(5)
em que Cbase,t denota o custo de linha de base estático calculado a partir das cargas de trabalho dos ativos de nível inferior e das cotas padronizadas de custos operacionais;
captura o efeito de transmissão das flutuações macroeconômicas de preços sobre os preços de materiais, equipamentos e serviços externos; e Γ(Etech,t) reflete a redução baseada na eficiência dos custos unitários de operação e manutenção após a maturidade tecnológica. Por meio do mecanismo de evolução dinâmica descrito acima, a linha de base da cota já não permanece em uma base contábil estática, mas pode ajustar-se adaptativamente às mudanças nos ambientes econômicos e nas condições tecnológicas. A Equação (5) é original deste trabalho e representa a integração inovadora das correções de preço e tecnologia ao interior do framework da linha de base de cotas.
Captura sistemática de resíduos não lineares sob restrições de cota
Apesar das correções evolutivas complexas, o modelo de cotação gera inevitavelmente desvios sistemáticos ao enfrentar interrupções climáticas imprevisíveis relacionadas a desastres e diretivas políticas súbitas, como custos aumentados no atendimento a reclamações de clientes durante períodos temporários de redução de tarifas. Esse desvio forma o termo residual em ambos os lados da equação:
Rt=Cactual,t-Ccota,t (6)
Como as regras físicas convencionais não conseguem explicar esse aspecto, a aprendizagem de máquina pode abordar essas limitações. Para evitar a maldição da dimensionalidade causada por características de alta dimensão, este estudo utiliza o algoritmo XGBoost baseado em conjuntos de árvores de decisão para modelar a relação não linear Rt37,38. Define-se uma matriz de características de forte perturbação Xt, incluindo características meteorológicas, como dias anuais extremos de congelamento Dice, e intensidade de políticas macroeconômicas.
Para um compensador não linear composto por árvores de regressão, a lógica de geração do resíduo previsto
pode ser expressa como39:
(7)
onde F denota o espaço de todas as estruturas possíveis de árvores de classificação e regressão. Para equilibrar a precisão do ajuste e a prevenção de sobreajuste, uma função objetivo regularizada contendo um termo de penalidade de complexidade estrutural é construída e minimizada na m-ésima iteração:
(8)
em que
é uma função de perda convexa que mede a diferença entre o resíduo verdadeiro e o resíduo previsto. Este artigo adota a Perda Huber para aumentar a robustez do modelo em relação a gastos máximos anômalos. O termo de regularização
é usado para restringir a complexidade da estrutura da árvore e é definido como:
(9)
em que Tm representa o número de nós folha na m-ésima árvore, wm representa o vetor de pesos correspondente das folhas, e γ e λ denotam, respectivamente, o coeficiente de penalização do número de nós folha e o coeficiente de regularização de peso.
A equação final de previsão é:
(10)
Ampliado ainda mais como:
(11)
A fórmula acima representa matematicamente a estrutura de malha fechada do modelo de previsão proposto. A demanda final de custo de produção e operação não é gerada diretamente pelo modelo de aprendizado de máquina; ao invés disso, é obtida pela sobreposição da compensação residual não linear identificada pelo módulo de aprendizado de máquina sobre a linha de base dinâmica da cota. Dentre esses componentes, os fatores preço e tecnologia refletem principalmente a evolução dinâmica da linha de base da cota, enquanto fatores difíceis de caracterizar explicitamente por meio de regras, como choques climáticos, perturbações políticas e picos nos eventos de reparo, são capturados pelo módulo de compensação residual baseado em aprendizado de máquina. As equações (10) e (11) são originais deste trabalho e sintetizam a linha de base física com a captura residual baseada em ML em um quadro unificado de previsão.
Figura 2 mostra que os resultados de previsão do modelo proposto exibem uma lógica clara de geração hierárquica. Por um lado, a cota de referência fornece uma base física estável, transparente e auditável para a demanda de custos; por outro lado, os ajustes de preço, os efeitos tecnológicos e os resíduos de choques externos permitem que o modelo se adapte a mudanças dinâmicas em ambientes complexos. Em comparação com modelos caixa-preta que geram diretamente valores previstos, essa estrutura de decomposição pode revelar claramente "por que os custos aumentam ou diminuem", aumentando assim a interpretabilidade dos resultados do modelo na revisão orçamentária e na regulação das tarifas de transmissão e distribuição.
Fontes de dados e procedimentos de coleta
Modelos teóricos devem ser rigorosamente validados por meio de dados empíricos para demonstrar sua utilidade prática. Como os dados financeiros centrais do setor elétrico envolvem informações sensíveis relacionadas às operações de infraestrutura nacional, este estudo extrai dados contábeis mensais de alta precisão e anonimizados de uma rede elétrica provincial típica no leste da China, referida como E-Grid para facilitar a referência, abrangendo 16 anos consecutivos, de 2010 a 2025. Essa província passou por um ciclo econômico típico de transição de um crescimento impulsionado por indústrias pesadas tradicionais para a manufatura de alta tecnologia, com a taxa de crescimento anual composta da escala de ativos da rede alcançando 7,4%. A evolução complexa de sua estrutura de custos, portanto, possui relevância potencial para outros sistemas de rede em rápido desenvolvimento. Os dados originam-se de três fontes principais: (1) registros internos de operação e manutenção que registram cargas de trabalho em nível de ativo, frequências de inspeção e eventos de reparo; (2) sistemas de contabilidade financeira que fornecem demonstrativos mensais de custos em mão de obra, materiais, equipamentos e serviços terceirizados; e (3) bases de dados ambientais externas, incluindo registros meteorológicos da Administração Meteorológica da China e indicadores macroeconômicos do Escritório Nacional de Estatísticas.
Controle de qualidade e tratamento de dados ausentes
Para mais de 130 indicadores iniciais integrados a partir de sistemas múltiplos, foi implementado um procedimento rigoroso de controle de qualidade. Pontos de dados ausentes, correspondendo a menos de 3% do total de observações, foram tratados mediante interpolação linear para variáveis contínuas com tendências temporais e imputação pela moda para indicadores categóricos. Valores atípicos foram identificados utilizando o método do intervalo interquartílico (IIQ), sendo os valores que excediam 3,0 vezes o IIQ acima do terceiro quartil ajustados para o percentil 99 para preservar a integridade dos dados e mitigar distorções provocadas por valores extremos.
Considerações sobre o tamanho da amostra
O conjunto de dados compreende 192 observações mensais (janeiro de 2010 a dezembro de 2025), com 156 observações (2010–2022) alocadas para treinamento e validação e 36 observações (2023–2025) reservadas para testes fora da amostra. Embora este tamanho amostral seja relativamente modesto para aplicações de aprendizado profundo, é adequado para o algoritmo XGBoost, que foi especificamente projetado para apresentar bom desempenho com conjuntos de dados tabulares pequenos a médios por meio de seus mecanismos de regularização e poda de árvores. Para mitigar riscos potenciais de sobreajuste, (1) foram empregadas penalidades rigorosas de regularização (γ = 0,1, λ = 1,0), (2) parada antecipada com tolerância de 50 rodadas e (3) restrições conservadoras de profundidade das árvores (profundidade máxima = 5). Essas medidas garantem coletivamente a estabilidade e a capacidade de generalização do modelo, apesar do tamanho limitado da amostra.
Segmentação de dados e integração heterogênea de múltiplas fontes
Para testes rigorosos, os dados de janeiro de 2010 a dezembro de 2022 foram designados para o intervalo de treinamento-validação, contendo 156 observações, que é utilizado para treinar os fatores de evolução da cota e a rede residual de compensação de cota. O período de janeiro de 2023 a dezembro de 2025 é reservado como conjunto de teste mantido fora da amostra, contendo 36 observações. Por que este período foi selecionado como a arena final de testes? A razão é que esses três anos coincidiram com a aceleração da construção de sistemas elétricos de novo tipo, agravada por eventos em larga escala de altas temperaturas relacionados ao forte El Niño e pelo crescimento rápido e desigual da geração distribuída de energia renovável. A rede elétrica enfrentou pressões sem precedentes nas cadeias de suprimento de materiais e na alocação de mão de obra para reparos.
A seleção científica e a definição quantitativa de fatores impulsionadores de custos são a base para garantir que a rede residual de aprendizado de máquina possa capturar efetivamente flutuações sistemáticas. Com base na lógica de gestão dos custos operacionais padrão em sistemas de energia, este estudo ultrapassa a dimensão única da previsão financeira tradicional, que depende apenas de fluxos de caixa históricos, e reconstrói a engenharia de características a partir de quatro limites principais: escala de ativos físicos, condições de operação e manutenção, evolução macroeconômica e ambiente climático externo, utilizando registros operacionais originais e livros contábeis de sistemas externos. No processo real de modelagem, para mais de 130 indicadores originais resultantes da integração de sistemas múltiplos, este estudo utiliza testes de correlação de Pearson para eliminar variáveis redundantes altamente colineares, com um limiar de |r| > 0,85. Com base no conhecimento prévio de especialistas seniores em redes elétricas, 42 características de entrada principais são finalmente selecionadas para formar a matriz de características Xt. Para apresentar claramente a estrutura subjacente e a distribuição dos dados do tensor de entrada, Tabela 2 seleciona 12 características principais representativas das quatro dimensões de avaliação acima e resume suas estatísticas descritivas ao longo do período de observação.
Para ilustrar melhor a base espacial-topológica do sistema de características multissource, Figura 3 apresenta uma topologia esquemática anonimizada da rede elétrica provincial em estudo. A figura sobrepõe subestações por nível de tensão, corredores de transmissão, agrupamentos distribuídos de energias renováveis, centros de carga e zonas representativas de distúrbios ambientais. A topologia ajuda a explicar por que os custos de produção e operação são conjuntamente afetados pela escala dos ativos, estrutura da rede, intensidade de reparos emergenciais e choques climáticos externos. Também fornece uma base de interpretação espacial para as variáveis orientadas por resíduos utilizadas no módulo de compensação XGBoost.
Tabela 2 mostra que as variáveis explicativas em diferentes dimensões empresariais exibem formas estatísticas claramente distintas. As variáveis de ativos físicos que representam dinâmicas endógenas de desenvolvimento empresarial, como capacidade de subestação e comprimento de linha, possuem desvios-padrão relativamente estáveis e valores de assimetria concentrados entre 0,1 e 0,8. Sua estrutura geral de dados é aproximadamente normal, refletindo objetivamente o atributo de desenvolvimento estável da rede elétrica no ciclo de construção de infraestrutura. Em acentuado contraste estão as variáveis meteorológicas e de perturbação ambiental externa na parte inferior da tabela. Por exemplo, o número acumulado de dias com temperaturas elevadas em nível de alerta nos últimos 90 dias e o índice de impacto de desligamento de linha apresentam assimetria fortemente positiva, com valores de assimetria de 2,15 e 2,45, respectivamente. Essa distribuição típica com cauda pesada confirma um ponto crítico objetivo que não pode ser ignorado na operação e manutenção reais da rede elétrica: embora desastres climáticos extremos ocorram com relativa infrequência ao longo do ano, quando acionados, costumam provocar aumentos exponenciais na demanda de mão de obra para reparos e no consumo de peças de reposição. De outra perspectiva, a alta não uniformidade e a assimetria de valores extremos na distribuição dessas características multissensoriais revelam as limitações teóricas dos modelos tradicionais de séries temporais lineares, como o ARIMAX, que se baseiam nas suposições de normalidade e homocedasticidade ao rastrear custos complexos da rede elétrica. Isso não apenas reforça ainda mais a racionalidade de introduzir um módulo de aprendizado de máquina além da base contábil física, mas também fornece suporte estatístico sólido para a escolha, neste artigo, do modelo de árvore XGBoost, capaz de lidar eficientemente com distribuições esparsas de características e mapeamentos não lineares para aproximar os resíduos de custo.
Configuração do sistema de otimização e avaliação de hiperparâmetros
Após determinar o espaço de entrada das características, a definição dos hiperparâmetros do modelo afeta diretamente o desempenho de ajuste da rede de aproximação de resíduos. Como a rede de compensação XGBoost envolve múltiplos parâmetros, incluindo profundidade da árvore (max depth), taxa de aprendizado e termos de penalidade de regularização, e esses parâmetros apresentam interações não lineares, a busca convencional em grade não apenas possui alta complexidade computacional, mas também tende a ficar presa em mínimos locais em espaços de alta dimensão. Portanto, este estudo introduz o Estimador Parzen com Estrutura de Árvore (Tree-structured Parzen Estimator, TPE), um método de otimização bayesiana, no processo de ajuste de parâmetros. O algoritmo TPE pode orientar dinamicamente as direções de amostragem subsequentes utilizando o feedback da função de perda a partir de avaliações anteriores. Ao construir uma estimativa da densidade espectral posterior (KDE) da variável objetivo, ele reduz adaptativamente o espaço de busca de parâmetros, permitindo que o modelo aproxime a configuração globalmente ótima de hiperparâmetros sem incorrer em alto custo computacional. O objetivo da otimização TPE foi minimizar o RMSE de validação ao longo de 100 iterações, com interrupção antecipada após 50 rodadas sem melhoria.
Após a conclusão da otimização dos parâmetros no conjunto de validação interno, para avaliar de forma objetiva o desempenho final de cada modelo no conjunto de testes fora da amostra e atender aos requisitos quantitativos dos reguladores para verificação de custos, este estudo utiliza o erro percentual absoluto médio (MAPE) para quantificar o desvio relativo na sequência prevista. Ao mesmo tempo, para atender à necessidade prática de controlar falhas extremas nas previsões de custo durante as operações, o erro quadrático médio (RMSE) também é introduzido para impor penalidades mais severas a erros maiores. Por fim, o coeficiente de determinação, R2, quantifica o poder explicativo geral da regressão em relação à variância verdadeira do alvo.
As definições matemáticas dos indicadores são as seguintes:
(12)
(13)
(14)
em que
representa o custo real de produção e operação no período t,
representa o custo previsto pelo modelo,
representa o custo real médio na amostra de teste e N é o número de amostras no conjunto de teste.