Method Article

Fusão Interativa de Atenção Multiescala com Rede de Convolução de Características Escassas para Detecção de Alterações de Imagens de Satélite

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo apresenta um modelo interativo de fusão de atenção multiescala com redes de convolução de características escassas para melhorar a detecção de mudanças em imagens de satélite. A abordagem aproveita a extração de características multiescala, o foco seletivo na atenção e convoluções esparsas para detectar e localizar efetivamente mudanças em imagens de satélite bi-temporais, reduzindo a complexidade computacional.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A detecção de mudanças usando imagens de satélite bi-temporais é um problema importante no monitoramento da Terra, que visa identificar e localizar mudanças na superfície entre uma aquisição temporal e distinguir pseudo-mudanças reais devido a ciclos sazonais, fatores atmosféricos ou desenvolvimentos causados pelo homem. Os métodos atuais de deep learning normalmente enfrentam um viés unidirecional em sua modelagem temporal, o que restringe a usabilidade de relações espaciais em grande escala para possibilitar a caracterização adequada dos padrões de mudança. Embora as técnicas recentes baseadas em transformadores sejam altamente precisas, seus requisitos computacionais também são bastante grandes, limitando assim seu uso em tarefas com recursos limitados. Em resposta a essas limitações, uma rede Interativa de Fusão de Atenção Multiescala (IMAF) com Convolução de Características Escassas (SFC) baseada em módulos Ghost para alcançar extração eficaz de características multiescala é proposta neste artigo. A rede utiliza arquitetura avançada codificador-decodificador, complementada por módulos de atenção interativos em diferentes escalas. A rede funciona com fluxos complementares de atenção para frente e para trás: o primeiro registra variação temporal progressiva e o segundo verifica a consistência das mudanças por análise temporal reversa. Esse método interativo permite representações eficazes do modelo duplex de relações temporais sem ser computacionalmente proibitivo, aprimorando abordagens muito melhores para distinguir movimentos legítimos de cobertura do solo versus ruído ausente de variação induzida pelo ruído. Dois conjuntos de dados de referência são experimentados: o conjunto de dados de Detecção de Alterações por Satélite Onera (OSCD) e o conjunto de dados SZTAKI AirChange. Os experimentos significativos realizados com conjuntos de dados OSCD revelam que a abordagem proposta atinge taxas competitivas de F1 de 58,14% (13 canais) e 50,68% (3 canais) com apenas 2,13 milhões de parâmetros e 19,6G FLOPS, 19 vezes poucos parâmetros, e 5,6x de rotatividade de inferência em comparação com o ChangeFormer. O desempenho competitivo nas amostras dos conjuntos de teste Szada/1 e Tiszadob/3 do conjunto de dados SZTAKI, com pontuação F1 de 74,29% e 92,86% respectivamente, torna possível implementar, no maior número possível de dispositivos de borda, análises em tempo real e sistemas extensos de mapeamento onde a energia operacional depende diretamente da energia computacional.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Níveis sem precedentes de urbanização no meio ambiente global, perda de recursos ambientais e alterações na paisagem devido ao clima desencadearam diretamente a necessidade de fornecer um sistema de monitoramento exato, oportuno e automático que possa identificar e medir mudanças na superfície da Terra. A sensoriamento remoto via satélite tornou-se o bloco básico da vigilância ambiental em massa, pois fornece cobertura temporal e espacial consistente, além de ser vital para o exame completo da mudança. A detecção de mudanças em imagens de satélite bi-temporais é a caracterização das mudanças na superfície entre duas aquisições sequenciais da mesma região geográfica. É um processo complicado, porém, devido às inúmeras variáveis de confusão, incluindo a variação das estações, as condições climáticas, as propriedades dos sensores, distorções geométricas e alterações fenomenológicas que podem obscurecer ou se assemelhar ao real na cobertura do solo. A interpretação manual de imagens de satélite atualmente em uso é demorada, subjetiva e inadequada para lidar com as quantidades crescentes de informações de observação da Terra geradas pelas constelações atuais de satélites. Essa é a limitação básica que resultou na criação de soluções automatizadas de detecção de mudanças. Métodos convencionais baseados empixels 1 e detecção de alterações baseados emobjetos 2 tendem a ser pouco adequados para operar dentro dos limites dessas complexidades e possuem um padrão baixo de robustez para aplicar a uma grande variedade de unidades geográficas e escalas temporais. Arquiteturas de deep learning, especialmente redes neurais convolucionais e variantes, permitem a extração de características hierárquicas que representam detalhes espectrais de baixo nível e padrões semânticos de alto nível relevantes para distinguir mudanças. Modelos de detecção de mudanças em aprendizado profundo têm se mostrado altamente promissores na captura de mudanças espaço-temporais latentes em dados de sensoriamento remoto e na identificação da verdadeira cobertura do solo versus pseudo-mudanças, introduzidas por fatores externos. Essas abordagens de aprendizado de ponta a ponta aproveitam o fato de que as características podem ser extraídas e a classificação pode ser realizada de forma ótima de uma só vez. Apesar do progresso substancial na precisão da detecção de mudanças, a maioria das abordagens existentes continua difícil de ser implementada em ambientes operacionais do mundo real. Abordagens baseadas emtransformadores 3, embora eficientes no contexto global, possuem alto número de parâmetros, complexidade computacional quadrática, latência de inferência e alto consumo de energia. As arquiteturas siamesas baseadas em CNN, por outro lado, são superiores em eficiência, mas possuem campos receptivos pequenos e carecem em grande parte de modelagem contextual global, o que piora significativamente o desempenho. Essas restrições são ainda mais agravadas em ambientes de grande escala e com recursos limitados, onde escalabilidade e custo operacional são considerações críticas. Escalabilidade, eficiência energética e a velocidade com que as inferências são feitas são frequentemente vitais em um ambiente de resposta a emergências, e há necessidade de criar soluções que equilibrem desempenho e implantabilidade. Portanto, permanece uma lacuna entre modelos computacionais focados em precisão e os requisitos práticos da implantação no mundo real.

Para superar tais problemas, é proposta uma Rede Interativa de Fusão de Atenção Multiescala (IMAF) com Convolução de Características Escassas (SFC), que foca no design de uma estrutura eficiente e implantável de detecção de mudanças, em vez de apenas otimização de precisão. A solução proposta foca em pares ópticos de imagens de satélite, geralmente RGB ou imagens multiespectrais de alta resolução (resolução 0,5-30 m), adquiridas por satélites, por exemplo, Landsat, Sentinel-2 ou WorldView. A técnica pressupõe um co-registro geométrico preciso de pares bitemporais, pois erros de registro também podem ter um efeito considerável na detecção. Ele lida com detecção de mudança binária (em oposição à mudança semântica multiclasse) e não consegue distinguir entre vários tipos de mudança. Além disso, o método utiliza imagens corrigidas radiometricamente para reduzir os efeitos das mudanças sazonais, atmosféricas e de iluminação, que seriam confundidas com mudanças na cobertura do solo. Ao contrário das tradicionais CNNssiamesas 4, que separam imagens bitemporais com o auxílio de uma simples concatenação, o módulo IMAF proposto permite a fusão contextual multiescala de características globais e locais. Abordagens recentes baseadas em transformadores, como BIT5 eChangeFormer 3, estão obtendo resultados muito bons, mas seus mecanismos de autoatenção têm a complexidade O(N2). O framework proposto captura mudanças sutis com atenção bidirecional, reduzindo a complexidade computacional e a latência de inferência. Além disso, o projeto proposto é consciente da esparsidade, o que é superior a projetos de fusão densa multiescala, como UNet++6,7 e SNUNet8. A convolução de características esparsas com o módulo fantasma reduz os FLOPs em aproximadamente 50%, preservando a qualidade da representação. Assim, o framework proposto favorece um equilíbrio entre precisão e eficiência para uma implantação confiável em ambientes com recursos limitados.

As principais contribuições deste estudo são: (i) Um detector de mudança leve que atinge uma pontuação F1 competitiva usando 19 vezes menos parâmetros em comparação com seus equivalentes baseados em transformadores. (ii) Um módulo de Fusão de Atenção Multiescala Interativa que obtém informações contextuais globais sem o custo computacional quadrático dos mecanismos tradicionais de autoatenção. (iii) Um esquema de convolução com esparsão de características baseado em módulos Ghosts, que minimiza as operações de ponto flutuante em 49,4 por cento, sem degradação da qualidade na representação das características. (iv) Validação experimental extensa em um grande conjunto de conjuntos de dados de referência, com melhores compensações entre eficiência e precisão e razoável praticabilidade da aplicação real no mundo real.

O restante deste manuscrito compreende as seguintes seções: A Seção 2 oferece uma visão geral extensa dos trabalhos recentes na área de metodologias de detecção de mudanças binárias, com atenção especial a soluções de aprendizado profundo e sua implementação em benchmarks padrão. A Seção 3 apresenta o contexto teórico e o design estrutural da solução proposta, representação matemática do mecanismo de fusão temporal e dos elementos de atenção, as características do conjunto experimental, conjuntos de dados, métricas de avaliação e detalhes de implementação necessários para produzir pesquisas reprodutíveis. A Seção 4 ilustra achados experimentais detalhados que incluem ablação, comparações com os mais recentes algoritmos de detecção de alterações binárias que explicam a capacidade em várias áreas geográficas nos conjuntos de dados de Airchange do OSCD e SZTAKI. A Seção 5 determina o resultado dos achados, limitações de uma abordagem atual e possibilidades de pesquisas futuras na detecção de mudanças.

O desenvolvimento de algoritmos de detecção de mudanças em sensoriamento remoto foi muito alterado, passando de métodos baseados em pixels para frameworks de aprendizado profundo. Os procedimentos iniciais de detecção de mudanças baseavam-se principalmente em processos algébricos como diferenciação de imagens, racionamento de imagens e análise de vetores de mudança, que trabalhavam diretamente sobre valores de pixels para detectar mudançastemporais 9,10. Foram desenvolvidos métodos alternativos envolvendo comparação pós-classificação, nos quais cada imagem temporal foi classificada de forma independente e depois comparada com a tabulaçãocruzada 11. As técnicas de detecção de mudanças baseadas em objetos representaram um passo importante de progresso com a introdução do contexto espacial, bem como a mitigação do ruído em nível depixel 2,12.

O advento das técnicas de deep learning revolucionou o espaço da detecção de mudanças por sensoriamento remoto e abriu caminho para superar várias limitações das técnicas tradicionais. Recentemente, as Redes Neurais de Convolução (CNNs) tornaram-se a arquitetura padrão para extração automatizada de características e classificaçãode alterações 13,14. O Siamese NestedUNet for ChangeDetection 14 e o Siamese Swin-Unet15 emergiram como uma inovação significativa devido à topologia de redes siameses densamente conectadas, que ajuda a reter efetivamente as informações de localização em toda a hierarquia da rede.

O problema da detecção de mudança bi-temporal em sensoriamento remoto óptico de alta resolução ainda é difícil de resolver devido a uma variedade de fatores de confusão, e as redes transformadoras multiescala baseadas em atenção com estratégias elaboradas de fusão de características forampropostas 16. A estrutura EGMT-CD propôs transformadores multimodais guiados por bordas de pares de imagens heterogêneos, onde as imagens homólogas não são acessíveis devido à cobertura denuvens 17. Arquiteturas como a DASUNet rompem gargalos manuais de aprendizado profundo na fusão de características em escala real, com melhora 0,85% maior no índice F1 em relação ao SNUNet-24 no conjunto de dados CDD usando fluxogradiente melhorado 18. Modelos híbridos CNN-Transformador lidam com a questão dos falsos negativos a um custo mais alto, fornecendo um custo adicional nos componentes de frequência para o aprendizado de características19. As redes híbridasde transformadores em formato de U 20, no entanto, ainda são difíceis de fornecer integração de características locais-globais e mudanças nas regiões que ocorrem periodicamente, mesmo em pequena escala. O uso de detecção de mudanças semânticas multitarefas, além de localização precisa e identificação de classes, é mais complicado em comparação com tarefas binárias21,22. Correlações bi-temporais podem ser modeladas com sucesso por atenção cruzada sem mudanças arquitetônicassignificativas 14,23. A expressão paradigmática de linguagem de perspectiva também é uma fronteira recente, com designs baseados em CLIP, combinando explicações textuais em padrões de correspondênciade mudança 24 e semi-supervisionados, eliminando a dependência de dados rotulados25. Change Mamba apresenta os modelos de espaço de estados dos modelosespaço-temporais 26,27. Diferentes aplicações de métodos especializados de atenção são demonstradas: abordando o uso da detecção de anomaliashiperespectrais 28, classificação de alvosmultiárea 29 ou segmentação de rótuloslimitados 30, e demonstrando a flexibilidade dos mecanismos de atenção em análises de sensoriamento remoto.

AutoresMétodo/ArquiteturaEspecificações TécnicasInovação Chave e Descobertas / Desempenho do Conjunto de Dados
Singh, A. [8]Métodos TradicionaisDiferenciação baseada em pixels, CVAFramework de detecção digital de mudanças, múltiplos conjuntos de dados, Precisão: 65-80%
Mas, J.F. [10]Pós-classificaçãoClassificação temporal independenteAnálise de metodologia comparativa, Imagens tropicais, OA: 72-85%
Lu et al. [9]Métodos TradicionaisOperações algébricas, AVC, ACPComparação abrangente de técnicas, Múltiplas fontes, Precisão: 70-88%
Benedek & Szirányi [23]Modelo de Markov MistoEstrutura condicional multicamadaModelagem probabilística de variação, Sztaki AirChange, DA: 92,1%
Blaschke, T. [2]Baseado em objetosAnálise baseada em segmentaçãoIntegração de contexto espacial, várias imagens de HR, SA: 85-92%
Chen et al. [11]Baseado em objetosSegmentação multiescalaAnálise hierárquica de objetos, imagens de HR, OA: 87,3%
Zhan et al. [12]CNN siamesaCNN de 5 camadas, tamanho do kernel 3×3Arquitetura siamês profunda para CD, imagens aéreas, F1: 0,847, IoU: 0,735
Daudt et al. [4]FCN siamêsFC-EF, FC-Siam-diff, FC-Siam-concEstratégias de fusão precoce/tardia, OSCD, F1: 0,431, IoU: 0,276
Peng et al. [26]UNet++U-Net aninhada, conexões de salto densoAgregação de características multiescala, satélite HR, F1: 0,753, IoU: 0,604
Chen & Shi [25]Atenção Espaço-TemporalBlocos de atenção, modelagem temporalAprendizado de características espaço-temporal, LEVIR-CD, F1: 0,887, IoU: 0,797
Fang et al. [7]SNUNet-CDSiamês NestedUNet, conexões densasOtimização de transmissão de informação, LEVIR: F1: 0,897, WHU: F1: 0,904
Chen et al. [5]BIT-CDResNet18 + codificador transformadorAprendizado binário de características temporais, OSCD: F1: 0,635, LEVIR: F1: 0,919
Bandara & Patel [3]Mudança AntigaCodificador de transformador hierárquicoAtenção de transformadores em múltiplas escalas, OSCD: F1: 0,654, LEVIR: F1: 0,905
Song et al. [27]ACANetAtenção axial + espinha dorsal CNNCálculo eficiente de atenção, LEVIR: F1: 0,901, WHU: F1: 0,913
Shi et al. [28]Artigo de RevisãoPesquisa abrangente sobre métodos de IAAnálise sistemática de abordagens de IA, 50+ conjuntos de dados analisados
Li et al. [14]AMST-NetTransformador multiescala, atenção pirâmideExtração adaptativa de características multiescala, imagens ópticas de frequência cardíaca, mIoU: 0,823
Xiang et al. [15]EGMT-CDArquitetura multimodal guiada por bordasAlinhamento de características entre modais, Pares heterogêneos, F1: 0,756
Miao et al. [16]DASUNetSupervisão densa, fusão em escala totalSupervisão profunda em todos os níveis do decodificador, CDD: 0,85% de melhora na F1 em relação ao SNUNet
Tang et al. [29]Swin-UNet siamêsFusão Swin Transformer + UnetJanela hierárquica de atenção, LEVIR: F1: 0,923, WHU: F1: 0,925
Wu et al. [18]Transformador em U híbridoBackbone UNet++ + blocos transformadoresIntegração de recursos global-local, imagens de RH, IoU: 0,851, F1: 0,919
Dong et al. [20]ChangeCLIPLinguagem visual baseada em CLIPCompreensão semântica multimodal, pares RS, precisão semântica: 94,1%
Li et al. [21]SemiCD-VLLinguagem de visão semi-supervisionadaRequisitos de anotação reduzidos, rótulos limitados, F1: 0,889
Chen et al. [22]ChangeMambaModelos de Espaço de Estado (SSMs)Modelagem temporal de complexidade linear, imagens RS, eficiência: 3 vezes mais rápida

Tabela 1: Resumo dos Métodos de Detecção de Mudanças em Sensoriamento Remoto. Por favor, clique aqui para baixar esta tabela.

Um resumo dos estudos anteriores é apresentado na Tabela 1. Métodos tradicionais possuem recursos artesanais que não são adequados para variações espaço-temporaiscomplexas 31, e a arquitetura de aprendizado profundo (UNet, FPN, PSPNet) envolve convoluções densas computacionalmente caras. Os modelos atuais não possuem sistemas eficientes de incorporação multiescala e atenção dinâmica. Para preencher essas lacunas, o estudo atual propõe a Fusão Interativa de Atenção Multiescala com Rede de Convolução de Características Escassas, que visa capturar as mudanças sutis entre escalas, sendo computacionalmente eficiente em sensoriamento remoto, especialmente em mudanças estruturais urbanas e causadas pelo homem.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Declaração de ética

  1. Tanto os conjuntos de dados Onera Satellite Change Detection (OSCD) quanto SZTAKI AirChange usados neste estudo consistem em imagens RGB e multiespectrais disponíveis publicamente cobrindo diversas características geográficas. Esses conjuntos de dados não contêm dados restritos ou sensíveis. Portanto, não é necessário consentimento ético para este trabalho.

2. Materiais e equipamentos

  1. Realize testes em um computador com Windows 11 contendo um processador Intel Core i7 10870H, um chip NVIDIA GeForce GTX 1650 Ti com 4GB de VRAM e 32GB de RAM.
    NOTA: O ambiente de programação é Python 3.8, e depende do framework PyTorch (versão 1.12.1) e do Torchvision (versão 0.13.1) para implementar deep learning.
  2. Baixe e instale bibliotecas como scikit-learn (versão 1.0.2), contendo utilitário de aprendizado de máquina, e NumPy (versão 1.21.0), contendo operações numéricas.
  3. Certifique-se de instalar as versões 11.3 do CUDA Toolkit e a versão 8.2 do cuDNN fornecidas pela NVIDIA Corporation para poder utilizar a aceleração da placa de vídeo.
  4. Treine e avalie o desempenho usando o conjunto de dados de Airchange OSCD e SZTAKI, disponível publicamente.

3. Preparação de conjuntos de dados

  1. Selecione o OSCD4, composto por imagens aéreas ópticas RGB de satélite e imagens multiespectrais, cada uma de 600 x 600 pixels com resolução de 10 m, e o conjunto de dados SZTAKIAirChange 32 , composto por 13 pares ópticos de imagens aéreas, cada um com 952 x 640 pixels e resolução de 1,5 m/pixel, como conjuntos de dados de referência.
  2. Particione as 24 cidades do conjunto de dados OSCD em 14 cidades fixas e predefinidas para treinamento e 10 cidades para testes.
  3. Atribuir pares fixos não aleatórios de imagens Szada/1 e Tiszadob/3 do conjunto de dados SZTAKI AirChange ao conjunto de teste e os pares de imagens restantes como o conjunto de treinamento como um benchmark convencional.
  4. Realize a detecção de mudanças no conjunto de teste e quantifique o desempenho em uma única execução usando pares de imagens anotadas de cada conjunto de dados.

4. Pré-processamento

  1. Aplique pré-processamento baseado em patches.
    1. Extraia patches de imagem independentemente por imagem temporal em locais idênticos em tempo real para gerenciar imagens de satélite de alta resolução de forma eficiente.
    2. Divida cada imagem em áreas sobrepostas de 128 × 128 pixels usando uma passada de 64 pixels.
    3. Alinhe regiões sobrepostas entre manchas adjacentes para manter a consistência dos limites e reter as informações das bordas.
  2. Realize aumento de dados por classes.
    1. Aplique aumento diferencial durante o treinamento em ambos os patches do par com base na proporção de pixels de mudança para lidar com o desequilíbrio de classe entre regiões de "mudança" e "sem mudança".
    2. Aumente o par de patch de mudança (aqueles com > 1% de pixels de mudança) seis vezes usando as seguintes transformações: inversões horizontais e verticais, rotações de 90°, jitter de cor (brilho, contraste e saturação ± 30%), transformações afins (rotação ± 15°, translação ± 10 pixels, escala 95-105%).
    3. Aumente o par de patches sem alteração apenas uma vez para evitar desequilíbrio no conjunto de dados.
      NOTA: Esta estratégia de aumento, baseada em classes, oferece treinamento equilibrado nas regiões de mudança e sem mudança.
  3. Normalize e melhore a qualidade da imagem.
    1. Normalize todos os patches usando a média e o desvio padrão do ImageNet: Média = (0,485, 0,456, 0,406), Std = (0,229, 0,224, 0,225).
      1. Use o Contrast Limited Adaptive Histogram Equalization (CLAHE) com limite de clipe = 2.0, tamanho da grade do tile = 8 x 8, no Espaço de Cor LAB (Apenas Canal L) para clarear os contrastes das áreas com baixo contraste, de modo que as características possam ser distinguidas na imagem, com intensidades normalizadas para [0,255].
      2. Limpe quaisquer patches menores que 128 x 128 pixels e preencha os patches menores para que tenham o mesmo tamanho dos patches maiores e mantenham sua integridade espacial durante o treinamento do modelo.

5. Construção do modelo

  1. Defina entrada e saída.
    1. A estrutura proposta recebe como entrada um par de imagens de satélite co-registradas I1, I2 R H×W×C adquiridas em diferentes momentos temporais e produz um mapa binário de mudança M ∈ RH×W×2 que delimita com precisão regiões alteradas e inalteradas.
  2. Estrutura proposta
    1. Processe o framework proposto como um pipeline de processamento em três etapas. Na primeira etapa, realize modelagem de atenção temporal em sequências de entrada para capturar mudanças ao longo do tempo.
    2. Use a atenção cruzada interativa para capturar dependências temporais simétricas entre características bitemporais na etapa de modelagem da atenção temporal.
    3. Extraia representações hierárquicas de características relevantes de uma imagem modelada temporalmente usando uma arquitetura de codificador baseada em características esparsa na segunda etapa, onde a resolução espacial diminui gradualmente enquanto a dimensão das características aumenta.
    4. Use um decodificador skip-connected com upsampling adaptativo para produzir mapas de mudança de alta resolução na etapa de reconstrução, mantendo detalhes espaciais em escala menor.
      NOTA: A Figura 1 mostra o fluxo geral de dados das imagens bitemporais de satélite de entrada para o codificador compartilhado, blocos de processamento de atenção cruzada do meio e o decodificador, que juntos resultam no mapa de detecção de mudanças.
  3. Codificador de características esparsas
    1. Construir um codificador leve construído a partir de blocos convolucionais Ghost com razão=2, com normalização em lote e função de ativação do ReLU aplicada sequencialmente para reduzir a complexidade computacional mantendo a qualidade representacional.
    2. Monte o codificador sequencialmente a partir dos três tipos seguintes de blocos.
      Bloco 1: Ghost(in_channels → 32) → BN ReLU Ghost (32 → 64) → BN ReLU MaxPool (2×2)
      Bloco 2: Ghost (64 → 96) → BN ReLU Ghost (96 → 128) → BN ReLU MaxPool (2×2)
      Bloco 3: Ghost(128 → 128) → BN ReLU
    3. Conecte os blocos para manter o fluxo suave de características através do codificador e preservar a resolução espacial para as etapas seguintes.
      NOTA: A inovação central dessa abordagem reside no mecanismo interativo de atenção cruzada que permite a interação simétrica de características entre imagens bi-temporais. Para cada par de imagens, são extraídas as características profundas F1,F 2R B×C×H'×W', onde H' = H/4, W' = W/4, C=128 representa a dimensão das características. Essas características espaciais são remodeladas para um formato figure-protocol-1 de sequência que representa o comprimento da sequência espacial, e D=C representa a dimensão da característica.
  4. Modelagem de atenção temporal
    1. Implemente a operação de atenção cruzada usando a formulação padrão de atenção escalar escalar, conforme ilustrado na Figura 2
      figure-protocol-2
      onde Q, K e V representam matrizes de consulta, chave e valor, respectivamente, e dk denota a dimensão dos vetores chave.
      NOTA: A atenção multi-cabeças com h = 8 cabeças para capturar diferentes tipos de relações temporais simultaneamente é empregada independentemente em cada escala. Cada cabeça de atenção processa um subespaço diferente das representações de características, permitindo que o modelo foque em vários aspectos das mudanças temporais.
    2. Calcule a saída de atenção multi-cabeça como:
      MultiHead (Q,K,V) = Concat (cabeça1,...,cabeça h ) WO
      onde cada figure-protocol-3 uma são matrizes de projeção aprendidas.
  5. Atenção interativa simétrica
    1. A estratégia de atenção interativa captura informações de mudança simétrica por meio de operações para frente e para trás (mostrado na Figura 3). A atenção frontal permite que características da primeira imagem temporal atenzam características da segunda imagem temporal, calculadas como:
      figure-protocol-4
      onde as primeiras características temporais servem como consultas, enquanto as segundas funcionalidades temporais fornecem chaves e valores.
    2. Por outro lado, a atenção para trás permite que características da segunda imagem temporal atenzam características da primeira imagem temporal, formuladas como:
      figure-protocol-5
      As características assistidas de ambas as direções são concatenadas e projetadas por meio de uma transformação linear para produzir a representação final assistida:
      figure-protocol-6
      NOTA: Esse mecanismo interativo garante que as relações temporais sejam capturadas simetricamente, tornando a rede invariante à ordem das imagens de entrada, o que é crucial para aplicações de detecção de mudanças onde a sequência temporal não deve alterar os resultados da detecção.
  6. Decodificador e reconstrução de mapa de alterações
    1. Mesclar as características assistidas com as saídas do codificador por meio de conexões de salto para manter detalhes espaciais.
    2. Aplique interpolação bilinear com parâmetros idênticos em todos os estágios do decodificador para redimensionamento adaptativo e garantir alinhamento perfeito entre conexões de salto.
    3. No primeiro estágio, reduzir os canais de 256 para 96 pixels via convoluções Ghost em H/4×W/4 e fazer upsampling para H/2×W/2 e fundir com os recursos correspondentes do codificador.
    4. No segundo estágio, processam recursos com convoluções Ghost para reduzir canais de 160 para 64 pixels e fazer upsampling para resolução total H×W e integrar com recursos de salto em nível de codificador.
    5. Por fim, aplique convoluções Ghost para reduzir os canais para 32 e use uma convolução final 1 × 1 para gerar o mapa binário de mudança de dois canais.
    6. Resuma todo o pipeline de processamento através do seguinte framework algorítmico, que integra todos os componentes arquitetônicos em um sistema coeso de detecção de mudanças.
      NOTA: Notação: Eki denota características do codificador da imagem i ∈ {1,2} no nível k; Fi é a característica final codificada; figure-protocol-7 é sua versão achatada;figure-protocol-8 é o recurso de atenção aprimorada; A é a matriz de atenção; Dj são saídas do decodificador; φk,ψ j são blocos codificador/decodificador; [·;·] denota concatenação canal a canal; Wout é o kernel da camada de saída.
      Veja o Algoritmo de Arquivo Suplementar 1 para "Detecção de Mudanças Baseada em Fusão de Atenção Multiescala Interativa

figure-protocol-9
Figura 1: Metodologia Proposta Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-protocol-10
Figura 2: Arquitetura de Atenção Cruzada Por favor, clique aqui para ver uma versão maior desta figura.

figure-protocol-11
Figura 3: Arquitetura Interativa de Atenção Cruzada Por favor, clique aqui para ver uma versão maior desta figura.

6. Procedimento de treinamento

  1. Função de perda
    NOTA: O processo de treinamento emprega uma função focal de perda tversky para corrigir o desequilíbrio de classes comumente encontrado em conjuntos de dados de detecção de mudanças.
    1. Formule a função de perda da seguinte forma: Seja pi ∈ [0,1] a probabilidade prevista para o pixel i, e gi ∊ {0,1} a correspondente verdade fundamental. O índice de Tversky (TI) é definido como:
      figure-protocol-12
      onde α e β controlam a penalidade para falsos positivos e falsos negativos, respectivamente, e ε é um termo de suavização.
    2. Depois, expresse a Perda Focal de Tversky como:
      figure-protocol-13
      com γ modulando o foco em pixels difíceis de classificar.
  2. Configuração de hiperparâmetros
    1. Aplique uma busca sistemática em grade baseada em validação cruzada de 5 vezes no conjunto de trens para selecionar valores ótimos.
    2. Defina os coeficientes de ponderação de perda para a tarefa de detecção de mudança para α = 0,3, β = 0,7, γ = 1,0 e ε = 1,0. Esses valores enfatizam minimizar detecções perdidas em detrimento de falsos positivos, o que é importante para conjuntos de dados desequilibrados onde mudanças são relativamente raras.
      NOTA: Peso assimétrico com β > α foca na recall, o que significa que falsos negativos têm mais peso do que falsos positivos, e é consistente com o design, especialmente em aplicações de monitoramento de desastres.
  3. Otimizador e estratégia de aprendizagem
    1. Utilize o otimizador AdamW com decaimento de peso de 1×10⁻⁴ para melhorar a regularização e evitar o sobreajuste.
    2. Inicialize a taxa de aprendizado em 1×10⁻³ e aplique um cronograma de recozimento cosseno para garantir uma convergência suave e estável durante o treinamento.
    3. Use um lote de 8 para manter a compatibilidade com um ambiente de memória GPU de 4 GB.
  4. Cronograma de treinos
    1. Treine o modelo separadamente no OSCD, consistindo em 14 pares pré-definidos para treinamento e 10 pares para testes, depois no conjunto de dados SZTAKI Airchange com Szada/1 e Tiszabob/3 como benchmarks padrão do conjunto de teste.
    2. Divida os pares de treinamento em cinco dobras, use uma dobra como conjunto de validação em cada iteração e continue treinando por um máximo de 100 épocas.
    3. Monitore a perda de validação ao final de cada dobra e aplique critérios de parada precoce de 10 épocas após a estabilização da convergência para evitar sobreajuste e reduzir computação desnecessária.
    4. Selecione os hiperparâmetros com base no melhor desempenho médio de validação em todas as dobras.
    5. Realize a detecção de mudanças no conjunto de teste e quantifique o desempenho em uma única execução usando pares de imagens anotadas de cada conjunto de dados.
  5. Otimização de memória
    1. Ative o gradient checkpointing para reduzir o uso de memória da GPU em aproximadamente 40%, obtido ao recalcular ativações intermediárias durante a passagem reversa.
    2. Permitir treinamento de precisão mista para utilizar operações FP16 quando numericamente estáveis, melhorando assim a velocidade e reduzindo a carga de memória.
    3. Use escalonamento adaptativo de tamanho de lote para ajustar dinamicamente o uso de memória e maximizar a eficiência da GPU.

7.Avaliação

  1. Certifique-se de que nenhum patch das cidades de teste seja incluído no treinamento ou validação para evitar vazamento de dados.
  2. Organize patches de imagem e mapas de verdade terrestre correspondentes para avaliação por lote.
  3. Carregue os pesos treinados do modelo a partir da época de melhor desempenho determinada pela perda de validação.
  4. Selecione um limiar de 0,5 para converter mapas de probabilidade em mapas de mudança binários.
  5. Calcule métricas de avaliação pixel a pixel para medir o desempenho em detecçãode mudanças 10
    Precisão (P): fração dos pixels de mudança previstos que são verdadeiros pixels de mudança.
    Recordar (R): Fração dos pixels de mudança verdadeira detectada corretamente.
    Pontuação F1: Média harmônica de precisão e recordação.
  6. Produzir patch de imagem em tempo real enquanto treina e avalia modelos com dimensões de 128 x 128 pixels e um passo de 64 pixels.
    NOTA: Essa geração dinâmica garante eficácia da memória, bem como consistência dos limites.
  7. Verifique a correção do pré-processamento e da colocação dos patches examinando uma amostra representativa dos patches criados inteligíveis ou imagens de características de nível intermediário.
    NOTA: Representações de características codificadas geradas pelo codificador baseado em CNN são armazenadas na memória na forma de tensores para serem usados posteriormente nas etapas, que servem como pontos de verificação ao verificar características. Mapas de alterações produzidos são armazenados como arquivos de imagem regulares (e.g. PNG ou TIFF) para serem visualizados visualmente e avaliar as alterações identificadas.
  8. Registre os indicadores de convergência (curvas de perda, métricas de precisão) no treinamento do modelo e verifique se os pontos do modelo são salvos em intervalos especificados para que todo o processo de treinamento possa ser repetido, refinado ou recuperado.
    NOTA: A apresentação explícita do formato de saída, etapas de verificação e detalhes do checkpoint ajuda a garantir transparência, permitindo que a verificação ocorra passo a passo e também possibilitando que o protocolo seja reproduzido e validado por outros pesquisadores. Esse protocolo oferece um fluxo de trabalho aprofundado e detalhado de como preparar um conjunto de dados e prosseguir com a fase de pré-processamento, construção da rede, treinamento e avaliação. Ao seguir os passos, será possível implementar o método proposto sob as condições especificadas de forma repetível. Os resultados desse procedimento são apresentados na seção de Resultados a seguir.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O método proposto de detecção de mudanças foi avaliado com base estabelecida usando dois conjuntos de dados de referência públicos para avaliar seu desempenho em diferentes resoluções espectrais e condições ambientais. Os resultados experimentais revelam melhorias significativas no equilíbrio da precisão da detecção com o controle de falsos positivos, demonstrando particularmente a capacidade do método de manter altas taxas de recall enquanto melhora substancialmente a precisão em compar...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo apresenta uma rede interativa de detecção de mudanças baseada em fusão de atenção em múltiplas escalas para detectar alterações em imagens de satélite bi-temporais. A integração de um mecanismo de atenção bidirecional, ao contrário dos métodos unidirecionais, facilita uma interação completa entre características e características entre as laterais, com sinais complementares de atenção para frente e para trás. Mudanças temporais progressivas do fluxo de atenção direto são capt...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não têm conflito de interesses.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Essa pesquisa não recebeu nenhuma bolsa específica de qualquer agência financiadora dos setores público, comercial ou sem fins lucrativos.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Kit de Ferramentas CUDANVIDIA CorporationVersão 11.3Aceleração de GPU para cálculos de aprendizado profundo
cuDNNNVIDIA CorporationVersão 8.2Biblioteca otimizada de aprendizado profundo para GPU
Intel  ProcessadorIntel CorporationCore i7 10870HPlataforma computacional usada para treinar e avaliar o modelo proposto de aprendizado profundo
NumPyCódigo AbertoVersão 1.21.0Processamento numérico de matriz
NVIDIA GeForce NVIDIA CorporationGTX 1650 Ti (4 GB VRAM)Unidade de processamento gráfico usada para treinamento acelerado de modelos
Conjunto de Dados de Detecção de Alterações de Satélites Onera (OSCD)ONERAConjunto de dados ópticos de imagens RGB e multiespectrais publicamente disponíveis para treinamento e avaliação.https://rcdaudt.github.io/oscd/
PythonFundação de Software PythonVersão 3.8Linguagem de programação usada para implementação de algoritmos
PyTorchMeta AI (Código Aberto)Versão 1.12.1Framework de aprendizado profundo de código aberto usado para desenvolver e treinar o modelo proposto
Scikit-learnCódigo AbertoVersão 1.0.2Métricas de avaliação de desempenho
Conjunto de Dados de Benchmark do AirChange SZTAKISZTAKIConjunto de dados de imagens aéreas RGB ópticas disponível publicamente usado para treinamento e avaliação.http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
TorchvisionMeta AI (Código Aberto)Versão 0.13.1Carregamento de conjuntos de dados e transformações de imagens
Windows OSMicrosoft11Sistema Operacional 

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles