$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Níveis sem precedentes de urbanização no meio ambiente global, perda de recursos ambientais e alterações na paisagem devido ao clima desencadearam diretamente a necessidade de fornecer um sistema de monitoramento exato, oportuno e automático que possa identificar e medir mudanças na superfície da Terra. A sensoriamento remoto via satélite tornou-se o bloco básico da vigilância ambiental em massa, pois fornece cobertura temporal e espacial consistente, além de ser vital para o exame completo da mudança. A detecção de mudanças em imagens de satélite bi-temporais é a caracterização das mudanças na superfície entre duas aquisições sequenciais da mesma região geográfica. É um processo complicado, porém, devido às inúmeras variáveis de confusão, incluindo a variação das estações, as condições climáticas, as propriedades dos sensores, distorções geométricas e alterações fenomenológicas que podem obscurecer ou se assemelhar ao real na cobertura do solo. A interpretação manual de imagens de satélite atualmente em uso é demorada, subjetiva e inadequada para lidar com as quantidades crescentes de informações de observação da Terra geradas pelas constelações atuais de satélites. Essa é a limitação básica que resultou na criação de soluções automatizadas de detecção de mudanças. Métodos convencionais baseados empixels 1 e detecção de alterações baseados emobjetos 2 tendem a ser pouco adequados para operar dentro dos limites dessas complexidades e possuem um padrão baixo de robustez para aplicar a uma grande variedade de unidades geográficas e escalas temporais. Arquiteturas de deep learning, especialmente redes neurais convolucionais e variantes, permitem a extração de características hierárquicas que representam detalhes espectrais de baixo nível e padrões semânticos de alto nível relevantes para distinguir mudanças. Modelos de detecção de mudanças em aprendizado profundo têm se mostrado altamente promissores na captura de mudanças espaço-temporais latentes em dados de sensoriamento remoto e na identificação da verdadeira cobertura do solo versus pseudo-mudanças, introduzidas por fatores externos. Essas abordagens de aprendizado de ponta a ponta aproveitam o fato de que as características podem ser extraídas e a classificação pode ser realizada de forma ótima de uma só vez. Apesar do progresso substancial na precisão da detecção de mudanças, a maioria das abordagens existentes continua difícil de ser implementada em ambientes operacionais do mundo real. Abordagens baseadas emtransformadores 3, embora eficientes no contexto global, possuem alto número de parâmetros, complexidade computacional quadrática, latência de inferência e alto consumo de energia. As arquiteturas siamesas baseadas em CNN, por outro lado, são superiores em eficiência, mas possuem campos receptivos pequenos e carecem em grande parte de modelagem contextual global, o que piora significativamente o desempenho. Essas restrições são ainda mais agravadas em ambientes de grande escala e com recursos limitados, onde escalabilidade e custo operacional são considerações críticas. Escalabilidade, eficiência energética e a velocidade com que as inferências são feitas são frequentemente vitais em um ambiente de resposta a emergências, e há necessidade de criar soluções que equilibrem desempenho e implantabilidade. Portanto, permanece uma lacuna entre modelos computacionais focados em precisão e os requisitos práticos da implantação no mundo real.
Para superar tais problemas, é proposta uma Rede Interativa de Fusão de Atenção Multiescala (IMAF) com Convolução de Características Escassas (SFC), que foca no design de uma estrutura eficiente e implantável de detecção de mudanças, em vez de apenas otimização de precisão. A solução proposta foca em pares ópticos de imagens de satélite, geralmente RGB ou imagens multiespectrais de alta resolução (resolução 0,5-30 m), adquiridas por satélites, por exemplo, Landsat, Sentinel-2 ou WorldView. A técnica pressupõe um co-registro geométrico preciso de pares bitemporais, pois erros de registro também podem ter um efeito considerável na detecção. Ele lida com detecção de mudança binária (em oposição à mudança semântica multiclasse) e não consegue distinguir entre vários tipos de mudança. Além disso, o método utiliza imagens corrigidas radiometricamente para reduzir os efeitos das mudanças sazonais, atmosféricas e de iluminação, que seriam confundidas com mudanças na cobertura do solo. Ao contrário das tradicionais CNNssiamesas 4, que separam imagens bitemporais com o auxílio de uma simples concatenação, o módulo IMAF proposto permite a fusão contextual multiescala de características globais e locais. Abordagens recentes baseadas em transformadores, como BIT5 eChangeFormer 3, estão obtendo resultados muito bons, mas seus mecanismos de autoatenção têm a complexidade O(N2). O framework proposto captura mudanças sutis com atenção bidirecional, reduzindo a complexidade computacional e a latência de inferência. Além disso, o projeto proposto é consciente da esparsidade, o que é superior a projetos de fusão densa multiescala, como UNet++6,7 e SNUNet8. A convolução de características esparsas com o módulo fantasma reduz os FLOPs em aproximadamente 50%, preservando a qualidade da representação. Assim, o framework proposto favorece um equilíbrio entre precisão e eficiência para uma implantação confiável em ambientes com recursos limitados.
As principais contribuições deste estudo são: (i) Um detector de mudança leve que atinge uma pontuação F1 competitiva usando 19 vezes menos parâmetros em comparação com seus equivalentes baseados em transformadores. (ii) Um módulo de Fusão de Atenção Multiescala Interativa que obtém informações contextuais globais sem o custo computacional quadrático dos mecanismos tradicionais de autoatenção. (iii) Um esquema de convolução com esparsão de características baseado em módulos Ghosts, que minimiza as operações de ponto flutuante em 49,4 por cento, sem degradação da qualidade na representação das características. (iv) Validação experimental extensa em um grande conjunto de conjuntos de dados de referência, com melhores compensações entre eficiência e precisão e razoável praticabilidade da aplicação real no mundo real.
O restante deste manuscrito compreende as seguintes seções: A Seção 2 oferece uma visão geral extensa dos trabalhos recentes na área de metodologias de detecção de mudanças binárias, com atenção especial a soluções de aprendizado profundo e sua implementação em benchmarks padrão. A Seção 3 apresenta o contexto teórico e o design estrutural da solução proposta, representação matemática do mecanismo de fusão temporal e dos elementos de atenção, as características do conjunto experimental, conjuntos de dados, métricas de avaliação e detalhes de implementação necessários para produzir pesquisas reprodutíveis. A Seção 4 ilustra achados experimentais detalhados que incluem ablação, comparações com os mais recentes algoritmos de detecção de alterações binárias que explicam a capacidade em várias áreas geográficas nos conjuntos de dados de Airchange do OSCD e SZTAKI. A Seção 5 determina o resultado dos achados, limitações de uma abordagem atual e possibilidades de pesquisas futuras na detecção de mudanças.
O desenvolvimento de algoritmos de detecção de mudanças em sensoriamento remoto foi muito alterado, passando de métodos baseados em pixels para frameworks de aprendizado profundo. Os procedimentos iniciais de detecção de mudanças baseavam-se principalmente em processos algébricos como diferenciação de imagens, racionamento de imagens e análise de vetores de mudança, que trabalhavam diretamente sobre valores de pixels para detectar mudançastemporais 9,10. Foram desenvolvidos métodos alternativos envolvendo comparação pós-classificação, nos quais cada imagem temporal foi classificada de forma independente e depois comparada com a tabulaçãocruzada 11. As técnicas de detecção de mudanças baseadas em objetos representaram um passo importante de progresso com a introdução do contexto espacial, bem como a mitigação do ruído em nível depixel 2,12.
O advento das técnicas de deep learning revolucionou o espaço da detecção de mudanças por sensoriamento remoto e abriu caminho para superar várias limitações das técnicas tradicionais. Recentemente, as Redes Neurais de Convolução (CNNs) tornaram-se a arquitetura padrão para extração automatizada de características e classificaçãode alterações 13,14. O Siamese NestedUNet for ChangeDetection 14 e o Siamese Swin-Unet15 emergiram como uma inovação significativa devido à topologia de redes siameses densamente conectadas, que ajuda a reter efetivamente as informações de localização em toda a hierarquia da rede.
O problema da detecção de mudança bi-temporal em sensoriamento remoto óptico de alta resolução ainda é difícil de resolver devido a uma variedade de fatores de confusão, e as redes transformadoras multiescala baseadas em atenção com estratégias elaboradas de fusão de características forampropostas 16. A estrutura EGMT-CD propôs transformadores multimodais guiados por bordas de pares de imagens heterogêneos, onde as imagens homólogas não são acessíveis devido à cobertura denuvens 17. Arquiteturas como a DASUNet rompem gargalos manuais de aprendizado profundo na fusão de características em escala real, com melhora 0,85% maior no índice F1 em relação ao SNUNet-24 no conjunto de dados CDD usando fluxogradiente melhorado 18. Modelos híbridos CNN-Transformador lidam com a questão dos falsos negativos a um custo mais alto, fornecendo um custo adicional nos componentes de frequência para o aprendizado de características19. As redes híbridasde transformadores em formato de U 20, no entanto, ainda são difíceis de fornecer integração de características locais-globais e mudanças nas regiões que ocorrem periodicamente, mesmo em pequena escala. O uso de detecção de mudanças semânticas multitarefas, além de localização precisa e identificação de classes, é mais complicado em comparação com tarefas binárias21,22. Correlações bi-temporais podem ser modeladas com sucesso por atenção cruzada sem mudanças arquitetônicassignificativas 14,23. A expressão paradigmática de linguagem de perspectiva também é uma fronteira recente, com designs baseados em CLIP, combinando explicações textuais em padrões de correspondênciade mudança 24 e semi-supervisionados, eliminando a dependência de dados rotulados25. Change Mamba apresenta os modelos de espaço de estados dos modelosespaço-temporais 26,27. Diferentes aplicações de métodos especializados de atenção são demonstradas: abordando o uso da detecção de anomaliashiperespectrais 28, classificação de alvosmultiárea 29 ou segmentação de rótuloslimitados 30, e demonstrando a flexibilidade dos mecanismos de atenção em análises de sensoriamento remoto.
| Autores | Método/Arquitetura | Especificações Técnicas | Inovação Chave e Descobertas / Desempenho do Conjunto de Dados |
| Singh, A. [8] | Métodos Tradicionais | Diferenciação baseada em pixels, CVA | Framework de detecção digital de mudanças, múltiplos conjuntos de dados, Precisão: 65-80% |
| Mas, J.F. [10] | Pós-classificação | Classificação temporal independente | Análise de metodologia comparativa, Imagens tropicais, OA: 72-85% |
| Lu et al. [9] | Métodos Tradicionais | Operações algébricas, AVC, ACP | Comparação abrangente de técnicas, Múltiplas fontes, Precisão: 70-88% |
| Benedek & Szirányi [23] | Modelo de Markov Misto | Estrutura condicional multicamada | Modelagem probabilística de variação, Sztaki AirChange, DA: 92,1% |
| Blaschke, T. [2] | Baseado em objetos | Análise baseada em segmentação | Integração de contexto espacial, várias imagens de HR, SA: 85-92% |
| Chen et al. [11] | Baseado em objetos | Segmentação multiescala | Análise hierárquica de objetos, imagens de HR, OA: 87,3% |
| Zhan et al. [12] | CNN siamesa | CNN de 5 camadas, tamanho do kernel 3×3 | Arquitetura siamês profunda para CD, imagens aéreas, F1: 0,847, IoU: 0,735 |
| Daudt et al. [4] | FCN siamês | FC-EF, FC-Siam-diff, FC-Siam-conc | Estratégias de fusão precoce/tardia, OSCD, F1: 0,431, IoU: 0,276 |
| Peng et al. [26] | UNet++ | U-Net aninhada, conexões de salto denso | Agregação de características multiescala, satélite HR, F1: 0,753, IoU: 0,604 |
| Chen & Shi [25] | Atenção Espaço-Temporal | Blocos de atenção, modelagem temporal | Aprendizado de características espaço-temporal, LEVIR-CD, F1: 0,887, IoU: 0,797 |
| Fang et al. [7] | SNUNet-CD | Siamês NestedUNet, conexões densas | Otimização de transmissão de informação, LEVIR: F1: 0,897, WHU: F1: 0,904 |
| Chen et al. [5] | BIT-CD | ResNet18 + codificador transformador | Aprendizado binário de características temporais, OSCD: F1: 0,635, LEVIR: F1: 0,919 |
| Bandara & Patel [3] | Mudança Antiga | Codificador de transformador hierárquico | Atenção de transformadores em múltiplas escalas, OSCD: F1: 0,654, LEVIR: F1: 0,905 |
| Song et al. [27] | ACANet | Atenção axial + espinha dorsal CNN | Cálculo eficiente de atenção, LEVIR: F1: 0,901, WHU: F1: 0,913 |
| Shi et al. [28] | Artigo de Revisão | Pesquisa abrangente sobre métodos de IA | Análise sistemática de abordagens de IA, 50+ conjuntos de dados analisados |
| Li et al. [14] | AMST-Net | Transformador multiescala, atenção pirâmide | Extração adaptativa de características multiescala, imagens ópticas de frequência cardíaca, mIoU: 0,823 |
| Xiang et al. [15] | EGMT-CD | Arquitetura multimodal guiada por bordas | Alinhamento de características entre modais, Pares heterogêneos, F1: 0,756 |
| Miao et al. [16] | DASUNet | Supervisão densa, fusão em escala total | Supervisão profunda em todos os níveis do decodificador, CDD: 0,85% de melhora na F1 em relação ao SNUNet |
| Tang et al. [29] | Swin-UNet siamês | Fusão Swin Transformer + Unet | Janela hierárquica de atenção, LEVIR: F1: 0,923, WHU: F1: 0,925 |
| Wu et al. [18] | Transformador em U híbrido | Backbone UNet++ + blocos transformadores | Integração de recursos global-local, imagens de RH, IoU: 0,851, F1: 0,919 |
| Dong et al. [20] | ChangeCLIP | Linguagem visual baseada em CLIP | Compreensão semântica multimodal, pares RS, precisão semântica: 94,1% |
| Li et al. [21] | SemiCD-VL | Linguagem de visão semi-supervisionada | Requisitos de anotação reduzidos, rótulos limitados, F1: 0,889 |
| Chen et al. [22] | ChangeMamba | Modelos de Espaço de Estado (SSMs) | Modelagem temporal de complexidade linear, imagens RS, eficiência: 3 vezes mais rápida |
Tabela 1: Resumo dos Métodos de Detecção de Mudanças em Sensoriamento Remoto. Por favor, clique aqui para baixar esta tabela.
Um resumo dos estudos anteriores é apresentado na Tabela 1. Métodos tradicionais possuem recursos artesanais que não são adequados para variações espaço-temporaiscomplexas 31, e a arquitetura de aprendizado profundo (UNet, FPN, PSPNet) envolve convoluções densas computacionalmente caras. Os modelos atuais não possuem sistemas eficientes de incorporação multiescala e atenção dinâmica. Para preencher essas lacunas, o estudo atual propõe a Fusão Interativa de Atenção Multiescala com Rede de Convolução de Características Escassas, que visa capturar as mudanças sutis entre escalas, sendo computacionalmente eficiente em sensoriamento remoto, especialmente em mudanças estruturais urbanas e causadas pelo homem.