Method Article

Fusión interactiva de atención multiescala con red de convolución de características dispersas para la detección de cambios en imágenes satelitales

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta un modelo de fusión interactiva de atención multiescala con redes de convolución de características dispersas para mejorar la detección de cambios en imágenes satelitales. El enfoque aprovecha la extracción de características multiescala, el enfoque selectivo en la atención y las convoluciones dispersas para detectar y localizar eficazmente cambios en imágenes satelitales bitemporales reduciendo la complejidad computacional.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La detección de cambios mediante imágenes satelitales bitemporales es un problema importante en la monitorización terrestre que busca identificar y localizar los cambios superficiales entre una adquisición temporal y distinguir pseudo-cambios reales debidos a ciclos estacionales, factores atmosféricos o desarrollos provocados por el hombre. Los métodos actuales de aprendizaje profundo suelen enfrentarse a un sesgo unidireccional en su modelado temporal, lo que restringe la usabilidad de relaciones espaciales a gran escala para facilitar la correcta caracterización de los patrones de cambio. Aunque las técnicas recientes basadas en transformadores son muy precisas, sus requisitos computacionales también son bastante grandes, lo que limita su uso en tareas con recursos limitados. En respuesta a estas limitaciones, en este artículo se propone una red de Fusión Interactiva de Atención Multiescala (IMAF) con Convolución de Características Dispersas (SFC) basada en módulos Ghost para lograr una extracción efectiva de características multiescala. La red utiliza una arquitectura avanzada codificador-decodificador, complementada con módulos de atención interactivos en diferentes escalas. La red funciona con flujos de atención complementarios hacia adelante y hacia atrás: el primero registra la variación temporal progresiva y el segundo verifica la consistencia de los cambios mediante análisis temporal inverso. Este método interactivo permite representaciones efectivas del modelo dúplex de relaciones temporales sin ser computacionalmente prohibitivo, mejorando enfoques mucho mejores para distinguir movimientos legítimos de cobertura del suelo frente al ruido ausente de variación inducida por el ruido. Se experimentan con dos conjuntos de datos de referencia: el conjunto de datos de detección de cambios por satélite Onera (OSCD) y el conjunto de datos SZTAKI AirChange. Los experimentos significativos realizados con conjuntos de datos OSCD revelan que el enfoque propuesto alcanza tasas competitivas de F1 del 58,14% (13 canales) y del 50,68% (3 canales) con solo 2,13 millones de parámetros y 19,6G FLOPS, 19 veces pocos parámetros y una rotación de inferencia 5,6x en comparación con ChangeFormer. El rendimiento competitivo en las muestras de los conjuntos de pruebas Szada/1 y Tiszadob/3 del conjunto de datos SZTAKI, con puntuaciones F1 del 74,29% y 92,86% respectivamente, permite implementar en la mayoría de los dispositivos de borde, análisis en tiempo real y sistemas de mapeo extensos donde la energía operativa depende directamente de la energía computacional.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niveles sin precedentes de urbanización en el medio ambiente global, la pérdida de recursos medioambientales y las alteraciones del paisaje debido al clima han provocado directamente la necesidad de proporcionar un sistema de monitorización exacto, oportuno y automático que pueda identificar y medir los cambios en la superficie de la Tierra. La teledetección satelital se ha convertido en el pilar básico de la vigilancia ambiental masiva, ya que proporciona una cobertura temporal y espacial consistente, además de ser vital para el examen completo del cambio. La detección de cambios por imágenes satelitales bitemporales es la caracterización de los cambios superficiales entre dos adquisiciones secuenciales de la misma región geográfica. Sin embargo, es un proceso complicado debido a las numerosas variables de confusión, incluyendo la variación de las estaciones, las condiciones meteorológicas, las propiedades del sensor, las distorsiones geométricas y las alteraciones fenomenológicas que pueden ocultar o asemejarse a la realidad en la cobertura del suelo. La interpretación manual de imágenes de satélites actualmente en uso es laboriosa, subjetiva y no adecuada para hacer frente a las cantidades crecientes de información de observación terrestre generadas por las constelaciones satelitales actuales. Esta es la limitación básica que ha dado lugar a la creación de soluciones automatizadas de detección de cambios. Los métodos convencionales basados enpíxeles 1 y la detección de cambios basada enobjetos 2 tienden a ser poco adecuados para operar dentro de los límites de estas complejidades y tienen un bajo estándar de robustez para aplicarse a una amplia gama de unidades geográficas y escalas temporales. Las arquitecturas de aprendizaje profundo, especialmente las redes neuronales convolucionales y sus variantes, permiten la extracción de características jerárquicas que representan detalles espectrales de bajo nivel y patrones semánticos de alto nivel relevantes para distinguir cambios. Los modelos de detección de cambios por aprendizaje profundo han demostrado ser muy prometedores para capturar cambios espacio-temporales latentes en datos de teledetección y para identificar la verdadera cobertura terrestre frente a pseudo-cambios, introducidos por factores externos. Estos enfoques de aprendizaje de extremo a extremo aprovechan el hecho de que se pueden extraer características y la clasificación puede realizarse de forma óptima a la vez. A pesar de los avances sustanciales en la precisión de detección de cambios, la mayoría de los enfoques existentes siguen siendo difíciles de implementar en entornos operativos reales. Los enfoquesbasados en transformadores 3, aunque eficientes en el contexto global, tienen un alto conteo de parámetros, complejidad computacional cuadrática, latencia de inferencia y alto consumo energético. Las arquitecturas siamesas basadas en CNN, por otro lado, son superiores en eficiencia, pero tienen campos receptivos pequeños y carecen en gran parte de modelado contextual global, lo que empeora significativamente el rendimiento. Estas limitaciones se agravan aún más en entornos a gran escala y con recursos limitados, donde la escalabilidad y el coste operativo son consideraciones críticas. La escalabilidad, la eficiencia energética y la rapidez con la que se hacen las inferencias son frecuentemente vitales en un entorno de respuesta a emergencias, y es necesario crear soluciones que equilibren rendimiento y facilidad de despliegue. Por lo tanto, existe una brecha entre los modelos centrados en la precisión, que requieren mucha intensidad computacional, y los requisitos prácticos del despliegue en el mundo real.

Para superar estos problemas, se propone una Red de Fusión de Atención Multiescala Interactiva (IMAF) con Convolución de Características Dispersas (SFC), que se centra en el diseño de un marco eficiente y desplegable de detección de cambios, en lugar de optimizar solo la precisión. La solución propuesta se centra en pares ópticos de imágenes satelitales, normalmente imágenes RGB o multiespectrales de alta resolución (resolución 0,5-30 m), adquiridas por satélites, por ejemplo, Landsat, Sentinel-2 o WorldView. La técnica presupone una co-registro geométrica precisa de pares bitemporales, ya que los errores de registro también pueden tener un efecto considerable en la detección. Se ocupa de la detección de cambios binarios (en contraposición al cambio semántico multiclase) y no puede distinguir entre varios tipos de cambio. Además, el método utiliza imágenes corregidas radiométricamente para reducir los efectos de cambios estacionales, atmosféricos e iluminados, que se confundirían con cambios en la cobertura del suelo. A diferencia de las CNN siamesestradicionales 4, que separan imágenes bitemporales con la ayuda de una simple concatenación, el módulo IMAF propuesto permite la fusión contextual multiescala de características globales y locales. Los enfoques recientes basados en transformadores, como BIT5 yChangeFormer 3, están obteniendo muy buenos resultados, pero sus mecanismos de autoatención tienen la complejidad O(N2). El marco propuesto captura cambios sutiles con atención bidireccional, reduciendo la complejidad computacional y la latencia de inferencia. Además, el diseño propuesto es consciente de la esparsidad, lo que es superior a diseños de fusión densa y multiescala como UNet++6,7 y SNUNet8. La convolución de características escasas con el módulo fantasma reduce los FLOPs en aproximadamente un 50%, preservando la calidad de la representación. Por tanto, el marco propuesto favorece un equilibrio entre precisión y eficiencia para un despliegue fiable en entornos con recursos limitados.

Las principales contribuciones de este estudio son: (i) Un detector de cambio ligero que alcanza una puntuación F1 competitiva utilizando 19 veces menos parámetros en comparación con sus equivalentes basados en transformadores. (ii) Un módulo interactivo de fusión de atención multiescala que obtiene información contextual global sin el coste computacional cuadrático de los mecanismos tradicionales de autoatención. (iii) Un esquema de convolución con esparsidad de características basado en módulos Ghosts, que minimiza las operaciones de coma flotante en un 49,4 por ciento sin degradación de calidad en la representación de características. (iv) Validación experimental extensa en un gran conjunto de conjuntos de datos de referencia, con mejores compromisos entre eficiencia y precisión y una razonable viabilidad de aplicación real en el mundo real.

El resto de este manuscrito comprende las siguientes secciones: La sección 2 ofrece una visión general extensa del trabajo reciente en el área de metodologías de detección de cambios binarios, con especial atención a soluciones de aprendizaje profundo y su implementación en benchmarks estándar. La Sección 3 ofrece el contexto teórico y el diseño estructural de la solución propuesta, la representación matemática del mecanismo de fusión temporal y los elementos de atención, las características del montaje experimental, conjuntos de datos, métricas de evaluación y detalles de implementación necesarios para producir investigación reproducible. La Sección 4 ilustra hallazgos experimentales detallados que comprenden la ablación, comparaciones con los últimos algoritmos de detección de cambios binarios que explican la capacidad en diversas áreas geográficas de los conjuntos de datos de Airchange de OSCD y SZTAKI. La Sección 5 determina los resultados de los hallazgos, las limitaciones de un enfoque actual y las posibilidades de futuras investigaciones en la detección de cambios.

El desarrollo de algoritmos de detección de cambios en teledetección ha cambiado considerablemente, pasando de métodos basados en píxeles a marcos de aprendizaje profundo. Los procedimientos tempranos de detección de cambios se basaban principalmente en procesos algebraicos como la diferenciación de imágenes, el racionamiento de imágenes y el análisis de vectores de cambio, que trabajaban directamente sobre los valores de píxeles para detectar cambiostemporales 9,10. Se desarrollaron métodos alternativos que implicaban la comparación posterior a la clasificación, en los que cada imagen temporal se clasificaba de forma independiente y luego se comparaba con la tabulacióncruzada 11. Las técnicas de detección de cambios basadas en objetos representaron un paso importante de progreso con la introducción del contexto espacial, así como la mitigación del ruido a nivel depíxel 2,12.

La llegada de las técnicas de aprendizaje profundo ha revolucionado el ámbito de la detección de cambios en teledetección y ha allanado el camino para superar varias limitaciones en las técnicas tradicionales. Recientemente, las Redes Neuronales de Convolución (CNN) se han convertido en la arquitectura estándar para la extracción automatizada de características y clasificaciónde cambios 13,14. Siamese NestedUNet for ChangeDetection 14 y Siamese Swin-Unet15 han surgido como una innovación significativa debido a la topología de redes siamesas densamente conectadas, que ayuda a retener eficazmente la información de localización a lo largo de la jerarquía de la red.

El problema de la detección de cambios bitemporales en la teledetección óptica de alta resolución sigue siendo difícil de resolver debido a una variedad de factores de confusión, y se han propuesto16 las redes transformadoras multiescala basadas en atención con las elaboradas estrategias de fusión de características. El marco EGMT-CD propuso transformadores multimodales guiados por bordes de pares de imágenes heterogéneos, donde las imágenes homólogas no son accesibles debido a la cobertura denubes 17. Arquitecturas como DASUNet rompen cuellos de botella manuales de aprendizaje profundo en la fusión de características a gran escala, con una mejora del índice F1 un 0,85% mayor que SNUNet-24 en el conjunto de datos CDD usando un flujo gradientemejorado 18. Los modelos híbridos CNN-Transformador abordan el problema de falsos negativos a un coste más alto proporcionando un coste adicional en los componentes de frecuencia respecto al aprendizajede características 19. Sin embargo, las redes híbridas de transformadoresen forma de U 20 siguen siendo difíciles de proporcionar integración de características local-global y cambios en regiones que ocurren periódicamente, incluso a pequeña escala. El uso de la detección de cambios semánticos multitarea, así como la identificación precisa de localización y clase, es más complicado en comparación con tareas binarias21,22. Las correlaciones bi-temporales pueden modelarse con éxito mediante la atención cruzada sin cambios arquitectónicossignificativos 14,23. La expresión paradigmática de lenguaje en perspectiva también es una frontera reciente con diseños basados en CLIP, que combinan explicaciones textuales en patrones de correspondenciade cambio 24 y semi-supervisados, eliminando la dependencia de datosetiquetados 25. Change Mamba presenta los modelos de espacio de estados de los modelos espacio-temporales26,27. Se demuestran diferentes aplicaciones de métodos especializados de atención: abordando el uso de detección de anomalíashiperespectrales 28, clasificación de objetivosmultiárea 29 o segmentación de etiquetaslimitadas 30, y demostrar la flexibilidad de los mecanismos de atención en la analítica de teledetección.

AutoresMétodo/ArquitecturaEspecificaciones técnicasInnovación y hallazgos clave / Rendimiento del conjunto de datos
Singh, A. [8]Métodos tradicionalesDiferenciación basada en píxeles, CVAMarco de detección de cambios digitales, múltiples conjuntos de datos, Precisión: 65-80%
Mas, J.F. [10]PosclasificaciónClasificación temporal independienteAnálisis de metodología comparativa, Imágenes tropicales, OA: 72-85%
Lu et al. [9]Métodos tradicionalesOperaciones algebraicas, CVA, PCAComparación completa de técnicas, múltiples fuentes, precisión: 70-88%
Benedek & Szirányi [23]Modelo de Markov MixtoMarco condicional multicapaModelado probabilístico del cambio, Sztaki AirChange, DA: 92,1%
Blaschke, T. [2]Basado en objetosAnálisis basado en segmentaciónIntegración del contexto espacial, diversas imágenes de HR, SA: 85-92%
Chen et al. [11]Basado en objetosSegmentación multiescalaAnálisis jerárquico de objetos, imágenes de RRHH, OA: 87,3%
Zhan et al. [12]CNN siamesaCNN de 5 capas, tamaño de núcleo 3×3Arquitectura siamesa profunda para CD, imágenes aéreas, F1: 0.847, IoU: 0.735
Daudt et al. [4]FCN siamésFC-EF, FC-Siam-diff, FC-Siam-concEstrategias de fusión temprana/tardía, OSCD, F1: 0,431, IoU: 0,276
Peng et al. [26]UNet++U-Net anidado, conexiones de salto densoAgregación de características a escala múltiple, satélite HR, F1: 0,753, IoU: 0,604
Chen & Shi [25]Atención espaciotemporalBloques de atención, modelado temporalAprendizaje de características espacio-temporal, LEVIR-CD, F1: 0,887, IoU: 0,797
Fang et al. [7]SNUNet-CDSiamese NestedUNet, conexiones densasOptimización de transmisión de información, LEVIR: F1: 0,897, WHU: F1: 0,904
Chen et al. [5]BIT-CDResNet18 + codificador de transformadorAprendizaje binario temporal de características, OSCD: F1: 0,635, LEVIR: F1: 0,919
Bandara y Patel [3]ChangeFormerCodificador jerárquico de transformadorAtención de transformadores a escala multipla, OSCD: F1: 0,654, LEVIR: F1: 0,905
Song et al. [27]ACANetAtención axial + columna vertebral CNNCálculo eficiente de atención, LEVIR: F1: 0,901, WHU: F1: 0,913
Shi et al. [28]Artículo de revisiónEncuesta integral sobre métodos de IAAnálisis sistemático de enfoques de IA, 50+ conjuntos de datos analizados
Li et al. [14]AMST-NetTransformador multiescala, atención piramidalExtracción adaptativa de características multiescala, imágenes ópticas de frecuencia cardíaca, mIoU: 0,823
Xiang et al. [15]EGMT-CDArquitectura multimodal guiada por bordesAlineamiento de características entre modales, Pares heterogéneos, F1: 0,756
Miao et al. [16]DASUNetSupervisión densa, fusión a gran escalaSupervisión profunda en todos los niveles de decodificadores, CDD: mejora del 0,85% en F1 respecto a SNUNet
Tang et al. [29]Swin-UNet siamésFusión Swin Transformer + UnetVentana jerárquica de atención, LEVIR: F1: 0,923, WHU: F1: 0,925
Wu et al. [18]Transformador en U híbridoColumna vertebral UNet++ + bloques transformadoresIntegración global-local de funcionalidades, imágenes de RRHH, IoU: 0,851, F1: 0,919
Dong et al. [20]ChangeCLIPLenguaje visual basado en CLIPComprensión semántica multimodal, pares RS, precisión semántica: 94,1%
Li et al. [21]SemiCD-VLLenguaje de visión semi-supervisadoRequisitos de anotación reducidos, etiquetas limitadas, F1: 0,889
Chen et al. [22]ChangeMambaModelos de Espacio de Estado (SSM)Modelado temporal de complejidad lineal, imágenes RS, eficiencia: 3 veces más rápido

Tabla 1: Resumen de los métodos de detección de cambios en teledetección. Por favor, haga clic aquí para descargar esta tabla.

Un resumen de los estudios previos se presenta en la Tabla 1. Los métodos tradicionales tienen características hechas a mano que no son adecuadas para variaciones espaciotemporalescomplejas 31, y la arquitectura de aprendizaje profundo (UNet, FPN, PSPNet) implica convoluciones densas y computacionalmente costosas. Los modelos actuales no cuentan con sistemas eficientes de incorporación multiescala ni de atención dinámica. Para cubrir estas carencias, el estudio actual propone la Fusión Interactiva de Atención Multiescala con Red de Convolución de Características Dispersas, que tiene como objetivo captar los cambios sutiles a través de escalas mientras es computacionalmente eficiente en teledetección, especialmente en cambios estructurales urbanos y provocados por el hombre.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Declaración de ética

  1. Tanto los conjuntos de datos de Onera Satellite Change Detection (OSCD) como SZTAKI AirChange utilizados en este estudio consisten en imágenes RGB y multiespectrales disponibles públicamente que cubren diversas características geográficas. Estos conjuntos de datos no contienen datos restringidos ni sensibles. Por lo tanto, no se requiere consentimiento ético para este trabajo.

2. Materiales y equipos

  1. Realiza pruebas en un ordenador con Windows 11 que contenga un procesador Intel Core i7 10870H, un chip NVIDIA GeForce GTX 1650 Ti con 4GB de VRAM y 32GB de RAM.
    NOTA: El entorno de programación es Python 3.8, y depende del framework PyTorch (versión 1.12.1) y Torchvision (versión 0.13.1) para implementar aprendizaje profundo.
  2. Descargar e instalar bibliotecas como scikit-learn (versión 1.0.2), que contiene utilidad de aprendizaje automático, y NumPy (versión 1.21.0), que contiene operaciones numéricas.
  3. Asegúrate de instalar la versión 11.3 de CUDA Toolkit y la versión 8.2 de cuDNN proporcionadas por NVIDIA Corporation para poder aprovechar la aceleración de la tarjeta gráfica.
  4. Entrenar y evaluar el rendimiento utilizando el conjunto de datos de Airchange OSCD y SZTAKI, disponible públicamente.

3. Preparación de conjuntos de datos

  1. Selecciona OSCD4, que está compuesto por imágenes aéreas ópticas RGB por satélite e imágenes multiespectrales, cada una de 600 x 600 píxeles con resolución de 10 m, y el conjunto de datos SZTAKIAirChange 32 , compuesto por 13 pares de imágenes aéreas ópticas, cada uno de 952 x 640 píxeles con una resolución de 1,5 m/píxel, como conjuntos de datos de referencia.
  2. Particionar las 24 ciudades del conjunto de datos OSCD en 14 ciudades fijas y predefinidas para la formación y 10 ciudades para las pruebas.
  3. Asignar pares fijos no aleatorizados de imágenes Szada/1 y Tiszadob/3 del conjunto de datos SZTAKI AirChange al conjunto de pruebas y los pares restantes de imágenes como conjunto de entrenamiento como benchmark convencional.
  4. Realizar la detección de cambios en el conjunto de pruebas y cuantificar el rendimiento en una sola ejecución usando pares de imágenes anotadas de cada conjunto de datos.

4. Preprocesamiento

  1. Aplica preprocesamiento basado en parches.
    1. Extraer los parches de imagen de forma independiente por imagen temporal en ubicaciones idénticas sobre la marcha para gestionar imágenes de satélite de alta resolución de forma eficiente.
    2. Divide cada imagen en parches superpuestos de 128 × 128 píxeles usando una zancada de 64 píxeles.
    3. Alinear las regiones superpuestas entre parches adyacentes para mantener la consistencia de los límites y conservar la información de los bordes.
  2. Realiza la ampliación de datos por clase.
    1. Aplicar aumentos diferenciales durante el entrenamiento en ambos parches del par según la proporción de píxeles de cambio para manejar el desequilibrio de clases entre regiones de "cambio" y "sin cambio".
    2. Aumenta el par de parches de cambio (aquellos con > 1% de píxeles de cambio) seis veces usando las siguientes transformaciones: volteos horizontales y verticales, rotaciones de 90°, jitter de color (brillo, contraste y saturación ± 30%), transformaciones afines (rotación ± 15°, traslación ± 10 píxeles, escalado 95-105%).
    3. Aumentar el par de parches sin cambios solo una vez para evitar un desequilibrio en el conjunto de datos.
      NOTA: Esta estrategia de aumento, basada en clases, proporciona entrenamiento equilibrado en las regiones de cambio y sin cambio.
  3. Normaliza y mejora la calidad de imagen.
    1. Normalizar todos los parches usando la media y desviación estándar de ImageNet: Media = (0,485, 0,456, 0,406), Std = (0,229, 0,224, 0,225).
      1. Utiliza la Ecualización Adaptativa de Histograma Limitada por Contraste (CLAHE) con límite de clip = 2.0, tamaño de la cuadrícula de mosaico = 8 x 8, en el espacio de color LAB (solo canal L) para aclarar los contrastes de las áreas con bajo contraste y así distinguir las características en la imagen, con intensidades normalizadas a [0,255].
      2. Borra cualquier parche menor que 128 x 128 píxeles y rellena los parches más pequeños para que tengan el mismo tamaño que los parches más grandes y mantenga su integridad espacial durante el entrenamiento del modelo.

5. Construcción del modelo

  1. Define entrada y salida.
    1. El marco propuesto toma como entrada un par de imágenes satelitales co-registradas I1, I2 R H×W×C adquiridas en diferentes instancias temporales y produce un mapa binario de cambio M ∈ RH×W× 2 que delimita con precisión regiones cambiadas e inalteradas.
  2. Marco propuesto
    1. Procesa el marco propuesto como una tubería de procesamiento en tres etapas. En la primera etapa, realiza modelado de atención temporal en las secuencias de entrada para capturar el cambio a lo largo del tiempo.
    2. Utiliza la atención cruzada interactiva para capturar dependencias temporales simétricas entre características bitemporales en la etapa de modelado de la atención temporal.
    3. Extraer representaciones jerárquicas de características relevantes de una imagen modelada temporalmente usando una arquitectura de codificador basada en características dispersa en la segunda etapa, donde la resolución espacial disminuye gradualmente mientras aumenta la dimensión de la característica.
    4. Utiliza un decodificador skip-connected con upsampling adaptativo para producir mapas de cambios de alta resolución en la etapa de reconstrucción, manteniendo los detalles espaciales a menor escala.
      NOTA: La Figura 1 muestra el flujo total de datos desde las imágenes satelitales bitemporales de entrada hacia el codificador compartido, los bloques de procesamiento de atención cruzada centrales y el decodificador, que en conjunto dan lugar al mapa de detección de cambios.
  3. Codificador de características disperso
    1. Construir un codificador ligero construido a partir de bloques convolucionales Ghost con ratio=2, con normalización por lotes y función de activación de ReLU aplicada secuencialmente para reducir la complejidad computacional manteniendo la calidad representacional.
    2. Ensambla el codificador secuencialmente a partir de los siguientes tres tipos de bloques.
      Bloque1: Ghost (in_channels → 32) → BN ReLU Ghost (32 → 64) → BN ReLU MaxPool(2×2)
      Bloque2: Ghost (64 → 96) → BN ReLU Ghost (96 → 128) → BN ReLU MaxPool (2×2)
      Bloque3: Ghost (128 → 128) → BN ReLU
    3. Conecta los bloques para mantener un flujo fluido de características a través del codificador y preservar la resolución espacial para las etapas siguientes.
      NOTA: La innovación central de este enfoque reside en el mecanismo interactivo de atención cruzada que permite la interacción simétrica de características entre imágenes bitemporales. Para cada par de imágenes, se extraen las características profundas F1,F 2R B×C×H'×W', donde H' = H/4, W'=W/4, C=128 representa la dimensión de la característica. Estas características espaciales se remodelan a un formato figure-protocol-1 de secuencia que representa la longitud de la secuencia espacial, y D=C representa la dimensión de la característica.
  4. Modelado de la atención temporal
    1. Implementar la operación de atención cruzada usando la formulación estándar de atención escalar escalar como se ilustra en la Figura 2
      figure-protocol-2
      donde Q, K y V representan matrices de consulta, clave y valor respectivamente, y dk denota la dimensión de los vectores clave.
      NOTA: Se emplea la atención de múltiples cabezas con h = 8 cabezas para capturar diferentes tipos de relaciones temporales simultáneamente en cada escala. Cada cabeza de atención procesa un subespacio diferente de las representaciones de características, permitiendo que el modelo se centre en varios aspectos de los cambios temporales.
    2. Calcular la salida de atención multicabeza como:
      Multicabeza (Q,K,V) = Concat (cabeza1,...,cabeza h ) WO
      donde cada figure-protocol-3 una son matrices de proyección aprendidas.
  5. Atención interactiva simétrica
    1. La estrategia de atención interactiva captura información de cambio simétrico mediante operaciones hacia adelante y hacia atrás (mostrado en la Figura 3). La atención directa permite que las características de la primera imagen temporal presten atención a las características de la segunda imagen temporal, calculadas como:
      figure-protocol-4
      donde las primeras características temporales sirven como consultas mientras que las segundas características temporales proporcionan claves y valores.
    2. Por el contrario, la atención hacia atrás permite que las características de la segunda imagen temporal presten atención a las características de la primera imagen temporal, formuladas como:
      figure-protocol-5
      Las características asistidas de ambas direcciones se concatenan y proyectan mediante una transformación lineal para producir la representación atendida final:
      figure-protocol-6
      NOTA: Este mecanismo interactivo garantiza que las relaciones temporales se capturen simétricamente, haciendo que la red sea invariante respecto al orden de las imágenes de entrada, lo cual es crucial para aplicaciones de detección de cambios donde la secuencia temporal no debe sesgar los resultados de la detección.
  6. Decodificador y reconstrucción de mapas de cambios
    1. Fusiona las características asistidas con las salidas del codificador mediante conexiones de salto para conservar detalles espaciales.
    2. Aplicar interpolación bilineal con parámetros idénticos en todas las etapas del decodificador para un redimensionamiento adaptativo que asegure una alineación perfecta entre conexiones de salto.
    3. En la primera etapa, reduce los canales de 256 a 96 píxeles mediante convoluciones fantasma en H/4×W/4 y haz un muestreo adicional a H/2×W/2 y fusiona con las correspondientes funciones del codificador.
    4. En la segunda etapa, procesar funciones con convoluciones Ghost para reducir los canales de 160 a 64 píxeles y hacer upsampling a resolución completa H×W e integrarse con funciones de salto a nivel codificador.
    5. Por último, aplica convoluciones Ghost para reducir los canales a 32 y usa una convolución final 1 × 1 para generar el mapa binario de cambio de dos canales.
    6. Resume toda la cadena de procesamiento a través del siguiente marco algorítmico, que integra todos los componentes arquitectónicos en un sistema cohesivo de detección de cambios.
      NOTA: Notación: Eki denota características del codificador de la imagen i ∈ {1,2} en el nivel k; Fi es la última característica codificada; figure-protocol-7 es su versión aplanada;figure-protocol-8 es la característica de atención mejorada; A es la matriz de atención; Dj son salidas de decodificador; φk,ψ j son bloques codificador/decodificador; [·;·] denota concatenación canal a canal; Wout es el núcleo de la capa de salida.
      Véase el Algoritmo de archivo suplementario 1 para "Detección de Cambios Interactiva basada en Fusión de Atención Multiescala

figure-protocol-9
Figura 1: Metodología propuesta Por favor haga clic aquí para ver una versión ampliada de esta figura.

figure-protocol-10
Figura 2: Arquitectura de Atención cruzada Haga clic aquí para ver una versión ampliada de esta figura.

figure-protocol-11
Figura 3: Arquitectura interactiva de atención cruzada Haz clic aquí para ver una versión ampliada de esta figura.

6. Procedimiento de entrenamiento

  1. Función de pérdida
    NOTA: El proceso de entrenamiento emplea una función de pérdida focal de Tversky para abordar el desequilibrio de clases comúnmente encontrado en conjuntos de datos de detección de cambios.
    1. Formulemos la función de pérdida de la siguiente manera: Sea pi ∈ [0,1] la probabilidad predicha para el píxel i, y gi ∊ {0,1} la verdad fundamental correspondiente. El índice de Tversky (TI) se define como:
      figure-protocol-12
      donde α y β controlan la penalización por falsos positivos y falsos negativos, respectivamente, y ε es un término de suavización.
    2. Luego expresa la Pérdida Focal de Tversky como:
      figure-protocol-13
      con γ modulando el enfoque en píxeles difíciles de clasificar.
  2. Configuración de hiperparámetros
    1. Aplicar una búsqueda sistemática en cuadrícula basada en validación cruzada de 5 veces en el conjunto de trenes para seleccionar valores óptimos.
    2. Establezca los coeficientes de ponderación de pérdida para la tarea de detección de cambios en α = 0,3, β = 0,7, γ = 1,0 y ε = 1,0. Estos valores enfatizan minimizar las detecciones perdidas frente a los falsos positivos, lo cual es importante para conjuntos de datos desequilibrados donde los cambios son relativamente raros.
      NOTA: El peso asimétrico con β > α se centra en la recuperación, lo que significa que los falsos negativos tienen más peso que los falsos positivos, y es coherente con el diseño, especialmente en aplicaciones de monitorización de desastres.
  3. Optimizador y estrategia de aprendizaje
    1. Emplea el optimizador AdamW con una disminución de peso de 1×10⁻⁴ para mejorar la regularización y evitar el sobreajuste.
    2. Inicializar la tasa de aprendizaje en 1×10⁻³ y aplicar un programa de recocido coseno para asegurar una convergencia fluida y estable durante el entrenamiento.
    3. Utiliza un lote de 8 para mantener la compatibilidad con un entorno de memoria GPU de 4 GB.
  4. Horario de entrenamiento
    1. Entrenar el modelo por separado en OSCD, que consiste en 14 pares predefinidos para entrenamiento y 10 pares para pruebas, luego en el conjunto de datos de cambios de aire SZTAKI con Szada/1 y Tiszabob/3 como benchmarks estándar del conjunto de prueba.
    2. Divide los pares de entrenamiento en cinco pliegues, usa un pliegue como conjunto de validación en cada iteración y continúa entrenando durante un máximo de 100 épocas.
    3. Monitorizar la pérdida de validación al final de cada pliegue y aplicar criterios de parada temprana de 10 épocas una vez que la convergencia se estabilice para evitar el sobreajuste y reducir cálculos innecesarios.
    4. Selecciona los hiperparámetros basándote en el mejor rendimiento medio de validación en todos los pliegues.
    5. Realizar la detección de cambios en el conjunto de pruebas y cuantificar el rendimiento en una sola ejecución usando pares de imágenes anotadas de cada conjunto de datos.
  5. Optimización de memoria
    1. Activa el punto de control de gradiente para reducir el uso de memoria de la GPU en aproximadamente un 40%, logrado recalculando activaciones intermedias durante el paso hacia atrás.
    2. Permitir el entrenamiento de precisión mixta para utilizar operaciones FP16 cuando sea numéricamente estable, mejorando así la velocidad y reduciendo la carga de memoria.
    3. Utiliza el escalado adaptativo del tamaño de lotes para ajustar dinámicamente el uso de memoria y lograr la máxima eficiencia de la GPU.

7. Evaluación

  1. Asegúrate de que no se incluyan parches de ciudades de prueba en la formación o validación para evitar fugas de datos.
  2. Organizar los parches de imagen y los correspondientes mapas de verificación en tierra para su evaluación por lotes.
  3. Carga los pesos entrenados del modelo desde la época de mejor rendimiento determinada por la pérdida de validación.
  4. Seleccione un umbral de 0,5 para convertir mapas de probabilidad en mapas de cambio binarios.
  5. Calcular métricas de evaluación píxel por píxel para medir el rendimiento en detecciónde cambios 10
    Precisión (P): Fracción de píxeles de cambio predichos que son píxeles de cambio reales.
    Recordar (R): Fracción de píxeles de cambio real detectados correctamente.
    Puntuación F1: Media armónica de precisión y recuerdo.
  6. Producir parches de imagen en tiempo real mientras entrenas y evalúas modelos con dimensiones de 128 x 128 píxeles y una zancada de 64 píxeles.
    NOTA: Esta generación dinámica garantiza la efectividad de la memoria así como la consistencia de los límites.
  7. Comprueba la corrección del preprocesamiento y la colocación de los parches examinando una muestra representativa de los parches creados inteligibles, o imágenes de características de nivel medio.
    NOTA: Las representaciones de características codificadas generadas por el codificador basado en CNN se almacenan en memoria en forma de tensores que se usarán más adelante en las etapas, que sirven como puntos de control al verificar características. Los mapas de cambios producidos se almacenan como archivos de imagen regulares (e.g. PNG o TIFF) para ser visualizados visualmente y así evaluar las alteraciones identificadas.
  8. Registra los indicadores de convergencia (curvas de pérdida, métricas de precisión) en el entrenamiento del modelo y comprueba si los puntos del modelo se guardan en intervalos especificados para que todo el proceso de entrenamiento pueda repetirse, refinarse o recuperarse.
    NOTA: La presentación explícita del formato de salida, los pasos de verificación y los detalles del punto de control ayuda a garantizar la transparencia, permitiendo que la verificación se realice paso a paso y también permita que el protocolo sea reproducido y validado por otros investigadores. Este protocolo ofrece un flujo de trabajo detallado y detallado sobre cómo preparar un conjunto de datos y proceder con la fase de preprocesamiento, construcción de la red, entrenamiento y evaluación. Siguiendo los pasos, se podrá implementar el método propuesto bajo las condiciones especificadas de forma repetible. Los resultados de dicho procedimiento se muestran en la siguiente sección de Resultados.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El método propuesto de detección de cambios fue evaluado frente a enfoques de referencia establecidos utilizando dos conjuntos de datos de referencia disponibles públicamente para evaluar su rendimiento en diferentes resoluciones espectrales y condiciones ambientales. Los resultados experimentales revelan mejoras significativas en el equilibrio de la precisión de detección con el control de falsos positivos, demostrando especialmente la capacidad del método para mantener altas tasas de r...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta una red interactiva de detección de cambios basada en fusión de atención a múltiples escalas para detectar cambios en imágenes satelitales bitemporales. La integración de un mecanismo de atención bidireccional, a diferencia de los métodos unidireccionales, facilita una interacción completa entre características y características entre características y señales complementarias de atención hacia adelante y hacia atrás. Los cambios temporales progresivos del flujo de a...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen conflicto de intereses.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación no recibió ninguna subvención específica de ninguna agencia financiadora en los sectores público, comercial o sin ánimo de lucro.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Kit de herramientas CUDANVIDIA CorporationVersión 11.3Aceleración de GPU para cálculos de aprendizaje profundo
cuDNNNVIDIA CorporationVersión 8.2Biblioteca optimizada de aprendizaje profundo para GPU
Intel  ProcesadorIntel CorporationCore i7 10870HPlataforma computacional utilizada para entrenar y evaluar el modelo propuesto de aprendizaje profundo
NumPyCódigo abiertoVersión 1.21.0Procesamiento numérico de matrices
NVIDIA GeForce NVIDIA CorporationGTX 1650 Ti (4 GB VRAM)Unidad de procesamiento gráfico utilizada para el entrenamiento acelerado de modelos
Conjunto de datos de detección de cambios por satélite Onera (OSCD)ONERAConjunto de datos ópticos de imágenes RGB y multiespectrales disponibles públicamente utilizado para entrenamiento y evaluación.https://rcdaudt.github.io/oscd/
PythonFundación de Software PythonVersión 3.8Lenguaje de programación utilizado para la implementación de algoritmos
PyTorchMeta AI (Código Abierto)Versión 1.12.1Marco de aprendizaje profundo de código abierto utilizado para desarrollar y entrenar el modelo propuesto
Scikit-learnCódigo abiertoVersión 1.0.2Métricas de evaluación del rendimiento
Conjunto de datos de benchmark de SZTAKI AirChangeSZTAKIConjunto de datos de imágenes aéreas ópticas RGB disponibles públicamente para entrenamiento y evaluación.http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
TorchvisionMeta AI (Código Abierto)Versión 0.13.1Carga de conjuntos de datos y transformaciones de imágenes
Windows OSMicrosoft11Sistema operativo  

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles