$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Niveles sin precedentes de urbanización en el medio ambiente global, la pérdida de recursos medioambientales y las alteraciones del paisaje debido al clima han provocado directamente la necesidad de proporcionar un sistema de monitorización exacto, oportuno y automático que pueda identificar y medir los cambios en la superficie de la Tierra. La teledetección satelital se ha convertido en el pilar básico de la vigilancia ambiental masiva, ya que proporciona una cobertura temporal y espacial consistente, además de ser vital para el examen completo del cambio. La detección de cambios por imágenes satelitales bitemporales es la caracterización de los cambios superficiales entre dos adquisiciones secuenciales de la misma región geográfica. Sin embargo, es un proceso complicado debido a las numerosas variables de confusión, incluyendo la variación de las estaciones, las condiciones meteorológicas, las propiedades del sensor, las distorsiones geométricas y las alteraciones fenomenológicas que pueden ocultar o asemejarse a la realidad en la cobertura del suelo. La interpretación manual de imágenes de satélites actualmente en uso es laboriosa, subjetiva y no adecuada para hacer frente a las cantidades crecientes de información de observación terrestre generadas por las constelaciones satelitales actuales. Esta es la limitación básica que ha dado lugar a la creación de soluciones automatizadas de detección de cambios. Los métodos convencionales basados enpíxeles 1 y la detección de cambios basada enobjetos 2 tienden a ser poco adecuados para operar dentro de los límites de estas complejidades y tienen un bajo estándar de robustez para aplicarse a una amplia gama de unidades geográficas y escalas temporales. Las arquitecturas de aprendizaje profundo, especialmente las redes neuronales convolucionales y sus variantes, permiten la extracción de características jerárquicas que representan detalles espectrales de bajo nivel y patrones semánticos de alto nivel relevantes para distinguir cambios. Los modelos de detección de cambios por aprendizaje profundo han demostrado ser muy prometedores para capturar cambios espacio-temporales latentes en datos de teledetección y para identificar la verdadera cobertura terrestre frente a pseudo-cambios, introducidos por factores externos. Estos enfoques de aprendizaje de extremo a extremo aprovechan el hecho de que se pueden extraer características y la clasificación puede realizarse de forma óptima a la vez. A pesar de los avances sustanciales en la precisión de detección de cambios, la mayoría de los enfoques existentes siguen siendo difíciles de implementar en entornos operativos reales. Los enfoquesbasados en transformadores 3, aunque eficientes en el contexto global, tienen un alto conteo de parámetros, complejidad computacional cuadrática, latencia de inferencia y alto consumo energético. Las arquitecturas siamesas basadas en CNN, por otro lado, son superiores en eficiencia, pero tienen campos receptivos pequeños y carecen en gran parte de modelado contextual global, lo que empeora significativamente el rendimiento. Estas limitaciones se agravan aún más en entornos a gran escala y con recursos limitados, donde la escalabilidad y el coste operativo son consideraciones críticas. La escalabilidad, la eficiencia energética y la rapidez con la que se hacen las inferencias son frecuentemente vitales en un entorno de respuesta a emergencias, y es necesario crear soluciones que equilibren rendimiento y facilidad de despliegue. Por lo tanto, existe una brecha entre los modelos centrados en la precisión, que requieren mucha intensidad computacional, y los requisitos prácticos del despliegue en el mundo real.
Para superar estos problemas, se propone una Red de Fusión de Atención Multiescala Interactiva (IMAF) con Convolución de Características Dispersas (SFC), que se centra en el diseño de un marco eficiente y desplegable de detección de cambios, en lugar de optimizar solo la precisión. La solución propuesta se centra en pares ópticos de imágenes satelitales, normalmente imágenes RGB o multiespectrales de alta resolución (resolución 0,5-30 m), adquiridas por satélites, por ejemplo, Landsat, Sentinel-2 o WorldView. La técnica presupone una co-registro geométrica precisa de pares bitemporales, ya que los errores de registro también pueden tener un efecto considerable en la detección. Se ocupa de la detección de cambios binarios (en contraposición al cambio semántico multiclase) y no puede distinguir entre varios tipos de cambio. Además, el método utiliza imágenes corregidas radiométricamente para reducir los efectos de cambios estacionales, atmosféricos e iluminados, que se confundirían con cambios en la cobertura del suelo. A diferencia de las CNN siamesestradicionales 4, que separan imágenes bitemporales con la ayuda de una simple concatenación, el módulo IMAF propuesto permite la fusión contextual multiescala de características globales y locales. Los enfoques recientes basados en transformadores, como BIT5 yChangeFormer 3, están obteniendo muy buenos resultados, pero sus mecanismos de autoatención tienen la complejidad O(N2). El marco propuesto captura cambios sutiles con atención bidireccional, reduciendo la complejidad computacional y la latencia de inferencia. Además, el diseño propuesto es consciente de la esparsidad, lo que es superior a diseños de fusión densa y multiescala como UNet++6,7 y SNUNet8. La convolución de características escasas con el módulo fantasma reduce los FLOPs en aproximadamente un 50%, preservando la calidad de la representación. Por tanto, el marco propuesto favorece un equilibrio entre precisión y eficiencia para un despliegue fiable en entornos con recursos limitados.
Las principales contribuciones de este estudio son: (i) Un detector de cambio ligero que alcanza una puntuación F1 competitiva utilizando 19 veces menos parámetros en comparación con sus equivalentes basados en transformadores. (ii) Un módulo interactivo de fusión de atención multiescala que obtiene información contextual global sin el coste computacional cuadrático de los mecanismos tradicionales de autoatención. (iii) Un esquema de convolución con esparsidad de características basado en módulos Ghosts, que minimiza las operaciones de coma flotante en un 49,4 por ciento sin degradación de calidad en la representación de características. (iv) Validación experimental extensa en un gran conjunto de conjuntos de datos de referencia, con mejores compromisos entre eficiencia y precisión y una razonable viabilidad de aplicación real en el mundo real.
El resto de este manuscrito comprende las siguientes secciones: La sección 2 ofrece una visión general extensa del trabajo reciente en el área de metodologías de detección de cambios binarios, con especial atención a soluciones de aprendizaje profundo y su implementación en benchmarks estándar. La Sección 3 ofrece el contexto teórico y el diseño estructural de la solución propuesta, la representación matemática del mecanismo de fusión temporal y los elementos de atención, las características del montaje experimental, conjuntos de datos, métricas de evaluación y detalles de implementación necesarios para producir investigación reproducible. La Sección 4 ilustra hallazgos experimentales detallados que comprenden la ablación, comparaciones con los últimos algoritmos de detección de cambios binarios que explican la capacidad en diversas áreas geográficas de los conjuntos de datos de Airchange de OSCD y SZTAKI. La Sección 5 determina los resultados de los hallazgos, las limitaciones de un enfoque actual y las posibilidades de futuras investigaciones en la detección de cambios.
El desarrollo de algoritmos de detección de cambios en teledetección ha cambiado considerablemente, pasando de métodos basados en píxeles a marcos de aprendizaje profundo. Los procedimientos tempranos de detección de cambios se basaban principalmente en procesos algebraicos como la diferenciación de imágenes, el racionamiento de imágenes y el análisis de vectores de cambio, que trabajaban directamente sobre los valores de píxeles para detectar cambiostemporales 9,10. Se desarrollaron métodos alternativos que implicaban la comparación posterior a la clasificación, en los que cada imagen temporal se clasificaba de forma independiente y luego se comparaba con la tabulacióncruzada 11. Las técnicas de detección de cambios basadas en objetos representaron un paso importante de progreso con la introducción del contexto espacial, así como la mitigación del ruido a nivel depíxel 2,12.
La llegada de las técnicas de aprendizaje profundo ha revolucionado el ámbito de la detección de cambios en teledetección y ha allanado el camino para superar varias limitaciones en las técnicas tradicionales. Recientemente, las Redes Neuronales de Convolución (CNN) se han convertido en la arquitectura estándar para la extracción automatizada de características y clasificaciónde cambios 13,14. Siamese NestedUNet for ChangeDetection 14 y Siamese Swin-Unet15 han surgido como una innovación significativa debido a la topología de redes siamesas densamente conectadas, que ayuda a retener eficazmente la información de localización a lo largo de la jerarquía de la red.
El problema de la detección de cambios bitemporales en la teledetección óptica de alta resolución sigue siendo difícil de resolver debido a una variedad de factores de confusión, y se han propuesto16 las redes transformadoras multiescala basadas en atención con las elaboradas estrategias de fusión de características. El marco EGMT-CD propuso transformadores multimodales guiados por bordes de pares de imágenes heterogéneos, donde las imágenes homólogas no son accesibles debido a la cobertura denubes 17. Arquitecturas como DASUNet rompen cuellos de botella manuales de aprendizaje profundo en la fusión de características a gran escala, con una mejora del índice F1 un 0,85% mayor que SNUNet-24 en el conjunto de datos CDD usando un flujo gradientemejorado 18. Los modelos híbridos CNN-Transformador abordan el problema de falsos negativos a un coste más alto proporcionando un coste adicional en los componentes de frecuencia respecto al aprendizajede características 19. Sin embargo, las redes híbridas de transformadoresen forma de U 20 siguen siendo difíciles de proporcionar integración de características local-global y cambios en regiones que ocurren periódicamente, incluso a pequeña escala. El uso de la detección de cambios semánticos multitarea, así como la identificación precisa de localización y clase, es más complicado en comparación con tareas binarias21,22. Las correlaciones bi-temporales pueden modelarse con éxito mediante la atención cruzada sin cambios arquitectónicossignificativos 14,23. La expresión paradigmática de lenguaje en perspectiva también es una frontera reciente con diseños basados en CLIP, que combinan explicaciones textuales en patrones de correspondenciade cambio 24 y semi-supervisados, eliminando la dependencia de datosetiquetados 25. Change Mamba presenta los modelos de espacio de estados de los modelos espacio-temporales26,27. Se demuestran diferentes aplicaciones de métodos especializados de atención: abordando el uso de detección de anomalíashiperespectrales 28, clasificación de objetivosmultiárea 29 o segmentación de etiquetaslimitadas 30, y demostrar la flexibilidad de los mecanismos de atención en la analítica de teledetección.
| Autores | Método/Arquitectura | Especificaciones técnicas | Innovación y hallazgos clave / Rendimiento del conjunto de datos |
| Singh, A. [8] | Métodos tradicionales | Diferenciación basada en píxeles, CVA | Marco de detección de cambios digitales, múltiples conjuntos de datos, Precisión: 65-80% |
| Mas, J.F. [10] | Posclasificación | Clasificación temporal independiente | Análisis de metodología comparativa, Imágenes tropicales, OA: 72-85% |
| Lu et al. [9] | Métodos tradicionales | Operaciones algebraicas, CVA, PCA | Comparación completa de técnicas, múltiples fuentes, precisión: 70-88% |
| Benedek & Szirányi [23] | Modelo de Markov Mixto | Marco condicional multicapa | Modelado probabilístico del cambio, Sztaki AirChange, DA: 92,1% |
| Blaschke, T. [2] | Basado en objetos | Análisis basado en segmentación | Integración del contexto espacial, diversas imágenes de HR, SA: 85-92% |
| Chen et al. [11] | Basado en objetos | Segmentación multiescala | Análisis jerárquico de objetos, imágenes de RRHH, OA: 87,3% |
| Zhan et al. [12] | CNN siamesa | CNN de 5 capas, tamaño de núcleo 3×3 | Arquitectura siamesa profunda para CD, imágenes aéreas, F1: 0.847, IoU: 0.735 |
| Daudt et al. [4] | FCN siamés | FC-EF, FC-Siam-diff, FC-Siam-conc | Estrategias de fusión temprana/tardía, OSCD, F1: 0,431, IoU: 0,276 |
| Peng et al. [26] | UNet++ | U-Net anidado, conexiones de salto denso | Agregación de características a escala múltiple, satélite HR, F1: 0,753, IoU: 0,604 |
| Chen & Shi [25] | Atención espaciotemporal | Bloques de atención, modelado temporal | Aprendizaje de características espacio-temporal, LEVIR-CD, F1: 0,887, IoU: 0,797 |
| Fang et al. [7] | SNUNet-CD | Siamese NestedUNet, conexiones densas | Optimización de transmisión de información, LEVIR: F1: 0,897, WHU: F1: 0,904 |
| Chen et al. [5] | BIT-CD | ResNet18 + codificador de transformador | Aprendizaje binario temporal de características, OSCD: F1: 0,635, LEVIR: F1: 0,919 |
| Bandara y Patel [3] | ChangeFormer | Codificador jerárquico de transformador | Atención de transformadores a escala multipla, OSCD: F1: 0,654, LEVIR: F1: 0,905 |
| Song et al. [27] | ACANet | Atención axial + columna vertebral CNN | Cálculo eficiente de atención, LEVIR: F1: 0,901, WHU: F1: 0,913 |
| Shi et al. [28] | Artículo de revisión | Encuesta integral sobre métodos de IA | Análisis sistemático de enfoques de IA, 50+ conjuntos de datos analizados |
| Li et al. [14] | AMST-Net | Transformador multiescala, atención piramidal | Extracción adaptativa de características multiescala, imágenes ópticas de frecuencia cardíaca, mIoU: 0,823 |
| Xiang et al. [15] | EGMT-CD | Arquitectura multimodal guiada por bordes | Alineamiento de características entre modales, Pares heterogéneos, F1: 0,756 |
| Miao et al. [16] | DASUNet | Supervisión densa, fusión a gran escala | Supervisión profunda en todos los niveles de decodificadores, CDD: mejora del 0,85% en F1 respecto a SNUNet |
| Tang et al. [29] | Swin-UNet siamés | Fusión Swin Transformer + Unet | Ventana jerárquica de atención, LEVIR: F1: 0,923, WHU: F1: 0,925 |
| Wu et al. [18] | Transformador en U híbrido | Columna vertebral UNet++ + bloques transformadores | Integración global-local de funcionalidades, imágenes de RRHH, IoU: 0,851, F1: 0,919 |
| Dong et al. [20] | ChangeCLIP | Lenguaje visual basado en CLIP | Comprensión semántica multimodal, pares RS, precisión semántica: 94,1% |
| Li et al. [21] | SemiCD-VL | Lenguaje de visión semi-supervisado | Requisitos de anotación reducidos, etiquetas limitadas, F1: 0,889 |
| Chen et al. [22] | ChangeMamba | Modelos de Espacio de Estado (SSM) | Modelado temporal de complejidad lineal, imágenes RS, eficiencia: 3 veces más rápido |
Tabla 1: Resumen de los métodos de detección de cambios en teledetección. Por favor, haga clic aquí para descargar esta tabla.
Un resumen de los estudios previos se presenta en la Tabla 1. Los métodos tradicionales tienen características hechas a mano que no son adecuadas para variaciones espaciotemporalescomplejas 31, y la arquitectura de aprendizaje profundo (UNet, FPN, PSPNet) implica convoluciones densas y computacionalmente costosas. Los modelos actuales no cuentan con sistemas eficientes de incorporación multiescala ni de atención dinámica. Para cubrir estas carencias, el estudio actual propone la Fusión Interactiva de Atención Multiescala con Red de Convolución de Características Dispersas, que tiene como objetivo captar los cambios sutiles a través de escalas mientras es computacionalmente eficiente en teledetección, especialmente en cambios estructurales urbanos y provocados por el hombre.