Method Article

Fusion interactive de l’attention multi-échelle avec réseau de convolution de caractéristiques clairsemées pour la détection des changements d’images satellites

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un modèle de fusion interactive à attention multiéchelle avec des réseaux de convolution de caractéristiques clairsemées afin d’améliorer la détection des changements d’images satellites. Cette approche tire parti de l’extraction de caractéristiques à plusieurs échelles, de l’attention sélective et des convolutions clairsemées pour détecter et localiser efficacement les changements dans les images satellites bitemporelles en réduisant la complexité de calcul.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La détection des changements à l’aide d’images satellites bitemporelles est un problème important dans la surveillance de la Terre, qui vise à identifier et localiser les changements de surface entre une acquisition temporelle et à distinguer les pseudo-changements réels dus aux cycles saisonniers, aux facteurs atmosphériques ou aux développements d’origine humaine. Les méthodes actuelles d’apprentissage profond font généralement face à un biais unidirectionnel dans leur modélisation temporelle, ce qui limite l’utilisabilité des relations spatiales à grande échelle afin de permettre une caractérisation correcte des schémas de changement. Bien que les techniques récentes basées sur les transformateurs soient très précises, leurs exigences de calcul sont également assez importantes, limitant ainsi leur utilisation sur des tâches limitées en ressources. En réponse à ces limitations, un réseau Interactive Multiscale Attention Fusion (IMAF) avec Convolution de Caractéristiques Parcimonieuses (SFC) basé sur des modules Ghost est proposé dans cet article. Le réseau utilise une architecture avancée encodeur-décodeur, complétée par des modules d’attention interactifs à différentes échelles. Le réseau fonctionne avec des flux d’attention complémentaires avant et arrière : le premier enregistre la variation temporelle progressive et le second vérifie la cohérence des changements par analyse temporelle inverse. Cette méthode interactive permet des représentations efficaces du modèle duplex des relations temporelles sans être computationnellement prohibitives, améliorant ainsi de bien meilleures approches pour distinguer les mouvements légitimes de couverture des sols par rapport au bruit sans variation induite par le bruit. Deux jeux de données de référence sont expérimentés : l’ensemble de données Onera Satellite Change Detection (OSCD) et le jeu de données SZTAKI AirChange. Les expériences significatives menées sur les ensembles de données OSCD révèlent que l’approche proposée atteint des taux F1 compétitifs de 58,14 % (13 canaux) et 50,68 % (3 canaux) avec seulement 2,13 millions de paramètres et 19,6 G FLOPS, 19 fois peu de paramètres, et un taux d’inférence 5,6 fois supérieur à ChangeFormer. La performance compétitive sur les échantillons des ensembles de test Szada/1 et Tiszadob/3 du jeu de données SZTAKI, avec un score F1 de 74,29 % et 92,86 % respectivement, permet d’implémenter dans le plus grand nombre d’appareils en périphérie, des analyses en temps réel et des systèmes de cartographie étendus où l’énergie opérationnelle dépend directement de l’énergie de calcul.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Des niveaux sans précédent d’urbanisation dans l’environnement mondial, la perte de ressources environnementales et les modifications du paysage dues au climat ont directement déclenché la nécessité de fournir un système de surveillance précis, rapide et automatique capable d’identifier et de mesurer les changements à la surface de la Terre. La télédétection par satellite est devenue la base de la surveillance environnementale de masse, car elle assure une couverture temporelle et spatiale cohérente, en plus d’être essentielle à l’examen complet de ce changement. La détection des changements par imagerie satellite bi-temporelle est la caractérisation des changements de surface entre deux acquisitions séquentielles d’une même région géographique. C’est un processus complexe, cependant, en raison des nombreuses variables de confusion, notamment la variation des saisons, les conditions météorologiques, les propriétés des capteurs, les distorsions géométriques et les altérations phénoménologiques qui peuvent obscurcir ou ressembler au réel dans la couverture du sol. L’interprétation manuelle des images satellites actuellement utilisées est longue, subjective et inadaptée à la gestion des quantités croissantes d’informations d’observation de la Terre générées par les constellations satellites actuelles. C’est la limitation fondamentale qui a conduit à la création de solutions automatisées de détection des changements. Les méthodes conventionnelles basées surle pixel 1 et la détection de changement basée surl’objet 2 ont tendance à être mal adaptées pour fonctionner dans les limites de ces complexités et ont un faible standard de robustesse à appliquer à une large gamme d’unités géographiques et d’échelles temporelles. Les architectures d’apprentissage profond, en particulier les réseaux de neurones convolutionnels et leurs variantes, permettent l’extraction de caractéristiques hiérarchiques représentant des détails spectraux de bas niveau et des motifs sémantiques de haut niveau pertinents pour distinguer les changements. Les modèles de détection des changements par apprentissage profond se sont révélés très prometteurs pour capturer les changements spatio-temporels latents dans les données de télédétection, et pour identifier la véritable couverture terrestre versus les pseudo-changements, introduits par des facteurs extérieurs. Ces approches d’apprentissage de bout en bout tirent parti du fait que les caractéristiques peuvent être extraites et que la classification peut être effectuée de manière optimale en même temps. Malgré des progrès substantiels en matière de précision de détection des changements, la plupart des approches existantes restent difficiles à déployer dans des environnements opérationnels réels. Les approchesbasées sur transformateurs 3, bien qu’efficaces dans un contexte global, présentent un nombre élevé de paramètres, une complexité computationnelle quadratique, une latence d’inférence et une consommation d’énergie élevée. Les architectures siamoises basées sur CNN, en revanche, sont supérieures en efficacité, mais possèdent de petits champs récepteurs et manquent en grande partie de modélisation contextuelle globale, ce qui détériore significativement les performances. Ces contraintes sont encore exacerbées dans les environnements à grande échelle et limités en ressources, où la scalabilité et le coût opérationnel sont des considérations critiques. La scalabilité, l’efficacité énergétique et la rapidité avec laquelle les inférences sont faites sont souvent essentielles dans un contexte d’intervention d’urgence, et il est nécessaire de créer des solutions qui équilibrent performance et facilité de déploiement. Par conséquent, un fossé subsiste entre les modèles axés sur la précision, intensifs en calcul, et les exigences pratiques du déploiement réel.

Pour surmonter ces problèmes, une fusion interactive de l’attention multiscale (IMAF) avec réseau de convolution de fonctionnalités parcies (SFC) est proposée, qui se concentre sur la conception d’un cadre de détection de changement efficace et déployable, plutôt que sur l’optimisation de la précision seule. La solution proposée se concentre sur des paires d’images satellites optiques, généralement des images RVB ou multispectrales haute résolution (résolution 0,5-30 m), acquises par des satellites, par exemple Landsat, Sentinel-2 ou WorldView. La technique suppose une co-enregistrement géométrique précise des paires bi-temporelles, car les erreurs d’enregistrement peuvent également avoir un effet considérable sur la détection. Il traite de la détection binaire des changements (par opposition aux changements sémantiques multiclasses) et ne peut pas distinguer les différents types de changements. Plus encore, la méthode utilise des images corrigées radiométriquement pour réduire les effets des changements saisonniers, atmosphériques et d’éclairage, qui seraient confondus avec des changements de couverture terrestre. Contrairement aux CNN siamoistraditionnels 4 qui séparent les images bi-temporelles à l’aide d’une simple concaténation, le module IMAF proposé permet une fusion contextuelle multi-échelle de caractéristiques globales et locales. Les approches récentes basées sur les transformateurs, telles que BIT5 etChangeFormer 3, donnent de très bons résultats, mais leurs mécanismes d’auto-attention ont la complexité O(N2). Le cadre proposé capte les changements subtils avec une attention bidirectionnelle, réduisant la complexité computationnelle et la latence d’inférence. De plus, la conception proposée est consciente de la parcimonie, ce qui est supérieur aux conceptions de fusion multiéchelle dense telles que UNet++6,7 et SNUNet8. La convolution de caractéristiques clairsemées avec le module fantôme réduit les FLOP d’environ 50 %, préservant la qualité de la représentation. Ainsi, le cadre proposé privilégie un compromis précision-efficacité pour un déploiement fiable sur des environnements à ressources limitées.

Les principales contributions de cette étude sont : (i) Un détecteur de changement léger qui atteint un score F1 compétitif en utilisant 19 fois moins de paramètres que ses homologues basés sur transformateurs. (ii) Un module de fusion interactive de l’attention multiscale qui obtient des informations contextuelles globales sans le coût computationnel quadratique des mécanismes traditionnels d’auto-attention. (iii) Un schéma de convolution avec la parcimonie des caractéristiques basé sur les modules Ghosts, qui minimise les opérations en virgule flottante de 49,4 % sans dégradation de la qualité dans la représentation des caractéristiques. (iv) Une validation expérimentale étendue sur un large ensemble de jeux de données de référence, avec de meilleurs compromis entre efficacité et précision et une réalisabilité raisonnable de l’application réelle dans le monde réel.

Le reste de ce manuscrit comprend les sections suivantes : La section 2 offre un aperçu approfondi des travaux récents dans le domaine des méthodologies de détection des changements binaires, avec une attention particulière portée aux solutions d’apprentissage profond et à leur mise en œuvre sur des benchmarks standards. La section 3 donne le contexte théorique et la conception structurelle de la solution proposée, la représentation mathématique du mécanisme de fusion temporelle et des éléments d’attention, les caractéristiques de la configuration expérimentale, les jeux de données, les métriques d’évaluation et les détails de mise en œuvre nécessaires à la production de recherches reproductibles. La section 4 illustre des résultats expérimentaux détaillés comprenant l’ablation, des comparaisons avec les derniers algorithmes de détection des changements binaires qui expliquent la capacité dans diverses zones géographiques dans les ensembles de données Airchange de l’OSCD et du SZTAKI. La Section 5 détermine les résultats des résultats, les limites d’une approche actuelle et les possibilités de recherches futures en matière de détection du changement.

Le développement des algorithmes de détection des changements en télédétection a été grandement modifié, passant des méthodes basées sur des pixels aux cadres d’apprentissage profond. Les procédures précoces de détection des changements étaient principalement basées sur des processus algébriques tels que la différenciation d’images, le rationnement d’image et l’analyse des vecteurs de changement, qui travaillaient directement sur les valeurs de pixels pour détecter les changements temporels 9,10. Des méthodes alternatives impliquant la comparaison post-classification ont été développées, dans lesquelles chaque image temporelle était classifiée indépendamment puis comparée par un tableaucroisé 11. Les techniques de détection des changements basées sur les objets ont représenté une étape importante du progrès avec l’introduction du contexte spatial ainsi que la réduction du bruit au niveau despixels 2,12.

L’avènement des techniques d’apprentissage profond a révolutionné le domaine de la détection des changements en télédétection et a ouvert la voie à la surmontation de plusieurs contraintes des techniques traditionnelles. Récemment, les réseaux neuronaux à convolution (CNN) sont devenus l’architecture standard pour l’extraction automatisée des caractéristiques et la classificationdes modifications 13,14. Siamese NestedUNet for ChangeDetection 14 et Siamois Swin-Unet15 se sont imposés comme une innovation significative grâce à une topologie de réseau siamoise densément connectée, qui aide à conserver efficacement les informations de localisation à travers la hiérarchie du réseau.

Le problème de la détection des changements bi-temporels dans la télédétection optique haute résolution reste difficile à résoudre en raison de divers facteurs de confusion, et les réseaux de transformateurs multi-échelle basés sur l’attention avec des stratégies de fusion complexes ont étéproposés 16. Le cadre EGMT-CD proposait des transformateurs multimodaux guidés par arêtes de paires d’images hétérogènes, où les images homologues ne sont pas accessibles en raison de la couverturenuageuse 17. Des architectures comme DASUNet brisent les goulots d’étranglement manuels en apprentissage profond grâce à la fusion de fonctionnalités à grande échelle, avec une amélioration de l’indice F1 supérieure de 0,85 % par rapport à SNUNet-24 sur le jeu de données CDD grâce à un flux gradientamélioré 18. Les modèles hybrides CNN-Transformateur traitent le problème des faux négatifs à un coût plus élevé en fournissant un coût supplémentaire sur les composantes de fréquence à l’apprentissagedes caractéristiques 19. Les réseaux hybrides detransformateurs en forme de U 20, cependant, restent difficiles à assurer l’intégration des caractéristiques local-globale et des changements dans les régions qui surviennent périodiquement, même à petite échelle. L’utilisation de la détection de changements sémantiques multitâches, ainsi que l’identification précise de localisation et de classe, est plus complexe comparée aux tâches binaires21,22. Les corrélations bi-temporelles peuvent être modélisées avec succès par l’attention croisée sans changements architecturauxsignificatifs 14,23. L’expression paradigmique du langage en perspective est également une frontière récente avec des conceptions basées sur CLIP, combinant des explications textuelles en correspondance de changement24 et des motifs semi-supervisés, éliminant ainsi la dépendance aux donnéesétiquetées 25. Change Mamba présente les modèles d’espace d’états des modèles spatio-temporels26,27. Différentes applications de méthodes spécialisées d’attention sont démontrées : abordant l’utilisation de la détection d’anomalieshyperspectrales 28, de la classification multi-zonesde cibles 29 ou de la segmentation à l’étiquettelimitée 30, et la démonstration de la flexibilité des mécanismes d’attention dans l’analyse de la télédétection.

AuteursMéthode/ArchitectureSpécifications techniquesInnovation clé et résultats / Performance des ensembles de données
Singh, A. [8]Méthodes traditionnellesDifférenciation basée sur les pixels, CVACadre de détection des changements numériques, Ensembles de données multiples, Précision : 65-80 %
Mas, J.F. [10]Après le classementClassification temporelle indépendanteAnalyse méthodologique comparative, Imagerie tropicale, OA : 72-85 %
Lu et al. [9]Méthodes traditionnellesOpérations algébriques, AVC, ACPComparaison complète des techniques, sources multiples, précision : 70-88 %
Benedek & Szirányi [23]Modèle de Markov mixteCadre conditionnel multicoucheModélisation probabiliste du changement, Sztaki AirChange, DA : 92,1 %
Blaschke, T. [2]Basé sur des objetsAnalyse basée sur la segmentationIntégration du contexte spatial, diverses images de fréquence cardiaque, SA : 85-92 %
Chen et al. [11]Basé sur des objetsSegmentation multi-échelleAnalyse hiérarchique des objets, imagerie HR, OA : 87,3 %
Zhan et al. [12]CNN siamoiseCNN à 5 couches, taille du noyau 3×3Architecture siamoise profonde pour CD, images aériennes, F1 : 0,847, IoU : 0,735
Daudt et al. [4]FCN siamoisFC-EF, FC-Siam-diff, FC-Siam-concStratégies de fusion précoce/tardive, OSCD, F1 : 0,431, IoU : 0,276
Peng et al. [26]UNet++U-Net imbriqué, connexions à saut denseAgrégation de caractéristiques à plusieurs échelles, satellite HR, F1 : 0,753, IoU : 0,604
Chen & Shi [25]Attention spatiale-temporelleBlocs d’attention, modélisation temporelleApprentissage des caractéristiques spatio-temporelle, LEVIR-CD, F1 : 0,887, IoU : 0,797
Fang et al. [7]SNUNet-CDSiamois NestedUNet, connexions densesOptimisation de la transmission de l’information, LEVIR : F1 : 0,897, WHU : F1 : 0,904
Chen et al. [5]BIT-CDResNet18 + encodeur transformateurApprentissage binaire des caractéristiques temporelles, OSCD : F1 : 0,635, LEVIR : F1 : 0,919
Bandara & Patel [3]ChangeAncienEncodeur de transformateur hiérarchiqueAttention des transformateurs à plusieurs échelles, OSCD : F1 : 0,654, LEVIR : F1 : 0,905
Song et al. [27]ACANetAttention axiale + colonne vertébrale CNNCalcul efficace de l’attention, LEVIR : F1 : 0,901, WHU : F1 : 0,913
Shi et al. [28]Mémoire de synthèseEnquête complète sur les méthodes d’IAAnalyse systématique des approches d’IA, 50+ jeux de données analysés
Li et al. [14]AMST-NetTransformateur multi-échelle, attention pyramidaleExtraction adaptative multiéchelle des caractéristiques, images optiques HR, mIoU : 0,823
Xiang et al. [15]EGMT-CDArchitecture multimodale guidée par les bordsAlignement des caractéristiques intermodales, paires hétérogènes, F1 : 0,756
Miao et al. [16]DASUNetSupervision dense, fusion à grande échelleSupervision approfondie à tous les niveaux de décodeur, CDD : amélioration de 0,85 % de F1 par rapport à SNUNet
Tang et al. [29]Swin-UNet siamoisFusion Transformateur Swin + UnetAttention hiérarchique de la fenêtre, LEVIR : F1 : 0,923, WHU : F1 : 0,925
Wu et al. [18]Transformateur en U hybrideBackbone UNet++ + blocs transformateursIntégration des fonctionnalités global-locale, images HR, IoU : 0,851, F1 : 0,919
Dong et al. [20]ChangeCLIPLangage visuel basé sur CLIPCompréhension sémantique multimodale, paires RS, précision sémantique : 94,1 %
Li et al. [21]SemiCD-VLLangage visionnel semi-superviséExigences d’annotation réduites, étiquettes limitées, F1 : 0,889
Chen et al. [22]ChangeMambaModèles d’espace d’état (SSM)Modélisation temporelle de complexité linéaire, images RS, efficacité : 3 fois plus rapide

Tableau 1 : Résumé des méthodes de détection des changements en télédétection Veuillez cliquer ici pour télécharger ce tableau.

Un résumé des études antérieures est présenté dans le tableau 1. Les méthodes traditionnelles possèdent des fonctionnalités artisanales qui ne conviennent pas aux variations spatiales et temporellescomplexes 31, et l’architecture d’apprentissage profond (UNet, FPN, PSPNet) implique des convolutions denses coûteuses en calcul. Les modèles actuels ne disposent pas de systèmes d’intégration multi-échelle efficaces ni de systèmes d’attention dynamique. Pour combler ces lacunes, l’étude actuelle propose une fusion interactive de l’attention multi-échelle avec réseau de convolution de caractéristiques clairsemées, qui vise à capturer les changements subtils à travers les échelles tout en étant efficace en télédétection, notamment sur les changements urbains et structurels d’origine humaine.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Déclaration d’éthique

  1. Les ensembles de données Onera Satellite Change Detection (OSCD) et SZTAKI AirChange utilisés dans cette étude consistent en des images RVB et multispectrales accessibles au public couvrant diverses caractéristiques géographiques. Ces ensembles de données ne contiennent aucune donnée restreinte ou sensible. Par conséquent, aucun consentement éthique n’est requis pour ce travail.

2. Matériaux et équipements

  1. Effectuez des tests sur un ordinateur Windows 11 équipé d’un processeur Intel Core i7 10870H, d’une puce NVIDIA GeForce GTX 1650 Ti avec 4 Go de VRAM, et 32 Go de RAM.
    REMARQUE : L’environnement de programmation est Python 3.8, et l’environnement de programmation dépend du framework PyTorch (version 1.12.1) et de Torchvision (version 0.13.1) pour implémenter l’apprentissage profond.
  2. Téléchargez et installez des bibliothèques telles que scikit-learn (version 1.0.2), contenant l’utilitaire d’apprentissage automatique, et NumPy (version 1.21.0), contenant des opérations numériques.
  3. Assurez-vous d’installer la version 11.3 et la version 8.2 du CUDNN Toolkit fournies par NVIDIA Corporation afin d’être en mesure d’utiliser l’accélération de la carte graphique.
  4. Entraînez et évaluez les performances à l’aide des ensembles de données disponibles publiquement sur les Airchange OSCD et SZTAKI.

3. Préparation de l’ensemble de données

  1. Sélectionnez OSCD4, composé d’images aériennes satellites RGB optiques et d’images multispectrales, chacune de 600 x 600 pixels avec une résolution de 10 m, ainsi que le jeu de données SZTAKIAirChange 32 , composé de 13 paires d’images aériennes optiques, chacune de 952 x 640 pixels avec une résolution de 1,5 m/pixel comme jeux de données de référence.
  2. Partitionner les 24 villes de l’ensemble de données OSCD en 14 villes fixes et prédéfinies pour la formation et 10 villes pour les tests.
  3. Attribuer des paires d’images fixes non aléatoires Szada/1 et Tiszadob/3 du jeu de données SZTAKI AirChange à l’ensemble de test, et les paires d’images restantes comme ensemble d’entraînement comme benchmark conventionnel.
  4. Effectuer la détection de changements sur l’ensemble de test et quantifier la performance sur une seule exécution en utilisant des paires d’images annotées de chaque jeu de données.

4. Prétraitement

  1. Appliquez un prétraitement basé sur les correctifs.
    1. Extraire les patchs d’image indépendamment par image temporelle à des emplacements identiques à la volée pour gérer efficacement les images satellites haute résolution.
    2. Divisez chaque image en zones superposées de 128 × 128 pixels en utilisant une foulée de 64 pixels.
    3. Aligner les régions qui se chevauchent entre les zones adjacentes afin de maintenir la cohérence des bords et de conserver les informations sur les arêtes.
  2. Effectuez une augmentation des données par classe.
    1. Appliquez une augmentation différentielle pendant l’entraînement sur les deux patches de la paire en fonction de la proportion de pixels de changement pour gérer le déséquilibre de classe entre les régions « changement » et « sans changement ».
    2. Augmentez six fois la paire de patchs de changement (celles avec > 1 % de pixels de changement) en utilisant les transformations suivantes : basculements horizontaux et verticaux, rotations de 90°, jitter de couleur (luminosité, contraste et saturation ± 30 %), transformations affines (rotation ± 15°, translation ± 10 pixels, mise à l’échelle 95-105 %).
    3. Augmentez la paire de patchs sans changement une seule fois pour éviter un déséquilibre de jeu de données.
      REMARQUE : Cette stratégie d’augmentation, basée sur les classes, offre un entraînement équilibré dans les régions de changement et de non-changement.
  3. Normaliser et améliorer la qualité de l’image.
    1. Normalisez tous les patches en utilisant la moyenne et l’écart-type d’ImageNet : Moyenne = (0,485, 0,456, 0,406), Std = (0,229, 0,224, 0,225).
      1. Utilisez l’égalisation adaptative limitée par contraste (CLAHE) avec limite de clip = 2,0, taille de grille de tuiles = 8 x 8, dans l’espace colorimétrique LAB (canal L uniquement) pour éclaircir les contrastes des zones à faible contraste afin que les caractéristiques puissent être distinguées sur l’image, avec des intensités normalisées à [0,255].
      2. Effacez les patchs plus petits que 128 x 128 pixels et remplissez les patchs plus petits afin qu’ils soient de la même taille que les patchs plus grands et conservent leur intégrité spatiale lors de l’entraînement du modèle.

5. Construction du modèle

  1. Définissez l’entrée et la sortie.
    1. Le cadre proposé prend en entrée une paire d’images satellites co-enregistrées I1, I2 R H×W×C acquises à différents instants temporels et produit une carte de changement binaire M ∈ RH×W× 2 qui délimite avec précision les régions modifiées et non modifiées.
  2. Cadre proposé
    1. Traiter le cadre proposé en trois étapes de pipeline de traitement. Lors de la première étape, effectuez une modélisation de l’attention temporelle sur les séquences d’entrée pour capturer les changements au fil du temps.
    2. Utilisez l’attention croisée interactive pour capturer les dépendances temporelles symétriques entre les caractéristiques bitemporelles à l’étape de modélisation de l’attention temporelle.
    3. Extraire des représentations hiérarchiques des caractéristiques pertinentes à partir d’une image modélisée temporellement en utilisant une architecture d’encodeur basée sur des caractéristiques clairsemée à la deuxième étape, où la résolution spatiale diminue progressivement tandis que la dimension des caractéristiques augmente.
    4. Utilisez un décodeur skip-connected avec un upsampling adaptatif pour produire des cartes de changement haute résolution lors de la phase de reconstruction, tout en conservant les détails spatiaux à plus petite échelle.
      REMARQUE : La figure 1 montre le flux global de données des images satellites bi-temporelles d’entrée vers l’encodeur partagé, les blocs de traitement à attention croisée du milieu et le décodeur, ce qui aboutit ensemble à la carte de détection des changements.
  3. Encodeur de caractéristiques clairsemé
    1. Construire un encodeur léger construit à partir de blocs convolutionnels Ghost avec un ratio = 2, avec une normalisation par lots et une fonction d’activation ReLU appliquées séquentiellement pour réduire la complexité de calcul tout en maintenant la qualité de la représentation.
    2. Assemblez l’encodeur séquentiellement à partir des trois types de blocs suivants.
      Bloc1 : Ghost (in_channels → 32) → BN ReLU → Ghost (32 → 64) → BN ReLU MaxPool (2×2)
      Bloc2 : Ghost (64 → 96) → BN ReLU Ghost (96 → 128) → BN ReLU MaxPool (2×2)
      Bloc3 : Ghost (128 → 128) → BN ReLU
    3. Reliez les blocs pour maintenir un flux de caractéristiques fluide à travers l’encodeur et préserver la résolution spatiale pour les étapes suivantes.
      REMARQUE : L’innovation centrale de cette approche réside dans le mécanisme interactif d’attention croisée qui permet l’interaction symétrique des caractéristiques entre des images bi-temporelles. Pour chaque paire d’images, les traits profonds F1,F 2R B×C×H'×W' sont extraits où H' = H/4, W' = W/4, C=128 représente la dimension des caractéristiques. Ces caractéristiques spatiales sont remodelées selon un format figure-protocol-1 de séquence représentant la longueur de la séquence spatiale, et D=C représente la dimension des caractéristiques.
  4. Modélisation de l’attention temporelle
    1. Implémentez l’opération d’attention croisée en utilisant la formulation standard à échelle de l’attention par produit scalaire comme illustré à la Figure 2
      figure-protocol-2
      où Q, K et V représentent respectivement les matrices de requête, de clé et de valeurs, et dk désigne la dimension des vecteurs clés.
      REMARQUE : L’attention à plusieurs têtes avec h = 8 têtes pour capturer simultanément différents types de relations temporelles est employée indépendamment à chaque échelle. Chaque tête d’attention traite un sous-espace différent des représentations des caractéristiques, permettant au modèle de se concentrer sur divers aspects des changements temporels.
    2. Calculer la sortie d’attention multi-têtes comme suit :
      Multitête (Q,K,V) = Concat (tête 1,...,tête h ) WO
      où chacune figure-protocol-3 est apprise par des matrices de projection.
  5. Attention interactive symétrique
    1. La stratégie d’attention interactive capture l’information symétrique de changement par des opérations d’avant et de retour (illustrées à la Figure 3). L’attention directe permet aux caractéristiques de la première image temporelle de s’occuper des caractéristiques de la seconde image temporelle, calculées comme :
      figure-protocol-4
      où les premières caractéristiques temporelles servent de requêtes tandis que les secondes caractéristiques temporelles fournissent des clés et des valeurs.
    2. Inversement, l’attention à rebours permet aux traits de la seconde image temporelle de s’occuper des traits de la première image temporelle, formulés comme suit :
      figure-protocol-5
      Les caractéristiques attendues des deux directions sont concaténées et projetées via une transformation linéaire pour produire la représentation attendue finale :
      figure-protocol-6
      REMARQUE : Ce mécanisme interactif garantit que les relations temporelles sont capturées de façon symétrique, rendant le réseau invariant par rapport à l’ordre des images d’entrée, ce qui est crucial pour les applications de détection de changements où la séquence temporelle ne doit pas biaiser les résultats de détection.
  6. Décodeur et reconstruction de la carte de changement
    1. Fusionner les caractéristiques attendues avec les sorties de l’encodeur via des connexions à saut pour conserver les détails spatiaux.
    2. Appliquer une interpolation bilinéaire avec des paramètres identiques sur toutes les étapes du décodeur pour un redimensionnement adaptatif afin d’assurer un alignement parfait entre les connexions de saut.
    3. Au premier étage, réduire les canaux de 256 à 96 pixels via des convolutions fantômes à H/4×W/4, et suréchantillonner à H/2×W/2 et fusionner avec les fonctions d’encodeur correspondantes.
    4. À la deuxième étape, les fonctionnalités avec convolutions Ghost permettent de réduire les canaux de 160 à 64 pixels, d’upsampler à la résolution complète H×W et de s’intégrer aux fonctions de saut au niveau encodeur.
    5. Enfin, appliquez des convolutions Ghost pour réduire les canaux à 32 et utilisez une convolution finale 1 × 1 pour générer la carte de changement binaire à deux canaux.
    6. Résumez l’ensemble du pipeline de traitement à travers le cadre algorithmique suivant, qui intègre tous les composants architecturaux dans un système cohérent de détection des changements.
      REMARQUE : Notation : Eki désigne les caractéristiques de l’encodeur de l’image i ∈ {1,2} au niveau k ; Fi est la dernière caractéristique encodée ; figure-protocol-7 est sa version aplatie ;figure-protocol-8 est la caractéristique d’attention renforcée ; A est la matrice d’attention ; Dj sont les sorties décodeurs ; φk,ψ j sont des blocs encodeur/décodeur ; [·;·] désigne la concaténation canal par canal ; Wout est le noyau de la couche de sortie.
      Voir l’algorithme de fichier supplémentaire 1 pour la « détection de modifications basée sur la fusion interactive à l’attention multi-échelle

figure-protocol-9
Figure 1 : Méthodologie proposée Veuillez cliquer ici pour voir une version agrandie de cette figure.

figure-protocol-10
Figure 2 : Architecture à attention croisée Veuillez cliquer ici pour voir une version agrandie de cette figure.

figure-protocol-11
Figure 3 : Architecture interactive à attention croisée Veuillez cliquer ici pour voir une version agrandie de cette figure.

6. Procédure d’entraînement

  1. Fonction de perte
    REMARQUE : Le processus d’entraînement utilise une fonction de perte focale de Tversky pour corriger le déséquilibre de classe couramment rencontré dans les jeux de données de détection de changement.
    1. Formulons la fonction de perte comme suit : Soit pi ∈ [0,1] la probabilité prédite pour le pixel i, et gi ∊ {0,1} la vérité fondamentale correspondante. L’indice de Tversky (TI) est défini comme suit :
      figure-protocol-12
      où α et β contrôlent respectivement la pénalité pour les faux positifs et les faux négatifs, et ε est un terme de lissage.
    2. Exprimez alors la perte focale de Tversky comme suit :
      figure-protocol-13
      avec γ modulant la mise au point sur des pixels difficiles à classer.
  2. Configuration des hyperparamètres
    1. Appliquez une recherche systématique en grille basée sur la validation croisée à 5 reprises sur l’ensemble du train pour sélectionner les valeurs optimales.
    2. Fixez les coefficients de pondération des pertes pour la tâche de détection de changement à α = 0,3, β = 0,7, γ = 1,0, et ε = 1,0. Ces valeurs mettent l’accent sur la minimisation des détections manquées plutôt que des faux positifs, ce qui est important pour les ensembles de données déséquilibrés où les changements sont relativement rares.
      REMARQUE : Le poids asymétrique avec β > α se concentre sur le rappel, ce qui signifie que les faux négatifs sont pondérés plus que les faux positifs, et est cohérent avec la conception, en particulier dans les applications de surveillance des catastrophes.
  3. Optimiseur et stratégie d’apprentissage
    1. Utiliser l’optimiseur AdamW avec une décroissance de poids de 1×10⁻⁴ pour améliorer la régularisation et éviter le sur-ajustement.
    2. Initialiser le taux d’apprentissage à 1×10⁻³ et appliquer un calendrier de recuit cosinus pour assurer une convergence fluide et stable pendant l’entraînement.
    3. Utilisez une taille de lot de 8 pour maintenir la compatibilité avec un environnement mémoire GPU de 4 Go.
  4. Programme d’entraînement
    1. Entraîner le modèle séparément sur OSCD, composé de 14 paires prédéfinies pour l’entraînement et 10 paires pour les tests, puis sur le jeu de données SZTAKI Airchange avec Szada/1 et Tiszabob/3 comme benchmarks standards du jeu de test.
    2. Divisez les paires d’entraînement en cinq parties, utilisez une seule comme jeu de validation à chaque itération, et poursuivez l’entraînement pendant un maximum de 100 époques.
    3. Surveillez la perte de validation à la fin de chaque pli et appliquez des critères d’arrêt précoce de 10 époques une fois la convergence stabilisée afin d’éviter le surapprentissage et de réduire les calculs inutiles.
    4. Sélectionnez les hyperparamètres en fonction de la meilleure performance moyenne de validation sur tous les plis.
    5. Effectuez la détection de modifications sur l’ensemble de test et quantifiez la performance sur une seule exécution à l’aide de paires d’images annotées de chaque jeu de données.
  5. Optimisation de la mémoire
    1. Activez le point de contrôle gradient pour réduire l’utilisation de la mémoire GPU d’environ 40 %, réalisée en recalculant les activations intermédiaires lors du passage en arrière.
    2. Permettre un entraînement en précision mixte pour utiliser les opérations FP16 où la stabilité numérique est stable, améliorant ainsi la vitesse et réduisant la charge mémoire.
    3. Utilisez une mise à l’échelle adaptative de la taille des lots pour ajuster dynamiquement l’utilisation de la mémoire afin d’optimiser l’efficacité du GPU.

7. Évaluation

  1. Veillez à ce qu’aucun correctif provenant des villes de test ne soit inclus dans la formation ou la validation pour éviter toute fuite de données.
  2. Organisez les patches d’image et les cartes de vérité du sol correspondantes pour une évaluation par lots.
  3. Chargez les poids entraînés du modèle à partir de l’époque la mieux performante déterminée par la perte de validation.
  4. Sélectionnez un seuil de 0,5 pour convertir les cartes de probabilité en cartes de changement binaires.
  5. Calculer des métriques d’évaluation pixel par pixel pour mesurer la performance de détectionde changement 10
    Précision (P) : Fraction des pixels de changement prédits qui sont de vrais pixels de changement.
    Rappel (R) : Fraction des pixels de changement réel correctement détectée.
    Note F1 : Moyenne harmonique de la précision et du rappel.
  6. Produire un patch d’image en temps réel tout en entraînant et en évaluant des modèles de dimensions de 128 x 128 pixels et une foulée de 64 pixels.
    REMARQUE : Cette génération dynamique garantit l’efficacité de la mémoire ainsi que la cohérence des frontières.
  7. Vérifiez la justesse du prétraitement et du placement des patchs en examinant un échantillon représentatif des patches créés intelligibles, ou des images de caractéristiques de niveau intermédiaire.
    REMARQUE : Les représentations de caractéristiques encodées générées par l’encodeur basé sur CNN sont stockées en mémoire sous forme de tenseurs à utiliser ultérieurement dans les étapes, qui servent de points de contrôle lors de la vérification des caractéristiques. Les cartes de modifications produites sont stockées sous forme de fichiers image classiques (e.g. PNG ou TIFF) pour être visualisées afin d’évaluer les modifications identifiées.
  8. Enregistrez les indicateurs de convergence (courbes de perte, métriques de précision) lors de l’entraînement du modèle, et vérifiez si les points du modèle sont sauvegardés à des intervalles spécifiés afin que l’ensemble du processus d’entraînement puisse être répété, affiné ou récupéré.
    REMARQUE : Une présentation explicite du format de sortie, des étapes de vérification et des détails du point de contrôle aide à garantir la transparence, permettant la vérification d’être effectuée étape par étape et permettant également la reproduction et la validation du protocole par d’autres chercheurs. Ce protocole propose un flux de travail approfondi et détaillé sur la manière de préparer un jeu de données et de procéder à la phase de prétraitement, à la construction du réseau, à la formation et à l’évaluation. En suivant les étapes, on pourra implémenter la méthode proposée dans les conditions spécifiées de manière répétable. Les résultats d’une telle procédure sont donnés dans la section suivante des Résultats.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La méthode de détection des changements proposée a été évaluée selon des approches de référence établies à l’aide de deux ensembles de données de référence accessibles publiquement afin d’évaluer ses performances à travers différentes résolutions spectrales et conditions environnementales. Les résultats expérimentaux révèlent des améliorations significatives dans l’équilibre entre la précision de la détection et le contrôle des faux positifs, démontrant notamment la capacité de la méthod...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un réseau interactif de détection de changement basé sur la fusion de l’attention à plusieurs échelles pour détecter les modifications des images satellites bi-temporelles. L’intégration d’un mécanisme d’attention bidirectionnel, contrairement aux méthodes unidirectionnelles, facilite une interaction complète intertemporelle entre caractéristiques avec des signaux d’attention complémentaires avant et arrière. Les changements temporels progressifs du flux d’attention ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun conflit d’intérêts.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette recherche n’a reçu aucune subvention spécifique d’une agence de financement dans les secteurs public, commercial ou à but non lucratif.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Boîte à outils CUDANVIDIA CorporationVersion 11.3Accélération GPU pour les calculs d’apprentissage profond
cuDNNNVIDIA CorporationVersion 8.2Bibliothèque d’apprentissage profond GPU optimisée
Intel  ; ProcesseurIntel CorporationCore i7 10870HPlateforme computationnelle utilisée pour l’entraînement et l’évaluation du modèle d’apprentissage profond proposé
NumPyOpen SourceVersion 1.21.0Traitement numérique de tableaux
NVIDIA GeForce  ;NVIDIA CorporationGTX 1650 Ti (4 Go de VRAM)Unité de traitement graphique utilisée pour l’entraînement accéléré des modèles
Jeu de données Onera Satellite Change Detection (OSCD)ONERAEnsemble de données optiques RGB et multispectrales disponibles publiquement utilisé pour l’entraînement et l’évaluation.https://rcdaudt.github.io/oscd/
PythonFondation Python SoftwareVersion 3.8Langage de programmation utilisé pour l’implémentation d’algorithmes
PyTorchMeta AI (Open Source)Version 1.12.1Cadre d’apprentissage profond open source utilisé pour développer et entraîner le modèle proposé
Scikit-learnOpen SourceVersion 1.0.2Indicateurs d’évaluation de la performance
Jeu de données de référence SZTAKI AirChangeSZTAKIEnsemble de données d’images aériennes RGB optiques accessibles au public, utilisé pour l’entraînement et l’évaluation.http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
TorchvisionMeta AI (Open Source)Version 0.13.1Chargement des jeux de données et transformations d’images
Windows OSMicrosoft11Système d’exploitation   ;

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles