$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Des niveaux sans précédent d’urbanisation dans l’environnement mondial, la perte de ressources environnementales et les modifications du paysage dues au climat ont directement déclenché la nécessité de fournir un système de surveillance précis, rapide et automatique capable d’identifier et de mesurer les changements à la surface de la Terre. La télédétection par satellite est devenue la base de la surveillance environnementale de masse, car elle assure une couverture temporelle et spatiale cohérente, en plus d’être essentielle à l’examen complet de ce changement. La détection des changements par imagerie satellite bi-temporelle est la caractérisation des changements de surface entre deux acquisitions séquentielles d’une même région géographique. C’est un processus complexe, cependant, en raison des nombreuses variables de confusion, notamment la variation des saisons, les conditions météorologiques, les propriétés des capteurs, les distorsions géométriques et les altérations phénoménologiques qui peuvent obscurcir ou ressembler au réel dans la couverture du sol. L’interprétation manuelle des images satellites actuellement utilisées est longue, subjective et inadaptée à la gestion des quantités croissantes d’informations d’observation de la Terre générées par les constellations satellites actuelles. C’est la limitation fondamentale qui a conduit à la création de solutions automatisées de détection des changements. Les méthodes conventionnelles basées surle pixel 1 et la détection de changement basée surl’objet 2 ont tendance à être mal adaptées pour fonctionner dans les limites de ces complexités et ont un faible standard de robustesse à appliquer à une large gamme d’unités géographiques et d’échelles temporelles. Les architectures d’apprentissage profond, en particulier les réseaux de neurones convolutionnels et leurs variantes, permettent l’extraction de caractéristiques hiérarchiques représentant des détails spectraux de bas niveau et des motifs sémantiques de haut niveau pertinents pour distinguer les changements. Les modèles de détection des changements par apprentissage profond se sont révélés très prometteurs pour capturer les changements spatio-temporels latents dans les données de télédétection, et pour identifier la véritable couverture terrestre versus les pseudo-changements, introduits par des facteurs extérieurs. Ces approches d’apprentissage de bout en bout tirent parti du fait que les caractéristiques peuvent être extraites et que la classification peut être effectuée de manière optimale en même temps. Malgré des progrès substantiels en matière de précision de détection des changements, la plupart des approches existantes restent difficiles à déployer dans des environnements opérationnels réels. Les approchesbasées sur transformateurs 3, bien qu’efficaces dans un contexte global, présentent un nombre élevé de paramètres, une complexité computationnelle quadratique, une latence d’inférence et une consommation d’énergie élevée. Les architectures siamoises basées sur CNN, en revanche, sont supérieures en efficacité, mais possèdent de petits champs récepteurs et manquent en grande partie de modélisation contextuelle globale, ce qui détériore significativement les performances. Ces contraintes sont encore exacerbées dans les environnements à grande échelle et limités en ressources, où la scalabilité et le coût opérationnel sont des considérations critiques. La scalabilité, l’efficacité énergétique et la rapidité avec laquelle les inférences sont faites sont souvent essentielles dans un contexte d’intervention d’urgence, et il est nécessaire de créer des solutions qui équilibrent performance et facilité de déploiement. Par conséquent, un fossé subsiste entre les modèles axés sur la précision, intensifs en calcul, et les exigences pratiques du déploiement réel.
Pour surmonter ces problèmes, une fusion interactive de l’attention multiscale (IMAF) avec réseau de convolution de fonctionnalités parcies (SFC) est proposée, qui se concentre sur la conception d’un cadre de détection de changement efficace et déployable, plutôt que sur l’optimisation de la précision seule. La solution proposée se concentre sur des paires d’images satellites optiques, généralement des images RVB ou multispectrales haute résolution (résolution 0,5-30 m), acquises par des satellites, par exemple Landsat, Sentinel-2 ou WorldView. La technique suppose une co-enregistrement géométrique précise des paires bi-temporelles, car les erreurs d’enregistrement peuvent également avoir un effet considérable sur la détection. Il traite de la détection binaire des changements (par opposition aux changements sémantiques multiclasses) et ne peut pas distinguer les différents types de changements. Plus encore, la méthode utilise des images corrigées radiométriquement pour réduire les effets des changements saisonniers, atmosphériques et d’éclairage, qui seraient confondus avec des changements de couverture terrestre. Contrairement aux CNN siamoistraditionnels 4 qui séparent les images bi-temporelles à l’aide d’une simple concaténation, le module IMAF proposé permet une fusion contextuelle multi-échelle de caractéristiques globales et locales. Les approches récentes basées sur les transformateurs, telles que BIT5 etChangeFormer 3, donnent de très bons résultats, mais leurs mécanismes d’auto-attention ont la complexité O(N2). Le cadre proposé capte les changements subtils avec une attention bidirectionnelle, réduisant la complexité computationnelle et la latence d’inférence. De plus, la conception proposée est consciente de la parcimonie, ce qui est supérieur aux conceptions de fusion multiéchelle dense telles que UNet++6,7 et SNUNet8. La convolution de caractéristiques clairsemées avec le module fantôme réduit les FLOP d’environ 50 %, préservant la qualité de la représentation. Ainsi, le cadre proposé privilégie un compromis précision-efficacité pour un déploiement fiable sur des environnements à ressources limitées.
Les principales contributions de cette étude sont : (i) Un détecteur de changement léger qui atteint un score F1 compétitif en utilisant 19 fois moins de paramètres que ses homologues basés sur transformateurs. (ii) Un module de fusion interactive de l’attention multiscale qui obtient des informations contextuelles globales sans le coût computationnel quadratique des mécanismes traditionnels d’auto-attention. (iii) Un schéma de convolution avec la parcimonie des caractéristiques basé sur les modules Ghosts, qui minimise les opérations en virgule flottante de 49,4 % sans dégradation de la qualité dans la représentation des caractéristiques. (iv) Une validation expérimentale étendue sur un large ensemble de jeux de données de référence, avec de meilleurs compromis entre efficacité et précision et une réalisabilité raisonnable de l’application réelle dans le monde réel.
Le reste de ce manuscrit comprend les sections suivantes : La section 2 offre un aperçu approfondi des travaux récents dans le domaine des méthodologies de détection des changements binaires, avec une attention particulière portée aux solutions d’apprentissage profond et à leur mise en œuvre sur des benchmarks standards. La section 3 donne le contexte théorique et la conception structurelle de la solution proposée, la représentation mathématique du mécanisme de fusion temporelle et des éléments d’attention, les caractéristiques de la configuration expérimentale, les jeux de données, les métriques d’évaluation et les détails de mise en œuvre nécessaires à la production de recherches reproductibles. La section 4 illustre des résultats expérimentaux détaillés comprenant l’ablation, des comparaisons avec les derniers algorithmes de détection des changements binaires qui expliquent la capacité dans diverses zones géographiques dans les ensembles de données Airchange de l’OSCD et du SZTAKI. La Section 5 détermine les résultats des résultats, les limites d’une approche actuelle et les possibilités de recherches futures en matière de détection du changement.
Le développement des algorithmes de détection des changements en télédétection a été grandement modifié, passant des méthodes basées sur des pixels aux cadres d’apprentissage profond. Les procédures précoces de détection des changements étaient principalement basées sur des processus algébriques tels que la différenciation d’images, le rationnement d’image et l’analyse des vecteurs de changement, qui travaillaient directement sur les valeurs de pixels pour détecter les changements temporels 9,10. Des méthodes alternatives impliquant la comparaison post-classification ont été développées, dans lesquelles chaque image temporelle était classifiée indépendamment puis comparée par un tableaucroisé 11. Les techniques de détection des changements basées sur les objets ont représenté une étape importante du progrès avec l’introduction du contexte spatial ainsi que la réduction du bruit au niveau despixels 2,12.
L’avènement des techniques d’apprentissage profond a révolutionné le domaine de la détection des changements en télédétection et a ouvert la voie à la surmontation de plusieurs contraintes des techniques traditionnelles. Récemment, les réseaux neuronaux à convolution (CNN) sont devenus l’architecture standard pour l’extraction automatisée des caractéristiques et la classificationdes modifications 13,14. Siamese NestedUNet for ChangeDetection 14 et Siamois Swin-Unet15 se sont imposés comme une innovation significative grâce à une topologie de réseau siamoise densément connectée, qui aide à conserver efficacement les informations de localisation à travers la hiérarchie du réseau.
Le problème de la détection des changements bi-temporels dans la télédétection optique haute résolution reste difficile à résoudre en raison de divers facteurs de confusion, et les réseaux de transformateurs multi-échelle basés sur l’attention avec des stratégies de fusion complexes ont étéproposés 16. Le cadre EGMT-CD proposait des transformateurs multimodaux guidés par arêtes de paires d’images hétérogènes, où les images homologues ne sont pas accessibles en raison de la couverturenuageuse 17. Des architectures comme DASUNet brisent les goulots d’étranglement manuels en apprentissage profond grâce à la fusion de fonctionnalités à grande échelle, avec une amélioration de l’indice F1 supérieure de 0,85 % par rapport à SNUNet-24 sur le jeu de données CDD grâce à un flux gradientamélioré 18. Les modèles hybrides CNN-Transformateur traitent le problème des faux négatifs à un coût plus élevé en fournissant un coût supplémentaire sur les composantes de fréquence à l’apprentissagedes caractéristiques 19. Les réseaux hybrides detransformateurs en forme de U 20, cependant, restent difficiles à assurer l’intégration des caractéristiques local-globale et des changements dans les régions qui surviennent périodiquement, même à petite échelle. L’utilisation de la détection de changements sémantiques multitâches, ainsi que l’identification précise de localisation et de classe, est plus complexe comparée aux tâches binaires21,22. Les corrélations bi-temporelles peuvent être modélisées avec succès par l’attention croisée sans changements architecturauxsignificatifs 14,23. L’expression paradigmique du langage en perspective est également une frontière récente avec des conceptions basées sur CLIP, combinant des explications textuelles en correspondance de changement24 et des motifs semi-supervisés, éliminant ainsi la dépendance aux donnéesétiquetées 25. Change Mamba présente les modèles d’espace d’états des modèles spatio-temporels26,27. Différentes applications de méthodes spécialisées d’attention sont démontrées : abordant l’utilisation de la détection d’anomalieshyperspectrales 28, de la classification multi-zonesde cibles 29 ou de la segmentation à l’étiquettelimitée 30, et la démonstration de la flexibilité des mécanismes d’attention dans l’analyse de la télédétection.
| Auteurs | Méthode/Architecture | Spécifications techniques | Innovation clé et résultats / Performance des ensembles de données |
| Singh, A. [8] | Méthodes traditionnelles | Différenciation basée sur les pixels, CVA | Cadre de détection des changements numériques, Ensembles de données multiples, Précision : 65-80 % |
| Mas, J.F. [10] | Après le classement | Classification temporelle indépendante | Analyse méthodologique comparative, Imagerie tropicale, OA : 72-85 % |
| Lu et al. [9] | Méthodes traditionnelles | Opérations algébriques, AVC, ACP | Comparaison complète des techniques, sources multiples, précision : 70-88 % |
| Benedek & Szirányi [23] | Modèle de Markov mixte | Cadre conditionnel multicouche | Modélisation probabiliste du changement, Sztaki AirChange, DA : 92,1 % |
| Blaschke, T. [2] | Basé sur des objets | Analyse basée sur la segmentation | Intégration du contexte spatial, diverses images de fréquence cardiaque, SA : 85-92 % |
| Chen et al. [11] | Basé sur des objets | Segmentation multi-échelle | Analyse hiérarchique des objets, imagerie HR, OA : 87,3 % |
| Zhan et al. [12] | CNN siamoise | CNN à 5 couches, taille du noyau 3×3 | Architecture siamoise profonde pour CD, images aériennes, F1 : 0,847, IoU : 0,735 |
| Daudt et al. [4] | FCN siamois | FC-EF, FC-Siam-diff, FC-Siam-conc | Stratégies de fusion précoce/tardive, OSCD, F1 : 0,431, IoU : 0,276 |
| Peng et al. [26] | UNet++ | U-Net imbriqué, connexions à saut dense | Agrégation de caractéristiques à plusieurs échelles, satellite HR, F1 : 0,753, IoU : 0,604 |
| Chen & Shi [25] | Attention spatiale-temporelle | Blocs d’attention, modélisation temporelle | Apprentissage des caractéristiques spatio-temporelle, LEVIR-CD, F1 : 0,887, IoU : 0,797 |
| Fang et al. [7] | SNUNet-CD | Siamois NestedUNet, connexions denses | Optimisation de la transmission de l’information, LEVIR : F1 : 0,897, WHU : F1 : 0,904 |
| Chen et al. [5] | BIT-CD | ResNet18 + encodeur transformateur | Apprentissage binaire des caractéristiques temporelles, OSCD : F1 : 0,635, LEVIR : F1 : 0,919 |
| Bandara & Patel [3] | ChangeAncien | Encodeur de transformateur hiérarchique | Attention des transformateurs à plusieurs échelles, OSCD : F1 : 0,654, LEVIR : F1 : 0,905 |
| Song et al. [27] | ACANet | Attention axiale + colonne vertébrale CNN | Calcul efficace de l’attention, LEVIR : F1 : 0,901, WHU : F1 : 0,913 |
| Shi et al. [28] | Mémoire de synthèse | Enquête complète sur les méthodes d’IA | Analyse systématique des approches d’IA, 50+ jeux de données analysés |
| Li et al. [14] | AMST-Net | Transformateur multi-échelle, attention pyramidale | Extraction adaptative multiéchelle des caractéristiques, images optiques HR, mIoU : 0,823 |
| Xiang et al. [15] | EGMT-CD | Architecture multimodale guidée par les bords | Alignement des caractéristiques intermodales, paires hétérogènes, F1 : 0,756 |
| Miao et al. [16] | DASUNet | Supervision dense, fusion à grande échelle | Supervision approfondie à tous les niveaux de décodeur, CDD : amélioration de 0,85 % de F1 par rapport à SNUNet |
| Tang et al. [29] | Swin-UNet siamois | Fusion Transformateur Swin + Unet | Attention hiérarchique de la fenêtre, LEVIR : F1 : 0,923, WHU : F1 : 0,925 |
| Wu et al. [18] | Transformateur en U hybride | Backbone UNet++ + blocs transformateurs | Intégration des fonctionnalités global-locale, images HR, IoU : 0,851, F1 : 0,919 |
| Dong et al. [20] | ChangeCLIP | Langage visuel basé sur CLIP | Compréhension sémantique multimodale, paires RS, précision sémantique : 94,1 % |
| Li et al. [21] | SemiCD-VL | Langage visionnel semi-supervisé | Exigences d’annotation réduites, étiquettes limitées, F1 : 0,889 |
| Chen et al. [22] | ChangeMamba | Modèles d’espace d’état (SSM) | Modélisation temporelle de complexité linéaire, images RS, efficacité : 3 fois plus rapide |
Tableau 1 : Résumé des méthodes de détection des changements en télédétection Veuillez cliquer ici pour télécharger ce tableau.
Un résumé des études antérieures est présenté dans le tableau 1. Les méthodes traditionnelles possèdent des fonctionnalités artisanales qui ne conviennent pas aux variations spatiales et temporellescomplexes 31, et l’architecture d’apprentissage profond (UNet, FPN, PSPNet) implique des convolutions denses coûteuses en calcul. Les modèles actuels ne disposent pas de systèmes d’intégration multi-échelle efficaces ni de systèmes d’attention dynamique. Pour combler ces lacunes, l’étude actuelle propose une fusion interactive de l’attention multi-échelle avec réseau de convolution de caractéristiques clairsemées, qui vise à capturer les changements subtils à travers les échelles tout en étant efficace en télédétection, notamment sur les changements urbains et structurels d’origine humaine.