$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Ongekende niveaus van verstedelijking in het wereldwijde milieu, verlies van milieuhulpbronnen en veranderingen van het landschap door het klimaat hebben direct de noodzaak gewekt om een exact, tijdig en automatisch monitoringssysteem te bieden dat veranderingen op het aardoppervlak kan identificeren en meten. Satelliet-remote sensing is uitgegroeid tot de basisbouwsteen van massale milieubewaking, omdat ze consistente temporele en ruimtelijke dekking bieden en bovendien essentieel zijn voor het volledige onderzoek van de verandering. Bi-temporele detectie van satellietbeeldveranderingen is de karakterisering van oppervlakteveranderingen tussen twee opeenvolgende verwervingen van hetzelfde geografische gebied. Het is echter een ingewikkeld proces vanwege de talrijke verstorende variabelen, waaronder de variatie van de seizoenen, de weersomstandigheden, sensoreigenschappen, geometrische vervormingen en fenomenologische veranderingen die de werkelijke in landbedekking kunnen verhullen of lijken. De handmatige beeldinterpretatie van satellietbeelden die momenteel in gebruik zijn, is tijdrovend, subjectief en niet geschikt om om te gaan met de voortdurend groeiende hoeveelheden aardobservatie-informatie die door de huidige satellietconstellaties worden gegenereerd. Dit is de fundamentele beperking die heeft geleid tot de creatie van geautomatiseerde oplossingen voor wijzigingsdetectie. Conventionele pixel-gebaseerde1 - en objectgebaseerde veranderingsdetectiemethodenzijn doorgaans slecht geschikt om binnen deze complexiteiten te werken en hebben een lage robuustheidsstandaard die toepasbaar is op een groot scala aan geografische eenheden en temporele schalen. Deep learning-architecturen, met name convolutionele neurale netwerken en varianten, maken het mogelijk hiërarchische kenmerken te extraheren die laag-niveau spectrale details en hoog-niveau semantische patronen vertegenwoordigen die relevant zijn voor het onderscheiden van veranderingen. Deep learning veranderingsdetectiemodellen zijn zeer veelbelovend gebleken in het vastleggen van latente ruimtelijk-temporele veranderingen in remote sensing-data en bij het identificeren van de werkelijke landbedekking versus pseudo-veranderingen, veroorzaakt door externe factoren. Deze end-to-end leerbenaderingen maken gebruik van het feit dat kenmerken kunnen worden geëxtraheerd en classificatie optimaal tegelijk kan worden uitgevoerd. Ondanks aanzienlijke vooruitgang in de nauwkeurigheid van veranderingsdetectie blijven de meeste bestaande benaderingen moeilijk toe te passen in operationele omgevingen in de echte wereld. Transformator-gebaseerde benaderingen3, hoewel efficiënt in de globale context, hebben een hoog aantal parameters, kwadratische computationele complexiteit, inferentielatentie en een hoog energieverbruik. Siamese CNN-gebaseerde architecturen daarentegen zijn superieur in efficiëntie, maar hebben kleine receptieve velden en missen grotendeels globale contextuele modellering, wat de prestaties aanzienlijk verslechtert. Deze beperkingen worden verder verergerd in grootschalige en hulpbronnenbeperkte omgevingen, waar schaalbaarheid en operationele kosten cruciale overwegingen zijn. Schaalbaarheid, energie-efficiëntie en de snelheid waarmee conclusies worden getrokken zijn vaak van vitaal belang in een noodsituatie, en er is behoefte aan oplossingen die prestaties en inzetbaarheid in balans brengen. Daarom blijft er een kloof bestaan tussen nauwkeurigheidgerichte computationeel intensieve modellen en de praktische vereisten van implementatie in de praktijk.
Om dergelijke problemen te overwinnen, wordt een Interactive Multiscale Attention Fusion (IMAF) met Sparse Feature Convolution (SFC) Network voorgesteld, dat zich richt op het ontwerpen van een efficiënt en inzetbaar veranderingsdetectiekader in plaats van alleen nauwkeurigheidsoptimalisatie. De voorgestelde oplossing richt zich op optische satellietbeeldparen, meestal RGB- of hoogresolutie multispectrale beelden (resolutie 0,5-30 m), die worden verworven door satellieten, bijvoorbeeld Landsat, Sentinel-2 of WorldView. De techniek veronderstelt precieze geometrische co-registratie van bi-temporele paren, omdat registratiefouten ook een aanzienlijk effect kunnen hebben op detectie. Het houdt zich bezig met binaire veranderingsdetectie (in tegenstelling tot multi-klasse semantische verandering) en kan geen onderscheid maken tussen verschillende veranderingstypen. Meer nog, de methode gebruikt radiometrisch gecorrigeerde beelden om de effecten van seizoensgebonden, atmosferische en verlichtingsveranderingen te verminderen, die zouden worden aangezien voor verandering in landbedekking. In tegenstelling tot de traditionele Siamese CNNs4, die bitemporele beelden scheiden met behulp van een eenvoudige concatenatie, maakt de voorgestelde IMAF-module multiscale contextuele fusie van zowel globale als lokale kenmerken mogelijk. Recente transformer-gebaseerde benaderingen, zoals BIT5 en ChangeFormer3, leveren zeer goede resultaten op, maar hun zelf-aandacht mechanismen hebben de O(N2) complexiteit. Het voorgestelde kader vangt subtiele veranderingen met bidirectionele aandacht vast, waardoor de computationele complexiteit en inferentievertraging worden verminderd. Daarnaast is het voorgestelde ontwerp sparsity-aware, wat superieur is aan dichte multiscale fusieontwerpen zoals UNet++6,7 en SNUNet8. De spaarzame feature-convolutie met de ghost module vermindert FLOPs met ongeveer 50%, waardoor de representatiekwaliteit behouden blijft. Het voorgestelde kader geeft dus de voorkeur aan een nauwkeurigheid-efficiëntie afweging voor betrouwbare inzet in omgevingen met beperkte middelen.
De belangrijkste bijdragen van deze studie zijn: (i) Een lichtgewicht veranderingsdetector die een concurrerende F1-score behaalt met 19 keer minder parameters vergeleken met transformator-gebaseerde tegenhangers. (ii) Een Interactieve Multiscale Attention Fusion-module die globale contextuele informatie verkrijgt zonder de kwadratische rekenkosten van de traditionele zelf-aandachtmechanismen. (iii) Een convolutieschema met feature-sparsiteit gebaseerd op Ghosts-modules, dat de floating-point-operaties met 49,4 procent minimaliseert zonder kwaliteitsverlies in de feature-representatie. (iv) Uitgebreide experimentele validatie op een grote set benchmarkdatasets, met betere efficiëntie-nauwkeurigheidsafwegingen en redelijke praktische toepassing in de praktijk.
De rest van dit manuscript bestaat uit de volgende secties: Sectie 2 geeft een uitgebreid overzicht van het recente werk op het gebied van binaire veranderingsdetectiemethodologieën, met speciale aandacht voor deep learning-oplossingen en hun implementatie op standaardbenchmarks. Sectie 3 geeft de theoretische achtergrond en het structurele ontwerp van de voorgestelde oplossing, de wiskundige weergave van het temporele fusiemechanisme en de aandachtselementen, de kenmerken van de experimentele opstelling, datasets, evaluatiemetrieken en implementatiedetails die nodig zijn om reproduceerbaar onderzoek te produceren. Sectie 4 illustreert gedetailleerde experimentele bevindingen die ablatie omvatten, vergelijkingen met de nieuwste algoritmen voor binaire veranderingsdetectie die de capaciteit in verschillende geografische gebieden in de OSCD- en SZTAKI-luchtveranderingsdatasets verklaren. Sectie 5 bepaalt de uitkomst van bevindingen, de beperkingen van een huidige aanpak en de mogelijkheden voor toekomstig onderzoek naar veranderingsdetectie.
De ontwikkeling van veranderingsdetectie-algoritmen in remote sensing is sterk veranderd van pixelgebaseerde methoden naar deep learning-frameworks. Vroege veranderingsdetectieprocedures waren voornamelijk gebaseerd op algebraïsche processen zoals beelddifferentiëring, beeldrationering en veranderingsvectoranalyse, die direct werkten op pixelwaarden om temporele veranderingente detecteren 9,10. Alternatieve methoden waarbij post-classificatie vergelijking werd toegepast, waarbij elk temporeel beeld onafhankelijk werd geclassificeerd en vervolgens werd vergeleken met kruis-tabulatie11. Objectgebaseerde veranderingsdetectietechnieken vormden een belangrijke stap in vooruitgang met de introductie van ruimtelijke context en het beperken van pixel-niveau ruis 2,12.
De opkomst van deep learning-technieken heeft de wereld van remote sensing change detection gerevolutioneerd en de weg vrijgemaakt voor het overwinnen van verschillende beperkingen in traditionele technieken. Recentelijk zijn Convolution Neural Networks (CNN's) de standaardarchitectuur geworden voor geautomatiseerde feature-extractie en wijzigingsclassificatie13,14. Siamese NestedUNet for Change Detection14 en Siamese Swin-Unet15 zijn uitgegroeid tot een belangrijke innovatie dankzij de dicht verbonden Siamese netwerktopologie, die helpt om informatie over lokalisatie effectief te behouden binnen de hiërarchie van het netwerk.
Het probleem van bitemporele veranderingsdetectie in hoogresolutie optische remote sensing is nog steeds moeilijk op te lossen vanwege diverse verstorende factoren, en de op aandacht gebaseerde multischaaltransformatornetwerken met de uitgebreide kenmerken fusiestrategieën zijn voorgesteld16. Het EGMT-CD-raamwerk stelde randgeleide multimodale transformatoren van heterogene beeldparen voor, waarbij homologe beelden niet toegankelijk zijn vanwege wolkenbedekking17. Architecturen zoals DASUNet doorbreken handmatige deep learning-bottlenecks in de full-scale feature fusion, met 0,85% hogere verbetering van de F1-index ten opzichte van SNUNet-24 op de CDD-dataset met verbeterde gradient flow18. Hybride CNN-Transformer-modellen pakken het probleem van valse negatieven tegen hogere kosten aan door een extra on-cost te bieden op de frequentiecomponenten voor feature learning19. De hybride U-vormige transformatornetwerken20 zijn echter nog steeds moeilijk om lokaal en globale kenmerken te integreren en veranderingen te bieden in regio's die periodiek voorkomen, zelfs op kleine schaal. Het gebruik van multitask-detectie van semantische veranderingen en nauwkeurige locatie- en klasse-identificatie is ingewikkelder dan binaire taken21,22. Bitemporele correlaties kunnen met succes worden gemodelleerd door cross-attention zonder significante architecturale veranderingen14,23. De uitdrukking van het perspectief-taalparadigma is ook een recent vooruitgangspunt met CLIP-gebaseerde ontwerpen die tekstuele verklaringen combineren in veranderingscorrespondentie24 en semi-supervised patronen, waardoor de afhankelijkheid van gelabelde datawordt geëlimineerd. Change Mamba presenteert de toestandsruimtemodellen van ruimtelijk-temporele modellen26,27. Verschillende toepassingen van gespecialiseerde aandachtsmethoden worden gedemonstreerd: het gebruik van hyperspectrale anomaliedetectie28, multiarea target classificatie29 of limited-label segmentatie30, en toont de flexibiliteit van aandachtsmechanismen in remote sensing-analyse.
| Auteurs | Methode/Architectuur | Technische specificaties | Belangrijke innovatie & bevindingen / datasetprestaties |
| Singh, A. [8] | Traditionele methoden | Pixelgebaseerde differentie, CVA | Digitaal wijzigingsdetectieframework, meerdere datasets, nauwkeurigheid: 65-80% |
| Mas, J.F. [10] | Na de classificatie | Onafhankelijke temporele classificatie | Analyse van vergelijkende methodologie, tropische beeldvorming, OA: 72-85% |
| Lu et al. [9] | Traditionele methoden | Algebraïsche bewerkingen, CVA, PCA | Uitgebreide techniekvergelijking, meerdere bronnen, nauwkeurigheid: 70-88% |
| Benedek & Szirányi [23] | Gemengd Markov-model | Meerlaags conditioneel kader | Probabilistische veranderingsmodellering, Sztaki AirChange, DA: 92,1% |
| Blaschke, T. [2] | Objectgebaseerd | Analyse op basis van segmentatie | Integratie van ruimtelijke context, diverse HR-beelden, SA: 85-92% |
| Chen et al. [11] | Objectgebaseerd | Multi-schaal segmentatie | Hiërarchische objectanalyse, HR-beelden, OA: 87,3% |
| Zhan et al. [12] | Siamese CNN | 5-laag CNN, kernelgrootte 3×3 | Diepe siameesarchitectuur voor CD, luchtfoto's, F1: 0,847, IoU: 0,735 |
| Daudt et al. [4] | Siamese FCN | FC-EF, FC-Siam-diff, FC-Siam-conc | Vroege/late fusiestrategieën, OSCD, F1: 0,431, IoU: 0,276 |
| Peng et al. [26] | UNet++ | Geneste U-Net, dichte skipverbindingen | Multi-scale feature aggregatie, HR-satelliet, F1: 0,753, IoU: 0,604 |
| Chen & Shi [25] | Ruimtelijk-temporele aandacht | Aandachtsblokken, temporele modellering | Ruimtelijk-temporeel feature-leren, LEVIR-CD, F1: 0,887, IoU: 0,797 |
| Fang et al. [7] | SNUNet-CD | Siamese NestedUNet, dichte verbindingen | Optimalisatie van informatieoverdracht, LEVIR: F1: 0,897, WHU: F1: 0,904 |
| Chen et al. [5] | BIT-CD | ResNet18 + transformatorencoder | Binair temporeel kenmerkleren, OSCD: F1: 0,635, LEVIR: F1: 0,919 |
| Bandara & Patel [3] | ChangeFormer | Hiërarchische transformatorencoder | Multi-schaal transformator aandacht, OSCD: F1: 0,654, LEVIR: F1: 0,905 |
| Song et al. [27] | ACANet | Axiale aandacht + CNN-ruggengraat | Efficiënte aandachtsberekening, LEVIR: F1: 0,901, WHU: F1: 0,913 |
| Shi et al. [28] | Reviewartikel | Uitgebreide AI-methoden enquête | Systematische analyse van AI-benaderingen, 50+ datasets geanalyseerd |
| Li et al. [14] | AMST-Net | Multiscale transformator, piramide aandacht | Adaptieve multiscale feature-extractie, HR optische beelden, mIoU: 0,823 |
| Xiang et al. [15] | EGMT-CD | Edge-geleide multimodale architectuur | Cross-modale feature-uitlijning, heterogene paren, F1: 0,756 |
| Miao et al. [16] | DASUNet | Dichte supervisie, fullscale fusie | Diepe supervisie op alle decoderniveaus, CDD: 0,85% F1-verbetering ten opzichte van SNUNet |
| Tang et al. [29] | Siamese Swin-UNet | Swin Transformer + Unet fusie | Hiërarchische vensteraandacht, LEVIR: F1: 0,923, WHU: F1: 0,925 |
| Wu et al. [18] | Hybride U-transformator | UNet++ backbone + transformatorblokken | Global-local feature-integratie, HR-afbeeldingen, IoU: 0,851, F1: 0,919 |
| Dong et al. [20] | ChangeCLIP | CLIP-gebaseerde visie-taal | Multimodaal semantisch begrip, RS-paren, semantische nauwkeurigheid: 94,1% |
| Li et al. [21] | SemiCD-VL | Semi-supervised visionlanguage | Verminderde annotatievereisten, beperkte labels, F1: 0,889 |
| Chen et al. [22] | ChangeMamba | Toestandsruimtemodellen (SSM's) | Lineaire complexiteit temporele modellering, RS-afbeeldingen, efficiëntie: 3x sneller |
Tabel 1: Samenvatting van veranderingsdetectiemethoden in Remote Sensing Klik hier om deze tabel te downloaden.
Een samenvatting van eerdere studies wordt gepresenteerd in Tabel 1. Traditionele methoden hebben handgemaakte functies die niet geschikt zijn voor complexe ruimtelijk-temporele variaties31, en deep learning-architectuur (UNet, FPN, PSPNet) omvat rekenkrachtig dure dichte convoluties. De huidige modellen beschikken niet over efficiënte multiscale incorporatie en dynamische aandachtsystemen. Om deze hiaten op te vullen, stelt de huidige studie Interactive Multi-scale Attention Fusion met Sparse Feature Convolution Network voor, dat tot doel heeft subtiele veranderingen over schalen te vangen en tegelijkertijd computationeel efficiënt te zijn in remote sensing, met name bij stedelijke en door de mens veroorzaakte structurele veranderingen.