Method Article

Interactieve multiscale aandachtfusie met spaarzame feature convolutienetwerk voor detectie van satellietbeeldveranderingen

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie presenteert een interactief multischaal aandachtfusiemodel met Sparse Feature Convolution Networks om de detectie van satellietbeeldveranderingen te verbeteren. De aanpak maakt gebruik van multiscale feature-extractie, de selectieve focus op aandacht en spaarzame convoluties om effectief verandering in bitemporele satellietbeelden te detecteren en te lokaliseren door de computationele complexiteit te verminderen.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Veranderingsdetectie met behulp van bitemporele satellietbeelden is een belangrijk probleem in aardmonitoring dat gericht is op het identificeren en lokaliseren van oppervlakteveranderingen tussen een temporele ontdekking en het onderscheiden van daadwerkelijke pseudo-veranderingen door seizoenscycli, atmosferische factoren of door mensen veroorzaakte ontwikkelingen. Huidige deep learning-methoden ondervinden doorgaans een eenrichtingsbias in hun temporele modellering, wat de bruikbaarheid van grootschalige ruimtelijke relaties beperkt om de juiste karakterisering van veranderpatronen mogelijk te maken. Hoewel recente transformatorgebaseerde technieken zeer nauwkeurig zijn, zijn hun rekenkundige eisen ook vrij groot, waardoor hun gebruik bij taken met beperkte middelen wordt beperkt. Als reactie op deze beperkingen wordt in dit artikel een Interactive Multiscale Attention Fusion (IMAF) netwerk met Sparse Feature Convolution (SFC) op basis van Ghost-modules voorgesteld om effectieve multi-scale features extraction te bereiken. Het netwerk maakt gebruik van geavanceerde encoder-decoder architectuur, aangevuld met interactieve aandachtsmodules op verschillende schaalen. Het netwerk werkt met complementaire voorwaartse en achterwaartse aandachtsstromen: de eerste registreert progressieve temporele variatie en de tweede verifieert een consistentie van de veranderingen door omgekeerde temporele analyse. Deze interactieve methode maakt effectieve weergaven van het duplexmodel van temporele relaties mogelijk zonder computationeel prohibitief te zijn, wat veel betere benaderingen verbetert om legitieme landbedekkingsbewegingen te onderscheiden van ruis zonder ruis-geïnduceerde variatie. Er worden geëxperimenteerd met twee benchmarkdatasets: de Onera Satellite Change Detection dataset (OSCD) en de SZTAKI AirChange-datasets. De belangrijke experimenten op OSCD-datasets tonen aan dat de voorgestelde aanpak concurrerende F1-percentages behaalt van 58,14% (13 kanalen) en 50,68% (3 kanalen) met slechts 2,13M parameters en 19,6G FLOPS, 19 keer zo weinig parameters en 5,6x inferentieomzet vergeleken met ChangeFormer. Competitieve prestaties op Szada/1 en Tiszadob/3 testsetmonsters van de SZTAKI-dataset, met een F1-score van respectievelijk 74,29% en 92,86%, maken het mogelijk om realtime analyses en uitgebreide kaartsystemen te implementeren in de meest edge-apparaten waarbij operationele energie direct afhankelijk is van rekenkracht.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ongekende niveaus van verstedelijking in het wereldwijde milieu, verlies van milieuhulpbronnen en veranderingen van het landschap door het klimaat hebben direct de noodzaak gewekt om een exact, tijdig en automatisch monitoringssysteem te bieden dat veranderingen op het aardoppervlak kan identificeren en meten. Satelliet-remote sensing is uitgegroeid tot de basisbouwsteen van massale milieubewaking, omdat ze consistente temporele en ruimtelijke dekking bieden en bovendien essentieel zijn voor het volledige onderzoek van de verandering. Bi-temporele detectie van satellietbeeldveranderingen is de karakterisering van oppervlakteveranderingen tussen twee opeenvolgende verwervingen van hetzelfde geografische gebied. Het is echter een ingewikkeld proces vanwege de talrijke verstorende variabelen, waaronder de variatie van de seizoenen, de weersomstandigheden, sensoreigenschappen, geometrische vervormingen en fenomenologische veranderingen die de werkelijke in landbedekking kunnen verhullen of lijken. De handmatige beeldinterpretatie van satellietbeelden die momenteel in gebruik zijn, is tijdrovend, subjectief en niet geschikt om om te gaan met de voortdurend groeiende hoeveelheden aardobservatie-informatie die door de huidige satellietconstellaties worden gegenereerd. Dit is de fundamentele beperking die heeft geleid tot de creatie van geautomatiseerde oplossingen voor wijzigingsdetectie. Conventionele pixel-gebaseerde1 - en objectgebaseerde veranderingsdetectiemethodenzijn doorgaans slecht geschikt om binnen deze complexiteiten te werken en hebben een lage robuustheidsstandaard die toepasbaar is op een groot scala aan geografische eenheden en temporele schalen. Deep learning-architecturen, met name convolutionele neurale netwerken en varianten, maken het mogelijk hiërarchische kenmerken te extraheren die laag-niveau spectrale details en hoog-niveau semantische patronen vertegenwoordigen die relevant zijn voor het onderscheiden van veranderingen. Deep learning veranderingsdetectiemodellen zijn zeer veelbelovend gebleken in het vastleggen van latente ruimtelijk-temporele veranderingen in remote sensing-data en bij het identificeren van de werkelijke landbedekking versus pseudo-veranderingen, veroorzaakt door externe factoren. Deze end-to-end leerbenaderingen maken gebruik van het feit dat kenmerken kunnen worden geëxtraheerd en classificatie optimaal tegelijk kan worden uitgevoerd. Ondanks aanzienlijke vooruitgang in de nauwkeurigheid van veranderingsdetectie blijven de meeste bestaande benaderingen moeilijk toe te passen in operationele omgevingen in de echte wereld. Transformator-gebaseerde benaderingen3, hoewel efficiënt in de globale context, hebben een hoog aantal parameters, kwadratische computationele complexiteit, inferentielatentie en een hoog energieverbruik. Siamese CNN-gebaseerde architecturen daarentegen zijn superieur in efficiëntie, maar hebben kleine receptieve velden en missen grotendeels globale contextuele modellering, wat de prestaties aanzienlijk verslechtert. Deze beperkingen worden verder verergerd in grootschalige en hulpbronnenbeperkte omgevingen, waar schaalbaarheid en operationele kosten cruciale overwegingen zijn. Schaalbaarheid, energie-efficiëntie en de snelheid waarmee conclusies worden getrokken zijn vaak van vitaal belang in een noodsituatie, en er is behoefte aan oplossingen die prestaties en inzetbaarheid in balans brengen. Daarom blijft er een kloof bestaan tussen nauwkeurigheidgerichte computationeel intensieve modellen en de praktische vereisten van implementatie in de praktijk.

Om dergelijke problemen te overwinnen, wordt een Interactive Multiscale Attention Fusion (IMAF) met Sparse Feature Convolution (SFC) Network voorgesteld, dat zich richt op het ontwerpen van een efficiënt en inzetbaar veranderingsdetectiekader in plaats van alleen nauwkeurigheidsoptimalisatie. De voorgestelde oplossing richt zich op optische satellietbeeldparen, meestal RGB- of hoogresolutie multispectrale beelden (resolutie 0,5-30 m), die worden verworven door satellieten, bijvoorbeeld Landsat, Sentinel-2 of WorldView. De techniek veronderstelt precieze geometrische co-registratie van bi-temporele paren, omdat registratiefouten ook een aanzienlijk effect kunnen hebben op detectie. Het houdt zich bezig met binaire veranderingsdetectie (in tegenstelling tot multi-klasse semantische verandering) en kan geen onderscheid maken tussen verschillende veranderingstypen. Meer nog, de methode gebruikt radiometrisch gecorrigeerde beelden om de effecten van seizoensgebonden, atmosferische en verlichtingsveranderingen te verminderen, die zouden worden aangezien voor verandering in landbedekking. In tegenstelling tot de traditionele Siamese CNNs4, die bitemporele beelden scheiden met behulp van een eenvoudige concatenatie, maakt de voorgestelde IMAF-module multiscale contextuele fusie van zowel globale als lokale kenmerken mogelijk. Recente transformer-gebaseerde benaderingen, zoals BIT5 en ChangeFormer3, leveren zeer goede resultaten op, maar hun zelf-aandacht mechanismen hebben de O(N2) complexiteit. Het voorgestelde kader vangt subtiele veranderingen met bidirectionele aandacht vast, waardoor de computationele complexiteit en inferentievertraging worden verminderd. Daarnaast is het voorgestelde ontwerp sparsity-aware, wat superieur is aan dichte multiscale fusieontwerpen zoals UNet++6,7 en SNUNet8. De spaarzame feature-convolutie met de ghost module vermindert FLOPs met ongeveer 50%, waardoor de representatiekwaliteit behouden blijft. Het voorgestelde kader geeft dus de voorkeur aan een nauwkeurigheid-efficiëntie afweging voor betrouwbare inzet in omgevingen met beperkte middelen.

De belangrijkste bijdragen van deze studie zijn: (i) Een lichtgewicht veranderingsdetector die een concurrerende F1-score behaalt met 19 keer minder parameters vergeleken met transformator-gebaseerde tegenhangers. (ii) Een Interactieve Multiscale Attention Fusion-module die globale contextuele informatie verkrijgt zonder de kwadratische rekenkosten van de traditionele zelf-aandachtmechanismen. (iii) Een convolutieschema met feature-sparsiteit gebaseerd op Ghosts-modules, dat de floating-point-operaties met 49,4 procent minimaliseert zonder kwaliteitsverlies in de feature-representatie. (iv) Uitgebreide experimentele validatie op een grote set benchmarkdatasets, met betere efficiëntie-nauwkeurigheidsafwegingen en redelijke praktische toepassing in de praktijk.

De rest van dit manuscript bestaat uit de volgende secties: Sectie 2 geeft een uitgebreid overzicht van het recente werk op het gebied van binaire veranderingsdetectiemethodologieën, met speciale aandacht voor deep learning-oplossingen en hun implementatie op standaardbenchmarks. Sectie 3 geeft de theoretische achtergrond en het structurele ontwerp van de voorgestelde oplossing, de wiskundige weergave van het temporele fusiemechanisme en de aandachtselementen, de kenmerken van de experimentele opstelling, datasets, evaluatiemetrieken en implementatiedetails die nodig zijn om reproduceerbaar onderzoek te produceren. Sectie 4 illustreert gedetailleerde experimentele bevindingen die ablatie omvatten, vergelijkingen met de nieuwste algoritmen voor binaire veranderingsdetectie die de capaciteit in verschillende geografische gebieden in de OSCD- en SZTAKI-luchtveranderingsdatasets verklaren. Sectie 5 bepaalt de uitkomst van bevindingen, de beperkingen van een huidige aanpak en de mogelijkheden voor toekomstig onderzoek naar veranderingsdetectie.

De ontwikkeling van veranderingsdetectie-algoritmen in remote sensing is sterk veranderd van pixelgebaseerde methoden naar deep learning-frameworks. Vroege veranderingsdetectieprocedures waren voornamelijk gebaseerd op algebraïsche processen zoals beelddifferentiëring, beeldrationering en veranderingsvectoranalyse, die direct werkten op pixelwaarden om temporele veranderingente detecteren 9,10. Alternatieve methoden waarbij post-classificatie vergelijking werd toegepast, waarbij elk temporeel beeld onafhankelijk werd geclassificeerd en vervolgens werd vergeleken met kruis-tabulatie11. Objectgebaseerde veranderingsdetectietechnieken vormden een belangrijke stap in vooruitgang met de introductie van ruimtelijke context en het beperken van pixel-niveau ruis 2,12.

De opkomst van deep learning-technieken heeft de wereld van remote sensing change detection gerevolutioneerd en de weg vrijgemaakt voor het overwinnen van verschillende beperkingen in traditionele technieken. Recentelijk zijn Convolution Neural Networks (CNN's) de standaardarchitectuur geworden voor geautomatiseerde feature-extractie en wijzigingsclassificatie13,14. Siamese NestedUNet for Change Detection14 en Siamese Swin-Unet15 zijn uitgegroeid tot een belangrijke innovatie dankzij de dicht verbonden Siamese netwerktopologie, die helpt om informatie over lokalisatie effectief te behouden binnen de hiërarchie van het netwerk.

Het probleem van bitemporele veranderingsdetectie in hoogresolutie optische remote sensing is nog steeds moeilijk op te lossen vanwege diverse verstorende factoren, en de op aandacht gebaseerde multischaaltransformatornetwerken met de uitgebreide kenmerken fusiestrategieën zijn voorgesteld16. Het EGMT-CD-raamwerk stelde randgeleide multimodale transformatoren van heterogene beeldparen voor, waarbij homologe beelden niet toegankelijk zijn vanwege wolkenbedekking17. Architecturen zoals DASUNet doorbreken handmatige deep learning-bottlenecks in de full-scale feature fusion, met 0,85% hogere verbetering van de F1-index ten opzichte van SNUNet-24 op de CDD-dataset met verbeterde gradient flow18. Hybride CNN-Transformer-modellen pakken het probleem van valse negatieven tegen hogere kosten aan door een extra on-cost te bieden op de frequentiecomponenten voor feature learning19. De hybride U-vormige transformatornetwerken20 zijn echter nog steeds moeilijk om lokaal en globale kenmerken te integreren en veranderingen te bieden in regio's die periodiek voorkomen, zelfs op kleine schaal. Het gebruik van multitask-detectie van semantische veranderingen en nauwkeurige locatie- en klasse-identificatie is ingewikkelder dan binaire taken21,22. Bitemporele correlaties kunnen met succes worden gemodelleerd door cross-attention zonder significante architecturale veranderingen14,23. De uitdrukking van het perspectief-taalparadigma is ook een recent vooruitgangspunt met CLIP-gebaseerde ontwerpen die tekstuele verklaringen combineren in veranderingscorrespondentie24 en semi-supervised patronen, waardoor de afhankelijkheid van gelabelde datawordt geëlimineerd. Change Mamba presenteert de toestandsruimtemodellen van ruimtelijk-temporele modellen26,27. Verschillende toepassingen van gespecialiseerde aandachtsmethoden worden gedemonstreerd: het gebruik van hyperspectrale anomaliedetectie28, multiarea target classificatie29 of limited-label segmentatie30, en toont de flexibiliteit van aandachtsmechanismen in remote sensing-analyse.

AuteursMethode/ArchitectuurTechnische specificatiesBelangrijke innovatie & bevindingen / datasetprestaties
Singh, A. [8]Traditionele methodenPixelgebaseerde differentie, CVADigitaal wijzigingsdetectieframework, meerdere datasets, nauwkeurigheid: 65-80%
Mas, J.F. [10]Na de classificatieOnafhankelijke temporele classificatieAnalyse van vergelijkende methodologie, tropische beeldvorming, OA: 72-85%
Lu et al. [9]Traditionele methodenAlgebraïsche bewerkingen, CVA, PCAUitgebreide techniekvergelijking, meerdere bronnen, nauwkeurigheid: 70-88%
Benedek & Szirányi [23]Gemengd Markov-modelMeerlaags conditioneel kaderProbabilistische veranderingsmodellering, Sztaki AirChange, DA: 92,1%
Blaschke, T. [2]ObjectgebaseerdAnalyse op basis van segmentatieIntegratie van ruimtelijke context, diverse HR-beelden, SA: 85-92%
Chen et al. [11]ObjectgebaseerdMulti-schaal segmentatieHiërarchische objectanalyse, HR-beelden, OA: 87,3%
Zhan et al. [12]Siamese CNN5-laag CNN, kernelgrootte 3×3Diepe siameesarchitectuur voor CD, luchtfoto's, F1: 0,847, IoU: 0,735
Daudt et al. [4]Siamese FCNFC-EF, FC-Siam-diff, FC-Siam-concVroege/late fusiestrategieën, OSCD, F1: 0,431, IoU: 0,276
Peng et al. [26]UNet++Geneste U-Net, dichte skipverbindingenMulti-scale feature aggregatie, HR-satelliet, F1: 0,753, IoU: 0,604
Chen & Shi [25]Ruimtelijk-temporele aandachtAandachtsblokken, temporele modelleringRuimtelijk-temporeel feature-leren, LEVIR-CD, F1: 0,887, IoU: 0,797
Fang et al. [7]SNUNet-CDSiamese NestedUNet, dichte verbindingenOptimalisatie van informatieoverdracht, LEVIR: F1: 0,897, WHU: F1: 0,904
Chen et al. [5]BIT-CDResNet18 + transformatorencoderBinair temporeel kenmerkleren, OSCD: F1: 0,635, LEVIR: F1: 0,919
Bandara & Patel [3]ChangeFormerHiërarchische transformatorencoderMulti-schaal transformator aandacht, OSCD: F1: 0,654, LEVIR: F1: 0,905
Song et al. [27]ACANetAxiale aandacht + CNN-ruggengraatEfficiënte aandachtsberekening, LEVIR: F1: 0,901, WHU: F1: 0,913
Shi et al. [28]ReviewartikelUitgebreide AI-methoden enquêteSystematische analyse van AI-benaderingen, 50+ datasets geanalyseerd
Li et al. [14]AMST-NetMultiscale transformator, piramide aandachtAdaptieve multiscale feature-extractie, HR optische beelden, mIoU: 0,823
Xiang et al. [15]EGMT-CDEdge-geleide multimodale architectuurCross-modale feature-uitlijning, heterogene paren, F1: 0,756
Miao et al. [16]DASUNetDichte supervisie, fullscale fusieDiepe supervisie op alle decoderniveaus, CDD: 0,85% F1-verbetering ten opzichte van SNUNet
Tang et al. [29]Siamese Swin-UNetSwin Transformer + Unet fusieHiërarchische vensteraandacht, LEVIR: F1: 0,923, WHU: F1: 0,925
Wu et al. [18]Hybride U-transformatorUNet++ backbone + transformatorblokkenGlobal-local feature-integratie, HR-afbeeldingen, IoU: 0,851, F1: 0,919
Dong et al. [20]ChangeCLIPCLIP-gebaseerde visie-taalMultimodaal semantisch begrip, RS-paren, semantische nauwkeurigheid: 94,1%
Li et al. [21]SemiCD-VLSemi-supervised visionlanguageVerminderde annotatievereisten, beperkte labels, F1: 0,889
Chen et al. [22]ChangeMambaToestandsruimtemodellen (SSM's)Lineaire complexiteit temporele modellering, RS-afbeeldingen, efficiëntie: 3x sneller

Tabel 1: Samenvatting van veranderingsdetectiemethoden in Remote Sensing Klik hier om deze tabel te downloaden.

Een samenvatting van eerdere studies wordt gepresenteerd in Tabel 1. Traditionele methoden hebben handgemaakte functies die niet geschikt zijn voor complexe ruimtelijk-temporele variaties31, en deep learning-architectuur (UNet, FPN, PSPNet) omvat rekenkrachtig dure dichte convoluties. De huidige modellen beschikken niet over efficiënte multiscale incorporatie en dynamische aandachtsystemen. Om deze hiaten op te vullen, stelt de huidige studie Interactive Multi-scale Attention Fusion met Sparse Feature Convolution Network voor, dat tot doel heeft subtiele veranderingen over schalen te vangen en tegelijkertijd computationeel efficiënt te zijn in remote sensing, met name bij stedelijke en door de mens veroorzaakte structurele veranderingen.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Ethische verklaring

  1. Zowel Onera Satellite Change Detection (OSCD) als SZTAKI AirChange-datasets die in deze studie zijn gebruikt, bestaan uit openbaar beschikbare RGB- en multispectrale beelden die diverse geografische kenmerken beslaan. Deze datasets bevatten geen beperkte of gevoelige gegevens. Daarom is voor dit werk geen ethische toestemming vereist.

2. Materialen en uitrusting

  1. Voer tests uit op een Windows 11-computer met een Intel Core i7 10870H-processor, een NVIDIA GeForce GTX 1650 Ti-chip met 4GB VRAM en 32GB RAM.
    OPMERKING: De programmeeromgeving is Python 3.8, en de programmeeromgeving is afhankelijk van het PyTorch-framework (versie 1.12.1) en Torchvision (versie 0.13.1) om deep learning te implementeren.
  2. Download en installeer bibliotheken zoals scikit-learn (versie 1.0.2), met machine learning-hulpprogramma, en NumPy (versie 1.21.0), met numerieke bewerkingen.
  3. Zorg ervoor dat je de CUDA Toolkit versie 11.3 en cuDNN versie 8.2 van NVIDIA Corporation installeert, zodat je de acceleratie van de grafische kaart kunt benutten.
  4. Train en evalueer prestaties met behulp van de openbaar beschikbare OSCD- en SZTAKI-luchtuitwisselingsdataset.

3. Datasetvoorbereiding

  1. Selecteer OSCD4, dat bestaat uit optische RGB-satellietluchtfoto's en multispectrale beelden, elk van 600 x 600 pixels met een resolutie van 10 m, en de SZTAKI AirChange32-dataset , die bestaat uit 13 optische luchtfotoparen, elk 952 x 640 pixels met een resolutie van 1,5 m/pixel als benchmarkdatasets.
  2. Verdeel de 24 steden van de OSCD-dataset in vaste, vooraf gedefinieerde 14 steden voor training en 10 steden voor testen.
  3. Wijs vaste niet-gerandomiseerde Szada/1- en Tiszadob/3-beeldparen uit de SZTAKI AirChange-dataset toe aan de testset en de overige beeldparen als trainingsset als conventionele benchmark.
  4. Voer wijzigingsdetectie uit op de testset en kwantificeer de prestaties bij één run met behulp van geannoteerde beeldparen uit elke dataset.

4. Preprocessing

  1. Pas patch-gebaseerde preprocessing toe.
    1. Haal beeldpatches onafhankelijk per temporele afbeelding op identieke locaties on-the-fly uit om satellietbeelden met hoge resolutie efficiënt te beheren.
    2. Verdeel elke afbeelding in overlappende stukken van 128 × 128 pixels met een stap van 64 pixels.
    3. Lijn overlappende gebieden tussen aangrenzende patches uit om grensconsistentie te behouden en randinformatie te behouden.
  2. Voer klasgewijze data-augmentatie uit.
    1. Pas differentiële augmentatie toe tijdens training op beide patches in het paar, gebaseerd op het aandeel veranderde pixels om klasse-onevenwicht tussen "verandering" en "geen verandering" regio's te verwerken.
    2. Versterk het patchpaar van verandering (die met > 1% pixelverandering) zes keer met behulp van de volgende transformaties: Horizontale en verticale flips, 90° rotaties, kleurjitter (helderheid, contrast en verzadiging ± 30%), affiene transformaties (rotatie ± 15°, translatie ± 10 pixels, schaal 95-105%).
    3. Vul het patchpaar zonder wijzigingen slechts één keer aan om een disbalans in de dataset te voorkomen.
      OPMERKING: Deze augmentatiestrategie, gebaseerd op lessen, biedt evenwichtige training in de veranderings- en no-change-regio's.
  3. Normaliseer en verbeter de beeldkwaliteit.
    1. Normaliseer alle patches met behulp van ImageNet-gemiddelde en standaarddeviatie: Gemiddelde = (0,485, 0,456, 0,406), Std = (0,229, 0,224, 0,225).
      1. Gebruik Contrast Limited Adaptive Histogram Equalization (CLAHE) met cliplimiet = 2,0, tegelroostergrootte =8 x 8, in LAB Color Space (alleen L Kanaal) om de contrasten van de gebieden met laag contrast op te helderen zodat de kenmerken op het beeld kunnen worden onderscheiden, met intensiteiten genormaliseerd op [0,255].
      2. Maak alle patches die kleiner zijn dan 128 x 128 pixels en vul de kleinere patches op zodat ze even groot zijn als de grotere patches en hun ruimtelijke integriteit behouden tijdens modeltraining.

5. Modelbouw

  1. Definieer input en output.
    1. Het voorgestelde raamwerk neemt als invoer een paar co-geregistreerde satellietbeelden I1, I2 ∈ RH×W×C die op verschillende temporele instanties zijn verkregen, en produceert een binaire veranderingskaart M ∈ RH×W×2 die veranderde en ongewijzigde regio's nauwkeurig afbakent.
  2. Voorgesteld raamwerk
    1. Verwerk het voorgestelde raamwerk in drie fasen van de verwerkingspijplijn. In de eerste fase voert u temporele aandachtsmodellering uit op invoersequenties om veranderingen in de loop van de tijd vast te leggen.
    2. Gebruik interactieve cross-attention om symmetrische temporele afhankelijkheden tussen bitemporele kenmerken vast te leggen in de temporele aandachtsmodelleerfase.
    3. Hiërarchische representaties van relevante kenmerken uit een temporeel gemodelleerd beeld met behulp van een spaarzame, feature-gebaseerde encoderarchitectuur in de tweede fase, waarbij de ruimtelijke resolutie geleidelijk afneemt terwijl de feature-dimensie toeneemt.
    4. Gebruik een skip-connected decoder met adaptieve upsampling om in de reconstructiefase hoge resolutie change maps te maken, terwijl lagere ruimtelijke details behouden blijven.
      OPMERKING: Figuur 1 toont de totale datastroom van invoer bi-temporele satellietbeelden naar de gedeelde encoder, middelste cross-attention verwerkingsblokken en decoder, die samen resulteren in de change detection map.
  3. Sparse feature encoder
    1. Bouw een lichtgewicht encoder gebouwd uit Ghost-convolutionele blokken met ratio=2 met batchnormalisatie en ReLU-activatiefunctie die sequentieel worden toegepast om de rekenkundige complexiteit te verminderen terwijl de representatiekwaliteit behouden blijft.
    2. Stel de encoder sequentieel samen uit de volgende drie typen blokken.
      Blok1: Ghost (in_channels → 32) → BN ReLU Ghost (32 → 64) → BN ReLU MaxPool(2×2)
      Blok2: Ghost (64 → 96) → BN ReLU Ghost (96 → 128) → BN ReLU MaxPool(2×2)
      Blok3: Ghost (128 → 128) → BN ReLU
    3. Verbind de blokken om een soepele featureflow door de encoder te behouden en de ruimtelijke resolutie voor volgende fasen te behouden.
      OPMERKING: De kerninnovatie van deze benadering ligt in het interactieve cross-attention-mechanisme dat symmetrische interactie tussen bitemporele beelden mogelijk maakt. Voor elk beeldpaar worden diepe kenmerken F1,F 2∈RB×C×H'×W' geëxtraheerd waarbij H' = H/4, W'=W/4, C=128 de kenmerkdimensie vertegenwoordigt. Deze ruimtelijke kenmerken worden hervormd tot een sequentieformaat figure-protocol-1 dat de ruimtelijke sequentielengte weergeeft, en D=C de kenmerkdimensie.
  4. Temporele aandachtsmodellering
    1. Implementeer cross-attention operatie met behulp van standaard geschaalde dot-product aandacht-formulering zoals geïllustreerd in Figuur 2
      figure-protocol-2
      waarbij Q, K en V respectievelijk query-, key- en waardematrices vertegenwoordigen, en dk de dimensie van sleutelvectoren aanduidt.
      OPMERKING: Multi-head attention met h = 8 koppen om verschillende typen temporele relaties gelijktijdig vast te leggen, wordt onafhankelijk toegepast op elke schaal. Elke aandachtskop verwerkt een andere subruimte van de feature-representaties, waardoor het model zich kan richten op verschillende aspecten van temporele veranderingen.
    2. Bereken de multi-head aandachtoutput als:
      MultiHead (Q,K,V) = Concat (kop1,...,koph ) WO
      waarbij elk figure-protocol-3 geleerde projectiematrices zijn.
  5. Symmetrische interactieve aandacht
    1. De interactieve aandachtstrategie vangt symmetrische veranderingsinformatie vast via voor- en achterwaartse operaties (weergegeven in Figuur 3). Voorovergerichte aandacht maakt het mogelijk dat kenmerken uit het eerste temporele beeld aandacht besteden aan kenmerken uit het tweede temporele beeld, berekend als:
      figure-protocol-4
      waarbij de eerste temporele kenmerken als queries dienen, terwijl de tweede temporele kenmerken sleutels en waarden leveren.
    2. Omgekeerd maakt achterwaartse aandacht het mogelijk dat kenmerken uit het tweede temporele beeld aandacht besteden aan kenmerken uit het eerste temporele beeld, geformuleerd als:
      figure-protocol-5
      De geattendeerde kenmerken uit beide richtingen worden samengevoegd en geprojecteerd via een lineaire transformatie om de uiteindelijke geattendeerde representatie te produceren:
      figure-protocol-6
      OPMERKING: Dit interactieve mechanisme zorgt ervoor dat temporele relaties symmetrisch worden vastgelegd, waardoor het netwerk invariant is ten opzichte van de volgorde van invoerbeelden, wat cruciaal is voor toepassingen van veranderingsdetectie waarbij de temporele sequentie de detectieresultaten niet mag beïnvloeden.
  6. Reconstructie van decoder en change maps
    1. Meng de bijgewonen features met de encoderuitgangen via skipverbindingen om ruimtelijke details te behouden.
    2. Pas bilineaire interpolatie toe met identieke parameters over alle decoderfasen voor adaptieve grootteaanpassing om perfecte uitlijning over skipverbindingen te garanderen.
    3. In de eerste fase verminder je kanalen van 256 naar 96 pixels via Ghost-convoluties bij H/4×W/4 en neem je een upsample naar H/2×W/2 en fuse met bijbehorende encoderfuncties.
    4. In de tweede fase worden functies verwerkt met Ghost-convoluties om kanalen te verkleinen van 160 naar 64 pixels en upsample naar volledige resolutie H×W en te integreren met encoder-niveau skipfuncties.
    5. Tot slot pas je Ghost-convoluties toe om kanalen terug te brengen tot 32 en gebruik je een laatste 1 × 1 convolutie om de tweekanaals binaire veranderingskaart te genereren.
    6. Vat de volledige verwerkingspijplijn samen via het volgende algoritmische raamwerk, dat alle architecturale componenten integreert in een samenhangend systeem voor veranderingsdetectie.
      OPMERKING: Notatie: Eki duidt encoderkenmerken aan uit afbeelding i ∈ {1,2} op niveau k; Fi is de laatste gecodeerde feature; figure-protocol-7 is de afgeplatte versie;figure-protocol-8 is de aandacht-versterkte functie; A is de aandachtmatrix; Dj zijn decoderuitgangen; φk,ψ j zijn encoder-/decoderblokken; [·;·] duidt kanaalgewijze concatenatie aan; Wout is de kernel van de outputlaag.
      Zie Aanvullende bestandsalgoritme 1 voor "Interactieve Multiscale Attention Fusion gebaseerde veranderingsdetectie

figure-protocol-9
Figuur 1: Voorgestelde methodologie Klik hier om een grotere versie van deze figuur te bekijken.

figure-protocol-10
Figuur 2: Cross Attention Architectuur Klik hier om een grotere versie van deze figuur te bekijken.

figure-protocol-11
Figuur 3: Interactieve Cross Attention Architectuur Klik hier om een grotere versie van deze figuur te bekijken.

6. Trainingsprocedure

  1. Verliesfunctie
    OPMERKING: Het trainingsproces maakt gebruik van een focale Tversky-verliesfunctie om de klasse-onbalans aan te pakken die vaak voorkomt in veranderingsdetectiedatasets.
    1. Formuleer de verliesfunctie als volgt: Laat pi ∈ [0,1] de voorspelde kans voor pixel i zijn, en gi ∊ {0,1} de overeenkomstige grondwaarheid. De Tversky-index (TI) wordt gedefinieerd als:
      figure-protocol-12
      waarbij α en β respectievelijk de straf voor vals-positieven en vals-negatief bepalen, en ε een gladmakende term is.
    2. Druk dan het focale Tversky-verlies uit als:
      figure-protocol-13
      waarbij γ de focus moduleert op moeilijk te classificeren pixels.
  2. Hyperparameterconfiguratie
    1. Pas een systematische rasterzoekopdracht op basis van 5-voudige kruisvalidatie toe op de treinset om optimale waarden te selecteren.
    2. Stel de gewichtscoëfficiënten voor de veranderingsdetectietaak in op α = 0,3, β = 0,7, γ = 1,0 en ε = 1,0. Deze waarden leggen de nadruk op het minimaliseren van gemiste detecties boven vals-positieven, wat belangrijk is voor onevenwichtige datasets waar wijzigingen relatief zeldzaam zijn.
      OPMERKING: Asymmetrisch gewicht met β > α richt zich op terugroepactie, wat betekent dat vals-negatieven zwaarder worden gewogen dan vals-positieven, en consistent is met het ontwerp, vooral bij rampenmonitoring.
  3. Optimizer en leerstrategie
    1. Gebruik de AdamW-optimizer met een gewichtsafname van 1×10⁻⁴ om de regularisatie te verbeteren en overfitting te voorkomen.
    2. Initialiseer de leersnelheid op 1×10⁻³ en pas een cosinus-annealingschema toe om een soepele en stabiele convergentie tijdens de training te garanderen.
    3. Gebruik een batchgrootte van 8 om compatibiliteit te behouden met een 4-GB GPU-geheugenomgeving.
  4. Trainingsschema
    1. Train het model apart op OSCD, bestaande uit 14 vooraf gedefinieerde paren voor training en 10 paren voor testen, daarna op de SZTAKI Airchange-dataset met Szada/1 en Tiszabob/3 als standaard testsetbenchmarks.
    2. Verdeel de trainingsparen in vijf vouwen, gebruik één vouw als validatieset in elke iteratie, en ga door met trainen maximaal 100 epochs.
    3. Monitor validatieverlies aan het einde van elke vouw en pas vroege stopcriteria van 10 epochs toe zodra de convergentie stabiliseert om overfitting te voorkomen en onnodige berekeningen te verminderen.
    4. Selecteer de hyperparameters op basis van de beste gemiddelde validatieprestatie over alle folds.
    5. Voer wijzigingsdetectie uit op de testset en kwantificeer de prestaties bij een enkele run met behulp van geannoteerde beeldparen uit elke dataset.
  5. Geheugenoptimalisatie
    1. Activeer gradient checkpointing om het GPU-geheugengebruik met ongeveer 40% te verlagen, wat wordt bereikt door tussenliggende activaties tijdens de achterwaartse pass opnieuw te berekenen.
    2. Mixed-precision training mogelijk maken om FP16-bewerkingen te gebruiken waar numeriek stabiel was, waardoor de snelheid verbetert en de geheugenbelasting wordt verminderd.
    3. Gebruik adaptieve batchgrootte-schaal om het geheugengebruik dynamisch aan te passen voor maximale GPU-efficiëntie.

7. Evaluatie

  1. Zorg ervoor dat er geen patches van teststeden zijn opgenomen in training of validatie om datalekken te voorkomen.
  2. Organiseer afbeeldingspatches en bijbehorende grondwaarheidskaarten voor batch-gewijze evaluatie.
  3. Laad de getrainde modelgewichten uit het best presterende epoch, bepaald door validatieverlies.
  4. Selecteer een drempel van 0,5 om kanskaarten om te zetten in binaire veranderingskaarten.
  5. Bereken pixelgewijze evaluatiemetrieken om de prestaties van veranderingsdetectie te meten10
    Precisie (P): Het percentage voorspelde veranderingspixels dat echte veranderingspixels zijn.
    Recall (R): Percentage van de werkelijke verandering-pixels correct gedetecteerd.
    F1-score: Harmonisch gemiddelde van precisie en herinnering.
  6. Maak een beeldpatch in realtime terwijl je modellen traint en evalueert met afmetingen van 128 x 128 pixels en een stap van 64 pixels.
    OPMERKING: Dergelijke dynamische generatie garandeert zowel geheugeneffectiviteit als consistentie van grenzen.
  7. Controleer de correctheid van preprocessing en patchplaatsing door een representatief voorbeeld te bekijken van de gemaakte patches, verstaanbare of middelniveau-featurebeelden.
    OPMERKING: Gecodeerde feature-representaties die door de CNN-gebaseerde encoder worden gegenereerd, worden in het geheugen opgeslagen in de vorm van tensoren die later in de fasen worden gebruikt en als checkpoints dienen bij het verifiëren van features. Geproduceerde wijzigingskaarten worden opgeslagen als reguliere afbeeldingsbestanden (e.g. PNG of TIFF) om visueel te worden bekeken om de geïdentificeerde wijzigingen te evalueren.
  8. Noteer de convergentie-indicatoren (verliescurves, nauwkeurigheidsmetrics) tijdens modeltraining en controleer of de punten van het model op bepaalde intervallen worden opgeslagen zodat het hele trainingsproces herhaald, verfijnd of hersteld kan worden.
    OPMERKING: Expliciete presentatie van het uitvoerformaat, verificatiestappen en checkpointdetails helpt bij transparantie, waardoor verificatie stap voor stap kan plaatsvinden en het protocol ook door andere onderzoekers kan worden gereproduceerd en gevalideerd. Dit protocol biedt een diepgaande, gedetailleerde workflow over hoe een dataset wordt voorbereid en doorgaat met de preprocessingfase, netwerkconstructie, training en evaluatie. Door de stappen te volgen, kan men de voorgestelde methode onder de gespecificeerde voorwaarden op een herhaalbare manier implementeren. De resultaten van zo'n procedure worden gegeven in de volgende sectie Resultaten.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De voorgestelde veranderingsdetectiemethode werd geëvalueerd aan de hand van gevestigde basisbenaderingen met behulp van twee publiek beschikbare benchmarkdatasets om de prestaties te beoordelen over verschillende spectrale resoluties en omgevingscondities. De experimentele resultaten tonen aanzienlijke verbeteringen in het balanceren van detectienauwkeurigheid met valse positieve controle, met name het vermogen van de methode om hoge terugroeppercentages te behouden terwijl de precisie ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie presenteert een interactief, multi-schaal aandacht, fusie-gebaseerd veranderingsdetectienetwerk voor het detecteren van veranderingen in bitemporele satellietbeelden. De integratie van een bidirectioneel aandachtsmechanisme, in tegenstelling tot unidirectionele methoden, faciliteert een volledige interactie tussen de tijd van kenmerk tot kenmerk met complementaire voorwaartse en achterwaartse aandachtsignalen. Progressieve temporele veranderingen van de voorwaartse aandachtss...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat zij geen belangenconflict hebben.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit onderzoek ontving geen specifieke subsidie van een financieringsinstantie in de publieke, commerciële of non-profitsector.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
CUDA ToolkitNVIDIA CorporationVersie 11.3GPU-versnelling voor deep learning berekeningen
cuDNNNVIDIA CorporationVersie 8.2Geoptimaliseerde GPU deep learning bibliotheek
Intel  processorIntel CorporationCore i7 10870HComputationele platform gebruikt voor het trainen en evalueren van het voorgestelde deep learning model
NumPyOpen SourceVersie 1.21.0Numerieke array verwerking
NVIDIA GeForce NVIDIA CorporationGTX 1650 Ti (4 GB VRAM)Grafische verwerkingseenheid gebruikt voor versnelde modeltraining
Onera Satellite Change Detection (OSCD) DatasetONERAPubliek beschikbare optische RGB en Multispectrale beelddataset gebruikt voor training en evaluatie.https://rcdaudt.github.io/oscd/
PythonPython Software FoundationVersie 3.8Programmeertaal gebruikt voor algoritme implementatie
PyTorchMeta AI (Open Source)Versie 1.12.1Open-source deep learning framework gebruikt om het voorgestelde model te ontwikkelen en te trainen
Scikit-learnOpen SourceVersie 1.0.2Prestatie-evaluatiemetrieken
SZTAKI AirChange Benchmark DatasetSZTAKIPubliek beschikbare optische RGB luchtbeelddataset gebruikt voor training en evaluatie.http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
TorchvisionMeta AI (Open Source)Versie 0.13.1Dataset laden en beeldtransformaties
Windows OSMicrosoft11Besturingssysteem 

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles