Method Article

Interaktywna wieloskalowa fuzja uwagi z rzadką siecią konwolucji cech do wykrywania zmian obrazów satelitarnych

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie przedstawia interaktywny model fuzji wieloskalowej uwagi z rzadkimi sieciami konwolucyjnymi cech, aby poprawić wykrywanie zmian na obrazach satelitarnych. Podejście wykorzystuje wieloskalową ekstrakcję cech, selektywne skupienie na uwadze oraz rzadkie konwolucje, aby skutecznie wykrywać i lokalizować zmiany w dwuczasowych obrazach satelitarnych poprzez zmniejszenie złożoności obliczeniowej.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Detekcja zmian za pomocą dwuczasowych obrazów satelitarnych jest ważnym problemem w monitoringu Ziemi, który ma na celu identyfikację i lokalizację zmian powierzchni pomiędzy pozyskaniem czasowym a rozróżnieniem rzeczywistych pseudo-zmian spowodowanych cyklami sezonowymi, czynnikami atmosferycznymi lub rozwojem wywołanym przez człowieka. Obecne metody głębokiego uczenia zazwyczaj napotykają jednokierunkowe uprzedzenie w modelowaniu czasowym, co ogranicza użyteczność dużych relacji przestrzennych, aby umożliwić właściwą charakterystykę wzorców zmian. Chociaż najnowsze techniki oparte na transformatorach są bardzo dokładne, ich wymagania obliczeniowe są również dość duże, co ogranicza ich zastosowanie do zadań o ograniczonych zasobach. W odpowiedzi na te ograniczenia w niniejszym artykule proponowano sieć Interaktywnej Fuzji Wieloskalowej Uwagi (IMAF) z rzadką konwolucją cech (SFC) opartą na modułach duchów, aby uzyskać efektywną ekstrakcję cech wieloskalowych. Sieć wykorzystuje zaawansowaną architekturę enkodera-dekodera, uzupełnioną interaktywnymi modułami uwagi w różnych skalach. Sieć pracuje z komplementarnymi strumieniami uwagi do przodu i do tyłu: pierwszy rejestruje progresywną zmienność czasową, a drugi weryfikuje spójność zmian poprzez odwrotną analizę czasową. Ta interaktywna metoda umożliwia skuteczne przedstawienie modelu dupleksu relacji czasowych bez konieczności obliczeniowej, co znacznie ułatwia rozróżnianie prawidłowych przesunięcia terenu od zmienności wywołanej hałasem bez szumów. Eksperymentuje się z dwoma zestawami danych benchmarkowych: zbiorem danych Sonera Satellite Change Detection (OSCD) oraz zestawami danych SZTAKI AirChange. Znaczące eksperymenty przeprowadzone na zbiorach danych OSCD pokazują, że proponowane podejście osiąga konkurencyjne wskaźniki F1 na poziomie 58,14% (13 kanałów) i 50,68% (3 kanały) przy zaledwie 2,13 mln parametrów i 19,6G FLOPS, 19 razy mniej parametrów oraz 5,6-krotnej rotacji wniosków w porównaniu do ChangeFormer. Konkurencyjne wyniki na próbkach zestawów testowych Szada/1 i Tiszadob/3 zbioru danych SZTAKI, odpowiednio wynik F1 wynoszący 74,29% i 92,86%, umożliwiają wdrożenie w najbardziej brzegowych urządzeniach analityki czasu rzeczywistego oraz rozbudowanych systemów mapowania, gdzie energia operacyjna bezpośrednio zależy od energii obliczeniowej.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bezprecedensowy poziom urbanizacji w globalnym środowisku, utrata zasobów środowiskowych oraz zmiany krajobrazu spowodowane klimatem bezpośrednio wywołały konieczność zapewnienia precyzyjnego, terminowego i automatycznego systemu monitoringu, który potrafi identyfikować i mierzyć zmiany na powierzchni Ziemi. Teledetekcja satelitarna stała się podstawowym elementem masowego nadzoru środowiskowego, ponieważ zapewnia stałe pokrycie czasowe i przestrzenne, a także jest kluczowe w pełnym badaniu zmian. Dwuczasowe wykrywanie zmian na zdjęciach satelitarnych polega na charakteryzacji zmian powierzchni pomiędzy dwoma kolejnymi akwizycjami tego samego regionu geograficznego. Jest to jednak skomplikowany proces ze względu na liczne zmienne zakłócające, w tym zmienność pór roku, warunki pogodowe, właściwości sensorów, zniekształcenia geometryczne oraz fenomenologiczne zmiany, które mogą zaciemniać lub przypominać rzeczywistość w pokryciu terenu. Ręczna interpretacja obrazów satelitarnych obecnie stosowanych jest czasochłonna, subiektywna i nieodpowiednia do obsługi stale rosnących ilości informacji z obserwacji Ziemi generowanych przez obecne konstelacje satelitarne. To podstawowe ograniczenie, które doprowadziło do powstania zautomatyzowanych rozwiązań do wykrywania zmian. Tradycyjne metody detekcji zmian na podstawie pikseli1 oraz detekcji zmian2 oparte na obiektach zwykle są słabo przystosowane do pracy w ramach tych zawiłości i mają niski standard odporności do zastosowania do szerokiego zakresu jednostek geograficznych i skal czasowych. Architektury głębokiego uczenia, szczególnie konwolucyjne sieci neuronowe i ich warianty, umożliwiają wydobycie cech hierarchicznych reprezentujących niskopoziomowe szczegóły spektralne oraz wysokopoziomowe wzorce semantyczne istotne do rozróżniania zmian. Modele detekcji zmian w głębokim uczeniu okazały się bardzo obiecujące w rejestrowaniu utajonych zmian przestrzenno-czasowych w danych teledetekcji oraz w identyfikacji prawdziwego pokrycia terenu z pseudozmianami wprowadzonymi przez czynniki zewnętrzne. Te podejścia end-to-end wykorzystują fakt, że cechy mogą być wyodrębniane i klasyfikacja wykonywana optymalnie jednocześnie. Pomimo znacznego postępu w dokładności wykrywania zmian, większość istniejących podejść pozostaje trudna do wdrożenia w rzeczywistych środowiskach operacyjnych. Podejścia oparte na transformatorach3, choć efektywne w kontekście globalnym, charakteryzują się dużą liczbą parametrów, kwadratową złożoność obliczeniową, opóźnieniem wnioskowania oraz wysokim zużyciem energii. Syjamskie architektury oparte na CNN natomiast są lepsze pod względem efektywności, ale mają małe pola recepcyjne i w dużej mierze brakuje im globalnego modelowania kontekstowego, co znacznie pogarsza wydajność. Te ograniczenia są dodatkowo pogłębiane w środowiskach dużych skali i ograniczonych zasobami, gdzie skalowalność i koszty operacyjne są kluczowe. Skalowalność, efektywność energetyczna oraz szybkość wyciągania wniosków są często kluczowe w sytuacjach ratunkowych, dlatego konieczne jest tworzenie rozwiązań równoważących wydajność z możliwością wdrożenia. Dlatego pozostaje luka między modelami skoncentrowanymi na dokładności i wymagającymi obliczeniowo a praktycznymi wymaganiami wdrożenia w rzeczywistości.

Aby przezwyciężyć takie problemy, proponowano Interaktywną Wieloskalową Fuzję Uwagi (IMAF) z rzadką konwolucją cech (SFC), która koncentruje się na projektowaniu efektywnego i wdrożalnego ramowego systemu wykrywania zmian, a nie wyłącznie optymalizacji dokładności. Proponowane rozwiązanie koncentruje się na parach optycznych obrazów satelitarnych, zwykle RGB lub wysokorozdzielczych obrazach multispektralnych (rozdzielczość 0,5-30 m), pozyskiwanych przez satelity, np. Landsat, Sentinel-2 czy WorldView. Technika zakłada precyzyjną geometryczną współrejestrację par dwuczasowych, ponieważ błędy rejestracji mogą również znacząco wpływać na wykrywanie. Zajmuje się wykrywaniem zmian binarnych (w przeciwieństwie do wieloklasowych zmian semantycznych) i nie potrafi rozróżnić różnych typów zmian. Co więcej, metoda wykorzystuje obrazy skorygowane radiometrycznie, aby zmniejszyć skutki zmian sezonowych, atmosferycznych i oświetleniowych, które można by pomylić ze zmianą pokrycia terenu. W przeciwieństwie do tradycyjnych syjamskich CNN4, które oddzielają obrazy dwuczasowe za pomocą prostego połączenia, proponowany moduł IMAF umożliwia wieloskalową fuzję kontekstową zarówno cech globalnych, jak i lokalnych. Najnowsze podejścia oparte na transformatorach, takie jak BIT5 i ChangeFormer3, osiągają bardzo dobre rezultaty, ale ich mechanizmy samouwagi mają złożoność O(N2). Proponowane ramy rejestrują subtelne zmiany z dwukierunkową uwagą, zmniejszając złożoność obliczeniową i opóźnienia w wnioskowaniu. Ponadto proponowany projekt jest świadomy rzadkości, co jest lepsze od gęstych, wieloskalowych projektów fuzji, takich jak UNet++6,7 i SNUNet8. Rzadka konwolucja funkcji z modułem duchów zmniejsza liczbę FLOP o około 50%, zachowując jakość reprezentacji. W związku z tym proponowane ramy preferują kompromis między dokładnością a efektywnością na rzecz niezawodnego wdrożenia w środowiskach o ograniczonych zasobach.

Główne osiągnięcia tego badania to: (i) lekki detektor zmian, który osiąga konkurencyjny wynik F1, używając 19 razy mniejszej liczby parametrów w porównaniu do odpowiedników opartych na transformatorze. (ii) Interaktywny moduł fuzji wieloskalowej uwagi, który uzyskuje globalne informacje kontekstowe bez kosztu kwadratowego tradycyjnego mechanizmu samouwagi. (iii) Schemat splotu o rzadkości cech oparty na modułach Ghosts, który minimalizuje operacje zmiennoprzecinkowe o 49,4 procent bez pogorszenia jakości reprezentacji cech. (iv) Szeroko zakrojona walidacja eksperymentalna na dużym zbiorze zbiorów danych benchmarkowych, z lepszymi kompromisami między efektywnością a dokładnością oraz rozsądną praktycznością rzeczywistego zastosowania w rzeczywistym świecie.

Pozostała część tego manuskryptu obejmuje następujące sekcje: Sekcja 2 przedstawia obszerny przegląd najnowszych prac w dziedzinie metod wykrywania zmian binarnych, ze szczególnym uwzględnieniem rozwiązań deep learning i ich implementacji na standardowych benchmarkach. Sekcja 3 przedstawia teoretyczne tło i konstrukcję proponowanego rozwiązania, matematyczną reprezentację mechanizmu fuzji czasowej oraz elementów uwagi, charakterystykę układu eksperymentalnego, zbiory danych, metryki oceny oraz szczegóły implementacyjne niezbędne do przeprowadzenia powtarzalnych badań. Sekcja 4 ilustruje szczegółowe wyniki eksperymentalne, obejmujące ablację, porównania z najnowszymi algorytmami detekcji zmian binarnych, które wyjaśniają zdolność w różnych obszarach geograficznych zbiorów OSCD i SZTAKI Airchange. Sekcja 5 określa wyniki wyników, ograniczenia obecnego podejścia oraz możliwości przyszłych badań nad wykrywaniem zmian.

Rozwój algorytmów wykrywania zmian w teledetekcji uległ znacznym zmianom – z metod opartych na pikselach na ramy uczenia głębokiego. Procedury wczesnego wykrywania zmian opierały się głównie na procesach algebraicznych, takich jak różnicowanie obrazów, racjonowanie obrazów oraz analiza wektorów zmian, które działały bezpośrednio na wartościach pikseli w celu wykrywania zmian czasowych 9,10. Opracowano alternatywne metody polegające na porównaniu po klasyfikacji, w których każdy obraz czasowy był niezależnie klasyfikowany, a następnie porównywany z tabelacją krzyżową11. Techniki detekcji zmian oparte na obiektach stanowiły ważny krok postępu wraz z wprowadzeniem kontekstu przestrzennego oraz redukcją szumu na poziomie pikseli 2,12.

Pojawienie się technik głębokiego uczenia zrewolucjonizowało przestrzeń detekcji zmian teledetekcji i utorowało drogę do przezwyciężenia wielu ograniczeń tradycyjnych technik. Ostatnio sieci neuronowe splotowe (CNN) stały się standardową architekturą automatycznego wyodrębniania cech i klasyfikacji zmian13,14. Syjamskie NestedUNet do wykrywania zmian14oraz syjamskie Swin-Unet15 stały się znaczącą innowacją dzięki gęsto połączonej topologii sieci syjamskiej, która pomaga skutecznie przechowywać informacje o lokalizacji w całej hierarchii sieci.

Problem detekcji zmian dwuczasowych w wysokorozdzielczym teledetekcji optycznym nadal jest trudny do rozwiązania z powodu różnych czynników zakłócających, a zaproponowano wieloskalowe sieci transformatorów opartych na uwadze i rozbudowane strategie fuzji cech16. Ramy EGMT-CD zaproponowały wielomodalne transformatory sterowane krawędziami heterogenicznych par obrazów, gdzie homologiczne obrazy nie są dostępne z powodu zachmurzenia17. Architektury takie jak DASUNet przełamują ręczne wąskie gardła głębokiego uczenia w pełnoskalowej fuzji funkcji, osiągając o 0,85% wyższą poprawę indeksu F1 w porównaniu do SNUNet-24 na zbiorze danych CDD dzięki ulepszonemu przepływowi gradientu18. Hybrydowe modele CNN-Transformer rozwiązują problem fałszywych negatywów przy wyższych kosztach, zapewniając dodatkowy koszt na składowe częstotliwości umożliwiające uczeniesię 19. Hybrydowe sieci transformatorów w kształcie litery U20 jednak nadal mają trudności z integracją cech lokalno-globalnych oraz zmianami w regionach, które okresowo zachodzą, nawet na niewielką skalę. Zastosowanie wielozadaniowego wykrywania zmian semantycznych oraz precyzyjnej identyfikacji lokalizacji i klas jest bardziej skomplikowane w porównaniu do zadań binarnych21,22. Korelacje dwuczasowe można skutecznie modelować za pomocą uwagi krzyżowej bez istotnych zmian architektonicznych14,23. Wyrażenie paradygmatu języka perspektywicznego to również nowatorski trend, z projektami opartymi na CLIP, które łączą tekstowe wyjaśnienia w korespondencję zmian24 oraz półnadzorowane wzorce, eliminując poleganie na danych oznaczonych25. Change Mamba prezentuje modele przestrzeni stanów modeli przestrzenno-czasowych26,27. Demonstrowano różne zastosowania wyspecjalizowanych metod uwagi: uwzględnienie zastosowania wykrywania anomalii hiperspektralnych28, klasyfikacji wieloobszarowej29 lub segmentacji ograniczonej etykiety30 oraz demonstrację elastyczności mechanizmów uwagi w analityce teledetekcji.

AutorzyMetoda/ArchitekturaSpecyfikacja technicznaKluczowe innowacje i odkrycia / Wydajność zbioru danych
Singh, A. [8]Tradycyjne metodyRóżnicowanie oparte na pikselach, CVACyfrowy system wykrywania zmian, wiele zbiorów danych, dokładność: 65-80%
Mas, J.F. [10]Po klasyfikacjiNiezależna klasyfikacja czasowaAnaliza metodologii porównawczej, obrazy tropikalne, OA: 72-85%
Lu i in. [9]Tradycyjne metodyOperacje algebraiczne, CVA, PCAKompleksowe porównanie technik, wiele źródeł, dokładność: 70-88%
Benedek & Szirányi [23]Model Markowa mieszanyWielowarstwowy framework warunkowyModelowanie zmiany probabilistycznej, Sztaki AirChange, DA: 92,1%
Blaschke, T. [2]ObiektoweAnaliza oparta na segmentacjiIntegracja kontekstu przestrzennego, różne obrazy tętna, SA: 85-92%
Chen i in. [11]ObiektoweSegmentacja wieloskalowaHierarchiczna analiza obiektów, obrazowanie tętna, OA: 87,3%
Zhan i in. [12]Syjamskie CNNCNN 5-warstwowy, rozmiar jądra 3×3Głęboka syjamska architektura dla płyt CD, zdjęcia lotnicze, F1: 0,847, IoU: 0,735
Daudt i in. [4]Syjamski FCNFC-EF, FC-Siam-diff, FC-Siam-concStrategie wczesnej/późnej fuzji, OSCD, F1: 0,431, IoU: 0,276
Peng i in. [26]UNet++Zagnieżdżone połączenia U-Net, gęste połączenia pomijaniaWieloskalowa agregacja cech, satelita HR, F1: 0,753, IoU: 0,604
Chen & Shi [25]Uwaga przestrzenno-czasowaBloki uwagi, modelowanie czasoweUczenie cech przestrzenno-czasowych, LEVIR-CD, F1: 0,887, IoU: 0,797
Fang i in. [7]SNUNet-CDSiamese NestedUNet, gęste połączeniaOptymalizacja transmisji informacji, LEVIR: F1: 0,897, WHU: F1: 0,904
Chen i in. [5]BIT-CDResNet18 + enkoder transformatoraBinarne uczenie cech czasowych, OSCD: F1: 0,635, LEVIR: F1: 0,919
Bandara & Patel [3]ChangeFormerEnkoder transformatorowy hierarchicznyWieloskalowa uwaga transformatora, OSCD: F1: 0,654, LEVIR: F1: 0,905
Song i in. [27]ACANetUwaga osiowa + szkielet CNNWydajne obliczanie uwagi, LEVIR: F1: 0,901, WHU: F1: 0,913
Shi i in. [28]Artykuł przeglądowyKompleksowa ankieta metod AISystematyczna analiza podejść AI, 50+ zestawów danych
Li i in. [14]AMST-NetTransformator wieloskalowy, piramida uwagiAdaptacyjne wieloskalowe wyodrębnianie cech, obrazy optyczne HR, mIoU: 0,823
Xiang i in. [15]EGMT-CDArchitektura multimodalna prowadzona na krawędziachMiędzymodalne wyrównanie cech, pary heterogeniczne, F1: 0,756
Miao i in. [16]DASUNetGęsty nadzór, pełnoskalowa fuzjaGłęboki nadzór na wszystkich poziomach dekodera, CDD: 0,85% poprawa F1 w porównaniu do SNUNet
Tang i in. [29]Syjamski Swin-UNetFuzja Swin Transformer + UnetHierarchiczna uwaga okienkowa, LEVIR: F1: 0,923, WHU: F1: 0,925
Wu i in. [18]Hybrydowy transformator U-TransformerUNet++ szkielet + bloki transformatoraGlobalno-lokalna integracja funkcji, obrazy HR, IoU: 0,851, F1: 0,919
Dong i in. [20]ChangeCLIPJęzyk wizji oparty na CLIPMultimodalne zrozumienie semantyczne, pary RS, dokładność semanticzna: 94,1%
Li i in. [21]SemiCD-VLPółnadzorowany język wizjiZmniejszone wymagania adnotacji, Ograniczona liczba etykiet, F1: 0,889
Chen i in. [22]ChangeMambaModele Przestrzeni Stanów (SSM)Liniowe modelowanie czasowe złożoności, obrazy RS, wydajność: 3 razy szybsza

Tabela 1: Podsumowanie metod wykrywania zmian w teledetekcji Prosimy kliknąć tutaj, aby pobrać tę tabelę.

Podsumowanie wcześniejszych badań przedstawiono w Tabeli 1. Tradycyjne metody mają ręcznie opracowane funkcje, które nie są odpowiednie dla złożonych wariacji przestrzenno-czasowych31, a architektura głębokiego uczenia (UNet, FPN, PSPNet) wymaga kosztownie kosztownych obliczeniowo gęstych konwolucji. Obecne modele nie posiadają wydajnych, wieloskalowych systemów integracji i dynamicznej uwagi. Aby wypełnić te luki, obecne badanie proponuje Interaktywną Wieloskalową Fuzję Uwagi z Sparse Feature Convolution Network, która ma na celu uchwycenie subtelnych zmian na różnych skalach, jednocześnie będąc efektywnym obliczeniowo w teledetekcji, szczególnie w zakresie zmian strukturalnych miejskich i wywołanych przez człowieka.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Oświadczenie etyczne

  1. Zarówno zestawy danych Onera Satellite Change Detection (OSCD), jak i SZTAKI AirChange użyte w tym badaniu zawierają publicznie dostępne obrazy RGB i wielospektralne obejmujące różnorodne cechy geograficzne. Te zbiory danych nie zawierają żadnych danych ograniczonych ani wrażliwych. Dlatego nie jest wymagana żadna etyczna zgoda na tę pracę.

2. Materiały i wyposażenie

  1. Testuj na komputerze z Windows 11 wyposażonym w procesor Intel Core i7 10870H, układ NVIDIA GeForce GTX 1650 Ti z 4GB pamięci VRAM oraz 32GB RAM.
    UWAGA: Środowisko programistyczne to Python 3.8, a środowisko programistyczne opiera się na frameworku PyTorch (wersja 1.12.1) oraz Torchvision (wersja 0.13.1) do implementacji deep learning.
  2. Pobieranie i instalowanie bibliotek, takie jak scikit-learn (wersja 1.0.2), zawierająca narzędzie uczenia maszynowego, oraz NumPy (wersja 1.21.0), zawierająca operacje numeryczne.
  3. Upewnij się, że zainstalowałeś CUDA Toolkit w wersji 11.3 oraz cuDNN w wersji 8.2 dostarczonych przez NVIDIA Corporation, aby móc korzystać z przyspieszenia karty graficznej.
  4. Szkolenie i ocena wydajności za pomocą publicznie dostępnych zbiorów danych OSCD i SZTAKI Airchange.

3. Przygotowanie zbioru danych

  1. Wybierz OSCD4, składający się z optycznych zdjęć satelitarnych satelitarnych RGB oraz obrazów wielospektralnych, każdy o wymiarach 600 x 600 pikseli i rozdzielczości 10 m, oraz zestawu danych SZTAKI AirChange32 , składającego się z 13 par optycznych obrazów lotniczych, każda o wymiarach 952 x 640 pikseli i rozdzielczości 1,5 m/piksel, jako zestawy danych benchmarkowych.
  2. Podzielić 24 miasta z zbioru danych OSCD na stałe, z góry zdefiniowane 14 miast do treningu i 10 miast do testowania.
  3. Przypisz stałe, nielosowe pary obrazów Szada/1 i Tiszadob/3 z zbioru danych SZTAKI AirChange do zestawu testowego, a pozostałe pary obrazów jako zestaw treningowy jako konwencjonalny benchmark.
  4. Wykonaj wykrywanie zmian na zbiorze testowym i ilościowo określ wydajność w jednym uruchomieniu, używając adnotowanych par obrazów z każdego zbioru danych.

4. Wstępne przetwarzanie

  1. Stosuj wstępne przetwarzanie oparte na łatkach.
    1. Niezależnie wyodrębniaj fragmenty obrazów na każdy obraz czasowy w identycznych miejscach w trakcie pracy, aby efektywnie zarządzać zdjęciami satelitarnymi o wysokiej rozdzielczości.
    2. Podziel każdy obraz na nakładające się fragmenty po 128 × 128 pikseli, używając kroku 64 piksele.
    3. Wyrównuj nakładające się obszary między sąsiadującymi łatami, aby zachować spójność granic i zachować informacje o krawędziach.
  2. Wykonaj augmentację danych według klas.
    1. Stosuj augmentację różnicową podczas treningu na obu łatkach w parze na podstawie proporcji pikseli zmian, aby poradzić sobie z nierównowagą klas między obszarami "zmian" a "bez zmian".
    2. Zwiększanie pary zmian (te z > 1% pikseli) sześć razy, stosując następujące transformacje: przewrócenia poziome i pionowe, obroty o 90°, drgania kolorów (jasność, kontrast i nasycenie ± 30%), transformacje afiniczne (obrót ± 15°, translacja ± 10 pikseli, skalowanie 95-105%).
    3. Uzupełnij parę łatek bez zmian tylko raz, aby zapobiec nierównowadze zbioru danych.
      UWAGA: Ta strategia augmentacji, oparta na klasach, zapewnia zrównoważone szkolenie w regionach zmian i bez zmian.
  3. Normalizuj i poprawiaj jakość obrazu.
    1. Normalizuj wszystkie łatki za pomocą średniej i odchylenia standardowego ImageNet: Średnia = (0,485, 0,456, 0,406), Std = (0,229, 0,224, 0,225).
      1. Użyj Contrast Limited Adaptive Histogram Equalization (CLAHE) z limitem klipów = 2,0, rozmiarem siatki kafelków =8 x 8, w przestrzeni kolorów LAB (tylko kanał L), aby rozjaśnić kontrasty obszarów o niskim kontraście i tak rozróżnić cechy na obrazie, z normalizacją intensywności do [0,255].
      2. Usuń wszystkie łatki mniejsze niż 128 x 128 pikseli i wypełnij mniejsze łatki tak, aby miały ten sam rozmiar co większe i zachowały integralność przestrzenną podczas trenowania modelu.

5. Budowa modelu

  1. Zdefiniuj wejście i wyjście.
    1. Proponowane ramy przyjmują jako dane parę współrejestrowanych zdjęć satelitarnych I1,I 2∈ RH×W×C uzyskanych w różnych instancjach czasowych i generują binarną mapę zmian M ∈ RH×W×2 , która dokładnie wyznacza zmienione i niezmienione regiony.
  2. Proponowane ramy
    1. Przetworz proponowany framework jako trzyetapowy pipeline przetwarzania. W pierwszym etapie wykonaj modelowanie uwagi czasowej na sekwencjach wejściowych, aby uchwycić zmiany w czasie.
    2. Wykorzystaj interaktywną uwagę krzyżową do uchwycenia symetrycznych zależności czasowych między cechami bitemporalnymi na etapie modelowania uwagi czasowej.
    3. Wyodrębniaj hierarchiczne reprezentacje istotnych cech z obrazu modelowanego czasowo, używając rzadkiej architektury enkodera opartej na cechach w drugim etapie, gdzie rozdzielczość przestrzenna stopniowo maleje, a wymiar cech się zwiększa.
    4. Użyj dekodera z przeskokiem połączonym z adaptacyjnym upsamplowaniem, aby uzyskać mapy zmian o wysokiej rozdzielczości na etapie rekonstrukcji, zachowując jednocześnie niższe detale przestrzenne.
      UWAGA: Rysunek 1 pokazuje ogólny przepływ danych z wejściowych dwuczasowych obrazów satelitarnych do wspólnego enkodera, środkowych bloków przetwarzania cross-attention oraz dekodera, co razem prowadzi do mapy detekcji zmian.
  3. Enkoder rzadkich cech
    1. Skonstruuj lekki enkoder zbudowany z bloków splotowych duchów o stosunku=2, z kolejną normalizacją wsadową i funkcją aktywacji ReLU, aby zmniejszyć złożoność obliczeniową przy zachowaniu jakości reprezentacji.
    2. Złóż enkoder sekwencyjnie z następujących trzech typów bloków.
      Blok1: Ghost (in_channels → 32) → BN ReLU Ghost (32 → 64) → BN ReLU MaxPool (2×2)
      Blok2: Ghost (64 → 96) → BN ReLU Ghost (96 → 128) → BN ReLU MaxPool(2×2)
      Blok3: Ghost (128 → 128) → BN ReLU
    3. Połącz bloki, aby utrzymać płynny przepływ elementów przez enkoder i zachować rozdzielczość przestrzenną na kolejnych etapach.
      UWAGA: Główną innowacją tego podejścia jest interaktywny mechanizm wzajemnej uwagi, który umożliwia symetryczną interakcję cech między obrazami dwuczasowymi. Dla każdej pary obrazów wyodrębniane są głębokie cechy F1,F 2∈RB×C×H'×W', gdzie H' = H/4, W'=W/4, C=128 oznacza wymiar cech. Te cechy przestrzenne są przekształcane w format Mathematical expression F1, F2 ∈ R^B×N×D; equation detail N = H'×W'. sekwencji, który reprezentuje długość sekwencji, a D=C oznacza wymiar cech.
  4. Modelowanie uwagi czasowej
    1. Implementuj operację cross-focus przy użyciu standardowej skalowanej formuły uwagi dot-iloment, jak pokazano na Rysunku 2
      Attention mechanism formula, key concept in machine learning for sequence processing.
      gdzie Q, K i V reprezentują odpowiednio macierze zapytania, klucza i wartości, a dk oznacza wymiar wektorów klucza.
      UWAGA: Wielogłowa uwaga z h = 8 głowami do jednoczesnego uchwycenia różnych typów relacji czasowych jest stosowana niezależnie na każdej skali. Każda głowa uwagi przetwarza inną podprzestrzeń reprezentacji cech, co pozwala modelu skupić się na różnych aspektach zmian czasowych.
    2. Oblicz wyjście uwagi wielu głów jako:
      MultiHead (Q,K,V) = Concat (głowa1,...,headh ) WO
      gdzie każda z nich Attention mechanism formula; Q, K, V matrices; tensor dimensions RDxdK; mathematical notation. to wyuczone macierze projekcyjne.
  5. Symetryczna interaktywna uwaga
    1. Strategia interaktywnej uwagi rejestruje informacje o symetrycznych zmianach poprzez operacje w przód i w tył (pokazane na Rysunku 3). Uwaga do przodu pozwala na skupienie się na cechach z pierwszego obrazu czasowego na cechy drugiego obrazu czasowego, obliczane jako:
      Cross-attention equation, A₁→₂=CrossAttention(F₁',F₂',F₂''), neural network model, diagram.
      gdzie pierwsze cechy czasowe służą jako zapytania, a drugie cechy temporalne dostarczają kluczy i wartości.
    2. Natomiast uwaga wsteczna pozwala na skupienie cech z drugiego obrazu czasowego na objęcie cech z pierwszego obrazu czasowego, sformułowanego jako:
      CrossAttention formula diagram for attention mechanism in neural networks.
      Obiekty obsługiwane z obu stron są łączone i wyświetlane przez transformację liniową, aby uzyskać ostateczną reprezentację obsługiwaną:
      Linear transformation equation, Fattemded = Linear([A1→2; A2→1]), formula for neural network.
      UWAGA: Ten interaktywny mechanizm zapewnia, że relacje czasowe są rejestrowane symetrycznie, czyniąc sieć niezmienną względem kolejności obrazów wejściowych, co jest kluczowe w zastosowaniach wykrywania zmian, gdzie sekwencja czasowa nie powinna wpływać na wyniki detekcji.
  6. Rekonstrukcja dekodera i map zmian
    1. Połącz obsługiwane cechy z wyjściami enkodera za pomocą połączeń pomijania, aby zachować szczegóły przestrzenne.
    2. Zastosuj interpolację biliniową z identycznymi parametrami na wszystkich etapach dekodera dla adaptacyjnej zmiany rozmiaru, aby zapewnić idealne wyrównanie między połączeniami pomijania.
    3. W pierwszym etapie redukuj kanały z 256 do 96 pikseli za pomocą konwolucji duchów na H/4×W/4 i upsampluj do H/2×W/2 i fuzuj z odpowiadającymi cechami enkodera.
    4. W drugim etapie proces wykorzystuje konwolucje duchowe, redukując kanały z 160 do 64 pikseli, próbkując do pełnej rozdzielczości H×W i integrując funkcje pomijania na poziomie enkodera.
    5. Na koniec zastosuj sploty duchów, aby zredukować kanały do 32 i użyj końcowej konwolucji 1 × 1, aby wygenerować dwukanałową mapę zmian binarnych.
    6. Podsumowaj cały proces przetwarzania za pomocą następującego algorytmicznego ramy, który integruje wszystkie komponenty architektoniczne w spójny system wykrywania zmian.
      UWAGA: Notacja: Eki oznacza cechy enkodera z obrazu i ∈ {1,2} na poziomie k; Fi jest ostatnią cechą zakodowaną; Static equilibrium equation; ΣFi=0; diagram; forces in balance; physics concepts; educational use. jest jej spłaszczoną wersją;Static equilibrium equation ΣFx=0, ΣFy=0; vector diagram, force balance analysis. to funkcja zwiększona uwagi; A to macierz uwagi; Dj to wyjścia dekodera; φk,ψ j to bloki enkodera/dekodera; [·;·] oznacza łączenie kanałów; Wout to jądro warstwy wyjściowej.
      Zobacz Algorytm pliku uzupełniający 1 dotyczący "Interaktywnego wykrywania zmian opartych na fuzji wieloskalowej uwagi

Neural network model diagram; shared encoder, bidirectional attention, feature concatenation.
Rysunek 1: Proponowana metodologia Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Transformer mechanism, showing attention process with query, key, value; diagram for neural networks.
Rysunek 2: Architektura krzyżowego obrazu Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Cross-attention diagram, features T1/T2 to attended features via QKV mechanism for data fusion output.
Rysunek 3: Interaktywna architektura cross focus Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

6. Procedura szkoleniowa

  1. Funkcja straty
    UWAGA: Proces treningowy wykorzystuje funkcję utraty ogniskowej Tversky'ego do rozwiązania problemu nierównowagi klasowej często spotykanej w zbiorach danych wykrywania zmian.
    1. Sformułuj funkcję straty następująco: Niech pi ∈ [0,1] będzie przewidywanym prawdopodobieństwem dla piksela i, a gi ∊ {0,1} odpowiadającą rzeczywistością. Indeks Tversky'ego (TI) definiuje się jako:
      TI formula equation; statistical method; data analysis process; mathematical representation.
      gdzie α i β kontrolują karę odpowiednio za fałszywie pozytywne i fałszywie negatywne, a ε jest wyrazem wygładzającym.
    2. Następnie wyrażę Ogniskową Stratę Tversky'ego jako:
      Equation for the FFTL loss function in mathematical symbol format.
      γ modulują skupienie na trudno sklasyfikowanych pikselach.
  2. Konfiguracja hiperparametrów
    1. Zastosowanie systematycznego wyszukiwania siatkowego opartego na 5-krotnej walidacji krzyżowej na zestawie pociągów, aby wybrać optymalne wartości.
    2. Ustaw współczynniki wag strat dla zadania wykrywania zmian na α = 0,3, β = 0,7, γ = 1,0 oraz ε = 1,0. Wartości te podkreślają minimalizację przeoczonych wykryć zamiast fałszywie pozytywnych, co jest ważne w przypadku niezrównoważonych zbiorów danych, gdzie zmiany są stosunkowo rzadkie.
      UWAGA: Waga asymetryczna z β > α koncentruje się na przypomnieniu, co oznacza, że fałszywie negatywne wyniki są ważone bardziej niż fałszywie pozytywne, co jest zgodne z projektowaniem, zwłaszcza w zastosowaniach monitorowania katastrof.
  3. Optymalizator i strategia uczenia się
    1. Zastosowanie optymalizatora AdamW z spadkiem masy 1×10⁻⁴, aby poprawić regularizację i zapobiec nadmiernemu dopasowaniu.
    2. Zainicjalizuj tempo uczenia na poziomie 1×10⁻³ i zastosuj harmonogram wyżarzania kosinusowego, aby zapewnić płynną i stabilną zbieżność podczas treningu.
    3. Użyj partii 8, aby utrzymać kompatybilność ze środowiskiem pamięci GPU o pojemności 4 GB.
  4. Harmonogram treningów
    1. Model należy trenować osobno na OSCD, składającym się z 14 zdefiniowanych par do trenowania i 10 par do testów, a następnie na zbiorze danych SZTAKI Airchange z Szada/1 i Tiszabob/3 jako standardowymi benchmarkami zestawu testowego.
    2. Podziel pary treningowe na pięć składów, użyj jednego jako zestawu walidacyjnego w każdej iteracji i kontynuuj trening przez maksymalnie 100 epok.
    3. Monitoruj straty walidacyjne na końcu każdego fałdowania i stosuj kryteria wczesnego zatrzymania na poziomie 10 epok po ustabilizowaniu się zbieżności, aby zapobiec nadmiernemu dopasowaniu i ograniczyć niepotrzebne obliczenia.
    4. Wybierz hiperparametry na podstawie najlepszej średniej wydajności walidacyjnej dla wszystkich fałdów.
    5. Wykonaj wykrywanie zmian na zbiorze testowym i ilościowo określ wydajność w pojedynczym uruchomieniu, korzystając z adnotowanych par obrazów z każdego zbioru danych.
  5. Optymalizacja pamięci
    1. Aktywacja gradientowych punktów kontrolnych, aby zmniejszyć zużycie pamięci GPU o około 40%, osiągnięte poprzez ponowne obliczenie aktywacji pośrednich podczas przejścia wstecznego.
    2. Umożliwić trening o mieszanej precyzji, aby wykorzystać operacje FP16 w sytuacjach stabilnych numerycznie, co poprawia szybkość i zmniejsza obciążenie pamięci.
    3. Użyj adaptacyjnego skalowania rozmiaru partii, aby dynamicznie dostosować zużycie pamięci dla maksymalnej wydajności GPU.

7. Ocena

  1. Upewnij się, że żadne poprawki z miast testowych nie zostaną uwzględnione w treningu lub walidacji, aby zapobiec wyciekom danych.
  2. Organizuj łaty obrazów i odpowiadające im mapy rzeczywistości do oceny poszczególnej partii.
  3. Załaduj wytrenowane wagi modelu z najlepiej działającej epoki określonej przez stratę walidacyjną.
  4. Wybierz próg 0,5, aby przekształcić mapy prawdopodobieństwa na binarne zmiany binarne.
  5. Obliczanie metryk oceny według pikseli, aby zmierzyć wydajność wykrywania zmian10
    Precyzja (P): Ułamek przewidywanych pikseli zmian, które są prawdziwymi pikselami zmiany.
    Recall (R): Ułamek poprawnie wykrytych pikseli prawdziwej zmiany.
    F1-wynik: Harmoniczna średnia precyzji i przypomnienia.
  6. Generuj patch obrazu w czasie rzeczywistym, trenując i oceniając modele o wymiarach 128 x 128 pikseli i kroku 64 piksele.
    UWAGA: Taka dynamiczna generacja gwarantuje skuteczność pamięci oraz spójność granic.
  7. Sprawdź poprawność wstępnego przetwarzania i rozmieszczenia patchów, analizując reprezentatywną próbkę patchy tworzonych w sposób zrozumiały lub obrazy cech średniego poziomu.
    UWAGA: Zakodowane reprezentacje cech generowane przez enkoder oparty na CNN są przechowywane w pamięci w postaci tensorów, które są używane później na etapach, które służą jako punkty kontrolne podczas weryfikacji cech. Wyprodukowane mapy zmian są przechowywane jako zwykłe pliki obrazowe (e.g. PNG lub TIFF), które można wizualnie oglądać w celu oceny zidentyfikowanych zmian.
  8. Zapisz wskaźniki zbieżności (krzywe strat, metryki dokładności) podczas treningu modelu i sprawdź, czy punkty modelu są zapisywane w określonych odstępach czasu, aby cały proces treningowy mógł być powtarzany, dopracowywany lub odzyskiwany.
    UWAGA: Wyraźne przedstawienie formatu wyjściowego, kroków weryfikacji oraz szczegółów punktów kontrolnych pomaga zapewnić przejrzystość, umożliwiając weryfikację krok po kroku, a także umożliwiając powielanie i walidację protokołu przez innych badaczy. Protokół ten zapewnia dogłębny, szczegółowy workflow dotyczący przygotowania zbioru danych oraz przejścia do fazy wstępnego przetwarzania, budowy sieci, szkolenia i oceny. Przestrzegając tych kroków, można wdrożyć proponowaną metodę w określonych warunkach w sposób powtarzalny. Wyniki takiej procedury przedstawiono w poniższej sekcji Rezultaty.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponowana metoda wykrywania zmian została oceniona na podstawie ustalonych podejść bazowych, wykorzystując dwa publicznie dostępne zestawy danych benchmarkowych do oceny jej wydajności w różnych rozdzielczościach spektralnych i warunkach środowiskowych. Wyniki eksperymentów pokazują istotną poprawę w równoważeniu dokładności wykrywania z kontrolą fałszywie pozytywną, szczególnie pokazując zdolność metody do utrzymania wysokich wskaźników przypominania przy jednoczesnym znacznym zwiększeniu precyzji w porównaniu z trady...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie przedstawia interaktywną, wieloskalową sieć detekcji zmian opartą na fuzji uwagi oparty na wykrywaniu zmian w dwuczasowych obrazach satelitarnych. Integracja dwukierunkowego mechanizmu uwagi, w przeciwieństwie do metod jednokierunkowych, ułatwia pełną międzyczasową interakcję cech-obiekt z komplementarnymi sygnałami uwagi do przodu i do tyłu. Progresywne zmiany temporalne strumienia uwagi w przód są rejestrowane przez różnicę uwagi, tj. między starszymi a nowszymi akwizycjami czasowymi, podczas gdy spój...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają konfliktu interesów.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badania te nie otrzymały żadnego konkretnego grantu od żadnej agencji finansującej z sektora publicznego, komercyjnego ani non-profit.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Zestaw narzędzi CUDANVIDIA CorporationWersja 11.3Akceleracja GPU do obliczeń uczenia głębokiego
cuDNNNVIDIA CorporationWersja 8.2Zoptymalizowana biblioteka głębokiego uczenia GPU
Intel  procesorIntel CorporationCore i7 10870HPlatforma obliczeniowa używana do trenowania i oceny proponowanego modelu deep learning
NumPyOpen SourceWersja 1.21.0Numeryczne przetwarzanie tablicowe
NVIDIA GeForce NVIDIA CorporationGTX 1650 Ti (4 GB VRAM)Jednostka przetwarzania grafiki używana do przyspieszonego treningu modeli
Zestaw danych Sonera Satellite Change Detection (OSCD)ONERAPublicznie dostępny optyczny zestaw danych RGB i wielospektralnych obrazów wykorzystywany do treningu i oceny.https://rcdaudt.github.io/oscd/
PythonPython Software FoundationWersja 3.8Język programowania używany do implementacji algorytmów
PyTorchMeta AI (Open Source)Wersja 1.12.1Otwartoźródłowe ramy głębokiego uczenia użyte do opracowania i trenowania proponowanego modelu
Scikit-learnOpen SourceWersja 1.0.2Metryki oceny wydajności
SZTAKI AirChange Benchmark DatasetSZTAKIPublicznie dostępny optyczny zestaw danych z powietrza RGB wykorzystywany do treningu i oceny.http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
TorchvisionMeta AI (Open Source)Wersja 0.13.1Ładowanie zbiorów danych i transformacje obrazów
System WindowsMicrosoft11System operacyjny 

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles