Method Article

衛星画像変化検出のためのスパース特徴量変換ネットワークを用いたインタラクティブなマルチスケール注意融合

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究は、衛星画像の変化検出を向上させるために、スパース特徴畳み込みネットワークを用いたインタラクティブマルチスケールアテンション融合モデルを提示します。この手法は、マルチスケール特徴抽出、注意への選択的焦点、スパース畳み込みを活用し、計算複雑さを削減することで二時的衛星画像の変化を効果的に検出・局在化します。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

二時的衛星画像を用いた変化検出は、地球モニタリングにおける重要な課題であり、時間的な取得と季節サイクル、大気要因、人工的発展による実際の疑似変化を識別し、局所化することを目的としています。現在の深層学習手法は、時間モデルにおいて一方通行のバイアスを抱えており、大規模な空間関係の利用性を制限し、変化パターンの適切な特徴付けを可能にしています。最近のトランスフォーマーベースの技術は非常に高精度ですが、計算要件も非常に大きいため、資源制約のあるタスクでの利用が制限されています。これらの制約に対応するため、ゴーストモジュールに基づくスパース特徴畳み込み(SFC)を用いたインタラクティブマルチスケール注意融合(IMAF)ネットワークを提案し、効果的なマルチスケール特徴抽出を実現します。このネットワークは、異なるスケールのインタラクティブな注意モジュールを補完した高度なエンコーダー・デコーダアーキテクチャを利用しています。このネットワークは補完的な順方向と後方の注意ストリームで動作します。前者は進行的な時間変動を記録し、後者は逆時間分析によって変化の一貫性を確認します。このインタラクティブな手法は、計算負荷を抑えつつ時間的関係の二重モデルを効果的に表現し、正当な土地被覆移動とノイズによる変動を伴わないノイズを区別するより良いアプローチを強化します。2つのベンチマークデータセットが実験されています:Onera衛星変化検出データセット(OSCD)とSZTAKIエアチェンジデータセットです。OSCDデータセットでの重要な実験の結果、提案されたアプローチは、わずか213Mパラメータ、19.6G FLOPS、19倍の少数パラメータ、5.6倍の推論ターンオーバーで、ChangeFormerと比較して58.14%(13チャネル)および50.68%(3チャネル)と競争力のあるF1率を達成していることが示されました。 SZTAKIデータセットのSzada/1およびTiszadob/3テストセットサンプルでの競争力、それぞれ74.29%と92.86%のF1スコアは、運用エネルギーが計算エネルギーに直接依存する最もエッジデバイス、リアルタイム分析、広範なマッピングシステムへの実装を可能にします。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

地球環境における前例のない都市化、環境資源の損失、気候による景観の変化は、地球表面の変化を特定・測定できる正確でタイムリーかつ自動的な監視システムの提供の必要性を直接引き起こしました。衛星リモートセンシングは、時間的・空間的に一貫したカバレッジを提供するだけでなく、変化の完全な検証にも不可欠であるため、大規模な環境監視の基本的な構成要素として成長しています。バイタイム・サテライト画像の変化検出とは、同じ地理的地域における2つの連続取得間の表面変化を特徴づける技術です。しかし、季節の変化、天候条件、センサーの特性、幾何学的歪み、そして土地の実際の実態を曖昧にしたり似せたりする現象学的変化など、多くの交絡変数が絡むため、このプロセスは複雑です。現在使用されている衛星画像の手動画像解釈は時間がかかり主観的であり、現在の衛星コンステレーションによって生成される地球観測情報の量が絶えず増加するには適していません。これが、自動変更検出ソリューションの創出を生んだ基本的な制約です。従来のピクセルベースの1 およびオブジェクトベースの変化検出2 の手法は、これらの複雑さの制約内で動作するには適さが低く、広範な地理的単位や時間スケールに適用するための堅牢性の基準も低い傾向があります。ディープラーニングアーキテクチャ、特に畳み込みニューラルネットワークやその変種は、変化を識別するために必要な低レベルのスペクトル詳細や高レベルの意味パターンを表す階層的特徴の抽出を可能にします。ディープラーニングの変化検出モデルは、リモートセンシングデータにおける潜在的な時空間変化を捉え、外部要因によってもたらされる真の土地被覆と疑似変化の識別において非常に有望であることが証明されています。これらのエンドツーエンド学習アプローチは、特徴を抽出し、分類を同時に最適に実行できるという事実を活用しています。変更検出の精度は大きく進歩しているものの、既存の多くの手法は実際の運用環境での展開が依然として困難です。トランスを用いたアプローチ3は、グローバルな文脈では効率的であるものの、パラメータ数が多く、計算の複雑さが二次に高まり、推論遅延が高く、エネルギー消費も高いです。一方、シャムCNNベースのアーキテクチャは効率が優れていますが、受容野が小さく、グローバルな文脈モデリングが大部分不足しているため、性能が大幅に低下します。これらの制約は、大規模かつ資源制約のある環境ではさらに悪化し、スケーラビリティや運用コストが重要な考慮事項となります。スケーラビリティ、エネルギー効率、推論の速度は緊急対応の場面で頻繁に重要であり、性能と展開性のバランスを取ったソリューションを作成する必要があります。したがって、精度重視の計算集約型モデルと実際の展開の実務要件との間にギャップが残っています。

これらの問題を克服するために、効率的で展開可能な変化検出フレームワークの設計に焦点を当てた、スパース特徴量畳み込み(SFC)ネットワークを用いたインタラクティブマルチスケール注意融合(IMAF)が提案されています。提案されているソリューションは、通常はRGBまたは高解像度の多波長画像(0.5〜30 m解像度)で、Landsat、Sentinel-2、またはWorldViewなど衛星によって取得される光学衛星画像ペアに焦点を当てています。この手法は、二時点対の正確な幾何学的共定位を前提としており、登録誤差も検出に大きな影響を与えることがあります。これは二項変化検出(多クラスの意味変化とは異なり)を扱い、さまざまな変化タイプを区別できません。さらに、この方法は放射学補正画像を用いて、季節的、大気、照明の変化の影響を軽減します。これらは土地被覆の変化と誤認されがちです。従来のシャムCNNs4が単純な連結で二時点画像を分離するのに対し、提案されているIMAFモジュールは、グローバルおよび局所の特徴のマルチスケール文脈融合を可能にします。最近のトランスフォーマーベースのアプローチ、例えばBIT5やChangeFormer3は非常に良い結果を得ていますが、自己注意機構の複雑度はO(N2)です。提案されたフレームワークは双方向の注意で微妙な変化を捉え、計算複雑さと推論遅延を低減します。さらに、提案された設計はスパーシティ認識能力を持ち、UNet++6,7やSNUNet8のような高密度マルチスケール融合設計よりも優れています。ゴーストモジュールを用いたスパース特徴量畳み込みはFLOPを約50%削減し、表現品質を保ちます。したがって、提案されたフレームワークは、資源制約の厳しい環境での信頼性の高い展開に対して、精度と効率のトレードオフを重視しています。

本研究の主な貢献は以下の通りです:(i) トランスベースのものと比べて19分の1少ないパラメータで競争力のあるF1スコアを達成する軽量変化検出器。(ii) 従来の自己注意メカニズムの二次計算コストなしにグローバルな文脈情報を得るインタラクティブなマルチスケール注意融合モジュール。(iii) ゴースト加群に基づく特徴スパーシティを持つ畳み込みスキームで、浮動小数点演算を49.4%最小化しつつ特徴表現の品質劣化がない。(iv) 多数のベンチマークデータセットに対する広範な実験検証を行い、効率と精度のトレードオフが向上し、実際の応用が合理的な実用性を持つこと。

本稿の残りの部分は以下のセクションで構成されています。第2節では、二元変化検出手法の分野での最近の研究を広範に概観し、特にディープラーニングソリューションとその標準ベンチマークでの実装に注目しています。第3節では、提案された解決策の理論的背景と構造設計、時間的融合メカニズムと注意要素の数学的表現、実験セットアップの特徴、データセット、評価指標、再現性のある研究を生み出すために必要な実装の詳細が示されています。第4節では、アブレーションを含む詳細な実験結果を示し、OSCDおよびSZTAKIのエアチェンジデータセットにおけるさまざまな地理的地域における容量を説明する最新の二値変化検出アルゴリズムとの比較を紹介します。第5節は、発見の結果、現行アプローチの限界、そして変化検出における将来の研究の可能性を定めます。

リモートセンシングにおける変化検出アルゴリズムの開発は、ピクセルベースの手法から深層学習フレームワークへと大きく変化しました。初期の変化検出手法は主に画像差分、画像配分、変化ベクトル解析などの代数的プロセスに基づいており、ピクセル値に直接作用して時間的変化を検出していました。分類後比較を含む代替手法が開発され、各時間画像を独立に分類し、クロスタブ化11と比較されました。オブジェクトベースの変化検出技術は、空間的文脈の導入とピクセルレベルのノイズの軽減に伴い、重要な進展の一歩を示しました 2,12

ディープラーニング技術の登場は、リモートセンシングの変化検出の分野を革命的に変え、従来の手法におけるいくつかの制約を克服する道を開きました。近年、畳み込みニューラルネットワーク(CNN)は、自動特徴抽出および変化分類の標準アーキテクチャとなっています。Siamese NestedUNet for Change Detection14およびSiamese Swin-Unet15は、密に接続されたシャムネットワークトポロジーにより、ネットワークの階層全体にわたる位置情報の効果的な保持に役立つ重要な革新として登場しました。

高解像度光学リモートセンシングにおける二時的変化検出の問題は、さまざまな交絡因子のため依然として解決が困難であり、注意に基づく多スケールトランスネットワークと複雑な特徴融合戦略が提案されています。EGMT-CDフレームワークは、雲被覆のため相同画像がアクセスできない異種画像ペアのエッジガイド型マルチモーダルトランスフォーマーを提案しました。DASUNetのようなアーキテクチャは、手動ディープラーニングのボトルネックを突破し、CDDデータセット上でSNUNet-24に比べて、改善された勾配フロー18を用いて、手動ディープラーニングのボトルネックを突破しました。ハイブリッドCNN-トランスフォーマーモデルは、周波数成分に追加のオンコストを付与することで、偽陰性の問題に高コストで対処します。しかし、ハイブリッドU字型トランスネットワーク20は、局所的・グローバルな特徴の統合や、周期的に発生する領域の変化を提供するのが依然として困難です。マルチタスクの意味変化検出や正確な位置・クラス識別の使用は、バイナリタスクと比べてより複雑です。二時的相関は、大きな構造的変化なしにクロスアテンションによって成功裏にモデリング可能です14,23。視点言語パラダイム表現も最近のフロンティアであり、CLIPベースのデザインはテキスト説明を変化対応に組み合わせ、ラベル付きデータへの依存を排除する半教師ありパターン24チェンジ・マンバは時空モデルの状態空間モデルを提示します26,27。特殊な注意手法のさまざまな応用例が示されており、ハイパースペクトル異常検出28、多領域ターゲット分類29、限定ラベルセグメンテーション30の利用、そしてリモートセンシング分析における注意メカニズムの柔軟性を示しています。

著者方法/アーキテクチャ技術仕様主要なイノベーションと成果/データセットパフォーマンス
シン、A. [8]伝統的な方法ピクセルベース差分、CVAデジタル変化検出フレームワーク、複数データセット、精度:65〜80%
マス、J.F. [10]分類後独立時間分類比較方法論分析、熱帯画像、OA:72-85%
Lu ら [9]伝統的な方法代数演算、CVA、PCA包括的な技術比較、複数の情報源、正確性:70-88%
ベネデク&シラーニ [23]混合マルコフモデル多層条件付き枠組み確率的変化モデリング、Sztaki AirChange、DA:92.1%
ブラシュケ、T. [2]オブジェクトベースセグメンテーションベース分析空間的コンテキスト統合、各種HR画像、SA:85-92%
チェンら [11]オブジェクトベースマルチスケールセグメンテーション階層的オブジェクト分析、HR画像、OA:87.3%
Zhanら [12]シャムCNN5層CNN、カーネルサイズ3×3CDおよび航空画像のためのディープシャムアーキテクチャ、F1: 0.847, IoU: 0.735
ダウトら[4]シャムFCNFC-EF、FC-Siam-diff、FC-Siam-conc早期・後期融合戦略、OSCD、F1: 0.431、IoU: 0.276
Pengら[26]UNet++ネストされたU-Net、密集スキップ接続マルチスケール特徴集約、HR衛星、F1:0.753、IoU:0.604
チェン&シー [25]空間的・時間的注意注意ブロック、時間的モデリング時空間特徴学習、LEVIR-CD、F1: 0.887, IoU: 0.797
ファングら[7]SNUNet-CDシャムネステッドUNet、密接続情報伝達最適化、LEVIR: F1: 0.897、WHU: F1: 0.904
チェンら[5]ビットCDResNet18 + Transformer encoderバイナリ時間特徴学習、OSCD: F1: 0.635、LEVIR: F1: 0.919
バンダラ&パテル [3]チェンジフォーマー階層型トランスフォーマーエンコーダマルチスケールトランス注意、OSCD: F1: 0.654、LEVIR: F1: 0.905
Songら[27]ACANet(アカネット)軸方向注意+CNNバックボーン効率的な注意計算、LEVIR: F1: 0.901、WHU: F1: 0.913
Shi ら [28]レビューペーパー包括的なAI手法調査AIアプローチの体系的分析、50+データセットを解析
Li ら [14]AMST-Netマルチスケールトランス、ピラミッド注意適応型マルチスケール特徴抽出、HR光学画像、mIoU: 0.823
Xiangら[15]EGMT-CDエッジ誘導マルチモーダルアーキテクチャクロスモーダル特徴アラインメント、異質ペア、F1:0.756
ミャオら [16]ダスネット密集監督、フルスケールの核融合すべてのデコーダレベルでの深い監督、CDD:SNUNetよりF1が0.85%改善
Tang ら [29]シャム・スウィン・ユネットスウィントランスフォーマー+Unet融合階層的ウィンドウ注意、LEVIR: F1: 0.923、WHU: F1: 0.925
Wu ら [18]ハイブリッドUトランスUNet++ バックボーン + トランスフォーマーブロックグローバル・ローカル特徴量積分、HR画像、IoU: 0.851、F1: 0.919
ドンら [20]チェンジクリップCLIPベースの視覚言語マルチモーダル意味理解、RSペア、意味正確率:94.1%
Li ら [21]セミCD-VLセミ教師ありビジョン言語注釈要件の削減、限定ラベル、F1:0.889
チェンら[22]チェンジマンバ状態空間モデル(SSM)線形複雑度、時間的モデリング、RS画像、効率:3倍高速化

表1: リモートセンシングにおける変化検出手法の概要 この表をダウンロードするにはこちらをクリックしてください。

過去の研究の概要は 表1に示されています。従来の手法は複雑な時空間的変動に適さない手作業の機能を持ち、深層学習アーキテクチャ(UNet、FPN、PSPNet)は計算コストの高い密集型畳み込みを含みます。現在のモデルには効率的なマルチスケールインフォレーションや動的な注意システムがありません。これらのギャップを埋めるために、本研究ではスパース特徴量畳み込みネットワークを用いたインタラクティブマルチスケールアテンションフュージョンを提案しており、スケールを超えた微妙な変化を捉えつつ、特に都市や人工的な構造変化に関するリモートセンシングにおいて計算効率を追求することを目指しています。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 倫理声明

  1. 本研究で使用されるOnera衛星変化検出(OSCD)およびSZTAKI AirChangeデータセットは、多様な地理的特徴をカバーする公開されているRGBおよび多波長画像で構成されています。これらのデータセットには制限データや機密データが含まれていません。したがって、この作業に倫理的同意は必要ありません。

2. 資材と装備

  1. Intel Core i7 10870Hプロセッサ、NVIDIA GeForce GTX 1650 Tiチップ(4GB VRAM)、32GB RAMを搭載したWindows 11コンピュータでテストを行います。
    注意:プログラミング環境はPython 3.8で、ディープラーニングの実装にはPyTorchフレームワーク(バージョン1.12.1)とTorchvision(バージョン0.13.1)に依存しています。
  2. scikit-learn(バージョン1.0.2)などの機械学習ユーティリティやNumPy(バージョン1.21.0)などのライブラリをダウンロード・インストールできます。
  3. グラフィックカードのアクセラレーションを活用できるように、NVIDIA社が提供するCUDA Toolkitバージョン11.3とcuDNNバージョン8.2を必ずインストールしてください。
  4. 公開されているOSCDおよびSZTAKIエアチェンジデータセットを用いて、パフォーマンスを訓練・評価します。

3. データセットの準備

  1. OSCD4は光学RGB衛星の航空画像と多波長画像で構成されており、それぞれ600×600ピクセル、解像度10m、および13組の光学航空画像ペア(それぞれ952×640ピクセル、解像度1.5m/ピクセル)で構成されるSZTAKI AirChange32 データセットをベンチマークデータセットとして選択します。
  2. OSCDデータセットの24都市を、固定された事前定義された14都市(訓練用都市)と10都市(テスト用都市)に分割します。
  3. SZTAKI AirChangeデータセットから固定された非ランダム化Szada/1およびTiszadob/3画像ペアをテストセットに割り当て、残りの画像ペアをトレーニングセットとして従来のベンチマークとして割り当てます。
  4. テストセットで変更検出を行い、各データセットの注釈付き画像ペアを用いて単一実行でのパフォーマンスを定量化します。

4. 前処理

  1. パッチベースの前処理を適用してください。
    1. 同一地点の時間画像ごとに独立して画像パッチを抽出し、高解像度衛星画像を効率的に管理します。
    2. 各画像を128ピクセル×重なるパッチに分割し、64ピクセルのストライドで分けます。
    3. 隣接するパッチ間の重なり合う領域を整列させ、境界の一貫性を維持し、エッジ情報を保持します。
  2. クラスごとにデータ拡張を行います。
    1. トレーニング中に、ペア内の両パッチに変化ピクセルの割合に基づいて差分増強を適用し、「変化」領域と「変化なし」領域のクラス不均衡を処理します。
    2. 1%のピクセル変化を取るパッチ>ペアを6回補強します。以下の変換方法を用いてください:水平および垂直の反轉、90°回転、色ジッター(明るさ、コントラスト、彩度±30%)、アフィン変換(15°回転、10ピクセル±平行移動、95〜105%のスケーリング±)。
    3. 変更なしパッチペアは1回だけ補強してデータセットのバランスを崩さないようにしてください。
      注:この補強戦略はクラスをベースにしており、変化領域と変化なし領域でバランスの取れたトレーニングを提供します。
  3. 画像の正規化と品質向上。
    1. すべてのパッチをImageNetの平均および標準偏差を用いて正規化します:平均=(0.485, 0.456, 0.406)、Std = (0.229, 0.224, 0.225)。
      1. LABカラースペース(Lチャンネルのみ)で、コントラスト制限付き適応ヒストグラムイコライゼーション(CLAHE)を用い、クリップリミット=2.0、タイルグリッドサイズ=8×8で、コントラストの低い部分のコントラストを明るくし、画像上で特徴を区別できるようにし、強度は[0,255]に正規化します。
      2. 128×128ピクセル未満のパッチはクリアし、小さいパッチは大きなパッチと同じサイズにし、モデルトレーニング中に空間的な整合性を保つようにパッドを重ねます。

5. モデル構成

  1. 入力と出力を定義してください。
    1. 提案されたフレームワークは、異なる時間的インスタンスで取得された共登録衛星画像I1I2∈RH×W×Cのペアを入力として受け取り、変化領域と変わらない領域を正確に区分する二値変化マップM∈R H×W×2を生成する。
  2. 提案された枠組み
    1. 提案されたフレームワークを3段階の処理パイプラインとして処理します。第1段階では、入力列に対して時間的注意モデリングを行い、時間経過の変化を捉えます。
    2. 時間的注意モデリング段階で、双方時間的特徴間の対称的な時間的依存性を捉えるためにインタラクティブクロスアテンションを用いましょう。
    3. 第2段階では、空間分解能が徐々に低下し、特徴寸法が増加する間、時間的にモデル化された画像から関連特徴の階層的表現を抽出します。
    4. スキップ接続デコーダを用いて適応型アップサンプリングを行い、再構成段階で高解像度の変化マップを作成しつつ、低スケールの空間ディテールを保持します。
      注: 図1 は、入力された二時点衛星画像から共有エンコーダー、中間クロスアテンション処理ブロック、デコーダまでの全体のデータフローを示しており、これらがすべて変化検出マップを生成します。
  3. スパース特徴エンコーダー
    1. Ghost畳み込みブロック(比率=2)から構成し、バッチ正規化とReLU活性化関数を逐次適用して計算複雑さを減らしつつ表現品質を維持する軽量エンコーダを構築します。
    2. エンコーダは以下の3種類のブロックから順番に組み立てます。
      ブロック1:Ghost(44歳、32 in_channels → → BN ReLU Ghost(32 →& 64 44 BC → BN ReLU MaxPool(2×2)
      ブロック2: Ghost(64 → 96) → BN ReLU Ghost(96 → 128) → BN ReLU MaxPool(2×2)
      ブロック3: ゴースト(128→128)→ BN ReLU
    3. ブロックを接続してエンコーダ内の特徴量の流れを滑らかに保ち、後続の段階で空間分解能を保ちます。
      注:この手法の核心的な革新は、双方向画像間の対称的な特徴相互作用を可能にするインタラクティブなクロスアテンション機構にあります。各画像ペアに対して、深部特徴F1、F 2∈R B×C×H'×W'を抽出し、H' = H/4、W'=W/4、C=128が特徴次元を表します。これらの空間的特徴は空間的列の長さを表す列形形式に再形成され、D=Cは特徴次元を表しfigure-protocol-1
  4. 時間的注意モデリング
    1. 図2に示すように、標準的なスケールドット積注意の定式化を用いてクロスアテンション操作を実装します
      figure-protocol-2
      ここで、Q、K、Vはそれぞれクエリ行列、鍵行列、値行列を表し、dk は鍵ベクトルの次元を表します。
      注:h=8ヘッドの多頭注意力は、異なる時間的関係を同時に捉えるために各スケールで独立して用いられます。各注意ヘッドは特徴表現の異なる部分空間を処理するため、モデルは時間的変化のさまざまな側面に焦点を当てることができます。
    2. マルチヘッドの注意出力は次のように計算します:
      マルチヘッド (Q,K,V) = コンキャット(ヘッド1,...,ヘッドh ) WO
      figure-protocol-3は学習された射影行列です。
  5. 対称的なインタラクティブアテンション
    1. インタラクティブアテンション戦略は、前後の操作を通じて対称的な変化情報を捉えます( 図3参照)。前方注意は、最初の時間像の特徴が第二の時間像の特徴に注意を向けることを可能にします。計算方式は次の通りです:
      figure-protocol-4
      最初の時間的特徴はクエリとして機能し、2番目の時間的特徴はキーと値を提供します。
    2. 逆に、後方注意は第二の時間像の特徴が第一時間像の特徴に注意を向けることを可能にし、次のように定式化されます。
      figure-protocol-5
      両方向からの注意特徴は連結され、線形変換を経て投影されて最終的な注意付き表現が得られます。
      figure-protocol-6
      注:このインタラクティブな仕組みにより、時間的関係が対称的に記録されることが保証され、入力画像の順序にネットワークが不変となることが重要であり、時間的配列が検出結果に偏りを与えない変化検出アプリケーションにおいて重要です。
  6. デコーダと変換マップの再構成
    1. 注意された特徴をスキップ接続を通じてエンコーダ出力と統合し、空間の詳細を保持します。
    2. 全てのデコーダ段階で同一パラメータでバイリニア補間を適用し、スキップ接続間の完璧なアライメントを確保するための適応型リサイズを行います。
    3. 第1段階では、ゴースト畳み込みでチャネルを256ピクセルから96ピクセルに減らし、H/4×W/4でアップサンプリングしてH/2×W/2にし、対応するエンコーダ機能と融合させます。
    4. 第2段階では、ゴースト畳み込みを用いたプロセス機能により、チャネルを160ピクセルから64ピクセルに削減し、H×Wをフル解像度にアップサンプリングし、エンコーダレベルのスキップ機能と統合します。
    5. 最後に、ゴースト畳み込みを適用してチャンネル数を32に減らし、最終的な1×1畳み込みを使って2チャンネルのバイナリチェンジマップを生成します。
    6. すべてのアーキテクチャコンポーネントを統合し、一貫した変更検出システムとして統合した以下のアルゴリズムフレームワークを通じて、完全な処理パイプラインをまとめます。
      注:記法:Eki はレベル k の画像 i ∈ {1,2} からのエンコーダ特徴を示します。Fi は最終的なエンコード特徴です。 figure-protocol-7はその平坦化版です;figure-protocol-8 は注意力を増強する特徴です。Aは注意行列です。Dj はデコーダ出力です。φk,ψ j はエンコーダ/デコーダブロックです。[·;·]はチャネルごとの連結を示します。Woutは出力層カーネルです。
      「インタラクティブなマルチスケール注意融合に基づく変化検出」については 補足ファイルアルゴリズム1 を参照してください

figure-protocol-9
図1:提案された方法論 この図の拡大版はこちらをクリックしてご覧ください。

figure-protocol-10
図2:クロスアテンションアーキテクチャ この図の拡大版はこちらをクリックしてください。

figure-protocol-11
図3:インタラクティブなクロスアテンションアーキテクチャ この図の拡大版はこちらをクリックしてください。

6. 訓練手順

  1. 損失関数
    注:トレーニングプロセスでは、変化検出データセットでよく見られるクラスの不均衡に対応するためにフォーカルトヴェルスキー損失関数が用いられています。
    1. 損失関数を次のように定式化します:pi ∈ [0,1] をピクセル i の予測確率、gi ∊ {0,1} を対応する基底真理とします。トヴェルスキー指数(TI)は次のように定義されます:
      figure-protocol-12
      ここでαとβはそれぞれ偽陽性と偽陰性のペナルティを制御し、εは平滑化項です。
    2. 次に、焦点トヴェルスキー損失を次のように表します。
      figure-protocol-13
      γは分類が難しいピクセルへの焦点を調整しています。
  2. ハイパーパラメータ構成
    1. 列車集合に対して5重クロス検証に基づく体系的グリッド探索を適用し、最適な値を選択します。
    2. 変化検出タスクの損失加重係数をα = 0.3、β = 0.7、γ = 1.0、ε = 1.0 に設定します。これらの値は誤検知よりも見逃し検出を最小限に抑えることを重視しており、変化が比較的稀なアンバランスデータセットにおいて重要です。
      注:β > αの非対称重みはリコールに焦点を当てており、偽陰性が偽陽性よりも重み付けされ、特に災害監視用途において設計上一貫しています。
  3. 最適化器と学習戦略
    1. 正則化を改善し過学習を防ぐために、重み減衰が1×10⁻⁴のAdamW最適化器を用いましょう。
    2. 学習率を1×10⁻³で初期化し、コサインアニーリングスケジュールを適用して、訓練中の収束がスムーズかつ安定するようにします。
    3. 4GBのGPUメモリ環境との互換性を維持するために、バッチサイズを8にしてください。
  4. トレーニングスケジュール
    1. モデルはOSCD上で別々に訓練し、訓練用に14組の事前定義ペアとテスト用に10組のペアで構成され、その後SZTAKIのAirchangeデータセットでSzada/1およびTiszabob/3を標準テストセットベンチマークとして使用します。
    2. トレーニングペアを5つのフォールドに分け、各イテレーションで1つのフォールドを検証セットとして使い、最大100エポックまでトレーニングを続けます。
    3. 各折り返し終了時の検証損失を監視し、収束が安定したら10エポックの早期停止基準を適用して過学習を防ぎ、不要な計算を削減します。
    4. すべてのフォールドで最良の平均検証性能に基づいてハイパーパラメータを選択します。
    5. テストセットで変更検出を行い、各データセットから注釈付き画像ペアを用いて単一実行のパフォーマンスを定量化します。
  5. メモリ最適化
    1. グラデーションチェックポイントを有効にして、バックワードパス中の中間アクティベーションを再計算することでGPUメモリ使用率を約40%削減します。
    2. 数値的に安定しているFP16演算を活用できる混合精度トレーニングを可能にし、速度を向上させメモリ負荷を軽減します。
    3. 適応型バッチサイズスケーリングを使って、GPU効率を最大限に高めるためにメモリ使用量を動的に調整します。

7. 評価

  1. テスト都市のパッチがトレーニングや検証に含まれないようにし、データの漏洩を防ぎましょう。
  2. 画像パッチと対応するグラウンドトゥルースマップをバッチごとに評価するために整理します。
  3. 検証損失によって決定された最も性能の良いエポックから訓練済みのモデル重みを読み込みます。
  4. 確率マップを二値変化マップに変換するには、閾値0.5を選択します。
  5. ピクセル単位の評価指標を計算して変化検出性能を測定する10
    精度(P):予測される変化ピクセルのうち真の変化ピクセルの割合。
    リコール(R):真の変化ピクセルのうち正しく検出された割合。
    F1スコア:精度と記憶力の調和平均。
  6. 128×128ピクセル、ストライド64ピクセルのモデルを訓練・評価しながらリアルタイムで画像パッチを作成します。
    注:このような動的生成は記憶の有効性と境界の一貫性を保証します。
  7. 前処理やパッチ配置の正確性は、理解可能な、または中間レベルの特徴画像として作成された代表的なパッチサンプルを調べて確認します。
    注:CNNベースのエンコーダによって生成された符号化特徴表現は、テンソルの形でメモリに保存され、後の段階で使用するため、特徴検証時のチェックポイントとして機能します。生成された変更マップは通常の画像ファイル(e.g. PNGまたはTIFF)として保存され、視覚的に表示されて特定された変更を評価できます。
  8. モデルトレーニング中に収束指標(損失曲線、精度指標)を記録し、モデルのポイントが指定された間隔で保存されているかを確認し、トレーニングプロセス全体を繰り返し、洗練、または回復できるようにします。
    注:出力フォーマット、検証ステップ、チェックポイントの詳細を明示的に示すことで、透明性を確保し、検証を段階的に行えるようにし、プロトコルが他の研究者によって再現・検証されることも可能となります。このプロトコルは、データセットの準備方法や前処理フェーズ、ネットワーク構築、トレーニング、評価の進め方について、詳細かつ詳細なワークフローを提供します。手順に従うことで、指定された条件下で提案された手法を繰り返し可能な方法で実装できるようになります。このような手続きの結果は、以下の結果セクションに示されています。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

提案された変化検出方法は、2つの公開されているベンチマークデータセットを用いて確立されたベースライン手法と比較して評価し、異なるスペクトル分解能や環境条件での性能を評価しました。実験結果は、誤陽性コントロールと検出精度のバランスにおいて大きな改善を示し、特に従来の手法と比較して高いリコール率を維持しつつ精度を大幅に向上させる能力を示しています。

データネットワーク精度(%)リコール率(%)F1(%)
OSCD-3チャンネルシャム。[11]21.5779.433.85
OSCD-3チャンネル

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究は、二時的衛星画像の変化を検出するためのインタラクティブなマルチスケールの注意融合型変化検出ネットワークを提示します。双方向注意メカニズムの統合は、単方向手法とは異なり、補完的な前方・後方注意信号による完全な時間横断的な特徴間相互作用を促進します。前方注意ストリームの進行的な時間的変化は注意差、すなわち古い時間的獲得によって捉えられ、変化の一貫性はポッピング特徴を認識する後方獲得システムによってチェックされます。この2帯構造は、実際の土地被覆の変化や騒音を分離するのにより効果的であることが証明されており、これは運用変化検知システムの最も長く続く課題の一つとされています。

2つの難易度の高いベンチマークデータセットでの実験的検証により、提案された方法論がさまざまな地理的環境や空間解像度に対して有用かつ実現可能であることが確認されました。提案された方法はOSCDサンプルに対して36.44%の精度、79.67%のリコール率、50.68%のF1スコアを達成しました。これは、包括的な変更検出が必要な環境で特に高い数値...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者たちは利益相反がないと宣言しています。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、公共、商業、非営利分野のいかなる資金提供機関からも具体的な助成金を受けていません。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
CUDAツールキットNVIDIAコーポレーションバージョン11.3ディープラーニング計算のためのGPUアクセラレーション
cuDNNNVIDIAコーポレーションバージョン8.2最適化されたGPU深層学習ライブラリ
インテル プロセッサーインテル・コーポレーションCore i7 10870H提案された深層学習モデルの訓練および評価に使用される計算プラットフォーム
NumPyオープンソースバージョン 1.21.0数値配列処理
NVIDIA GeForce NVIDIAコーポレーションGTX 1650 Ti(4GB VRAM)加速モデル学習に使用されるグラフィックス処理ユニット
Onera衛星変化検出(OSCD)データセットオネラ学習および評価に使用される公開されている光学RGBおよび多分波長画像データセット。https://rcdaudt.github.io/oscd/
パイソンPythonソフトウェア財団バージョン3.8アルゴリズム実装に用いられるプログラミング言語
パイトーチMeta AI(オープンソース)バージョン 1.12.1提案モデルの開発とトレーニングに使用されたオープンソースの深層学習フレームワーク
Scikit-learn(シキット学習)オープンソースバージョン 1.0.2パフォーマンス評価指標
SZTAKI AirChange ベンチマークデータセットシュタキトレーニングおよび評価に使用される公開されている光学RGB航空画像データセット。http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
トーチビジョンMeta AI(オープンソース)バージョン 0.13.1データセットの読み込みと画像変換
Windows OSマイクロソフト11オペレーティングシステム 

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles