Method Article

Интерактивная многомасштабная объединение внимания с сетью свёртки с разрежёнными признаками для обнаружения изменений спутниковых изображений

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании представлена интерактивная многомасштабная модель слияния внимания с сетями разрежённых признаков свёртки для улучшения обнаружения изменений спутниковых изображений. Подход использует преимущества многомасштабного извлечения признаков, избирательного фокуса на внимание и редких свёрток для эффективного обнаружения и локализации изменений на двухвременных спутниковых снимках за счёт снижения вычислительной сложности.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Обнаружение изменений с помощью двухвременных спутниковых снимков — важная задача в мониторинге Земли, которая направлена на выявление и локализацию изменений поверхности между временным приобретением и различение реальных псевдоизменений, вызванных сезонными циклами, атмосферными факторами или техногными изменениями. Современные методы глубокого обучения обычно сталкиваются с односторонним уклоном во временном моделировании, что ограничивает возможность использования крупномасштабных пространственных связей для правильной характеристики изменений. Хотя современные методы на основе трансформаторов очень точны, их вычислительные требования также довольно велики, что ограничивает их использование в задачах с ограниченными ресурсами. В ответ на эти ограничения в этой статье предлагается создать интерактивную многомасштабную слияние внимания (IMAF) с разрежённой конволюцией признаков (SFC) на базе модулей Ghost для эффективного извлечения многомасштабных признаков. Сеть использует продвинутую архитектуру энкодер-декодера, дополненную интерактивными модулями внимания в различных масштабах. Сеть работает с дополняющими потоками вперёд и назад: первый фиксирует прогрессивные временные вариации, а второй проверяет согласованность изменений с помощью обратного временного анализа. Этот интерактивный метод позволяет эффективно представлять дуплексную модель временных отношений без вычислительной сложности, что значительно улучшает подходы к различению законных перемещений земельного покрова от шума без шумовых изменений. Проводятся эксперименты с двумя эталонными наборами данных: набором данных Onera Satellite Change Detection (OSCD) и набором данных SZTAKI AirChange. Значимые эксперименты, проведённые на наборах данных OSCD, показывают, что предлагаемый подход достигает конкурентных скоростей F1 в 58,14% (13 каналов) и 50,68% (3 канала) при использовании всего 2,13 млн параметров и 19,6 G FLOPS, что в 19 раз меньше параметров и 5,6x оборота выводов по сравнению с ChangeFormer. Конкурентная производительность на выборках тестовых наборов Szada/1 и Tiszadob/3 из набора данных SZTAKI, а также F1-баллы 74,29% и 92,86% соответственно, позволяют внедрять в самых передовых устройствах, аналитику в реальном времени и обширные картографические системы, где рабочая энергия напрямую зависит от вычислительной энергии.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Беспрецедентные уровни урбанизации в глобальной среде, потеря экологических ресурсов и изменения ландшафта из-за климата напрямую вызвали необходимость создания точной, своевременной и автоматической системы мониторинга, способной выявлять и измерять изменения на поверхности Земли. Спутниковое дистанционное зондирование стало основой массового экологического наблюдения, поскольку обеспечивает стабильное временное и пространственное покрытие, а также важно для полного изучения изменений. Бивременное обнаружение изменений спутниковых снимков — это характеристика изменений поверхности между двумя последовательными получениями одного и того же географического региона. Однако это сложный процесс из-за множества смешивающих факторов, включая изменения сезонов, погодные условия, свойства сенсоров, геометрические искажения и феноменологические изменения, которые могут скрывать или напоминать реальное покрытие земли. Ручная интерпретация спутниковых изображений, используемая в настоящее время, занимает много времени, субъективна и не подходит для работы с постоянно растущим объёмом информации о наблюдении Земли, генерируемой текущими спутниковыми созвездиями. Это основное ограничение, приведшее к созданию автоматизированных решений для обнаружения изменений. Обычные методы обнаружения изменений на основепикселей 1 иобъектно-основанные 2 обычно плохо подходят для работы в пределах этих сложностей и имеют низкий стандарт устойчивости для применения к широкому диапазону географических единиц и временных масштабов. Архитектуры глубокого обучения, особенно сверточные нейронные сети и их варианты, позволяют извлекать иерархические признаки, представляющие низкоуровневую спектральную детализацию и семантические паттерны высокого уровня, важные для различия изменений. Модели обнаружения изменений с помощью глубокого обучения доказали высокую перспективу для фиксации латентных пространственно-временных изменений в данных дистанционного зондирования и в определении истинного земельного покрова по сравнению с псевдоизменениями, вызванными посторонними факторами. Эти сквозные методы обучения используют возможность выделить признаки и одновременно провести оптимальную классификацию. Несмотря на значительный прогресс в точности обнаружения изменений, большинство существующих подходов остаются трудными для внедрения в реальных операционных условиях. Подходы на основетрансформаторов 3, хотя и эффективны в глобальном контексте, обладают высоким количеством параметров, квадратичной вычислительной сложностью, задержкой вывода и высоким энергопотреблением. Сиамские архитектуры на базе CNN, напротив, превосходят эффективность, но имеют небольшие рецептивные поля и в значительной степени отсутствуют глобальное контекстное моделирование, что значительно ухудшает производительность. Эти ограничения усугубляются в масштабных и ресурсно ограниченных условиях, где масштабируемость и операционные затраты являются критически важными. Масштабируемость, энергоэффективность и скорость выводов часто имеют решающее значение в условиях реагирования на чрезвычайные ситуации, и необходимо создавать решения, балансирующие производительность и возможность развертывания. Таким образом, существует разрыв между моделями, ориентированными на точность, ориентированными на вычислительные ресурсы, и практическими требованиями реального внедрения.

Для преодоления таких проблем предлагается интерактивная многомасштабная объединение внимания (IMAF) с сетью свертки разреженных признаков (SFC), которая сосредоточена на разработке эффективной и развертываемой фреймворка для обнаружения изменений, а не только на оптимизации точности. Предлагаемое решение сосредоточено на парах оптических спутниковых изображений, обычно RGB или высокоразрешённых мультиспектральных изображений (разрешение 0,5–30 м), полученных спутниками, например, Landsat, Sentinel-2 или WorldView. Этот метод предполагает точную геометрическую совместную регистрацию бивременных пар, поскольку ошибки регистрации также могут существенно влиять на обнаружение. Он занимается бинарным обнаружением изменений (в отличие от многоклассовых семантических изменений) и не может различать различные типы изменений. Более того, метод использует радиометрически скорректированные изображения для снижения эффектов сезонных, атмосферных и осветительных изменений, которые можно ошибочно принять за изменение почвенного покрова. В отличие от традиционных сиамскихCNN 4, которые разделяют бивременные изображения с помощью простой конкатенации, предлагаемый модуль IMAF позволяет многомасштабно контекстное слияние как глобальных, так и локальных признаков. Современные подходы на основе трансформаторов, такие как BIT5 иChangeFormer 3, дают очень хорошие результаты, но их механизмы самосознания имеют сложность O(N2). Предлагаемая структура фиксирует тонкие изменения с двусторонним вниманием, снижая вычислительную сложность и задержку вывода. Кроме того, предлагаемая конструкция ориентирована на разрежённость, что превосходит плотные многомасштабные термоядерные конструкции, такие как UNet++6,7 и SNUNet8. Разрежённая свёртка с модулем призрака снижает количество FLOP примерно на 50%, сохраняя качество представления. Таким образом, предлагаемая структура способствует компромиссу точности и эффективности для надёжного внедрения в условиях с ограниченными ресурсами.

Основные вклады этого исследования включают: (i) Лёгкий детектор изменений, который достигает конкурентоспособного результата F1, используя в 19 раз меньше параметров по сравнению с аналогами на базе трансформаторов. (ii) Интерактивный мультимасштабный модуль слияния внимания, который получает глобальную контекстную информацию без квадратичных вычислительных затрат, присущих традиционным механизмам самовнимания. (iii) Схема свёртки с разреженностью признаков, основанная на модулях Ghosts, которая минимизирует операции с плавающей запятой на 49,4 процента без ухудшения качества представления признаков. (iv) Обширная экспериментальная валидация на большом наборе эталонных наборов данных с лучшими компромиссами между эффективностью и точностью и разумной практичностью реального применения в реальной жизни.

Остальная часть этой рукописи включает следующие разделы: Раздел 2 даёт подробный обзор последних работ в области методологий обнаружения бинарных изменений, с особым вниманием к решениям глубокого обучения и их реализации на стандартных бенчмарках. Раздел 3 содержит теоретическую основу и структурное проектирование предлагаемого решения, математическое представление механизма временного слияния и элементов внимания, характеристики экспериментальной установки, наборы данных, метрики оценки и детали реализации, необходимые для создания воспроизводимых исследований. Раздел 4 иллюстрирует подробные экспериментальные результаты, включающие абляцию — сравнения с новейшими алгоритмами обнаружения бинарных изменений, объясняющими пропускную способность в различных географических районах в наборах данных OSCD и SZTAKI Airchange. Раздел 5 определяет результаты результатов, ограничения текущего подхода и возможности будущих исследований в области обнаружения изменений.

Разработка алгоритмов обнаружения изменений в дистанционном зондировании значительно изменилась — от пиксельных методов к фреймворкам глубокого обучения. Ранние процедуры обнаружения изменений в основном основывались на алгебраических процессах, таких как дифференцирование изображений, нормирование изображений и анализ векторов изменений, которые работали непосредственно с значениями пикселей для обнаружения временныхизменений 9,10. Были разработаны альтернативные методы, включающие постклассификационное сравнение, при которых каждое временное изображение независимо классифицировалось, а затем сравнивалось с перекрёстнойтаблицей 11. Методы обнаружения изменений на основе объектов стали важным этапом прогресса с введением пространственного контекста и снижением шума на уровнепикселей 2,12.

Появление технологий глубокого обучения произвело революцию в области дистанционного зондирования обнаружения изменений и открыло путь к преодолению ряда ограничений традиционных методов. В последнее время конволюционные нейронные сети (CNN) стали стандартной архитектурой для автоматизированного извлечения признаков и классификации изменений13,14. Siamese NestedUNet for Change Detection14 и Siamese Swin-Unet15 стали значительным инновациями благодаря плотно связанной топологии сиамских сетей, которая помогает эффективно сохранять информацию о локализации по всей иерархии сети.

Проблема обнаружения бивременных изменений при высокоразрешающем оптическом дистанционном зондировании всё ещё трудно решить из-за множества факторов, и были предложены сети многомасштабных трансформаторов, основанных на внимание, с сложными стратегиями термоядерногосинтеза. Фреймворк EGMT-CD предлагал направляемые по краям мультимодальные трансформаторы гетерогенных пар изображений, где гомологичные изображения недоступны из-заоблачности 17. Архитектуры, такие как DASUNet, преодолевают узкие места ручного глубокого обучения в полномасштабном слиянии функций, с улучшением индекса F1 на 0,85% выше по сравнению с SNUNet-24 на CDD-наборе данных благодаря улучшенному градиентномупотоку 18. Гибридные модели CNN-Transformer решают проблему ложноотрицательных результатов по более высокой цене, предоставляя дополнительную стоимость на частотных компонентах с учёбой19. Однако гибридные U-образные трансформаторныесети 20 всё ещё трудно обеспечить локально-глобальную интеграцию характеристик и изменения в регионах, которые периодически происходят, даже в небольших масштабах. Использование многозадачного обнаружения семантических изменений и точного определения местоположения и классов сложнее по сравнению с бинарнымизадачами 21,22. Бивременные корреляции можно успешно смоделировать с помощью перекрёстного внимания без значительных архитектурныхизменений 14,23. Выражение парадигмы перспективного языка также стало недавним рубежом с КЛИП-дизайнами, сочетающими текстовые объяснения в соответствиеизменений 24 и полуконтролируемые паттерны, исключающие зависимость от маркированныхданных 25. Change Mamba представляет модели пространства состояний пространственно-временныхмоделей 26,27. Показаны различные применения специализированных методов внимания: использование гиперспектрального обнаруженияаномалий 28, многозонной классификациицелей 29 или сегментации с ограниченнойметкой 30, а также демонстрация гибкости механизмов внимания в аналитике дистанционного зондирования.

АвторыМетод/АрхитектураТехнические характеристикиКлючевые инновации и результаты / Результаты наборов данных
Сингх, А. [8]Традиционные методыДифференцирование на основе пикселей, CVAФреймворк для цифрового обнаружения изменений, несколько наборов данных, точность: 65-80%
Мас, Дж.Ф. [10]ПостклассификацияНезависимая временная классификацияСравнительный методологический анализ, тропические изображения, OA: 72-85%
Лу и др. [9]Традиционные методыАлгебраические операции, CVA, PCAВсестороннее сравнение техник, множество источников, точность: 70-88%
Benedek & Szirányi [23]Смешанная модель МарковаМногоуровневая условная структураМоделирование вероятностных изменений, Sztaki AirChange, DA: 92,1%
Блашке, Т. [2]Объектно-ориентированныеАнализ на основе сегментацииИнтеграция пространственного контекста, различные кадры HR, SA: 85-92%
Чен и др. [11]Объектно-ориентированныеМногомасштабная сегментацияИерархический анализ объектов, кадровые изображения, OA: 87,3%
Чжан и др. [12]Сиамский CNN5-слойный CNN, размер ядра 3×3Глубокая сиамская архитектура для CD, аэрофотоснимки, F1: 0.847, IoU: 0.735
Даудт и др. [4]Сиамский ФКНFC-EF, FC-Siam-diff, FC-Siam-concСтратегии раннего/позднего синтеза, OSCD, F1: 0.431, IoU: 0.276
Пэн и др. [26]UNet++Вложенная U-сеть, плотные пропускные соединенияМногомасштабная агрегация признаков, спутник HR, F1: 0.753, IoU: 0.604
Чэнь и Ши [25]Пространственно-временное вниманиеБлоки внимания, временное моделированиеПространственно-временное обучение признаков, LEVIR-CD, F1: 0.887, IoU: 0.797
Фанг и др. [7]SNUNet-CDSiamese NestedUNet, dense connectionsОптимизация передачи информации, LEVIR: F1: 0.897, WHU: F1: 0.904
Чен и др. [5]BIT-CDResNet18 + трансформаторный кодировщикБинарное временное обучение признаков, OSCD: F1: 0.635, LEVIR: F1: 0.919
Бандара и Патель [3]ChangeFormerИерархический трансформаторный кодировщикМногомасштабное внимание трансформатора, OSCD: F1: 0.654, LEVIR: F1: 0.905
Сонг и др. [27]ACANetОсьовое внимание + основа CNNЭффективное расчёт внимания, LEVIR: F1: 0.901, WHU: F1: 0.913
Ши и др. [28]Обзорная статьяКомплексное исследование методов ИИСистематический анализ подходов ИИ, анализ 50+ наборов данных
Ли и др. [14]AMST-NetМногомасштабный трансформатор, пирамидальный вниманиеАдаптивное многомасштабное извлечение признаков, оптические изображения HR, мIoU: 0.823
Сян и др. [15]EGMT-CDМультимодальная архитектура, управляемая краямиКроссмодальное выравнивание признаков, гетерогенные пары, F1: 0,756
Мяо и др. [16]DASUNetПлотный надзор, полномасштабное слияниеГлубокий надзор на всех уровнях декодера, CDD: 0,85% улучшения F1 по сравнению с SNUNet
Танг и др. [29]Сиамский Swin-UNetТрансформатор Swin + термоядерный синтез UnetИерархическое внимание окна, LEVIR: F1: 0.923, WHU: F1: 0.925
Ву и др. [18]Гибридный U-трансформаторМагистраль UNet++ + Блоки трансформаторовГлобально-локальная интеграция функций, изображения HR, IoU: 0.851, F1: 0.919
Донг и др. [20]ChangeCLIPЯзык видения на основе CLIPМультимодальное семантическое понимание, пары RS, семантическая точность: 94,1%
Ли и др. [21]SemiCD-VLПолуконтролируемый язык зренияСниженные требования к аннотациям, ограниченные метки, F1: 0.889
Чен и др. [22]ChangeMambaМодели пространственных состояний (SSM)Линейная сложность временного моделирования, RS-изображения, эффективность: в 3 раза быстрее

Таблица 1: Краткое описание методов обнаружения изменений в дистанционном зондировании Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Краткое изложение предыдущих исследований приведено в Таблице 1. Традиционные методы имеют ручной работы функции, неподходящие для сложных пространственно-временныхвариаций 31, а архитектура глубокого обучения (UNet, FPN, PSPNet) включает вычислительно затратные свёртки. Текущие модели не имеют эффективных систем многомасштабного инкорпорирования и динамического внимания. Для заполнения этих пробелов текущее исследование предлагает интерактивное многомасштабное слияние внимания с сетью свертки с разрежёнными признаками, которая направлена на фиксирование тонких изменений на разных масштабах при одновременной вычислительной эффективности в дистанционном зондировании, особенно в области городских и техногенных структурных изменений.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Этическое заявление

  1. Оба набора данных Onera Satellite Change Detection (OSCD) и SZTAKI AirChange, использованные в этом исследовании, включают общедоступные RGB- и мультиспектральные изображения, охватывающие различные географические характеристики. Эти наборы данных не содержат никаких ограниченных или чувствительных данных. Поэтому для этой работы этическое согласие не требуется.

2. Материалы и оборудование

  1. Проведите тестирование на компьютере с Windows 11 с процессором Intel Core i7 10870H, чипом NVIDIA GeForce GTX 1650 Ti с 4 ГБ видеопамяти и 32 ГБ оперативной памяти.
    ПРИМЕЧАНИЕ: Среда программирования — Python 3.8, а для реализации глубокого обучения основан на фреймворке PyTorch (версия 1.12.1) и Torchvision (версия 0.13.1).
  2. Скачивайте и устанавливайте библиотеки, такие как scikit-learn (версия 1.0.2), содержащая утилиту машинного обучения, и NumPy (версия 1.21.0), содержащую численные операции.
  3. Обязательно установите CUDA Toolkit версии 11.3 и cuDNN 8.2, предоставленные корпорацией NVIDIA, чтобы использовать ускорение видеокарты.
  4. Обучайте и оценивайте производительность с использованием общедоступных наборов данных OSCD и SZTAKI Airchange.

3. Подготовка наборов данных

  1. ВыберитеOSCD 4, который состоит из оптических RGB-спутниковых аэрофотосъёмок и мультиспектральных изображений размером 600 x 600 пикселей с разрешением 10 м, а также набор данных SZTAKIAirChange 32 , состоящий из 13 пар оптических аэрофотоснимков, каждая с разрешением 1,5 м/пиксель в качестве эталонных наборов данных.
  2. Разделите 24 города из набора данных OSCD на фиксированные, заранее определённые 14 городов для обучения и 10 городов для тестирования.
  3. Назначить фиксированные нерандомизированные пары изображений Szada/1 и Tiszadob/3 из набора данных SZTAKI AirChange тестовому набору, а оставшиеся пары изображений — как обычный бенчмарк.
  4. Выполните обнаружение изменений на тестовом наборе и количественно оцените производительность на одном запуске с помощью аннотированных пар изображений из каждого набора данных.

4. Предварительная обработка

  1. Применяйте предварительную обработку на основе патчей.
    1. Извлекайте участки изображений независимо от каждого временного изображения в одинаковых местах на лету для эффективной обработки высокоразрешающих спутниковых снимков.
    2. Разделите каждое изображение на перекрывающиеся участки по 128 × 128 пикселей, используя шаг в 64 пикселя.
    3. Выровнять перекрывающиеся области между соседними участками для поддержания согласованности границ и сохранения информации о краях.
  2. Выполняйте дополнение данных по классам.
    1. Примените дифференциальное дополнение во время обучения на обоих участках пары на основе доли пикселей изменения для обработки дисбаланса классов между регионами «изменения» и «без изменений».
    2. Увеличите пару смены патча (у тех, у кого > 1% пикселей меняются) шесть раз, используя следующие преобразования: горизонтальные и вертикальные перевороты, повороты на 90°, цветовая дрожь (яркость, контраст и насыщенность ± 30%), аффинные преобразования (поворот ± 15°, сдвиг ± 10 пикселей, масштабирование 95-105%).
    3. Дополните пару патчей без изменений только один раз, чтобы избежать дисбаланса набора данных.
      ПРИМЕЧАНИЕ: Эта стратегия усиления, основанная на классах, обеспечивает сбалансированную тренировку в регионах с изменениями и без изменений.
  3. Нормализуйте и улучшайте качество изображения.
    1. Нормализуйте все патчи с помощью среднего значения ImageNet и стандартного отклонения: Mean = (0.485, 0.456, 0.406), Std = (0.229, 0.224, 0.225).
      1. Используйте Contrast Limited Adaptive Histogram Equalization (CLAHE) с ограничением клипа = 2.0, размером сетки плитки =8 x 8 в цветовом пространстве LAB (только L-канал), чтобы осветлить контрасты областей с низким контрастом, чтобы различить элементы на изображении с нормализацией интенсивности до [0,255].
      2. Удалите все патчи размером меньше 128 x 128 пикселей и уменьшите меньшие пятна так, чтобы они были того же размера, что и большие, и сохраняйте пространственную целостность во время обучения модели.

5. Конструкция модели

  1. Определите вход и выход.
    1. Предлагаемая структура принимает в качестве входа пару совместно зарегистрированных спутниковых изображений I1,I 2 R H×W× C, полученных в разные временные моменты, и создаёт бинарную карту изменений M ∈R H×W×2 , которая точно определяет изменённые и неизменные области.
  2. Предлагаемая структура
    1. Обработать предлагаемую структуру в виде трёхэтапного процессорного конвейера. На первом этапе выполните моделирование временного внимания на входных последовательностях для фиксации изменений со временем.
    2. Используйте интерактивное кросс-внимание для фиксации симметричных временных зависимостей между бивременными признаками на этапе моделирования временного внимания.
    3. Извлекать иерархические представления релевантных признаков из временно смоделированного изображения с помощью разреженной архитектуры энкодера на основе признаков на втором этапе, где пространственное разрешение постепенно уменьшается по мере увеличения размера признаков.
    4. Используйте skip-connected декодер с адаптивным апсэмплингом для создания высококачественных карт изменений на этапе восстановления, сохраняя при этом пространственные детали меньшего масштаба.
      ПРИМЕЧАНИЕ: Рисунок 1 показывает общий поток данных от входных двухвременных спутниковых изображений к общему энкодеру, средним блокам перекрестного внимания и декодеру, что вместе приводит к карте обнаружения изменений.
  3. Sparse feature encoder
    1. Создать лёгкий энкодер из сверточных блоков Ghost с ratio=2 с пакетной нормализацией и последовательно применяемой функцией активации ReLU для снижения вычислительной сложности при сохранении качества представления.
    2. Соберите энкодер последовательно из следующих трёх типов блоков.
      Блок1: Ghost (in_channels → 32) → BN ReLU Ghost (32 → 64) → BN ReLU MaxPool (2×2)
      Блок 2: Ghost (64 → 96) → BN ReLU Ghost (96 → 128) → BN ReLU MaxPool (2×2)
      Блок 3: Призрак (128 → 128) → BN ReLU
    3. Соединяйте блоки для поддержания плавного потока функций через энкодер и сохранения пространственного разрешения для последующих этапов.
      ПРИМЕЧАНИЕ: Основная инновация этого подхода заключается в интерактивном механизме перекрёстного внимания, который позволяет симметричному взаимодействию признаков между двувременными изображениями. Для каждой пары изображений извлекаются глубокие признаки F1,F 2∈RB×C×H'×W', где H' = H/4, W'=W/4, C=128 обозначает размерность признаков. Эти пространственные особенности перестраиваются в формат figure-protocol-1 последовательности, представляющий длину пространственной последовательности, а D=C — размерность признаков.
  4. Моделирование временного внимания
    1. Реализовать операцию перекрестного внимания с использованием стандартной формулировки внимания с масштабируемым точечным произведением, как показано на рисунке 2
      figure-protocol-2
      где Q, K и V представляют соответственно матрицы запроса, ключа и значения, а dk обозначает размерность векторов ключей.
      ПРИМЕЧАНИЕ: Многоголовное внимание с h = 8 головами для одновременного захвата различных типов временных отношений применяется независимо на каждом масштабе. Каждая голова внимания обрабатывает разное подпространство представлений признаков, позволяя модели фокусироваться на различных аспектах временных изменений.
    2. Вычислим многоголовый результат внимания как:
      Многоголовая (Q,K,V) = Конкат (голова 1,...,голова h ) WO
      где каждая figure-protocol-3 из них — изученные проекционные матрицы.
  5. Симметричное интерактивное внимание
    1. Интерактивная стратегия внимания фиксирует информацию о симметричных изменениях с помощью операций вперёд и назад (показано на рисунке 3). Вперёдное внимание позволяет признакам первого временного изображения обращать внимание на признаки второго временного изображения, вычисляемые как:
      figure-protocol-4
      где первые временные признаки служат запросами, а вторые временные признаки предоставляют ключи и значения.
    2. Напротив, обратное внимание позволяет признакам второго временного изображения обращать внимание на особенности первого временного изображения, сформулированное так:
      figure-protocol-5
      Присутствующие объекты с обоих направлений объединяются и проецируются через линейное преобразование, чтобы получить итоговое представление с прислуждением:
      figure-protocol-6
      ПРИМЕЧАНИЕ: Этот интерактивный механизм обеспечивает симметричный фикс временных связей, делая сеть инвариантной относительно порядка входных изображений, что крайне важно для приложений обнаружения изменений, где временная последовательность не должна искажать результаты обнаружения.
  6. Реконструкция декодера и изменения карты
    1. Объедините присутствующие функции с выходами энкодера через пропускные соединения, чтобы сохранить пространственные детали.
    2. Применяйте билинейную интерполяцию с одинаковыми параметрами на всех этапах декодера для адаптивного изменения размера, чтобы обеспечить идеальное выравнивание между пропускными соединениями.
    3. На первом этапе уменьшите количество каналов с 256 до 96 пикселей с помощью свёрток Ghost при H/4×W/4, а затем upsample до H/2×W/2 и объединяйте с соответствующими функциями энкодера.
    4. На втором этапе обрабатывайте функции с помощью сверток Ghost, чтобы уменьшить количество каналов с 160 до 64 пикселей, увеличить дискретизацию до полного разрешения H×W и интегрировать с функциями пропуска на уровне энкодера.
    5. Наконец, примените призрачные свёртки, чтобы уменьшить количество каналов до 32, и используйте финальную свёртку 1 × 1 для создания двухканального бинарного отображения изменений.
    6. Краткое изложение полного процессопотока с помощью следующей алгоритмической структуры, которая объединяет все архитектурные компоненты в целостную систему обнаружения изменений.
      ПРИМЕЧАНИЕ: Обозначения: Eki обозначает признаки энкодера из изображения i ∈ {1,2} на уровне k; Fi — это последняя закодированная функция; figure-protocol-7— это уплощённая версия;figure-protocol-8 — это функция с повышенным вниманием; A — матрица внимания; Dj — выходы декодера; φk,ψ j — это блоки энкодера/декодера; [·;·] обозначает конкатенацию по каналам; Wout — ядро выходного слоя.
      См. дополнительный файл Алгоритм 1 для «Интерактивного многомасштабного обнаружения изменений на основе слияния внимания»

figure-protocol-9
Рисунок 1: Предлагаемая методология Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-protocol-10
Рисунок 2: Архитектура перекрёстного внимания Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-protocol-11
Рисунок 3: Архитектура интерактивного перекрёстного внимания Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

6. Процедура обучения

  1. Функция потерь
    ПРИМЕЧАНИЕ: Процесс обучения использует функцию фокальных потерь Тверского для устранения классового дисбаланса, часто встречающегося в наборах данных по обнаружению изменений.
    1. Формулируем функцию потерь следующим образом: пусть pi ∈ [0,1] — предсказанная вероятность для пикселя i,а g i ∊ {0,1} — соответствующая основная истинность. Индекс Тверского (TI) определяется как:
      figure-protocol-12
      где α и β регулируют штраф за ложноположительные и ложноотрицательные соответственно, а ε — это сглаживающий член.
    2. Затем выражаем фокальную потерю Тверского как:
      figure-protocol-13
      с γ модуляцией фокуса на трудно классифицируемых пикселях.
  2. Конфигурация гиперпараметров
    1. Примените 5-кратный систематический поиск по сетке на основе перекрестной валидации на наборе поездов для выбора оптимальных значений.
    2. Установите коэффициенты веса потерь для задачи обнаружения изменений на α = 0,3, β = 0,7, γ = 1,0 и ε = 1,0. Эти значения делают акцент на минимизации пропущенных обнаружений по сравнению с ложноположительными результатами, что важно для несбалансированных наборов данных, где изменения относительно редкие.
      ПРИМЕЧАНИЕ: Асимметричный вес с β > α сосредоточен на отзыве, что означает, что ложноотрицательные результаты оцениваются больше, чем ложноположительные, и соответствует проектированию, особенно в приложениях мониторинга катастроф.
  3. Оптимизатор и стратегия обучения
    1. Используйте оптимизатор AdamW с затуханием веса 1×10⁻⁴ для улучшения регуляризации и предотвращения перенагона.
    2. Инициализируйте скорость обучения на уровне 1×10⁻³ и примените график косинусного отжига, чтобы обеспечить плавную и стабильную конвергенцию во время обучения.
    3. Используйте пакетный размер 8 для поддержания совместимости с средой памяти GPU на 4 ГБ.
  4. График тренировок
    1. Модель обучается отдельно на OSCD, состоящем из 14 заранее определённых пар для обучения и 10 пар для тестирования, затем на наборе данных SZTAKI Airchange с Szada/1 и Tiszabob/3 в качестве стандартных тестовых наборов.
    2. Разделите обучающие пары на пять этапов, используйте один набор валидации в каждой итерации и продолжайте тренировку максимум до 100 эпох.
    3. Следите за потерей валидации в конце каждого сгибания и применяйте критерии ранней остановки в 10 эпох после стабилизации сходимости, чтобы предотвратить переподгонку и сократить ненужные вычисления.
    4. Выбирайте гиперпараметры на основе наилучшей средней валидационной эффективности по всем сгибам.
    5. Выполняйте обнаружение изменений на тестовом наборе и количественно оценивайте производительность при одиночном запуске с помощью пар аннотированных изображений из каждого набора данных.
  5. Оптимизация памяти
    1. Активировать градиентную контрольную точку для снижения использования памяти GPU примерно на 40%, достигаемого путём повторного вычисления промежуточных активаций во время обратного прохода.
    2. Обеспечить смешанную точность обучения для использования операций FP16 при численной стабильности, тем самым повышая скорость и снижая нагрузку на память.
    3. Используйте адаптивное масштабирование размера пакета для динамической настройки использования памяти для максимальной эффективности GPU.

7. Оценка

  1. Убедитесь, что в обучение или валидацию не включены патчи из тестовых городов, чтобы предотвратить утечку данных.
  2. Организуйте участки изображений и соответствующие карты истинности для попакетной оценки.
  3. Загрузите тренированные модели веса из эпохи наилучших результатов, определяемых потерей валидации.
  4. Выберите порог 0,5 для преобразования вероятностных отображений в бинарные изменения отображений.
  5. Рассчитайте попиксельные метрики оценки для оценки производительности обнаруженияизменений 10
    Точность (P): Доля предсказанных пикселей изменений, которые являются истинными пикселями изменения.
    Вспомнить (R): Доля пикселей истинных изменений, обнаруженная корректно.
    F1-score: гармоническое среднее по точности и воспоминаниям.
  6. Создавайте патчи изображений в реальном времени, обучая и оценивая модели с размерами 128 x 128 пикселей и шагом 64 пикселя.
    ПРИМЕЧАНИЕ: Такая динамическая генерация гарантирует эффективность памяти, а также согласованность границ.
  7. Проверьте корректность предварительной обработки и размещения патча, изучив репрезентативную выборку созданных патчей intelligable или среднего уровня изображений функций.
    ПРИМЕЧАНИЕ: Закодированные представления признаков, генерируемые энкодером на базе CNN, хранятся в памяти в виде тензоров для дальнейшего использования на этапах, которые служат контрольными точками при проверке признаков. Полученные карты изменений хранятся в виде обычных файлов изображений (e.g. PNG или TIFF) для визуального просмотра с целью оценки выявленных изменений.
  8. Записывайте индикаторы сходимости (кривые потерь, метрики точности) в обучении модели и проверяйте, сохраняются ли точки модели в определённые интервалы, чтобы весь процесс обучения можно было повторить, уточнить или восстановить.
    ПРИМЕЧАНИЕ: Чёткое представление формата выхода, шагов проверки и деталей контрольных точек помогает обеспечить прозрачность, позволяя проводить проверку пошагово, а также позволяя воспроизводить и проверять протокол другими исследователями. Этот протокол предоставляет подробный и подробный рабочий процесс подготовки набора данных и прохождения этапа предварительной обработки, построения сети, обучения и оценки. Следуя этим шагам, можно реализовать предложенный метод при заданных условиях в повторяемом виде. Результаты такой процедуры приведены в следующем разделе «Результаты».

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предлагаемый метод обнаружения изменений был оценён по установленным базовым подходам с использованием двух общедоступных эталонных наборов данных для оценки его эффективности при различных спектральных разрешениях и условиях окружающей среды. Экспериментальные результаты показывают значительные улучшения в балансе точности обнаружения с контролем ложноположительных результатов, особенно демонстрируя способность метода поддерживать высокие показатели воспоминания при значительном повышен...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании представлена интерактивная многомасштабная сеть обнаружения изменений на основе синтеза внимания для обнаружения изменений на двухвременных спутниковых снимках. Интеграция двунаправленного механизма внимания, в отличие от однонаправленных методов, способствует полноценному межвременному взаимодействию признаков с дополняющими сигналами вперёд и назад. Прогрессивные временные изменения прямого потока внимания фиксируются разницей внимания, то есть от старых к новым в...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конфликта интересов.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование не получило конкретного гранта от каких-либо фондов в государственном, коммерческом или некоммерческом секторе.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Набор инструментов CUDAКорпорация NVIDIAВерсия 11.3Ускорение GPU для вычислений в глубоком обучении
cuDNNКорпорация NVIDIAВерсия 8.2Оптимизированная библиотека глубокого обучения GPU
Intel  процессорIntel CorporationCore i7 10870HВычислительная платформа, используемая для обучения и оценки предлагаемой модели глубокого обучения
NumPyОткрытый исходный кодВерсия 1.21.0Численная обработка массив
NVIDIA GeForce Корпорация NVIDIAGTX 1650 Ti (4 ГБ видеопамяти)Графический процессор, используемый для ускоренного обучения моделей
Набор данных Onera Satellite Change Detection (OSCD)ОНЕРАОбщедоступный оптический набор данных RGB и мультиспектральных изображений, используемый для обучения и оценки.https://rcdaudt.github.io/oscd/
PythonФонд программного обеспечения PythonВерсия 3.8Язык программирования, используемый для реализации алгоритмов
PyTorchMeta AI (с открытым исходным кодом)Версия 1.12.1Открытый фреймворк глубокого обучения, используемый для разработки и обучения предлагаемой модели
Scikit-learnОткрытый исходный кодВерсия 1.0.2Метрики оценки эффективности
SZTAKI AirChange Benchmark DatasetШТАКИОбщедоступный оптический RGB-набор аэрофотоснимков, используемый для обучения и оценки.http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
TorchvisionMeta AI (с открытым исходным кодом)Версия 0.13.1Загрузка наборов данных и преобразования изображений
Windows OSMicrosoft11Операционная система 

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles