$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Беспрецедентные уровни урбанизации в глобальной среде, потеря экологических ресурсов и изменения ландшафта из-за климата напрямую вызвали необходимость создания точной, своевременной и автоматической системы мониторинга, способной выявлять и измерять изменения на поверхности Земли. Спутниковое дистанционное зондирование стало основой массового экологического наблюдения, поскольку обеспечивает стабильное временное и пространственное покрытие, а также важно для полного изучения изменений. Бивременное обнаружение изменений спутниковых снимков — это характеристика изменений поверхности между двумя последовательными получениями одного и того же географического региона. Однако это сложный процесс из-за множества смешивающих факторов, включая изменения сезонов, погодные условия, свойства сенсоров, геометрические искажения и феноменологические изменения, которые могут скрывать или напоминать реальное покрытие земли. Ручная интерпретация спутниковых изображений, используемая в настоящее время, занимает много времени, субъективна и не подходит для работы с постоянно растущим объёмом информации о наблюдении Земли, генерируемой текущими спутниковыми созвездиями. Это основное ограничение, приведшее к созданию автоматизированных решений для обнаружения изменений. Обычные методы обнаружения изменений на основепикселей 1 иобъектно-основанные 2 обычно плохо подходят для работы в пределах этих сложностей и имеют низкий стандарт устойчивости для применения к широкому диапазону географических единиц и временных масштабов. Архитектуры глубокого обучения, особенно сверточные нейронные сети и их варианты, позволяют извлекать иерархические признаки, представляющие низкоуровневую спектральную детализацию и семантические паттерны высокого уровня, важные для различия изменений. Модели обнаружения изменений с помощью глубокого обучения доказали высокую перспективу для фиксации латентных пространственно-временных изменений в данных дистанционного зондирования и в определении истинного земельного покрова по сравнению с псевдоизменениями, вызванными посторонними факторами. Эти сквозные методы обучения используют возможность выделить признаки и одновременно провести оптимальную классификацию. Несмотря на значительный прогресс в точности обнаружения изменений, большинство существующих подходов остаются трудными для внедрения в реальных операционных условиях. Подходы на основетрансформаторов 3, хотя и эффективны в глобальном контексте, обладают высоким количеством параметров, квадратичной вычислительной сложностью, задержкой вывода и высоким энергопотреблением. Сиамские архитектуры на базе CNN, напротив, превосходят эффективность, но имеют небольшие рецептивные поля и в значительной степени отсутствуют глобальное контекстное моделирование, что значительно ухудшает производительность. Эти ограничения усугубляются в масштабных и ресурсно ограниченных условиях, где масштабируемость и операционные затраты являются критически важными. Масштабируемость, энергоэффективность и скорость выводов часто имеют решающее значение в условиях реагирования на чрезвычайные ситуации, и необходимо создавать решения, балансирующие производительность и возможность развертывания. Таким образом, существует разрыв между моделями, ориентированными на точность, ориентированными на вычислительные ресурсы, и практическими требованиями реального внедрения.
Для преодоления таких проблем предлагается интерактивная многомасштабная объединение внимания (IMAF) с сетью свертки разреженных признаков (SFC), которая сосредоточена на разработке эффективной и развертываемой фреймворка для обнаружения изменений, а не только на оптимизации точности. Предлагаемое решение сосредоточено на парах оптических спутниковых изображений, обычно RGB или высокоразрешённых мультиспектральных изображений (разрешение 0,5–30 м), полученных спутниками, например, Landsat, Sentinel-2 или WorldView. Этот метод предполагает точную геометрическую совместную регистрацию бивременных пар, поскольку ошибки регистрации также могут существенно влиять на обнаружение. Он занимается бинарным обнаружением изменений (в отличие от многоклассовых семантических изменений) и не может различать различные типы изменений. Более того, метод использует радиометрически скорректированные изображения для снижения эффектов сезонных, атмосферных и осветительных изменений, которые можно ошибочно принять за изменение почвенного покрова. В отличие от традиционных сиамскихCNN 4, которые разделяют бивременные изображения с помощью простой конкатенации, предлагаемый модуль IMAF позволяет многомасштабно контекстное слияние как глобальных, так и локальных признаков. Современные подходы на основе трансформаторов, такие как BIT5 иChangeFormer 3, дают очень хорошие результаты, но их механизмы самосознания имеют сложность O(N2). Предлагаемая структура фиксирует тонкие изменения с двусторонним вниманием, снижая вычислительную сложность и задержку вывода. Кроме того, предлагаемая конструкция ориентирована на разрежённость, что превосходит плотные многомасштабные термоядерные конструкции, такие как UNet++6,7 и SNUNet8. Разрежённая свёртка с модулем призрака снижает количество FLOP примерно на 50%, сохраняя качество представления. Таким образом, предлагаемая структура способствует компромиссу точности и эффективности для надёжного внедрения в условиях с ограниченными ресурсами.
Основные вклады этого исследования включают: (i) Лёгкий детектор изменений, который достигает конкурентоспособного результата F1, используя в 19 раз меньше параметров по сравнению с аналогами на базе трансформаторов. (ii) Интерактивный мультимасштабный модуль слияния внимания, который получает глобальную контекстную информацию без квадратичных вычислительных затрат, присущих традиционным механизмам самовнимания. (iii) Схема свёртки с разреженностью признаков, основанная на модулях Ghosts, которая минимизирует операции с плавающей запятой на 49,4 процента без ухудшения качества представления признаков. (iv) Обширная экспериментальная валидация на большом наборе эталонных наборов данных с лучшими компромиссами между эффективностью и точностью и разумной практичностью реального применения в реальной жизни.
Остальная часть этой рукописи включает следующие разделы: Раздел 2 даёт подробный обзор последних работ в области методологий обнаружения бинарных изменений, с особым вниманием к решениям глубокого обучения и их реализации на стандартных бенчмарках. Раздел 3 содержит теоретическую основу и структурное проектирование предлагаемого решения, математическое представление механизма временного слияния и элементов внимания, характеристики экспериментальной установки, наборы данных, метрики оценки и детали реализации, необходимые для создания воспроизводимых исследований. Раздел 4 иллюстрирует подробные экспериментальные результаты, включающие абляцию — сравнения с новейшими алгоритмами обнаружения бинарных изменений, объясняющими пропускную способность в различных географических районах в наборах данных OSCD и SZTAKI Airchange. Раздел 5 определяет результаты результатов, ограничения текущего подхода и возможности будущих исследований в области обнаружения изменений.
Разработка алгоритмов обнаружения изменений в дистанционном зондировании значительно изменилась — от пиксельных методов к фреймворкам глубокого обучения. Ранние процедуры обнаружения изменений в основном основывались на алгебраических процессах, таких как дифференцирование изображений, нормирование изображений и анализ векторов изменений, которые работали непосредственно с значениями пикселей для обнаружения временныхизменений 9,10. Были разработаны альтернативные методы, включающие постклассификационное сравнение, при которых каждое временное изображение независимо классифицировалось, а затем сравнивалось с перекрёстнойтаблицей 11. Методы обнаружения изменений на основе объектов стали важным этапом прогресса с введением пространственного контекста и снижением шума на уровнепикселей 2,12.
Появление технологий глубокого обучения произвело революцию в области дистанционного зондирования обнаружения изменений и открыло путь к преодолению ряда ограничений традиционных методов. В последнее время конволюционные нейронные сети (CNN) стали стандартной архитектурой для автоматизированного извлечения признаков и классификации изменений13,14. Siamese NestedUNet for Change Detection14 и Siamese Swin-Unet15 стали значительным инновациями благодаря плотно связанной топологии сиамских сетей, которая помогает эффективно сохранять информацию о локализации по всей иерархии сети.
Проблема обнаружения бивременных изменений при высокоразрешающем оптическом дистанционном зондировании всё ещё трудно решить из-за множества факторов, и были предложены сети многомасштабных трансформаторов, основанных на внимание, с сложными стратегиями термоядерногосинтеза. Фреймворк EGMT-CD предлагал направляемые по краям мультимодальные трансформаторы гетерогенных пар изображений, где гомологичные изображения недоступны из-заоблачности 17. Архитектуры, такие как DASUNet, преодолевают узкие места ручного глубокого обучения в полномасштабном слиянии функций, с улучшением индекса F1 на 0,85% выше по сравнению с SNUNet-24 на CDD-наборе данных благодаря улучшенному градиентномупотоку 18. Гибридные модели CNN-Transformer решают проблему ложноотрицательных результатов по более высокой цене, предоставляя дополнительную стоимость на частотных компонентах с учёбой19. Однако гибридные U-образные трансформаторныесети 20 всё ещё трудно обеспечить локально-глобальную интеграцию характеристик и изменения в регионах, которые периодически происходят, даже в небольших масштабах. Использование многозадачного обнаружения семантических изменений и точного определения местоположения и классов сложнее по сравнению с бинарнымизадачами 21,22. Бивременные корреляции можно успешно смоделировать с помощью перекрёстного внимания без значительных архитектурныхизменений 14,23. Выражение парадигмы перспективного языка также стало недавним рубежом с КЛИП-дизайнами, сочетающими текстовые объяснения в соответствиеизменений 24 и полуконтролируемые паттерны, исключающие зависимость от маркированныхданных 25. Change Mamba представляет модели пространства состояний пространственно-временныхмоделей 26,27. Показаны различные применения специализированных методов внимания: использование гиперспектрального обнаруженияаномалий 28, многозонной классификациицелей 29 или сегментации с ограниченнойметкой 30, а также демонстрация гибкости механизмов внимания в аналитике дистанционного зондирования.
| Авторы | Метод/Архитектура | Технические характеристики | Ключевые инновации и результаты / Результаты наборов данных |
| Сингх, А. [8] | Традиционные методы | Дифференцирование на основе пикселей, CVA | Фреймворк для цифрового обнаружения изменений, несколько наборов данных, точность: 65-80% |
| Мас, Дж.Ф. [10] | Постклассификация | Независимая временная классификация | Сравнительный методологический анализ, тропические изображения, OA: 72-85% |
| Лу и др. [9] | Традиционные методы | Алгебраические операции, CVA, PCA | Всестороннее сравнение техник, множество источников, точность: 70-88% |
| Benedek & Szirányi [23] | Смешанная модель Маркова | Многоуровневая условная структура | Моделирование вероятностных изменений, Sztaki AirChange, DA: 92,1% |
| Блашке, Т. [2] | Объектно-ориентированные | Анализ на основе сегментации | Интеграция пространственного контекста, различные кадры HR, SA: 85-92% |
| Чен и др. [11] | Объектно-ориентированные | Многомасштабная сегментация | Иерархический анализ объектов, кадровые изображения, OA: 87,3% |
| Чжан и др. [12] | Сиамский CNN | 5-слойный CNN, размер ядра 3×3 | Глубокая сиамская архитектура для CD, аэрофотоснимки, F1: 0.847, IoU: 0.735 |
| Даудт и др. [4] | Сиамский ФКН | FC-EF, FC-Siam-diff, FC-Siam-conc | Стратегии раннего/позднего синтеза, OSCD, F1: 0.431, IoU: 0.276 |
| Пэн и др. [26] | UNet++ | Вложенная U-сеть, плотные пропускные соединения | Многомасштабная агрегация признаков, спутник HR, F1: 0.753, IoU: 0.604 |
| Чэнь и Ши [25] | Пространственно-временное внимание | Блоки внимания, временное моделирование | Пространственно-временное обучение признаков, LEVIR-CD, F1: 0.887, IoU: 0.797 |
| Фанг и др. [7] | SNUNet-CD | Siamese NestedUNet, dense connections | Оптимизация передачи информации, LEVIR: F1: 0.897, WHU: F1: 0.904 |
| Чен и др. [5] | BIT-CD | ResNet18 + трансформаторный кодировщик | Бинарное временное обучение признаков, OSCD: F1: 0.635, LEVIR: F1: 0.919 |
| Бандара и Патель [3] | ChangeFormer | Иерархический трансформаторный кодировщик | Многомасштабное внимание трансформатора, OSCD: F1: 0.654, LEVIR: F1: 0.905 |
| Сонг и др. [27] | ACANet | Осьовое внимание + основа CNN | Эффективное расчёт внимания, LEVIR: F1: 0.901, WHU: F1: 0.913 |
| Ши и др. [28] | Обзорная статья | Комплексное исследование методов ИИ | Систематический анализ подходов ИИ, анализ 50+ наборов данных |
| Ли и др. [14] | AMST-Net | Многомасштабный трансформатор, пирамидальный внимание | Адаптивное многомасштабное извлечение признаков, оптические изображения HR, мIoU: 0.823 |
| Сян и др. [15] | EGMT-CD | Мультимодальная архитектура, управляемая краями | Кроссмодальное выравнивание признаков, гетерогенные пары, F1: 0,756 |
| Мяо и др. [16] | DASUNet | Плотный надзор, полномасштабное слияние | Глубокий надзор на всех уровнях декодера, CDD: 0,85% улучшения F1 по сравнению с SNUNet |
| Танг и др. [29] | Сиамский Swin-UNet | Трансформатор Swin + термоядерный синтез Unet | Иерархическое внимание окна, LEVIR: F1: 0.923, WHU: F1: 0.925 |
| Ву и др. [18] | Гибридный U-трансформатор | Магистраль UNet++ + Блоки трансформаторов | Глобально-локальная интеграция функций, изображения HR, IoU: 0.851, F1: 0.919 |
| Донг и др. [20] | ChangeCLIP | Язык видения на основе CLIP | Мультимодальное семантическое понимание, пары RS, семантическая точность: 94,1% |
| Ли и др. [21] | SemiCD-VL | Полуконтролируемый язык зрения | Сниженные требования к аннотациям, ограниченные метки, F1: 0.889 |
| Чен и др. [22] | ChangeMamba | Модели пространственных состояний (SSM) | Линейная сложность временного моделирования, RS-изображения, эффективность: в 3 раза быстрее |
Таблица 1: Краткое описание методов обнаружения изменений в дистанционном зондировании Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.
Краткое изложение предыдущих исследований приведено в Таблице 1. Традиционные методы имеют ручной работы функции, неподходящие для сложных пространственно-временныхвариаций 31, а архитектура глубокого обучения (UNet, FPN, PSPNet) включает вычислительно затратные свёртки. Текущие модели не имеют эффективных систем многомасштабного инкорпорирования и динамического внимания. Для заполнения этих пробелов текущее исследование предлагает интерактивное многомасштабное слияние внимания с сетью свертки с разрежёнными признаками, которая направлена на фиксирование тонких изменений на разных масштабах при одновременной вычислительной эффективности в дистанционном зондировании, особенно в области городских и техногенных структурных изменений.