Method Article

دمج الانتباه التفاعلي متعدد المستويات مع شبكة التفاف بميزات متفرقة لاكتشاف تغير صور الأقمار الصناعية

DOI:

10.3791/69815

March 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة نموذج تفاعلي متعدد المقاييس لدمج الانتباه مع شبكات الالتفاف ذات الميزات المتفرقة لتحسين اكتشاف تغير صور الأقمار الصناعية. يستفيد هذا النهج من استخراج الميزات متعدد المقاييس، والتركيز الانتقائي على الانتباه، والتداخلات المحدودة لاكتشاف وتحديد موقع التغيرات في صور الأقمار الصناعية ثنائية الزمان بفعالية عن طريق تقليل تعقيد الحسابات.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعد اكتشاف التغيرات باستخدام صور الأقمار الصناعية ثنائية الزمان مشكلة مهمة في مراقبة الأرض تهدف إلى تحديد وتحديد مواقع التغيرات السطحية بين الاقتباس الزمني والتمييز بين التغيرات الزائفة الفعلية الناتجة عن الدورات الموسمية أو العوامل الجوية أو التطورات البشرية. عادة ما تواجه طرق التعلم العميق الحالية تحيزا أحادي الاتجاه في نمذجتها الزمنية، مما يحد من قابلية استخدام العلاقات المكانية واسعة النطاق لتمكين التوصيف الصحيح لأنماط التغيير. على الرغم من أن تقنيات المحولات الحديثة دقيقة للغاية، إلا أن متطلباتها الحسابية كبيرة أيضا، مما يحد من استخدامها في المهام ذات الموارد المحدودة. استجابة لهذه القيود، تم اقتراح شبكة تفاعلية متعددة المستويات بدمج الانتباه (IMAF) مع التفاف الميزات المتفرقة (SFC) تعتمد على وحدات الشبح لتحقيق استخراج ميزات متعدد المقاييس فعال في هذه الورقة. تستخدم الشبكة بنية متقدمة لمشفر-فك الترميز مدعومة بوحدات انتباه تفاعلية بمقاييس مختلفة. تعمل الشبكة مع تدفقات انتباه متكاملة للأمام والخلف: الأولى تسجل التغيرات الزمنية التدريجية، والثانية تتحقق من اتساق التغيرات من خلال التحليل الزمني العكسي. تسمح هذه الطريقة التفاعلية بتمثيلات فعالة لنموذج الدوكسين للعلاقات الزمنية دون أن تكون مرهقة حسابيا، مما يعزز أساليب أفضل بكثير للتمييز بين الحركات المشروعة للغطاء الأرضي مقابل الضوضاء التي لا تغيب، بسبب التباين الناتج عن الضوضاء. تم تجربة مجموعتين من البيانات المعيارية: مجموعة بيانات اكتشاف التغير عبر الأقمار الصناعية أونيرا (OSCD)، ومجموعات بيانات SZTAKI AirChange. تكشف التجارب المهمة على مجموعات بيانات OSCD أن النهج المقترح يحقق معدلات F1 تنافسية تبلغ 58.14٪ (13 قناة) و50.68٪ (3 قنوات) مع 2.13 مليون معلمة فقط و19.6G FLOPS، أي 19 ضعف عدد المعلمات، ومعدل دوران 5.6x مقارنة ب ChangeFormer. الأداء التنافسي على عينات مجموعة اختبار Szada/1 وTiszadob/3 من بيانات SZTAKI بدرجة F1 البالغة 74.29٪ و92.86٪ على التوالي، يجعل من الممكن التطبيق في أكثر الأجهزة الطرفية، والتحليلات اللحظية، وأنظمة الخرائط الواسعة حيث تعتمد الطاقة التشغيلية مباشرة على الطاقة الحاسوبية.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مستويات غير مسبوقة من التحضر في البيئة العالمية، وفقدان الموارد البيئية، وتغيرات المناظر الطبيعية بسبب المناخ أدت مباشرة إلى الحاجة إلى توفير نظام مراقبة دقيق وفي الوقت المناسب وآلي يمكنه تحديد وقياس التغيرات على سطح الأرض. نما الاستشعار عن بعد عبر الأقمار الصناعية ليصبح الركنة الأساسية للمراقبة البيئية الجماعية لأنه يوفر تغطية زمنية ومكانية متسقة بالإضافة إلى كونه حيويا في الفحص الكامل للتغيير. كشف التغيرات بالصور ثنائية الزمان للأقمار الصناعية هو توصيف التغيرات السطحية بين اقتوابات متتالية لنفس المنطقة الجغرافية. لكنها عملية معقدة بسبب العديد من المتغيرات المربكة، بما في ذلك تغير الفصول، وظروف الطقس، وخصائص المستشعرات، والتشوهات الهندسية، والتغيرات الظاهراتية التي قد تخفي أو تشبه الحقيقي في الغطاء الأرضي. التفسير اليدوي للصور الفضائية المستخدمة حاليا يستغرق وقتا طويلا، وذاتيا، وغير مناسب للتعامل مع الكميات المتزايدة باستمرار من معلومات مراقبة الأرض التي تولدها كوكبات الأقمار الصناعية الحالية. وهذا هو القيد الأساسي الذي أدى إلى إنشاء حلول كشف التغيير الآلية. تميل طرق اكتشاف التغير التقليدية القائمة على بكسل1 وطريقة كشف التغير2 القائمة على الكائنات إلى أن تكون غير مناسبة للعمل ضمن حدود هذه التعقيدات ولديها معيار منخفض للمتانة لتطبيقها على مجموعة واسعة من الوحدات الجغرافية والمقاييس الزمنية. تمكن هياكل التعلم العميق، وخاصة الشبكات العصبية الالتفاوية والمتحورات، من استخراج ميزات هرمية تمثل تفاصيل طيفية منخفضة المستوى وأنماط دلالية عالية المستوى ذات صلة بتمييز التغيرات. أثبتت نماذج اكتشاف التغير في التعلم العميق أنها واعدة للغاية في التقاط التغيرات الكامنة في بيانات الاستشعار عن بعد، وفي تحديد التغيرات الحقيقية بين الغطاء الأرضي والتغيرات الزائفة التي تسببها عوامل خارجية. تستفيد هذه الأساليب التعليمية من البداية إلى النهاية حقيقة إمكانية استخراج الميزات وإجراء التصنيف بشكل مثالي في نفس الوقت. على الرغم من التقدم الكبير في دقة اكتشاف التغييرات، لا تزال معظم الطرق الحالية صعبة التطبيق في بيئات العمليات الواقعية. النهج المعتمدة على المحولات3، رغم كفاءتها في السياق العالمي، تتميز بعدد معلمات عالي، وتعقيد حسابي تربيعي، وكمون استدلال، واستهلاك طاقة مرتفع. أما البنى المعتمدة على CNN السيامي، فهي متفوقة في الكفاءة، لكنها تحتوي على حقول استقبال صغيرة وتفتقر إلى النمذجة السياقية العالمية إلى حد كبير، مما يؤدي إلى تدهور الأداء بشكل كبير. وتتفاقم هذه القيود أكثر في البيئات واسعة النطاق ومحدودة الموارد، حيث تعتبر قابلية التوسع والتكلفة التشغيلية اعتبارات حاسمة. غالبا ما تكون قابلية التوسع، وكفاءة الطاقة، وسرعة الاستنتاجات ضرورية في بيئة الاستجابة للطوارئ، وهناك حاجة لابتكار حلول توازن بين الأداء وقابلية النشر. لذلك، تبقى فجوة بين النماذج الحاسوبية المكثفة التي تركز على الدقة والمتطلبات العملية للنشر في العالم الحقيقي.

لتجاوز مثل هذه المشكلات، يقترح إنشاء شبكة تفاعلية متعددة المستويات لدمج الانتباه (IMAF) مع الالتفاف المتناثر (SFC)، تركز على تصميم إطار عمل فعال وقابل للنشر لاكتشاف التغييرات بدلا من تحسين الدقة فقط. يركز الحل المقترح على أزواج صور الأقمار الصناعية البصرية، عادة صور RGB أو صور متعددة الأطياف عالية الدقة (دقة 0.5-30 متر)، التي تلتقطها الأقمار الصناعية مثل Landsat أو Sentinel-2 أو WorldView. تفترض التقنية وجود تسجيل هندسي دقيق لأزواج ثنائية الزمن، لأن أخطاء التسجيل يمكن أن يكون لها أيضا تأثير كبير على الكشف. يتعامل مع اكتشاف التغيرات الثنائية (على عكس التغير الدلالي متعدد الفئات) ولا يمكنه التمييز بين أنواع التغير المختلفة. أكثر من ذلك، تستخدم الطريقة صورا مصححة إشعاعيا لتقليل تأثيرات التغيرات الموسمية والجوية والإضاءة، والتي قد يخطئ في اعتبارها تغير الغطاء الأرضي. على عكس شبكات CNNالسيامية التقليدية 4 التي تفصل الصور ثنائية الزمان بمساعدة تسلسل بسيط، تسمح وحدة IMAF المقترحة بدمج سياقي متعدد المستويات لكل من الميزات العالمية والمحلية. الأساليب الحديثة القائمة على المحولات، مثل BIT5 وChangeFormer3، تحقق نتائج جيدة جدا، لكن آليات الانتباه الذاتي لديهم تتميز بتعقيد O(N2). يلتقط الإطار المقترح التغيرات الدقيقة مع الانتباه ثنائي الاتجاه، مما يقلل من تعقيد الحوسبة وكمون الاستدلال. بالإضافة إلى ذلك، التصميم المقترح واعي للنشوة، وهو متفوق على تصاميم الاندماج متعددة المقاييس الكثيفة مثل UNet++6,7 وSNUNet8. يقلل التفاف الميزات المتفرقة مع وحدة الشبح من FLOPs بحوالي 50٪، مع الحفاظ على جودة التمثيل. لذا، يفضل الإطار المقترح مقايضة الدقة والكفاءة للنشر الموثوق في بيئات محدودة الموارد.

المساهمات الرئيسية لهذه الدراسة هي: (1) كاشف تغيير خفيف الوزن يحقق درجة F1 تنافسية باستخدام معلمات أقل بمقدار 19 مرة مقارنة بالكاشف المعتمد على المحولات. (2) وحدة تفاعلية متعددة المستويات لدمج الانتباه تحصل على معلومات سياقية عالمية دون التكلفة الحسابية التربيعية لآليات التركيز الذاتي التقليدية. (3) مخطط التفاف مع تنوع مميز يعتمد على وحدات الأشباح، يقلل من العمليات العائمة بنسبة 49.4 بالمئة دون تدهور جودة في تمثيل الميزة. (4) التحقق التجريبي الموسع على مجموعة كبيرة من مجموعات بيانات المعايير، مع مقايضات أفضل بين الكفاءة والدقة وقابلية التطبيق الفعلي في الواقع بشكل معقول.

يتكون بقية هذه المخطوطة من الأقسام التالية: يقدم القسم الثاني نظرة شاملة على الأعمال الحديثة في مجال منهجيات اكتشاف التغير الثنائي، مع اهتمام خاص لحلول التعلم العميق وتنفيذها على المعايير القياسية. يقدم القسم 3 الخلفية النظرية والتصميم البنيوي للحل المقترح، والتمثيل الرياضي لآلية الاندماج الزمني وعناصر الانتباه، وخصائص إعداد التجريب، ومجموعات البيانات، ومقاييس التقييم، وتفاصيل التنفيذ اللازمة لإنتاج أبحاث قابلة للتكرار. يوضح القسم 4 النتائج التجريبية التفصيلية التي تشمل الاستئصال، والمقارنات مع أحدث خوارزميات كشف التغير الثنائي التي تفسر السعة في مناطق جغرافية مختلفة ضمن مجموعات بيانات OSCD وSZTAKI Airchange. يحدد القسم 5 نتائج النتائج، وحدود النهج الحالي، وإمكانيات الأبحاث المستقبلية في اكتشاف التغيير.

لقد تغير تطوير خوارزميات اكتشاف التغيير في الاستشعار عن بعد بشكل كبير من الطرق المعتمدة على البكسلات إلى أطر التعلم العميق. كانت إجراءات اكتشاف التغيرات المبكرة تعتمد بشكل رئيسي على عمليات جبرية مثل تمييز الصور، وتقنين الصورة، وتحليل متجهات التغيير، والتي كانت تعمل مباشرة على قيم البكسل لاكتشاف التغيرات الزمنية9،10. تم تطوير طرق بديلة تتضمن المقارنة بعد التصنيف، حيث تم تصنيف كل صورة زمنية بشكل مستقل ثم مقارنتها بالجدول المتقاطع11. مثلت تقنيات اكتشاف التغيرات القائمة على الكائنات خطوة مهمة من التقدم مع إدخال السياق المكاني وكذلك التخفيف من الضوضاء على مستوى البكسل 2,12.

لقد أحدث ظهور تقنيات التعلم العميق ثورة في مجال اكتشاف التغيير بالاستشعار عن بعد ومهد الطريق لتجاوز عدة قيود في التقنيات التقليدية. مؤخرا، أصبحت شبكات الالتفاف العصبية (CNN) هي البنية القياسية لتصنيف الاستخراج التلقائي للميزات وتغيير التصنيف13,14. برزت سيامية NestedUNet for Change Detection14 وSiamese Swin-Unet15 كابتكار مهم بفضل طوبولوجيا الشبكة السيامية المتصلة بكثافة والتي تساعد على الاحتفاظ بمعلومات التوطين عبر تسلسل الشبكة بشكل فعال.

لا تزال مشكلة اكتشاف التغيرات ثنائية الزمن في الاستشعار البصري عن بعد عالي الدقة صعبة الحل بسبب عوامل مربكة متعددة، وقد تم اقتراح شبكات المحولات متعددة المقاييس المعتمدة على الانتباه مع ميزات معقدة لاستراتيجيات الاندماج16. اقترح إطار عمل EGMT-CD محولات متعددة الوسائط موجهة بالحافة لأزواج صور غير متجانسة، حيث لا يمكن الوصول إلى الصور المتماثلة بسبب غطاء السحاب17. اخترقت معماريات مثل DASUNet عنق الزجاجة اليدوي في التعلم العميق اليدوي في دمج الميزات الكامل، مع تحسن مؤشر F1 أعلى بنسبة 0.85٪ مقارنة ب SNUNet-24 في مجموعة بيانات CDD باستخدام تدفق التدرج18 المحسن. تتعامل نماذج CNN الهجينة مع المحول مع مشكلة السالب الكاذبة بتكلفة أعلى من خلال توفير تكلفة إضافية على مكونات التردد لتعلم الميزات19. ومع ذلك، لا تزال شبكات المحولات الهجينة على شكل U20 صعبة في توفير تكامل الميزات المحلية والعالمية والتغيرات في المناطق التي تحدث بشكل دوري، حتى على نطاق صغير. استخدام اكتشاف التغيرات الدلالية متعددة المهام، والتعرف الدقيق على الموقع والفئة، أكثر تعقيدا مقارنة بالمهام الثنائية21,22. يمكن نمذجة الارتباطات ثنائية الزمن بنجاح من خلال الانتباه المتقاطع دون تغييرات معمارية كبيرة14,23. يعد تعبير نموذج لغة المنظور أيضا جبهة حديثة مع تصاميم قائمة على CLIP تجمع بين التفسيرات النصية في مراسلات التغيير24 وأنماط شبه مراقبة، مما يلغي الاعتماد على البيانات الموسومة25. تقدم مامبا التغيير نماذج فضاء الحالات لنماذج الزمكانوالزمان 26,27. يتم عرض تطبيقات مختلفة لطرق الانتباه المتخصصة: معالجة استخدام اكتشاف الشذوذ الطيفي الفائق28، أو تصنيف الأهداف متعدد المناطق29، أو تقسيم محدودالتسمية 30، وإظهار مرونة آليات الانتباه في تحليلات الاستشعار عن بعد.

المؤلفونالمنهجية/العمارةالمواصفات الفنيةالابتكار الرئيسي والنتائج / أداء مجموعة البيانات
سينغ، أ. [8]الطرق التقليديةالتفاضل القائم على البكسلات، CVAإطار عمل كشف التغيير الرقمي، مجموعات بيانات متعددة، الدقة: 65-80٪
ماس، ج. ف. [10]ما بعد التصنيفالتصنيف الزمني المستقلتحليل منهجية مقارنة، صور استوائية، OA: 72-85٪
لو وآخرون [9]الطرق التقليديةالعمليات الجبرية، CVA، PCAمقارنة شاملة للتقنيات، مصادر متعددة، الدقة: 70-88٪
بينيدك & سيراني [23]نموذج ماركوف المختلطإطار شرطي متعدد الطبقاتنمذجة التغير الاحتمالي، Sztaki AirChange، DA: 92.1٪
بلاشكي، ت. [2]القائمة على الكائناتالتحليل القائم على التقسيمدمج السياق المكاني، صور الموارد البشرية المختلفة، SA: 85-92٪
تشين وآخرون [11]القائمة على الكائناتالتقسيم متعدد المقاييستحليل الكائنات الهرمية، صور HR، OA: 87.3٪
زان وآخرون [12]سي إن إن السياميةCNN من 5 طبقات، حجم النواة 3×3العمارة السيامية العميقة للأقراص المدمجة، صور جوية، F1: 0.847، IoU: 0.735
داودت وآخرون. [4]سيامي إف سي إننادي FC-EF، FC-سيام-ديفرانس، FC-سيام-كونكاستراتيجيات الاندماج المبكر/المتأخر، OSCD، F1: 0.431، IoU: 0.276
بنغ وآخرون [26]UNet++شبكة U-Net المتداخلة، اتصالات تخطي كثيفةتجميع الميزات متعدد المقاييس، قمر HR، F1: 0.753، IoU: 0.604
تشن & شي [25]الانتباه الزماني المكانيحواجز الانتباه، النمذجة الزمنيةتعلم الميزات الزمانية المكانية، LEVIR-CD، F1: 0.887، IoU: 0.797
فانغ وآخرون. [7]SNUNet-CDSiamese NestedUNet, dense connectionsتحسين نقل المعلومات، LEVIR: F1: 0.897، WHU: F1: 0.904
تشين وآخرون [5]BIT-CDمشفر ResNet18 + Transformerتعلم الخصائص الزمنية الثنائية، OSCD: F1: 0.635، LEVIR: F1: 0.919
باندارا وباتيل [3]تغيير سابقمشفر المحول الهرميانتباه المحول متعدد المقاييس، OSCD: F1: 0.654، LEVIR: F1: 0.905
سونغ وآخرون [27]ACANetالانتباه المحوري + العمود الفقري CNNحساب الانتباه الفعال، LEVIR: F1: 0.901، WHU: F1: 0.913
شي وآخرون [28]ورقة مراجعةمسح شامل لطرق الذكاء الاصطناعيتحليل منهجي لأساليب الذكاء الاصطناعي، تم تحليل 50+ مجموعة بيانات
لي وآخرون [14]AMST-Netمحول متعدد المقاييس، انتباه هرمياستخراج الميزات متعدد المقاييس التكيفي، صور بصرية بمعدل ضربات قلب، mIoU: 0.823
شيانغ وآخرون [15]EGMT-CDالبنية متعددة الوسائط الموجهة بالحافةمحاذاة الخصائص متعددة النمط، أزواج غير متجانسة، F1: 0.756
مياو وآخرون [16]DASUNetالإشراف المكثف، الاندماج الكاملإشراف عميق على جميع مستويات فك التشفير، CDD: تحسن بنسبة F1 بنسبة 0.85٪ مقارنة ب SNUNet
تانغ وآخرون [29]سيامي سوين-يونيتسوين ترانسفورمر + دمج يونيتانتباه نافذة هرمية، LEVIR: F1: 0.923، WHU: F1: 0.925
وو وآخرون [18]محول U الهجينكتل UNet++ الأساسية + المحولتكامل الميزات العالمية مع الموارد، صور الموارد البشرية، IoU: 0.851، F1: 0.919
دونغ وآخرون [20]تشينج كليبلغة الرؤية المعتمدة على CLIPالفهم الدلالي متعدد الوسائط، أزواج RS، الدقة الدلالية: 94.1٪
لي وآخرون [21]SemiCD-VLلغة الرؤية شبه المراقبةمتطلبات تقليل التعليقات، تسميات محدودة، F1: 0.889
تشين وآخرون [22]تشينجمامبانماذج الفضاء الحالة (SSMs)النمذجة الزمنية بالتعقيد الخطي، صور RS، الكفاءة: أسرع بثلاث مرات

الجدول 1: ملخص طرق اكتشاف التغيير في الاستشعار عن بعد يرجى الضغط هنا لتحميل هذا الجدول.

يتم عرض ملخص الدراسات السابقة في الجدول 1. الطرق التقليدية تحتوي على ميزات مصممة يدويا غير مناسبة للتغيرات الزمنية المكانية المعقدة31، وبنية التعلم العميق (UNet، FPN، PSPNet) تتضمن التفافيات حسابية مكلفة وكثيفة. النماذج الحالية لا تحتوي على أنظمة دمج متعددة المقاييس فعالة وأنظمة انتباه ديناميكية. لسد هذه الفجوات، تقترح الدراسة الحالية دمج الانتباه التفاعلي متعدد المقاييس مع شبكة الالتفاف ذات الميزات المتفرقة، التي تهدف إلى التقاط التغيرات الدقيقة عبر المقاييس مع الكفاءة الحاسوبية في الاستشعار عن بعد، خاصة في التغيرات الهيكلية الحضرية والبشرية.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. بيان الأخلاقيات

  1. تتكون كل من مجموعات بيانات اكتشاف تغير الأقمار الصناعية في أونيرا (OSCD) وSZTAKI AirChange المستخدمة في هذه الدراسة من صور RGB ومتعددة الأطياف المتاحة للجمهور تغطي خصائص جغرافية متنوعة. هذه المجموعات لا تحتوي على أي بيانات مقيدة أو حساسة. لذلك، لا يشترط الحصول على موافقة أخلاقية لهذا العمل.

2. المواد والمعدات

  1. قم بإجراء اختبار على جهاز كمبيوتر يعمل بنظام Windows 11 يحتوي على معالج Intel Core i7 10870H، وشريحة NVIDIA GeForce GTX 1650 Ti مع 4GB من ذاكرة VRAM، وذاكرة RAM بسعة 32GB.
    ملاحظة: بيئة البرمجة هي بايثون 3.8، وتعتمد بيئة البرمجة على إطار عمل PyTorch (الإصدار 1.12.1) وTorchvision (الإصدار 0.13.1) لتنفيذ التعلم العميق.
  2. تحميل وتثبيت مكتبات مثل scikit-learn (الإصدار 1.0.2)، الذي يحتوي على أداة تعلم الآلة، وNumPy (الإصدار 1.21.0)، الذي يحتوي على العمليات الرقمية.
  3. تأكد من تثبيت مجموعة أدوات CUDA الإصدار 11.3 وcuDNN الإصدار 8.2 المقدم من شركة NVIDIA لتتمكن من الاستفادة من تسريع بطاقة الرسومات.
  4. تدريب وتقييم الأداء باستخدام مجموعة بيانات OSCD وSZTAKI Airchange المتاحة للجمهور.

3. إعداد مجموعة البيانات

  1. اختر OSCD4، الذي يتكون من صور هوائية ضوئية RGB للأقمار الصناعية وصور متعددة الأطياف، كل منها بحجم 600 × 600 بكسل بدقة 10 متر، ومجموعة بيانات SZTAKI AirChange32 ، التي تتكون من 13 زوجا من الصور الجوية البصرية، كل منها 952 × 640 بكسل بدقة 1.5 م/بكسل كمجموعات بيانات معيارية.
  2. قسم 24 مدينة في مجموعة بيانات OSCD إلى 14 مدينة ثابتة ومحددة مسبقا للتدريب و10 مدن للاختبار.
  3. تعيين أزواج صور ثابتة غير عشوائية من Szada/1 و Tiszadob/3 من مجموعة بيانات SZTAKI AirChange لمجموعة الاختبار، وأزواج الصور المتبقية كمجموعة تدريب كمعيار قياسي.
  4. إجراء اكتشاف التغييرات على مجموعة الاختبار وقياس الأداء في جولة واحدة باستخدام أزواج الصور المشروحة من كل مجموعة بيانات.

4. المعالجة المسبقة

  1. طبق المعالجة المسبقة القائمة على الرقعة.
    1. استخراج رقع الصور بشكل مستقل لكل صورة زمنية في مواقع متطابقة أثناء التصوير لإدارة صور الأقمار الصناعية عالية الدقة بكفاءة.
    2. قسم كل صورة إلى رقع متداخلة من 128 × 128 بكسل باستخدام خطوة من 64 بكسل.
    3. محاذاة المناطق المتداخلة بين البقع المجاورة للحفاظ على اتساق الحدود والاحتفاظ بمعلومات الحواف.
  2. قم بإجراء تعزيز بيانات حسب الفئة.
    1. تطبيق تعزيز تفاضلي أثناء التدريب على كلا الرقعين في الزوج بناء على نسبة بكسل التغيير للتعامل مع عدم توازن الفئة بين مناطق "التغيير" و"عدم التغيير".
    2. تعزيز زوج الرقعة (التي تحتوي على >٪ تغير البكسلات) ست مرات باستخدام التحولات التالية: الانقلابات الأفقية والعمودية، دوران 90°، تذبذب الألوان (سطوع، تباين، وتشبع ± 30٪)، تحويلات أفينية (دوران ± 15°، ترجمة ± 10 بكسل، مقياس 95-105٪).
    3. قم بتعزيز زوج التحديث بدون تغيير مرة واحدة فقط لمنع عدم توازن مجموعة البيانات.
      ملاحظة: هذه الاستراتيجية التعزيزية، المبنية على الحصص، توفر تدريبا متوازنا في مناطق التغيير والمناطق التي لا تتغير.
  3. تطبيع وتحسين جودة الصورة.
    1. تطبيع جميع الرقعات باستخدام متوسط ImageNet والانحراف المعياري: المتوسط = (0.485، 0.456، 0.406)، Std = (0.229، 0.224، 0.225).
      1. استخدم معادلة المخطط التكراري التكيفي المحدود للتباين (CLAHE) مع حد المقطع = 2.0، وحجم شبكة البلاطات=8 × 8، في مساحة ألوان LAB (قناة L فقط) لتفتيح تباين المناطق ذات التباين المنخفض بحيث يمكن تمييز الميزات على الصورة، مع تمديد الشدة إلى [0,255].
      2. قم بإزالة أي رقع أصغر من 128 × 128 بكسل ووضع وسادة على الرقع الصغيرة بحيث تكون بنفس حجم الرقع الأكبر وتحافظ على سلامتها المكانية أثناء تدريب النماذج.

5. بناء النماذج

  1. عرف المدخل والمخرجات.
    1. يأخذ الإطار المقترح كمدخل زوجا من صور الأقمار الصناعية المسجلة معا I1 وI2 ∈ RH×W×C تم التقاطها في حالات زمنية مختلفة وينتج خريطة تغير ثنائية M ∈ RH×W×2 تحدد بدقة المناطق المتغيرة وغير المتغيرة.
  2. الإطار المقترح
    1. معالجة الإطار المقترح كخط معالجة من ثلاث مراحل. في المرحلة الأولى، قم بنمذجة الانتباه الزمني على تسلسلات الإدخال لالتقاط التغيرات مع مرور الوقت.
    2. استخدم الانتباه التفاعلي لالتقاط الاعتمادات الزمنية المتماثلة بين الميزات ثنائية الزمن في مرحلة نمذجة الانتباه الزمني.
    3. استخراج التمثيلات الهرمية للميزات ذات الصلة من صورة نمذجة زمنيا باستخدام بنية مشفرة قائمة على الميزات في المرحلة الثانية، حيث تنخفض الدقة المكانية تدريجيا بينما يزداد بعد الميزة.
    4. استخدم فك تشفير متصل بالتخطي مع أخذ عينات تكيفية لإنتاج خرائط تغيير عالية الدقة في مرحلة إعادة البناء، مع الاحتفاظ بتفاصيل مكانية أقل مقياسا.
      ملاحظة: يوضح الشكل 1 تدفق البيانات الكلي من صور الأقمار الصناعية ثنائية الزمن المدخلة إلى المشفر المشترك، وكتل معالجة الانتباه المتقاطعة الوسطى، وفك الترميز، والتي تؤدي جميعها معا إلى خريطة كشف التغيير.
  3. مشفر الميزات المتفرقة
    1. قم ببناء مشفر خفيف الوزن مبني من كتل الالتفافية الشبح بنسبة =2 مع تطبيق التطبيع الدفعي ووظيفة تفعيل ReLU بشكل متسلسل لتقليل تعقيد الحسابات مع الحفاظ على جودة التمثيل.
    2. قم بتجميع المشفر بشكل متسلسل من الأنواع الثلاثة التالية من الكتل.
      الكتلة1: غوست (in_channels → 32) → BN ReLU Ghost (32 → 64) → BN ReLU MaxPool(2×2)
      الكتلة2: غوست (64 → 96) → BN ReLU جوست (96 → 128) → BN ReLU MaxPool(2×2)
      الكتلة3: غوست (128 → 128) → BN ReLU
    3. قم بتوصيل الكتل للحفاظ على تدفق سلس للميزات عبر المشفر والحفاظ على الدقة المكانية للمراحل التالية.
      ملاحظة: يكمن الابتكار الأساسي في هذا النهج في آلية التفاعل بين الانتباه التي تتيح التفاعل المتماثل بين الصور ثنائية الزمن. لكل زوج من الصور، يتم استخراج الميزات العميقة F1،F 2∈RB×C×H'×W' حيث يمثل H' = H/4، W'=W/4، C=128 بعد الميزة. تعاد تشكيل هذه الميزات المكانية لتصبح تسلسلا يمثل figure-protocol-1 طول التسلسل المكاني، وD=C يمثل بعد الميزة.
  4. نمذجة الانتباه الزمني
    1. تنفيذ عملية الانتباه المتقاطع باستخدام صياغة الانتباه القياسية ذات الضرب النقطي كما هو موضح في الشكل 2
      figure-protocol-2
      حيث تمثل Q وK وV مصفوفات الاستعلام، المفتاح، والقيم على التوالي، وdk تمثل بعد المتجهات الرئيسية.
      ملاحظة: يستخدم الانتباه متعدد الرؤوس مع h = 8 رؤوس لالتقاط أنواع مختلفة من العلاقات الزمنية في نفس الوقت بشكل مستقل على كل مقياس. كل رأس انتباه يعالج فضاء فرعي مختلف من تمثيلات الميزات، مما يمكن النموذج من التركيز على جوانب مختلفة من التغيرات الزمنية.
    2. احسب مخرجات الانتباه متعددة الرؤوس كالتالي:
      الرؤوس المتعددة (Q,K,V) = الكونكات (الرأس1,...,الرأس h ) WO
      حيث كل منها figure-protocol-3 هو مصفوفات إسقاط مكتسبة.
  5. الانتباه التفاعلي المتماثل
    1. تلتقط استراتيجية الانتباه التفاعلي معلومات التغير المتماثل من خلال العمليات الأمامية والخلفية ( موضحة في الشكل 3). يسمح الانتباه الأمامي للسمات من الصورة الزمنية الأولى بالاهتمام بميزات الصورة الزمنية الثانية، ويتم حسابها كالتالي:
      figure-protocol-4
      حيث تعمل الميزات الزمنية الأولى كاستعلامات بينما توفر الميزات الزمنية الثانية مفاتيح وقيما.
    2. وعلى العكس، يمكن الانتباه العكسي ميزات الصورة الزمنية الثانية من الاهتمام بميزات الصورة الزمنية الأولى، وصاغت كالتالي:
      figure-protocol-5
      يتم دمج الميزات الموجهة من كلا الاتجاهين وإسقاطها عبر تحويل خطي لإنتاج التمثيل النهائي المحضر:
      figure-protocol-6
      ملاحظة: تضمن هذه الآلية التفاعلية التقاط العلاقات الزمنية بشكل متماثل، مما يجعل الشبكة ثابتة حسب ترتيب الصور المدخلة، وهو أمر حاسم لتطبيقات كشف التغيير حيث يجب ألا يؤثر التسلسل الزمني على نتائج الكشف.
  6. إعادة بناء خريطة فك التشفير وتغيير الشفرة
    1. ادمج الميزات التي تم التعامل معها مع مخرجات المشفر عبر تخطي الاتصالات للاحتفاظ بالتفاصيل المكانية.
    2. تطبيق الاستيفاء الثنائي الخطي مع معاملات متطابقة عبر جميع مراحل فك التشفير لإعادة تحديد حجم التكيف لضمان محاذاة مثالية عبر اتصالات التخطي.
    3. في المرحلة الأولى، قم بتقليل القنوات من 256 إلى 96 بكسل عبر التفافيات الشبح عند H/4×W/4 ورفع العينات إلى H/2×W/2 وادمج مع ميزات التشفير المقابلة.
    4. في المرحلة الثانية، يتم معالجة ميزات مع التفافيات شبح لتقليل القنوات من 160 إلى 64 بكسل وزيادة العينات إلى دقة كاملة H×W والتكامل مع ميزات تخطي على مستوى المشفر.
    5. وأخيرا، تطبيق التفافيات الشبح لتقليل القنوات إلى 32 واستخدام الالتفاف النهائي 1 × 1 لتوليد خريطة التغيير الثنائية ذات القناتين.
    6. لخص خط أنابيب المعالجة الكامل من خلال الإطار الخوارزمي التالي، الذي يدمج جميع المكونات المعمارية في نظام كشف التغيير المتماسك.
      ملاحظة: الترميز: Eki تشير إلى ميزات المشفر من الصورة i ∈ {1,2} عند المستوى k؛ Fi هي الميزة المشفرة النهائية؛ figure-protocol-7 هي نسختها المسطحة؛figure-protocol-8 وهي ميزة تعزيز الانتباه؛ A هو مصفوفة الانتباه؛ Dj هي مخرجات فك الترميز؛ φk,ψ j هي كتل مشفر/فك ترميز؛ [·;·] تشير إلى التسلسل حسب القناة؛ W out هي نواة طبقة الإخراج.
      انظر خوارزمية الملف التكميلي 1 ل "اكتشاف التغيير التفاعلي القائم على دمج الانتباه متعدد المقياس"

figure-protocol-9
الشكل 1: المنهجية المقترحة يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-protocol-10
الشكل 2: هندسة الانتباه المتقاطع يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-protocol-11
الشكل 3: هندسة الانتباه التفاعلي يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

6. إجراءات التدريب

  1. دالة الخسارة
    ملاحظة: تستخدم عملية التدريب دالة فقدان تفيرسكي البؤرية لمعالجة اختلال التوازن الطبقي الذي يواجه عادة في مجموعات بيانات كشف التغيير.
    1. صيغ دالة الخسارة كما يلي: لتكن pi ∈ [0,1] هي الاحتمال المتوقع للبكسل i، وgi ∊ {0,1} الحقيقة الأرضية المقابلة. يعرف مؤشر تفيرسكي (TI) على النحو التالي:
      figure-protocol-12
      حيث α و β يتحكمان في العقوبة على الإيجابيات الكاذبة والسلبية الكاذبة على التوالي، و ε هو مصطلح تنعيم.
    2. ثم نعبر عن خسارة تفيرسكي البؤرية كالتالي:
      figure-protocol-13
      مع تعديل γ التركيز على البكسلات التي يصعب تصنيفها.
  2. تكوين المعاملات الفائقة
    1. تطبيق بحث شبكة منهجي قائم على التحقق المتقاطع من خمسة أضعاف على مجموعة القطارات لاختيار القيم المثلى.
    2. اضبط معاملات وزن الفقدان لمهمة كشف التغير إلى α = 0.3، β = 0.7، γ = 1.0، و ε = 1.0. تركز هذه القيم على تقليل الاكتشافات الفائتة مقارنة بالإيجابيات الكاذبة، وهو أمر مهم لمجموعات البيانات غير المتوازنة حيث تكون التغيرات نادرة نسبيا.
      ملاحظة: يركز الوزن غير المتماثل مع β > α على الاستدعاء، مما يعني أن السلبيات الكاذبة تعطى وزنا أكبر من الإيجابيات الكاذبة، وهو متوافق مع التصميم، خاصة في تطبيقات مراقبة الكوارث.
  3. المحسن واستراتيجية التعلم
    1. استخدم محسن AdamW مع تناقص وزن 1×10⁻⁴ لتحسين التنظيم ومنع الإفراط في التركيب.
    2. قم بتهيئة معدل التعلم عند 1×10⁻³ وتطبيق جدول تلدين جيب تمام لضمان تقارب سلس ومستقر أثناء التدريب.
    3. استخدم حجم دفعة مكون من 8 للحفاظ على التوافق مع بيئة ذاكرة بطاقة الرسوميات بسعة 4 جيجابايت.
  4. جدول التدريب
    1. درب النموذج بشكل منفصل على OSCD، ويتكون من 14 زوجا محددا مسبقا للتدريب و10 أزواج للاختبار، ثم على مجموعة بيانات SZTAKI Airchange مع Szada/1 و Tiszabob/3 كمعايير اختبار قياسية.
    2. قسم أزواج التدريب إلى خمسة أقسام، واستخدم مجموعة واحدة كمجموعة تحقق في كل تكرار، واستمر في التدريب لحد أقصى 100 عصر.
    3. راقب فقدان التحقق في نهاية كل طية وطبق معايير التوقف المبكر لمدة 10 فترات بعد استقرار التقارب لمنع الإفراط في التركيب وتقليل الحسابات غير الضرورية.
    4. اختر المعلمات الفائقة بناء على أفضل أداء تحقق متوسط عبر جميع الطيات.
    5. قم بإجراء اكتشاف التغييرات على مجموعة الاختبار وقياس الأداء في التشغيل الواحد باستخدام أزواج الصور المشروحة من كل مجموعة بيانات.
  5. تحسين الذاكرة
    1. تفعيل نقاط التحقق التدرجية لتقليل استهلاك ذاكرة GPU بحوالي 40٪، ويتم ذلك عن طريق إعادة حساب التفعيلات الوسيطة أثناء التمرير العكسي.
    2. تمكين التدريب الدقيق المختلط لاستخدام عمليات FP16 حيث تكون مستقرا عدديا، مما يحسن السرعة ويقلل من حمل الذاكرة.
    3. استخدم مقياس حجم الدفعة التكيفي لضبط استخدام الذاكرة ديناميكيا لتحقيق أقصى كفاءة لوحدة معالجة الرسوميات.

7. التقييم

  1. تأكد من عدم تضمين أي تحديثات من مدن الاختبار في التدريب أو التحقق لمنع تسرب البيانات.
  2. نظم رقع الصور وخرائط الحقيقة الأرضية المقابلة للتقييم على دفعة.
  3. تحميل أوزان النموذج المدرب من أفضل فترة أداء تحددها خسارة التحقق.
  4. اختر عتبة 0.5 لتحويل خرائط الاحتمالات إلى خرائط تغير ثنائية.
  5. حساب مقاييس التقييم على مستوى البكسل لقياس أداء كشف التغير10
    الدقة (P): نسبة من بكسلات التغير المتوقعة التي هي بكسلات تغيير حقيقية.
    الاستدعاء (R): نسبة من بكسلات التغير الحقيقي تم اكتشافها بشكل صحيح.
    F1-score: المتوسط التوافقي للدقة والاستدعاء.
  6. إنتاج رقعة الصورة في الوقت الحقيقي أثناء تدريب وتقييم النماذج بأبعاد 128 × 128 بكسل وخطوة بحجم 64 بكسل.
    ملاحظة: يضمن هذا التوليد الديناميكي فعالية الذاكرة وكذلك اتساق الحدود.
  7. تحقق من صحة المعالجة المسبقة ووضع الرقعة من خلال فحص عينة ممثلة من الصور التي تم إنشاؤها بشكل مفهوم أو صور ميزات متوسطة المستوى.
    ملاحظة: يتم تخزين تمثيلات الميزات المشفرة التي تولدها المشفرة المعتمدة على CNN في الذاكرة على شكل موترات لاستخدامها لاحقا في المراحل، والتي تعمل كنقاط تحقق عند التحقق من الميزات. يتم تخزين خرائط التغيير المنتجة كملفات صور عادية (e.g. PNG أو TIFF) ليتم عرضها بصريا لتقييم التعديلات المحددة.
  8. سجل مؤشرات التقارب (منحنيات الفقد، مقاييس الدقة) في تدريب النماذج، وتحقق مما إذا كانت نقاط النموذج محفوظة في فترات محددة حتى يمكن تكرار أو تحسين أو استعادة عملية التدريب بأكملها.
    ملاحظة: العرض الصريح لصيغة المخرج، وخطوات التحقق، وتفاصيل نقاط التفتيش يساعد في ضمان الشفافية، مما يسمح بإجراء التحقق خطوة بخطوة، كما يسمح بإعادة إنتاج البروتوكول والتحقق منه من قبل باحثين آخرين. يوفر هذا البروتوكول سير عمل مفصل ومعمقا حول كيفية إعداد مجموعة البيانات والمضي قدما في مرحلة المعالجة المسبقة، وبناء الشبكة، والتدريب، والتقييم. من خلال الالتزام بالخطوات، سيتمكن الشخص من تنفيذ الطريقة المقترحة تحت الظروف المحددة بطريقة قابلة للتكرار. تقدم نتائج مثل هذه العملية في قسم النتائج التالي.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم تقييم طريقة كشف التغيير المقترحة مقابل الأساليب الأساسية المعتمدة باستخدام مجموعتين من بيانات المرجع المتاحة للجمهور لتقييم أدائها عبر دقات طيفية وظروف بيئية مختلفة. تكشف نتائج التجارب عن تحسينات كبيرة في موازنة دقة الكشف مع التحكم الإيجابي الكاذب، مما يثبت بشكل خاص قدرة الطريقة على الحفاظ على معدلات استدعاء عالية مع تعزيز الدقة بشكل كبير مقارنة بالأساليب التقليدية.

...
البياناتالشبكة

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة شبكة تفاعلية متعددة المقاييس تعتمد على دمج الانتباه لاكتشاف التغيرات في صور الأقمار الصناعية ثنائية الزمن. يسهل دمج آلية انتباه ثنائية الاتجاه، على عكس الطرق أحادية الاتجاه، تفاعلا كاملا بين الميزات عبر الزمن مع إشارات انتباه مكملة للأمام والخلف. يتم التقاط التغيرات الزمنية التدريجية لتيار الانتباه الأمامي من خلال فرق الانتباه، أي من الاكتسابات الزمنية القديمة إلى الحديثة، بينما يتم التحقق من اتساق التغير بواسطة نظام اكتساب عكسي يتعرف على ميزات الفرقعة. وقد أثبتت هذه الم...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنهم لا يواجهون تضارب مصالح.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لم يحصل هذا البحث على منحة محددة من أي جهة تمويل في القطاعات العامة أو التجارية أو غير الربحية.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
مجموعة أدوات CUDAشركة NVIDIAالإصدار 11.3تسريع وحدة معالجة الرسومات (GPU) لحسابات التعلم العميق
cuDNNشركة NVIDIAالإصدار 8.2مكتبة التعلم العميق المحسنة لوحدة معالجة الرسومات
إنتل  المعالجشركة إنتلكور i7 10870Hالمنصة الحاسوبية المستخدمة في تدريب وتقييم نموذج التعلم العميق المقترح
نومبايالمصدر المفتوحالإصدار 1.21.0معالجة المصفوفة العددية
NVIDIA GeForce شركة NVIDIAبطاقة GTX 1650 Ti (ذاكرة فيديو 4 جيجابايت)وحدة معالجة الرسومات المستخدمة في تدريب النماذج المعجل
مجموعة بيانات اكتشاف التغيرات عبر الأقمار الصناعية (OSCD) في أونيراأونيرامجموعة بيانات صور RGB ومتعددة الطيف البصرية المتاحة للجمهور تستخدم للتدريب والتقييم.https://rcdaudt.github.io/oscd/
بايثونمؤسسة بايثون للبرمجياتالإصدار 3.8لغة البرمجة المستخدمة في تنفيذ الخوارزميات
بايتورشالذكاء الاصطناعي المفتوح (الميتا آي)الإصدار 1.12.1إطار عمل التعلم العميق مفتوح المصدر المستخدم لتطوير وتدريب النموذج المقترح
سكيت-لرنالمصدر المفتوحالإصدار 1.0.2مقاييس تقييم الأداء
مجموعة بيانات معيار SZTAKI AirChangeسزتاكيمجموعة بيانات الصور الجوية البصرية RGB المتاحة للجمهور تستخدم للتدريب والتقييم.http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
تورشفيجنالذكاء الاصطناعي المفتوح (الميتا آي)الإصدار 0.13.1تحميل مجموعات البيانات وتحويلات الصور
نظام ويندوزمايكروسوفت11نظام التشغيل  

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Satellite Image ChangeChange DetectionMultiscale Attention FusionSparse Feature ConvolutionDeep LearningEncoder Decoder NetworkTemporal ModelingGhost ModulesLand Cover ChangeBenchmark Datasets

Related Articles