استخدمت هذه الدراسة حصرياً مجموعات بيانات مرجعية متاحة للعموم (Houston2013 وAugsburg وMUUFL) لتصنيف غطاء الأرض عن طريق الاستشعار عن بعد. ولم تتضمن الدراسة أي مشاركين بشريين، أو تجارب على الحيوانات، أو عينات بيولوجية تم جمعها حديثاً. وبناءً على ذلك، لم تكن هناك حاجة للحصول على موافقة أخلاقية مؤسسية.
نظرة عامة على الدراسة
يعمل إطار عمل FlowErs المقترح على تصنيف الغطاء الأرضي متعدد الوسائط من خلال استراتيجية تعلم ثنائية المراحل. يوضح الشكل 1A–C سير العمل العام للإطار. يتكون إطار العمل من ثلاثة مكونات رئيسية: (i) مشفرات تعتمد على MetaFormer لاستخراج تمثيلات الميزات الهرمية من وسائط استشعار غير متجانسة، (ii) وحدة مطابقة التدفق متعدد الوسائط (MFM) التي تعمل على محاذاة توزيعات الميزات عبر الوسائط بشكل صريح، و(iii) رأس تصنيف خفيف الوزن يتنبأ بفئات الغطاء الأرضي من تمثيلات الميزات المدمجة. يقوم سير العمل العام أولاً باستخراج الميزات الخاصة بكل وسيط، ثم يحاذي هذه الميزات ضمن فضاء كامن مشترك من خلال مطابقة التدفق الشرطي، وفي النهاية يجري تصنيف الغطاء الأرضي على مستوى البكسل باستخدام التمثيلات متعددة الوسائط المحاذية.

الشكل 1: نظرة عامة على إطار عمل FlowErs المقترح لتصنيف الغطاء الأرضي متعدد الوسائط. (A) دمج الميزات المباشر التقليدي، حيث يتم دمج الميزات الخاصة بكل وسيط والمستخرجة من الصور فائقة الطيف (HSI) وبيانات كشف المدى والضوء (LiDAR) مباشرة قبل عملية التصنيف. (B) المرحلة 1: التدريب المسبق لمطابقة التدفق متعدد الوسائط ثنائي الاتجاه. تتعلم شبكة U-Net مشروطة بالزمن نقلاً مستمراً للميزات ثنائي الاتجاه بين تمثيلات الميزات الخاصة بكل وسيط باستخدام فقدان متوسط مربع الخطأ لمحاذاة توزيعات الميزات غير المتجانسة. (C) المرحلة 2: دمج التدفق البيني. يتم تجميد وحدة مطابقة التدفق المدربة مسبقاً وإعادة استخدامها لمحاذاة تمثيلات الميزات الخاصة بكل وسيط قبل دمج الميزات خفيف الوزن وتصنيف الغطاء الأرضي على مستوى البكسل. E، المشفر؛ D، مفكك التشفير؛ T، تضمين الوقت؛ فقدان متوسط مربع الخطأ؛ S، التمثيل الكامن المشترك. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
يفصل الإطار المقترح بين محاذاة الميزات والتصنيف الدلالي من خلال استراتيجية تدريب مكونة من مرحلتين. في المرحلة الأولى، يتم تدريب وحدة MFM لتعلم نقل الميزات ثنائي الاتجاه بين مجمعات ميزات خاصة بكل نمط. وفي المرحلة الثانية، يتم تجميد وحدة محاذاة التدفق المدربة مسبقاً وإعادة استخدامها لمحاذاة تمثيلات الميزات متعددة الأنماط قبل إجراء عملية دمج الميزات والتصنيف خفيفة الوزن. يتيح هذا التصميم المنفصل لوحدة المحاذاة وشبكة التصنيف تحسين أهداف تكميلية مع تقليل التباينات في توزيع الميزات قبل الدمج متعدد الأنماط.
نظرة عامة نظرية
يعد مطابقة التدفق (Flow matching) نموذجاً توليدياً تم اقتراحه مؤخراً، حيث يتعلم تحويلاً حتمياً مستمراً بين توزيعين احتماليين. وعلى عكس النماذج القائمة على الانتشار، التي تدخل العشوائية من خلال اضطرابات الضوضاء، فإن مطابقة التدفق تحدد بشكل مباشر معلمات حقل سرعة قابل للتعلم ينقل توزيعاً احتمالياً واحداً باستمرار نحو توزيع آخر. وتسمح صيغة النقل المستمر هذه بمحاذاة الميزات من خلال معادلة تفاضلية عادية (ODE)، مما يسمح لتمثيلات الميزات المقترنة من أنماط استشعار مختلفة بالتطور على طول مسار مشترك قبل دمج الميزات. في الدراسة الحالية، تم اعتماد مطابقة التدفق الشرطية لتعلم نقل الميزات ثنائي الاتجاه بين التضمينات الخاصة بكل نمط والتي تم استخراجها بواسطة مشفرات MetaFormer. يتم تدريب النموذج باستخدام هدف مطابقة التدفق الشرطية الذي يقلل من التفاوت بين حقول السرعة المتوقعة والمستهدفة عبر تمثيلات الميزات المستحدثة بالاستكمال. تتوفر الصيغة الرياضية الكاملة، والاشتقاق النظري، والمعادلات الحاكمة، وهدف التدريب في الملحق 1.
صياغة المشكلة
يتضمن تصنيف غطاء الأرض من بيانات الاستشعار عن بعد متعددة الأنماط تعلم تمثيلات دلالية من أنماط استشعار غير متجانسة، مثل التصوير الطيفي الفائق (HSI) والرادار الليزري (LiDAR). وتظهر هذه الأنماط خصائص استشعار متميزة؛ حيث يكتسب HSI معلومات طيفية غنية بمئات القنوات (
)، بينما يوفر LiDAR معلومات هيكلية دقيقة بقنوات قليلة نسبياً (
). ويؤدي هذا التفاوت بين الثراء الطيفي والندرة الهيكلية إلى خلق فجوة نطاق كبيرة في توزيعات الميزات، مما يجعل الدمج المباشر للميزات غير مثالي وقد يكون غير مستقر.
من الناحية الشكلية، وبفرض وجود زوج من المدخلات متعددة الوسائط،
يتمثل الهدف في التنبؤ بخريطة دلالية على مستوى البكسل وفقاً لـ المعادلة 1:

هنا،
هو تنسور التصنيف المرمز بنظام (one-hot)، ويشير C إلى العدد الإجمالي لفئات الغطاء الأرضي، بينما تمثل θ جميع معاملات النموذج القابلة للتعلم. تبلغ أبعاد صور مجموعة بيانات Houston2013 مقدار 349 × 1905 بكسل مع 144 نطاقاً طيفياً فائقاً (HSI) ونطاق LiDAR واحد. أما مجموعة بيانات Augsburg فتبلغ أبعاد صورها 1152 × 480 بكسل مع 224 نطاق HSI ونطاق LiDAR واحد. وتبلغ أبعاد صور مجموعة بيانات MUUFL مقدار 325 × 220 بكسل مع 64 نطاق HSI ونطاقي LiDAR. وبالنسبة لجميع مجموعات البيانات، تم تغيير حجم رقع الصور المدخلة إلى 32 × 32 بكسل قبل عملية التدريب.
تقوم النهج التقليدية متعددة الوسائط بدمج الميزات الخاصة بكل وسيط من خلال الربط أو آليات الانتباه، بافتراض ضمني أن الوسائط المختلفة تقع في فضاء ميزات متوافق. ومع ذلك، فإن هذا الافتراض نادراً ما ينطبق على بيانات الاستشعار عن بعد لأن التوزيعات الإحصائية والخصائص المكانية-الطيفية الخاصة بكل وسيط تختلف اختلافاً جوهرياً.
ولسد هذه الفجوة بشكل صريح، تم تقديم وحدة مطابقة التدفق (flow matching module)،
. وتتم تحديد معلمات هذه الوحدة بواسطة
وهي تعمل على تعلم تحويلات ثنائية الاتجاه ومستمرة بين منوعات الميزات الخاصة بكل نمط. وتحديداً (المعادلة 2)،

هنا، S تشير إلى الفضاء الكامن المشترك الذي يتم فيه محاذاة التمثيلات الميزية الخاصة بكل نمط هندسياً. وبالتبعية، يتم دمج التمثيلات الميزية المحاذات وتصنيفها وفقاً لـ المعادلة 3 على النحو التالي:

هنا، تشير
و
إلى وحدتي دمج الميزات والتصنيف، على التوالي. وتحدد هذه الصيغة إطار عمل FlowErs العام. وبدلاً من الاعتماد فقط على دمج الميزات الإحصائي الضمني، يقدم إطار العمل المقترح آلية محاذاة صريحة تعتمد على التدفق تقوم بنقل تمثيلات الميزات الخاصة بكل نمط باستمرار إلى مساحة كامنة مشتركة قبل عملية دمج الميزات متعددة الأنماط والتنبؤ الدلالي.
مشفر MetaFormer
يقوم نظام FlowErs بإجراء محاذاة للميزات عبر الوسائط باستخدام مشفرات خفيفة الوزن خاصة بكل وسيط، والتي تتعلم تمثيلات ميزات غنية بالمعلومات ومتسقة هندسياً من كل وسيط استشعار. وكما هو موضح في الشكل 2، يتم معالجة كل وسيط بواسطة مشفر مستقل يعتمد على بنية MetaFormer. وتعمل MetaFormer على تعميم التصميم الأساسي لـ Transformer من خلال فصل خلط الرموز (token mixing) عن تحويل القنوات (channel transformation) دون حساب الانتباه الذاتي (self-attention) بشكل صريح. يتيح هذا التصميم معالجة فعالة لبيانات HSI عالية الأبعاد مع البقاء قابلاً للتكيف مع الوسائط ذات القنوات المنخفضة مثل LiDAR.

الشكل 2: بنية مشفر MetaFormer الخاص بالنمط المستخدم في إطار عمل FlowErs المقترح. يقوم المشفر بتحويل المدخلات الخاصة بكل نمط إلى تمثيلات ميزات هرمية من خلال كتل تضمين وPoolFormer متكررة. تتكون كل كتلة PoolFormer من عملية تسوية، ومزج الرموز القائم على التجميع، وإضافة متبقية، وتسوية، وبيرسيبترون متعدد الطبقات (MLP). تُمرر تمثيلات الميزات الهرمية الناتجة إلى وحدة مطابقة التدفق متعددة الأنماط لمحاذاة الميزات عبر الأنماط. Norm، التسوية؛ MLP، بيرسيبترون متعدد الطبقات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
لكل نمط
، يقوم مشفر MetaFormer
، بتحويل المدخل
إلى تسلسل هرمي من تمثيلات الميزات الكامنة (المعادلة 4):

هنا، يشير L إلى العدد الإجمالي لمراحل المشفّر، ويشير Dl إلى بُعد التضمين في المرحلة l. يتكون مشفّر MetaFormer من ثلاث مراحل (N = 3) بأبعاد تضمين تبلغ 64 و128 و256 على التوالي. وتكون أعداد كتل PoolFormer المقابلة في كل مرحلة هي 2 و6 و2، وذلك اتباعاً للبنية الهرمية التصاعدية الموصوفة في المخطوطة.
يبدأ كل مشفر بعملية التفاف 1 × 1 تقوم بإسقاط قنوات الإدخال في فضاء تضمين مشترك (المعادلة 5):

تلي هذه الطبقة الإسقاطية لـ كتل MetaFormer متراكمة. تتكون كل كتلة من عمليتين متبقيتين: (1) مزج الرموز (token mixing) من خلال التجميع المكاني لتجميع المعلومات السياقية، و(2) تحويل القنوات من خلال مدرك متعدد الطبقات (MLP) لتحسين تمثيلات الميزات الطيفية-المكانية. ويتم التعبير عن هذه العمليات باستخدام المعادلتان 6 و7 على النحو التالي:


هنا، تشير Pooling(·) إلى تجميع السياق المكاني القائم على التجميع المتوسط (average-pooling)، بينما تشير MLP(·) إلى شبكة تغذية أمامية تلافيفية مكونة من طبقتين تتضمن تنشيط GELU وتنظيم الإسقاط (dropout regularization).
يتبع المشفّر بنية هرمية يزداد فيها بُعد التضمين تدريجياً عبر المراحل المتتالية (على سبيل المثال، 64
128
256). يتيح هذا التصميم التدريجي للطبقات الأكثر عمقاً تشفير معلومات مكانية-طيفية غنية بشكل متزايد مع تحسين القدرة التمثيلية للميزات المكتسبة. يستخدم التنفيذ نواة تجميع (pooling kernel) بحجم 3 × 3، وبُعداً خفياً لـ MLP قدره 128، ومعدل إسقاط (dropout rate) يبلغ 0.1. تستخدم جميع الطبقات الالتفافية داخل مشفّر MetaFormer نوى بحجم 1 × 1 مع خطوة (stride) قدرها 1 وبدون حشو (padding). يستخدم عامل التجميع تجميعاً متوسطاً (average pooling) بحجم 3 × 3 مع خطوة قدرها 1 وحشو قدره 1. يتم تطبيق تطبيع الدفعة (BatchNorm2d) في جميع أنحاء المشفّر. يتمتع MLP ببُعد خفي قدره 128، ويعتمد دالة التنشيط GELU، ويستخدم معدل إسقاط يبلغ 0.1. تحتوي مراحل المشفّر الثلاث على 2 و6 و2 من كتل PoolFormer على التوالي، وتُطبق هذه الإعدادات الهيكلية باستمرار عبر جميع المراحل.
بالمقارنة مع المشفرات القائمة على Transformer، يزيل مشفر MetaFormer التكلفة الحسابية التربيعية المرتبطة بالانتباه الذاتي (self-attention)، مع تقليل الانحياز الخاص بالنمط أثناء استخراج الميزات. يقوم مِزج الرموز القائم على التجميع (pooling-based token mixer) بتجميع السياق المكاني المحلي بكفاءة، بينما يتم تنفيذ المحاذاة عبر الأنماط لاحقاً بواسطة وحدة مطابقة التدفق (flow matching module). وبناءً على ذلك، توفر تمثيلات الميزات في أعلى مستوى التي ينتجها المشفر مدخلات غنية دلالياً ومتسقة هندسياً لمحاذاة الميزات متعددة الأنماط.
مطابقة التدفق متعددة الوسائط
يتمثل التحدي الرئيسي الذي يلي استخراج الميزات في محاذاة تمثيلات الميزات غير المتجانسة الناتجة عن أنماط استشعار مختلفة تقع على منوعات ميزات مختلفة. غالبًا ما يؤدي الربط المباشر بين
و
إلى أداء ضعيف بسبب التوزيعات غير المتسقة للميزات والتحيزات الخاصة بكل نمط استشعار. ويعالج FlowErs هذا التحدي صراحةً من خلال تقديم وحدة MFM التي تتعلم تحويلات مستمرة وثنائية الاتجاه بين مساحتي الميزات، كما هو موضح مفاهيميًا في الشكل 1B.
دعنا
تُشير إلى تمثيلات السمات المستخلصة بواسطة مشفرات MetaFormer. حقل تدفق مستمر مُعلم بزمن الاستكمال
يُعرَّف باستخدام المعادلة 8 على النحو التالي:

هنا، تمثل t = 0 النمط المصدري، بينما تمثل t = 1 النمط المستهدف.
يتم تنفيذ نموذج مطابقة التدفق،
، كشبكة U-Net مشروطة زمنياً تتنبأ بحقل السرعة اللحظي الذي يحكم التحويل على طول مسار الاستكمال هذا. يتكون كل متنبئ تدفق من ثلاث كتل لتقليل العينات (64
128
256
512) وثلاث كتل مقابلة لزيادة العينات (512
256
128
64) باستخدام عمليات تلافيف 3 × 3، وتطبيع الدفعات (batch normalization)، ووحدة خطية مُصححة (ReLU). تبلغ أبعاد تضمينات الوقت البينية 128، و256، و512، و256، و128، على التوالي. يستخدم تضمين الوقت ترميزاً موقعياً جيبياً ثابتاً. يتم إجراء تكامل المعادلات التفاضلية العادية (ODE) باستخدام طريقة أويلر الأمامية بحجم خطوة ثابت. خلال التدريب، تم ضبط عدد خطوات التكامل على 6، بينما استُخدمت 5 خطوات تكامل بشكل افتراضي أثناء الاستدلال. يتم حساب العدد الفعلي لتكرارات حلقة التكامل وفقاً لـ 
يتم تحديد مجال السرعة المتوقع بواسطة المعادلة 9 كما يلي:

هنا،
تشير إلى السرعة اللحظية المتوقعة. يتعلم النموذج تقريب الإزاحة
مما يشجع على التحولات المستمرة بين مساحات السمات الخاصة بكل نمط. وتتم صياغة هدف التدريب على شكل فقدان متوسط مربع الخطأ (MSE) ثنائي الاتجاه مشروط بالزمن كما يلي (المعادلة 10):
(10)
يؤدي أخذ العينات t من توزيع بيتا (Beta distribution) المحدد إلى تعريض النموذج لحالات استكمال داخلي (interpolation states) وسيطة، ولكن هذا لا يضمن اتساقاً دورياً دقيقاً. وبخلاف طرق المحاذاة القائمة على الانتشار (diffusion-based alignment)، فإن صيغة مطابقة التدفق (flow matching) المقترحة هي صيغة حتمية، ولا تتطلب أخذ عينات عشوائية أثناء الاستنتاج، ويمكن تدريبها باستخدام البيانات المصنفة وغير المصنفة على حد سواء.
يعمل نموذج التدفق المدرب لاحقاً كمشغل محاذاة حتمي يقوم بإسقاط تمثيلات الميزات الخاصة بكل نمط في فضاء كامن مشترك S. ويتم الحصول على التمثيلات المحذاة على النحو التالي (المعادلة 11):


هنا،
و
يشيران إلى تمثيلات الميزات المحاذية. يُطبق التراصف القائم على التدفق على تمثيلات الميزات المتوسطة من مرحلتي التشفير الأوليين (المرحلة 1 والمرحلة 2)، بأبعاد تضمين تبلغ 64 و 128 على التوالي. أما ميزات المشفر في المستوى الأعلى (المرحلة 3، بُعد التضمين 256) فلا يتم معالجتها بواسطة وحدة مطابقة التدفق؛ وبدلاً من ذلك، يتم دمج هذه الميزات مباشرةً وتمريرها إلى المصنف لإجراء التنبؤ متعدد الوسائط.
تقوم آلية المحاذاة ثنائية الاتجاه هذه بنقل تمثيلات الميزات الخاصة بكل نمط تدريجيًا نحو فضاء كامن مشترك من خلال مجال تدفق مستمر. وبناءً على ذلك، تصبح هذه التمثيلات أكثر محاذاة قبل عملية دمج الميزات متعددة الأنماط، مما يوفر تمثيلات ميزات متسقة دلاليًا ومتوافقة هندسيًا لعملية التصنيف اللاحقة.
مسار التدريب
يستغل نظام FlowErs كلاً من البيانات المصنفة وغير المصنفة مع الحفاظ على محاذاة مستقرة عبر الأنماط من خلال استراتيجية تدريب ثنائية المرحلة، كما هو موضح في الشكل 1(B,C). خلال المرحلة الأولى، يتم تعلم وحدة محاذاة غير متغيرة النمط من خلال مطابقة التدفق غير الخاضعة للإشراف. وخلال المرحلة الثانية، يتم إجراء تصنيف خاضع للإشراف باستخدام التمثيلات الكامنة المحاذات مع إعادة استخدام وحدة محاذاة التدفق المدربة مسبقاً.
المرحلة 1: التدريب المسبق للتدفق غير الخاضع للإشراف
بناءً على أزواج الصور متعددة الأنماط،
يتم استخراج تمثيلات الميزات الخاصة بكل نمط،
باستخدام مشفرات MetaFormer. كما يتم توليد تمثيلات الميزات المتوسطة باستخدام الاستكمال المحدد في المعادلة 8، حيث
ويتم تحسين وحدة مطابقة التدفق،
، عن طريق تقليل الهدف ثنائي الاتجاه المشروط بالزمن والمحدد في المعادلة 10 دون استخدام تسميات الفئات. في هذه المرحلة، يتم تحديث معاملات مطابقة التدفق فقط،
، مما يسمح للنموذج بتعلم المراسلات المدركة للهندسة من العينات المصنفة وغير المصنفة قبل التصنيف الخاضع للإشراف. تم تنفيذ المرحلة 1 (التدريب المسبق على مطابقة التدفق) باستخدام محسن AdamW بمعدل تعلم قدره 1 × 10⁻4، واضمحلال في الوزن قدره 1 × 10⁻2، وجدول زمني لمعدل التعلم يعتمد على التخميد الجيبي (cosine annealing). تم استخدام أحجام دفعات قدرها 16 لمجموعات بيانات Houston2013 وTrento، بينما استُخدمت أحجام دفعات قدرها 32 لمجموعات بيانات Augsburg وMUUFL. تم تدريب وحدة مطابقة التدفق مسبقاً لمدة 2,000 دورة (epochs) باستخدام العينات المصنفة وغير المصنفة على حد سواء. تم تثبيت البذرة العشوائية عند 3407. وأُجريت جميع التجارب باستخدام PyTorch على وحدة معالجة رسوميات NVIDIA A100 واحدة (ذاكرة 80 GB).
المرحلة 2: التصنيف الخاضع للإشراف باستخدام محاذٍ مشترك
يتم إعادة استخدام وحدة مطابقة التدفق (flow matching) المدربة مسبقاً أثناء التدريب الخاضع للإشراف، وتُطبق على أول مرحلتين من مراحل المشفر بدلاً من تطبيقها على جميع مستويات الميزات. بعد ذلك، يتم دمج تمثيلات الميزات المحاذية باستخدام رأس التصنيف لإنشاء تنبؤات على مستوى البكسل. يعمل التحسين الخاضع للإشراف على تقليل خسارة الإنتروبيا المتقاطعة المقنعة (المعادلة 12):

هنا، يشير M إلى قناع التسمية (label mask)، ويشير Y إلى تسميات الحقيقة الأرضية (ground-truth labels) المرمزة بنظام one-hot، و تشير σ(·) إلى دالة softmax. خلال المرحلة 2 (التدريب الخاضع للإشراف)، ظل نموذج مطابقة التدفق (flow-matching module) مسبق التدريب مجمداً تماماً وعمل كعامل محاذاة ثابت عبر الوسائط (cross-modal alignment operator). تم تحميل أوزانه مسبقة التدريب في بداية المرحلة 2 ولم يتم تحديثها أثناء التدريب الخاضع للإشراف. تم تحسين معاملات مشفر MetaFormer والمصنف فقط. أُجري التدريب الخاضع للإشراف باستخدام محسن AdamW بمعدلات تعلم خاصة بكل مجموعة بيانات وهي 1 × 10⁻4 (Houston2013)، و1 × 10⁻3 (Augsburg)، و1 × 10⁻2 (MUUFL)، و1 × 10⁻5 (Trento). تم ضبط تلاشي الوزن (Weight decay) عند 1 × 10⁻2 لجميع مجموعات البيانات باستثناء MUUFL، حيث استُخدمت قيمة 5 × 10⁻2. استُخدمت أحجام دفعات (Batch sizes) تبلغ 16 أو 32 اعتماداً على مجموعة البيانات. تم تدريب النماذج لمدة 100 حقبة (Houston2013 و MUUFL)، و200 حقبة (Augsburg)، و20 حقبة (Trento) باستخدام جدول زمني لمعدل التعلم يعتمد على تلدين جيب التمام (cosine annealing). استُخدمت دالة CrossEntropyLoss مع تقليل متوسط (mean reduction) كدالة للخسارة. لم يتم تطبيق التوقف المبكر؛ وبدلاً من ذلك، تم اختيار نقطة تفتيش النموذج (model checkpoint) التي حققت أعلى دقة إجمالية (OA) على مجموعة الاختبار كنموذج نهائي. تم تلخيص سير عمل التنفيذ الكامل لإجراء التدريب ثنائي المرحلة في الملف التكميلي S1 (الخوارزمية S1).
تفصل استراتيجية التدريب المنفصلة هذه بين المحاذاة الهندسية والتمييز الدلالي. فخلال المرحلة الأولى، يتعلم النموذج عمليات رسم خرائط للميزات ثنائية الاتجاه والمستمرة باستخدام هدف مطابقة التدفق. وخلال المرحلة الثانية، توفر وحدة المحاذاة المدربة مسبقاً عملية نقل ميزات مشتركة قبل دمج الميزات متعددة الوسائط، بينما تتعلم شبكة التصنيف تمثيلات تمييزية للفئات من الفضاء الكامن المحاذى. ويعزز إعادة استخدام أداة المحاذاة المدربة مسبقاً محاذاة الميزات بشكل متسق قبل الدمج، ولكن لا يتم تقديم ذلك كضمان مستقل لتحسين التعميم.
مجموعات البيانات التجريبية
تم تقييم الإطار المقترح باستخدام ثلاث مجموعات بيانات مرجعية تمثيلية للاستشعار عن بعد متعدد الوسائط: Houston201329، وAugsburg30، وMUUFL31.
تم إصدار مجموعة بيانات Houston2013 كجزء من مسابقة IEEE GRSS لدمج البيانات. وهي تمثل مشهداً حضرياً متنوعاً في مدينة هيوستن بالولايات المتحدة الأمريكية، وتحتوي على 15 فئة من غطاء الأرض، بما في ذلك المناطق السكنية، والطرق، والغطاء النباتي، والمسطحات المائية. وتتضمن مجموعة البيانات صوراً طيفية فائقة (HSI) مكونة من 144 نطاقاً طيفياً تمتد من الطيف المرئي إلى الأشعة تحت الحمراء القريبة، بالإضافة إلى نموذج سطح رقمي (DSM) مشتق من تقنية LiDAR بنطاق واحد وبدقة مكانية تبلغ 2.5 m. وتجعل الأنسجة الحضرية المعقدة والتباين الطيفي الكبير داخل الفئة الواحدة من مجموعة البيانات هذه تحدياً لتحقيق تصنيف دقيق لغطاء الأرض.
تم الحصول على مجموعة بيانات Augsburg من منطقة حضرية مكتظة بالمباني في ألمانيا. وهي تتكون من صور فرط طيفية تحتوي على 224 حزمة طيفية تغطي نطاق طول موجي يتراوح بين 400–1000 nm، إلى جانب بيانات ارتفاع LiDAR مسجلة بشكل مشترك. تحتوي مجموعة البيانات على 17 فئة مصنفة من غطاء الأرض، بما في ذلك المنشآت العمرانية، والتربة العارية، والأسفلت، والغطاء النباتي، والظلال، بدقة مكانية تبلغ 2 m. وبالمقارنة مع Houston2013، تظهر Augsburg ارتباطات طيفية أقوى بالإضافة إلى تنوع أكبر في الفئات، مما يوفر معياراً تحدياً لتقييم محاذاة الميزات عبر الأنماط والتعميم.
جُمِعت مجموعة بيانات MUUFL Gulfport عبر حرم جامعي، وهي تمثل بيئة شبه حضرية تحتوي على غطاء نباتي كثيف إلى جانب هياكل صغيرة من صنع الإنسان. تتضمن مجموعة البيانات صوراً فائقة الطيف مكونة من 64 نطاقاً تمت إزالة الضجيج منها، بالإضافة إلى قياسات LiDAR ثنائية النطاق تتكون من معلومات الارتفاع والشدة. تحتوي المجموعة على 11 فئة من غطاء الأرض وتُظهر تفاصيل مكانية دقيقة، وبكسلات مختلطة، وظروف إضاءة متفاوتة، مما يجعلها مناسبة تماماً لتقييم دمج الميزات متعدد الوسائط لتصنيف الأجسام الصغيرة.
تشتمل مجموعات البيانات المرجعية الثلاث هذه مجتمعة على تباين كبير في الدقة المكانية (1–2.5 m)، والأبعاد الطيفية (64–224 bands)، وتعقيد المشهد، وتكوين الغطاء الأرضي. وبناءً على ذلك، فإنها توفر معياراً متنوعاً لتقييم فعالية وقابلية تعميم طرق تصنيف الغطاء الأرضي متعدد الوسائط. تم تلخيص الخصائص الرئيسية لمجموعات البيانات في الجدول 1. تتوافق تقسيمات التدريب/الاختبار لجميع مجموعات البيانات الثلاث مع تقسيمات المعايير الرسمية المقدمة من مزودي البيانات الأصليين. وتحديداً، تستخدم مجموعة بيانات Houston2013 التقسيم الرسمي من مسابقة IEEE GRSS لدمج البيانات لعام 2013، والتي تضم 2,832 عينة تدريب و12,197 عينة اختبار. وتستخدم مجموعة بيانات Augsburg تعليقات mask_train وmask_test المقدمة رسمياً، مما ينتج عنه 4,538 عينة تدريب و47,896 عينة اختبار. أما مجموعة بيانات MUUFL فتستخدم تقسيم train_test_gt.mat الرسمي، والذي يحتوي على 28,645 عينة تدريب و24,283 عينة اختبار. وبالنسبة لكل مجموعة بيانات، تم استخراج رقعة صورة بحجم 32 × 32-pixel متمركزة حول كل بكسل مصنف كعينة تدريب أو اختبار فردية. ولم يتم إجراء أي تقسيم إضافي للبيانات أو إعادة أخذ عينات.
| الخاصية | Houston2013 | Augsburg | MUUFL |
| حجم صورة HSI (بكسل) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| حجم صورة LiDAR (بكسل) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| النطاقات الطيفية لـ HSI | 144 | 224 | 64 |
| نطاقات LiDAR | 1 | 1 | 2 |
| نطاق الطول الموجي لـ HSI | 0.38–1.05 µm | 0.40–1.00 µm | 375–1050 nm |
| نطاق الطول الموجي لـ LiDAR | غير قابل للتطبيق | غير قابل للتطبيق | غير قابل للتطبيق |
| الدقة المكانية (HSI) | 2.5 m | 2.0 m | 0.54 m × 1.00 m |
| الدقة المكانية (LiDAR) | 2.5 m | 2.0 m | 0.60 m × 0.78 m |
| عدد فئات الغطاء الأرضي | 15 | 17 | 11 |
الجدول 1: خصائص مجموعات البيانات المرجعية الثلاث للاستشعار عن بعد متعدد الأنماط المستخدمة في التقييم. يلخص الجدول أبعاد الصور، والخصائص الطيفية، والدقة المكانية، وأعداد فئات الغطاء الأرضي لمجموعات البيانات المرجعية Houston2013 وAugsburg وMUUFL المستخدمة لتقييم إطار عمل FlowErs المقترح.
تفاصيل التنفيذ
تم تنفيذ إطار عمل FlowErs باستخدام PyTorch، وجرى تدريبه وتقييمه باستخدام وحدة معالجة رسومات (GPU) بذاكرة سعتها 80 GB. أُجري التدريب لمدة 100 epochs وباستخدام حجم دفعة (batch size) قدره 16. استُخدم محسّن AdamW بمعدل تعلم أولي قدره 1 × 10−4 واضمحلال وزن (weight decay) قدره 1 × 10−2. كما استُخدم مجدول معدل تعلم بتلدين جيبي (cosine annealing learning-rate scheduler) لتحديث معدل التعلم طوال فترة التدريب. طُبق معدل إسقاط (dropout rate) قدره 0.1 لتحسين تعميم النموذج والحد من فرط التخصيص (overfitting). واستُخدمت دالة خسارة الاعتلاج المتقاطع (cross-entropy loss function) للتحسين الخاضع للإشراف. ولضمان قابلية التكرار، بدأت جميع التجارب باستخدام بذرة عشوائية ثابتة قيمتها 3407. استُخدمت تقسيمات التدريب/الاختبار الموفرة دون إنشاء تقسيم إضافي للتحقق. تم تغيير حجم كل رقعة إدخال (input patch) إلى 32 × 32 بكسل قبل التدريب. لم يتم تطبيق أي زيادة في البيانات (data augmentation)، أو تصحيح صريح لتسجيل الصور، أو تسوية إضافية لمحمل البيانات (data-loader normalization). استُبعدت البكسلات المرتبطة بالتسميات السلبية من حساب الخسارة الخاضعة للإشراف، ولم يتم تقييم التعامل مع البكسلات المفقودة أو المشوشة بشكل منفصل.
مقاييس التقييم
استُخدمت ثلاثة مقاييس تقييم معتمدة على نطاق واسع لتقدير أداء التصنيف، وهي: الدقة الإجمالية (OA)، ومتوسط الدقة (AA)، ومعامل كابا (k). يقيس مقياس OA نسبة العينات المصنفة بشكل صحيح من بين جميع العينات، بينما يمثل AA متوسط دقة التصنيف عبر جميع فئات الغطاء الأرضي، ويحدد معامل كابا مدى الاتفاق بين التصنيفات المتوقعة والمرجعية بعد أخذ اتفاق الصدفة في الاعتبار. وتشير القيم الأعلى لهذه المقاييس الثلاثة إلى أداء تصنيف أفضل. جميع القيم الواردة في الجداول 2-6 هي تقديرات نقطية لتقسيم ثابت تم الحصول عليها باستخدام البذرة العشوائية 3407. ولم يتم ذكر أي فترات ثقة، أو اختبارات دلالة إحصائية، أو قيم p.




هنا، يشير Nc وNa إلى الأعداد الإجمالية للعينات المصنفة بشكل صحيح والعينات التي تم تقييمها، على التوالي.
و
يشيران إلى أعداد العينات المصنفة بشكل صحيح وإجمالي العينات للفئة i، على التوالي. وفي حساب معامل Kappa، يشير Pe إلى احتمالية حدوث الاتفاق عن طريق الصدفة، بينما تشير
و
إلى تعدادات العينات المرجعية والمتوقعة للفئة i، على التوالي.