يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية

مقالة بحثية

طريقة تحليل دلالي لصور المشاهد الداخلية بناء على معرفة سابقة بهيكل المباني

54 مشاهدة

⸱

DOI:

10.3791/72054

⸱

أغسطس 11, 2026

في هذه المقالة

ملخص

تقترح هذه الدراسة خوارزمية تربط بشكل وثيق بين الميزات البصرية الهرمية التي يلتقطها مشفر محول هرمي نافذة متغيرة مع عمق صندوق حدود مانهاتن ثلاثي الأبعاد السابق الناتج عن اكتشاف مقاطع الخط، مما يحقق إعادة بناء دلالية عالية الدقة لمشاهد داخلية معقدة.

الملخص

لمعالجة انقطاعات التنبؤ الدلالي وتشوهات الحدود الفيزيائية الناتجة عن انسداد الأثاث في المشاهد الداخلية المعقدة، تقترح هذه الورقة طريقة تحليل دلالي تستفيد من المبادئ السابقة لبناء المباني. يستخدم النظام مشفر محول هرمي نافذة متغيرة لاستخراج ميزات بصرية متعددة المقاييس ويجمع بين خوارزمية كشف مقاطع الخط ذات الاتجاه والتدرج لبناء صندوق حدود ثلاثي الأبعاد في مانهاتن. يتحول هذا الصندوق الإحادي إلى حقل مسافة موقعة (SDF) قبل ترميز الخطوط الهندسية المنفصلة إلى حقل جهد فيزيائي مستمر. آلية الانتباه المتقاطع الموجهة بالبنية تجبر الإشارات البصرية على المحاذاة مع الحدود الهندسية المتعامدة ثلاثية الأبعاد الحقيقية، مما يعيد استمرارية الميزات في المناطق المحجوبة. يقوم رسم بياني للمجاورة المكانية المنشأ من عقد البكسل الفائقة بدفع شبكة الالتفاف الرسم البياني (GCN) لتجميع الميزات، مما يضمن اتساقا دلاليا كبيرا داخل المستوى الحامل للحمل الفيزيائي. مزيج من فقدان الإنتروبيا المتقاطع على مستوى البكسل وفقدان الاتساق الهيكلي المصمم خصيصا يعزز القيود، مما يعاقب التنبؤات خارج الحدود. تظهر التجارب عبر عدة جولات مستقلة أن متوسط التقاطع فوق الاتحاد (mIoU) يصل إلى 68.7٪ مع انحراف معياري 0.2٪، ودرجة F1 للحدود الهيكلية تصل إلى 76.4٪ مع انحراف معياري 0.3٪، مما يؤكد الأداء المتين للوحدات المقترحة. مع حجم عقدة صورة واحدة يبلغ 256، ظل متوسط زمن الاستدلال عند 61 مللي ثانية.

المقدمة

يحتل تحليل الصور الدلالية للمشهد الداخلي مكانة أساسية في الإدراك المكاني ثلاثي الأبعاد ومهام التفكير المكاني الذكي 1,2. غالبا ما يعيق استخراج الميزات البصرية في البيئات الفيزيائية الحقيقية بشكل كبير بسبب التخطيط المكاني المعقد3. حل الانقطاع الدلالي وتشوه الحدود الفيزيائية في هيكل أساس المبنى الناتج عن انسداد الأثاث واسع النطاق أمر مهم لأبحاث الإدراك المكاني4،5. إزالة التداخل من الأجسام المزدحمة بدقة واستعادة الاستمرارية الفيزيائية لنفس الجدار والأرضية سيحدد مباشرة دقة إعادة بناء المشهد ثلاثي الأبعاد وتحليل المنطق المكاني العالمي6. يتم توضيح الانقطاع الدلالي الناتج عن انسداد الأثاث واسع النطاق وتأثير الإصلاح الهيكلي لتوجيهات البناء المقترحة في الشكل 1، حيث يتم مقارنة المدخل المحجوز الأحمر والأخضر والأزرق (RGB) في الجدول 1A، وتشوه القناع الأساسي في الشكل 1B، ونتيجة إصلاح الهيكل السابق في الشكل 1C تحت نفس حالة المشهد الداخلي.

لتلبية متطلبات الدقة في التفكير المنطقي المكاني، تواجه الشبكات البصرية القائمة بالبكسل الحالية العديد من العقبات عند التعامل مع البيئات الداخلية المعقدة7،8. غالبا ما تمتلئ المساحات الداخلية بالأثاث الكثيف والأثاث المزدحم، مما يؤدي إلى فقدان كبير لإشارات الحدود البصرية المنخفضة المستوى في الصور9. تعتمد آليات استخراج الميزات التقليدية بشكل مفرط على استجابات لونية وملمس ثنائية الأبعاد محلية، مع افتقارها إلى فهم ماكروسكوب للقوانين المتعامدة الصلبة للهياكل ثلاثية الأبعاد المصنوعة يدويا10. هذا القيد في المجال الاستقبالي المحلي يجعل انتشار الميزات يتوقف بسهولة، مما يصعب توسيع الطوبولوجيا العالمية عبر الإخفاء11. حاليا، هناك حاجة ملحة لحل المشكلة الأساسية المتمثلة في الانقطاعات الدلالية في التنبؤ والتشويهات الشديدة للحدود الفيزيائية الناتجة عن الانسداد والتداخل12.

لمعالجة الأعطال الهيكلية في أساسات المباني الناتجة عن الانسداد والتداخل، طور المجتمع الأكاديمي مجموعة متنوعة من تدابير التدخل المستهدفة13. تعوض شبكات تجميع الميزات متعددة الوسائط بفعالية عن النواقص الكامنة في نمط بصري واحد في الإدراك المكاني من خلال إدخال خرائط عمق أو نصوص مسبقة للمساعدة في صور الأحمر-الأخضر-الأزرق (RGB)14,15. تضخ أطر إدراك الحدود واختيار السياق التكيفي استراتيجيات تعزيز الشكل الفيزيائي في مرحلة فك ترميز الميزات، مما يحسن بشكل كبير ملاءمة الحواف لنتائج التنبؤ في المشاهد المعقدة16,17. تحسن نماذج الاستدلال المبنية على شبكات GCN وآليات تفاعل الميزات بشكل كبير سلاسة الميزات والاتساق الدلالي الكبير في المناطق المتجانسة من خلال بناء الاتصالات على مستوى العقد18,19. دمج السابقات الهيكلية الصريحة لمانهاتن في خط أنابيب استخراج الميزات البصري يفرض حدود الاتساق الهندسي، مما يعالج تحديات انقطاع الميزات الناتجة عن انسداد الأجسام الأمامية الواسع20.

لمعالجة التحدي الأساسي المتمثل في أخطاء التنبؤ الدلالي والتشوهات الشديدة في الحدود الفيزيائية المرتبطة بالبنية التحتية للمباني، تم اقتراح إطار تحليل دلالي قائم على آلية اقتران مغلقة الحلقة تدمج السوابق المعمارية. يتجاوز هذا الإطار خطوط الهندسة الساذجة من خلال إنشاء محاذاة خرائط ثنائية الاتجاه بين الحقول الهندسية المستمرة ومتشعبات الميزات البصرية المنفصلة، مكونة تآزرا غير بسيط يصحح أخطاء الانسداد من خلال القوانين الهيكلية. يعتمد هذا النظام على شبكة عمود فقري بصري متعددة المقاييس وخوارزمية كشف مقاطع الخط تعتمد على تقدير نقطة الاختفاء للحصول على ميزات المظهر المحلية ونماذج الحواف المتعامدة التي تمثل صندوق حدود مانهاتن ثلاثي الأبعاد بشكل متوازي، ثم تحويلها إلى SDF. تستخدم الخوارزمية آلية الانتباه المتقاطع الموجهة بالهيكل، حيث تستخدم الميزات البصرية كمتجهات استعلام وتعامل ميزات SDF كمفاتيح وقيم لحسابات الضرب النقطي، مما يجبر الإشارة البصرية على المحاذاة مع الحدود الهندسية ثلاثية الأبعاد الحقيقية في فضاء الميزات. يتم تغذية رسم بياني للجوار المكاني مبني من عقد السوبربكسل وميزات الحواف ذات المستوى المكاني إلى شبكة GCN لأداء تجميع الميزات عبر العقد وتمرير الرسائل. تستخدم عملية تحسين المعلمات من الطرف إلى الطرف بشكل مشترك الإنتروبيا المتقاطع على مستوى البكسل ودالة فقدان الاتساق الهيكلي المخصصة، التي تقيد وتعاقب بشكل صارم البكسلات المتوقعة التي تعبر حدود البناء السابق. يتم تلخيص خط أنابيب التحليل الدلالي الكامل في الشكل 2، الذي يربط إدخال صورة RGB، والاستخراج الهندسي المسبق، ومحاذاة الانتباه المتقاطع، واستدلال الرسوم البيانية الفائقة، وفك ترميز القناع الدلالي ضمن بنية موحدة.

اعتمدت شبكات تحليل المشاهد المبكرة على العمليات الالتفافية لالتقاط نسيج المظهر المحلي، ولكن بسبب القيود في الحقول المستقبلية المحلية، أظهرت تماسكا دلاليا غير كاف للأهداف واسعة النطاق21،22. وقد طبقت دراسات سابقة وحدة الانتباه الذاتي في بنية المحول البصري لاستخراج المعلومات السياقية العالمية وبناء ميزات ارتباط البكسل لمسافات طويلة23,24. تستخرج استراتيجيات تجميع الميزات متعددة الوسائط متعددة الأبعاد للميزات الهندسية المكانية ثلاثية الأبعاد للمشهد من خلال دمج سحب نقاط خرائط العمق ومدخلات أوامر نصية 25,26. آليات الانتباه الهجينة لاستهداف الاندماج للميزات الخاصة بالنضج تدريجيا. من خلال بناء جسور تفاعل الميزات، قللت بشكل كبير من فقدان الطاقة وتقليل الخصائص في النقل متعدد المقاييس للإشارات البصرية وحسنت متانة تحليل الهياكل المعقدة. تدمج تصاميم المشفرة المتطورة بشكل مشترك وتستنتج تفاصيل المجالات عالية التردد إلى جانب الميزات العالمية والمحلية، مما يعزز قدرة الشبكة على التمييز بين الفئات الدلالية الدقيقة ذات التشابه العالي ويحسن دقة التحليل الداخلي27,28. توفر التطورات الحديثة في هياكل التقسيم الدلالي مراجع قيمة لتحسين الكفاءة الحسابية والإدراك المكاني. تستخرج النماذج المصممة للتنبؤ الكثيف والتجميع السياقي متعدد المقاييس ميزات هندسية دقيقة من خلفيات معقدة. تعالج استراتيجيات فصل الميزات والاندماج التآزري الغموض الدلالي في مناطق الحدود. آليات الانتباه الخفيفة الوزن ووحدات التجميع المبوابة تحسن توزيع المعاملات، مما يسرع الاستدلال مع الحفاظ على التفاصيل الهيكلية المحلية. يوفر تنفيذ هذه التصاميم المعمارية الفعالة إرشادات نظرية لتقليل العبء الحاسوبي لعمليات الاستدلال الطوبولوجي غير الإقليدية في تحليل المشاهد الداخلية.

تستخدم سابقات هيكل المبنى وتقدير تخطيط ثلاثي الأبعاد لتصحيح أخطاء التحليل البصري المحلي29. استخرجت الدراسات السابقة من الميزات الهندسية المتعامدة والمتوازية للمباني الداخلية كقيود استنتاجية لتقليل تحيز التنبؤ بالشبكة الناتج عن الخلفيات الداخلية المزدحمة30,31. تستخدم الخطط الحالية خوارزميات كشف مقاطع الخط وتقنيات تحليل نقاط استئصال الصور لإنشاء صناديق حدود ثلاثية الأبعاد في مانهاتن لرسم خريطة الحدود الفيزيائية للغرف والمساعدة في تحديد المواقع البصرية الأساسية32. تدمج البنية المشتركة لوحدة الوعي بالحدود والسياق متعدد المقاييس معلومات هيكلية سابقة ضمنيا في عملية فك ترميز الميزات عالية الأبعاد، مما يجبر الشبكة على إخراج أقنعة دلالية تتطابق بشكل وثيق مع الخطوط الفيزيائية الحقيقية، مما يحسن بشكل فعال تعرج وضبابية حواف الأجسام33. تم استكشاف تصاميم دوال فقدان شبه خاضعة أو ضعيفة الإشراف مع خصائص تعزيز الحدود على نطاق واسع. بالاعتماد على صيغ رياضية صارمة لمعاقبة سلوك تصنيف البكسلات المستقل الذي ينتهك القواعد الطوبولوجية المكانية، يتم ضمان سلاسة الهندسة والسلامة الهيكلية لنتيجة التقسيم النهائية من مصدر تحسين التدرج34.

استخدمت بعض الدراسات شبكات عصبية بيانية لإجراء تجميع عبر المجالات للميزات البصرية والتفكير في العلاقات الطوبولوجية في الفضاء عالي الأبعاد35. تقوم خوارزمية تقسيم البكسل الفائق بتجميع كتل البكسل المجاورة التي لها استجابة لونية وميزات نسيج متشابهة مسبقا في عقد متصلة مستقلة. تقوم خوارزمية تقسيم البكسل الفائق بضغط التكرار الحسابي لبنية الرسم البياني على مستوى الصورة وتحافظ على الطوبولوجيا الهندسية الأساسية للصورة36. تم بناء GCN على متجه الميزة عالية الأبعاد للعقدة، ومصفوفة المجاور التي تمثل القرب المكاني تدفع النقل الاتجاهي الفعال والدمج التفاعلي للمعلومات البصرية متعددة المقاييس على طول الرسم البياني الفيزيائي المتصل في المجالالمكاني 37,38. تطبيق وحدة تعزيز المعلومات الزمنية وآلية الاتصال الهجينة متعددة المقاييس يقمع التليين المفرط والتجانس لميزات العقدة الناتجة عن عملية تمرير الرسائل العميقة متعددة الطبقات39. تقنية تحويل مويجات الرسوم البيانية متعددة المقاييس، واستراتيجية تحسين تعلم العناصر الزائفة التسميمية، تحسن آلية ضوضاء الخلفية لصيغة تحديث ميزات العقدة، بحيث تحافظ الميزات ذات السمات الدلالية نفسها على وضع استجابة تعاوني في طوبولوجيا الشبكةالمعقدة 40. تقوم آلية الاستدلالية القائمة على الرسوم البيانية بتعيين شبكات البكسلات المنتظمة إلى فضاءات طوبولوجية غير إقليدية لإجراء حسابات تجميع الميزات للهياكل المباني غير المنتظمة والمكونات الداخلية41.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

تم إعداد مجموعات بيانات مشاهد RGB الداخلية وتعليقاتها الدلالية قبل التدريب على الشبكة. تم الحصول على مجموعة البيانات ثلاثية الأبعاد الداخلية واسعة النطاق ومجموعة بيانات المشاهد الداخلية RGB-D (انظر جدول المواد) من مستودعاتها الرسمية. تم الاحتفاظ بمشاهد الاقتناء الداخلية التي تحتوي على انسداد الأثاث، وتغير الإضاءة، ومقاطعة حدود الجدران، وتخطيطات مكانية معقدة لتتناسب مع سيناريو التحليل المستهدف. تم تحويل التسميات الدلالية إلى أقنعة PNG أحادية القناة مفهرسة، وتم تغيير حجم جميع صور RGB والأقنعة الدلالية إلى 512 × 512 بكسل. تم تطبيق تعزيز البيانات عبر الإنترنت خلال التدريب، مع الانقلاب الأفقي العشوائي باحتمال 0.5، ومقياس السطوع العشوائي بين 0.8 و1.2، والدوران العشوائي بين −10° و+10° لتوسيع توزيع التخطيط الهيكلي. تم تطبيع قنوات RGB بقيم متوسطة 0.485، 0.456، و0.406 وقيم انحراف معياري 0.229، 0.224، و0.225. تبع اختبار القياس الداخلي الواسع النطاق ثلاثي الأبعاد تقسيم الإصدارات الرسمي المستخدم في هذه الدراسة، مع 1201 مشهد تدريب و312 مشهد تحقق لتطوير والتحقق من النموذج. اتبع معيار RGB-D للمشهد الداخلي بروتوكول التقييم الرسمي، حيث تم تسجيل 795 صورة تدريبية و654 صورة اختبار. لم يتم تطبيق أي تقسيم إضافي قائم على النسبة المئوية على هذين المعيارين العامين.

تم تهيئة شبكة العمود الفقري البصري للعمود الفقري للمحولات الهرمية ذات النوافذ المتغيرة (انظر جدول المواد) كعمود فقري لترميز محول النوافذ المتحركة. تم ضبط حجم تضمين التحديث على شكل 4 × 4 بكسل. تم تعيين أبعاد التضمين للمراحل الأربعة الهرمية على 128، 256، 512، و1024، وتم تعيين عدد كتل المحولات في المراحل الأربع إلى 2، 2، 18، و2. تم تعيين حجم نافذة الانتباه المحلية إلى 7 × 7، وعدد رؤوس الانتباه إلى 4 و8 و16 و32 للمراحل الهرمية الأربع. تم استخدام دوال التنشيط المستمر غير الخطية داخل جميع طبقات البيرسيبترون متعددة الطبقات. تم إجراء تقليل العينة المكانية من خلال عمليات دمج الرقع مع خطوة 2 بعد كل مرحلة هرمية. تم تلخيص بنية الشبكة الأساسية ومعلمات وحدة الاستدلال الالتفافي في الجدول 1.

ثم تم إجراء استخراج ميزات الانتباه الذاتي عبر نافذة التغيير على خرائط ميزات الإدخال. تم تقسيم كل خريطة ميزات إلى نوافذ محلية غير متداخلة بأبعاد مكانية 7 × 7. كان الاهتمام العادي بالنافذة واهتمام النافذة المنزيحة يتناوب بين كتل محولات النوافذ المزيحة المجاورة. تم تعيين مسافة التحول الدوري إلى 3 بكسل، وتم تطبيق ترميز الانحياز النسبي في كل نافذة انتباه محلية. تم تجميع الميزات البصرية المحلية عبر التركيز الذاتي متعدد الرؤوس لتوليد تمثيلات هرمية متعددة المقاييس.

تم استخراج السوابق الهيكلية في مانهاتن من صور RGB الداخلية. تم اكتشاف مقاطع الحواف الهيكلية باستخدام خوارزمية اكتشاف مقاطع الخط باتجاه التدرج. تم تجميع الاتجاهات الهيكلية السائدة من خلال خوارزمية إجماع عشوائي للعينة (RANSAC) (انظر جدول المواد) بناء على تقدير نقطة الاختفاء. تم إعادة بناء ثلاثة اتجاهات متعامدة في مانهاتن لتوليد تمثيل صندوق محيط ثلاثي الأبعاد لمانهاتن. تم تحويل الحد الهيكلي المعاد بناؤه إلى خريطة SDF عن طريق حساب الحد الأدنى للمسافة الإقليدية من كل بكسل إلى أقرب قطعة خط حدود.

تم توليد ميزات الانتباه المتقاطع الموجهة بالبنية بعد الحصول على الميزات البصرية وسابقات SDF. تم تعيين متعدد الخصائص البصرية إلى موتر الاستعلام Q من خلال مصفوفة التحويل الخطية W عنصر تحت Q من الغطاء المزدوج الضرب R إلى مصفوفة التكوين W تحت عنصر Q من الغطاء مزدوج الضرب R إلى مصفوفة figure-protocol-1التكوين. تم تعيين حقل المسافة المستمرة السابقة إلى موتر المفتاح K وموتر القيمة V عبر مصفوفات figure-protocol-2التحويل، وتم تعيين بعد النموذج إلى 512. قسم التضمين متعدد الرؤوس فضاء الإسقاط إلى 8 فضاءات فرعية مستقلة، حيث يكون بعد كل رأس 64. الإحداثيات المنفصلة للتخطيط المكاني في التخطيط المكاني السابق إلى حقل جهد مستمر وولد مصفوفة الألفة الهيكلية S كتحيز مكاني إضافي صريح لتعديل مصفوفة التشابه النقطي والضرب النقطي. تم استخدام موتر الميزة البصرية كمصدر للاستعلام لأن التحليل الدلالي يتطلب من كل موقع بصري استرجاع أدلة متسقة هيكليا بنشاط من الفضاء الهندسي السابق. تم استخدام البريور SDF كمصدر رئيسي وقيمة لأنه يخزن المسافة الحدودية المستمرة والإشارات الهيكلية الداخلية الخارجية المستمدة من تخطيط مانهاتن. كان مصطلح ضرب النقطة يقيس التوافق بين المظهر الدلالي والشكل الهندسي السابق، بينما كان المصطلح البنيوي الإضافي λS يحول أوزان الانتباه نحو البكسلات على نفس المستوى الفيزيائي أو بالقرب من نفس المنحنى المعماري. كان المعامل λ يمثل الثقة في السابقة الهيكلية المستخرجة ويتحكم في مدى دمج القيود المتعامدة الصلبة في توزيع الانتباه. قلل هذا التشكيل من انتشار الميزات عبر الحدود الناتج عن انسداد الأثاث واحتفظ بالاسترخاء التكيفي في التصاميم غير المانهاتنية. تم حساب توزيع الانتباه الموجه بالبنية وفقا للمعادلة 1.

المعادلة 1: figure-protocol-3

حيث يشير A إلى مصفوفة تجميع الانتباه الموجهة بالبنية، وQ يشير إلى موتر الاستعلام الناتج عن الميزات البصرية، وK يشير إلى موتر المفتاح الناتج من ميزات SDF السابقة، وV يشير إلى موتر القيمة الناتج عن التمثيلات السابقة البنيوية، وdk يشير إلى بعد الميزة للموتر الرئيسي، وλ يشير إلى معامل الوزن البنيوي التكيفي المستخدم لتحديد الثقة الهندسية للمناطق المحلية وتخفيف القيود المتعامدة الصلبة في الفضاء غير المانهاتني التصاميم، وS تشير إلى مصفوفة الألفة SDF. التقسيم بواسطة dk استقر مقياس لوجيت الانتباه ومنع أبعاد الميزات الكبيرة من إنتاج أوزان انتباه مفرطة التركيز. حولت الدالة الأسية المطبعة (انظر جدول المواد) درجات التشابه المعدلة إلى توزيع مكاني مطبيعي، مما يسمح لكل بكسل بتجميع المعلومات السابقة الهيكلية بناء على الاتساق الدلالي والهندسي. يفسر هذا التصميم سبب دمج المظهر البصري وحدود المعمارية في مستوى الانتباه بدلا من دمج الميزات المباشرة.

تم بناء رسم طوبولوجيا البكسل الفائق من خريطة الميزات المحازمة بالبنية المعمارية. تم تقسيم خريطة الميزات باستخدام خوارزمية توليد المناطق المكانية. تم تعيين رقم البكسل الفائق إلى 256، ومعامل الانضغاط إلى 10، ومعامل التلميع الغاوسي على 1.0، ورقم التكرار على 10. تم فرض قيود القرب المكاني بتعيين وزن مقياس المسافة بنسبة ثابتة 1.0 إلى مسافة فضاء اللون الخاص بالميزة أثناء التجميع، مما يحافظ على توليد عقد منتظم عبر حدود الفوضى الكثيفة. تم تجميع البكسلات ذات الاستجابات الدلالية المتجانسة في عقد فائقة البكسلات. تم بناء حواف الرسوم البيانية وفقا لعلاقات الاقتراب المكاني، وقوة ألفة SDF، وقيود الاتساق الهندسي المتساوي المستوى. تظهر عملية بناء مصفوفة الألفة الهيكلية والربط الطوبولوجي في الشكل 3، موضحا كيف تم تحويل توجيه SDF إلى علاقات مكانية على مستوى الرسوم البيانية.

تم تقديم صياغة الرسم البياني لتحويل الاستدلال الكثيف باتجاه البكسلات إلى التفكير المكاني حسب العقد على مناطق بنيوية متجانسة. تمثل كل عقدة فائقة البكسل منطقة محلية ذات استجابة دلالية واستمرارية مكانية متشابهة، بينما تمثل كل حافة مسارا موثوقا لنقل الميزات مع قيود المجاور، وتقارب الحقل المسافي، وقيود الاتساق مع المستويات. قلل هذا التصميم من تأثير البكسلات المزعجلة والضوضاء ومكنت المناطق المحجوبة من الجدران والأرضية والسقف من استقبال الرسائل من العقد المجاورة فعليا. لذلك، كان بناء الحواف بمثابة جسر رياضي بين التوجيه المستمر لواجهة SDF والاستدلال البياني غير الإقليدي المتقطع.

تم تكوين شبكة استدلال الالتفافية بالرسوم البيانية ثلاثية الطبقات بأبعاد ميزات مخفية تبلغ 512 و256 و128. قامت طبقة الالفاف الالتصافي للرسم البياني بتنويسة ميزات على بنية الرسم البياني بناء على العلاقات المكانية للعقد. احتفظت الحلقة الذاتية بالحالة الأصلية لكل عقدة أثناء تمرير الرسالة، مما منع محو ميزات المنطقة الهيكلية الصغيرة بواسطة المناطق الكبيرة المحيطة. قام التطبيع المتماثل بتكبير عناصر مصفوفة المجاورة بحاصل ضرب الجذور التربيعية العكسية لدرجات العقدة بحيث تساهم العقد ذات الدرجة العالية والعقد منخفضة الدرجة تحت مقاييس عددية مماثلة أثناء الانتشار. أدى الانتشار الأمامي للتغذية التجميع المكاني الموضعي، حيث امتصت كل حالة عقدة ميزات عالية الأبعاد من تجمعات متجاورة في نفس المستويين قبل تطبيق دالة التقويم غير الخطية على مستوى العنصر. جعلت هذه الصياغة طبقة الالتفاف في الرسم البياني تقارب الانتشار الدلالي على طول مستويات داخلية ذات معنى فيزيائي بدلا من التنعيم غير المقيد عبر حدود الأجسام غير المرتبطة به. تم تقييم ميزات عقد الرسم البياني وفقا للمعادلة 2.

المعادلة 2: figure-protocol-4

يتم عرض الإسقاط من ميزات بكسل كثيفة إلى عقد البكسل الفائقة، وتمرير الرسائل الالفافية عبر الرسم البياني، والإسقاط العكسي للإحداثيات في الشكل 4، موضحا مسار تجميع الميزات من شبكات الصور المنتظمة إلى طوبولوجيا غير إقليدية والعودة إلى تمثيل دلالي كثيف. الإسقاط من ميزات البكسل الكثيفة في الشكل 4A إلى عقد البكسل الفائقة في الشكل 4B، ورسالة الالتفاف الرسم البياني في الشكل 4C، والإسقاط العكسي للإحداثيات في الشكل 4D يوضح مسار تجميع الميزات من شبكات الصور العادية إلى طوبولوجيا غير إقليدية والعودة إلى تمثيل دلالي كثيف.

حيث H(l) يرمز إلى موتر ميزة العقدة لطبقة الالتفاف الرسم البياني رقم l، وÂ يشير إلى مصفوفة المجاور ذات الوصلات الذاتية، وD يشير إلى مصفوفة الدرجة المقابلة لمصفوفة الجوار، وW(l) يشير إلى مصفوفة الوزن القابلة للتعلم لطبقة الالتفاف الرسم البياني ال ثانية، ويشير σ إلى دالة تفعيل الوحدة الخطية المصححة. كان مصطلح ÂH(l) يجمع ميزات من عقد فائقة البكسل المجاورة، بينما توازن D−1/2 وD−1/2 مساهمة العقد ذات الكثافات الاتصالية المختلفة. المصفوفة القابلة للتعلم W(l) أسقطت ميزات العقدة المجمعة في فضاء دلالي جديد، مما سمح لطبقة الرسم البياني بالتمييز بين الاتساق الهيكلي والقرب المكاني العادي. حافظ التنشيط غير الخطي على الفرق في الاستجابات بين المناطق المتعوية وغير المستوية بعد تجميع الخصائص.

تم فك رموز التقسيم الدلالي بعد التفكير البياني. تم بناء جهاز فك التشفير باستخدام ثلاث مراحل استيفاء ثنائية الخطية وعمليات دمج الربط عبر الطبقات. تم دمج ميزات الترميز المكاني الضحل مع ميزات فك الترميز الدلالي عالي المستوى من خلال دمج قناة. تمت استعادة دقة الميزة إلى حجم الصورة الأصلي، وتم توليد خريطة التنبؤ الاحتمالية الدلالية النهائية عبر طبقة الالتفاف 1 × 1.

تم تدريب شبكة التحليل الدلالي الكاملة باستخدام محسن وزن منفصل (انظر جدول المواد). تم تعيين معدل التعلم الأولي إلى 0.0001، ومعامل تدهور الوزن إلى 0.01، وحجم الدفعة إلى 8 لكلا المعيارين العامين. تم تعيين معدل تحلل العزم الأول على 0.9، ومعدل تدهور العزم الثاني على 0.999، ومعامل الاستقرار العددي لإبسيلون على 1 × 10⁻8. كان فقدان التحقق يراقب في نهاية كل حقبة، وتحفظ نقاط التحقق عندما يزداد mIoU في مجموعة التحقق. تم تدريب الشبكة لمدة 300 عصر باستخدام استراتيجية تدهور معدل التعلم متعدد الحدود بقوة تراجع 0.9. تم إجراء خمس جولات تدريب مستقلة باستخدام تهيئة عشوائية مختلفة لتحديد قاعدة تقييم صارمة إحصائيا. تم تحسين الشبكة بشكل مشترك باستخدام فقدان الإنتروبيا المتقاطع على مستوى البكسل وفقدان الاتساق الهيكلي. أجريت جميع التجارب على منصة حوسبة مجهزة بأجهزة حوسبة متوازية عالية الذاكرة، وتم الإبلاغ عن معلومات الأجهزة التفصيلية في جدول المواد.

فرض التحسين المشترك محاذاة الحدود الهندسية عن طريق حساب مقدار التدرج المكاني لموتر احتمالية الفئة. تم استخدام فقدان الاتساق الهيكلي كمنظم لضرب معيار تدرجات التنبؤ المكاني في قيم SDF المستمرة. كان المنطق الرياضي أن تغييرات الفئات الدلالية يجب أن تركز بالقرب من الخطوط المعمارية الحقيقية، حيث تقترب SDF من الصفر، بينما يجب أن تحافظ الداخليات المسطحة على الجدران والأرضيات والسقف على استجابات دلالية سلسة. عندما ظهر تدرج تنبؤ كبير بعيدا عن حدود هيكلية، زاد مصطلح الحقل المسافت من العقوبة ومنع الانتقالات الدلالية الزائفة داخل مستوى فيزيائي متجانس. عندما ظهر تدرج تنبؤ بالقرب من منحنى المسافة الصفرية، ظل العقوبة محدودا وحافظ على انتقالات طبقية مشروعة على طول الحدود المعمارية. تم تقييد مناطق الانتقال الدلالي لتتوافق مع خطوط المسافة الصفرية لقاعدة SDF، كما هو موضح في المعادلة 3.

المعادلة 3: figure-protocol-5

حيثL الإجمالي يشير إلى دالة الهدف النهائية للتحسين، وLce يرمز إلى فقدان الإنتروبيا على مستوى البكسل، وLscl يشير إلى خسارة الثبات الهيكلي، ويشير α إلى معامل وزن الخسارة الهيكلية. وفر مصطلح التسلسل التقاطع إشرافا دلاليا على مستوى البكسل عبر أقنعة التعليق، بينما فرض مصطلح الاتساق الهيكلي التنظيم الهندسي باستخدام السوابق المعمارية. α معامل الوزن متوازنا في التعرف على الفئات ومحاذاة الحدود، مما يمنع التحسين من تجاوز دقة المسممات المحلية أو الخطوط الهيكلية الصلبة. ربط هذا الهدف المشترك بين الدلالات البصرية، واتساق الحدود الفيزيائية، ومعلمات الشبكة القابلة للتدريب ضمن هدف تحسين موحد.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

الإعداد التجريبي

استخدمت هذه الدراسة مجموعتين قياسيتين لتحليل المشاهد الداخلية، وهما مجموعة بيانات داخلية ثلاثية الأبعاد واسعة النطاق ومجموعة بيانات RGB-D للمشاهد الداخلية، لتقييم الأداء وضبط النموذج. تحتوي مجموعة البيانات ثلاثية الأبعاد الداخلية واسعة النطاق على مشاهد فضائية معقدة وممسوحة ضوئيا واقعيا وعروض RGB عالية الدقة، مما يوفر تسميات دلالية ثلاثية الأبعاد دقيقة بكسل ببكسل وأقنعة تقسيم مكانية ثنائية الأبعاد. تؤسس بيانات إعادة بناء شبكة ا...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

تربط خوارزمية هذه الورقة بشكل وثيق الميزات البصرية الهرمية التي يلتقطها مشفر محول النوافذ الهرمية المتحركة مع عمق صندوق حدود مانهاتن ثلاثي الأبعاد السابق الناتج عن اكتشاف مقاطع الخط، مما يحقق إعادة بناء دلالية عالية الدقة لمشاهد داخلية معقدة. آلية الانتباه المتقاطع الموجهة بالبنية تجبر الإشارة البصرية على المحاذاة مع الحدود الهندسية الحقيقية التي تم معايرتها بواسطة SDF، مما يعيد استمرارية الميزات منخفضة المستوى في المناطق المحجوبةمحليا 42. يتم إنشاء رسم الطوبولوجي...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

يعلن المؤلفون أنهم لا يواجهون تضارب مالي.

شكر وتقدير

التمويل: برنامج البحث والتطوير الرئيسي في شنشي (رقم البرنامج 2024CY2-GJHX-76).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

المراجع

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

الوسوم

مسبقات بنية المبانيالمحول الهرمياكتشاف قطع الخطوطصندوق الإحاطة ثلاثي الأبعاد لمانهاتنحقل المسافة الموقعةآلية الانتباه المتقاطعالشبكة العصبية التلافيفية الرسوميةفقدان الاتساق البنيوي