Araştırma makalesi

Bina yapısı hakkında önceden bilgiye dayanan iç mekan sahne görüntüleri için anlamsal ayrıştırma yöntemi

28 görüntüleme

DOI:

10.3791/72054

11 Ağustos 2026

Bu makalede

Özet

Bu çalışma, kaydırılmış pencere hiyerarşik transformatör kodlayıcısı tarafından yakalanan hiyerarşik görsel özellikleri, çizgi-segment algılama ile oluşturulan Manhattan 3D sınırlayıcı kutusunun önceki derinliği ile sıkı bir şekilde birleştiren bir algoritma öneriyor; böylece karmaşık iç mekan sahnelerinin yüksek hassasiyetli anlamsal yeniden inşaflanması sağlanıyor.

Özet

Karmaşık iç mekan sahnelerinde mobilya tıkanmasının neden olduğu anlamsal tahmin kesintilerini ve fiziksel sınır bozulmalarını ele almak için, bu makale bina yapı önceliklerini kullanan anlamsal ayrıştırma yöntemi önermektedir. Şema, çok ölçekli görsel özellikleri çıkarmak için kaydırılmış pencere hiyerarşik transformatör kodlayıcısı kullanır ve gradyan yönü tutarlılığına sahip çizgi segmenti algılama algoritmasını birleştirerek Manhattan 3D sınırlayıcı kutusu oluşturur. Bu sınırlayıcı kutu, ayrık geometrik konturlar sürekli fiziksel potansiyel alanına kodlanmadan önce işaretli mesafe alanına (SDF) dönüştürülür. Yapı yönlendirilmeli çapraz dikkat mekanizması, görsel sinyalleri gerçek 3B ortogonal geometrik sınırlarla hizalamaya zorlar ve kapatılmış alanlarda özellik sürekliliğini geri getirir. Süper piksel düğümlerinden oluşturulan bir uzamsal bitişik graf, özellikleri birleştirmek için bir Grafik Konvolüsyon Ağı (GCN) yönlendirerek fiziksel yük taşıyıcı düzlemde makroskobik anlamsal tutarlılığı sağlar. Piksel düzeyinde çapraz entropi kaybı ile özel tasarlanmış yapısal tutarlılık kaybının birleşimi, sınır dışı tahminleri cezalandırarak kısıtlamaları güçlendirir. Birden fazla bağımsız çalışma üzerinde yapılan deneyler, birleşim üzerindeki ortalama kesişimin (mIoU) %68,7'ye ulaştığını ve %0,2 standart sapma ile %68,7'ye ulaştığını, yapısal sınır F1 puanının %0,3 standart sapma ile %76,4'e ulaştığını göstererek önerilen modüllerin sağlam performansını doğrulamaktadır. Tek bir görüntü düğümü boyutu 256 olduğundan, ortalama çıkarım süresi 61 ms olarak kaldı.

Giriş

Kapalı mekan sahne görüntüsü anlamsal analizi, üç boyutlu mekânsal biliş ve akıllı mekânsal akıl yürütmegörevlerinde temel bir konumu ele alır 1,2. Gerçek fiziksel ortamlarda görsel özelliklerin çıkarılması genellikle karmaşık mekansal yerleşimler nedeniyle ciddi şekildeengellenmektedir 3. Bina temel yapısının anlamsal süreksizlik ve fiziksel sınır bozulmasının çözümü, büyük ölçekli mobilya tıkanması nedeniyle bina temel yapısının temeli yapısı mekânsal biliş araştırması için önemlidir 4,5. Dağınık nesnelerden gelen paraziti doğru şekilde ortadan kaldırmak ve aynı duvar ile zeminin fiziksel sürekliliğini yeniden tesis etmek, üç boyutlu sahne yeniden yapılandırmasının ve küresel mekansal mantık analizinin doğruluğunu doğrudanbelirleyecektir 6. Büyük ölçekli mobilya tıkanmasının neden olduğu anlamsal süreksizlik ve önerilen bina-öncesi rehberliğin yapısal onarım etkisi Şekil 1'de gösterilmiştir; burada Tablo 1A'daki tıkanmış kırmızı, yeşil mavi (RGB) girişi, Şekil 1B'deki temel maske bozulması ve Şekil 1C'deki yapı-öncesi onarım sonucu aynı iç mekan sahne koşulları altında karşılaştırılmıştır.

Mekansal mantıksal akıl yürütmenin doğruluk gereksinimlerini karşılamak için, mevcut ana akım piksel odaklı görsel ağlar karmaşık iç mekan ortamlarıyla başa çıkarken birçok engellekarşılaşmaktadır 7,8. İç mekanlar genellikle yoğun mobilyalar ve dağınık mobilyalarla dolup, bu da görüntülerde düşük seviyeli görsel sınır sinyallerinin önemli ölçüde kaybolmasına yolaçmaktadır9. Geleneksel özellik çıkarma mekanizmaları, üç boyutlu insan yapımı yapıların katı ortogonal yasalarını makroskobik olarak tanımadıkları için yerel iki boyutlu renk ve doku tepkilerine aşırı şekildedayanır. Yerel alıcı alanın bu sınırlaması, özellik yayılımını kolayca kesintiye uğratır ve küresel topolojinin11 bloklar arasında genişletilmesini zorlaştırır. Şu anda, anlamsal tahmin kesintileri ve tıkanma ile girişimden kaynaklanan fiziksel sınırların ciddi bozulmaları temel sorununu acil çözmeye ihtiyaçvardır 12.

Bina temellerinde tıkanma ve parazit nedeniyle oluşan yapısal hataları gidermek için akademik topluluk çeşitli hedefli müdahale önlemlerigeliştirmiştir 13. Çapraz modal özellik toplama ağları, tek bir görsel modalitenin mekansal algıdaki doğasında olan eksikliklerini, kırmızı-yeşil-mavi (RGB) görüntülere yardımcı olmak için derinlik haritaları veya metin öncelikleri ekleyerek etkili bir şekilde telafieder 14,15. Sınır algısı ve uyarlanabilir bağlam seçim çerçeveleri, özellik çözme aşamasına fiziksel kontur geliştirme stratejileri ekleyerek tahmin sonuçlarının kenar uyumunu büyük ölçüde iyileştirir ve karmaşıksahnelerde 16,17. GCN'lere ve özellik etkileşim mekanizmalarına dayalı çıkarım modelleri, homojen bölgelerde düğüm düzeyinde bağlantılar oluşturarak özellik akıcılığını ve makro-anlamsal tutarlılığı önemli ölçüde artırır 18,19. Manhattan'ın açık yapısal önceliklerinin görsel özellik çıkarma boru hattına entegre edilmesi, geometrik tutarlılık sınırlarını sağlar ve bu da geniş ön plan nesne tıkanması20'nin neden olduğu özellik süreksizliği sorunlarını giderir.

Bina altyapısıyla ilişkili anlamsal tahmin hataları ve fiziksel sınırların ciddi bozulmaları gibi temel sorunu ele almak için, mimari öncelikleri içeren kapalı döngü bağlama mekanizmasına dayalı bir anlamsal ayrıştırma çerçevesi önerilmektedir. Bu çerçeve, sürekli geometrik potansiyel alanları ile ayrık görsel özellik manifoldları arasında çift yönlü bir eşleme hizalanması kurarak saf mühendislik boru hatlarını aşar; böylece yapısal yasalarla tıkanma hatalarını düzelten basit olmayan bir sinerji oluşturur. Bu şema, çok ölçekli görsel omurga ağı ve yok nokta tahminine dayalı bir çizgi-segment algılama algoritmasına dayanır; böylece Manhattan 3D sınır kutusunu paralel olarak temsil eden yerel görünüm özellikleri ve ortogonal kenar öncelikleri elde edilir ve ardından bunları SDF'ye dönüştürür. Algoritma, görsel özellikleri sorgu vektörleri olarak kullanan ve SDF özelliklerini nokta-çarpım hesaplamaları için anahtar ve değer olarak ele alan yapı rehberli çapraz dikkat mekanizması kullanır; böylece görsel sinyalin özellik alanındaki gerçek 3B geometrik sınırla hizalanması sağlanır. Süper piksel düğümlerinden ve uzamsal düzlemli kenar özelliklerinden oluşturulan bir uzamsal bitişiklik grafiği, çapraz düğüm özelliklerinin toplanmasını ve mesaj iletimi gerçekleştirmek için bir GCN'ye aktarılır. Uçtan uca parametre optimizasyon süreci, piksel düzeyinde çapraz entropiyi ve binanın öncesi sınırını geçen tahmin edilen pikselleri sıkı sıkı bir şekilde sınırlayan ve cezalandıran özel yapısal tutarlılık kaybı fonksiyonunu birlikte kullanır. Tam anlamsal ayrıştırma boru hattı, RGB görüntü girişi, geometrik önceden çıkarma, çapraz dikkat hizalama, süper piksel grafik akıl yürütme ve anlamsal maske çözme süreçlerini birleşik bir mimari içinde birbirine bağlayan Şekil 2'de özetlenmiştir.

Erken sahne ayrıştırma ağları, yerel görünüm dokularını yakalamak için konvolüsyonel işlemlere dayanıyordu, ancak yerel alıcı alanlardaki sınırlamalar nedeniyle büyük ölçekli hedeflerin anlamsal tutarlılığını yetersizgösterdiler 21,22. Önceki çalışmalar, görsel Transformer mimarisinin öz-dikkat modülünü küresel bağlamsal bilgi çıkarmak ve uzun mesafe piksel ilişkilendirme özellikleri oluşturmak içinkullanmıştır 23,24. Çapraz modal çoklu görünüm özellik toplama stratejileri, derinlik haritası nokta bulutları ve metin komut girişlerini birleştirerek sahnenin üç boyutlu geometrik mekansal özellikleriniçıkarır 25,26. Belirli alanlara yönelik özellik birleşimi için hibrit dikkat mekanizmaları yavaş yavaş olgunlaşmıştır. Özellik etkileşim köprüleri inşa ederek, çok ölçekli görsel sinyal iletiminde enerji kaybını ve özellik seyrekliğini önemli ölçüde azaltmış ve karmaşık yapı ayrıştırmanın sağlamlığını artırmıştır. En son kodlayıcı tasarımları, yüksek frekanslı alan mekânsal detaylarını küresel ve yerel özelliklerle birlikte birlikte entegre eder ve çıkarır; bu da ağın yüksek benzerlikli ince taneli anlamsal kategorileri ayırt etme yeteneğini güçlendirir ve iç mekan ayrıştırma doğruluğunuartırır 27,28. Semantik segmentasyon mimarilerindeki son gelişmeler, hesaplama verimliliği ve mekansal algıyı optimize etmek için değerli referanslar sağlar. Yoğun tahmin ve çok ölçekli bağlamsal toplama için tasarlanmış modeller, karmaşık arka planlardan ince tanenli geometrik özellikler çıkarır. Özellik ayrıştırma ve sinerjik füzyon stratejileri, sınır bölgelerindeki anlamsal belirsizliği ele alır. Hafif dikkat mekanizmaları ve kapılı toplama modülleri, parametre dağılımını optimize eder, böylece çıkarımı hızlandırır ve yerel yapısal detayları korur. Bu verimli mimari tasarımların uygulanması, iç mekan sahne ayrıştırmasında Öklid dışı topolojik çıkarım işlemlerinin hesaplama yükünü azaltmak için teorik rehberlik sunar.

Bina yapı öncelikleri ve 3B yerleşim tahmini, yerel görsel ayrıştırma hatalarını düzeltmek içinkullanılır 29. Önceki çalışmalar, iç mekan binalarının ortogonal ve paralel geometrik özelliklerini, karmaşık iç mekan arka planlarından kaynaklanan ağ tahmin yanlılığını azaltmak için çıkarım kısıtlamaları olarakçıkarmıştır 30,31. Mevcut şemalar, Manhattan 3D sınırlayıcı kutular oluşturmak için çizgi segmenti tespit algoritmaları ve görüntü ablasyon nokta analiz teknikleri kullanarak odaların fiziksel sınırlarını haritalandırır ve altta yatan görsel özelliklerin yerelleştirilmesine yardımcı olur32. Sınır farkındalık modülü ve çok ölçekli bağlamın ortak mimarisi, önceki yapısal bilgileri yüksek boyutlu özellik çözme sürecine örtük olarak gömülür; böylece ağın gerçek fiziksel konturlarla yakından eşleşen anlamsal maskeler üretmesini sağlar ve nesne kenarlarının keskinliğini ve bulanıklığını etkili şekildeartırır 33. Sınır güçlendirme özelliklerine sahip yarı denetimli veya zayıf denetimli kayıp fonksiyonu tasarımları geniş çapta araştırılmıştır. Bağımsız piksel sınıflandırma davranışını cezalandırmak için uzamsal topolojik kuralları ihlal eden titiz matematiksel formüllere dayanarak, nihai segmentasyon sonucunun geometrik düzgünlüğü ve yapısal bütünlüğü gradyan optimizasyonu34 kaynağından garanti edilir.

Bazı çalışmalar, grafik sinir ağlarını kullanarak görsel özelliklerin çapraz alanlarını toplaması ve yüksek boyutlu uzayda topolojik ilişkiler hakkında akıl yürütme yapmıştır35. Süper piksel segmentasyon algoritması, benzer renk tepkisi ve doku özelliklerine sahip bitişik piksel blokları bağımsız bağlı düğümlere önceden toplar. Süper piksel segmentasyon algoritması, grafik yapısının hesaplamalı yeketini görüntü seviyesinde sıkıştırırve görüntünün temel geometrik topolojisini korur 36. GCN, yüksek boyutlu düğüm özellik vektörü üzerine inşa edilmiş ve uzamsal yakınlığı temsil eden bitişik matris, mekansalalanda (37,38) fiziksel bağlantılı grafik boyunca çok ölçekli görsel bilginin verimli yönlü iletimi ve etkileşimli birleşimini sağlar. Zamansal bilgi geliştirme modülünün ve hibrit çok ölçekli atlama bağlantı mekanizmasının uygulanması, çok katmanlı derin mesajgeçişi 39 sürecinde oluşan düğüm özelliklerinin aşırı yumuşatılması ve homojenleşmesini bastırır. Çok ölçekli grafik dalgasit dönüşüm teknolojisi ve sözde etiket eleman öğrenme optimizasyon stratejisi, düğüm özellik güncelleme formülünün arka plan gürültüsü karşıtı mekanizmasını optimize eder; böylece aynı anlamsal özelliklere sahip özellikler, karmaşık ağ topolojisinde işbirlikçi yanıt modusürdürür 40. Grafik tabanlı akıl yürütme mekanizması, düzenli piksel ızgaralarını Öklid dışı topolojik uzaylara eşlerek düzensiz bina yapıları ve iç bileşenlerin özellik toplama hesaplamalarınıyapar 41.

Protokol

Kapalı RGB sahne veri setleri ve bunların anlamsal açıklamaları, ağ eğitiminden önce hazırlanmıştır. Büyük ölçekli kapalı 3D veri seti ve RGB-D iç mekan sahne veri seti (bkz. Materyal Tablosu) resmi depolarından elde edilmiştir. Mobilya kapanması, aydınlatma varyasyonu, duvar sınırı kesintisi ve karmaşık mekansal düzenleri içeren iç mekan alma sahneleri, hedef ayrıştırma senaryosuna uyacak şekilde korundu. Anlamsal etiketler indeksli tek kanallı PNG annotasyon maskelerine dönüştürüldü ve tüm RGB görüntüler ile anlamsal maskeler 512 × 512 piksel boyutuna dönüştürüldü. Eğitim sırasında çevrimiçi veri artırma uygulandı; rastgele yatay çevirme 0.5 olasılıkla, rastgele parlaklık 0.8 ile 1.2 arasında ve rastgele dönüş −10° ile +10° arasında rastgele dönüş yapılarak yapısal yerleşim dağılımını genişletti. RGB kanalları ortalama değerleri 0.485, 0.456 ve 0.406 ile ve standart sapma değerleri 0.229, 0.224 ve 0.225 olarak normalleştirildi. Büyük ölçekli kapalı 3D kıysası, bu çalışmada kullanılan resmi yayın bölünmesini takip etti; model geliştirme ve doğrulama için 1201 eğitim sahnesi ve 312 doğrulama sahnesi yer aldı. RGB-D kapalı mekan sahne kıyaslaması, resmi değerlendirme protokolünü takip ederek 795 eğitim görüntüsü ve 654 test görseli içeriyordu. Bu iki kamu kıytemasına ek bir yüzde tabanlı bölünme uygulanmadı.

Kaydırılmış pencere hiyerarşik transformatör görsel omurga ağı (bkz. Materyaller Tablosu), hareketli pencere transformatör kodlayıcı omurga olarak başlatıldı. Yama göme boyutu 4 x 4 piksel olarak yapılandırıldı. Dört hiyerarşik aşamanın göme boyutları 128, 256, 512 ve 1024 olarak ayarlanmış, dört aşamadaki transformatör blok sayısı ise 2, 2, 18 ve 2 olarak belirlenmiştir. Yerel dikkat penceresi boyutu 7 x 7 olarak ayarlanmış, dört hiyerarşik aşama için dikkat başı sayısı ise 4, 8, 16 ve 32 olarak belirlenmiştir. Tüm çok katmanlı perceptron katmanlarında doğrusal olmayan sürekli aktivasyon fonksiyonları kullanıldı. Mekânsal aşağı örnekleme, her hiyerarşik aşamadan sonra 2 adımla yama birleştirme işlemleriyle gerçekleştirildi. Çekirdek ağ mimarisi ve konvolüsyon çıkarım modülü hiperparametreleri Tablo 1'de özetlenmiştir.

Kaydırılmış pencere öz-dikkat özelliği çıkarımı giriş özellik haritalarında gerçekleştirildi. Her özellik haritası, 7 × 7 boyutlarında uzanan örtüşmeyen yerel pencerelere bölünmüştür. Düzenli pencere dikkati ve kaydırılmış pencere dikkati, bitişik kaydırılmış pencere transformatör blokları arasında dönüşümlü olarak kullanıldı. Döngüsel kayma mesafesi 3 piksele ayarlandı ve her yerel dikkat penceresi içinde göreli konumsal yanlılık kodlaması uygulandı. Yerel görsel özellikler, çok başlı öz-dikkat yoluyla toplanmış ve hiyerarşik, çok ölçekli özellik temsilleri oluşturulmuştur.

Manhattan yapısal öncelikleri iç mekan RGB görüntülerinden çıkarıldı. Yapısal kenar segmentleri, gradyan yönü-tutarlılığı çizgi segmenti tespit algoritması kullanılarak tespit edildi. Baskın yapısal yönler, yok nokta tahminine dayalı rastgele örneklem konsensus (RANSAC) algoritması (bkz. Materyal Tablosu) ile kümelenmiştir. Manhattan'ın 3B sınırlayıcı kutu temsili oluşturmak için üç karşılıklı dik Manhattan yönü yeniden inşa edildi. Yeniden oluşturulan yapısal sınır, her pikselden en yakın sınır çizgi segmentine olan minimum Öklid mesafesi hesaplanarak SDF haritasına dönüştürüldü.

Yapı odaklı çapraz dikkat özellikleri, görsel özellikler ve SDF öncelikleri alındıktan sonra oluşturuldu. Görsel özellik manifold, çift çarpılmış kap R'nin doğrusal dönüşüm matrisi W alt Q elemanı üzerinden çift çarpılmış kapağın R oluşum matrisi W alt Q elemanına, oluşum matrisine figure-protocol-1eşlenmiştir. Önceki sürekli mesafe alanı, dönüşüm matrisleri figure-protocol-2aracılığıyla anahtar tensör K ve değer tensörü V ile eşlendi ve model boyutu 512 olarak ayarlandı. Çok başlı modülasyon, projeksiyon uzayını 8 bağımsız alt uzaya bölmüştür ve her başlık 64 boyuta sahiptir. Önceki mekansal düzen, ayrık piksel koordinatlarını sürekli potansiyel alanına yansıtmış ve nokta-çarpım benzerlik matrisini modüle etmek için açık bir toplayıcı uzamsal yanlılık olarak yapısal yakınlık matrisi S'yi oluşturmuştur. Görsel özellik tensörü, sorgu kaynağı olarak kullanılmıştır çünkü anlamsal ayrıştırma, her görsel konumun geometrik önceki uzaydan yapısal olarak tutarlı kanıtları aktif olarak almasını gerektirir. SDF öncesi, Manhattan düzeninden türetilen sürekli sınır mesafesi ve iç-dış yapısal ipuçlarını sakladığı için anahtar ve değer kaynağı olarak kullanılmıştır. Nokta-çarpım terimi, anlamsal görünüm ile geometrik öncelik arasındaki uyumu ölçürken, toplama yapısal terim λS dikkat ağırlıklarını aynı fiziksel düzlemdeki veya aynı mimari kontura yakın piksellere kaydırırdı. λ katsayısı, çıkarılan yapısal önceliğe olan güveni temsil eder ve katı ortogonal kısıtlamaların dikkat dağılımına ne ölçüde dahil edildiğini kontrol ederdi. Bu formülasyon, mobilya tıkanmasından kaynaklanan sınır çapraz özellik difüzyonu azaltmış ve Manhattan dışı yerleşimlerde adaptif gevşemiyi korudu. Yapı odaklı dikkat dağılımı Denklem 1'e göre hesaplandı.

Denklem 1: figure-protocol-3

burada A, yapı yönlendirmeli dikkat toplama matrisini, Q görsel özelliklerden üretilen sorgu tensorunu, K SDF önceki özelliklerden üretilen anahtar tensörü, V yapısal önceki temsillerden üretilen değer tensörünü, dk anahtar tensörün özellik boyutunu, λ ise Manhattan dışındaki mekansal alanlarda yerel bölgelerin geometrik güvenini belirlemek ve katı ortogonal kısıtlamaları gevşetmek için kullanılan uyarlanabilir yapısal ağırlık katsayısını gösterir yerleşimleri ve S, SDF yakınlık matrisini gösterir. Dk ile bölünme, dikkat loglarının ölçeğini stabilize etti ve büyük özellik boyutlarının aşırı yoğunlaştırılmış dikkat ağırlıkları oluşturmasını engelledi. Normalleştirilmiş üstel fonksiyon (bkz. Materyal Tablosu), modüle edilmiş benzerlik puanlarını normalize bir uzamsal dağılıma dönüştürerek her pikselin anlamsal ve geometrik tutarlılığa dayalı yapısal önceki bilgileri toplamasına olanak tanıdı. Bu tasarım, görsel görünüm ve mimari sınır önceliklerinin neden doğrudan özelliklerin birleştirilmesiyle değil, dikkat seviyesinde birleştiğini açıklar.

Süper piksel topoloji grafiği, yapı hizalı özellik haritasından oluşturulmuştur. Özellik haritası, uzamsal bölge oluşturma algoritması kullanılarak segmentlere ayrılmıştır. Süper piksel sayısı 256, kompaktlık katsayısı 10, Gauss düzgünleştirme katsayısı 1.0 ve yineleme sayısı 10 olarak ayarlandı. Mekânsal yakınlık kısıtlamaları, kümeleme sırasında mesafe metrik ağırlığının özellik renk uzayı mesafesine 1.0 oranında sabit bir orana ayarlanarak uygulandı; böylece yoğun karmaşa sınırları üzerinde eşit düğüm oluşumu sağlandı. Homojen anlamsal yanıtlara sahip pikseller süper piksel düğümlerine toplandı. Grafik kenarları, mekânsal bitişiklik ilişkilerine, SDF affinite gücüne ve aynı düzlemsel geometrik tutarlılık kısıtlamalarına göre oluşturulmuştur. Yapısal yakınlık matrisi ve topolojik bağlantının yapım süreci, SDF rehberliğinin grafik düzeyinde mekânsal ilişkilere nasıl dönüştürüldüğünü gösteren Şekil 3'te gösterilmiştir.

Grafik formülasyonu, yoğun piksel bazında akıl yürütmeyi homojen yapısal bölgeler üzerinde düğüm bazlı uzamsal akıl yürütmeye dönüştürmek için tanıtıldı. Her süperpiksel düğümü, benzer anlamsal yanıt ve mekansal sürekliliğe sahip yerel bir bölgeyi temsil ederken, her kenar bitişiklik, mesafe-alan yakınlığı ve düzlemsel tutarlılık kısıtlamalarına bağlı olarak güvenilir bir özellik iletimi yolunu temsil ederdi. Bu tasarım, izole gürültülü piksellerin etkisini azalttı ve kapatılmış duvar, zemin ve tavan bölgelerinin fiziksel olarak bitişik düğümlerden mesaj almasını sağladı. Bu nedenle kenar yapısı, sürekli SDF yönlendirmesi ile ayrık Öklid dışı grafik akıl yürütme arasında matematiksel bir köprü görevi gördü.

Üç katmanlı bir grafik konvolüsyon akıl yürütme ağı, 512, 256 ve 128 gizli özellik boyutlarıyla yapılandırıldı. Uygulanan grafik konvolüsyon katmanı, düğümlerin mekansal ilişkilerine dayalı olarak grafik yapısını yumuşatma özelliğine sahiptir. Kendi kendine döngü bitişikliği, mesaj iletimi sırasında her düğümün orijinal durumunu korur, böylece küçük bir yapısal bölgenin özelliklerinin çevresindeki büyük bölgeler tarafından silinmesini engeller. Simetrik normalizasyon, bitişik matris elemanlarını düğüm derecelerinin ters kareköklerinin çarpımıyla ölçeklendirdi; böylece yüksek dereceli düğümler ve düşük dereceli düğümler yayılma sırasında karşılaştırılabilir sayısal büyüklükler altında katkıda bulundu. Besleme ilesi yayılımı, her düğüm durumu, eleman bazında doğrusal olmayan doğrulayıcı fonksiyon uygulanmadan önce bitişik düzlemsel kümelerden yüksek boyutlu özellikleri emdiği lokal uzamsal toplama gerçekleştirirdi. Bu formülasyon, grafik konvolüsyon katmanını, ilişkisiz nesnelerin sınırları boyunca sınırsız düzgünleştirme yerine fiziksel anlamlı iç düzlemler boyunca anlamsal yayılmayı yaklaştırmasını sağladı. Grafik düğüm özellikleri Denklem 2'ye göre değerlendirildi.

Denklem 2: figure-protocol-4

Yoğun piksel özelliklerinden süper piksel düğümlerine projeksiyon, grafik-konvolüsyon mesaj iletimi ve koordinat geri projeksiyonu Şekil 4'te sunulmakta olup, düzenli görüntü ızgaralarından Öklid dışı bir topolojiye ve tekrar yoğun anlamsal temsile doğru özellik-toplama yolunu açıklar. Şekil 4A'daki yoğun piksel özelliklerinden Şekil 4B'deki süper piksel düğümlerine projeksiyon, Şekil 4C'deki grafik-konvolüsyon mesaj iletimi ve Şekil 4D'deki koordinat geri projeksiyonu, düzenli görüntü ızgaralarından Öklid dışı bir topolojiye ve tekrar yoğun anlamsal bir temsile doğru özellik-toplama yolunu netleştirir.

burada H(l) l. grafik konvolüsyon katmanının düğüm özellik tensorunu gösterir, Â kendi döngü bağlantılarına sahip bitişik matrisini, D bitişik matrisi ile eşleşen derecelik matrisini, W(l) l-ci grafik konvolüsyon katmanının öğrenilebilir ağırlık matrisini ve σ Doğrulayıcı Doğrusal Birim aktivasyon fonksiyonunu gösterir. ÂH(l) terimi, bitişik süper piksel düğümlerinden gelen özellikleri toplarken, D−1/2 ve D−1/2 farklı bağlantı yoğunluklarına sahip düğümlerin katkısını dengeler. Öğrenilebilir matris W(l), toplanmış düğüm özelliklerini yeni bir anlamsal uzaya yansıtarak grafik katmanının yapısal tutarlılığı sıradan mekansal yakınlıktan ayırt etmesini sağladı. Doğrusal olmayan aktivasyon, özellik toplama sonrası aynı düzlemsel ve düzlemsel olmayan bölgeler arasındaki yanıt farkını korudu.

Anlamsal segmentasyon özellikleri grafik akıl yürütmesinden sonra çözüldü. Kod çözücü, üç bilinear interpolasyon upsampling aşaması ve katmanlar arası atlama bağlantı füzyon işlemleriyle inşa edilmiştir. Sığ uzamsal kodlayıcı özellikleri, kanal bazında füzyon yoluyla yüksek seviyeli anlamsal kodlayıcı özellikleriyle birleştirildi. Özellik çözünürlüğü orijinal görüntü boyutuna geri getirildi ve nihai anlamsal olasılık tahmin haritası 1 × 1 konvolüsyon katmanı üzerinden oluşturuldu.

Tam anlamsal ayrıştırma ağı, ayrılmış ağırlık-düşüş optimizatörü kullanılarak eğitildi (bkz. Materyaller Tablosu). Her iki kamuya açık kıyaslama için başlangıç öğrenme oranı 0.0001, ağırlık azalma katsayısı 0.01 ve parti büyüklüğü 8 olarak belirlendi. İlk moment bozulma oranı 0.9, ikinci moment bozulma oranı 0.999 olarak belirlendi ve sayısal stabiliteler epsilon katsayısı 1 × 10⁻8 olarak belirlendi. Doğrulama kaybı her dönemin sonunda izleniyor ve doğrulama setindeki mIoU arttığında kontrol noktaları kaydediliyordu. Ağ, 0.9 bozulma gücüne sahip polinom öğrenme hızı azalma stratejisi kullanılarak 300 etam için eğitildi. Beş bağımsız eğitim çalışması, farklı rastgele tohum başlatmaları kullanılarak gerçekleştirilerek istatistiksel olarak titiz bir değerlendirme temeli oluşturuldu. Ağ, piksel düzeyinde çapraz entropi kaybı ve yapısal tutarlılık kaybı kullanılarak ortak optimize edildi. Tüm deneyler, yüksek belleğe sahip paralel hesaplama donanımıyla donatılmış bir hesaplama platformunda gerçekleştirildi ve ayrıntılı donanım bilgileri Materyal Tablosu'nda bildirildi.

Ortak optimizasyon, sınıf olasılık tensörünün mekânsal gradyan büyüklüğünü hesaplayarak geometrik sınır hizasını zorunlu kılmıştır. Yapısal tutarlılık kaybı, mekânsal tahmin gradyanlarının normunu sürekli SDF değerleri ile çarpan düzenleyici olarak kullanıldı. Matematiksel gerekçe, anlamsal kategori değişikliklerinin gerçek mimari konturlara yakın odaklanması, SDF'nin sıfıra yaklaştığı yerlerde, düz duvar, zemin ve tavan iç mekanlarının ise düzgün anlamsal yanıtlar koruması gerektiğiydi. Büyük bir tahmin gradyanı yapısal sınırdan çok uzakta göründüğünde, mesafe alan terimi cezayı artırır ve homojen bir fiziksel düzlem içinde yanlış anlamsal geçişleri caydırır. Sıfır mesafe konturuna yakın bir tahmin gradyanı belirdiğinde, ceza sınırlı kalmış ve mimari sınırlar boyunca meşru sınıf geçişlerini korurdu. Anlamsal geçiş bölgeleri, Denklem 3'te belirtildiği gibi SDF'nin sıfır mesafe konturlarıyla hizalanmak üzere kısıtlanmıştır.

Denklem 3: figure-protocol-5

burada Ltoplam , nihai optimizasyon hedef fonksiyonunu, Lce piksel düzeyinde çapraz entropi kaybını, Lscl yapısal tutarlılık ceza kaybını, α ise yapısal kayıp ağırlık katsayısını gösterir. Çapraz entropi terimi, annotasyon maskeleri aracılığıyla piksel düzeyinde anlamsal denetim sağlarken, yapısal tutarlılık terimi mimari öncelikler kullanılarak geometrik düzenleme uygulardı. Ağırlık katsayısı, dengeli kategori tanıma ve sınır hizasını α, optimizasyonun yerel etiket doğruluğunun veya katı yapısal konturların aşırı uyumunu önler. Bu ortak hedef, görsel anlamsallığı, fiziksel sınır tutarlılığını ve eğitilebilir ağ parametrelerini birleşik bir optimizasyon hedefi içinde birbirine bağladı.

Sonuçlar

Deneysel Kurulum

Bu çalışma, performansı değerlendirmek ve modeli ayarlamak için iki standart iç mekan sahne ayrıştırma veri seti kullandı: büyük ölçekli bir kapalı mekan 3D veri seti ve bir RGB-D iç mekan sahne veri seti. Büyük ölçekli kapalı 3D veri seti, gerçekçi şekilde taranmış, karmaşık fiziksel uzay sahneleri ve yüksek çözünürlüklü RGB görünümler içeriyor; yüksek hassasiyetli, piksel piksel 3D nokta bulutu anlamsal etiketleri ve 2B uzaysal projeksiyon segmentasyon maskeleri sunuyor. Doğası gereği gerçekçi olan fiziksel uzay ızgara rekonstrüksiyon verileri ve ortogonal düzlem özellikleri, çıkarma dalında Manhattan 3D sınırlayıcı kutusunu doğru şekilde oluşturmak için geometrik-gerçeklik karşılaştırma kriterini oluşturur. RGB-D iç mekan sahne veri seti, mobilya ve dağınıklıkla gizlenmiş iç derinlik görüntülerini içerir ve ağın küresel mantıksal akıl yürütme doğruluğunu ve tıkanmalara karşı dayanıklılığını test etmek için kullanılır.

Algoritma, tahmin edilen ve gerçek anlamsal dağılımlar arasındaki mekânsal örtüşmeyi ölçmek için mIoU kullanırken, ayrıca tahmin edilen maske ile SDF tarafından kalibre edilen sıfır mesafeli fiziksel yapı kenarları arasındaki uyumun doğruluğunu titizlikle değerlendirmek için yapısal sınır F1 puanı da eklemektedir. Hesaplama sırasında, ağ tarafından üretilen kenar piksellerinin binaların gerçek fiziksel sınır konturlarıyla kesişip kesmediğini belirlemek için Öklid uzayında sabit bir piksel mesafesi hata eşiği belirlenir. Bu çift değerlendirme sistemi, büyük alanlı anlamsal bloklarda sınıflandırma hatalarını sınırlarken, katı çizgilerin topolojik yeniden yapılandırma etkisinin mikro-nicel değerlendirmesini güçlendirir. Deneysel veri yapılandırması ile optimizasyon süreci arasında tutarlılığı korumak için, veri seti ölçeği ve temel eğitim hiperparametreleri Tablo 2'de özetlenmiştir . Tablo 2, revize edilmiş el yazması için bir yetkili deneysel konfigürasyonu gösterir. Büyük ölçekli kapalı 3D kıyaslama 1201 eğitim sahnesi ve 312 doğrulama sahnesi kullanırken, RGB-D iç mekan sahne kıyaslaması 795 eğitim görüntüsü ve 654 test görsesi kullanır; her iki benchmark da 8 parti boyutu, 0.0001 başlangıç öğrenme oranı, 0.0001 ağırlık kaybetme katsayısı ve 300 eğitim dönemi ile eğitilmektedir.

Son teknoloji yöntemlerle karşılaştırma

İç mekan sahne ayrıştırma algoritmalarının nicel karşılaştırma tablosunu sunmadan önce, bu bölüm çok boyutlu değerlendirme sisteminde kullanılan test kıyaslamalarını titizlikle tanımlar. Modelin farklı granülerliklerdeki sınıflandırma performansını yansıtmak için, değerlendirme sistemi test sistemini iki ek metrikle tamamlar: küresel piksel doğruluğu (PixelAcc) ve ortalama sınıf doğruluğu (MeanAcc). Bu metrikler birlikte, sonraki nicel analizler için titiz bir teorik referans oluşturan ayrıntılı bir algoritma performans doğrulama sistemi oluşturur. Önerilen algoritmanın karmaşık fiziksel alanlarda anlamsal ayrıştırma doğruluğunu ve oklüzyon dayanıklılığını değerlendirmek için, RGB-D iç mekan sahne doğrulama setinde mevcut algoritmalarla karşılaştırmalı testler yapıldı. Karşılaştırma model kütüphanesi, temel maske-dikkat çerçevelerini, hiyerarşik vizyon Transformers'ları, modern saf konvolüsyon segmentasyon boru hatlarını, birleşik yoğun tahmin mimarileri ve kanallar arası dikkat ağlarını kapsar. Kıyaslama değerlendirmesi, transformatör tabanlı segmentasyon tabanı, birleşik yoğun tahmin tabanı, birleşik tespit ve segmentasyon tabanı, büyük ölçekli görme temel tabanı, saf konvolüsyon taban, maske-dikkat tabanlı segmentasyon tabanı, çapraz modal özellik toplama temel ve ilerleyici özellik birleşimi temel çizgisini kapsayacak şekilde genişletildi (bkz. Materyaller Tablosu), aynı RGB-D iç mekan sahne doğrulama seti, giriş çözünürlüğü, eğitim programı ve metrik protokolü kullanılarak. Önerilen mimaride, yapı yönlendirilmiş ağ, kaydırılmış pencere çok ölçekli görsel omurga, SDF'li yapı yönlendirmeli çapraz dikkat modülü ve süperpiksel GCN entegre eder. Genişletilmiş karşılaştırma, transformator tabanlı yoğun tahmin, konvolüsyon tabanlı yoğun tahmin, maske-dikkat ayrıştırma, çapraz modal özellik füzyonu ve ilerici özellik birleşimi paradigmalarını kapsıyor; böylece açık 3B geometrik sınır müdahalesinin daha geniş iç mekan sahne ayrıştırma temellerine karşı katkısının değerlendirilmesini sağlıyor.

Tablo 3, her ağın temel nicel metrikler üzerindeki nesnel değerlendirme performansını detaylandırır; ortalama değerleri ve buna karşılık gelen standart sapmaları beş bağımsız çalışma boyunca raporlar. Genişletilmiş temel karşılaştırma, önerilen yapı yönlendirilmiş akıl yürütme mekanizmasının standart yoğun tahmin omurgaları, maske tabanlı segmentasyon ağları ve RGB-D özellik birleşme ağlarının ötesinde doğruluk artışına katkı sağlayıp sağlamadığını değerlendirir. Deneysel veriler, önerilen algoritmanın dört nicel metrikte de istikrarlı kazanımlar elde ettiğini göstermektedir. Transformator tabanlı yoğun tahmin ağları ve maske-dikkat ağları güçlü küresel bağlam modelleme yeteneğini korudu, ancak öngörü maskelerinde açık fiziksel sınır kısıtlamaları olmadığı için ön plan karmaşası varken Sınır F1 değerleri daha düşük kaldı. Çapraz modal ve ilerici füzyon ağları yerel anlamsal sürekliliği geliştirdi, ancak özellik birleşimi hâlâ öncelikle görünüm ve derinlik tepkilerine dayanıyordu, işaretli mesafe yapısal öncesine değil. Önerilen yapı yönlendirilmiş ağ, 0.687 mIoU ile 0.002 standart sapma ve ortalama Sınır F1 puanı 0.764 ve standart sapma 0.003 elde etti. Genişletilmiş karşılaştırma, performans artışının yalnızca daha büyük yoğun tahmin omurgasından değil, işaretli mesafe alan rehberliği, yapı farkında çapraz dikkat ve grafik tabanlı topoloji akıl yürütmesinin ortak kullanımından kaynaklandığını göstermektedir.

Modelin tıkanma doğruluğunu tıkanma altında analiz etmek için, doğrulama setinde mobilya ve diğer dağınıklıklar nedeniyle ciddi şekilde engellenen tipik senaryoları tespit edip çıkardık ve piksel düzeyindeki tahmin maskelerinin görselleştirmelerini ürettik.

Yöntem iş akışı ve grafik akıl yürütme süreci Şekil 1, Şekil 2, Şekil 3 ve Şekil 4'te tanımlanmıştır. Şekil 5, aşırı tıkanma koşulları altında modeller arasında morfolojik tahminlerdeki farklılıkları göstermektedir. Nitel karşılaştırma örgü haritasındaki kırmızı dikdörtgenler, köşelerin ve yük taşıyan yüzeylerin kapatıldığı önemli çatışma alanlarını işaretler. Maske-dikkat tabanlı segmentasyon temel çizgisinden elde edilen çıkış maskası, belirgin kenar yumuşatması ve sınıflar arası yapışma gösterir. Çapraz modal özellik toplama temel ve aşamalı özellik birleşimi temel çizgisi çapraz modal verileri içerse de, tahmin sonuçları hâlâ yapısal sınıf süreksizlikleri ve fiziksel sınır bozulmaları gösterir. Bu önerilen yöntemle oluşturulan maske, zemin-gerçeklik etiketleriyle yüksek uzluksal örtüşme gösterir. Tamamen piksel odaklı prensiplerle sınırlanan temel modeller, kapatıldığında yerel alıcı alanlarını kaybetme eğilimindedir. Önerilen yöntem, Öklid dışı uzayda mesaj iletimi gerçekleştirmek için süperpiksel GCN kullanır; böylece örtük geometrik sınırlarla yönlendirilen temel köşeleri ve doğrusal uzamsal iskeletleri yeniden inşa eder. Bu, önerilen çözümümüzün karmaşık iç mekan düzenlerini görsel morfolojik açıdan çözmedeki anti-parazit performansını doğrular.

Ablasyon deneyi

Önerilen mimarideki her bağımsız bileşenin gerçek katkısını analiz etmek için, bu çalışma RGB-D iç mekan sahne doğrulama seti üzerinde genişletilmiş modüler ablasyon testi oluşturdu. Test temeli, yalnızca taban kaydırılmış pencere transformatör görsel omurgasından oluşan geleneksel bir sınıflandırma ağına ayarlandı. Nicel değerlendirme, yapı yönlendirmeli çapraz dikkat, işaretli mesafe alan yanlılığı, uyarlanabilir yapısal ağırlıklandırma, süper piksel grafik akıl yürütme, aynı düzlemsel kenar yapısı, simetrik grafik normalizasyonu ve yapısal tutarlılık kaybının bağımsız katkısını ölçtü. Bu genişletilmiş ablasyon tasarımı, kümülatif modül kazanımlarını bileşen çıkarma etkilerinden ayırarak her tasarım seçiminin katkı sınırını daha net hale getirdi.

Tablo 4 ve Şekil 6 , genişletilmiş kümülatif ve kaldırma tabanlı ablasyon ayarlarında doğruluğun evrimini göstermektedir. Taban kaydırılmış pencere transformatör ağı, üç boyutlu fiziksel sınır kısıtlamalarından yoksundur, bu da dağınık arka planlarda sınırlı özellik toplamasına yol açar. Yapı yönlendirilmiş çapraz dikkat eklendiğinde, mIoU 0.615'ten 0.648'e ve Sınır F1 puanı 0.630'dan 0.685'e yükseltildi; bu da işaretli mesafe alanının önceki görsel özellikler ile yapısal konturlar arasındaki hizalanmayı iyileştirdiğini gösterdi. Sadece süper piksel grafik akıl yürütmesi eklendiğinde mIoU 0.641'e ve Sınır F1 puanı 0.676'ya yükseltildi; bu da düğüm bazında topoloji akıl yürütmenin homojen fiziksel bölgeler üzerinde anlamsal tutarlılığı iyileştirdiğini gösterdi. Sadece yapısal tutarlılık kaybı eklendiğinde mIoU'yu 0.632'ye ve Sınır F1 puanını 0.662'ye yükseltti; bu da kayıp teriminin genel bağlamsal toplamayı değil, sınır uyumunu esas olarak etkilediğini gösterdi.

Çapraz dikkati grafik akıl yürütme ile birleştirildiğinde mIoU 0.669'a ve Sınır F1 puanı 0.721'e yükseltildi; bu da görsel-yapısal hizalanmanın ve grafik-alan mesaj iletiminin tamamlayıcı etkiler yarattığını gösterdi. Çapraz dikkat ile yapısal tutarlılık kaybı birleştirildiğinde 0.660 mIoU ve 0.713 Sınır F1 puanı elde edildi; grafik akıl yürütmeyi yapısal tutarlılık kaybıyla birleştirerek 0.653 mIoU ve 0.704 Sınır F1 puanı elde edildi. Bu çiftli sonuçlar, çapraz dikkat modülünün ana geometrik hizalama sinyalini sağladığını, grafik akıl yürütme modülünün bu sinyali aynı düzlemsel bölgeler arasında genişlettiğini ve yapısal tutarlılık kaybının optimizasyon sırasında anlamsal geçiş sınırını iyileştirdiğini göstermektedir.

Kaldırma tabanlı ablasyon, iç tasarım seçeneklerinin katkısını daha da netleştirdi. İşareli mesafe alan toplama yanlılığının kaldırılması, mIoU'yu 0.656'ya, Sınır F1 puanını ise 0.698'e düşürdü; bu da yapısal afinite matrisinin sınır çapraz özellik difüzyonunu bastırmada merkezi olduğunu doğruladı. Uyarlanabilir yapısal ağırlık katsayısı λ kaldırıldığında, mIoU 0.671'e ve Sınır F1 puanını 0.736'ya düşürdü; bu da sabit bir yapısal kısıtlamanın, Manhattan dışı ve görsel olarak bozulmuş bölgelerde model yanıtını zayıflattığını gösteriyor. Aynı düzlemsel kenar kısıtlamasının kaldırılması, mIoU'yu 0.666'ya, Sınır F1 puanını ise 0.728'e düşürdü; bu da yalnızca yerel bitişikliğe dayalı grafik kenarlarının fiziksel düzlem tutarlılığını koruyamadığını gösterdi. Simetrik grafik normalizasyonun kaldırılması mIoU'yu 0.673'e, Sınır F1 puanını ise 0.737'ye düşürdü; bu da kararlı düğüm toplanması için derece-dengeli yayılımın gerekli olduğunu gösteriyor. Önerilen tam yapı rehberli ağ, 0.687 mIoU ve 0.764 Sınır F1 puanı elde etti; bu da nihai kazancın yapısal dikkat, grafik akıl yürütme ve sınır farkında optimizasyon arasındaki koordineli etkileşimden kaynaklandığını gösterdi.

Hesaplama karmaşıklığı, eğitim süresi ve çıkarım verimliliği analizi

SDF çıkarımının hesaplama maliyetini, yapı yönlendirmeli çapraz dikkat ve süper piksel grafik konvolüsyon akıl yürütmeyi değerlendirmek için, bu çalışma aynı hesaplama platformunda parametre ölçeği, kayan nokta işlemleri, zirve bellek kullanımı, eğitim süresi, tek kare çıkarım gecikmesi, kare hızı ve mIoU değerlerini değerlendirdi. Kayan nokta işlemleri 512 × 512 giriş çözünürlüğü altında hesaplandı. Çıkarım gecikmesi, model ısınmasından sonra 1 parti büyüklüğüyle ölçüldü, bildirilen kare hızı ise ortalama tek görüntü gecikmesinden hesaplandı. Eğitim süresi aynı 300 dönemlik takvim, 8 parti büyüklüğü, optimizer ayarları ve veri ön işleme boru hattı altında ölçüldü.

Tablo 5, her ağ mimarisi için model ölçeği, eğitim maliyeti, çıkarım verimliliği ve ayrıştırma doğruluğu arasındaki ilişkiyi detaylandırır. Tablo 5'teki mIoU ve Sınır F1 sütunları, her ilgili model için Tablo 3 ile aynı genel doğrulama seti değerlerini kullanır. Bu iki doğruluk sütunu, yalnızca ayrıştırma doğruluğunu hesaplama maliyetiyle karşılaştırmak için Tablo 5'te tekrarlanır. Eğitilebilir parametrelerdeki artış, esas olarak yapı yönlendirmeli çapraz dikkat modülündeki sorgu-anahtar-değer projeksiyon katmanları ve üç grafik konvolüsyon katmanının ağırlık matrislerinden kaynaklanıyordu. Eğilenemeyen maliyet esas olarak SDF üretimi, süper piksel bölmesi ve grafik bitişiklik yapımından kaynaklanıyordu. Bu eğilenemeyen işlemler her giriş görüntüsü için bir kez gerçekleştirildiğinden, çıkarım gecikmesini artırdılar ancak eğitilebilir parametrelerin sayısını önemli ölçüde artırmadılar. Bu ayrım, önerilen yöntemin parametrelerde orta düzeyde bir artış göstermesini ancak gecikmede daha belirgin bir artış göstermesini açıklar. Karmaşıklık sonuçları, maske dikkat tabanlı segmentasyon tabanının daha küçük parametre sayısını ve daha kısa çıkarım gecikmesini koruduğunu, ancak Sınır F1 puanı ve mIoU'sunun ağın açık geometrik sınır rehberliğinin olmaması nedeniyle ciddi kapatma altında sınırlı kaldığını göstermektedir. Çapraz modal özellik toplama temel çizgisi, daha fazla kayan nokta işlemi ve daha uzun eğitim süresi gerektiriyordu çünkü çapraz modal toplama ek özellik hizalama yükü getiriyordu. Aşamalı özellik füzyon temel çizgisi orta düzeyde hesaplama maliyetini korudu, ancak tahmin doğruluğu sınır bozulması altında önerilen yöntemden daha düşük kaldı. Önerilen yapı rehberli ağ, SDF inşası, yapısal çapraz dikkat projeksiyonu, süper piksel grafik yapısı ve grafik konvolüsyon yayımı nedeniyle ek hesaplama maliyeti taşır. Tam model 66,8 milyon parametre, 121,4 milyar kayan nokta işlemi, 15,6 saat eğitim süresi, 7,9 GB pik bellek, 61 ms tek kare çıkarım süresi ve saniyede 16,4 kare kullanıyordu. Çıkarım gecikmesi saf maske-dikkat temelinden daha yüksek olsa da, model 0.687 mIoU ve 0.764 Sınır F1 puanı elde etti; bu da ek maliyetin esas olarak yapısal sınır onarımı ve topolojiye duyarlı anlamsal tutarlılığı desteklediğini gösteriyor.

Hesaplama ölçeği ile modelin analitik doğruluğu arasındaki iki boyutlu mekansal dengeyi görsel olarak temsil etmek için, kayan nokta işlemlerinin sayısını ve algoritmanın mIoU'sunu gösteren bir balon dağılım diyagramı oluşturuldu. Revize edilmiş görselleştirme ayrıca şekil açıklama alanında eğitim süresi ve çıkarım gecikmesini bildirdi; böylece hem eğitim hem de dağıtım açısından doğruluk kazanımları ile hesaplama maliyetleri karşılaştırıldı. Yatay eksen kayan noktalı işlemleri korurken, dikey eksen mIoU'yu korur, balon büyüklüğü aktarılabilir parametre miktarını temsil eder ve ekli etiket her yöntem için çıkarım süresini bildirirdi.

Şekil 7 , kayan nokta işlemleri, parametre ölçeği, çıkarım gecikmesi ve ayrıştırma doğruluğu arasındaki ilişkiyi ortaya koymaktadır. Önerilen yöntem, karşılaştırma ağlarından daha yüksek bir mIoU sağlarken, FLOP'ları ve parametre sayısı çapraz modal ve progresif füzyon tabanlarına yakın kalır. 61 ms olan tek kare gecikmesi, eklenen SDF ve grafik akıl yürütme dallarının dağıtım yükü getirdiğini, ancak gecikmenin birçok iç mekan sahne yorumlama görevi için gereken gerçek zamanlı aralıkta kaldığını göstermektedir. Eğitim süresi, her eğitim döneminde yapısal ön çıkarma, dikkat projeksiyonu ve grafik akıl yürütme işlemlerinin yapılması nedeniyle 15,6 saate çıkarıldı. Bu sonuç, önerilen yöntemin hesaplama maliyetinin kontrolsüz parametre genişletmesinden ziyade esas olarak sınır farkında yapısal akıl yürütmede yoğunlaştığını göstermektedir.

Yapısal tutarlılık kaybı ile mekansal mesafe kaybının özel karşılaştırması

Sınır mekânsal dönüşüm mesafesini kuantizasyon için ters dönüşüm ağı kaybı, sınır ofsetlerini yakalamak için homomorfik dönüşüm parametrelerini kullanır ve saf uzamsal mesafe metriklerinin piksel etiket değişikliklerine dayalı geleneksel çapraz entropi kayıplarından daha iyi performans gösterdiğini gösterir. Bu teorik uzlaşıya dayanarak, sınır kısıtlama şemaları kullanılarak paralel doğrulama deneyleri, Manhattan sınır sınırlama tabanlı özel Yapısal Tutarlılık Kaybı (SCL) ile sahne uyumlanabilirliği açısından karşılaştırmalı performansını değerlendirmek için yapılır. Deneyler, çok ölçekli görsel bir omurga ile grafik çıkarım ağı birleştirme analitik mimarisini sürdürürken, geri yayılma sırasında sınır kaybı terimini değiştirir. Dört paralel doğrulama ağı yapılandırılmıştır: yalnızca temel sınıflandırma çapraz entropi kaybını kullanan bir ağ, yüksek boyutlu geometrik kısıtlamalardan yoksundur; ek standart sınır ikili çapraz entropi (BCE) kaybına sahip bir ağ, geleneksel kenar ikili sınıflandırma denetimini gerçekleştirir; Ek uzamsal sınır mesafesi kaybı olan bir ağ, yerel deformasyonları yakalamaya odaklanır; ve önerilen SCL'yi uygulayan bir ağ, SDF'ye dayalı ortogonal topolojik cezalar uygular. RGB-D iç mekan sahne doğrulama setindeki kuantizasyon metrikleri, mIoU ve yapısal sınır F1 skoruyla sınırlıdır.

Tablo 6, farklı geri yayılma optimizasyon stratejilerinin altta yatan uzamsal mantık bilişi üzerindeki müdahale derecesini detaylandırmaktadır. Tablo 6'daki çapraz entropi girişi, yalnızca piksel düzeyinde çapraz entropi kaybıyla öğretilen önerdiğimiz mimariyi gösterir; görsel omurga, işaretli mesafe alan dalı, yapı yönlendirmeli çapraz dikkat modülü ve süperpiksel grafik akıl yürütme dalı değişmemiştir. Bu giriş bir Mask2Former temel değildir ve aynı modeli kullandığı için Tablo 3'teki genel Mask2Former değeriyle karşılaştırılmamalıdır. Yalnızca temel çapraz entropi kaybına dayanan ağlar en düşük sınır uyum puanını elde eder. Ek standart sınır ikili çapraz entropi kaybı olan ağlar hafif bir kazanç elde eder, ancak bu mekanizma büyük ölçekli kapatma altında kenar bulanıklığına neden olur. Mekânsal sınır mesafe kaybı, mekânsal dönüşüm algılama mekanizması sayesinde skoru iyileştirir ve bazı bozulmuş kenarları etkili bir şekilde düzeltir. Bu makalede önerilen yapısal tutarlılık kaybı, gerçek SDF'yi doğrudan kullanarak fiziksel yük taşıyıcı yüzeydeki anormal anlamsal mutasyonlara gradyan cezaları uygular ve yapısal sınırda en yüksek F1 puanını elde eder.

Farklı kayıp fonksiyonu konfigürasyonlarının maske tahmin doğruluğu ve sınır uyumu üzerindeki itici etkilerini görsel olarak karşılaştırmak için, farklı optimizasyon stratejilerinde gruplanmış çubuk grafikler çizdik.

Şekil 8, kayıp fonksiyonunun mekansal algı boyutunun yükseltilmesiyle ortaya çıkan kademeli performans iyileştirmesini göstermektedir. Yapısal sınırın F1 puanını temsil eden bar grafik, önemli bir yükselme eğilimi göstermektedir. Deneysel veriler, bu özelleştirilmiş ceza mekanizmasının tahmin edilen kategorinin mekânsal sıçrama konumunun ortogonal fiziksel konturla tam olarak örtüşmesini sağladığını göstermektedir. Mesafe-alan ceza mekanizması, iç mekan ortogonal öncelikleri için özelleştirilmiş olup, genel uzamsal sınır yakalama kaybından daha yüksek doğruluk sağlar ve böylece karmaşık bina hatalarını gidermek için etkili bir optimizasyon yolu oluşturur.

Aşırı tıkanma dağılımı, anormal yapılar ve zorlu aydınlatma koşullarının sağlamlık testi

Nesneler arasındaki karmaşık uzamsal ilişkiler ve karşılıklı tıkanma, küresel 3B uzamsal bilişi olumsuz etkiler. Ortak tahmin mimarisi, altta yatan maskenin çıkarılmasında sahne düzeni kısıtlamalarının destekleyici rolünü vurgular. Algoritmanın büyük alan görsel sinyal kaybı ve 3B ortogonal fiziksel varsayımını ihlal eden anormal uzamsal düzenler altında anti-parazit sınırlarını incelemek, algoritmanın etkili uygulama sınırını açıkça tanımlar ve temel, kanıtlanabilir değere sahiptir. Zemin gerçekliği etiketlerinde maskelenen büyük ölçekli mobilyaların oranına dayanarak, RGB-D iç mekan sahne test seti üç giderek daha zor alt kümeye ayrılır: hafif, orta ve şiddetli tıkanma. Aynı zamanda, eğimli tavanlı veya kavisli duvarlara sahip Manhattan'a özgü olmayan sahneler manuel olarak çıkarılarak anormallik sınır test setleri oluşturulur ve aşırı düşük ışık koşulları, aşırı pozlama ve geniş alanlı parlak veya şeffaf cam yüzeyler içeren sahneler zorlu aydınlatma ve doku alt setlerine ayrılır. Karşılaştırma model kütüphanesi, maske-dikkat tabanlı bir segmentasyon temeli içerir; küresel bağlamı yakalamak için maske dikkatine dayalı genel segmentasyon mimarisi; kapsamlı bir modal toplama stratejisi kullanan bir çapraz modal özellik toplama temeli; ve çok aşamalı aşamalı özellik çıkarma mekanizmasını entegre eden progresif özellik füzyon temeli. Bu makalede oluşturulan her karşılaştırma temeli, füzyon görsel omurga ve grafik çıkarım ağı ayrıştırma mimarisi yukarıdaki alt kümeler üzerinde bağımsız olarak değerlendirilmiş ve her modelin doğruluk azalma gradyanı istatistiksel olarak analiz edilmiştir.

Tablo 7 , hafif, orta ve şiddetli tıkanma, zorlu aydınlatma, doku girişimi ve Manhattan dışı anomali koşulları altında alt küme özgü dayanıklılık metriklerini rapor eder. Tablo 7, farklı modellerin mekânsal parazit altında maske tahmin doğruluğundaki değişiklikleri detaylandırır. Tablo 7 , uzamsal girişim koşullarında farklı modeller için altküme özgü mIoU değerlerini rapor eder; bu değerler yalnızca ilgili kapalı örtüklük, aydınlatma, doku veya Manhattan dışı alt küme içinde hesaplanır; genel RGB-D iç mekan sahne doğrulama seti üzerinde değil. Hafif ve orta seviyede tıkanma alt kümelerinde, tüm modeller bir temel doğruluğu korur. Kapatma alanı arttıkça, piksel tabanlı kurallara dayanan temel modeller, yoğun şekilde kapatılmış alt kümede kesişim-birleşme oranında (IU) azalma gösterir. Maske-dikkat tabanlı segmentasyon tabanı ve çapraz modal özellik toplama temeli bu alt kümede önemli doğruluk kayıpları yaşar. Progresif özellik birleşimi temel çizgisinin çok aşamalı progresif özellik çıkarma mimarisi, ciddi bir performans düşüşü gösterir. Önerilen çözüm, hasarlı görsel sinyallerin hizalanmasını zorunlu kılmak için açık 3D iskelet özelliklerine dayanır; ağır şekilde kapatılmış alt küme üzerinde stabil bir maske çıkış şeklini korur ve anlamsal maske çıkışının topolojik kararlılığını gösterir. Zorlu aydınlatma ve doku alt kümelerinde, çizgi segment dedektörü güçlü yansımalara ve şeffaf cama sahip bölgelerde yapısal kenarları kaçırır ve bu da SDF'de yerel kesintilere yol açar. Hatalı geometrik koordinatlar, yapısal affinite matrisi ve yapısal tutarlılık kaybı üzerinden yayılır; böylece anlamsal özelliklere anormal gradyan cezaları uygulanır ve sınır tahminlerinde buna karşılık gelen sapmalara yol açar. GCN'nin küresel mekansal bağlam akıl yürütme mekanizması, eksik geometrik öncelikleri bitişik yapısal yakınlıklarla tamamlarak, kabul edilebilir bir bozulma aralığında genel ayrıştırma doğruluğunu korur ve karmaşık fiziksel müdahale altında algoritmanın görsel algı yeteneklerinin sınırını ortaya koyar. Manhattan dışı anomali alt kümesinde, bu modelin alt katmanındaki SDF öncesi hafif bir haritalama yanlılığı oluşturur ve bu da ilerleyici özellik füzyon temel çizgisinden biraz daha düşük performansa yol açar. Çapraz dikkat modülündeki uyarlanabilir yapısal ağırlık katsayısı, temel fiziksel yapının gradyanlarının tutarlılığını dinamik olarak değerlendirir. Eğimli duvarlar veya eğimli tavanlara sahip sahnelerde, bu katsayı SDF'nin kısıtlama ağırlığını otomatik olarak azaltır ve ağın, homojen bölgelerde anlamsal tutarlılığı korumak için süperpiksel graf ağının yerel özellik düğümü toplama mekanizmasına güvenmesini sağlar ve böylece Manhattan dışı mekânsal düzenler için etkili bir geometrik telafi mekanizması oluşturur.

Tıkanma şiddetinin çözünürlük doğruluğu üzerindeki olumsuz etkisini görsel olarak göstermek için, farklı algoritma modelleri arasında doğruluk düşüşünü gösteren çizgi grafikler çizdik.

Şekil 9, aşırı fiziksel ortamlarda farklı özellik çıkarma paradigmaları arasındaki dayanıklılık farklarını görsel olarak ortaya koymaktadır. Temel modelleri temsil eden üç kesik çizgi, yoğun şekilde kapalı düğümlerde belirgin bir düşüş eğilimi gösterir; bu, büyük ölçekli sinyal kaybı altında özellik çıkarımındaki geleneksel alıcı alanların sınırlamalarını yansıtır. Önerilen yöntemi temsil eden katı çizgi, nispeten hafif bir bozulma yörüngeğini korur. Deneysel veriler, açık 3B mimari öncelikler ile grafik tabanlı çıkarım mekanizmaları arasındaki bağlantının, örtülüğe dirençli sahne ayrıştırma görevlerine yapısal destek sağladığını ve karmaşık ortamlarda model genellemesi performansını iyileştirdiğini göstermektedir.

Topoloji grafik düğüm bölümlemesinin mekansal duyarlılık analizi

Koordinat-uzayı graf konvolüsyon modülünün boyut azaltma-örnekleme hızı parametresi, alıcı alanın kalitesini ve grafik ağının hesaplama yükünü doğrudan kontrol eder. Bu makalenin teorik çerçevesine uygun olarak, bu çalışma basit doğrusal yineleme ile üretilen ayrık grafik düğüm sayısının Öklid dışı topolojik çıkarımın performansını nasıl etkilediğini incelemekte ve hiperparametre seçimi için titiz destek sağlamayı amaçlamaktadır. Deneyler, kümeleme algoritmasının başlatma kontrol parametrelerini ayarlamak için yapıldı; özellik alanının dinamik boyut azaltmasına zorla müdahale etti ve süperpiksel grafik düğüm bölümlerinin sayısı 64, 128, 256, 512 ve 1024 olarak ayarlandı. Sıkı hizalanmış bir test kıyaslası altında, ortalama kesişim-birleşik (IoU) oranı, yapısal sınır F1 puanı ve yüksek çözünürlüklü görüntü başına ortalama çıkarım süresi farklı topolojik düğüm boyutlarında eşzamanlı olarak kaydedildi.

Tablo 8 , özellik alanında dinamik boyut azalması derecesi ile hem analitik doğruluk hem de hesaplama maliyeti arasındaki ilişkiyi detaylandırır. Düğüm sayısının çok düşük ayarlanması, görüntü özelliklerinin eksik segmentasyonuna yol açar ve küçük nesnelerin anlamsal özelliklerinin büyük ölçekli duvar özellikleriyle birleşmesine yol açar ve böylece çeşitli doğruluk metrikleri azalır. Düğüm bölme ölçeği arttıkça, modelin yerel uzamsal detaylara duyarlılığı önemli ölçüde artar. Düğüm sayısının 512 ve 1024'e yükseltilmesi, homojen bölgelerin parçalanmasına yol açar, grafik sinir ağlarındaki makroskobik özellikler üzerindeki yumuşatıcı etkiyi zayıflar, düğüm ilişki matrisinin boyutluluğunu artırır ve çıkarım süresini artırır. 256 düğüm sayısı sabit olan bir parametre konfigürasyonu, kesişim-birleşim oranı ve sınır puanı için en yüksek değerlere yol açar.

Öklid dışı topolojik çıkarımda doğruluk ile hesaplama gücü arasındaki dengeyi görsel olarak temsil etmek için, düğüm boyutu hassasiyetini gösteren iki eksenli istatistiksel grafik çizildi.

Şekil 10, ayrı grafik düğüm sayısının ağ özelliklerinin evrimini etkilediği temel mantığı göstermektedir. Hesaplama süresini temsil eden arka plan çubuğu, düğüm sayısı 256 eşiğini aştıktan sonra keskin bir artış gösterir. Doğruluğu temsil eden çift çizgi, yatay eksende 256'ya ulaşır, ardından parçalanma etkileri nedeniyle makul şekilde azalır. Nesnel nicel veriler ve görsel evrim eğilimi oldukça tutarlıdır; bu da hesaplama grafiği boyutunun 256 düğümde tutulmasının mevcut sabit parametre yapılandırmasında donanım işleme ile mantıksal akıl yürütme arasında bir denge sağladığını gösterir. Bu düğüm sayısından sapmanın neden olduğu ciddi performans düşüşü, sabit süper piksel segmentasyon stratejisinin hiperparametre ayarına karşı yüksek hassasiyetini ortaya koyar ve dinamik bir düğüm seçme mekanizmasının geliştirilmesinin gerekliliğini vurgular.

VERİ ERIŞILEBILIRLIĞI:

Bu çalışmada analiz edilen ham kıyaslama verileri, Materyal Tablosu'nda listelenen resmi depolardan kamuya açık olarak erişilebilir durumdadır. Büyük ölçekli kapalı 3D kıyaslama, veri seti yayın tanımlayıcısı ScanNet v2 ile resmi ScanNet v2 sürümü olarak erişildi. RGB-D iç mekan sahne kıyaslaması, resmi NYU Depth Dataset V2 sürümü ile erişildi ve yayın tanımlayıcısı NYU Depth Dataset V2 olarak sunuldu. Büyük ölçekli kapalı 3D kıyaslama için betimleyici yayın DOI'si 10.1109/CVPR.2017.261 iken, RGB-D iç mekan sahnesi kıyaslaması için betimleyici DOI 10.1007/978-3-642-33715-4_54'tür. Bu çalışmada yeni ham görüntü veya RGB-D veri seti oluşturulmadı. İşlenen bölünmüş dosyalar, eğitim yapılandırma dosyaları, ham değerlendirme günlükleri, Tablo 2, Tablo 3, Tablo 4, Tablo 5, Tablo 6, Tablo 7 ve Tablo 8 ile Şekil 5, Şekil 6, Şekil 7, Şekil 8, Şekil 9 ve Şekil 10'u destekleyen sayısal kaynak dosyalar, eğitilmiş model ağırlıkları ve kaynak kodu figshare'e DOI altında yatırıldı: 10.6084/m9.figshare.32906765. Figshare kaydı, bu el yazmasında bildirilen nicel tablolar ve şekillerin yeniden üretilmesi için gereken tam ham sonuç verilerini sağlar. Depo, bildirilen mIoU, Sınır F1, PixelAcc, MeanAcc, hesaplama karmaşıklığı, sağlamlık, kayıp fonksiyonu doğrulama ve düğüm bölümleme hassasiyeti analizleri için kullanılan tahmin maskeleri, sınır değerlendirme dosyaları, metrik hesaplama betikleri, model kontrol noktaları ve tablo kaynak dosyalarını içerir.

figure-results-1
Şekil 1: Karmaşık iç mekan tıkanma senaryolarında anlamsal süreklilik ve yapısal önceki onarım etkilerinin karşılaştırılması. (A) Büyük ölçekli mobilya kapalı orijinal RGB görüntü. (B) Fiziksel sınır bozulmalarını ve anlamsal süreklilik kusurlarını vurgulayan geleneksel temel modelin çıktısı. (C) Önerilen yöntemin, alttaki yapının hasarlı özelliklerinin topolojik onarımı için 3D bina iskeletini açıkça haritalayan camgöbeği kesik çizgi perspektif örtüsiyle çıktısı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-2
Şekil 2: Yapısal önceliklerle yönlendirilen genel anlamsal ayrıştırma çerçevesi. Diyagram, RGB görüntü girişinden başlayarak, kaydırılmış pencere görsel özellik çıkarma dalı ve yapı öncesi çıkarma dalı üzerinden yapı yönlendirmeli çapraz dikkat modülüne, ardından süperpiksel GCN üzerinden topoloji akıl yürütmeye ve son olarak yoğun anlamsal haritaya çözümleme sürecini özetler. Dikkat affinite matrisi hesaplaması, grafik mesajı iletimi ve ortak optimizasyon kayıp fonksiyonlarının ayrıntılı yerleşimleri sağda sunulmaktadır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-3
Şekil 3: Affinite matrisi ve topolojik bağlantı inşasının akış şeması. Grafik, giriş mesafesi alanı haritası ve seçilmiş piksel çiftlerinden, sürekli geometrik potansiyel özellik çıkarımı ve gradyan tutarlılığı değerlendirmesi yoluyla çapraz dikkat mekanizması için açık bir uzamsal yanlılık olarak kullanılan normalize affinite matrisine dönüşümü gösteren adım adım matematiksel haritalandırma boru hattını detaylandırıyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-4
Şekil 4: Süperpiksel graf konvolüsyon düğüm projeksiyonu ve özellik toplanması şematik diyagramı. Panel, Öklid dışı topolojik akıl yürütme sürecini detaylandırıyor: (A) orijinal yerel özellik matrisi ve süper piksel kümeleme sınırlarını gösteren yoğun piksel özellikleri; (B) düzenli ızgarasındaki ayrık düğümlere ve fiziksel olarak bağlı kenarlara eşleyen süper piksel grafik topolojisi yapısı; (C) yerel özelliklerin yönlü toplamasını gerçekleştiren grafik konvolüsyon mesaj iletimi; ve (D) yoğun ızgarada restore edilmiş makroskopik anlamsal tutarlılık özelliklerini sunan koordinat geri projeksiyon. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-5
Şekil 5: Nitel karşılaştırma ızgara diyagramı. Matris, farklı satır bazında iç mekan sahnelerinde görsel performans değerlendirmesi sağlar; orijinal iç mekan RGB girişleri ve zemin doğruluk düzenlerini, maske dikkat tabanlı segmentasyon tabanı, çapraz modal özellik toplama temeli, ilerleyici özellik birleşimi tabanı ve tıkanmış köşeleri başarıyla geri kazandıran ve yük taşıyan yüzeyleri hizalayan önerilen yöntem ile karşılaştırır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-6
Şekil 6: Kümülatif modül entegrasyonu için ablasyon sonuçları. Çift eksenli grafik, farklı modüler ablasyon ayarlarında adım adım performans evrimini gösterir; birleşim üzerindeki ortalama kesişimin (mIoU) sabit yukarı doğru yörüngesini çubuk olarak ve yapısal sınır F1 puanını temel omurgadan tam çerçeveye doğru bir çizgi grafik olarak çizer. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-7
Şekil 7: Hesaplamalı karmaşıklık, eğitim süresi ve çıkarım verimliliği dağılımı Çok boyutlu balon grafiki, hesaplama maliyeti ile ayrıştırma doğruluğu arasındaki dengeleri ortaya koyuyor. Yatay eksen yüzer nokta işlemlerini (FLOP'ları) ölçür, dikey eksen mIoU'yu gösterir, balon boyutu ise eğitilebilir parametrelerin ölçeğini temsil eder ve bitişik metin etiketleri her ağ mimarisi için tek çerçeve çıkarım gecikmesini bildirir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-8
Şekil 8: Farklı kayıp fonksiyon konfigürasyonları altında sınır doğruluğu ve metrik puanlarının histogramı. Gruplanmış çubuk grafik, çeşitli optimizasyon stratejilerinin temel mekansal mantığı üzerindeki itici etkilerini karşılaştırarak, standart çapraz entropi formülasyonlarından önerilen yapısal tutarlılık kaybına yükseltilerek mIoU ve yapısal sınır F1 puanındaki önemli kazanımları gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-9
Şekil 9: Tıkanma şiddeti ile performans düşüşü arasındaki ilişkiyi gösteren çizgi grafik. Eğri, farklı özellik çıkarma paradigmalarında hafif, orta ve şiddetli tıkanma seviyelerinde doğruluk düşüşünü takip eder ve önerilen yapı rehberli çerçevenin sağlam topolojik kararlılığını ve anti-parazit yeteneğini tamamen piksel odaklı bazlara kıyasla vurgular. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-10
Şekil 10: Süper piksel düğüm ölçeğinin hassasiyet analizi. İki eksenli istatistiksel grafik, farklı grafik bölüm boyutlarında donanım işlem hızı ile mantıksal akıl yürütme doğruluğu arasındaki dengeyi gösterir; süper piksel düğüm sayısının doğruluk metriklerini nasıl etkilediğini ve ortalama çıkarım süresinde keskin bir artışa yol açtığını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Ağ katmanı numaralandırmasıGiriş düğümü özellik boyutuÇıkış düğümü özellik boyutuRastgele inaktivasyon olasılığı ayarı
15122560.15
22562560.15
32561280.1
4128640.05

Tablo 1: Konvolüsyonel Çıkarım Modülü için Ağ Mimarisi Hiperparametre Yapılandırma Tablosu. Tablo, grafik akıl yürütme ağında kullanılan ağ katmanı numaralandırmasını, giriş düğümü özellik boyutlarını, çıktı-düğüm özellik boyutlarını ve rastgele devre dışı bırakma olasılık ayarlarını rapor eder.

Konfigürasyon öğesiBüyük ölçekli kapalı 3D kıyaslamaRGB-D kapalı mekan sahne kıyaslaması
Resmi yayın tanımlayıcısıScanNet v2NYU Derinlik Veri Seti V2
Bu çalışmada kullanılan eğitim örnekleri1201 sahne795 fotoğraf
Değerlendirme için kullanılan doğrulama veya test örnekleri312 doğrulama sahnesi654 test görselleri
Toplam anlamsal kategoriler2040
Giriş görüntü çözünürlüğü512 × 512512 × 512
Başlangıç öğrenme oranı0.00010.0001
Toplu giriş örnek sayısı88
Ağırlık kaybetme katsayısı0.010.01
Toplam eğitim dönemleri300300
Bağımsız koşu sayısı55

Tablo 2: Deneysel Veri Seti Bölünmesi ve Birleşik Eğitim Hiperparametre Konfigürasyonu. Tablo, büyük ölçekli kapalı 3D veri seti ve RGB-D iç mekan sahne veri seti örnek bölümleme ayarlarını, anlamsal kategori sayılarını, öğrenme hızı ayarlarını, toplu giriş örnek sayılarını, ağırlık kaybı oranını ve toplam eğitim yineleme sayısını rapor ediyor.

Ağ model mimarisimIoUSınır F1PixelAccMeanAcc
SegFormer0.596 ± 0.0030.635 ± 0.0040.838 ± 0.0030.704 ± 0.004
ConvNeXt UperNet0.604 ± 0.0030.642 ± 0.0040.846 ± 0.0030.713 ± 0.004
Mask2Former0.612 ± 0.0030.654 ± 0.0040.853 ± 0.0030.721 ± 0.004
OneFormer0.621 ± 0.0020.663 ± 0.0030.861 ± 0.0030.733 ± 0.003
MaskDINO0.628 ± 0.0020.667 ± 0.0030.869 ± 0.0030.741 ± 0.003
CCANet0.635 ± 0.0030.671 ± 0.0040.876 ± 0.0030.745 ± 0.004
InternImage UperNet0.641 ± 0.0020.692 ± 0.0030.884 ± 0.0020.756 ± 0.003
CMPFFNet0.658 ± 0.0020.712 ± 0.0030.891 ± 0.0020.773 ± 0.003
SGCA_GCN0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

Tablo 3: RGB-D iç mekan sahne doğrulama setinde iç mekan sahne ayrıştırma temellerinin genel nicel karşılaştırması. Tablo, maske-dikkat tabanlı segmentasyon temeli, çapraz modal özellik toplama tabanı, prodüksiyon özellik birleşimi temel çizgisi ve önerilen yapı rehberli ağ mimarisi için mIoU, Sınır F1 puanı, küresel piksel doğruluğu ve ortalama sınıf doğruluğunu bildirir.

Ağ mimarisi yapılandırmasımIoUSınır F1PixelAccMeanAcc
Taban kaydırılmış pencere omurgası0.615 ± 0.0030.630 ± 0.0040.842±0.0030.706 ± 0.004
Omurga ve yapı odaklı çapraz dikkat0.648 ± 0.0030.685 ± 0.0040.874 ± 0.0030.748 ± 0.004
Omurga ve süperpiksel grafik akıl yürütme0.641 ± 0.0030.676 ± 0.0040.868 ± 0.0030.741 ± 0.004
Omurga ve yapısal tutarlılık kaybı0.632 ± 0.0030.662 ± 0.0040.859 ± 0.0030.732 ± 0.004
Omurga ile çapraz dikkat ve grafik akıl yürütme0.669 ± 0.0020.721 ± 0.0030.897 ± 0.0020.782 ± 0.003
Backbone artı çapraz dikkat ve yapısal tutarlılık kaybı0.660 ± 0.0020.713 ± 0.0030.889 ± 0.0020.773 ± 0.003
Backbone plus grafik akıl yürütme ve yapısal tutarlılık kaybı0.653 ± 0.0030.704 ± 0.0030.881 ± 0.0030.765 ± 0.003
İşareli mesafe alan toplama yanlılığı olmadan tam model0.656 ± 0.0030.698 ± 0.0040.884 ± 0.0030.761 ± 0.004
Adaptif yapısal ağırlıklandırma olmadan tam model λ0.671 ± 0.0020.736 ± 0.0030.904 ± 0.0020.792 ± 0.003
Aynı düzlemsel kenar kısıtlaması olmadan tam model0.666 ± 0.0020.728 ± 0.0030.899 ± 0.0020.786 ± 0.003
Simetrik grafik normalizasyonu olmadan tam model0.673 ± 0.0020.737 ± 0.0030.906 ± 0.0020.795 ± 0.003
Tam SGCA_GCN0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

Tablo 4: Temel bileşenlerin genişletilmiş nicel ablasyon analizi. Tablo, kümülatif modül entegrasyonu, çift modül kombinasyonları ve bileşen çıkarma ayarlarını rapor ederek, yapı yönlendirmeli çapraz dikkat, işaretli mesafe alan yanlılığı, uyarlanabilir yapısal ağırlıklandırma, süper piksel grafik akıl yürütme, aynı düzlemsel kenar yapısı, simetrik grafik normalizasyonu ve yapısal tutarlılık kaybının bağımsız ve işbirlikçi katkılarını nicelikle ölçer.

Ağ model mimarisiParametrelerFLOP'larZirve hafızaEğitim süresiÇıkarım süresiFPSmIoUSınır F1
SegFormer83,7 M80.1 G6.1 GB10,6 saat44 ms22.70.5960.635
ConvNeXt UperNet60.2 M91.5 G6.4 GB11.2 saat47 ms21.30.6040.642
Mask2Former44.0 M74.6 G5.8 GB9,4 saat41 ms24.40.6120.654
OneFormer64.1 M103.2 G7.0 GB12,9 saat55 ms18.20.6210.663
MaskDINO52.8 M96.8 G6.8 GB12.1 saat52 ms19.20.6280.667
CCANet63,5 M118.7 G7.6 GB14,8 saat67 ms14.90.6350.671
InternImage UperNet70.4 M112.3 G7.4 GB14,2 saat64 ms15.60.6410.692
CMPFFNet58,9 M104.6 G7.1 GB13.1 saat59 ms16.90.6580.712
SGCA_GCN66,8 M121.4 G7.9 GB15,6 saat61 ms16.40.6870.764

Tablo 5: Hesaplama karmaşıklığı, eğitim süresi ve çıkarım verimliliği ile genel doğrulama kümesi doğruluğu karşılaştırılması. Tablo, önerilen yöntem ve karşılaştırma ağları için eğitilebilir parametreleri, kayan nokta işlemlerini, zirve bellek kullanımını, 300 dönem eğitim süresini, tek kare çıkarım gecikmesini, saniye başına kare sayısını, mIoU'yu ve Sınır F1 puanını ve karşılaştırma ağlarını bildirir.

Kayıp Fonksiyonu KonfigürasyonumIoUSınır F1
Sadece çapraz entropi (CE)0.6690.721
CE + Sınır MÖ0.6740.738
CE + InverseForm Kaybı0.6810.752
CE + Bizim SCL0.6870.764

Tablo 6: Kayıp-fonksiyon doğrulamasının nicel karşılaştırması. Tablo, çapraz entropi kaybı, sınır ikili çapraz entropi kaybı, ters dönüşüm kaybı ve önerilen yapısal tutarlılık kaybı altında mIoU ve Sınır F1 puanını bildirmektedir.

Algoritmik model mimarisiHafif tıkanmaOrta derecede tıkanmaŞiddetli tıkanıklıkManhattan dışı anomaliler kümesiDoku-girişim alt kümesi
(mIoU)(mIoU)(mIoU)(mIoU)(mIoU)
Mask2Former0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

Tablo 7: Aşırı tıkanma dağılımı ve Manhattan dışı yapıların alt küme özgü sağlamlık analizi. Tablo, hafif tıkanma, orta oklüzyon, şiddetli tıkanma, zorlu aydınlatma, doku girişimi ve Manhattan dışı anomali alt kümelerinde ayrıştırma doğruluğundaki değişiklikleri bildirmektedir.

Süper ölçekli düğüm sayısımIoUSınırF1Ortalama çıkarım süresi (ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

Tablo 8: Topoloji Grafiğinde Düğüm Bölünme Ölçeğinin Mekansal Duyarlılık Analizi. Tablo, mIoU, yapısal sınır F1 puanı ve farklı süperpiksel düğüm bölme ayarlarında ortalama çıkarım süresini bildirir.

Tartışma

Bu makalenin algoritması, kaydırılmış pencere hiyerarşik transformatör kodlayıcısı tarafından yakalanan hiyerarşik görsel özellikleri, hat segmenti algılamayla oluşturulan Manhattan 3D sınırlayıcı kutusunun önceki derinliğiyle sıkı bir şekilde birleştirerek karmaşık iç mekan sahnelerinin yüksek hassasiyetli anlamsal yeniden inşaflanmasını sağlar. Yapı yönlendirilen çapraz dikkat mekanizması, görsel sinyalin SDF tarafından kalibre edilen gerçek geometrik sınırla hizalanmasını sağlar ve böylece yerel olarak kapatılmış alanlarda düşük seviyeli özelliklerin sürekliliğinigeri kazanır. 42. Bir topoloji grafiği, bir GCN'nin fiziksel düzlemsel kısıtlamalar altında özellik toplama gerçekleştirmesini sağlayan yinelemeli yerel kümeleme algoritması tarafından oluşturulan süperpiksel düğümleri kullanılarak oluşturulur ve makroskopik anlamsaldağılım 43'ün tutarlılığını sağlar. Deneysel sonuçlar, yöntemin birlik oranı üzerinde ortalama kesişim oranı %68,7 olduğunu, %0,2 standart sapma ile pratik mühendislik değeri, yapısal sınır F1 puanı %76,4 ve standart sapmanın %0,3 olduğunu ve 256 süper piksel düğüm konfigürasyonuyla 61 ms ortalama çıkarım süresi elde ettiğini göstermektedir; bu da sınır yeniden yapılandırma doğruluğunu nihai çıkarım verimliliğinden önceliklendiren kasıtlı bir takasyansıtmaktadır 44. Dayanıklılık testleri, modelin büyük ölçekli görsel sinyal kaybı aşırı koşullarında güçlü topoloji onarım yetenekleri sergilediğini ayrıca göstermektedir. Yapısal tutarlılık kaybı getirilerek, tahmin edilen maskenin SDF tarafından kalibre edilen sıfır mesafe fiziksel sınırıyla hizalanmasının doğruluğu artırılır; böylece hesaplama karmaşıklığı ve ayrıştırma kalitesinin sinerjik bir optimizasyonusağlanır 45. Bu şema, üç boyutlu uzay yasalarına dayalı bir özellik birleşimi yaklaşımı sunar ve büyük ölçekli mobilya tıkanması ile fiziksel sınır bozulması46 ile ilgilenildiğinde topoloji onarımında mantıksal tutarlılık gösterir. Araştırma sonuçları, akıllı mekânsal akıl yürütme ve yüksek hassasiyetli 3D yeniden yapılandırma için sağlam bir fiziksel-geometrik kısıtlama çerçevesi sağlar ve gerçek fiziksel ortamlarda robot görsel navigasyon ve sahne tanıma görevleri için pratik mühendislik değerine sahiptir.

Manhattan dünya hipotezine büyük ölçüde bağlı olan geometrik topoloji türetim mekanizması, kavisli duvarlar veya ortogonal olmayan sınırlara sahip düzensiz mimari alanlarla ilgilenirken uyum yanlılığından muzdaripolur 47. Bu geometrik modelleme darboğazını aşmak için, sonraki ağ yinelemeleri, çok dereceli polinom yüzey uyum algoritmalarını ve tekiz olmayan rasyonel B-spline eğri-çıkarma modüllerini fiziksel-öncelik dalı dahil edecektir. Bu evrensel uzamsal modelleme stratejisi, katı ortogonal çizgileri dinamik olarak şekile dönüştürülebilir topolojik sınırlara çevirir ve böylece algoritmanın anormal iç mekansal yerleşimlerde ayrıştırma doğruluğunu sürekli artırır.

Geometrik ön çıkarma temel çizgi-segment dedektörüne dayanır; bu da sistemin yansıtıcı veya şeffaf materyallerin hakim olduğu iç mekan sahnelerinde yapısal maske bozulmalarına karşı savunmasızbırakılmasına neden olur 48. Yapısal tutarlılık kaybı, bu dedektör tarafından üretilen SDF'yi doğrudan çağırır ve önceki çıkarma ile gradyan optimizasyonu arasında kapalı bir bağımlılık döngüsü oluşturur. Görsel parazit anormal çizgi-segment tespitlerini tetiklediğinde, hatalı geometrik koordinatlar SDF'ye eşlenir ve geri yayılma sırasında yapısal tutarlılık kaybıyla doğrudan güçlendirilir; böylece ağ parametreleri yanlış fiziksel sınırlarauymaya zorlanır 49. Sonraki algoritmik yinelemeler, derin derinlik haritalarını ve kızılötesi radyometrik verileri almak için multimodal adaptif füzyon dalları getirecek; böylece geometrik yapısal algıyı görünür ışık aydınlatma kısıtlamalarından ayıracak ve aşırı optik ortamlarda mekânsal akıl yürütme sınırını genişletecek.

Sabit süper piksel düğüm ölçeğinin neden olduğu performans hassasiyeti darboğazını çözmek için, sonraki araştırmalar, görüntünün karmaşıklığına göre düğüm bölümleme şemasını dinamik olarak belirleyen, öğrenilebilir, uyarlanabilir bir grafik havuzlama modülü tasarlayacak ve ağın manuel hiperparametre ayarına bağımlılığını ortadan kaldıracaktır. Süperpiksel grafik ağının hesaplama yükü nedeniyle oluşan donanım dağıtım kısıtlamalarını gidermek için, gelecekteki optimizasyon planları, parametre ölçeğini sıkıştırmak ve geometrik öncekidal 50'nin matris işlemlerini hızlandırmak için hafif özellik decoupling mekanizmaları ve kapılı toplama modülleri getirecektir.

Açıklamalar

Yazarlar, finansal çıkar çatışmaları olmadığını belirtir.

Teşekkürler

Fonlama: Shaanxi'nin Ana Araştırma ve Geliştirme Programı (Program No. 2024CY2-GJHX-76).

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

Kaynaklar

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Bina Yap ncelikleriHiyerar ik TransformerDo ru Par as TespitiManhattan 3D S n rlay c Kutuaretli Mesafe Alanapraz Dikkat MekanizmasGraf Evri imli AYap sal Tutarl l k Kayb

İlgili makaleler