Bu içeriği görüntülemek için JoVE aboneliğiniz gereklidir. Giriş yapın veya ücretsiz denemenizi bugün başlatın.

Araştırma makalesi

Bina yapısı hakkında önceden bilgiye dayanan iç mekan sahne görüntüleri için anlamsal ayrıştırma yöntemi

54 görüntülenme

⸱

DOI:

10.3791/72054

⸱

11 Ağustos 2026

Bu makalede

Özet

Bu çalışma, kaydırılmış pencere hiyerarşik transformatör kodlayıcısı tarafından yakalanan hiyerarşik görsel özellikleri, çizgi-segment algılama ile oluşturulan Manhattan 3D sınırlayıcı kutusunun önceki derinliği ile sıkı bir şekilde birleştiren bir algoritma öneriyor; böylece karmaşık iç mekan sahnelerinin yüksek hassasiyetli anlamsal yeniden inşaflanması sağlanıyor.

Özet

Karmaşık iç mekan sahnelerinde mobilya tıkanmasının neden olduğu anlamsal tahmin kesintilerini ve fiziksel sınır bozulmalarını ele almak için, bu makale bina yapı önceliklerini kullanan anlamsal ayrıştırma yöntemi önermektedir. Şema, çok ölçekli görsel özellikleri çıkarmak için kaydırılmış pencere hiyerarşik transformatör kodlayıcısı kullanır ve gradyan yönü tutarlılığına sahip çizgi segmenti algılama algoritmasını birleştirerek Manhattan 3D sınırlayıcı kutusu oluşturur. Bu sınırlayıcı kutu, ayrık geometrik konturlar sürekli fiziksel potansiyel alanına kodlanmadan önce işaretli mesafe alanına (SDF) dönüştürülür. Yapı yönlendirilmeli çapraz dikkat mekanizması, görsel sinyalleri gerçek 3B ortogonal geometrik sınırlarla hizalamaya zorlar ve kapatılmış alanlarda özellik sürekliliğini geri getirir. Süper piksel düğümlerinden oluşturulan bir uzamsal bitişik graf, özellikleri birleştirmek için bir Grafik Konvolüsyon Ağı (GCN) yönlendirerek fiziksel yük taşıyıcı düzlemde makroskobik anlamsal tutarlılığı sağlar. Piksel düzeyinde çapraz entropi kaybı ile özel tasarlanmış yapısal tutarlılık kaybının birleşimi, sınır dışı tahminleri cezalandırarak kısıtlamaları güçlendirir. Birden fazla bağımsız çalışma üzerinde yapılan deneyler, birleşim üzerindeki ortalama kesişimin (mIoU) %68,7'ye ulaştığını ve %0,2 standart sapma ile %68,7'ye ulaştığını, yapısal sınır F1 puanının %0,3 standart sapma ile %76,4'e ulaştığını göstererek önerilen modüllerin sağlam performansını doğrulamaktadır. Tek bir görüntü düğümü boyutu 256 olduğundan, ortalama çıkarım süresi 61 ms olarak kaldı.

Giriş

Kapalı mekan sahne görüntüsü anlamsal analizi, üç boyutlu mekânsal biliş ve akıllı mekânsal akıl yürütmegörevlerinde temel bir konumu ele alır 1,2. Gerçek fiziksel ortamlarda görsel özelliklerin çıkarılması genellikle karmaşık mekansal yerleşimler nedeniyle ciddi şekildeengellenmektedir 3. Bina temel yapısının anlamsal süreksizlik ve fiziksel sınır bozulmasının çözümü, büyük ölçekli mobilya tıkanması nedeniyle bina temel yapısının temeli yapısı mekânsal biliş araştırması için önemlidir 4,5. Dağı....

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Kapalı RGB sahne veri setleri ve bunların anlamsal açıklamaları, ağ eğitiminden önce hazırlanmıştır. Büyük ölçekli kapalı 3D veri seti ve RGB-D iç mekan sahne veri seti (bkz. Materyal Tablosu) resmi depolarından elde edilmiştir. Mobilya kapanması, aydınlatma varyasyonu, duvar sınırı kesintisi ve karmaşık mekansal düzenleri içeren iç mekan alma sahneleri, hedef ayrıştırma senaryosuna uyacak şekilde korundu. Anlamsal etiketler indeksli tek kanallı PNG annotasyon maskelerine dönüştürüldü ve tüm RGB görüntüler ile anlamsal maskeler 512 × 512 piksel boyutuna dönüştürüldü. Eğitim sırasında çevrimiçi veri artırma uygulandı; ....

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Deneysel Kurulum

Bu çalışma, performansı değerlendirmek ve modeli ayarlamak için iki standart iç mekan sahne ayrıştırma veri seti kullandı: büyük ölçekli bir kapalı mekan 3D veri seti ve bir RGB-D iç mekan sahne veri seti. Büyük ölçekli kapalı 3D veri seti, gerçekçi şekilde taranmış, karmaşık fiziksel uzay sahneleri ve yüksek çözünürlüklü RGB görünümler içeriyor; yüksek hassasiyetli, piksel piksel 3D nokta bulutu anlamsal etiketleri ve 2B uzay.......

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Bu makalenin algoritması, kaydırılmış pencere hiyerarşik transformatör kodlayıcısı tarafından yakalanan hiyerarşik görsel özellikleri, hat segmenti algılamayla oluşturulan Manhattan 3D sınırlayıcı kutusunun önceki derinliğiyle sıkı bir şekilde birleştirerek karmaşık iç mekan sahnelerinin yüksek hassasiyetli anlamsal yeniden inşaflanmasını sağlar. Yapı yönlendirilen çapraz dikkat mekanizması, görsel sinyalin SDF tarafından kalibre edilen gerçek geometrik sınırla hizalanmasını sağlar ve bö.......

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Yazarlar, finansal çıkar çatışmaları olmadığını belirtir.

Teşekkürler

Fonlama: Shaanxi'nin Ana Araştırma ve Geliştirme Programı (Program No. 2024CY2-GJHX-76).

....

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

Kaynaklar

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):53....

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Etiketler

Bina Yapı ÖncelikleriHiyerarşik TransformerDoğru Parçası TespitiManhattan 3D Sınırlayıcı Kutuİşaretli Mesafe AlanıÇapraz Dikkat MekanizmasıGraf Evrişimli AğYapısal Tutarlılık Kaybı