연구 논문

건물 구조에 대한 사전 지식을 바탕으로 실내 장면 이미지를 위한 의미론적 구문 분석 방법

29 조회수

DOI:

10.3791/72054

2026년 8월 11일

이 논문에서

요약

본 연구는 시프트 윈도우 계층적 트랜스포머 인코더가 포착한 계층적 시각적 특징과 선분간 검출로 생성된 맨해튼 3D 경계 박스의 사전 깊이를 긴밀하게 결합하여 복잡한 실내 장면의 고정밀 의미론적 재구성을 달성하는 알고리즘을 제안합니다.

초록

복잡한 실내 장면에서 가구 폐쇄로 인한 의미론적 예측 불연속성과 물리적 경계 왜곡을 해결하기 위해, 본 논문은 건물-구조 사전에 활용하는 의미론적 구문 분석 방법을 제안합니다. 이 방식은 시프트 윈도우 계층적 트랜스포머 인코더를 사용하여 다중 스케일 시각적 특징을 추출하고, 그라디언트 방향 일관성 선분간 검출 알고리즘을 결합해 맨해튼 3D 경계 상자를 구성합니다. 이 경계 상자는 이산 기하학적 윤곽선을 연속적인 물리적 퍼텐셜 장으로 인코딩하기 전에 부호 있는 거리장(SDF)으로 변환됩니다. 구조 유도 교차 주의 메커니즘은 시각 신호를 실제 3D 직교 기하학적 경계와 정렬시키고, 가려진 영역에서 특징의 연속성을 복원합니다. 슈퍼픽셀 노드로 구성된 공간 인접 그래프는 그래프 컨볼루션 네트워크(GCN)를 구동하여 특징을 집계하여 물리적 하중 지지 평면 내에서 거시적 의미론적 일관성을 보장합니다. 픽셀 수준의 교차엔트로피 손실과 맞춤 설계된 구조적 일관성 손실의 조합이 제약을 강화하여 경계 밖 예측에 불이익을 줍니다. 여러 독립 실험을 거치는 실험 결과, 결합 간 평균 교차점(mIoU)은 표준편차 0.2%로 68.7%에 도달하고, 구조 경계 F1 점수는 표준편차 0.3%로 76.4%에 도달하여 제안된 모듈들의 견고한 성능을 확인시켜 줍니다. 단일 이미지 노드 크기가 256일 때, 평균 추론 시간은 61ms로 유지되었습니다.

서론

실내 장면 이미지 의미 분석은 3차원 공간 인지와 지능형 공간 추론 과제에서 핵심적인 위치를 차지합니다 1,2. 실제 물리적 환경에서의 시각적 특징 추출은 복잡한 공간배치로 인해 종종 심각하게 방해받습니다. 건물 기초 구조의 의미 불연속성과 물리적 경계 왜곡을 해결하는 것은 대규모 가구 폐쇄로 인한 건물 기초 구조물의 공간인지 연구에 중요합니다. 4,5. 복잡한 물체의 간섭을 정확히 제거하고 같은 벽과 바닥의 물리적 연속성을 복원하는 것은 3차원 장면 재구성과 전역공간 논리 분석의 정확도를 직접 결정할 수 있습니다. 대규모 가구 폐쇄로 인한 의미적 불연속성과 제안된 건물 사전 지침의 구조적 수리 효과는 그림 1에 나타났으며, 표 1A의 차단된 적록색 녹색 파란색(RGB) 입력, 그림 1B의 기준선 마스크 왜곡, 그림 1C의 구조 사전 수리 결과가 동일한 실내 장면 조건에서 비교됩니다.

공간 논리 추론의 정확성 요구를 충족하기 위해, 현재의 주류 픽셀 기반 시각 네트워크는 복잡한 실내 환경을 다룰 때 여러 장애물에 직면해 있습니다 7,8. 실내 공간은 종종 빽빽한 가구와 어수선한 가구들로 채워져 있어, 이미지에서 저수준 시각 경계 신호가 크게 손실됩니다. 기존의 특징 추출 메커니즘은 국소적인 2차원 색상 및 질감 반응에 지나치게 의존하며, 3차원 인공 구조의 엄격한 직교 법칙에 대한 거시적 이해가 부족하다10. 국소 수용 필드의 이러한 한계로 인해 특징 전파가 쉽게 중단되어, 전역 위상을 폐쇄11을 넘어 확장하기 어렵다. 현재 폐쇄 및 간섭으로 인한 의미론적 예측 불연속성과 물리적 경계의 심각한 왜곡이라는 핵심 문제를 해결할 긴급한 필요가있습니다.

폐쇄와 간섭으로 인한 건물 기초 구조적 결함을 해결하기 위해 학계는 다양한 목표 지향적 개입 조치를 개발했습니다13. 교차 모달 특징 집계 네트워크는 적-녹-파랑(RGB) 이미지를 돕기 위해 깊이 지도나 텍스트 사전에 도입하여 단일 시각 양식의 공간 인식 내재적 결함을 효과적으로 보완합니다14,15. 경계 지각과 적응적 맥락 선택 프레임워크는 특징 디코딩 단계에 물리적 윤곽 강화 전략을 주입하여, 복잡한 장면에서 예측 결과의 엣지 적합도를 크게 향상시킵니다16,17. GCN과 특징 상호작용 메커니즘을 기반으로 한 추론 모델은 노드 수준 연결을 구성함으로써 동질한 영역에서 특징의 매끄러움과 거시의미 일관성을 크게 향상시킵니다18,19. 명시적인 맨해튼 구조 사전에 시각적 특징 추출 파이프라인을 통합하면 기하학적 일관성 경계가 강제되어, 광범위한 전경 객체 폐쇄로 인한 특징 불연속성 문제를 해결합니다.

건설 인프라와 관련된 의미 예측 오류와 물리적 경계의 심각한 왜곡이라는 핵심 과제를 해결하기 위해, 아키텍처 사전에 포함된 폐쇄 루프 결합 메커니즘을 기반으로 한 의미 구문 분석 프레임워크를 제안합니다. 이 프레임워크는 순진한 공학 파이프라인을 넘어 연속적인 기하학적 퍼텐셜장과 이산적인 시각적 특징 다양체 간의 양방향 매핑 정렬을 확립하여, 구조 법칙을 통해 가림 오류를 수정하는 비자명한 시너지를 형성합니다. 이 방식은 다중 스케일 시각 백본 네트워크와 소사점 추정 기반의 선분간 검출 알고리즘을 사용하여 맨해튼 3D 경계 박스를 병렬로 나타내는 국소 외관 특징과 직교 엣지 사전을 획득한 후 SDF로 변환합니다. 이 알고리즘은 구조 유도 교차 주의 메커니즘을 사용하여 시각적 특징을 쿼리 벡터로 사용하고 SDF 특징을 점곱 계산의 키와 값으로 처리하여 시각적 신호가 특징 공간의 실제 3D 기하학적 경계와 일치하도록 강제합니다. 초픽셀 노드와 공간 평면성 가장자리 특징으로 구성된 공간 인접 그래프가 GCN에 입력되어 노드 간 특징 집계와 메시지 전달을 수행합니다. 종단 간 매개변수 최적화 과정은 픽셀 수준 교차엔트로피와 맞춤형 구조적 일관성 손실 함수를 함께 사용하여 건물 사전 경계를 넘는 예측 픽셀을 엄격히 제한하고 벌점을 적용합니다. 완전한 의미 파싱 파이프라인은 그림 2에 요약되어 있으며, RGB 이미지 입력, 기하학적 사전 추출, 교차 주의 정렬, 슈퍼픽셀 그래프 추론, 의미 마스크 디코딩을 통합된 아키텍처 내에서 연결합니다.

초기 장면 파싱 네트워크는 국소 외관 질감을 포착하기 위해 합성곱 연산에 의존했으나, 국소 수용 필드의 한계로 인해 대규모 표적21,22의 의미적 일관성이 부족했다. 이전 연구들은 시각적 트랜스포머 아키텍처의 자기 주의 모듈을 적용하여 전 세계 맥락 정보를 추출하고 장거리 픽셀 연관 특징을 구성했습니다23,24. 크로스 모달 다중 뷰 특징 집계 전략은 깊이지도 포인트 클라우드와 텍스트 명령 입력25,26을 융합하여 장면의 3차원 기하학적 공간 특징을 추출합니다. 특정 도메인을 표적으로 하는 특징 융합을 위한 하이브리드 주의 메커니즘은 점차 성숙해져 왔습니다. 특징 상호작용 다리를 구축함으로써 시각 신호의 다중 스케일 전송에서 에너지 손실과 특징 희소성을 크게 줄였으며, 복잡한 구조 구문 분석의 견고성을 향상시켰습니다. 최첨단 인코더 설계는 고주파 영역 공간 세부사항을 전역 및 국소 특징과 함께 통합하고 추론하여, 네트워크가 높은 유사성을 가진 세밀한 의미 범주를 구분하는 능력을 강화하고 실내 구문 정확도를 향상시킵니다27,28. 최근 의미 분할 아키텍처의 발전은 계산 효율성과 공간 인식을 최적화하는 데 귀중한 참고 자료를 제공합니다. 조밀한 예측과 다중 규모 맥락 집계를 위해 설계된 모델은 복잡한 배경에서 세밀한 기하학적 특징을 추출합니다. 특징 분리와 시너지 융합 전략은 경계 영역의 의미적 모호성을 해결합니다. 경량 주의 메커니즘과 게이트 집계 모듈은 매개변수 분포를 최적화하여 추론을 가속화하면서 국소 구조적 세부사항을 유지합니다. 이러한 효율적인 아키텍처 설계를 구현함으로써 실내 씬 파싱에서 비유클리드 위상 추론 연산의 계산 오버헤드를 줄이는 이론적 지침을 제공합니다.

건물 구조 사전과 3D 배치 추정을 사용하여 국소 시각적 구문 오류를 수정합니다29. 이전 연구들은 실내 건물의 직교 및 평행 기하학적 특징을 추론 제약 조건으로 추출하여 혼잡한 실내 배경으로 인한 네트워크 예측 편향을 줄였습니다30,31. 기존 방식은 선분간 탐지 알고리즘과 이미지 제거점 분석 기법을 사용하여 맨해튼 3D 경계 박스를 생성하여 방의 물리적 경계를 매핑하고 기본시각적 특징의 위치 파악을 돕습니다. 경계 인식 모듈과 다중 규모 맥락의 공동 아키텍처는 고차원 특징 디코딩 과정에 이전 구조 정보를 암묵적으로 내장하여, 네트워크가 실제 물리적 윤곽선과 매우 일치하는 의미 마스크를 출력하도록 강제하여 객체 가장자리의 톱니 모양과 흐림을 효과적으로 개선합니다33. 경계 증강 특성을 가진 반지도 또는 약한 감독 손실 함수 설계가 널리 탐구되어 왔습니다. 공간적 위상 규칙을 위반하는 독립적인 픽셀 분류 행동을 처벌하기 위해 엄격한 수학적 공식에 의존하여, 최종 분할 결과의 기하학적 매끄러움과 구조적 완전성은 기울기 최적화34의 출처로부터 보장된다.

일부 연구에서는 그래프 신경망을 사용하여 시각적 특징의 교차 영역 집계와 고차원 공간에서의 위상 관계에 대한 추론을 수행했습니다. 슈퍼픽셀 세분화 알고리즘은 유사한 색상 반응과 텍스처 특성을 가진 인접한 픽셀 블록들을 독립적으로 연결된 노드로 사전 집계합니다. 슈퍼픽셀 세분화 알고리즘은 이미지 수준에서 그래프 구조의 계산 중복성을 압축하여 이미지36의 기본 기하학적 위상을 보존합니다. GCN은 고차원 노드 특징 벡터를 기반으로 하며, 공간적 근접성을 나타내는 인접 행렬은 공간도메인 37,38의 물리적 연결 그래프를 따라 다중 스케일 시각 정보를 효율적인 방향 전송과 상호작용 융합을 이끕니다. 시간 정보 향상 모듈과 하이브리드 다중 스케일 스킵 연결 메커니즘의 적용은 다층 딥메시지 전달 과정에서 발생하는 노드 특징의 과도한 평활화와 균질화를 억제합니다. 다중 스케일 그래프 웨이블릿 변환 기술과 의사 라벨 요소 학습 최적화 전략은 노드 특징 업데이트 공식의 배경 잡음 방지 메커니즘을 최적화하여 동일한 의미 속성을 가진 특징들이 복합 네트워크 토폴로지40에서 협력적 반응 모드를 유지하도록 합니다. 그래프 기반 추론 메커니즘은 정칙 픽셀 격자를 비유클리드 위상 공간에 매핑하여 불규칙한 건물 구조와내부 구성 요소의 특징 집계 계산을 수행합니다.

프로토콜

네트워크 훈련 전에 실내 RGB 장면 데이터셋과 그 의미 주석을 준비했습니다. 대규모 실내 3D 데이터셋과 RGB-D 실내 장면 데이터셋(재료표 참조)은 공식 저장소에서 수집되었습니다. 가구 가림, 조명 변화, 벽 경계 중단, 복잡한 공간 배치를 포함한 실내 획득 장면은 목표 구문 분석 시나리오에 맞게 유지되었습니다. 의미 라벨은 인덱스 단일 채널 PNG 주석 마스크로 변환되었고, 모든 RGB 이미지와 의미 마스크는 512 × 512 픽셀로 크기 조정되었습니다. 훈련 중 온라인 데이터 증강이 적용되었으며, 무작위 수평 반전(확률 0.5), 밝기 0.8에서 1.2 사이의 무작위 스케일링, 그리고 −10°에서 +10° 사이의 무작위 회전을 통해 구조 배치 분포를 넓혔습니다. RGB 채널은 평균 값 0.485, 0.456, 0.406과 표준편차 0.229, 0.224, 0.225로 정규화되었습니다. 대규모 실내 3D 벤치마크는 이 연구에서 공식적으로 사용된 1201개의 훈련 장면과 312개의 모델 개발 및 검증 장면을 포함한 공식 배포 구분을 따랐습니다. RGB-D 실내 장면 벤치마크는 공식 평가 프로토콜을 따랐으며, 795장의 훈련 이미지와 654장의 테스트 이미지가 포함되었습니다. 이 두 공공 기준점에는 추가적인 백분율 분배가 적용되지 않았습니다.

이동 윈도우 계층적 트랜스포머 시각 백본 네트워크(재료표 참조)가 무빙 윈도우 트랜스포머 인코더 백본으로 초기화되었습니다. 패치 임베딩 크기는 4 x 4 픽셀로 구성되었습니다. 네 단계의 임베딩 치수는 128, 256, 512, 1024로 설정되었고, 네 단계의 변압기 블록 수는 2, 2, 18, 2로 설정되었습니다. 로컬 주의 창 크기는 7 x 7로 설정되었고, 네 단계별 주의 머리 수는 4, 8, 16, 32로 설정되었습니다. 비선형 연속 활성화 함수는 모든 다층 인식론 계층 내에서 사용되었습니다. 공간 다운샘플링은 각 계층적 단계 후 2단계의 스트라이드로 구성된 패치 병합 작업을 통해 수행되었습니다. 핵심 네트워크 아키텍처와 합성곱 추론 모듈의 하이퍼파라미터는 표 1에 요약되어 있습니다.

이후 입력된 특징 지도에 대해 시프트 윈도우 자기 주의 특징 추출이 수행되었습니다. 각 특징 지도는 공간 차원이 7× 7인 겹치지 않는 지역 창으로 나뉘었습니다. 정기적인 창문 응시와 이동 창 응시는 인접한 이동 창 변압기 블록 간에 교대로 배치되었습니다. 순환 이동 거리는 3픽셀로 설정되었고, 각 국소 주의 창 내에 상대 위치 편향 인코딩이 적용되었습니다. 국소 시각적 특징들은 다중 헤드 자기 주의를 통해 집계되어 계층적이고 다중 규모의 특징 표현을 생성했습니다.

맨해튼 구조 사전에 실내 RGB 이미지에서 추출되었습니다. 구조적 가장자리 세그먼트는 그라디언트 방향-일관성 선분 검출 알고리즘을 사용하여 검출되었습니다. 지배적인 구조 방향은 소변점 추정을 기반으로 한 무작위 표본 합의(RANSAC) 알고리즘(재료표 참조)을 통해 군집화되었습니다. 세 개의 상호 직교 맨해튼 방향을 재구성하여 맨해튼 3D 경계 상자 표현을 생성했다. 재구성된 구조 경계는 각 픽셀에서 가장 가까운 경계선 구간까지의 최소 유클리드 거리를 계산하여 SDF 지도로 변환되었습니다.

구조 유도 교차 주의 특징은 시각적 특징과 SDF 사전 측정이 완료된 후에 생성되었습니다. 시각적 특징 다양체는 이중 타격 캡 R의 선형 변환 행렬 W sub Q 원소를 통해 이중타석 캡 R figure-protocol-1의 구성 행렬 W sub Q 원소를 통해 쿼리 텐서 Q에 대응되었다. 연속 거리장 사전에 변환 행렬 figure-protocol-2를 통해 키 텐서 K와 값 텐서 V에 대응되었고, 모델 차원은 512로 설정되었다. 다중 헤드 변조는 투영 공간을 8개의 독립적인 부분공간으로 나누었으며, 각 헤드의 차원은 64입니다. 공간 배치는 이전에 이산 픽셀 좌표를 연속 퍼텐셜 필드로 투영하고, 점곱 유사도 행렬을 변조하기 위한 명시적 가산 공간 편향으로 구조적 친화도 행렬 S를 생성했습니다. 시맨틱 파싱은 각 시각적 위치가 기하학적 사전 공간에서 구조적으로 일관된 증거를 적극적으로 가져오도록 요구하기 때문에 시각적 특징 텐서가 쿼리 소스로 사용되었습니다. SDF 이전은 맨해튼 레이아웃에서 파생된 연속적인 경계 거리와 내부-외부 구조 단서를 저장하기 때문에 핵심 및 가치 출처로 사용되었습니다. 점곱 항은 의미론적 외관과 기하학적 사전의 호환성을 측정했고, 가산적 구조 항 λS는 동일한 물리적 평면이나 거의 같은 건축 윤곽선 근처의 픽셀에 주의 가중치를 이동시켰다. 계수 λ는 추출된 구조적 사전에 대한 신뢰도를 나타내며, 강직교 제약이 주의 분포에 얼마나 포함되는지 조절했다. 이 공식은 가구 폐쇄로 인한 경계 교차 특징 확산을 줄이고 비 맨해튼 레이아웃에서도 적응적 이완을 유지했습니다. 구조 유도 주의 분포는 방정식 1에 따라 계산되었습니다.

방정식 1: figure-protocol-3

여기서 A는 구조 유도 주의 집계 행렬, Q는 시각적 특징에서 생성된 쿼리 텐서, K는 SDF 사전 특징에서 생성된 키 텐서, V는 구조적 사전 표현에서 생성된 값 텐서, dk는 키 텐서의 특징 차원, λ는 국소 영역의 기하학적 신뢰도를 식별하고 비맨해튼 공간에서 강직교 제약을 완화하는 데 사용되는 적응형 구조 가중 계수를 나타냅니다 레이아웃을 나타내며, S는 SDF 친화도 행렬을 나타냅니다. dk로 나누어짐은 주의 로그트의 척도를 안정화시키고 큰 지형 차원이 과도하게 집중된 주의 가중치를 생성하는 것을 방지했다. 정규화된 지수 함수(재료표 참조)는 변조된 유사도 점수를 정규화된 공간 분포로 변환하여 각 픽셀이 의미론적 및 기하학적 일관성에 기반해 구조적 사전 정보를 집계할 수 있게 했습니다. 이 설계는 시각적 외관과 건축적 경계 선행이 직접적인 특징 연결이 아니라 주의 수준에서 융합되는 이유를 설명한다.

슈퍼픽셀 위상 그래프는 구조 정렬된 특징 지도에서 구성되었습니다. 특징 지도는 공간 영역 생성 알고리즘을 사용하여 분할되었습니다. 슈퍼픽셀 수는 256, 집약성 계수는 10, 가우시안 평활 계수는 1.0, 반복 횟수는 10으로 설정되었습니다. 군집화 시 거리 메트릭 가중치를 특징 색-공간 거리의 1.0 비율로 고정하여 밀도가 높은 클러터 경계에서 균일한 노드 생성을 유지함으로써 공간적 근접성 제약 조건을 강제했습니다. 동종 의미론 응답을 가진 픽셀들은 슈퍼픽셀 노드로 집계되었습니다. 그래프 간선은 공간적 인접 관계, SDF 친화도, 그리고 공평면 기하학적 일관성 제약에 따라 구성되었습니다. 구조적 친화도 행렬과 위상 연결성의 구성 과정은 그림 3에 나타나 있으며, SDF 가이던스가 그래프 수준의 공간적 관계로 어떻게 변환되었는지를 보여줍니다.

그래프 공식화는 조밀한 픽셀 단위 추론을 동질한 구조 영역 위의 노드별 공간 추론으로 변환하기 위해 도입되었습니다. 각 슈퍼픽셀 노드는 유사한 의미 응답과 공간적 연속성을 가진 로컬 영역을 나타내며, 각 엣지는 인접성, 거리-장 친화성, 공평면 일관성 제약 조건에 따라 특징 전송을 위한 신뢰할 수 있는 경로를 나타냈습니다. 이 설계는 고립된 잡음 픽셀의 영향을 줄이고, 가려진 벽, 바닥, 천장 영역이 물리적으로 인접한 노드로부터 메시지를 받을 수 있게 했습니다. 따라서 간선 구성은 연속 SDF 유도와 이산 비유클리드 그래프 추론 사이의 수학적 다리 역할을 했다.

3층 그래프 합성곱 추론 네트워크가 512, 256, 128의 숨겨진 특징 차원으로 구성되었습니다. 그래프 컨볼루션 계층은 노드의 공간적 관계를 기반으로 그래프 구조에 특징 평활화를 수행했습니다. 자기 루프 인접은 메시지 전달 시 각 노드의 원래 상태를 유지하여, 작은 구조 영역의 특징이 주변 큰 영역에 의해 지워지는 것을 방지했습니다. 대칭 정규화는 인접 행렬 요소를 노드 차수의 역제곱근의 곱으로 스케일링하여 높은 차수 노드와 저차 노드가 전파 중 유사한 수치 크기 아래에서 기여하도록 했습니다. 피드포워드 전파는 국소화된 공간 집계를 수행했으며, 각 노드 상태가 인접한 공평면 클러스터의 고차원 특징을 흡수한 후 원소별 비선형 정류 함수를 적용했습니다. 이 공식화는 그래프 컨볼루션 층이 무관한 객체의 경계를 무제한적으로 평활화하는 대신 물리적으로 의미 있는 실내 평면을 따라 의미론적 확산을 근사하도록 만들었습니다. 그래프 노드 특징은 방정식 2에 따라 평가되었습니다.

식2: figure-protocol-4

조밀한 픽셀 특징에서 초픽셀 노드로의 투영, 그래프 합성 메시지 전달, 좌표 백투사는 그림 4에 제시되어 정규 이미지 격자에서 비유클리드 위상으로, 그리고 다시 조밀한 의미론 표현으로의 특징 집계 경로를 명확히 합니다. 그림 4A 의 조밀한 픽셀 특징에서 그림 4B의 슈퍼픽셀 노드로의 투영, 그림 4C의 그래프 합성곱 메시지 전달, 그리고 그림 4D 의 좌표 후복투사는 정칙 이미지 격자에서 비유클리드 위상으로, 그리고 다시 조밀한 의미론적 표현으로의 특징 집계 경로를 명확히 합니다.

여기서 H(l)는 l번째 그래프 합성곱층의 노드 특징 텐서를 나타내고, Â는 자기 루프 연결을 가진 인접 행렬을, D는 인접 행렬에 해당하는 차수 행렬을, W(l)는 l번째 그래프 합성곱 층의 학습 가능한 가중 행렬을, σ는 정정 선형 단위 활성화 함수를 나타냅니다. ÂH(l)라는 용어는 인접한 슈퍼픽셀 노드의 특징을 집계한 반면, D−1/2 와 D−1/2 는 서로 다른 연결 밀도를 가진 노드들의 기여를 균형 있게 표현했습니다. 학습 가능한 행렬 W(l)는 집계된 노드 특징들을 새로운 의미 공간에 투영하여, 그래프 계층이 구조적 일관성과 일반 공간적 근접성을 구분할 수 있게 했습니다. 비선형 활성화는 특징 집계 후 공평면과 비공면면 영역 간 반응 차이를 보존했다.

의미 분할 특징은 그래프 추론 후 해독되었습니다. 디코더는 세 개의 바이리니어 보간 업샘플링 단계와 크로스 레이어 스킵-커넥션 융합 연산을 사용하여 구성되었습니다. 얕은 공간 인코더 특징들은 채널별 융합을 통해 고수준 의미 디코더 기능과 결합되었습니다. 특징 해상도는 원래 이미지 크기로 복원되었고, 최종 의미론적 확률 예측 맵은 1 × 1 합성곱 층을 통해 생성되었습니다.

전체 의미 파싱 네트워크는 분리된 가중치-붕괴 최적화 장치를 사용해 학습되었습니다(재료 참조). 초기 학습률은 두 공개 벤치마크 모두 0.0001, 가중치 감쇠 계수는 0.01, 배치 크기는 8로 설정되었습니다. 첫 번째 모멘트 붕괴율은 0.9, 두 번째 모멘트 붕괴율은 0.999, 수치 안정성 엡실론 계수는 1 × 10⁻8로 설정되었습니다. 검증 손실은 각 에포크 말에 모니터링되었고, 검증 세트의 mIoU가 증가하면 체크포인트가 저장되었습니다. 네트워크는 0.9의 감쇠 능력인 다항식 학습률 감쇠 전략을 사용하여 300 에포흐를 훈련시켰습니다. 통계적으로 엄격한 평가 기준선을 설정하기 위해 다섯 번의 독립 학습 실행이 서로 다른 무작위 시드 초기화를 사용했습니다. 네트워크는 픽셀 수준의 교차엔트로피 손실과 구조적 일관성 손실을 사용하여 공동 최적화되었습니다. 모든 실험은 고메모리 병렬 컴퓨팅 하드웨어가 장착된 컴퓨팅 플랫폼에서 수행되었으며, 상세한 하드웨어 정보는 재료표에 보고되었습니다.

공동 최적화는 클래스 확률 텐서의 공간적 기울기 크기를 계산하여 기하학적 경계 정렬을 강제했습니다. 구조적 일관성 손실은 공간 예측 구배의 노름에 연속 SDF 값으로 곱하는 규칙화 변수로 사용되었습니다. 수학적 논리는 의미 범주 변화가 실제 건축 윤곽선 근처, 즉 SDF가 0에 근접하는 곳에 집중되어야 하며, 평평한 벽, 바닥, 천장 내부는 부드러운 의미론적 반응을 유지해야 한다는 것이었습니다. 큰 예측 기울기가 구조 경계에서 멀리 떨어져 나타날 때, 거리장 항은 페널티를 증가시키고 균질 물리적 평면 내에서 거짓 의미 전이가 발생하는 것을 억제했다. 예측 기울기가 0거리 등고선 근처에서 나타났을 때, 벌칙은 제한적이었고 건축적 경계를 따라 정당한 클래스 전이를 보존했다. 의미 전이 영역은 방정식 3에 의해 주어진 SDF의 0거리 윤곽선에 맞춰 제약을 받았습니다.

식의 3: figure-protocol-5

여기서 Ltotal 은 최종 최적화 목적 함수를, Lce 는 픽셀 수준 교차 엔트로피 손실을, Lscl 은 구조적 일관성 페널티 손실을, α는 구조적 손실 가중 계수를 나타냅니다. 교차 엔트로피 항은 주석 마스크를 통해 픽셀 수준의 의미 감독을 제공했고, 구조적 일관성 항은 아키텍처 사전에 기하학적 정규화를 부과했습니다. 가중 계수는 범주 인식과 경계 정렬을 균형 있게 α하여 최적화가 지역 라벨 정확도나 강직한 구조적 윤곽선을 과적합하는 것을 방지합니다. 이 공동 목표는 시각적 의미론, 물리적 경계 일관성, 학습 가능한 네트워크 매개변수를 통합된 최적화 대상 내에서 연결했습니다.

결과

실험 장치

이 연구는 대규모 실내 3D 데이터셋과 RGB-D 실내 씬 데이터셋 두 가지를 사용하여 성능을 평가하고 모델을 조정했습니다. 대규모 실내 3D 데이터셋은 현실적으로 스캔된 복잡한 물리적 공간 장면과 고해상도 RGB 뷰를 포함하고 있어, 픽셀 단위의 고정밀 3D 점군 의미 라벨과 2D 공간 투영 분할 마스크를 제공합니다. 본질적으로 현실적인 물리적 공간 격자 재구성 데이터와 직교 평면 특성은 추출 분기에서 맨해튼 3D 경계 상자를 정확히 구성할 수 있는 기하학적 진리 비교 기준을 설정합니다. RGB-D 실내 장면 데이터셋은 가구와 잡동사니에 가려진 실내 깊이 이미지를 포함하며, 네트워크의 전역 논리적 추론 정확성과 오클루즈에 대한 견고성을 테스트하는 데 사용됩니다.

이 알고리즘은 mIoU를 사용하여 예측된 의미 분포와 진정한 의미 분포 간의 공간적 겹침을 측정하고, 예측된 마스크와 SDF가 보정한 0거리 물리-구조 가장자리 간의 적합 정확도를 엄격히 평가하기 위해 구조적 경계 F1 점수를 도입합니다. 계산 중 유클리드 공간에서 고정된 픽셀 거리 오차 임계값을 설정하여 네트워크가 생성하는 가장자리 픽셀이 건물의 실제 물리적 경계 윤곽선과 교차하는지 판단합니다. 이 이중 평가 시스템은 넓은 영역의 의미 블록에서 분류 오류를 제한하는 동시에 강직선의 위상학적 재구성 효과에 대한 미세정량적 평가를 강화합니다. 실험 데이터 구성과 최적화 과정 간의 일관성을 유지하기 위해, 데이터셋 규모와 핵심 훈련 하이퍼파라미터는 표 2에 요약되었습니다 . 표 2는 개정된 원고에 대한 권위 있는 실험 구성 중 하나를 보고합니다. 대규모 실내 3D 벤치마크는 1201개의 훈련 장면과 312개의 검증 장면을 사용하며, RGB-D 실내 장면 벤치마크는 795개의 훈련 이미지와 654개의 테스트 이미지를 사용하며, 두 벤치마크 모두 배치 크기가 8개, 초기 학습률 0.0001, 가중치 감쇠 계수 0.01, 300개의 훈련 에포크로 학습됩니다.

최첨단 방법과의 비교

실내 장면 파싱 알고리즘의 정량적 비교표를 제시하기 전에, 이 절에서는 다차원 평가 시스템에서 사용되는 테스트 벤치마크를 엄격히 정의합니다. 모델의 다양한 세부 수준에서의 분류 성능을 반영하기 위해, 평가 시스템은 테스트 시스템을 보완하여 전역 픽셀 정확도(PixelAcc)와 평균 클래스 정확도(MeanAcc)를 추가로 제공합니다. 이 지표들은 함께 상세한 알고리즘 성능 검증 시스템을 구축하여 이후 정량적 분석을 위한 엄격한 이론적 기준을 마련합니다. 복잡한 물리적 공간에서 제안된 알고리즘의 의미 구문 정확도와 폐쇄 견고성을 평가하기 위해, RGB-D 실내 장면 검증 세트에서 기존 알고리즘과 비교 테스트를 수행하였습니다. 비교 모델 라이브러리는 기초 마스크-주의 프레임워크, 계층적 비전 변환기, 현대 순수 합성 분할 파이프라인, 통합 밀집 예측 아키텍처, 그리고 채널 간 주의 네트워크를 포함합니다. 벤치마크 평가는 트랜스포머 기반 세분화 기준선, 통합 조밀 예측 기준선, 통합 검출 및 분할 기준선, 대규모 비전 기초 기준선, 순수 합성곱 기준선, 마스크-주의 기반 세분화 기준선, 교차 모달 특징 집계 기준선, 점진적 특징 융합 기준선으로 확장되었습니다(재료 참조)), 동일한 RGB-D 실내 장면 검증 세트, 입력 해상도, 훈련 일정, 메트릭 프로토콜을 사용했습니다. 제안된 아키텍처에서 구조 유도 네트워크는 이동 창 다중 스케일 시각 백본, SDF가 포함된 구조 유도 교차 주의 모듈, 그리고 슈퍼픽셀 GCN을 통합합니다. 확장된 비교는 트랜스포머 기반 밀집 예측, 컨볼루션 기반 밀집 예측, 마스크-주의 파싱, 교차 모달 특징 융합, 점진적 특징 융합 패러다임을 포함하여, 명시적 3D 기하학적 경계 개입이 더 넓은 실내 장면 파싱 기준선에 기여하는 바를 평가할 수 있게 합니다.

표 3은 핵심 정량적 지표에 대한 각 네트워크의 객관적 평가 성과를 상세히 설명하며, 다섯 개의 독립 실행에 걸쳐 평균값과 이에 대응하는 표준편차를 보고합니다. 확장된 기초 비교는 제안된 구조 유도 추론 메커니즘이 표준 조밀 예측 백본, 마스크 기반 분할 네트워크, RGB-D 특징 융합 네트워크를 넘어 정확도 향상에 기여하는지 평가합니다. 실험 데이터는 제안된 알고리즘이 네 가지 정량적 지표 모두에서 안정적인 향상을 달성함을 보여줍니다. 트랜스포머 기반 밀집 예측 네트워크와 마스크-주의 네트워크는 강력한 전역 맥락 모델링 능력을 유지했으나, 예측된 마스크가 명시적인 물리적 경계 제약 조건이 없어 전경 혼잡 상태에서 경계 F1 값이 낮게 유지되었습니다. 교차 모달 및 점진적 융합 네트워크는 국소 의미 연속성을 개선했으나, 특징 융합은 여전히 부호 거리 구조 사전에 의존하지 않고 주로 외관과 깊이 반응에 의존했다. 제안된 구조 유도 네트워크는 0.687의 mIoU, 표준편차 0.002, 평균 경계 F1 점수 0.764, 표준편차 0.003을 달성했습니다. 확장된 비교 결과, 성능 향상은 단순히 더 큰 조밀한 예측 백본 때문만이 아니라, 부호 거리 필드 가이드, 구조 인식 교차 주의, 그래프 기반 토폴로지 추론의 공동 사용 덕분임을 시사합니다.

모델의 전역 논리적 추론 정확도를 가림 상태에서 분석하기 위해, 우리는 검증 세트에서 가구 및 기타 잡동사니로 심각하게 가려진 전형적인 시나리오를 식별하고 추출했으며, 픽셀 단위 예측 마스크의 시각화를 만들었습니다.

방법 워크플로우와 그래프 추론 과정이 그림 1, 그림 2, 그림 3, 그림 4에 정의된 후, 그림 5 는 극한 폐쇄 조건에서 모델 간 형태학적 예측의 차이를 보여줍니다. 정성적 비교 메쉬 맵의 빨간 직사각형은 모서리와 하중을 지탱하는 표면이 가려진 주요 충돌 영역을 표시합니다. 마스크-주의 기반 분할 기준선의 출력 마스크는 뚜렷한 엣지 스무딩과 클래스 간 부착을 보여준다. 교차 모달 특징 집계 기준선과 점진적 특징 융합 기준선은 교차 모달 데이터를 포함하지만, 예측 결과는 여전히 구조적 클래스 불연속성과 물리적 경계 왜곡을 보입니다. 이 제안된 방법으로 생성된 마스크는 실제 진실 라벨과 공간적으로 높은 겹침을 보입니다. 순수 픽셀 기반 원리에 의해 제약받는 기준선 모델은 차단될 때 국소 수용 야간을 잃기 쉽습니다. 제안된 방법은 초픽셀 GCN을 사용하여 비유클리드 공간에서 메시지 전달을 수행하여, 암묵적인 기하학적 경계에 의해 안내되는 기초 모서리와 선형 공간 골격을 재구성합니다. 이는 시각적 형태학적 관점에서 복잡한 실내 배치를 해결하는 데 있어 제안된 해결책의 간섭 방지 성능을 검증합니다.

소작 실험

제안된 아키텍처 내 각 독립 부품의 실제 기여도를 분석하기 위해, 본 연구는 RGB-D 실내 장면 검증 세트에 대한 확장된 모듈식 소작 테스트를 구성하였습니다. 시험 기준선은 기저 이동 윈도우 변압기 시각적 백본만을 가진 전통적인 분류 네트워크로 설정되었습니다. 정량적 평가는 구조 유도 교차 주의, 부호 거리 필드 바이어스, 적응형 구조 가중치, 슈퍼픽셀 그래프 추론, 공평면 간선 구성, 대칭 그래프 정규화, 구조 일관성 손실의 독립적인 기여도를 측정했습니다. 이 확장된 소작 설계는 누적 모듈 이득과 성분 제거 효과를 분리하여 각 설계 선택의 기여 경계를 명확히 했습니다.

표 4 그림 6 은 누적 및 제거 기반 소작술 설정에서 정확도의 변화를 보여줍니다. 기본 이동 윈도우 트랜스포머 네트워크는 3차원 물리적 경계 제약이 없어 복잡한 배경에서 특징 집계가 제한적입니다. 구조 유도 교차 주의를 추가하면 mIoU가 0.615에서 0.648로, 경계 F1 점수가 0.630에서 0.685로 증가했으며, 부호 거리 필드 사전에 시각 특징과 구조적 윤곽 간의 정렬이 개선되었음을 보여주었다. 슈퍼픽셀 그래프 추론만 추가하면 mIoU가 0.641, 경계 F1 점수가 0.676으로 증가했으며, 이는 노드별 위상학 추론이 동질적인 물리적 영역에서 의미적 일관성을 개선했음을 나타냅니다. 구조적 일관성 손실만 추가하면 mIoU가 0.632, 경계 F1 점수가 0.662로 증가했으며, 손실 항이 광범위한 맥락적 집계보다는 경계 적합에 주로 영향을 미쳤음을 보여주었습니다.

교차 주의와 그래프 추론을 결합하면 mIoU가 0.669, 경계 F1 점수가 0.721로 증가했으며, 시각-구조적 정렬과 그래프 도메인 메시지 전달이 상호 보완적인 효과를 냈음을 보여주었다. 교차 주의와 구조적 일관성 손실을 결합하면 mIoU는 0.660, 경계 F1 점수는 0.713이었고, 그래프 추론과 구조적 일관성 손실을 결합하면 mIoU는 0.653, 경계 F1 점수는 0.704를 기록했습니다. 이 쌍별 결과들은 교차 주의 모듈이 주요 기하학적 정렬 신호를 제공했고, 그래프 추론 모듈이 이 신호를 공평면 영역에 걸쳐 확장했으며, 구조적 일관성 손실이 최적화 과정에서 의미 전이 경계를 정교하게 만들었음을 나타냅니다.

제거 기반 절제는 내부 설계 선택의 기여도를 더욱 명확히 했습니다. 부호 거리 필드 가법 편향을 제거하자 mIoU는 0.656, 경계 F1 점수는 0.698로 감소하여, 구조적 친화력 행렬이 경계 교차 특징 확산을 억제하는 데 핵심적임을 확인했습니다. 적응형 구조 가중 계수 λ를 제거하자 mIoU는 0.671, 경계 F1 점수는 0.736으로 감소하여, 고정된 구조적 제약이 비맨해튼 및 시각적으로 손상된 지역에서 모델 반응을 약화시켰음을 나타냈다. 공평면 간선 제약 조건을 제거하자 mIoU는 0.666, 경계 F1 점수는 0.728로 감소했으며, 국소 인접성만을 기반으로 한 그래프 간선은 물리적 평면 일관성을 유지하지 못함을 보여주었습니다. 대칭 그래프 정규화를 제거하면 mIoU는 0.673, 경계 F1 점수는 0.737로 감소하여, 안정된 노드 집계에 차도 균형 전파가 필요함을 나타냈다. 전체 구조 유도 네트워크는 0.687의 mIoU와 0.764의 경계 F1 점수를 달성했으며, 최종 이득이 구조적 주의, 그래프 추론, 경계 인지 최적화 간의 조정된 상호작용에서 비롯되었음을 입증했습니다.

계산 복잡도, 훈련 시간 및 추론 효율성 분석

SDF 추출, 구조 유도 교차 주의, 슈퍼픽셀 그래프 합성곱 추론의 계산 비용을 평가하기 위해, 본 연구는 동일한 컴퓨팅 플랫폼에서 매개변수 규모, 부동소수점 연산, 최대 메모리 사용량, 학습 시간, 단일 프레임 추론 지연, 프레임 속도, mIoU를 평가했습니다. 부동소수점 연산은 512 × 512 입력 해상도로 계산되었습니다. 추론 지연은 모델 워밍업 후 배치 크기 1로 측정되었으며, 보고된 프레임 속도는 평균 단일 이미지 지연 시간에서 계산되었습니다. 훈련 시간은 동일한 300 에포크 일정, 8개의 배치 크기, 최적화 설정, 데이터 전처리 파이프라인 하에서 측정되었습니다.

표 5는 각 네트워크 아키텍처의 모델 규모, 학습 비용, 추론 효율성, 파싱 정확도 간의 관계를 상세히 설명합니다. 표 5 의 mIoU와 경계 F1 열은 각 모델별로 표 3 과 동일한 전체 검증 집합 값을 사용합니다. 이 두 정확도 열은 표 5 에서 반복되어 구문 분석 정확도와 계산 비용을 비교하기 위해 반복됩니다. 학습 가능한 매개변수 증가는 주로 구조 유도 교차 주의 모듈의 쿼리-키-값 투영 계층과 세 그래프 합성곱 층의 가중치 행렬 때문이었다. 학습 불가능한 비용은 주로 SDF 생성, 슈퍼픽셀 분할, 그래프 인접 구성 등에서 발생했습니다. 이러한 비훈련 연산은 각 입력 이미지마다 한 번씩 실행되었기 때문에 추론 지연은 증가했지만 훈련 가능한 매개변수 수를 크게 늘리지는 못했습니다. 이러한 분리 때문에 제안된 방법이 매개변수는 적당히 증가했지만 지연 시간은 더 뚜렷하게 증가한 것입니다. 복잡도 결과에 따르면, 마스크-주의 기반 분할 기준선은 매개변수 수가 적고 추론 지연이 짧았으나, 네트워크의 명시적 기하학적 경계 안내가 부족해 심각한 폐쇄 시 경계 F1 점수와 mIoU가 제한되었습니다. 교차 모달 특징 집계 기준선은 더 많은 부동소수점 연산과 더 긴 학습 시간이 필요했는데, 이는 교차 모달 집계가 추가적인 특징 정렬 오버헤드를 초래했기 때문입니다. 점진적 특징 융합 기준선은 중간 정도의 계산 비용을 유지했으나, 경계 왜곡 하에서 제안된 방법보다 예측 정확도는 낮았습니다. 제안된 구조 유도 네트워크는 SDF 구성, 구조적 교차 주의 투영, 슈퍼픽셀 그래프 구성, 그래프 컨볼루션 전파로 인해 추가적인 계산 비용이 발생합니다. 전체 모델은 6,680만 개의 파라미터, 1,214억 개의 부동소수점 연산, 15.6시간의 훈련 시간, 7.9GB 최대 메모리, 61ms 단일 프레임 추론 시간, 16.4프레임/초를 사용했습니다. 추론 지연 시간이 순수 마스크 주의 기준선보다 높았음에도 불구하고, 모델은 0.687의 mIoU와 0.764의 경계 F1 점수를 달성했으며, 이는 추가 비용이 주로 구조적 경계 복구와 위상적 인식 의미 일관성을 지원했음을 나타냈다.

계산 규모와 모델의 해석 정확도 사이의 2차원 공간 균형을 시각적으로 나타내기 위해, 부동소수점 연산 횟수와 알고리즘의 mIoU를 보여주는 버블 분포 다이어그램이 제작되었습니다. 수정된 시각화는 또한 그림 주석 영역에서 훈련 시간과 추론 지연을 보고하여, 훈련 및 배포 관점에서 정확도 향상과 계산 비용을 비교할 수 있게 했습니다. 수평축은 부동소수점 연산을, 수직축은 mIoU를 유지했으며, 버블 크기는 훈련 가능한 매개변수량을, 첨부된 라벨은 각 방법별 추론 시간을 보고했습니다.

그림 7 은 부동소수점 연산, 매개변수 스케일, 추론 지연, 파싱 정확도 간의 관계를 보여줍니다. 제안된 방법은 비교 네트워크보다 더 높은 mIoU를 달성하며, FLOPs와 매개변수 수는 교차 모달 및 점진적 융합 기준선과 거의 일치합니다. 단일 프레임 지연 61ms는 추가된 SDF와 그래프 추론 분기가 배포 오버헤드를 발생시켰음을 나타내지만, 지연 시간은 많은 실내 장면 해석 작업에 필요한 실시간 범위 내에 머물렀습니다. 각 훈련 시기마다 구조적 사전 추출, 주의 투사, 그래프 추론이 수행되면서 훈련 시간은 15.6시간으로 증가했습니다. 이 결과는 제안된 방법의 계산 비용이 통제되지 않은 매개변수 확장보다는 경계 인지 구조적 추론에 주로 집중되어 있음을 보여준다.

구조적 일관성 손실과 공간 거리 손실의 구체적 비교

경계 공간 변환 거리의 양자화를 위한 역변환 네트워크 손실은 준동형 변환 매개변수를 이용해 경계 오프셋을 포착하며, 순수 공간 거리 지표가 픽셀 라벨 변경 기반의 전통적인 교차 엔트로피 손실보다 더 우수한 성능을 보인다는 것을 입증합니다. 이 이론적 합의를 바탕으로, 경계-제약 체계를 사용하여 맨해튼-바운딩 박스 기반 맞춤형 구조적 일관성 손실(SCL)의 장면 적응성 성능을 평가하기 위한 병렬 검증 실험이 수행됩니다. 이 실험들은 다중 스케일 시각 백본과 그래프 추론 네트워크를 융합하는 분석 구조를 유지하면서도, 백패게이션 중 경계 손실 항을 단순히 대체합니다. 네 개의 병렬 검증 네트워크가 구성되어 있습니다: 기본 분류 교차 엔트로피 손실만을 사용하는 네트워크는 고차원 기하학적 제약이 없으며; 표준 경계 이진 교차엔트로피(BCE) 손실이 추가된 네트워크는 전통적인 엣지 이진 분류 감독을 수행합니다; 공간 경계 거리 손실이 추가된 네트워크는 국소 변형 포착에 집중합니다; 제안된 SCL을 적용하는 네트워크는 SDF를 기반으로 직교 위상적 페널티를 부과합니다. RGB-D 실내 장면 검증 세트의 양자화 지표는 mIoU와 구조 경계 F1 점수로 제한됩니다.

표 6은 다양한 역전파 최적화 전략이 기저 공간 논리 인지에 미치는 개입 정도를 상세히 설명합니다. 표 6 의 교차 엔트로피 전용 항목은 픽셀 수준 교차 엔트로피 손실만으로 훈련된 제안된 아키텍처를 나타내며, 시각적 백본, 부호 거리 필드 분기, 구조 유도 교차 주의 모듈, 슈퍼픽셀 그래프 추론 분기는 변경하지 않은 상태입니다. 이 항목은 Mask2Former 기준선이 아니며, 동일한 모델을 사용하기 때문에 표 3의 전체 Mask2Former 값과 비교해서는 안 됩니다. 기본 교차 엔트로피 손실에만 의존하는 네트워크는 가장 낮은 경계 적합 점수를 달성합니다. 추가적인 표준 경계 이진 교차 엔트로피 손실을 가진 네트워크는 약간의 이득을 얻지만, 이 메커니즘은 대규모 폐쇄 하에서도 가장자리 흐림을 유발합니다. 공간 경계 거리 손실은 공간 변환 인식 메커니즘을 통해 점수를 개선하여 일부 왜곡된 가장자리를 효과적으로 교정합니다. 이 논문에서 제안된 구조적 일관성 손실은 실제 SDF를 직접 활용하여 물리적 하중을 지탱하는 표면 내 이상 의미 돌연변이에 대해 구배 페널티를 부과하여 구조 경계에서 가장 높은 F1 점수를 달성합니다.

마스크 예측 정확도와 경계 적합도에 미치는 다양한 손실 함수 구성의 구동 효과를 시각적으로 비교하기 위해, 우리는 다양한 최적화 전략에 걸쳐 그룹화된 막대 차트를 그래프로 그렸습니다.

그림 8 은 손실 함수의 공간-지각 차원을 업그레이드함으로써 발생하는 단계별 성능 향상을 보여줍니다. 구조 경계의 F1 점수를 나타내는 막대 차트는 상당한 상승 추세를 보여준다. 실험 데이터는 이 맞춤형 페널티 메커니즘이 예측된 범주의 공간 점프 위치가 직교 물리적 윤곽과 정확히 일치하도록 강제하는 것을 보여줍니다. 실내 직교 사전에 맞게 맞춤화된 거리-장 페널티 메커니즘은 일반적인 공간 경계 캡처 손실보다 더 높은 정확도를 달성하여 복잡한 건축 결함을 해결하기 위한 효과적인 최적화 경로를 확립합니다.

극심한 폐쇄 분포, 이상 구조, 그리고 도전적인 조명 조건의 강인성 테스트

객체 간의 복잡한 공간 관계와 상호 가림은 전 지구적 3D 공간 인지에 부정적인 영향을 미칩니다. 공동 예측 아키텍처는 장면 레이아웃 제약이 기본 마스크를 추출하는 데 있어 보조 역할을 강조합니다. 넓은 영역의 시각 신호 손실과 3D 직교 물리 가정을 위반하는 이상 공간 배치 하에서 알고리즘의 간섭 방지 한계를 살펴보면 알고리즘의 유효 적용 경계가 명확히 정의되며, 핵심적이고 입증 가능한 가치를 가집니다. 대형 가구의 비율에 따라 실제 진실 표시 표시가 가려져 있으며, RGB-D 실내 장면 테스트 세트는 점차 난이도가 높아지는 세 가지 하위 집합으로 세분화됩니다: 경도, 중도, 심한 폐쇄. 동시에, 경사진 천장이나 곡선 벽이 있는 맨해튼 전형이 아닌 장면들은 수작업으로 추출하여 이상 경계 테스트 세트를 구성하고, 극도로 어두운 환경, 과노출, 광택 또는 투명 유리 표면이 있는 장면은 도전적인 조명 및 질감 하위 집합으로 분류됩니다. 비교 모델 라이브러리에는 마스크-주의 기반 세분화 기준선이 포함되어 있습니다; 마스크 주의를 기반으로 한 일반적인 세분화 아키텍처를 통해 전역 맥락을 포착하는 것; 포괄적인 교차 모달 특성 집계 전략을 적용한 교차 모달 특징 집계 기준선; 그리고 다단계 점진적 특징 추출 메커니즘을 통합한 점진적 특징 융합 기준선이 있습니다. 이 논문에서 구축된 각 비교 기준선, 융합 시각 백본, 그래프 추론 네트워크 파싱 아키텍처가 위의 하위 집합에 대해 독립적으로 평가되며, 각 모델의 정확도 감쇠 기울기를 통계적으로 분석합니다.

표 7은 경도, 중등도, 심한 폐색, 어려운 조명, 텍스처 간섭, 비맨해튼 이상 조건에서의 하위 집합별 강인성 지표를 보고합니다. 표 7은 공간 간섭 하에서 서로 다른 모델의 마스크 예측 정확도 변화를 상세히 설명합니다. 표 7은 공간 간섭 조건 하에서 서로 다른 모델의 하위 집합별 mIoU 값을 보고하며, 이는 해당 폐쇄, 조명, 텍스처 또는 비맨해튼 하위 집합 내에서만 계산되며, 전체 실내 장면 검증 세트에는 적용되지 않습니다. 경도와 중등도 폐쇄 하위 집합에서는 모든 모델이 기준선 정확도를 유지합니다. 폐쇄 면적이 증가함에 따라, 픽셀 기반 규칙에 의존하는 기준선 모델은 심하게 가린 부분집합에서 교차-합집합(IU)이 감소하는 것을 보입니다. 마스크-주의 기반 세분화 기준선과 교차 모달 특징 집계 기준선은 이 하위 집합에서 상당한 정확도 손실을 겪습니다. 점진적 특징 융합 기준선의 다단계 점진적 특징 추출 아키텍처는 심각한 성능 저하를 보입니다. 제안된 해결책은 명시적인 3D 골격 특징을 활용해 손상된 시각 신호의 정렬을 강제하고, 심하게 가려진 부분집합에서 안정적인 마스크 출력 형태를 유지하며, 의미 마스크 출력의 위상 안정성을 입증합니다. 조명 및 텍스처 하위 집합에서 선분간 검출기는 강한 반사와 투명 유리가 있는 영역에서 구조적 가장자리를 놓치고, SDF에 국소적인 불연속성을 발생시킵니다. 잘못된 기하학적 좌표는 구조적 친화도 행렬과 구조적 일관성 손실을 통해 전파되어, 의미적 특징에 비정상적인 기울기 페널티를 가하고 경계 예측에 그에 따른 편차를 초래한다. GCN의 글로벌 공간 맥락 추론 메커니즘은 누락된 기하학적 사전 변수를 인접한 구조적 친화성을 보완하여 전체 구문 정확도를 허용 가능한 감쇠 범위 내에서 유지하고, 복잡한 물리적 간섭 하에서 알고리즘의 시각적 인식 능력 경계를 드러냅니다. 비-맨해튼 이상 하위 집합에서는 이 모델의 하단 층에 있는 SDF 사전이 약간의 매핑 편향을 도입하여 점진적 특징 융합 기준선보다 약간 낮은 성능을 보입니다. 교차 주의 모듈의 적응형 구조 가중 계수는 기저 물리적 구조의 구배 일관성을 동적으로 평가합니다. 곡선형 벽이나 경사진 천장이 있는 장면에서는 이 계수가 자동으로 SDF의 제약 가중치를 줄여, 네트워크가 슈퍼픽셀 그래프 네트워크의 로컬 특징 노드 집계 메커니즘에 의존해 동질한 영역에서 의미적 일관성을 유지하도록 유도하여, 비맨해튼 공간 배치에 효과적인 기하학적 보상 메커니즘을 확립합니다.

오클루즈 심각도가 해상도 정확도에 미치는 부정적 영향을 시각적으로 보여주기 위해, 우리는 서로 다른 알고리즘 모델에서 정확도 저하를 보여주는 선 그래프를 그렸습니다.

그림 9 는 극한 물리적 환경에서 다양한 특징 추출 패러다임 간의 견고성 차이를 시각적으로 보여줍니다. 기초 모델을 나타내는 세 개의 점선은 모두 심하게 차단된 노드에서 유의미한 하락 경향을 보이는데, 이는 대규모 신호 손실 하에서 기존 수용야의 특징 추출 한계를 반영합니다. 제안된 방법을 나타내는 실선은 비교적 부드러운 붕괴 궤적을 유지합니다. 실험 데이터는 명시적인 3D 아키텍처 사전과 그래프 기반 추론 메커니즘 간의 결합이 폐쇄 저항성 장면 구문 분석에 구조적 지지를 제공하고 복잡한 환경에서 모델 일반화 성능을 향상시키는 것을 보여줍니다.

위상학 그래프 노드 분할의 공간 민감성 분석

좌표 공간 그래프 합성곱 모듈의 차원 감소 샘플링 속도 매개변수는 수용 영역의 품질과 그래프 네트워크의 계산 부담을 직접 제어합니다. 본 논문의 이론적 틀에 따라, 본 연구는 단순 선형 반복 군집화로 생성된 이산 그래프 노드 수가 비유클리드 위상 추론의 성능에 어떤 영향을 미치는지 조사하며, 하이퍼파라미터 선택에 대한 엄밀한 지원을 제공하는 것을 목표로 합니다. 클러스터링 알고리즘의 초기화 제어 매개변수를 조정하는 실험이 수행되었으며, 특징 공간의 동적 차원 감소에 강제로 개입하여 슈퍼픽셀 그래프 노드 파티션 수를 64, 128, 256, 512, 1024로 설정했습니다. 엄격히 정렬된 테스트 벤치마크 하에서, 평균 교차-합집합(IoU) 비율, 구조 경계 F1 점수, 고해상도 이미지당 평균 추론 시간이 서로 다른 위상 노드 크기에서 동시에 기록되었습니다.

표 8은 특징 공간에서의 동적 차원 감소 정도와 해석적 정확도 및 계산 비용 간의 관계를 상세히 설명합니다. 노드 수를 너무 낮게 설정하면 이미지 특징의 세분화가 부족해지고, 작은 객체의 의미적 속성이 대형 벽 특징과 융합되어 다양한 정확도 지표가 떨어집니다. 노드 분할 규모가 커질수록 모델의 국소 공간 세부 사항에 대한 민감도가 크게 향상됩니다. 노드 수를 512개와 1024개로 늘리면 동질한 영역의 단편화가 발생하고, 그래프 신경망의 거시적 특징에 대한 평활화 효과가 약화되며, 노드 관계 행렬의 차원이 증가하고 추론 시간이 증가합니다. 노드 수가 고정된 매개변수 구성은 교차-합 비율과 경계 점수에서 가장 높은 값을 만듭니다.

비유클리드 위상 추론에서 정확성과 계산 능력 간의 균형을 시각적으로 나타내기 위해, 노드 크기 민감도를 보여주는 이축 통계 그래프를 그렸습니다.

그림 10 은 이산 그래프 노드 수가 네트워크 특징의 진화에 영향을 미치는 기본 논리를 보여줍니다. 계산 시간을 나타내는 배경 바는 노드 수가 256 임계값을 초과하면 급격히 증가하는 것을 보여줍니다. 정확도를 나타내는 이중 선은 수평축 256에서 최고조에 달하며, 이후 단편화 효과로 인해 합리적으로 감소합니다. 객관적인 정량적 데이터와 시각적 진화 추세는 매우 일관되어, 현재 고정 매개변수 구성에서 하드웨어 처리와 논리적 추론 사이의 균형을 이루는 것을 보여줍니다. 이 노드 수에서 벗어나 발생하는 심각한 성능 저하는 고정 슈퍼픽셀 세분화 전략이 하이퍼파라미터 튜닝에 매우 민감하다는 점을 보여주며, 동적 노드 선택 메커니즘 개발의 필요성을 강조합니다.

데이터 가용성:

이 연구에서 분석된 원시 벤치마크 데이터는 재료표에 나열된 공식 저장소에서 공개되어 있습니다. 대규모 실내 3D 벤치마크는 공식 ScanNet v2 릴리스로 접근되었으며, 데이터셋 릴리스 식별자는 ScanNet v2였습니다. RGB-D 실내 장면 벤치마크는 공식 NYU Depth Dataset V2 릴리스를 통해 접근되었으며, 출시 식별자는 NYU Depth Dataset V2입니다. 대규모 실내 3D 벤치마크의 설명 DOI는 10.1109/CVPR.2017.261이며, RGB-D 실내 장면 벤치마크의 설명 DOI는 10.1007/978-3-642-33715-4_54입니다. 이 연구에서는 새로운 원본 이미지나 RGB-D 데이터셋이 생성되지 않았습니다. 처리된 분할 파일, 학습 구성 파일, 원시 평가 로그, 테이블 2, 테이블 3, 테이블 4, 테이블 5, 테이블 6, 테이블 7, 테이블 8을 지원하는 수치 소스 파일, 그리고 그림 5, 그림 6, 그림 7, 그림 8, 그림 9, 그림 10을 지원합니다훈련된 모델 가중치와 소스 코드는 FIGSHARE에 DOI: 10.6084/m9.figshare.32906765 하에 보관되어 있습니다. 피그쉐어 기록은 이 원고에 보고된 정량적 표와 수치를 재현하는 데 필요한 완전한 원시 결과 데이터를 제공합니다. 저장소에는 보고된 mIoU, 경계 F1, 픽셀 기록, 평균 계산, 계산 복잡도, 견고성, 손실 함수 검증, 노드-파티션 민감도 분석에 사용되는 예측 마스크, 경계 평가 파일, 메트릭 계산 스크립트, 모델 체크포인트, 테이블 소스 파일이 포함되어 있습니다.

figure-results-1
그림 1: 복잡한 실내 폐쇄 시나리오에서 의미 불연속성과 구조적 사전 수리 효과 비교. (A) 대규모 가구 가림이 포함된 원본 RGB 이미지. (B) 물리적 경계 왜곡과 의미 불연속성 결함을 강조하는 전통적인 기준선 모델 출력. (C) 제안된 방법의 출력은 3D 건물 골격을 명시적으로 매핑하여 기저 구조물의 손상된 구조물의 위상 수리를 위한 것. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-2
그림 2: 구조적 사전 구축에 의해 안내된 전체 의미 구문 구조. 이 다이어그램은 RGB 이미지 입력에서 시작하여 시프트 윈도우 시각 특징 추출 분기와 구조 사전 추출 분기, 구조 유도 교차주의 모듈, 슈퍼픽셀 GCN을 통한 위상학 추론, 그리고 마지막으로 조밀한 의미 맵으로 디코딩하는 전체 파이프라인을 개략적으로 설명합니다. 오른쪽에는 주의 친화도 행렬 계산, 그래프 메시지 전달, 그리고 공동 최적화 손실 함수의 상세 배치가 제시되어 있습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-3
그림 3: 친화성 행렬과 위상 연결성 구성의 흐름도. 이 차트는 입력 거리 장도 맵과 선택된 픽셀 쌍에서, 연속적인 기하학적 퍼텐셜 특징 추출과 그라디언트 일관성 평가를 거쳐, 교차 주의 메커니즘의 명시적 공간 편향으로 사용되는 정규화된 친화도 행렬로의 변환을 단계별로 상세히 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-4
그림 4: 슈퍼픽셀 그래프 컨볼루션 노드 투영 및 특징 집계의 개략도. 패널은 비유클리드 위상 추론 과정을 상세히 설명합니다: (A) 원래의 국소 특징 행렬과 슈퍼픽셀 군집 경계를 보여주는 밀집 픽셀 특징; (B) 정규 그리드를 이산 노드와 물리적으로 연결된 간선에 매핑하는 슈퍼픽셀 그래프 토폴로지 구성; (C) 국소 특징의 방향성 집계를 수행하는 그래프 합성곱 메시지 전달; 그리고 (D) 조밀한 격자에서 복원된 거시적 의미 일관성 특징을 제시하는 좌표 백투사. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-5
그림 5: 정성적 비교 격자 다이어그램. 이 행렬은 다양한 행별 실내 장면에서 시각적 성능 평가를 제공하며, 원래 실내 RGB 입력과 지상 진실 레이아웃을 마스크 주의 기반 분할 기준선, 교차 모달 특징 집계 기준선, 점진적 특징 융합 기준선, 그리고 가려진 모서리를 성공적으로 복원하고 하중 지지 표면을 정렬하는 제안된 방법의 출력과 비교합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-6
그림 6: 누적 모듈 적분을 위한 소작 결과. 이중 축 차트는 다양한 모듈러 소작 설정에서 성능 진화를 단계별로 보여주며, 결합 간 평균 교차점(mIoU)의 꾸준한 상승 궤적을 막대로, 구조 경계 F1 점수를 기준선 백본에서 전체 프레임워크로 선그래프로 표시합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-7
그림 7: 계산 복잡도, 훈련 시간, 추론 효율성 분포. 다차원 버블 차트는 계산 오버헤드와 구문 정확도 간의 절충관계를 보여줍니다. 가로축은 부동소수점 연산(FLOP)을 측정하고, 세로축은 mIoU를, 버블 크기는 학습 가능한 매개변수의 규모를, 인접한 텍스트 라벨은 각 네트워크 아키텍처의 단일 프레임 추론 지연을 보고합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-8
그림 8: 서로 다른 손실 함수 구성에서의 경계 정확도와 지표 점수의 히스토그램. 그룹화된 막대 차트는 다양한 최적화 전략이 기저 공간 논리에 미치는 주도 효과를 비교하며, 표준 교차엔트로피 공식에서 제안된 구조 일관성 손실로 업그레이드함으로써 mIoU와 구조 경계 F1 점수에서 상당한 향상을 보여준다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-9
그림 9: 폐색 심각도와 성능 저하 간의 관계를 보여주는 선 그래프. 이 곡선은 경미, 중등도, 심각한 폐쇄 수준에서 다양한 특징 추출 패러다임 간 정확도 저하를 추적하며, 제안된 구조 중심 프레임워크가 순수 픽셀 기반 기준선과 비교했을 때 견고한 위상 안정성과 간섭 방지 능력을 강조합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-10
그림 10: 슈퍼픽셀 노드 스케일의 감도 분석. 이축 통계 그래프는 다양한 그래프 분할 크기에서 하드웨어 처리 속도와 논리적 추론 정확도 간의 균형을 보여주며, 슈퍼픽셀 노드 수가 정확도 지표에 영향을 미치고 평균 추론 시간이 급격히 증가하는 결과를 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

네트워크 계층 번호 매기기입력 노드 특징 차원출력 노드 특징 차원무작위 비활성화 확률 설정
15122560.15
22562560.15
32561280.1
4128640.05

표 1: 합성곱 추론 모듈을 위한 네트워크 아키텍처의 하이퍼파라미터 구성 테이블. 이 표는 그래프 추론 네트워크에서 사용되는 네트워크 계층 번호 매기기, 입력-노드 특징 차원, 출력 노드-기능 차원, 그리고 무작위 비활성화 확률 설정을 보고합니다.

구성 항목대규모 실내 3D 벤치마크RGB-D 실내 장면 벤치마크
공식 출시 식별자스캔넷 v2NYU 깊이 데이터셋 V2
본 연구에서 사용된 훈련 샘플1201 장면795장 이미지
평가에 사용되는 검증 또는 테스트 샘플312개의 검증 장면654장 테스트 이미지
총 의미 범주2040
입력 이미지 해상도512 × 512512 × 512
초기 학습률0.00010.0001
배치 입력 샘플 카운트88
무게 감쇠 계수0.010.01
총 훈련 시기300300
독립 출연 횟수55

표 2: 실험 데이터셋 분할 및 통합 훈련 하이퍼파라미터 구성. 이 표는 대규모 실내 3D 데이터셋과 RGB-D 실내 장면 데이터셋의 샘플 분할 설정, 의미 범주 수, 학습률 설정, 배치 입력 샘플 수, 가중치 감소율, 총 학습 반복 횟수를 보고합니다.

네트워크 모델 아키텍처mIoU경계 F1픽셀 악민악
세그포머0.596 ± 0.0030.635 ± 0.0040.838 ± 0.0030.704 ± 0.004
ConvNeXt UperNet0.604 ± 0.0030.642 ± 0.0040.846 ± 0.0030.713 ± 0.004
마스크2포터0.612 ± 0.0030.654 ± 0.0040.853 ± 0.0030.721 ± 0.004
원포머0.621 ± 0.0020.663 ± 0.0030.861 ± 0.0030.733 ± 0.003
마스크다이노0.628 ± 0.0020.667 ± 0.0030.869 ± 0.0030.741 ± 0.003
CCANet0.635 ± 0.0030.671 ± 0.0040.876 ± 0.0030.745 ± 0.004
인터나이미지: 우퍼넷0.641 ± 0.0020.692 ± 0.0030.884 ± 0.0020.756 ± 0.003
CMPFFNet0.658 ± 0.0020.712 ± 0.0030.891 ± 0.0020.773 ± 0.003
SGCA_GCN0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

표 3: RGB-D 실내 씬 검증 세트에서의 실내 씬 파싱 베이스라인의 전반적인 정량적 비교. 표는 마스크-주의 기반 분할 기준선, 교차 모달 특징 집계 기준선, 점진적 특징 융합 기준선, 그리고 제안된 구조 유도 네트워크 아키텍처에 대해 mIoU, 경계 F1 점수, 전역 픽셀 정확도, 평균 클래스 정확도를 보고합니다.

네트워크 아키텍처 구성mIoU경계 F1픽셀 악민악
베이스 이동 윈도우 백본0.615 ± 0.0030.630 ± 0.0040.842±0.0030.706 ± 0.004
백본과 구조 중심 교차 주의0.648 ± 0.0030.685 ± 0.0040.874 ± 0.0030.748 ± 0.004
백본과 슈퍼픽셀 그래프 추론0.641 ± 0.0030.676 ± 0.0040.868 ± 0.0030.741 ± 0.004
척추와 구조적 일관성 손실0.632 ± 0.0030.662 ± 0.0040.859 ± 0.0030.732 ± 0.004
백본 플러스 교차 주의 및 그래프 추론0.669 ± 0.0020.721 ± 0.0030.897 ± 0.0020.782 ± 0.003
척추와 교차주의 및 구조적 일관성 손실0.660 ± 0.0020.713 ± 0.0030.889 ± 0.0020.773 ± 0.003
백본 플러스 그래프 추론과 구조적 일관성 손실0.653 ± 0.0030.704 ± 0.0030.881 ± 0.0030.765 ± 0.003
부호 거리 필드 가산 바이어스가 없는 전체 모델0.656 ± 0.0030.698 ± 0.0040.884 ± 0.0030.761 ± 0.004
적응 구조 가중 λ가 없는 전체 모델0.671 ± 0.0020.736 ± 0.0030.904 ± 0.0020.792 ± 0.003
공평면 엣지 제약 없이 전체 모델0.666 ± 0.0020.728 ± 0.0030.899 ± 0.0020.786 ± 0.003
대칭 그래프 정규화가 없는 전체 모델0.673 ± 0.0020.737 ± 0.0030.906 ± 0.0020.795 ± 0.003
풀 SGCA_GCN0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

표 4: 핵심 성분의 확장된 정량적 소작 분석. 이 표는 구조 유도 교차 주의, 부호 거리 필드 바이어스, 적응형 구조 가중치, 슈퍼픽셀 그래프 추론, 공평면 경계 구성, 대칭 그래프 정규화, 구조 일관성 손실의 독립적이고 협력적인 기여를 정량화하기 위해 누적 모듈 통합, 쌍별 모듈 조합, 구성 요소 제거 설정을 보고합니다.

네트워크 모델 아키텍처매개변수플랍피크 메모리훈련 시간추론 시간FPSmIoU경계 F1
세그포머83.7 M80.1 G6.1GB10.6시간44ms22.70.5960.635
ConvNeXt UperNet60.2 M91.5G6.4GB11.2 시간47ms21.30.6040.642
마스크2포터44.0 M74.6 G5.8GB9.4시간41ms24.40.6120.654
원포머64.1 M103.2 G7.0 GB12.9 시간55ms18.20.6210.663
마스크다이노52.8 M96.8 G6.8 GB12.1 시간52ms19.20.6280.667
CCANet63.5 M118.7 G7.6GB14.8시간67ms14.90.6350.671
인터나이미지: 우퍼넷70.4 M112.3 G7.4GB14.2 시간64ms15.60.6410.692
CMPFFNet58.9 M104.6 G7.1 GB13.1 시간59ms16.90.6580.712
SGCA_GCN66.8 M121.4 G7.9GB15.6시간61ms16.40.6870.764

표 5: 계산 복잡도, 훈련 시간, 추론 효율성과 전체 검증 집합 정확도 비교. 이 표는 학습 가능한 매개변수, 부동소수점 연산, 최대 메모리 사용량, 300 에포크의 학습 시간, 단일 프레임 추론 지연, 초당 프레임, mIoU, 그리고 제안된 방법 및 비교 네트워크의 경계 F1 점수를 보고합니다.

손실 함수 구성mIoU경계 F1
교차엔트로피(CE) 전용입니다0.6690.721
서기 + 경계 BCE0.6740.738
CE + 역형식 손실0.6810.752
CE + Ours SCL0.6870.764

표 6: 손실 함수 검증의 정량적 비교. 표는 교차 엔트로피 손실, 경계 이진 교차 엔트로피 손실, 역변환 손실, 그리고 제안된 구조 일관성 손실에 따른 mIoU 및 경계 F1 점수를 보고합니다.

알고리즘 모델 아키텍처가벼운 폐쇄중간 정도 폐쇄심한 폐쇄비맨해튼 이상 집합텍스처-간섭 부분집합
(빚)(빚)(빚)(빚)(빚)
마스크2포터0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

표 7: 극단적 폐쇄 분포와 비맨해튼 구조의 하위 집합별 강인성 분석. 표는 경도 폐쇄, 중간 정도 폐쇄, 심한 폐쇄, 도전 조명, 텍스처-간섭, 비맨해튼 이상 하위 집합에서 구문 정확도의 변화를 보고합니다.

슈퍼스케일 노드 수mIoU경계F1평균 추론 시간 (ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

표 8: 위상학 그래프에서 노드 분할 스케일의 공간 민감도 분석. 표는 mIoU, 구조 경계 F1 점수, 그리고 다양한 슈퍼픽셀 노드-파티션 설정 간 평균 추론 시간을 보고합니다.

토론

이 논문의 알고리즘은 시프트 윈도우 계층형 트랜스포머 인코더가 포착한 계층적 시각적 특징과 선분간 검출로 생성된 맨해튼 3D 경계 박스의 선행 깊이를 긴밀하게 결합하여, 복잡한 실내 장면의 고정밀 의미론적 재구성을 달성합니다. 구조 유도 교차 주의 메커니즘은 시각 신호를 SDF가 보정한 실제 기하학적 경계와 일치하도록 강제하여, 국소적으로 가려진 영역42의 저층 지형의 연속성을 복원합니다. 위상 그래프는 반복적인 국소 클러스터링 알고리즘으로 생성된 슈퍼픽셀 노드를 사용하여 구성되며, 이는 GCN이 물리적 동면적 제약 조건 하에서 특징 집계를 수행하도록 유도하여 거시적 의미 분포43의 일관성을 보장합니다. 실험 결과는 이 방법이 합집합 비율 간 평균 교차 비율을 68.7%로 달성하며 표준편차 0.2%를 달성하며, 실용적인 공학 값, 구조 경계 F1 점수 76.4%, 표준편차 0.3%, 평균 추론 시간(61ms)을 달성하며, 경계 재구성 정확도를 최종 추론 효율보다 우선시하는 의도적인 절충을 반영합니다44. 견고성 테스트는 또한 이 모델이 대규모 시각 신호 손실이 발생하는 극한 조건에서도 강력한 위상 복구 능력을 보인다는 것을 보여줍니다. 구조적 일관성 손실을 도입함으로써 예측된 마스크가 SDF에 의해 보정된 0거리 물리적 경계와의 정렬 정확도가 향상되어, 계산 복잡도와 구문 분석 품질45의 시너지 최적화를 달성합니다. 이 스킴은 3차원 공간 법칙에 기반한 특징 융합 접근법을 제공하며, 대규모 가구 폐쇄 및 물리적 경계 왜곡46을 다룰 때 위상 복원에서 논리적 일관성을 입증합니다. 연구 결과는 지능형 공간 추론과 고정밀 3D 재구성을 위한 견고한 물리-기하학적 제약 체계를 제공하며, 실제 물리적 환경에서 로봇의 시각 내비게이션 및 장면 인식 작업에 실용적인 공학적 가치를 지닙니다.

맨해튼 세계 가설에 크게 의존하는 기하학적 위상수학 도출 메커니즘은 곡선 벽이나 비직교 경계가 있는 불규칙한 건축 공간을 다룰 때 적합 편향을 겪는다47. 이 기하학적 모델링 병목 현상을 극복하기 위해 후속 네트워크 반복에서는 다도 다항식 표면 적합 알고리즘과 비균일 합리 B-스플라인 곡선 추출 모듈을 물리-사전 분기로 통합할 예정입니다. 이 범용 공간 모델링 전략은 강직선을 동적으로 변형 가능한 위상 경계로 변환하여, 비정상적인 실내 공간 배치에서 알고리즘의 파싱 정확도를 지속적으로 향상시킵니다.

기하학적 사전 추출은 기본적인 선분간 검출기에 의존하여, 반사되거나 투명한 재료가 지배적인 실내 장면을 처리할 때 구조적 마스크 왜곡에 취약합니다. 구조적 일관성 손실은 이 검출기가 생성하는 SDF를 직접 호출하여 사전 추출과 구배 최적화 사이에 닫힌 의존 루프를 형성합니다. 시각적 간섭이 이상 선분간 감지를 유발하면, 결함 있는 기하학적 좌표가 SDF에 매핑되고, 역전파 중 구조적 일관성 손실로 인해 직접 증폭되어 네트워크 매개변수가 잘못된 물리적 경계에 맞추도록 강요됩니다. 이후 알고리즘 반복에서는 심도 지도와 적외선 방사선 데이터를 수집하는 다중 모드 적응 융합 분기를 도입하여 기하학적 구조 인식을 가시광선 조명 제약과 분리시키고, 극한 광학 환경에서 공간적 추론 경계를 확장할 것입니다.

고정된 슈퍼픽셀 노드 스케일로 인한 성능 민감도를 해결하기 위해, 후속 연구에서는 이미지의 복잡성에 따라 노드 분할 방식을 동적으로 결정하는 학습 가능한 적응형 그래프 풀링 모듈을 설계할 예정이며, 이는 네트워크의 수동 하이퍼파라미터 튜닝에 의존하지 않게 할 것입니다. 슈퍼픽셀 그래프 네트워크의 계산 오버헤드로 인한 하드웨어 배포 한계를 해결하기 위해, 향후 최적화 계획에서는 경량 특징 분리 메커니즘과 게이트 집계 모듈을 도입하여 기하학적 사전 분기50의 매개변수 스케일을 압축하고 행렬 연산을 가속화할 예정입니다.

공개 사항

저자들은 재정적 이해 충돌이 없다고 선언합니다.

감사의 글

자금 지원: 산시 핵심 연구개발 프로그램 (프로그램 번호 2024CY2-GJHX-76).

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

참고문헌

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

3D

관련 논문