본 연구는 시프트 윈도우 계층적 트랜스포머 인코더가 포착한 계층적 시각적 특징과 선분간 검출로 생성된 맨해튼 3D 경계 박스의 사전 깊이를 긴밀하게 결합하여 복잡한 실내 장면의 고정밀 의미론적 재구성을 달성하는 알고리즘을 제안합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
본 연구는 시프트 윈도우 계층적 트랜스포머 인코더가 포착한 계층적 시각적 특징과 선분간 검출로 생성된 맨해튼 3D 경계 박스의 사전 깊이를 긴밀하게 결합하여 복잡한 실내 장면의 고정밀 의미론적 재구성을 달성하는 알고리즘을 제안합니다.
복잡한 실내 장면에서 가구 폐쇄로 인한 의미론적 예측 불연속성과 물리적 경계 왜곡을 해결하기 위해, 본 논문은 건물-구조 사전에 활용하는 의미론적 구문 분석 방법을 제안합니다. 이 방식은 시프트 윈도우 계층적 트랜스포머 인코더를 사용하여 다중 스케일 시각적 특징을 추출하고, 그라디언트 방향 일관성 선분간 검출 알고리즘을 결합해 맨해튼 3D 경계 상자를 구성합니다. 이 경계 상자는 이산 기하학적 윤곽선을 연속적인 물리적 퍼텐셜 장으로 인코딩하기 전에 부호 있는 거리장(SDF)으로 변환됩니다. 구조 유도 교차 주의 메커니즘은 시각 신호를 실제 3D 직교 기하학적 경계와 정렬시키고, 가려진 영역에서 특징의 연속성을 복원합니다. 슈퍼픽셀 노드로 구성된 공간 인접 그래프는 그래프 컨볼루션 네트워크(GCN)를 구동하여 특징을 집계하여 물리적 하중 지지 평면 내에서 거시적 의미론적 일관성을 보장합니다. 픽셀 수준의 교차엔트로피 손실과 맞춤 설계된 구조적 일관성 손실의 조합이 제약을 강화하여 경계 밖 예측에 불이익을 줍니다. 여러 독립 실험을 거치는 실험 결과, 결합 간 평균 교차점(mIoU)은 표준편차 0.2%로 68.7%에 도달하고, 구조 경계 F1 점수는 표준편차 0.3%로 76.4%에 도달하여 제안된 모듈들의 견고한 성능을 확인시켜 줍니다. 단일 이미지 노드 크기가 256일 때, 평균 추론 시간은 61ms로 유지되었습니다.
실내 장면 이미지 의미 분석은 3차원 공간 인지와 지능형 공간 추론 과제에서 핵심적인 위치를 차지합니다 1,2. 실제 물리적 환경에서의 시각적 특징 추출은 복잡한 공간배치로 인해 종종 심각하게 방해받습니다. 건물 기초 구조의 의미 불연속성과 물리적 경계 왜곡을 해결하는 것은 대규모 가구 폐쇄로 인한 건물 기초 구조물의 공간인지 연구에 중요합니다. 4,5. 복잡한 물체의 간섭을 정확히 제거하고 같은 벽과 바닥의 물리적 연속성을 복원하는 것은 3차원 장면 재구성과 전역공간 논리 분석의 정확도를 직접 결정할 수 있습니다. 대규모 가구 폐쇄로 인한 의미적 불연속성과 제안된 건물 사전 지침의 구조적 수리 효과는 그림 1에 나타났으며, 표 1A의 차단된 적록색 녹색 파란색(RGB) 입력, 그림 1B의 기준선 마스크 왜곡, 그림 1C의 구조 사전 수리 결과가 동일한 실내 장면 조건에서 비교됩니다.
공간 논리 추론의 정확성 요구를 충족하기 위해, 현재의 주류 픽셀 기반 시각 네트워크는 복잡한 실내 환경을 다룰 때 여러 장애물에 직면해 있습니다 7,8. 실내 공간은 종종 빽빽한 가구와 어수선한 가구들로 채워져 있어, 이미지에서 저수준 시각 경계 신호가 크게 손실됩니다. 기존의 특징 추출 메커니즘은 국소적인 2차원 색상 및 질감 반응에 지나치게 의존하며, 3차원 인공 구조의 엄격한 직교 법칙에 대한 거시적 이해가 부족하다10. 국소 수용 필드의 이러한 한계로 인해 특징 전파가 쉽게 중단되어, 전역 위상을 폐쇄11을 넘어 확장하기 어렵다. 현재 폐쇄 및 간섭으로 인한 의미론적 예측 불연속성과 물리적 경계의 심각한 왜곡이라는 핵심 문제를 해결할 긴급한 필요가있습니다.
폐쇄와 간섭으로 인한 건물 기초 구조적 결함을 해결하기 위해 학계는 다양한 목표 지향적 개입 조치를 개발했습니다13. 교차 모달 특징 집계 네트워크는 적-녹-파랑(RGB) 이미지를 돕기 위해 깊이 지도나 텍스트 사전에 도입하여 단일 시각 양식의 공간 인식 내재적 결함을 효과적으로 보완합니다14,15. 경계 지각과 적응적 맥락 선택 프레임워크는 특징 디코딩 단계에 물리적 윤곽 강화 전략을 주입하여, 복잡한 장면에서 예측 결과의 엣지 적합도를 크게 향상시킵니다16,17. GCN과 특징 상호작용 메커니즘을 기반으로 한 추론 모델은 노드 수준 연결을 구성함으로써 동질한 영역에서 특징의 매끄러움과 거시의미 일관성을 크게 향상시킵니다18,19. 명시적인 맨해튼 구조 사전에 시각적 특징 추출 파이프라인을 통합하면 기하학적 일관성 경계가 강제되어, 광범위한 전경 객체 폐쇄로 인한 특징 불연속성 문제를 해결합니다.
건설 인프라와 관련된 의미 예측 오류와 물리적 경계의 심각한 왜곡이라는 핵심 과제를 해결하기 위해, 아키텍처 사전에 포함된 폐쇄 루프 결합 메커니즘을 기반으로 한 의미 구문 분석 프레임워크를 제안합니다. 이 프레임워크는 순진한 공학 파이프라인을 넘어 연속적인 기하학적 퍼텐셜장과 이산적인 시각적 특징 다양체 간의 양방향 매핑 정렬을 확립하여, 구조 법칙을 통해 가림 오류를 수정하는 비자명한 시너지를 형성합니다. 이 방식은 다중 스케일 시각 백본 네트워크와 소사점 추정 기반의 선분간 검출 알고리즘을 사용하여 맨해튼 3D 경계 박스를 병렬로 나타내는 국소 외관 특징과 직교 엣지 사전을 획득한 후 SDF로 변환합니다. 이 알고리즘은 구조 유도 교차 주의 메커니즘을 사용하여 시각적 특징을 쿼리 벡터로 사용하고 SDF 특징을 점곱 계산의 키와 값으로 처리하여 시각적 신호가 특징 공간의 실제 3D 기하학적 경계와 일치하도록 강제합니다. 초픽셀 노드와 공간 평면성 가장자리 특징으로 구성된 공간 인접 그래프가 GCN에 입력되어 노드 간 특징 집계와 메시지 전달을 수행합니다. 종단 간 매개변수 최적화 과정은 픽셀 수준 교차엔트로피와 맞춤형 구조적 일관성 손실 함수를 함께 사용하여 건물 사전 경계를 넘는 예측 픽셀을 엄격히 제한하고 벌점을 적용합니다. 완전한 의미 파싱 파이프라인은 그림 2에 요약되어 있으며, RGB 이미지 입력, 기하학적 사전 추출, 교차 주의 정렬, 슈퍼픽셀 그래프 추론, 의미 마스크 디코딩을 통합된 아키텍처 내에서 연결합니다.
초기 장면 파싱 네트워크는 국소 외관 질감을 포착하기 위해 합성곱 연산에 의존했으나, 국소 수용 필드의 한계로 인해 대규모 표적21,22의 의미적 일관성이 부족했다. 이전 연구들은 시각적 트랜스포머 아키텍처의 자기 주의 모듈을 적용하여 전 세계 맥락 정보를 추출하고 장거리 픽셀 연관 특징을 구성했습니다23,24. 크로스 모달 다중 뷰 특징 집계 전략은 깊이지도 포인트 클라우드와 텍스트 명령 입력25,26을 융합하여 장면의 3차원 기하학적 공간 특징을 추출합니다. 특정 도메인을 표적으로 하는 특징 융합을 위한 하이브리드 주의 메커니즘은 점차 성숙해져 왔습니다. 특징 상호작용 다리를 구축함으로써 시각 신호의 다중 스케일 전송에서 에너지 손실과 특징 희소성을 크게 줄였으며, 복잡한 구조 구문 분석의 견고성을 향상시켰습니다. 최첨단 인코더 설계는 고주파 영역 공간 세부사항을 전역 및 국소 특징과 함께 통합하고 추론하여, 네트워크가 높은 유사성을 가진 세밀한 의미 범주를 구분하는 능력을 강화하고 실내 구문 정확도를 향상시킵니다27,28. 최근 의미 분할 아키텍처의 발전은 계산 효율성과 공간 인식을 최적화하는 데 귀중한 참고 자료를 제공합니다. 조밀한 예측과 다중 규모 맥락 집계를 위해 설계된 모델은 복잡한 배경에서 세밀한 기하학적 특징을 추출합니다. 특징 분리와 시너지 융합 전략은 경계 영역의 의미적 모호성을 해결합니다. 경량 주의 메커니즘과 게이트 집계 모듈은 매개변수 분포를 최적화하여 추론을 가속화하면서 국소 구조적 세부사항을 유지합니다. 이러한 효율적인 아키텍처 설계를 구현함으로써 실내 씬 파싱에서 비유클리드 위상 추론 연산의 계산 오버헤드를 줄이는 이론적 지침을 제공합니다.
건물 구조 사전과 3D 배치 추정을 사용하여 국소 시각적 구문 오류를 수정합니다29. 이전 연구들은 실내 건물의 직교 및 평행 기하학적 특징을 추론 제약 조건으로 추출하여 혼잡한 실내 배경으로 인한 네트워크 예측 편향을 줄였습니다30,31. 기존 방식은 선분간 탐지 알고리즘과 이미지 제거점 분석 기법을 사용하여 맨해튼 3D 경계 박스를 생성하여 방의 물리적 경계를 매핑하고 기본시각적 특징의 위치 파악을 돕습니다. 경계 인식 모듈과 다중 규모 맥락의 공동 아키텍처는 고차원 특징 디코딩 과정에 이전 구조 정보를 암묵적으로 내장하여, 네트워크가 실제 물리적 윤곽선과 매우 일치하는 의미 마스크를 출력하도록 강제하여 객체 가장자리의 톱니 모양과 흐림을 효과적으로 개선합니다33. 경계 증강 특성을 가진 반지도 또는 약한 감독 손실 함수 설계가 널리 탐구되어 왔습니다. 공간적 위상 규칙을 위반하는 독립적인 픽셀 분류 행동을 처벌하기 위해 엄격한 수학적 공식에 의존하여, 최종 분할 결과의 기하학적 매끄러움과 구조적 완전성은 기울기 최적화34의 출처로부터 보장된다.
일부 연구에서는 그래프 신경망을 사용하여 시각적 특징의 교차 영역 집계와 고차원 공간에서의 위상 관계에 대한 추론을 수행했습니다. 슈퍼픽셀 세분화 알고리즘은 유사한 색상 반응과 텍스처 특성을 가진 인접한 픽셀 블록들을 독립적으로 연결된 노드로 사전 집계합니다. 슈퍼픽셀 세분화 알고리즘은 이미지 수준에서 그래프 구조의 계산 중복성을 압축하여 이미지36의 기본 기하학적 위상을 보존합니다. GCN은 고차원 노드 특징 벡터를 기반으로 하며, 공간적 근접성을 나타내는 인접 행렬은 공간도메인 37,38의 물리적 연결 그래프를 따라 다중 스케일 시각 정보를 효율적인 방향 전송과 상호작용 융합을 이끕니다. 시간 정보 향상 모듈과 하이브리드 다중 스케일 스킵 연결 메커니즘의 적용은 다층 딥메시지 전달 과정에서 발생하는 노드 특징의 과도한 평활화와 균질화를 억제합니다. 다중 스케일 그래프 웨이블릿 변환 기술과 의사 라벨 요소 학습 최적화 전략은 노드 특징 업데이트 공식의 배경 잡음 방지 메커니즘을 최적화하여 동일한 의미 속성을 가진 특징들이 복합 네트워크 토폴로지40에서 협력적 반응 모드를 유지하도록 합니다. 그래프 기반 추론 메커니즘은 정칙 픽셀 격자를 비유클리드 위상 공간에 매핑하여 불규칙한 건물 구조와내부 구성 요소의 특징 집계 계산을 수행합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
네트워크 훈련 전에 실내 RGB 장면 데이터셋과 그 의미 주석을 준비했습니다. 대규모 실내 3D 데이터셋과 RGB-D 실내 장면 데이터셋(재료표 참조)은 공식 저장소에서 수집되었습니다. 가구 가림, 조명 변화, 벽 경계 중단, 복잡한 공간 배치를 포함한 실내 획득 장면은 목표 구문 분석 시나리오에 맞게 유지되었습니다. 의미 라벨은 인덱스 단일 채널 PNG 주석 마스크로 변환되었고, 모든 RGB 이미지와 의미 마스크는 512 × 512 픽셀로 크기 조정되었습니다. 훈련 중 온라인 데이터 증강이 적용되었으며, 무작위 수평 반전(확률 0.5), 밝기 0.8에서 1.2 사이의 무작위 스케일링, 그리고 −10°에서 +10° 사이의 무작위 회전을 통해 구조 배치 분포를 넓혔습니다. RGB 채널은 평균 값 0.485, 0.456, 0.406과 표준편차 0.229, 0.224, 0.225로 정규화되었습니다. 대규모 실내 3D 벤치마크는 이 연구에서 공식적으로 사용된 1201개의 훈련 장면과 312개의 모델 개발 및 검증 장면을 포함한 공식 배포 구분을 따랐습니다. RGB-D 실내 장면 벤치마크는 공식 평가 프로토콜을 따랐으며, 795장의 훈련 이미지와 654장의 테스트 이미지가 포함되었습니다. 이 두 공공 기준점에는 추가적인 백분율 분배가 적용되지 않았습니다.
이동 윈도우 계층적 트랜스포머 시각 백본 네트워크(재료표 참조)가 무빙 윈도우 트랜스포머 인코더 백본으로 초기화되었습니다. 패치 임베딩 크기는 4 x 4 픽셀로 구성되었습니다. 네 단계의 임베딩 치수는 128, 256, 512, 1024로 설정되었고, 네 단계의 변압기 블록 수는 2, 2, 18, 2로 설정되었습니다. 로컬 주의 창 크기는 7 x 7로 설정되었고, 네 단계별 주의 머리 수는 4, 8, 16, 32로 설정되었습니다. 비선형 연속 활성화 함수는 모든 다층 인식론 계층 내에서 사용되었습니다. 공간 다운샘플링은 각 계층적 단계 후 2단계의 스트라이드로 구성된 패치 병합 작업을 통해 수행되었습니다. 핵심 네트워크 아키텍처와 합성곱 추론 모듈의 하이퍼파라미터는 표 1에 요약되어 있습니다.
이후 입력된 특징 지도에 대해 시프트 윈도우 자기 주의 특징 추출이 수행되었습니다. 각 특징 지도는 공간 차원이 7× 7인 겹치지 않는 지역 창으로 나뉘었습니다. 정기적인 창문 응시와 이동 창 응시는 인접한 이동 창 변압기 블록 간에 교대로 배치되었습니다. 순환 이동 거리는 3픽셀로 설정되었고, 각 국소 주의 창 내에 상대 위치 편향 인코딩이 적용되었습니다. 국소 시각적 특징들은 다중 헤드 자기 주의를 통해 집계되어 계층적이고 다중 규모의 특징 표현을 생성했습니다.
맨해튼 구조 사전에 실내 RGB 이미지에서 추출되었습니다. 구조적 가장자리 세그먼트는 그라디언트 방향-일관성 선분 검출 알고리즘을 사용하여 검출되었습니다. 지배적인 구조 방향은 소변점 추정을 기반으로 한 무작위 표본 합의(RANSAC) 알고리즘(재료표 참조)을 통해 군집화되었습니다. 세 개의 상호 직교 맨해튼 방향을 재구성하여 맨해튼 3D 경계 상자 표현을 생성했다. 재구성된 구조 경계는 각 픽셀에서 가장 가까운 경계선 구간까지의 최소 유클리드 거리를 계산하여 SDF 지도로 변환되었습니다.
구조 유도 교차 주의 특징은 시각적 특징과 SDF 사전 측정이 완료된 후에 생성되었습니다. 시각적 특징 다양체는 이중 타격 캡 R의 선형 변환 행렬 W sub Q 원소를 통해 이중타석 캡 R
의 구성 행렬 W sub Q 원소를 통해 쿼리 텐서 Q에 대응되었다. 연속 거리장 사전에 변환 행렬
를 통해 키 텐서 K와 값 텐서 V에 대응되었고, 모델 차원은 512로 설정되었다. 다중 헤드 변조는 투영 공간을 8개의 독립적인 부분공간으로 나누었으며, 각 헤드의 차원은 64입니다. 공간 배치는 이전에 이산 픽셀 좌표를 연속 퍼텐셜 필드로 투영하고, 점곱 유사도 행렬을 변조하기 위한 명시적 가산 공간 편향으로 구조적 친화도 행렬 S를 생성했습니다. 시맨틱 파싱은 각 시각적 위치가 기하학적 사전 공간에서 구조적으로 일관된 증거를 적극적으로 가져오도록 요구하기 때문에 시각적 특징 텐서가 쿼리 소스로 사용되었습니다. SDF 이전은 맨해튼 레이아웃에서 파생된 연속적인 경계 거리와 내부-외부 구조 단서를 저장하기 때문에 핵심 및 가치 출처로 사용되었습니다. 점곱 항은 의미론적 외관과 기하학적 사전의 호환성을 측정했고, 가산적 구조 항 λS는 동일한 물리적 평면이나 거의 같은 건축 윤곽선 근처의 픽셀에 주의 가중치를 이동시켰다. 계수 λ는 추출된 구조적 사전에 대한 신뢰도를 나타내며, 강직교 제약이 주의 분포에 얼마나 포함되는지 조절했다. 이 공식은 가구 폐쇄로 인한 경계 교차 특징 확산을 줄이고 비 맨해튼 레이아웃에서도 적응적 이완을 유지했습니다. 구조 유도 주의 분포는 방정식 1에 따라 계산되었습니다.
방정식 1: 
여기서 A는 구조 유도 주의 집계 행렬, Q는 시각적 특징에서 생성된 쿼리 텐서, K는 SDF 사전 특징에서 생성된 키 텐서, V는 구조적 사전 표현에서 생성된 값 텐서, dk는 키 텐서의 특징 차원, λ는 국소 영역의 기하학적 신뢰도를 식별하고 비맨해튼 공간에서 강직교 제약을 완화하는 데 사용되는 적응형 구조 가중 계수를 나타냅니다 레이아웃을 나타내며, S는 SDF 친화도 행렬을 나타냅니다. dk로 나누어짐은 주의 로그트의 척도를 안정화시키고 큰 지형 차원이 과도하게 집중된 주의 가중치를 생성하는 것을 방지했다. 정규화된 지수 함수(재료표 참조)는 변조된 유사도 점수를 정규화된 공간 분포로 변환하여 각 픽셀이 의미론적 및 기하학적 일관성에 기반해 구조적 사전 정보를 집계할 수 있게 했습니다. 이 설계는 시각적 외관과 건축적 경계 선행이 직접적인 특징 연결이 아니라 주의 수준에서 융합되는 이유를 설명한다.
슈퍼픽셀 위상 그래프는 구조 정렬된 특징 지도에서 구성되었습니다. 특징 지도는 공간 영역 생성 알고리즘을 사용하여 분할되었습니다. 슈퍼픽셀 수는 256, 집약성 계수는 10, 가우시안 평활 계수는 1.0, 반복 횟수는 10으로 설정되었습니다. 군집화 시 거리 메트릭 가중치를 특징 색-공간 거리의 1.0 비율로 고정하여 밀도가 높은 클러터 경계에서 균일한 노드 생성을 유지함으로써 공간적 근접성 제약 조건을 강제했습니다. 동종 의미론 응답을 가진 픽셀들은 슈퍼픽셀 노드로 집계되었습니다. 그래프 간선은 공간적 인접 관계, SDF 친화도, 그리고 공평면 기하학적 일관성 제약에 따라 구성되었습니다. 구조적 친화도 행렬과 위상 연결성의 구성 과정은 그림 3에 나타나 있으며, SDF 가이던스가 그래프 수준의 공간적 관계로 어떻게 변환되었는지를 보여줍니다.
그래프 공식화는 조밀한 픽셀 단위 추론을 동질한 구조 영역 위의 노드별 공간 추론으로 변환하기 위해 도입되었습니다. 각 슈퍼픽셀 노드는 유사한 의미 응답과 공간적 연속성을 가진 로컬 영역을 나타내며, 각 엣지는 인접성, 거리-장 친화성, 공평면 일관성 제약 조건에 따라 특징 전송을 위한 신뢰할 수 있는 경로를 나타냈습니다. 이 설계는 고립된 잡음 픽셀의 영향을 줄이고, 가려진 벽, 바닥, 천장 영역이 물리적으로 인접한 노드로부터 메시지를 받을 수 있게 했습니다. 따라서 간선 구성은 연속 SDF 유도와 이산 비유클리드 그래프 추론 사이의 수학적 다리 역할을 했다.
3층 그래프 합성곱 추론 네트워크가 512, 256, 128의 숨겨진 특징 차원으로 구성되었습니다. 그래프 컨볼루션 계층은 노드의 공간적 관계를 기반으로 그래프 구조에 특징 평활화를 수행했습니다. 자기 루프 인접은 메시지 전달 시 각 노드의 원래 상태를 유지하여, 작은 구조 영역의 특징이 주변 큰 영역에 의해 지워지는 것을 방지했습니다. 대칭 정규화는 인접 행렬 요소를 노드 차수의 역제곱근의 곱으로 스케일링하여 높은 차수 노드와 저차 노드가 전파 중 유사한 수치 크기 아래에서 기여하도록 했습니다. 피드포워드 전파는 국소화된 공간 집계를 수행했으며, 각 노드 상태가 인접한 공평면 클러스터의 고차원 특징을 흡수한 후 원소별 비선형 정류 함수를 적용했습니다. 이 공식화는 그래프 컨볼루션 층이 무관한 객체의 경계를 무제한적으로 평활화하는 대신 물리적으로 의미 있는 실내 평면을 따라 의미론적 확산을 근사하도록 만들었습니다. 그래프 노드 특징은 방정식 2에 따라 평가되었습니다.
식2: 
조밀한 픽셀 특징에서 초픽셀 노드로의 투영, 그래프 합성 메시지 전달, 좌표 백투사는 그림 4에 제시되어 정규 이미지 격자에서 비유클리드 위상으로, 그리고 다시 조밀한 의미론 표현으로의 특징 집계 경로를 명확히 합니다. 그림 4A 의 조밀한 픽셀 특징에서 그림 4B의 슈퍼픽셀 노드로의 투영, 그림 4C의 그래프 합성곱 메시지 전달, 그리고 그림 4D 의 좌표 후복투사는 정칙 이미지 격자에서 비유클리드 위상으로, 그리고 다시 조밀한 의미론적 표현으로의 특징 집계 경로를 명확히 합니다.
여기서 H(l)는 l번째 그래프 합성곱층의 노드 특징 텐서를 나타내고, Â는 자기 루프 연결을 가진 인접 행렬을, D는 인접 행렬에 해당하는 차수 행렬을, W(l)는 l번째 그래프 합성곱 층의 학습 가능한 가중 행렬을, σ는 정정 선형 단위 활성화 함수를 나타냅니다. ÂH(l)라는 용어는 인접한 슈퍼픽셀 노드의 특징을 집계한 반면, D−1/2 와 D−1/2 는 서로 다른 연결 밀도를 가진 노드들의 기여를 균형 있게 표현했습니다. 학습 가능한 행렬 W(l)는 집계된 노드 특징들을 새로운 의미 공간에 투영하여, 그래프 계층이 구조적 일관성과 일반 공간적 근접성을 구분할 수 있게 했습니다. 비선형 활성화는 특징 집계 후 공평면과 비공면면 영역 간 반응 차이를 보존했다.
의미 분할 특징은 그래프 추론 후 해독되었습니다. 디코더는 세 개의 바이리니어 보간 업샘플링 단계와 크로스 레이어 스킵-커넥션 융합 연산을 사용하여 구성되었습니다. 얕은 공간 인코더 특징들은 채널별 융합을 통해 고수준 의미 디코더 기능과 결합되었습니다. 특징 해상도는 원래 이미지 크기로 복원되었고, 최종 의미론적 확률 예측 맵은 1 × 1 합성곱 층을 통해 생성되었습니다.
전체 의미 파싱 네트워크는 분리된 가중치-붕괴 최적화 장치를 사용해 학습되었습니다(재료 표 참조). 초기 학습률은 두 공개 벤치마크 모두 0.0001, 가중치 감쇠 계수는 0.01, 배치 크기는 8로 설정되었습니다. 첫 번째 모멘트 붕괴율은 0.9, 두 번째 모멘트 붕괴율은 0.999, 수치 안정성 엡실론 계수는 1 × 10⁻8로 설정되었습니다. 검증 손실은 각 에포크 말에 모니터링되었고, 검증 세트의 mIoU가 증가하면 체크포인트가 저장되었습니다. 네트워크는 0.9의 감쇠 능력인 다항식 학습률 감쇠 전략을 사용하여 300 에포흐를 훈련시켰습니다. 통계적으로 엄격한 평가 기준선을 설정하기 위해 다섯 번의 독립 학습 실행이 서로 다른 무작위 시드 초기화를 사용했습니다. 네트워크는 픽셀 수준의 교차엔트로피 손실과 구조적 일관성 손실을 사용하여 공동 최적화되었습니다. 모든 실험은 고메모리 병렬 컴퓨팅 하드웨어가 장착된 컴퓨팅 플랫폼에서 수행되었으며, 상세한 하드웨어 정보는 재료표에 보고되었습니다.
공동 최적화는 클래스 확률 텐서의 공간적 기울기 크기를 계산하여 기하학적 경계 정렬을 강제했습니다. 구조적 일관성 손실은 공간 예측 구배의 노름에 연속 SDF 값으로 곱하는 규칙화 변수로 사용되었습니다. 수학적 논리는 의미 범주 변화가 실제 건축 윤곽선 근처, 즉 SDF가 0에 근접하는 곳에 집중되어야 하며, 평평한 벽, 바닥, 천장 내부는 부드러운 의미론적 반응을 유지해야 한다는 것이었습니다. 큰 예측 기울기가 구조 경계에서 멀리 떨어져 나타날 때, 거리장 항은 페널티를 증가시키고 균질 물리적 평면 내에서 거짓 의미 전이가 발생하는 것을 억제했다. 예측 기울기가 0거리 등고선 근처에서 나타났을 때, 벌칙은 제한적이었고 건축적 경계를 따라 정당한 클래스 전이를 보존했다. 의미 전이 영역은 방정식 3에 의해 주어진 SDF의 0거리 윤곽선에 맞춰 제약을 받았습니다.
식의 3: 
여기서 Ltotal 은 최종 최적화 목적 함수를, Lce 는 픽셀 수준 교차 엔트로피 손실을, Lscl 은 구조적 일관성 페널티 손실을, α는 구조적 손실 가중 계수를 나타냅니다. 교차 엔트로피 항은 주석 마스크를 통해 픽셀 수준의 의미 감독을 제공했고, 구조적 일관성 항은 아키텍처 사전에 기하학적 정규화를 부과했습니다. 가중 계수는 범주 인식과 경계 정렬을 균형 있게 α하여 최적화가 지역 라벨 정확도나 강직한 구조적 윤곽선을 과적합하는 것을 방지합니다. 이 공동 목표는 시각적 의미론, 물리적 경계 일관성, 학습 가능한 네트워크 매개변수를 통합된 최적화 대상 내에서 연결했습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
실험 장치
이 연구는 대규모 실내 3D 데이터셋과 RGB-D 실내 씬 데이터셋 두 가지를 사용하여 성능을 평가하고 모델을 조정했습니다. 대규모 실내 3D 데이터셋은 현실적으로 스캔된 복잡한 물리적 공간 장면과 고해상도 RGB 뷰를 포함하고 있어, 픽셀 단위의 고정밀 3D 점군 의미 라벨과 2D 공간 투영 분할 마스크를 제공합니다. 본질적으로 현실적인 물리적 공간 격자 재구성 데이터와 직교 평면 특성은 추출 분기에서 맨해튼 3D 경계 상자를 정확히 구성할 수 있는 기하학적 진리 비교 기준을 설정합니다. RGB-D 실내 장면 데이터셋은 가구와 잡동사니에 가려진 실내 깊이 이미지를 포함하며, 네트워크의 전역 논리적 추론 정확성과 오클루즈에 대한 견고성을 테스트하는 데 사용됩니다.
이 알고리즘은 mIoU를 사용하여 예측된 의미 분포와 진정한 의미 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 논문의 알고리즘은 시프트 윈도우 계층형 트랜스포머 인코더가 포착한 계층적 시각적 특징과 선분간 검출로 생성된 맨해튼 3D 경계 박스의 선행 깊이를 긴밀하게 결합하여, 복잡한 실내 장면의 고정밀 의미론적 재구성을 달성합니다. 구조 유도 교차 주의 메커니즘은 시각 신호를 SDF가 보정한 실제 기하학적 경계와 일치하도록 강제하여, 국소적으로 가려진 영역42의 저층 지형의 연속성을 복원합니다. 위상 그래프는 반복적인 국소 클러스터링 알고리즘으로 생성된 슈퍼픽셀 노드를 사용하여 구성되며, 이는 GCN이 물리적 동면적 제약 조건 하에서 특징 집계를 수행하도록 유도하여 거시적 의미 분포43의 일관성을 보장합니다. 실험 결과는 이 방법이 합집합 비율 간 평균 교차 비율을 68.7%로 달성하며 표준편차 0.2%를 달성하며, 실용적인 공학 값, 구조 경계 F1 점수 76.4%, 표준편차 0.3%, ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 재정적 이해 충돌이 없다고 선언합니다.
자금 지원: 산시 핵심 연구개발 프로그램 (프로그램 번호 2024CY2-GJHX-76).
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| AdamW optimizer | PyTorch Contributors | https://pytorch.org/ | |
| CCANet | Zihao Z. et al. | https://doi.org/10.1109/TCDS.2024.3455356 | |
| CMPFFNet | Zhou W. et al. | https://doi.org/10.1109/TASE.2023.3332021 | |
| ConvNeXt | Meta AI Research | https://github.com/facebookresearch/ConvNeXt | |
| InternImage | OpenGVLab | https://github.com/OpenGVLab/InternImage | |
| Mask2Former | Meta AI Research | https://github.com/facebookresearch/Mask2Former | |
| MaskDINO | IDEA-Research | https://github.com/IDEA-Research/MaskDINO | |
| NYUv2 | http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html | ||
| OneFormer | SHI Labs | https://github.com/SHI-Labs/OneFormer | |
| RANSAC algorithm | scikit-learn developers | https://scikit-learn.org/ | |
| ScanNet V2 | http://www.scan-net.org/ | ||
| SegFormer | NVIDIA | https://github.com/NVlabs/SegFormer | |
| SGCA_GCN | Authors of this study | Proposed method (N/A) | |
| Softmax function | PyTorch Contributors | https://pytorch.org/ | |
| Swin Transformer | Microsoft Research | https://github.com/microsoft/Swin-Transformer |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.