Перед сетевым обучением были подготовлены наборы данных по RGB-сценам и их семантические аннотации. Крупномасштабный 3D-набор данных для внутренних помещений и RGB-D по внутренним сценам (см. Таблицу материалов) были получены из их официальных репозиториев. Сцены приобретения внутри помещений, включающие окклюзию мебели, вариации освещения, прерывание границ стен и сложные пространственные планировки, были сохранены для соответствия сценарию парсинга целей. Семантические метки были преобразованы в индексированные одноканальные PNG-аннотационные маски, а все RGB-изображения и семантические маски были изменены до 512 × 512 пикселей. Онлайн-дополнение данных применялось во время обучения: случайное горизонтальное переворот с вероятностью 0,5, случайное масштабирование яркости от 0,8 до 1,2 и случайное вращение между −10° и +10° для расширения структурного распределения. RGB-каналы были нормализованы со средними значениями 0,485, 0,456 и 0,406 и стандартными значениями отклонения 0,229, 0,224 и 0,225. Крупномасштабный внутренний 3D-бенчмарк последовал за официальным разделом релизов, использованным в этом исследовании: 1201 обучающая сцена и 312 валидационных сцен для разработки и валидации моделей. Бенчмарк RGB-D в помещении прошёл по официальному протоколу оценки: 795 обучающих и 654 тестовых изображений. Дополнительное процентное разделение не применялось к этим двум публичным ориентирам.
Визуальная магистральная сеть трансформатора с сдвинутым окном (см. Таблицу материалов) была инициализирована как магистраль кодера трансформатора с движущимися окнами. Размер вложения патча был настроен как 4 x 4 пикселя. Размеры вложения четырёх иерархических ступеней были установлены как 128, 256, 512 и 1024, а количество трансформаторных блоков в четырёх ступенях — 2, 2, 18 и 2. Размер локального окна внимания был установлен на 7 x 7, а количество головок внимания — 4, 8, 16 и 32 для четырёх иерархических этапов. Нелинейные функции непрерывной активации использовались во всех многослойных слоях перцептронов. Пространственное понижение дискретизации осуществлялось с помощью операций патч-слияния шагом 2 после каждого иерархического этапа. Архитектура ядра сети и гиперпараметры модуля сверточного вывода были обобщены в таблице 1.
Затем на входных картах выполнялась извлечение объектов с сдвиговым окном самовнимания. Каждая карта объектов была разделена на неперекрывающиеся локальные окна с пространственными размерами 7 × 7. Регулярное внимание окон и сдвигаемое внимание чередовались между соседними блоками трансформаторов с сдвинутыми окнами. Циклическое расстояние смещения было установлено на 3 пикселя, и в каждом локальном окне внимания применялось кодирование относительного позиционного смещения. Локальные визуальные особенности агрегировались с помощью многоголового самовнимания для создания иерархических, многомасштабных представлений признаков.
Структурные априоры Манхэттена были извлечены из RGB-изображений в помещении. Структурные сегменты кромки были обнаружены с помощью алгоритма определения линейных сегментов с уклоном и согласованностью градиента. Доминирующие структурные направления были сгруппированы с помощью алгоритма случайного консенсуса выборки (RANSAC) (см. Таблицу материалов) на основе оценки нуляющей точки. Три взаимно ортогональных направления Манхэттена были реконструированы для создания представления Манхэттенского трёхмерного ограничивающего ящика. Восстановленная структурная граница была преобразована в SDF-отображение путём вычисления минимального евклидового расстояния от каждого пикселя до ближайшего отрезка пограничной линии.
Структурно-ориентированные признаки перекрёстного внимания создавались после получения визуальных признаков и априоров SDF. Визуальное многообразие признаков отображалось в тензор запроса Q через линейную матрицу преобразования W sub Q элемента двойного удара R в матрицу формации W sub Q элемента двойного удара R в матрицу
формации . Непрерывное поле расстояний перед отображалось в ключевой тензор K и тензор значений V через матрицы
преобразования , а размерность модели была установлена в 512. Многоголовая модуляция делила проекционное пространство на 8 независимых подпространств, каждая из которых имела размерность 64. Пространственное расположение перед проектированием дискретных пиксельных координат в непрерывное потенциальное поле и генерировало структурную матрицу сродства S как явное аддитивное пространственное смещение для модуляции матрицы сходства с точечным произведением. Визуальный тензор признаков использовался в качестве источника запроса, поскольку семантический разбор требует от каждого визуального места активно извлекать структурно согласованные доказательства из геометрического априорного пространства. SDF prior использовался в качестве ключа и источника ценности, поскольку он хранит непрерывное расстояние границ и внутренние структурные сигналы, заимствованные из манхэттенской планировки. Термин с точным произведением измерял совместимость между семантическим видом и геометрическим априором, тогда как аддитивный структурный член λS смещал веса внимания в сторону пикселей на той же физической плоскости или близко к тому же архитектурному контуру. Коэффициент λ отражал доверие к извлеченному структурному априору и контролировал, насколько жёсткие ортогональные ограничения были включены в распределение внимания. Эта формула снизила диффузию пограничных признаков, вызванную окклюзией мебели, и сохранила адаптивную релаксацию в планировках вне Манхэттена. Распределение внимания, управляемое структурой, было рассчитано согласно уравнению 1.
Уравнение 1: 
где A обозначает структурно ориентированную матрицу агрегации внимания, Q — тензор запроса, генерируемый визуальными признаками, K — ключевой тензор, порождённый априорными признаками SDF, V — тензор значений, порождённый структурными априорными представлениями, dk — размерность признаков ключевого тензора, λ — адаптивный структурный коэффициент веса, используемый для идентификации геометрической уверенности локальных областей и ослабления жёстких ортогональных ограничений в не-манхэттенском пространстве макетов, а S обозначает матрицу аффинности SDF. Деление на dk стабилизировало масштаб логиков внимания и предотвратило создание чрезмерно концентрированных весов внимания крупными размерами. Нормализованная экспоненциальная функция (см. Таблицу материалов) преобразовывала модулированные оценки сходства в нормированное пространственное распределение, позволяя каждому пикселю агрегировать структурную априорную информацию на основе семантической и геометрической согласованности. Этот дизайн объясняет, почему визуальный облик и априоры архитектурных границ объединены на уровне внимания, а не прямой конкатенацией признаков.
Граф топологии суперпикселей был построен на основе структурно-выровненной карты признаков. Карта объектов была сегментирована с помощью алгоритма генерации пространственных регионов. Число суперпикселя было установлено на 256, коэффициент компактности — на 10, коэффициент сглаживания по Гауссу — на 1,0, а число итераций — на 10. Ограничения на пространственную близость обеспечивались за счёт установки массового веса расстояния на постоянное отношение 1,0 к расстоянию между цветовым пространством признаков во время кластеризации, что сохраняло равномерную генерацию узлов на плотных границах помех. Пиксели с однородными семантическими ответами агрегировались в суперпиксельные узлы. Рёбра графов строились с учётом пространственных смежных отношений, силы аффинности SDF и копланарных геометрических согласованных ограничений. Процесс построения структурной матрицы аффинности и топологической связности показан на рисунке 3, где показано, как руководство SDF было преобразовано в пространственные отношения на уровне графов.
Формулировка графов была введена для преобразования плотных пиксельных рассуждений в пространственное мышление по узлам по однородным структурным областям. Каждый узел суперпикселя представлял локальную область с аналогичным семантическим откликом и пространственной непрерывностью, а каждое ребро представляло собой надёжный путь передачи признаков с учётом смежности, аффинности расстояния и поля и копланарной согласованности. Такая конструкция снижала влияние изолированных шумных пикселей и позволяла закрытым зонам стен, пола и потолка получать сообщения от физически соседних узлов. Конструкция рёбер, таким образом, служила математическим мостом между непрерывным наведением SDF и дискретным неевклидовым графовым рассуждением.
Была сконфигурирована трёхслойная графовая сверточная сеть с скрытыми размерами признаков 512, 256 и 128. Графовый сверточный слой выполнял сглаживание признаков по структуре графа на основе пространственных отношений узлов. Смежность с самопетлями сохраняла исходное состояние каждого узла при передаче сообщений, предотвращая стирание особенностей небольшой структурной области окружающими большими областями. Симметричная нормализация масштабировала элементы матрицы смежности на произведение обратных квадратных корней степеней узлов, так что узлы высокой и низкой степени вносили вклад при сопоставимых числовых величинах во время распространения. Прямое распространение осуществляло локализованную пространственную агрегацию, при которой каждое состояние узла поглощало высокомерные особенности из соседних копланарных кластеров до применения функции нелинейного выпрямления по элементам. Эта формулировка делала слой свёртки графа приближённым к семантической диффузии вдоль физически значимых внутренних плоскостей, а не к неограниченному сглаживанию по границам несвязанных объектов. Признаки узлов графа оценивались согласно уравнению 2.
Уравнение 2: 
Проекция от плотных пиксельных признаков к суперпиксельным узлам, передача сообщений с графовой свёрткой и координатная обратная проекция представлены на рисунке 4, что уточняет путь агрегации признаков от регулярных сеток изображений к неевклидовой топологии и обратно к плотному семантическому представлению. Проекция от плотных пиксельных особенностей на рисунке 4A на суперпиксельные узлы на рисунке 4B, передача сообщения с графовой свёрткой на рисунке 4C и координатная обратная проекция на рисунке 4D проясняют путь агрегации признаков от регулярных сеток изображений к неевклидовской топологии и обратно к плотному семантическому представлению.
где H(l) обозначает тензор признаков узлов слоя свёртки l-го графа, Â — матрицу смежности с самопетляционными соединениями, D — матрицу степеней, соответствующую матрице смежности, W(l) — обучаемую матрицу весов слоя свёртки l-го графа, а σ — функцию активации ректифицированной линейной единицы. Термин ÂH(l) объединял признаки соседних суперпиксельных узлов, тогда как D−1/2 и D−1/2 уравновешивали вклад узлов с разной плотностью соединений. Обучаемая матрица W(l) проецировала агрегированные узловы в новое семантическое пространство, позволяя графовому слою отличать структурную согласованность от обычной пространственной близости. Нелинейная активация сохраняла разницу в ответах между копланарными и некопланарными областями после агрегации признаков.
Особенности семантической сегментации декодировались после рассуждения на основе графов. Декодер был построен с использованием трёх этапов билинейной интерполяции и операций синтеза с пропуском соединения между слоями. Поверхностные пространственные признаки кодировщика были объединены с высокоуровневыми семантическими декодерами посредством канального синтеза. Разрешение признаков было восстановлено до исходного размера изображения, а окончательная семантическая карта вероятностного прогнозирования была сгенерирована через слой свёртки 1 × 1.
Вся семантическая сеть парсинга была обучена с помощью разъединённого оптимизатора затухания веса (см. Таблицу материалов). Начальная скорость обучения была установлена на уровне 0,0001, коэффициент затухания веса — 0,01, а размер партии — 8 для обоих публичных бенчмарков. Скорость затухания первого момента была установлена на 0,9, во втором — на 0,999, а коэффициент эпсилона численной устойчивости — на 1 × 10⁻8. Потеря валидации отслеживалась в конце каждой эпохи, а контрольные точки сохранялись при увеличении mIoU на валидационном наборе. Сеть была обучена для 300 эпох с использованием стратегии затухания скорости полиномиального обучения с степенью затухания 0,9. Было проведено пять независимых обучающих запусков с использованием различных инициализаций случайного засея для установления статистически строгой базы оценки. Сеть была совместно оптимизирована с использованием потери кросс-энтропии на уровне пикселей и потери структурной согласованности. Все эксперименты проводились на вычислительной платформе, оснащённой аппаратным обеспечением для параллельных вычислений с высокой памятью, а подробная аппаратная информация была представлена в Таблице материалов.
Совместная оптимизация обеспечивала геометрическое выравнивание границ путём вычисления пространственной градиентной величины тензора вероятности класса. Потеря структурной согласованности использовалась как регуляризатор, умножая норму пространственных градиентов предсказания на непрерывные значения SDF. Математическое обоснование заключалось в том, что изменения семантических категорий должны сосредоточиться вблизи реальных архитектурных контуров, где SDF приближается к нулю, в то время как плоские стены, полы и потолочные интерьеры должны сохранять плавные семантические реакции. Когда большой градиент предсказания появлялся далеко от структурной границы, член поля расстояния увеличивал штраф и препятствовал ложным семантическим переходам внутри однородной физической плоскости. Когда градиент прогноза появлялся близко к нулевой линии, штраф оставался ограниченным и сохранял законные переходы классов вдоль архитектурных границ. Семантические переходные области были ограничены так, чтобы они совпадали с нулевой дистанцией SDF, как указано в уравнении 3.
Уравнение 3: 
где Ltotal обозначает конечную функцию оптимизации,L ce — потерю на уровне пикселей на перекрестной энтропии, Lscl — штрафные потери структурной согласованности, а α — коэффициент веса структурных потерь. Термин кросс-энтропии обеспечивал семантический надзор на уровне пикселей с помощью аннотационных масок, тогда как термин структурной согласованности навязывал геометрическую регуляризацию с использованием архитектурных априоров. Коэффициент веса α сбалансированное распознавание категорий и выравнивание границ, предотвращая перенагонку в оптимизации как локальной точности маркировки, так и жёстких структурных контуров. Эта совместная цель связала визуальную семантику, физическую согласованность границ и обучаемые параметры сети в рамках единой цели оптимизации.