Экспериментальная установка
В этом исследовании использовались два стандартных набора данных по разбору сцен в помещении — крупномасштабный 3D-набор для внутренней и RGB-D набор данных для внутренней сцены — для оценки производительности и настройки модели. Крупномасштабный внутренний 3D-набор данных содержит реалистично сканируемые, сложные сцены физического пространства и высококачественные RGB-виды, обеспечивая высокоточные пиксельно-пиксельные 3D-семантические метки точечного облака и 2D пространственно-проекционные сегментационные маски. Её по своей сути реалистичные данные реконструкции сетки в физическом пространстве и свойства ортогональной плоскости устанавливают критерий сравнения геометрической истинности для точного построения 3D-ограничивающего ящика Манхэттена в ветке экстракции. Набор данных RGB-D по внутренней сцене содержит глубинные изображения внутри помех, скрытые мебелью и мусором, и используется для проверки глобальной точности логического мышления и устойчивости сети к окклюзиям.
Алгоритм использует mIoU для измерения пространственного перекрытия между предсказанным и истинным семантическим распределениями, а также вводит структурную граничную оценку F1 для строгой оценки точности соответствия между предсказанной маской и рёбрами физической структуры с нулевым расстоянием, откалиброванными SDF. Фиксированный порог ошибки расстояния пикселей в евклидовом пространстве устанавливается при вычислении, чтобы определить, пересекают ли пиксели краёв, создаваемые сетью, истинные физические границы зданий. Эта система двойной оценки ограничивает ошибки классификации в семантических блоках больших площадей, одновременно усиливая микроколичественную оценку эффекта топологической реконструкции жёстких линий. Для поддержания согласованности между конфигурацией экспериментальных данных и процессом оптимизации масштаб набора данных и гиперпараметры основного обучения были суммированы в таблице 2. Таблица 2 содержит одну авторитетную экспериментальную конфигурацию для переработанной рукописи. Крупномасштабный внутренний 3D-бенчмарк использует 1201 обучающую и 312 валидационных сцен, RGB-D — 795 обучающих и 654 тестовых изображений, а оба бенчмарка обучены с размером партии 8, начальной скоростью обучения 0,0001, коэффициентом снижения веса 0,01 и 300 тренировочными эпохами.
Сравнение с современными методами
Перед представлением количественной сравнительной таблицы алгоритмов разбора сцен в помещении, этот раздел строго определяет тестовые ориентиры, используемые в многомерной системе оценки. Чтобы отразить классификационные характеристики модели при различных деталях, система оценки дополняет тестовую систему двумя дополнительными метриками: глобальной точностью пикселей (PixelAcc) и точностью среднего класса (MeanAcc). Эти метрики вместе создают детальную систему проверки эффективности алгоритма, устанавливая строгий теоретический ориентир для последующих количественных анализов. Для оценки точности семантического разбора и устойчивости к окклюзии предлагаемого алгоритма в сложных физических пространствах были проведены сравнительные тесты с существующими алгоритмами на наборе RGB-D для проверки внутренней сцены. Библиотека сравнительных моделей охватывает базовые фреймворки маски-внимания, иерархические трансформеры, современные чисто сверточные сегментационные конвейеры, унифицированные архитектуры плотного прогнозирования и сети внимания между каналами. Оценка бенчмарка была расширена, включив в себя базовую сегментацию на основе трансформаторов, унифицированную базу для прогнозирования плотности, унифицированную базу для обнаружения и сегментации, базу основы для крупномасштабного зрения, чисто сверточную базовую линию, базу сегментации на основе внимания с маской и базу для агрегации кросс-модальных признаков и базовую линию прогрессивного слияния признаков (см. Таблицу материалов)), используя тот же набор проверки внутренней сцены RGB-D, разрешение входов, график обучения и метрический протокол. В предлагаемой архитектуре структурно управляемая сеть интегрирует многомасштабный визуальный магистраль с сдвиговым окном, модуль перекрёстного внимания, управляемый структурой с SDF и суперпиксельный GCN. Расширенное сравнение охватывает предсказание плотности на основе трансформаторов, свёрточный анализ плотности, парсинг маски и внимания, кроссмодальное слияние признаков и парадигмы прогрессивного слияния признаков, что позволяет оценить вклад явного 3D-геометрического пограничного вмешательства в более широкие базовые линии парсинга сцены в помещении.
Таблица 3 подробно описывает объективную оценку каждой сети по основным количественным метрикам, с отчётом о средних значениях и соответствующих стандартных отклонениях по пяти независимым запускам. Расширенное базовое сравнение оценивает, способствует ли предложенный структуроориентированный механизм рассуждения повышению точности за пределами стандартных плотных систем предсказания, масочных сегментационных сетей и сетей слияния признаков RGB-D. Экспериментальные данные показывают, что предлагаемый алгоритм достигает стабильного прироста по всем четырём количественным метрикам. Плотные сети предсказания на основе трансформаторов и маски-внимание сохранили сильные возможности глобального контекстного моделирования, однако их значения Границы F1 оставались ниже при наличии помех на переднем плане, поскольку прогнозируемые маски не имели явных физических граничных ограничений. Кроссмодальные и прогрессивные сети синтеза улучшали локальную семантическую непрерывность, но их слияние признаков по-прежнему основывалось преимущественно на внешнем виде и глубинных реакциях, а не на структуре априор-сигнала с ознакомленным расстоянием. Предлагаемая структурно управляемая сеть достигла mIoU 0,687 со стандартным отклонением 0,002 и средним баллом по границе F1 0,764 со стандартным отклонением 0,003. Расширенное сравнение показывает, что прирост производительности был обусловлен не исключительно увеличением плотного основания прогноза, но и совместным использованием поля управления по знаковым расстояниям, структуроориентированного перекрестного внимания и графового топологического рассуждения.
Для анализа глобальной точности логического мышления модели при окклюзиях мы выявили и извлекли типичные сценарии из набора валидации, которые были сильно затруднены мебелью и другим помехом, а также создали визуализации масок прогнозирования на уровне пикселей.
После метода рабочий процесс и процесс графового рассуждения были определены на рисунках 1, 2, 3 и 4. Рисунок 5 иллюстрирует различия в морфологических прогнозах между моделями при экстремальных условиях окклюзии. Красные прямоугольники на качественной сравнительной сетке обозначают ключевые конфликтные зоны, где углы и несущие поверхности закрыты. Выходная маска с базовой сегментации на основе внимания маски демонстрирует выраженное сглаживание краёв и межклассовую адгезию. Хотя базовая линия агрегации кросс-модальных признаков и прогрессивная базовая линия слияния признаков включают кроссмодальные данные, их прогнозные результаты всё ещё демонстрируют структурные разрывы классов и физические искажения границ. Маска, созданная этим предложенным методом, демонстрирует большое пространственное перекрытие с метками ground-truth. Базовые модели, ограниченные исключительно пиксельными принципами, склонны терять свои локальные рецептивные поля при окклюзии. Предлагаемый метод использует суперпиксельный GCN для передачи сообщений в неевклидовом пространстве, тем самым реконструируя подлежащие углы и линейные пространственные скелеты, руководствуемые неявными геометрическими границами. Это подтверждает антиинтерференционную эффективность предлагаемого нами решения при решении сложных внутренних планировок с визуальной морфологической точки зрения.
Эксперимент абляции
Для анализа фактического вклада каждого независимого компонента в предлагаемую архитектуру было построено расширенное модульное абляционное испытание на наборе RGB-D для проверки сцены в помещении. Тестовая базовая линия была установлена на обычную классификационную сеть с визуальным основным основным вектором трансформатора с сдвивным окном. Количественная оценка измеряла независимый вклад структурно-ориентированного перекрёстного внимания, смещения поля со знакомыми расстояниями, адаптивного структурного взвешивания, рассуждения на суперпиксельных графах, построения копланарных ребер, нормализации симметричных графов и потери структурной согласованности. Расширенная абляционная конструкция отделяла накопленные прибыли модуля от эффектов удаления компонентов, делая границу вклада каждого проектного решения более чёткой.
Таблица 4 и рисунок 6 иллюстрируют эволюцию точности при расширенных накопленных и удалённых настройках абляции. Сеть трансформаторов с сдвигом базового окна не имеет трёхмерных физических границ, что приводит к ограниченной агрегации признаков в перегруженных фонах. Добавление структурно-ориентированного перекрёстного внимания увеличило mIoU с 0,615 до 0,648, а балл Границы F1 — с 0,630 до 0,685, что показало, что ранее поле с отмеченным расстоянием улучшало выравнивание визуальных объектов и структурных контуров. Добавление рассуждения на основе суперпиксельных графов увеличило mIoU до 0,641 и балл Границы F1 до 0,676, что указывает на то, что топологическое рассуждение по узлам улучшало семантическую согласованность в однородных физических областях. Добавление потери структурной согласованности только увеличило mIoU до 0,632, а балл Границы F1 — до 0,662, что показало, что термин потерь в основном влияет на подгонку границ, а не на широкую контекстную агрегацию.
Сочетание перекрёстного внимания с графическим мышлением увеличило mIoU до 0,669, а балл Границы F1 — до 0,721, что показало, что визуально-структурное выравнивание и передача сообщений в графовой области вызывают взаимодополняющие эффекты. Сочетание перекрёстного внимания с потерей структурной согласованности дало mIoU 0,660 и результат Границы F1 0,713, а сочетание графового рассуждения с потерей структурной согласованности дало mIoU 0,653 и балл Границы F1 0,704. Эти парные результаты показывают, что модуль перекрёстного внимания обеспечивал основной геометрический сигнал выравнивания, модуль графического рассуждения расширял этот сигнал по копланарным регионам, а потеря структурной согласованности уточняла границу семантических переходов во время оптимизации.
Абляция на основе удаления дополнительно прояснила вклад внутренних проектных решений. Удаление аддитивного смещения поля по знаковым расстояниям снизило mIoU до 0,656, а показатель Границы F1 — до 0,698, подтвердив, что структурная матрица аффинности была центральной для подавления диффузии признаков через границу. Удаление коэффициента адаптивного структурного веса λ снизило mIoU до 0,671, а балл Границы F1 — до 0,736, что указывает на фиксированное структурное ограничение ослабляло реакцию модели в регионах вне Манхэттена и визуально деградированных. Снятие ограничения на копланарные ребра снизило mIoU до 0,666, а балл Границы F1 — до 0,728, что показало, что рёбра графов, основанные только на локальной смежности, не смогли сохранить физическую согласованность плоскости. Удаление нормализации симметричного графа снизило mIoU до 0,673 и показатель Граничного F1 до 0,737, что указывало на необходимость сбалансированного распространения по степени для стабильной агрегации узлов. Вся предлагаемая структурно управляемая сеть достигла mIoU 0,687 и балла Boundary F1 0,764, демонстрируя, что итоговое приобретение было результатом координированного взаимодействия между структурным вниманием, графовым рассуждением и оптимизацией, ориентированной на границы.
Анализ вычислительной сложности, времени обучения и эффективности выводов
Для оценки вычислительной стоимости извлечения SDF, структурированного перекрестного внимания и сверточного мышления суперпиксельного графа, в этом исследовании были оценены масштаб параметров, операции с плавающей точкой, максимальное использование памяти, время обучения, задержка вывода по одному кадру, частота кадров и mIoU на одной вычислительной платформе. Операции с плавающей запятой рассчитывались при входном разрешении 512 × 512. Задержка вывода измерялась с размером партии 1 после прогрева модели, тогда как сообщаемая частота кадров рассчитывалась на основе средней задержки одного изображения. Время обучения измерялось по тому же графику из 300 эпох, размер партии 8, настройки оптимизатора и конвейер предварительной обработки данных.
Таблица 5 подробно описывает связь между масштабом модели, стоимостью обучения, эффективностью вывода и точностью парсинга для каждой архитектуры сети. Столбцы mIoU и Boundary F1 в Таблице 5 используют те же общие значения валидационного набора для каждой соответствующей модели, что и Таблица 3 . Эти два столбца точности повторяются в таблице 5 исключительно для сравнения точности парсинга с вычислительными затратами. Увеличение обучаемых параметров было в основном связано с проекционными слоями проекции ключа запроса в структурно-ориентированном модуле перекрестного внимания и матрицами весов трёх сверточных слоёв графов. Затраты на необучаемость в основном были связаны с генерацией SDF, разбиением суперпикселей и построением смежности графов. Поскольку эти необучаемые операции выполнялись один раз для каждого входного изображения, они увеличивали задержку вывода, но существенно не увеличивали количество обучаемых параметров. Это разделение объясняет, почему предложенный метод показал умеренное увеличение параметров, но более заметное увеличение задержки. Результаты сложности показывают, что базовая сегментация на основе внимания маски сохраняла меньшее количество параметров и меньшую задержку вывода, но её показатель Boundary F1 и mIoU были ограничены при сильной окклюзии из-за отсутствия в сети явных геометрических указаний границ. Кроссмодальная агрегация признаков требовала большего количества операций с плавающей запятой и более длительного времени обучения, поскольку кроссмодальная агрегация добавляла дополнительные расходы на выравнивание признаков. Исходная линия прогрессивного синтеза признаков сохраняла умеренные вычислительные затраты, но точность прогнозирования оставалась ниже, чем у предлагаемого метода при граничном искажении. Предлагаемая структурно управляемая сеть требует дополнительных вычислительных затрат из-за строительства SDF, структурной перекрестной проекции, построения суперпиксельных графов и распространения свёртки графов. Полная модель использовала 66,8 миллиона параметров, 121,4 миллиарда операций с плавающей точкой, 15,6 часа обучения, 7,9 ГБ максимальной памяти, 61 мс времени вывода за один кадр и 16,4 кадра в секунду. Хотя задержка вывода была выше, чем у чистой базовой линии маски-внимание, модель достигла mIoU 0,687 и балл Boundary F1 0,764, что указывает на то, что дополнительные затраты в основном поддерживали структурное исправление границ и семантическую согласованность с топологией.
Для визуального представления двумерного пространственного баланса между вычислительным масштабом и аналитической точностью модели была создана диаграмма пузырькового распределения, показывающая количество операций с плавающей запятой и mIoU алгоритма. Пересмотренная визуализация также отражала время обучения и задержку вывода в области аннотации рисунков, что позволило сравнивать прирост точности и вычислительные затраты как с точки зрения обучения, так и с точки зрения развертывания. Горизонтальная ось сохраняла операции с плавающей точкой, вертикальная ось — mIoU, размер пузыря — обучаемую величину параметров, а прилагаемая метка указывала время вывода для каждого метода.
Рисунок 7 показывает взаимосвязь между операциями с плавающей запятой, масштабом параметров, задержкой вывода и точностью разбора. Предлагаемый метод обеспечивает более высокий mIoU, чем сравнительные сети, при этом его FLOP и количество параметров остаются близки к кросс-модальной и прогрессивной термоядерной базе. Однокадровая задержка в 61 мс указывает на то, что добавленные ветки SDF и графового мышления создавали дополнительные расходы на развертывание, однако задержка оставалась в пределах реального времени, необходимого для многих задач интерпретации сцен в помещении. Время обучения увеличилось до 15,6 часов, поскольку в каждом этапе обучения выполнялись структурные предварительные методы, проекция внимания и графическое мышление. Этот результат показывает, что вычислительная стоимость предлагаемого метода в основном сосредоточена на структурном рассуждении с учётом границ, а не в неконтролируемом расширении параметров.
Конкретное сравнение потери структурной согласованности и пространственного расстояния
Потеря в сети обратного преобразования для квантования расстояния пространственного преобразования границ использует параметры гомоморфного преобразования для захвата смещений границ, демонстрируя, что чистые метрики пространственного расстояния превосходят традиционные потери на перекрестной энтропии, основанные на изменениях меток пикселей. Основываясь на этом теоретическом консенсусе, параллельные эксперименты по валидации проводятся с использованием схем граничного ограничения для оценки сравнительной эффективности кастомной потери структурной согласованности (SCL) на основе манхэттенских ограничивающих коробок с точки зрения адаптивности сцены. Эксперименты сохраняют аналитическую архитектуру слияния многомасштабного визуального магистрали с сетью графовых выводов, при этом просто заменяя термин потери границы во время обратного распространения. Конфигурированы четыре параллельные сети валидации: сеть, использующая только базовую классификацию потерь кросс-энтропии, лишена геометрических ограничений для высокоразмерных размеров; сеть с добавленной стандартной потерей по бинарной перекрестной энтропии (BCE) выполняет традиционный надзор по классификации бинарных границ; сеть с добавленной потерей пространственного расстояния на границе сосредоточена на фиксации локальных деформаций; а сеть, использующая предложенный SCL, накладывает ортогональные топологические штрафы на основе SDF. Метрики квантования в наборе валидации RGB-D в помещении ограничены mIoU и структурной границей F1.
Таблица 6 подробно описывает степень вмешательства различных стратегий обратной оптимизации на базовую пространственную логическую когницию. Статья только с перекрёстной энтропией в таблице 6 обозначает предложенную архитектуру ours, обученную исключительно с потерей кросс-энтропии на уровне пикселей, при этом сохраняя без изменений ветвь визуального хребта, ветвления поля со знаковым расстоянием, модуль кросс-внимания, управляемый структурой, и ветвь рассуждения суперпиксельного графа. Эта запись не является базовым уровнем Mask2Former и не должна сравниваться с общим значением Mask2Former в Таблице 3, так как используется та же модель. Сети, опирающиеся исключительно на базовые потери перекрестной энтропии, получают наименьший балл приравнивания границы. Сети с дополнительной стандартной потерей двойной границы на перекрестной энтропии достигают небольшого усиления, но этот механизм всё равно вызывает размытие краёв при масштабной окклюзии. Потеря пространственного пограничного расстояния улучшает балл благодаря механизму восприятия пространственного преобразования, эффективно корректируя некоторые искажённые рёбра. Потеря структурной согласованности, предложенная в этой статье, напрямую использует реальную SDF для наложения градиентных штрафов на аномальные семантические мутации внутри физической несущей поверхности, достигая наивысшего результата F1 на структурной границе.
Для визуального сравнения движущих эффектов различных конфигураций функций потерь на точность прогноза маски и подгонку границ мы нанесли сгруппированные столбчатые диаграммы по разным стратегиям оптимизации.
Рисунок 8 иллюстрирует поэтапное улучшение производительности, возникающее при увеличении пространственно-восприятия функции потерь. Столбчатая диаграмма, отражающая оценку F1 структурной границы, показывает значительный восходящий тренд. Экспериментальные данные показывают, что этот индивидуальный механизм штрафа заставляет точное совпадание пространственного прыжка предсказанной категории с ортогональным физическим контуром. Механизм штрафа по полю расстояния, адаптированный для ортогональных априоров в помещениях, достигает более высокой точности, чем общие потери при захвате границ пространственной границы, тем самым устанавливая эффективный путь оптимизации для устранения сложных неисправностей зданий.
Проверка устойчивости при экстремальном распределении окклюзии, аномальных структурах и сложных условиях освещения
Сложные пространственные отношения между объектами и взаимная окклюзия негативно влияют на глобальное 3D-пространственное познание. Совместная архитектура прогнозирования подчёркивает вспомогательную роль ограничений на расположение сцены при извлечении базовой маски. Анализ ограничений антиинтерференции алгоритма при потере визуального сигнала на большой площади и аномальных пространственных раскладок, нарушающих 3D-ортогональное физическое предположение, чётко определяет эффективную границу применения алгоритма и имеет основную, доказуемую ценность. Исходя из доли крупномасштабной мебели, замаскированной на этикетках ground-truth, тестовый набор RGB-D для внутренней сцены делится на три постепенно более сложных подгруппы: лёгкую, умеренную и сильную окклюзию. Одновременно нетипичные для Манхэттена сцены с наклонными потолками или изогнутыми стенами вручную извлекаются для создания тестовых наборов границ аномалий, а сцены с крайне слабым освещением, переэкспонированием и большой площадью глянцевыми или прозрачными стеклянными поверхностями классифицируются на сложные подмножества освещения и текстуры. Библиотека сравнительной модели включает базовую сегментацию на основе внимания маски; общая архитектура сегментации, основанная на маске для захвата глобального контекста; базовую базу кросс-модальной агрегации признаков с использованием комплексной кроссмодальной стратегии агрегирования; и базовый уровень прогрессивного синтеза признаков с интеграцией многоступенчатого механизма экстракции прогрессивных признаков. Каждая базовая линия сравнения, визуальный магистраль слияния и архитектура сетевого разбора графов, построенная в этой статье, независимо оцениваются на вышеуказанных подмножествах, а статистически анализируется градиент затухания точности каждой модели.
Таблица 7 отражает метрики устойчивости, специфические для подмножества, при лёгкой, умеренной и тяжёлой окклюзии, сложном освещении, интерференции текстуры и не-манхэттенских аномалий. Таблица 7 подробно описывает изменения точности прогнозирования маски в различных моделях при пространственных интерференциях. Таблица 7 отражает значения mIoU, специфичные для подмножества, для различных моделей при условиях пространственной интерференции, рассчитанных только в соответствующем подмножестве окклюзии, освещения, текстуры или не-Манхэттена, а не на общем наборе RGB-D для проверки сцены в помещении. В подмножествах с лёгкой и умеренной окклюзией все модели сохраняют базовую точность. С увеличением площади окклюзии базовые модели, основанные на пиксельных правилах, показывают уменьшение отношения пересечения-объединения (IU) на сильно окклюзионном подмножестве. Базовая сегментация на основе внимания маски и кроссмодальная агрегация признаков значительно теряют точность на этом подмножестве. Многоступенчатая архитектура прогрессивного извлечения признаков в базовой системе прогрессивного слияния признаков демонстрирует серьёзное снижение производительности. Предлагаемое решение опирается на явные 3D-скелетные особенности для принудительного выравнивания поврежденных визуальных сигналов, поддержания стабильной формы выхода маски на сильно окклюзивном подмножестве и демонстрации топологической стабильности выхода семантической маски. В сложных подмножествах освещения и текстуры детектор линейных сегментов пропускает структурные края в областях с сильными отражениями и прозрачным стеклом, что приводит к локальным разрывам в SDF. Ошибочные геометрические координаты распространяются по структурной матрице аффинности и потере структурной согласованности, тем самым применяя аномальные градиентные штрафы к семантическим признакам и вызывая соответствующие отклонения в прогнозах границ. Глобальный механизм пространственного контекста GCN дополняет отсутствующие геометрические априоры смежными структурными аффинностями, поддерживая общую точность парсинга в допустимом диапазоне распада и раскрывая границы визуального восприятия алгоритма при сложных физических интерференциях. В не-манхэттенском подмножестве аномалий SDF априор на нижнем слое этой модели вводит небольшое смещение картирования, что приводит к немного более низкой производительности, чем исходная линия прогрессивного слияния признаков. Коэффициент адаптивного структурного взвешивания в модуле перекрёстного внимания динамически оценивает согласованность градиентов базовой физической структуры. В сценах с изогнутыми стенами или наклонными потолками этот коэффициент автоматически уменьшает вес ограничения SDF, побуждая сеть полагаться на механизм агрегации локальных узлов признаков в суперпиксельной графовой сети для поддержания семантической когерентности в однородных областях, тем самым создавая эффективный механизм геометрической компенсации для пространственных структур вне Манхэттена.
Чтобы визуально продемонстрировать негативное влияние тяжести окклюзии на точность разрешения, мы построили линейные графики, показывающие снижение точности в различных моделях алгоритмов.
Рисунок 9 визуально показывает различия в устойчивости между различными парадигмами извлечения признаков в экстремальных физических условиях. Три пунктирные линии, представляющие базовые модели, демонстрируют значительный нисходящий тренд на сильно окклюзионных узлах, отражая ограничения традиционных рецептивных полей при извлечении признаков при крупномасштабных потерях сигнала. Сплошная линия, представляющая предлагаемый метод, сохраняет относительно плавную траекторию распада. Экспериментальные данные показывают, что связь между явными 3D-архитектурными априорами и механизмами вывода на основе графов обеспечивает структурную поддержку для задач разбора сцен, устойчивых к окклюзии, и улучшает производительность обобщения моделей в сложных средах.
Анализ пространственной чувствительности при разбиении узлов графов топологии
Параметр частоты дискретизации с уменьшением размерности в модуле свёртки графа координатного пространства напрямую контролирует качество рецептивного поля и вычислительную нагрузку графовой сети. В соответствии с теоретической основой данной статьи, исследование исследует, как количество дискретных графовых узлов, образующихся при простой линейной итеративной кластеризации, влияет на эффективность неевклидовского топологического вывода, с целью обеспечить строгую поддержку выбора гиперпараметров. Проводились эксперименты для корректировки параметров управления инициализацией алгоритма кластеризации, насильно вмешиваясь в динамическое уменьшение размерности пространства признаков, устанавливая количество разделов узлов графа суперпикселей на уровне 64, 128, 256, 512 и 1024. В строго выровненном тестовом бенчмарке среднее соотношение пересечения над объединением (IoU), структурный балл F1 и среднее время вывода на одно изображение высокого разрешения фиксировались одновременно при различных топологических размерах узлов.
Таблица 8 подробно описывает связь между степенью динамического уменьшения размерности в пространстве признаков и аналитической точностью и вычислительной стоимостью. Установка слишком низкого количества узлов приводит к недосегментации объектов изображения, что приводит к слиянию семантических характеристик малых объектов с крупномасштабными стенами, что снижает различные метрики точности. По мере увеличения масштаба разделения узлов чувствительность модели к локальным пространственным деталям значительно улучшается. Увеличение числа узлов до 512 и 1024 приводит к фрагментации однородных областей, ослабляет эффект сглаживания макроскопических особенностей в графовых нейронных сетях, увеличивает размерность матрицы связей узлов и увеличивает время вывода. Конфигурация параметров с фиксированным количеством узлов 256 приводит к наибольшим значениям для отношения пересечения-объединения и граничного балла.
Для визуального представления компромисса между точностью и вычислительной мощностью в неевклидовом топологическом выводе был построен биосный статистический график, показывающий чувствительность размера узла.
Рисунок 10 иллюстрирует логику, по которой количество дискретных графовых узлов влияет на развитие особенностей сети. Фоновая полоса, обозначающая время вычисления, показывает резкое увеличение после того, как количество узлов превышает порог в 256. Двойная линия, обозначающая точность, достигает пика на 256 по горизонтальной оси, затем значительно снижается из-за эффекта фрагментации. Объективные количественные данные и тенденция визуальной эволюции весьма согласованы, демонстрируя, что поддержание размера графа вычислений на уровне 256 узлов обеспечивает баланс между аппаратной обработкой и логическим мышлением в текущей конфигурации с фиксированными параметрами. Серьёзное снижение производительности, вызванное отклонением от этого количества узлов, выявляет высокую чувствительность стратегии сегментации фиксированных суперпикселей к гиперпараметрической настройке и подчеркивает необходимость разработки динамического механизма выбора узлов.
ДОСТУПНОСТЬ ДАННЫХ:
Исходные эталонные данные, проанализированные в этом исследовании, доступны публично из официальных репозиториев, перечисленных в Таблице материалов. Крупномасштабный внутренний 3D-бенчмарк был представлен как официальный релиз ScanNet v2 с идентификатором релиза датасета ScanNet v2. Бенчмарк RGB-D для внутренней сцены был доступен через официальный релиз NYU Depth Dataset V2 с идентификатором релиза NYU Depth Dataset V2. Описательное издание DOI для крупномасштабного внутреннего 3D-бенчмарка — 10.1109/CVPR.2017.261, а описательное издание DOI для бенчмарка RGB-D внутренней сцены — 10.1007/978-3-642-33715-4_54. В этом исследовании не было создано новых RGB-D изображений или наборов данных. Обработанные разделённые файлы, обучающие конфигурационные файлы, исходные журналы оценки, числовые исходные файлы, поддерживающие таблицы 2, таблицы 3, таблицы 4, таблицы 5, таблицы 6, таблицы 7 и таблицы 8 , а также рисунок 5, рисунок 6, рисунок 7, рисунок 8, рисунок 9 и рисунок 10, обученные веса модели и исходный код были размещены в Figshare под DOI: 10.6084/m9.figshare.32906765. Запись figshare предоставляет полные исходные данные результатов, необходимые для воспроизведения количественных таблиц и цифр, представленных в этой рукописи. Репозиторий содержит маски предсказаний, файлы оценки границ, скрипты вычисления метрик, контрольные точки модели и исходные файлы таблиц, используемые для отчетного mIoU, границы F1, PixelAcc, MeanAcc, вычислительной сложности, надёжности, проверки функции потерь и анализа чувствительности по разделению узлов.

Рисунок 1: Сравнение семантической разрывности и структурных эффектов предварительного восстановления в сложных случаях окклюзии в помещениях. (A) Оригинальное RGB-изображение с крупномасштабной окклюзией мебели. (B) Вывод традиционной базовой модели, подчеркивающей физические искажения границ и дефекты семантических разрывов. (C) Вывод предложенного метода с наложением на циановую пунктирную перспективу, которая явно отображает 3D-скелет здания для топологического ремонта повреждённых элементов подлежащей конструкции. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 2: Общая семантическая структура парсинга, основанная на структурных априорах здания. Диаграмма описывает полный конвейер, начиная от входа изображения RGB, через ветвь визуального извлечения признаков с сдвинутым окном и ветвь предварительной экстракции структуры, затем в модуль структурного перекрестного внимания, затем топологическое рассуждение через суперпиксельный GCN и, наконец, декодирование в плотную семантическую карту. Подробные схемы расчёта матрицы аффинности внимания, передачи графовых сообщений и совместных функций оптимизационных потерь представлены справа. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 3: Блок-схема матрицы аффинности и построение топологической связности. Диаграмма подробно описывает пошаговый математический конвейер отображения, показывая преобразование от входной карты поля расстояний и выбранных пар пикселей через непрерывное извлечение геометрических потенциальных признаков и оценку градиентной согласованности в нормализованную матрицу аффинности, используемую как явное пространственное смещение для механизма перекрёстного внимания. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 4: Схематическая схема проекции узлов свёртки суперпиксельного графа и агрегации признаков . Панель подробно описывает неевклидов топологический процесс: (A) плотные пиксельные особенности, показывающие исходную локальную матрицу признаков и границы кластеризации суперпикселей; (B) построение топологии суперпиксельного графа, отображающее регулярную сетку в дискретные узлы и физически связанные рёбра; (C) передача графовых сверточных сообщений, выполняющая направленную агрегацию локальных признаков; и (D) координатная обратная проекция, представляющая восстановленные макроскопические семантические признаки согласованности на плотной сетке. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 5: Диаграмма качественной сравнительной сетки. Матрица предоставляет визуальную оценку производительности в различных рядовых внутренних сценах, сравнивая исходные входы RGB в помещении и макеты ground-truth с выходами базовой сегментации на основе внимания масок, базы агрегации кросс-модальных признаков, прогрессивной базовой линии слияния признаков и предлагаемого метода, который успешно восстанавливает окклюзированные углы и выравнивает несущие поверхности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 6: Результаты абляции для кумулятивного интегрирования модулей. Диаграмма с двумя осями демонстрирует пошаговую эволюцию производительности в различных модульных настройках абляции, отображая устойчивую восходящую траекторию среднего пересечения по объединению (mIoU) в виде баров и структурную оценку границы F1 в виде линейного графика от базового магистрали до полной структуры. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 7: Вычислительная сложность, время обучения и распределение эффективности выводов. Многомерный пузырьковый график показывает компромиссы между вычислительными накладными расходами и точностью парсинга. Горизонтальная ось измеряет операции с плавающей запятой (FLOPs), вертикальная — mIoU, размер пузыря — масштаб обучаемых параметров, а соседние текстовые метки показывают задержку вывода по одному кадру для каждой сетевой архитектуры. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 8: Гистограмма точности границ и метрических показателей при различных конфигурациях функций потерь . Сгруппированная столбчатая диаграмма сравнивает движущие эффекты различных стратегий оптимизации на базовую пространственную логику, иллюстрируя значительные улучшения mIoU и структурного граничного показателя F1, достигнутые при переходе от стандартных формулировок кросс-энтропии к предлагаемой потере структурной согласованности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 9: Линейный график, показывающий связь между тяжестью окклюзии и снижением производительности. Кривая отслеживает снижение точности по различным парадигмам извлечения признаков при умеренных, умеренных и сильных уровнях окклюзии, подчёркивая надёжную топологическую устойчивость и антиинтерференционные возможности предлагаемой структурно-ориентированной структурной структуры по сравнению с чисто пиксельными базовыми линиями. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 10: Анализ чувствительности масштаба узлов суперпикселя. Биаксиальный статистический график иллюстрирует компромисс между скоростью аппаратной обработки и точностью логического рассуждения при разных размерах разбиений графов, показывая, как количество суперпиксельных узлов влияет на метрики точности и приводит к резкому увеличению среднего времени вывода. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
| Нумерация сетевых уровней | Размерность признаков входного узла | Размер признаков выходного узла | Вероятность случайной инактивации |
| 1 | 512 | 256 | 0.15 |
| 2 | 256 | 256 | 0.15 |
| 3 | 256 | 128 | 0.1 |
| 4 | 128 | 64 | 0.05 |
Таблица 1: Таблица конфигурации гиперпараметров архитектуры сети для модуля сверточного вывода. Таблица содержит нумерацию сетевого уровня, размеры признаков входного узла, размеры признаков выходного узла и параметры вероятности случайной инактивации, используемые в графовой сети рассуждения.
| Элемент конфигурации | Крупномасштабный внутренний 3D-бенчмарк | Бенчмарк RGB-D в помещении |
| Официальный идентификатор релиза | ScanNet v2 | Глубинный набор данных NYU V2 |
| Обучающие образцы, использованные в этом исследовании | Сцены 1201 года | 795 изображений |
| Валидационные или тестовые образцы, используемые для оценки | 312 сцен валидации | 654 тестовых изображения |
| Общие семантические категории | 20 | 40 |
| Разрешение входного изображения | 512 × 512 | 512 × 512 |
| Начальная скорость обучения | 0.0001 | 0.0001 |
| Пакетное количество входных выборок | 8 | 8 |
| Коэффициент затухания веса | 0.01 | 0.01 |
| Общие эпохи обучения | 300 | 300 |
| Количество независимых заездов | 5 | 5 |
Таблица 2: Экспериментальное разделение наборов данных и конфигурация унифицированных обучающих гиперпараметров .В таблице представлены крупномасштабные внутренние 3D-насеты данных и RGB-D набора внутренней сцены, семантические категории, настройки скорости обучения, пакетные входные выборки, скорость затухания веса и общее количество итераций обучения.
| Архитектура сетевой модели | mIoU | Граница F1 | PixelAcc | MeanAcc |
| SegFormer | 0,596 ± 0,003 | 0,635 ± 0,004 | 0,838 ± 0,003 | 0,704 ± 0,004 |
| ConvNeXt UperNet | 0,604 ± 0,003 | 0,642 ± 0,004 | 0,846 ± 0,003 | 0,713 ± 0,004 |
| Mask2Former | 0,612 ± 0,003 | 0,654 ± 0,004 | 0,853 ± 0,003 | 0,721 ± 0,004 |
| OneFormer | 0,621 ± 0,002 | 0,663 ± 0,003 | 0,861 ± 0,003 | 0,733 ± 0,003 |
| MaskDINO | 0,628 ± 0,002 | 0,667 ± 0,003 | 0,869 ± 0,003 | 0,741 ± 0,003 |
| CCANet | 0,635 ± 0,003 | 0,671 ± 0,004 | 0,876 ± 0,003 | 0,745 ± 0,004 |
| InternImage UperNet | 0,641 ± 0,002 | 0,692 ± 0,003 | 0,884 ± 0,002 | 0,756 ± 0,003 |
| CMPFFNet | 0,658 ± 0,002 | 0,712 ± 0,003 | 0,891 ± 0,002 | 0,773 ± 0,003 |
| SGCA_GCN | 0,687 ± 0,002 | 0,764 ± 0,003 | 0,924 ± 0,002 | 0,816 ± 0,003 |
Таблица 3: Общее количественное сравнение базовых уровней парсинга сцены в помещении на наборе валидации RGB-D для внутренней сцены. В таблице представлены mIoU, граничный балл F1, глобальная точность пикселей и средняя точность классов для базовой сегментации на основе внимания и маски, базы агрегации кросс-модальных признаков, прогрессивной базовой линии слияния признаков и предлагаемой архитектуры сети, управляемой структурой.
| Конфигурация сетевой архитектуры | mIoU | Граница F1 | PixelAcc | MeanAcc |
| Основная основа с сдвинутым окном | 0,615 ± 0,003 | 0,630 ± 0,004 | 0,842±0,003 | 0,706 ± 0,004 |
| Backbone плюс структурированное перекрёстное внимание | 0,648 ± 0,003 | 0,685 ± 0,004 | 0,874 ± 0,003 | 0,748 ± 0,004 |
| Магистраль плюс рассуждение на основе суперпиксельных графов | 0,641 ± 0,003 | 0,676 ± 0,004 | 0,868 ± 0,003 | 0,741 ± 0,004 |
| Основная структура плюс потеря структурной консистенции | 0,632 ± 0,003 | 0,662 ± 0,004 | 0,859 ± 0,003 | 0,732 ± 0,004 |
| Магистраль плюс перекрёстное внимание и графическое рассуждение | 0,669 ± 0,002 | 0,721 ± 0,003 | 0,897 ± 0,002 | 0,782 ± 0,003 |
| Потери устойчивости и структурной консистенции | 0,660 ± 0,002 | 0,713 ± 0,003 | 0,889 ± 0,002 | 0,773 ± 0,003 |
| Основная структура плюс графическое рассуждение и потеря структурной согласованности | 0,653 ± 0,003 | 0,704 ± 0,003 | 0,881 ± 0,003 | 0,765 ± 0,003 |
| Полная модель без аддитивного смещения полей со знаковым расстоянием | 0,656 ± 0,003 | 0,698 ± 0,004 | 0,884 ± 0,003 | 0,761 ± 0,004 |
| Полная модель без адаптивного структурного взвешивания λ | 0,671 ± 0,002 | 0,736 ± 0,003 | 0,904 ± 0,002 | 0,792 ± 0,003 |
| Полная модель без копланарного ограничения на ребра | 0,666 ± 0,002 | 0,728 ± 0,003 | 0,899 ± 0,002 | 0,786 ± 0,003 |
| Полная модель без нормализации симметричного графа | 0,673 ± 0,002 | 0,737 ± 0,003 | 0,906 ± 0,002 | 0,795 ± 0,003 |
| Полный SGCA_GCN | 0,687 ± 0,002 | 0,764 ± 0,003 | 0,924 ± 0,002 | 0,816 ± 0,003 |
Таблица 4: Расширенный количественный абляционный анализ основных компонентов. В таблице представлены кумулятивная интеграция модулей, попарные комбинации модулей и настройки удаления компонентов для количественной оценки независимого и кооперативного вклада структурного перекрёстного внимания, смещения поля по знаковым расстояниям, адаптивного структурного взвешивания, рассуждения на суперпиксельных графах, построения копланарных ребер, нормализации симметричного графа и потери структурной согласованности.
| Архитектура сетевой модели | Параметры | FLOPs | Пиковая память | Время обучения | Время вывода | FPS | mIoU | Граница F1 |
| SegFormer | 83,7 м | 80,1 G | 6,1 ГБ | 10,6 ч | 44 мс | 22.7 | 0.596 | 0.635 |
| ConvNeXt UperNet | 60,2 м | 91,5 G | 6,4 ГБ | 11,2 часа | 47 мс | 21.3 | 0.604 | 0.642 |
| Mask2Former | 44,0 м | 74,6 G | 5,8 ГБ | 9,4 часа | 41 мс | 24.4 | 0.612 | 0.654 |
| OneFormer | 64,1 м | 103.2 G | 7,0 ГБ | 12,9 ч | 55 мс | 18.2 | 0.621 | 0.663 |
| MaskDINO | 52,8 м | 96,8 G | 6,8 ГБ | 12,1 ч | 52 мс | 19.2 | 0.628 | 0.667 |
| CCANet | 63,5 м | 118,7 G | 7,6 ГБ | 14,8 ч | 67 мс | 14.9 | 0.635 | 0.671 |
| InternImage UperNet | 70,4 м | 112,3 G | 7,4 ГБ | 14,2 часа | 64 мс | 15.6 | 0.641 | 0.692 |
| CMPFFNet | 58,9 м | 104,6 G | 7,1 ГБ | 13,1 ч | 59 мс | 16.9 | 0.658 | 0.712 |
| SGCA_GCN | 66,8 м | 121,4 G | 7,9 ГБ | 15,6 ч | 61 мс | 16.4 | 0.687 | 0.764 |
Таблица 5: Сравнение вычислительной сложности, времени обучения и эффективности вывода с общей точностью валидационных наборов. Таблица содержит обучаемые параметры, операции с плавающей точкой, пиковое использование памяти, время обучения для 300 эпох, задержку вывода по одному кадру, кадры в секунду, mIoU и показатель F1 по границе для предлагаемого метода и сравнительных сетей.
| Конфигурация функции потерь | mIoU | Граница F1 |
| Только кросс-энтропия (CE) | 0.669 | 0.721 |
| CE + Граница до н.э. | 0.674 | 0.738 |
| CE + потери обратной формы | 0.681 | 0.752 |
| CE + Наши SCL | 0.687 | 0.764 |
Таблица 6: Количественное сравнение валидации функции потерь. В таблице представлены показатели mIoU и границы F1 при потере перекрестной энтропии, потери на границе бинарной перекрестной энтропии, потере при обратном преобразовании и предложенной потере структурной согласованности.
| Архитектура алгоритмической модели | Лёгкая окклюзия | Умеренная окклюзия | Тяжёлая окклюзия | Неманхэттенский набор аномалий | Подмножество текстур-интерференции |
| (mIoU) | (mIoU) | (mIoU) | (mIoU) | (mIoU) |
| Mask2Former | 0.685 | 0.612 | 0.421 | 0.584 | 0.553 |
| CCANet | 0.698 | 0.635 | 0.463 | 0.612 | 0.566 |
| CMPFFNet | 0.715 | 0.658 | 0.512 | 0.635 | 0.602 |
| SGCA_GCN | 0.732 | 0.687 | 0.645 | 0.628 | 0.649 |
Таблица 7: Анализ устойчивости, специфических для подмножеств, при распределении экстремальной окклюзии и не-манхэттенских структур. Таблица отражает изменения точности разбора между подмножествами с лёгкой окклюзией, умеренной окклюзией, сильной окклюзией, вызовом освещения, интерференцией текстуры и не-манхэттенскими аномалиями.
| Количество супермасштабных узлов | mIoU | BoundaryF1 | Среднее время вывода (ms) |
| 64 | 0.641 | 0.695 | 45 |
| 128 | 0.665 | 0.732 | 52 |
| 256 | 0.687 | 0.764 | 61 |
| 512 | 0.678 | 0.751 | 95 |
| 1024 | 0.662 | 0.735 | 185 |
Таблица 8: Анализ пространственной чувствительности масштаба распределения узлов в графе топологии. В таблице представлены mIoU, структурная граница F1 и среднее время вывода для различных настроек разделения узлов суперпикселей.