Исследовательская статья

Метод семантического разбора для изображений сцены в помещении, основанный на предварительных знаниях о структуре здания

30 просмотров

DOI:

10.3791/72054

11 августа 2026 г.

В этой статье

Краткое содержание

В данном исследовании предлагается алгоритм, который тесно связывает иерархические визуальные особенности, захваченные кодировщиком трансформатора с сдвинутым окном, с аноминационной глубиной 3D-ограничивающего блока Манхэттена, сгенерируемой при обнаружении отрезков строки, что позволяет достигать высокоточной семантической реконструкции сложных внутренних сцен.

Аннотация

Для решения семантических разрывов предсказания и физических искажений границ, вызванных окклюзией мебели в сложных внутренних сценах, в данной статье предлагается метод семантического разбора, использующий априоры структуры зданий. Схема использует иерархический трансформатор с сдвинутым окном для извлечения многомасштабных визуальных признаков и сочетает алгоритм определения сегментов линий с уклоном и согласованностью градиента для построения 3D-ограничивающего блока Манхэттена. Этот ограничивающий ящик преобразуется в знаковое поле расстояний (SDF) перед кодированием дискретных геометрических контуров в непрерывное физическое потенциальное поле. Механизм перекрёстного внимания, управляемый структурой, заставляет визуальные сигналы совпадать с реальными 3D-ортогональными геометрическими границами, восстанавливая непрерывность признаков в окклюзированных областях. Граф пространственной смежности, построенный из суперпиксельных узлов, приводит в движение графовую сверточную сеть (GCN) для агрегирования признаков, обеспечивая макроскопическую семантическую согласованность в пределах физической несущей плоскости. Сочетание потери перекрестной энтропии на уровне пикселей и специально разработанной структурной потери согласованности усиливает ограничения, наказывая прогнозы за пределы границ. Эксперименты с несколькими независимыми сериями показывают, что среднее пересечение по объединению (mIoU) достигает 68,7% при стандартном отклонении 0,2%, а оценка структурной границы F1 достигает 76,4% при стандартном отклонении 0,3%, что подтверждает надёжную работу предложенных модулей. При размере одного узла изображения 256 среднее время вывода оставалось 61 мс.

Введение

Семантический анализ изображения сцены в помещении занимает ключевое место в задачах трёхмерного пространственного познания и интеллектуального пространственногомышления 1,2. Визуальное извлечение признаков в реальной физической среде часто сильно затруднено сложнымипространственными планировками 3. Решение проблемы семантического разрыва и физических искажений границ фундаментной конструкции здания, вызванного крупномасштабной окклюзией мебели, важно для исследований пространственногопознания 4,5. Точное удаление помех от захламлённых объектов и восстановление физической непрерывности одной стены и пола напрямую определят точность трёхмерной реконструкции сцены и глобального пространственного логическогоанализа 6. Семантический разрыв, вызванный крупномасштабной окклюзией мебели, и эффект структурного ремонта предложенного руководства по строительству перед зданием иллюстрированы на рисунке 1, где вход окклюзированного красного, зелёного, синего (RGB) в таблице 1A, базового искажения маски на рисунке 1B и результат структуры-предшествующего ремонта на рисунке 1C сравниваются при одном и том же состоянии внутренней сцены.

Чтобы удовлетворить требования к точности пространственного логического мышления, современные основные пиксельные визуальные сети сталкиваются с множеством препятствий при работе со сложными внутреннимипомещениями 7,8. Внутренние помещения часто заполнены плотной мебелью и захламлённой мебелью, что приводит к значительной потере низкоуровневых визуальных пограничных сигналов наизображениях 9. Традиционные механизмы извлечения признаков чрезмерно опираются на локальные двумерные цветовые и текстурные реакции, не обладая макроскопическим пониманием жёстких ортогональных законов трёхмерных искусственных структур10. Это ограничение локального рецептивного поля делает распространение признаков легко прерываемым, затрудняя расширение глобальной топологии черезокклюзии 11. В настоящее время существует острая необходимость решить основную проблему семантических разрывов предсказания и серьёзных искажений физических границ, вызванных окклюзией иинтерференцией 12.

Для устранения конструктивных дефектов фундаментов зданий, вызванных окклюзией и помехами, академическое сообщество разработало ряд целенаправленных мервмешательства 13. Кроссмодальные сети агрегации признаков эффективно компенсируют присущие недостатки одной визуальной модальности в пространственном восприятии, вводя карты глубины или текстовые априоры для помощи при работе с изображениями красно-зелёно-синего(RGB) 14,15. Фреймворки восприятия границ и адаптивного выбора контекста внедряют стратегии усиления физических контуров в стадию декодирования признаков, что значительно улучшает подгонку краёв прогнозных результатов в сложныхсценах 16,17. Инференциальные модели, основанные на GCN и механизмах взаимодействия признаков, значительно улучшают плавность признаков и макросемантическую согласованность в однородных областях путём построения связей на уровнеузлов 18,19. Интеграция явных структурных априоров Манхэттена в конвейер визуального извлечения признаков обеспечивает геометрические границы согласованности, что решает проблемы разрывов признаков, вызванные обширной окклюзией объектов на переднемплане 20.

Для решения основной проблемы семантических ошибок предсказания и серьёзных искажений физических границ, связанных с инфраструктурой строительства, предлагается семантический парсинг-фреймворк на основе механизма замкнутого цикла связи, включающего архитектурные априоры. Эта концепция выходит за рамки наивных инженерных конвейеров, устанавливая двунаправленное выравнивание картографирования между непрерывными геометрическими полями потенциала и дискретными визуальными многообразиями признаков, формируя нетривиальную синергию, исправляющую ошибки окклюзии с помощью структурных законов. Эта схема опирается на многомасштабную визуальную магистральную сеть и алгоритм обнаружения линейных сегментов, основанный на оценке нулевой точки, чтобы получить локальные черты и ортогональные априоры ребер, представляющие 3D-ограничивающий блок Манхэттена параллельно, а затем преобразовать их в SDF. Алгоритм использует структурно ориентированный механизм перекрёстного внимания, используя визуальные признаки как векторы запроса и рассматривая особенности SDF как ключи и значения для вычислений точечного произведения, тем самым заставляя визуальный сигнал совпадать с реальной 3D-геометрической границей в пространстве признаков. Граф пространственной смежности, построенный из суперпиксельных узлов и пространственных копланарных краёв, подаётся в GCN для агрегации признаков между узлами и передачи сообщений. Процесс сквозной оптимизации параметров совместно использует кросс-энтропию на уровне пикселей и пользовательскую функцию потерь структурной согласованности, которая строго ограничивает и штрафует предсказанные пиксели, пересекающие границу здания-априор. Полный конвейер семантического разбора изложен на рисунке 2, который связывает RGB-ввод изображений, геометрическое априорное извлечение, выравнивание с перекрестным вниманием, рассуждение на суперпиксельных графах и декодирование семантической маски в единой архитектуре.

Ранние сети разбора сцен использовали сверточные операции для захвата локальных текстур внешнего вида, но из-за ограничений локальных рецептивных полей они демонстрировали недостаточную семантическую когерентность крупномасштабныхцелей 21,22. Предыдущие исследования применяли модуль самовнимания визуальной архитектуры Transformer для извлечения глобальной контекстной информации и построения признаков ассоциации пикселейна расстоянии 23,24. Кроссмодальные многофункциональные стратегии агрегации признаков извлекают трёхмерные геометрические пространственные особенности сцены, объединяя облака точек карты глубины и текстовые команды25,26. Гибридные механизмы внимания для слияния признаков, направленных на специфические домены, постепенно совершенствовались. Создавая мосты взаимодействия между признаками, они значительно снизили потери энергии и разреженность элементов при многомасштабной передаче визуальных сигналов, а также повысили устойчивость парсирования сложных структур. Передовые дизайны энкодеров совместно интегрируют и выводят пространственные детали высокочастотных доменов наряду с глобальными и локальными признаками, усиливая способность сети различать мелкозернистые семантические категории с высокой сходством и повышая точность внутреннего парсинга27,28. Недавние достижения в архитектурах семантической сегментации предоставляют ценные ориентиры для оптимизации вычислительной эффективности и пространственного восприятия. Модели, предназначенные для плотного прогнозирования и многомасштабной контекстной агрегации, извлекают мелкозернистые геометрические особенности из сложных фонов. Стратегии разделения признаков и синергетического слияния решают семантическую неоднозначность в пограничных областях. Лёгкие механизмы внимания и гейт-агрегационные модули оптимизируют распределение параметров, тем самым ускоряя вывод и сохраняя локальные структурные детали. Реализация этих эффективных архитектурных проектов предлагает теоретические рекомендации по снижению вычислительных накладных расходов на неевклидовские топологические операции вывода в разборе сцен внутри помещений.

Для коррекции локальных ошибок визуального разбора используются априоры структуры здания и оценка 3D-планировки29. Предыдущие исследования выделяли ортогональные и параллельные геометрические особенности внутренних зданий как ограничения на вывод для снижения смещения прогноза сети, вызванного перегруженными внутреннимифонами 30,31. Существующие схемы используют алгоритмы обнаружения линейных сегментов и методы анализа точек абляции изображений для создания 3D-ограничивающих коробок Манхэттена для картирования физических границ помещений и помощи в локализации визуальных объектов32. Совместная архитектура модуля осведомлённости границ и многомасштабного контекста неявно встраивает предшествующую структурную информацию в процесс декодирования высокомерных признаков, заставляя сеть выводить семантические маски, близкие к реальным физическим контурам, что эффективно улучшает зазубренность и размытие рёберобъектов 33. Широко изучены полуконтролируемые или слабо контролируемые функции потерь с свойствами усиления границ. Опираясь на строгие математические формулы для наказания независимого поведения классификации пикселей, нарушающего пространственные топологические правила, геометрическая гладкость и структурная целостность конечного результата сегментации гарантируются источником градиентнойоптимизации 34.

Некоторые исследования использовали графовые нейронные сети для кросс-доменной агрегации визуальных признаков и рассуждений о топологических отношениях в высокомерномпространстве 35. Алгоритм сегментации суперпикселей предварительно агрегирует соседние пиксельные блоки с похожими цветовыми характеристиками и текстурами в независимые связанные узлы. Алгоритм сегментации суперпикселей сжимает вычислительную избыточность структуры графа на уровне изображения и сохраняет базовую геометрическую топологию изображения36. GCN, построенный на высокомерном векторе признаков узла, а матрица смежности, представляющая пространственную близость, обеспечивает эффективную направленную передачу и интерактивное слияние многомасштабной визуальной информации вдоль физически связанного графа в пространственнойобласти 37,38. Применение модуля улучшения временной информации и гибридного многомасштабного механизма пропуска соединения подавляет чрезмерное сглаживание и гомогенизацию признаков узлов, возникающих в процессе многоуровневой глубокой передачисообщений 39. Технология многомасштабного графового вейвлет-преобразования и стратегия оптимизации обучения псевдометочных элементов оптимизируют механизм антифонового шума формулы обновления признаков узлов, так что признаки с одинаковыми семантическими атрибутами сохраняют кооперативный режим отклика в сложной сетевойтопологии 40. Механизм рассуждения на основе графов отображает правильные пиксельные сетки в неевклидовые топологические пространства для выполнения вычислений агрегации признаков неправильных строительных сооружений и внутреннихкомпонентов 41.

Протокол

Перед сетевым обучением были подготовлены наборы данных по RGB-сценам и их семантические аннотации. Крупномасштабный 3D-набор данных для внутренних помещений и RGB-D по внутренним сценам (см. Таблицу материалов) были получены из их официальных репозиториев. Сцены приобретения внутри помещений, включающие окклюзию мебели, вариации освещения, прерывание границ стен и сложные пространственные планировки, были сохранены для соответствия сценарию парсинга целей. Семантические метки были преобразованы в индексированные одноканальные PNG-аннотационные маски, а все RGB-изображения и семантические маски были изменены до 512 × 512 пикселей. Онлайн-дополнение данных применялось во время обучения: случайное горизонтальное переворот с вероятностью 0,5, случайное масштабирование яркости от 0,8 до 1,2 и случайное вращение между −10° и +10° для расширения структурного распределения. RGB-каналы были нормализованы со средними значениями 0,485, 0,456 и 0,406 и стандартными значениями отклонения 0,229, 0,224 и 0,225. Крупномасштабный внутренний 3D-бенчмарк последовал за официальным разделом релизов, использованным в этом исследовании: 1201 обучающая сцена и 312 валидационных сцен для разработки и валидации моделей. Бенчмарк RGB-D в помещении прошёл по официальному протоколу оценки: 795 обучающих и 654 тестовых изображений. Дополнительное процентное разделение не применялось к этим двум публичным ориентирам.

Визуальная магистральная сеть трансформатора с сдвинутым окном (см. Таблицу материалов) была инициализирована как магистраль кодера трансформатора с движущимися окнами. Размер вложения патча был настроен как 4 x 4 пикселя. Размеры вложения четырёх иерархических ступеней были установлены как 128, 256, 512 и 1024, а количество трансформаторных блоков в четырёх ступенях — 2, 2, 18 и 2. Размер локального окна внимания был установлен на 7 x 7, а количество головок внимания — 4, 8, 16 и 32 для четырёх иерархических этапов. Нелинейные функции непрерывной активации использовались во всех многослойных слоях перцептронов. Пространственное понижение дискретизации осуществлялось с помощью операций патч-слияния шагом 2 после каждого иерархического этапа. Архитектура ядра сети и гиперпараметры модуля сверточного вывода были обобщены в таблице 1.

Затем на входных картах выполнялась извлечение объектов с сдвиговым окном самовнимания. Каждая карта объектов была разделена на неперекрывающиеся локальные окна с пространственными размерами 7 × 7. Регулярное внимание окон и сдвигаемое внимание чередовались между соседними блоками трансформаторов с сдвинутыми окнами. Циклическое расстояние смещения было установлено на 3 пикселя, и в каждом локальном окне внимания применялось кодирование относительного позиционного смещения. Локальные визуальные особенности агрегировались с помощью многоголового самовнимания для создания иерархических, многомасштабных представлений признаков.

Структурные априоры Манхэттена были извлечены из RGB-изображений в помещении. Структурные сегменты кромки были обнаружены с помощью алгоритма определения линейных сегментов с уклоном и согласованностью градиента. Доминирующие структурные направления были сгруппированы с помощью алгоритма случайного консенсуса выборки (RANSAC) (см. Таблицу материалов) на основе оценки нуляющей точки. Три взаимно ортогональных направления Манхэттена были реконструированы для создания представления Манхэттенского трёхмерного ограничивающего ящика. Восстановленная структурная граница была преобразована в SDF-отображение путём вычисления минимального евклидового расстояния от каждого пикселя до ближайшего отрезка пограничной линии.

Структурно-ориентированные признаки перекрёстного внимания создавались после получения визуальных признаков и априоров SDF. Визуальное многообразие признаков отображалось в тензор запроса Q через линейную матрицу преобразования W sub Q элемента двойного удара R в матрицу формации W sub Q элемента двойного удара R в матрицу figure-protocol-1формации . Непрерывное поле расстояний перед отображалось в ключевой тензор K и тензор значений V через матрицы figure-protocol-2преобразования , а размерность модели была установлена в 512. Многоголовая модуляция делила проекционное пространство на 8 независимых подпространств, каждая из которых имела размерность 64. Пространственное расположение перед проектированием дискретных пиксельных координат в непрерывное потенциальное поле и генерировало структурную матрицу сродства S как явное аддитивное пространственное смещение для модуляции матрицы сходства с точечным произведением. Визуальный тензор признаков использовался в качестве источника запроса, поскольку семантический разбор требует от каждого визуального места активно извлекать структурно согласованные доказательства из геометрического априорного пространства. SDF prior использовался в качестве ключа и источника ценности, поскольку он хранит непрерывное расстояние границ и внутренние структурные сигналы, заимствованные из манхэттенской планировки. Термин с точным произведением измерял совместимость между семантическим видом и геометрическим априором, тогда как аддитивный структурный член λS смещал веса внимания в сторону пикселей на той же физической плоскости или близко к тому же архитектурному контуру. Коэффициент λ отражал доверие к извлеченному структурному априору и контролировал, насколько жёсткие ортогональные ограничения были включены в распределение внимания. Эта формула снизила диффузию пограничных признаков, вызванную окклюзией мебели, и сохранила адаптивную релаксацию в планировках вне Манхэттена. Распределение внимания, управляемое структурой, было рассчитано согласно уравнению 1.

Уравнение 1: figure-protocol-3

где A обозначает структурно ориентированную матрицу агрегации внимания, Q — тензор запроса, генерируемый визуальными признаками, K — ключевой тензор, порождённый априорными признаками SDF, V — тензор значений, порождённый структурными априорными представлениями, dk — размерность признаков ключевого тензора, λ — адаптивный структурный коэффициент веса, используемый для идентификации геометрической уверенности локальных областей и ослабления жёстких ортогональных ограничений в не-манхэттенском пространстве макетов, а S обозначает матрицу аффинности SDF. Деление на dk стабилизировало масштаб логиков внимания и предотвратило создание чрезмерно концентрированных весов внимания крупными размерами. Нормализованная экспоненциальная функция (см. Таблицу материалов) преобразовывала модулированные оценки сходства в нормированное пространственное распределение, позволяя каждому пикселю агрегировать структурную априорную информацию на основе семантической и геометрической согласованности. Этот дизайн объясняет, почему визуальный облик и априоры архитектурных границ объединены на уровне внимания, а не прямой конкатенацией признаков.

Граф топологии суперпикселей был построен на основе структурно-выровненной карты признаков. Карта объектов была сегментирована с помощью алгоритма генерации пространственных регионов. Число суперпикселя было установлено на 256, коэффициент компактности — на 10, коэффициент сглаживания по Гауссу — на 1,0, а число итераций — на 10. Ограничения на пространственную близость обеспечивались за счёт установки массового веса расстояния на постоянное отношение 1,0 к расстоянию между цветовым пространством признаков во время кластеризации, что сохраняло равномерную генерацию узлов на плотных границах помех. Пиксели с однородными семантическими ответами агрегировались в суперпиксельные узлы. Рёбра графов строились с учётом пространственных смежных отношений, силы аффинности SDF и копланарных геометрических согласованных ограничений. Процесс построения структурной матрицы аффинности и топологической связности показан на рисунке 3, где показано, как руководство SDF было преобразовано в пространственные отношения на уровне графов.

Формулировка графов была введена для преобразования плотных пиксельных рассуждений в пространственное мышление по узлам по однородным структурным областям. Каждый узел суперпикселя представлял локальную область с аналогичным семантическим откликом и пространственной непрерывностью, а каждое ребро представляло собой надёжный путь передачи признаков с учётом смежности, аффинности расстояния и поля и копланарной согласованности. Такая конструкция снижала влияние изолированных шумных пикселей и позволяла закрытым зонам стен, пола и потолка получать сообщения от физически соседних узлов. Конструкция рёбер, таким образом, служила математическим мостом между непрерывным наведением SDF и дискретным неевклидовым графовым рассуждением.

Была сконфигурирована трёхслойная графовая сверточная сеть с скрытыми размерами признаков 512, 256 и 128. Графовый сверточный слой выполнял сглаживание признаков по структуре графа на основе пространственных отношений узлов. Смежность с самопетлями сохраняла исходное состояние каждого узла при передаче сообщений, предотвращая стирание особенностей небольшой структурной области окружающими большими областями. Симметричная нормализация масштабировала элементы матрицы смежности на произведение обратных квадратных корней степеней узлов, так что узлы высокой и низкой степени вносили вклад при сопоставимых числовых величинах во время распространения. Прямое распространение осуществляло локализованную пространственную агрегацию, при которой каждое состояние узла поглощало высокомерные особенности из соседних копланарных кластеров до применения функции нелинейного выпрямления по элементам. Эта формулировка делала слой свёртки графа приближённым к семантической диффузии вдоль физически значимых внутренних плоскостей, а не к неограниченному сглаживанию по границам несвязанных объектов. Признаки узлов графа оценивались согласно уравнению 2.

Уравнение 2: figure-protocol-4

Проекция от плотных пиксельных признаков к суперпиксельным узлам, передача сообщений с графовой свёрткой и координатная обратная проекция представлены на рисунке 4, что уточняет путь агрегации признаков от регулярных сеток изображений к неевклидовой топологии и обратно к плотному семантическому представлению. Проекция от плотных пиксельных особенностей на рисунке 4A на суперпиксельные узлы на рисунке 4B, передача сообщения с графовой свёрткой на рисунке 4C и координатная обратная проекция на рисунке 4D проясняют путь агрегации признаков от регулярных сеток изображений к неевклидовской топологии и обратно к плотному семантическому представлению.

где H(l) обозначает тензор признаков узлов слоя свёртки l-го графа, Â — матрицу смежности с самопетляционными соединениями, D — матрицу степеней, соответствующую матрице смежности, W(l) — обучаемую матрицу весов слоя свёртки l-го графа, а σ — функцию активации ректифицированной линейной единицы. Термин ÂH(l) объединял признаки соседних суперпиксельных узлов, тогда как D−1/2 и D−1/2 уравновешивали вклад узлов с разной плотностью соединений. Обучаемая матрица W(l) проецировала агрегированные узловы в новое семантическое пространство, позволяя графовому слою отличать структурную согласованность от обычной пространственной близости. Нелинейная активация сохраняла разницу в ответах между копланарными и некопланарными областями после агрегации признаков.

Особенности семантической сегментации декодировались после рассуждения на основе графов. Декодер был построен с использованием трёх этапов билинейной интерполяции и операций синтеза с пропуском соединения между слоями. Поверхностные пространственные признаки кодировщика были объединены с высокоуровневыми семантическими декодерами посредством канального синтеза. Разрешение признаков было восстановлено до исходного размера изображения, а окончательная семантическая карта вероятностного прогнозирования была сгенерирована через слой свёртки 1 × 1.

Вся семантическая сеть парсинга была обучена с помощью разъединённого оптимизатора затухания веса (см. Таблицу материалов). Начальная скорость обучения была установлена на уровне 0,0001, коэффициент затухания веса — 0,01, а размер партии — 8 для обоих публичных бенчмарков. Скорость затухания первого момента была установлена на 0,9, во втором — на 0,999, а коэффициент эпсилона численной устойчивости — на 1 × 10⁻8. Потеря валидации отслеживалась в конце каждой эпохи, а контрольные точки сохранялись при увеличении mIoU на валидационном наборе. Сеть была обучена для 300 эпох с использованием стратегии затухания скорости полиномиального обучения с степенью затухания 0,9. Было проведено пять независимых обучающих запусков с использованием различных инициализаций случайного засея для установления статистически строгой базы оценки. Сеть была совместно оптимизирована с использованием потери кросс-энтропии на уровне пикселей и потери структурной согласованности. Все эксперименты проводились на вычислительной платформе, оснащённой аппаратным обеспечением для параллельных вычислений с высокой памятью, а подробная аппаратная информация была представлена в Таблице материалов.

Совместная оптимизация обеспечивала геометрическое выравнивание границ путём вычисления пространственной градиентной величины тензора вероятности класса. Потеря структурной согласованности использовалась как регуляризатор, умножая норму пространственных градиентов предсказания на непрерывные значения SDF. Математическое обоснование заключалось в том, что изменения семантических категорий должны сосредоточиться вблизи реальных архитектурных контуров, где SDF приближается к нулю, в то время как плоские стены, полы и потолочные интерьеры должны сохранять плавные семантические реакции. Когда большой градиент предсказания появлялся далеко от структурной границы, член поля расстояния увеличивал штраф и препятствовал ложным семантическим переходам внутри однородной физической плоскости. Когда градиент прогноза появлялся близко к нулевой линии, штраф оставался ограниченным и сохранял законные переходы классов вдоль архитектурных границ. Семантические переходные области были ограничены так, чтобы они совпадали с нулевой дистанцией SDF, как указано в уравнении 3.

Уравнение 3: figure-protocol-5

где Ltotal обозначает конечную функцию оптимизации,L ce — потерю на уровне пикселей на перекрестной энтропии, Lscl — штрафные потери структурной согласованности, а α — коэффициент веса структурных потерь. Термин кросс-энтропии обеспечивал семантический надзор на уровне пикселей с помощью аннотационных масок, тогда как термин структурной согласованности навязывал геометрическую регуляризацию с использованием архитектурных априоров. Коэффициент веса α сбалансированное распознавание категорий и выравнивание границ, предотвращая перенагонку в оптимизации как локальной точности маркировки, так и жёстких структурных контуров. Эта совместная цель связала визуальную семантику, физическую согласованность границ и обучаемые параметры сети в рамках единой цели оптимизации.

Результаты

Экспериментальная установка

В этом исследовании использовались два стандартных набора данных по разбору сцен в помещении — крупномасштабный 3D-набор для внутренней и RGB-D набор данных для внутренней сцены — для оценки производительности и настройки модели. Крупномасштабный внутренний 3D-набор данных содержит реалистично сканируемые, сложные сцены физического пространства и высококачественные RGB-виды, обеспечивая высокоточные пиксельно-пиксельные 3D-семантические метки точечного облака и 2D пространственно-проекционные сегментационные маски. Её по своей сути реалистичные данные реконструкции сетки в физическом пространстве и свойства ортогональной плоскости устанавливают критерий сравнения геометрической истинности для точного построения 3D-ограничивающего ящика Манхэттена в ветке экстракции. Набор данных RGB-D по внутренней сцене содержит глубинные изображения внутри помех, скрытые мебелью и мусором, и используется для проверки глобальной точности логического мышления и устойчивости сети к окклюзиям.

Алгоритм использует mIoU для измерения пространственного перекрытия между предсказанным и истинным семантическим распределениями, а также вводит структурную граничную оценку F1 для строгой оценки точности соответствия между предсказанной маской и рёбрами физической структуры с нулевым расстоянием, откалиброванными SDF. Фиксированный порог ошибки расстояния пикселей в евклидовом пространстве устанавливается при вычислении, чтобы определить, пересекают ли пиксели краёв, создаваемые сетью, истинные физические границы зданий. Эта система двойной оценки ограничивает ошибки классификации в семантических блоках больших площадей, одновременно усиливая микроколичественную оценку эффекта топологической реконструкции жёстких линий. Для поддержания согласованности между конфигурацией экспериментальных данных и процессом оптимизации масштаб набора данных и гиперпараметры основного обучения были суммированы в таблице 2. Таблица 2 содержит одну авторитетную экспериментальную конфигурацию для переработанной рукописи. Крупномасштабный внутренний 3D-бенчмарк использует 1201 обучающую и 312 валидационных сцен, RGB-D — 795 обучающих и 654 тестовых изображений, а оба бенчмарка обучены с размером партии 8, начальной скоростью обучения 0,0001, коэффициентом снижения веса 0,01 и 300 тренировочными эпохами.

Сравнение с современными методами

Перед представлением количественной сравнительной таблицы алгоритмов разбора сцен в помещении, этот раздел строго определяет тестовые ориентиры, используемые в многомерной системе оценки. Чтобы отразить классификационные характеристики модели при различных деталях, система оценки дополняет тестовую систему двумя дополнительными метриками: глобальной точностью пикселей (PixelAcc) и точностью среднего класса (MeanAcc). Эти метрики вместе создают детальную систему проверки эффективности алгоритма, устанавливая строгий теоретический ориентир для последующих количественных анализов. Для оценки точности семантического разбора и устойчивости к окклюзии предлагаемого алгоритма в сложных физических пространствах были проведены сравнительные тесты с существующими алгоритмами на наборе RGB-D для проверки внутренней сцены. Библиотека сравнительных моделей охватывает базовые фреймворки маски-внимания, иерархические трансформеры, современные чисто сверточные сегментационные конвейеры, унифицированные архитектуры плотного прогнозирования и сети внимания между каналами. Оценка бенчмарка была расширена, включив в себя базовую сегментацию на основе трансформаторов, унифицированную базу для прогнозирования плотности, унифицированную базу для обнаружения и сегментации, базу основы для крупномасштабного зрения, чисто сверточную базовую линию, базу сегментации на основе внимания с маской и базу для агрегации кросс-модальных признаков и базовую линию прогрессивного слияния признаков (см. Таблицу материалов)), используя тот же набор проверки внутренней сцены RGB-D, разрешение входов, график обучения и метрический протокол. В предлагаемой архитектуре структурно управляемая сеть интегрирует многомасштабный визуальный магистраль с сдвиговым окном, модуль перекрёстного внимания, управляемый структурой с SDF и суперпиксельный GCN. Расширенное сравнение охватывает предсказание плотности на основе трансформаторов, свёрточный анализ плотности, парсинг маски и внимания, кроссмодальное слияние признаков и парадигмы прогрессивного слияния признаков, что позволяет оценить вклад явного 3D-геометрического пограничного вмешательства в более широкие базовые линии парсинга сцены в помещении.

Таблица 3 подробно описывает объективную оценку каждой сети по основным количественным метрикам, с отчётом о средних значениях и соответствующих стандартных отклонениях по пяти независимым запускам. Расширенное базовое сравнение оценивает, способствует ли предложенный структуроориентированный механизм рассуждения повышению точности за пределами стандартных плотных систем предсказания, масочных сегментационных сетей и сетей слияния признаков RGB-D. Экспериментальные данные показывают, что предлагаемый алгоритм достигает стабильного прироста по всем четырём количественным метрикам. Плотные сети предсказания на основе трансформаторов и маски-внимание сохранили сильные возможности глобального контекстного моделирования, однако их значения Границы F1 оставались ниже при наличии помех на переднем плане, поскольку прогнозируемые маски не имели явных физических граничных ограничений. Кроссмодальные и прогрессивные сети синтеза улучшали локальную семантическую непрерывность, но их слияние признаков по-прежнему основывалось преимущественно на внешнем виде и глубинных реакциях, а не на структуре априор-сигнала с ознакомленным расстоянием. Предлагаемая структурно управляемая сеть достигла mIoU 0,687 со стандартным отклонением 0,002 и средним баллом по границе F1 0,764 со стандартным отклонением 0,003. Расширенное сравнение показывает, что прирост производительности был обусловлен не исключительно увеличением плотного основания прогноза, но и совместным использованием поля управления по знаковым расстояниям, структуроориентированного перекрестного внимания и графового топологического рассуждения.

Для анализа глобальной точности логического мышления модели при окклюзиях мы выявили и извлекли типичные сценарии из набора валидации, которые были сильно затруднены мебелью и другим помехом, а также создали визуализации масок прогнозирования на уровне пикселей.

После метода рабочий процесс и процесс графового рассуждения были определены на рисунках 1, 2, 3 и 4. Рисунок 5 иллюстрирует различия в морфологических прогнозах между моделями при экстремальных условиях окклюзии. Красные прямоугольники на качественной сравнительной сетке обозначают ключевые конфликтные зоны, где углы и несущие поверхности закрыты. Выходная маска с базовой сегментации на основе внимания маски демонстрирует выраженное сглаживание краёв и межклассовую адгезию. Хотя базовая линия агрегации кросс-модальных признаков и прогрессивная базовая линия слияния признаков включают кроссмодальные данные, их прогнозные результаты всё ещё демонстрируют структурные разрывы классов и физические искажения границ. Маска, созданная этим предложенным методом, демонстрирует большое пространственное перекрытие с метками ground-truth. Базовые модели, ограниченные исключительно пиксельными принципами, склонны терять свои локальные рецептивные поля при окклюзии. Предлагаемый метод использует суперпиксельный GCN для передачи сообщений в неевклидовом пространстве, тем самым реконструируя подлежащие углы и линейные пространственные скелеты, руководствуемые неявными геометрическими границами. Это подтверждает антиинтерференционную эффективность предлагаемого нами решения при решении сложных внутренних планировок с визуальной морфологической точки зрения.

Эксперимент абляции

Для анализа фактического вклада каждого независимого компонента в предлагаемую архитектуру было построено расширенное модульное абляционное испытание на наборе RGB-D для проверки сцены в помещении. Тестовая базовая линия была установлена на обычную классификационную сеть с визуальным основным основным вектором трансформатора с сдвивным окном. Количественная оценка измеряла независимый вклад структурно-ориентированного перекрёстного внимания, смещения поля со знакомыми расстояниями, адаптивного структурного взвешивания, рассуждения на суперпиксельных графах, построения копланарных ребер, нормализации симметричных графов и потери структурной согласованности. Расширенная абляционная конструкция отделяла накопленные прибыли модуля от эффектов удаления компонентов, делая границу вклада каждого проектного решения более чёткой.

Таблица 4 и рисунок 6 иллюстрируют эволюцию точности при расширенных накопленных и удалённых настройках абляции. Сеть трансформаторов с сдвигом базового окна не имеет трёхмерных физических границ, что приводит к ограниченной агрегации признаков в перегруженных фонах. Добавление структурно-ориентированного перекрёстного внимания увеличило mIoU с 0,615 до 0,648, а балл Границы F1 — с 0,630 до 0,685, что показало, что ранее поле с отмеченным расстоянием улучшало выравнивание визуальных объектов и структурных контуров. Добавление рассуждения на основе суперпиксельных графов увеличило mIoU до 0,641 и балл Границы F1 до 0,676, что указывает на то, что топологическое рассуждение по узлам улучшало семантическую согласованность в однородных физических областях. Добавление потери структурной согласованности только увеличило mIoU до 0,632, а балл Границы F1 — до 0,662, что показало, что термин потерь в основном влияет на подгонку границ, а не на широкую контекстную агрегацию.

Сочетание перекрёстного внимания с графическим мышлением увеличило mIoU до 0,669, а балл Границы F1 — до 0,721, что показало, что визуально-структурное выравнивание и передача сообщений в графовой области вызывают взаимодополняющие эффекты. Сочетание перекрёстного внимания с потерей структурной согласованности дало mIoU 0,660 и результат Границы F1 0,713, а сочетание графового рассуждения с потерей структурной согласованности дало mIoU 0,653 и балл Границы F1 0,704. Эти парные результаты показывают, что модуль перекрёстного внимания обеспечивал основной геометрический сигнал выравнивания, модуль графического рассуждения расширял этот сигнал по копланарным регионам, а потеря структурной согласованности уточняла границу семантических переходов во время оптимизации.

Абляция на основе удаления дополнительно прояснила вклад внутренних проектных решений. Удаление аддитивного смещения поля по знаковым расстояниям снизило mIoU до 0,656, а показатель Границы F1 — до 0,698, подтвердив, что структурная матрица аффинности была центральной для подавления диффузии признаков через границу. Удаление коэффициента адаптивного структурного веса λ снизило mIoU до 0,671, а балл Границы F1 — до 0,736, что указывает на фиксированное структурное ограничение ослабляло реакцию модели в регионах вне Манхэттена и визуально деградированных. Снятие ограничения на копланарные ребра снизило mIoU до 0,666, а балл Границы F1 — до 0,728, что показало, что рёбра графов, основанные только на локальной смежности, не смогли сохранить физическую согласованность плоскости. Удаление нормализации симметричного графа снизило mIoU до 0,673 и показатель Граничного F1 до 0,737, что указывало на необходимость сбалансированного распространения по степени для стабильной агрегации узлов. Вся предлагаемая структурно управляемая сеть достигла mIoU 0,687 и балла Boundary F1 0,764, демонстрируя, что итоговое приобретение было результатом координированного взаимодействия между структурным вниманием, графовым рассуждением и оптимизацией, ориентированной на границы.

Анализ вычислительной сложности, времени обучения и эффективности выводов

Для оценки вычислительной стоимости извлечения SDF, структурированного перекрестного внимания и сверточного мышления суперпиксельного графа, в этом исследовании были оценены масштаб параметров, операции с плавающей точкой, максимальное использование памяти, время обучения, задержка вывода по одному кадру, частота кадров и mIoU на одной вычислительной платформе. Операции с плавающей запятой рассчитывались при входном разрешении 512 × 512. Задержка вывода измерялась с размером партии 1 после прогрева модели, тогда как сообщаемая частота кадров рассчитывалась на основе средней задержки одного изображения. Время обучения измерялось по тому же графику из 300 эпох, размер партии 8, настройки оптимизатора и конвейер предварительной обработки данных.

Таблица 5 подробно описывает связь между масштабом модели, стоимостью обучения, эффективностью вывода и точностью парсинга для каждой архитектуры сети. Столбцы mIoU и Boundary F1 в Таблице 5 используют те же общие значения валидационного набора для каждой соответствующей модели, что и Таблица 3 . Эти два столбца точности повторяются в таблице 5 исключительно для сравнения точности парсинга с вычислительными затратами. Увеличение обучаемых параметров было в основном связано с проекционными слоями проекции ключа запроса в структурно-ориентированном модуле перекрестного внимания и матрицами весов трёх сверточных слоёв графов. Затраты на необучаемость в основном были связаны с генерацией SDF, разбиением суперпикселей и построением смежности графов. Поскольку эти необучаемые операции выполнялись один раз для каждого входного изображения, они увеличивали задержку вывода, но существенно не увеличивали количество обучаемых параметров. Это разделение объясняет, почему предложенный метод показал умеренное увеличение параметров, но более заметное увеличение задержки. Результаты сложности показывают, что базовая сегментация на основе внимания маски сохраняла меньшее количество параметров и меньшую задержку вывода, но её показатель Boundary F1 и mIoU были ограничены при сильной окклюзии из-за отсутствия в сети явных геометрических указаний границ. Кроссмодальная агрегация признаков требовала большего количества операций с плавающей запятой и более длительного времени обучения, поскольку кроссмодальная агрегация добавляла дополнительные расходы на выравнивание признаков. Исходная линия прогрессивного синтеза признаков сохраняла умеренные вычислительные затраты, но точность прогнозирования оставалась ниже, чем у предлагаемого метода при граничном искажении. Предлагаемая структурно управляемая сеть требует дополнительных вычислительных затрат из-за строительства SDF, структурной перекрестной проекции, построения суперпиксельных графов и распространения свёртки графов. Полная модель использовала 66,8 миллиона параметров, 121,4 миллиарда операций с плавающей точкой, 15,6 часа обучения, 7,9 ГБ максимальной памяти, 61 мс времени вывода за один кадр и 16,4 кадра в секунду. Хотя задержка вывода была выше, чем у чистой базовой линии маски-внимание, модель достигла mIoU 0,687 и балл Boundary F1 0,764, что указывает на то, что дополнительные затраты в основном поддерживали структурное исправление границ и семантическую согласованность с топологией.

Для визуального представления двумерного пространственного баланса между вычислительным масштабом и аналитической точностью модели была создана диаграмма пузырькового распределения, показывающая количество операций с плавающей запятой и mIoU алгоритма. Пересмотренная визуализация также отражала время обучения и задержку вывода в области аннотации рисунков, что позволило сравнивать прирост точности и вычислительные затраты как с точки зрения обучения, так и с точки зрения развертывания. Горизонтальная ось сохраняла операции с плавающей точкой, вертикальная ось — mIoU, размер пузыря — обучаемую величину параметров, а прилагаемая метка указывала время вывода для каждого метода.

Рисунок 7 показывает взаимосвязь между операциями с плавающей запятой, масштабом параметров, задержкой вывода и точностью разбора. Предлагаемый метод обеспечивает более высокий mIoU, чем сравнительные сети, при этом его FLOP и количество параметров остаются близки к кросс-модальной и прогрессивной термоядерной базе. Однокадровая задержка в 61 мс указывает на то, что добавленные ветки SDF и графового мышления создавали дополнительные расходы на развертывание, однако задержка оставалась в пределах реального времени, необходимого для многих задач интерпретации сцен в помещении. Время обучения увеличилось до 15,6 часов, поскольку в каждом этапе обучения выполнялись структурные предварительные методы, проекция внимания и графическое мышление. Этот результат показывает, что вычислительная стоимость предлагаемого метода в основном сосредоточена на структурном рассуждении с учётом границ, а не в неконтролируемом расширении параметров.

Конкретное сравнение потери структурной согласованности и пространственного расстояния

Потеря в сети обратного преобразования для квантования расстояния пространственного преобразования границ использует параметры гомоморфного преобразования для захвата смещений границ, демонстрируя, что чистые метрики пространственного расстояния превосходят традиционные потери на перекрестной энтропии, основанные на изменениях меток пикселей. Основываясь на этом теоретическом консенсусе, параллельные эксперименты по валидации проводятся с использованием схем граничного ограничения для оценки сравнительной эффективности кастомной потери структурной согласованности (SCL) на основе манхэттенских ограничивающих коробок с точки зрения адаптивности сцены. Эксперименты сохраняют аналитическую архитектуру слияния многомасштабного визуального магистрали с сетью графовых выводов, при этом просто заменяя термин потери границы во время обратного распространения. Конфигурированы четыре параллельные сети валидации: сеть, использующая только базовую классификацию потерь кросс-энтропии, лишена геометрических ограничений для высокоразмерных размеров; сеть с добавленной стандартной потерей по бинарной перекрестной энтропии (BCE) выполняет традиционный надзор по классификации бинарных границ; сеть с добавленной потерей пространственного расстояния на границе сосредоточена на фиксации локальных деформаций; а сеть, использующая предложенный SCL, накладывает ортогональные топологические штрафы на основе SDF. Метрики квантования в наборе валидации RGB-D в помещении ограничены mIoU и структурной границей F1.

Таблица 6 подробно описывает степень вмешательства различных стратегий обратной оптимизации на базовую пространственную логическую когницию. Статья только с перекрёстной энтропией в таблице 6 обозначает предложенную архитектуру ours, обученную исключительно с потерей кросс-энтропии на уровне пикселей, при этом сохраняя без изменений ветвь визуального хребта, ветвления поля со знаковым расстоянием, модуль кросс-внимания, управляемый структурой, и ветвь рассуждения суперпиксельного графа. Эта запись не является базовым уровнем Mask2Former и не должна сравниваться с общим значением Mask2Former в Таблице 3, так как используется та же модель. Сети, опирающиеся исключительно на базовые потери перекрестной энтропии, получают наименьший балл приравнивания границы. Сети с дополнительной стандартной потерей двойной границы на перекрестной энтропии достигают небольшого усиления, но этот механизм всё равно вызывает размытие краёв при масштабной окклюзии. Потеря пространственного пограничного расстояния улучшает балл благодаря механизму восприятия пространственного преобразования, эффективно корректируя некоторые искажённые рёбра. Потеря структурной согласованности, предложенная в этой статье, напрямую использует реальную SDF для наложения градиентных штрафов на аномальные семантические мутации внутри физической несущей поверхности, достигая наивысшего результата F1 на структурной границе.

Для визуального сравнения движущих эффектов различных конфигураций функций потерь на точность прогноза маски и подгонку границ мы нанесли сгруппированные столбчатые диаграммы по разным стратегиям оптимизации.

Рисунок 8 иллюстрирует поэтапное улучшение производительности, возникающее при увеличении пространственно-восприятия функции потерь. Столбчатая диаграмма, отражающая оценку F1 структурной границы, показывает значительный восходящий тренд. Экспериментальные данные показывают, что этот индивидуальный механизм штрафа заставляет точное совпадание пространственного прыжка предсказанной категории с ортогональным физическим контуром. Механизм штрафа по полю расстояния, адаптированный для ортогональных априоров в помещениях, достигает более высокой точности, чем общие потери при захвате границ пространственной границы, тем самым устанавливая эффективный путь оптимизации для устранения сложных неисправностей зданий.

Проверка устойчивости при экстремальном распределении окклюзии, аномальных структурах и сложных условиях освещения

Сложные пространственные отношения между объектами и взаимная окклюзия негативно влияют на глобальное 3D-пространственное познание. Совместная архитектура прогнозирования подчёркивает вспомогательную роль ограничений на расположение сцены при извлечении базовой маски. Анализ ограничений антиинтерференции алгоритма при потере визуального сигнала на большой площади и аномальных пространственных раскладок, нарушающих 3D-ортогональное физическое предположение, чётко определяет эффективную границу применения алгоритма и имеет основную, доказуемую ценность. Исходя из доли крупномасштабной мебели, замаскированной на этикетках ground-truth, тестовый набор RGB-D для внутренней сцены делится на три постепенно более сложных подгруппы: лёгкую, умеренную и сильную окклюзию. Одновременно нетипичные для Манхэттена сцены с наклонными потолками или изогнутыми стенами вручную извлекаются для создания тестовых наборов границ аномалий, а сцены с крайне слабым освещением, переэкспонированием и большой площадью глянцевыми или прозрачными стеклянными поверхностями классифицируются на сложные подмножества освещения и текстуры. Библиотека сравнительной модели включает базовую сегментацию на основе внимания маски; общая архитектура сегментации, основанная на маске для захвата глобального контекста; базовую базу кросс-модальной агрегации признаков с использованием комплексной кроссмодальной стратегии агрегирования; и базовый уровень прогрессивного синтеза признаков с интеграцией многоступенчатого механизма экстракции прогрессивных признаков. Каждая базовая линия сравнения, визуальный магистраль слияния и архитектура сетевого разбора графов, построенная в этой статье, независимо оцениваются на вышеуказанных подмножествах, а статистически анализируется градиент затухания точности каждой модели.

Таблица 7 отражает метрики устойчивости, специфические для подмножества, при лёгкой, умеренной и тяжёлой окклюзии, сложном освещении, интерференции текстуры и не-манхэттенских аномалий. Таблица 7 подробно описывает изменения точности прогнозирования маски в различных моделях при пространственных интерференциях. Таблица 7 отражает значения mIoU, специфичные для подмножества, для различных моделей при условиях пространственной интерференции, рассчитанных только в соответствующем подмножестве окклюзии, освещения, текстуры или не-Манхэттена, а не на общем наборе RGB-D для проверки сцены в помещении. В подмножествах с лёгкой и умеренной окклюзией все модели сохраняют базовую точность. С увеличением площади окклюзии базовые модели, основанные на пиксельных правилах, показывают уменьшение отношения пересечения-объединения (IU) на сильно окклюзионном подмножестве. Базовая сегментация на основе внимания маски и кроссмодальная агрегация признаков значительно теряют точность на этом подмножестве. Многоступенчатая архитектура прогрессивного извлечения признаков в базовой системе прогрессивного слияния признаков демонстрирует серьёзное снижение производительности. Предлагаемое решение опирается на явные 3D-скелетные особенности для принудительного выравнивания поврежденных визуальных сигналов, поддержания стабильной формы выхода маски на сильно окклюзивном подмножестве и демонстрации топологической стабильности выхода семантической маски. В сложных подмножествах освещения и текстуры детектор линейных сегментов пропускает структурные края в областях с сильными отражениями и прозрачным стеклом, что приводит к локальным разрывам в SDF. Ошибочные геометрические координаты распространяются по структурной матрице аффинности и потере структурной согласованности, тем самым применяя аномальные градиентные штрафы к семантическим признакам и вызывая соответствующие отклонения в прогнозах границ. Глобальный механизм пространственного контекста GCN дополняет отсутствующие геометрические априоры смежными структурными аффинностями, поддерживая общую точность парсинга в допустимом диапазоне распада и раскрывая границы визуального восприятия алгоритма при сложных физических интерференциях. В не-манхэттенском подмножестве аномалий SDF априор на нижнем слое этой модели вводит небольшое смещение картирования, что приводит к немного более низкой производительности, чем исходная линия прогрессивного слияния признаков. Коэффициент адаптивного структурного взвешивания в модуле перекрёстного внимания динамически оценивает согласованность градиентов базовой физической структуры. В сценах с изогнутыми стенами или наклонными потолками этот коэффициент автоматически уменьшает вес ограничения SDF, побуждая сеть полагаться на механизм агрегации локальных узлов признаков в суперпиксельной графовой сети для поддержания семантической когерентности в однородных областях, тем самым создавая эффективный механизм геометрической компенсации для пространственных структур вне Манхэттена.

Чтобы визуально продемонстрировать негативное влияние тяжести окклюзии на точность разрешения, мы построили линейные графики, показывающие снижение точности в различных моделях алгоритмов.

Рисунок 9 визуально показывает различия в устойчивости между различными парадигмами извлечения признаков в экстремальных физических условиях. Три пунктирные линии, представляющие базовые модели, демонстрируют значительный нисходящий тренд на сильно окклюзионных узлах, отражая ограничения традиционных рецептивных полей при извлечении признаков при крупномасштабных потерях сигнала. Сплошная линия, представляющая предлагаемый метод, сохраняет относительно плавную траекторию распада. Экспериментальные данные показывают, что связь между явными 3D-архитектурными априорами и механизмами вывода на основе графов обеспечивает структурную поддержку для задач разбора сцен, устойчивых к окклюзии, и улучшает производительность обобщения моделей в сложных средах.

Анализ пространственной чувствительности при разбиении узлов графов топологии

Параметр частоты дискретизации с уменьшением размерности в модуле свёртки графа координатного пространства напрямую контролирует качество рецептивного поля и вычислительную нагрузку графовой сети. В соответствии с теоретической основой данной статьи, исследование исследует, как количество дискретных графовых узлов, образующихся при простой линейной итеративной кластеризации, влияет на эффективность неевклидовского топологического вывода, с целью обеспечить строгую поддержку выбора гиперпараметров. Проводились эксперименты для корректировки параметров управления инициализацией алгоритма кластеризации, насильно вмешиваясь в динамическое уменьшение размерности пространства признаков, устанавливая количество разделов узлов графа суперпикселей на уровне 64, 128, 256, 512 и 1024. В строго выровненном тестовом бенчмарке среднее соотношение пересечения над объединением (IoU), структурный балл F1 и среднее время вывода на одно изображение высокого разрешения фиксировались одновременно при различных топологических размерах узлов.

Таблица 8 подробно описывает связь между степенью динамического уменьшения размерности в пространстве признаков и аналитической точностью и вычислительной стоимостью. Установка слишком низкого количества узлов приводит к недосегментации объектов изображения, что приводит к слиянию семантических характеристик малых объектов с крупномасштабными стенами, что снижает различные метрики точности. По мере увеличения масштаба разделения узлов чувствительность модели к локальным пространственным деталям значительно улучшается. Увеличение числа узлов до 512 и 1024 приводит к фрагментации однородных областей, ослабляет эффект сглаживания макроскопических особенностей в графовых нейронных сетях, увеличивает размерность матрицы связей узлов и увеличивает время вывода. Конфигурация параметров с фиксированным количеством узлов 256 приводит к наибольшим значениям для отношения пересечения-объединения и граничного балла.

Для визуального представления компромисса между точностью и вычислительной мощностью в неевклидовом топологическом выводе был построен биосный статистический график, показывающий чувствительность размера узла.

Рисунок 10 иллюстрирует логику, по которой количество дискретных графовых узлов влияет на развитие особенностей сети. Фоновая полоса, обозначающая время вычисления, показывает резкое увеличение после того, как количество узлов превышает порог в 256. Двойная линия, обозначающая точность, достигает пика на 256 по горизонтальной оси, затем значительно снижается из-за эффекта фрагментации. Объективные количественные данные и тенденция визуальной эволюции весьма согласованы, демонстрируя, что поддержание размера графа вычислений на уровне 256 узлов обеспечивает баланс между аппаратной обработкой и логическим мышлением в текущей конфигурации с фиксированными параметрами. Серьёзное снижение производительности, вызванное отклонением от этого количества узлов, выявляет высокую чувствительность стратегии сегментации фиксированных суперпикселей к гиперпараметрической настройке и подчеркивает необходимость разработки динамического механизма выбора узлов.

ДОСТУПНОСТЬ ДАННЫХ:

Исходные эталонные данные, проанализированные в этом исследовании, доступны публично из официальных репозиториев, перечисленных в Таблице материалов. Крупномасштабный внутренний 3D-бенчмарк был представлен как официальный релиз ScanNet v2 с идентификатором релиза датасета ScanNet v2. Бенчмарк RGB-D для внутренней сцены был доступен через официальный релиз NYU Depth Dataset V2 с идентификатором релиза NYU Depth Dataset V2. Описательное издание DOI для крупномасштабного внутреннего 3D-бенчмарка — 10.1109/CVPR.2017.261, а описательное издание DOI для бенчмарка RGB-D внутренней сцены — 10.1007/978-3-642-33715-4_54. В этом исследовании не было создано новых RGB-D изображений или наборов данных. Обработанные разделённые файлы, обучающие конфигурационные файлы, исходные журналы оценки, числовые исходные файлы, поддерживающие таблицы 2, таблицы 3, таблицы 4, таблицы 5, таблицы 6, таблицы 7 и таблицы 8 , а также рисунок 5, рисунок 6, рисунок 7, рисунок 8, рисунок 9 и рисунок 10, обученные веса модели и исходный код были размещены в Figshare под DOI: 10.6084/m9.figshare.32906765. Запись figshare предоставляет полные исходные данные результатов, необходимые для воспроизведения количественных таблиц и цифр, представленных в этой рукописи. Репозиторий содержит маски предсказаний, файлы оценки границ, скрипты вычисления метрик, контрольные точки модели и исходные файлы таблиц, используемые для отчетного mIoU, границы F1, PixelAcc, MeanAcc, вычислительной сложности, надёжности, проверки функции потерь и анализа чувствительности по разделению узлов.

figure-results-1
Рисунок 1: Сравнение семантической разрывности и структурных эффектов предварительного восстановления в сложных случаях окклюзии в помещениях. (A) Оригинальное RGB-изображение с крупномасштабной окклюзией мебели. (B) Вывод традиционной базовой модели, подчеркивающей физические искажения границ и дефекты семантических разрывов. (C) Вывод предложенного метода с наложением на циановую пунктирную перспективу, которая явно отображает 3D-скелет здания для топологического ремонта повреждённых элементов подлежащей конструкции. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-2
Рисунок 2: Общая семантическая структура парсинга, основанная на структурных априорах здания. Диаграмма описывает полный конвейер, начиная от входа изображения RGB, через ветвь визуального извлечения признаков с сдвинутым окном и ветвь предварительной экстракции структуры, затем в модуль структурного перекрестного внимания, затем топологическое рассуждение через суперпиксельный GCN и, наконец, декодирование в плотную семантическую карту. Подробные схемы расчёта матрицы аффинности внимания, передачи графовых сообщений и совместных функций оптимизационных потерь представлены справа. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-3
Рисунок 3: Блок-схема матрицы аффинности и построение топологической связности. Диаграмма подробно описывает пошаговый математический конвейер отображения, показывая преобразование от входной карты поля расстояний и выбранных пар пикселей через непрерывное извлечение геометрических потенциальных признаков и оценку градиентной согласованности в нормализованную матрицу аффинности, используемую как явное пространственное смещение для механизма перекрёстного внимания. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-4
Рисунок 4: Схематическая схема проекции узлов свёртки суперпиксельного графа и агрегации признаков . Панель подробно описывает неевклидов топологический процесс: (A) плотные пиксельные особенности, показывающие исходную локальную матрицу признаков и границы кластеризации суперпикселей; (B) построение топологии суперпиксельного графа, отображающее регулярную сетку в дискретные узлы и физически связанные рёбра; (C) передача графовых сверточных сообщений, выполняющая направленную агрегацию локальных признаков; и (D) координатная обратная проекция, представляющая восстановленные макроскопические семантические признаки согласованности на плотной сетке. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-5
Рисунок 5: Диаграмма качественной сравнительной сетки. Матрица предоставляет визуальную оценку производительности в различных рядовых внутренних сценах, сравнивая исходные входы RGB в помещении и макеты ground-truth с выходами базовой сегментации на основе внимания масок, базы агрегации кросс-модальных признаков, прогрессивной базовой линии слияния признаков и предлагаемого метода, который успешно восстанавливает окклюзированные углы и выравнивает несущие поверхности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-6
Рисунок 6: Результаты абляции для кумулятивного интегрирования модулей. Диаграмма с двумя осями демонстрирует пошаговую эволюцию производительности в различных модульных настройках абляции, отображая устойчивую восходящую траекторию среднего пересечения по объединению (mIoU) в виде баров и структурную оценку границы F1 в виде линейного графика от базового магистрали до полной структуры. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-7
Рисунок 7: Вычислительная сложность, время обучения и распределение эффективности выводов. Многомерный пузырьковый график показывает компромиссы между вычислительными накладными расходами и точностью парсинга. Горизонтальная ось измеряет операции с плавающей запятой (FLOPs), вертикальная — mIoU, размер пузыря — масштаб обучаемых параметров, а соседние текстовые метки показывают задержку вывода по одному кадру для каждой сетевой архитектуры. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-8
Рисунок 8: Гистограмма точности границ и метрических показателей при различных конфигурациях функций потерь . Сгруппированная столбчатая диаграмма сравнивает движущие эффекты различных стратегий оптимизации на базовую пространственную логику, иллюстрируя значительные улучшения mIoU и структурного граничного показателя F1, достигнутые при переходе от стандартных формулировок кросс-энтропии к предлагаемой потере структурной согласованности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-9
Рисунок 9: Линейный график, показывающий связь между тяжестью окклюзии и снижением производительности. Кривая отслеживает снижение точности по различным парадигмам извлечения признаков при умеренных, умеренных и сильных уровнях окклюзии, подчёркивая надёжную топологическую устойчивость и антиинтерференционные возможности предлагаемой структурно-ориентированной структурной структуры по сравнению с чисто пиксельными базовыми линиями. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-10
Рисунок 10: Анализ чувствительности масштаба узлов суперпикселя. Биаксиальный статистический график иллюстрирует компромисс между скоростью аппаратной обработки и точностью логического рассуждения при разных размерах разбиений графов, показывая, как количество суперпиксельных узлов влияет на метрики точности и приводит к резкому увеличению среднего времени вывода. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Нумерация сетевых уровнейРазмерность признаков входного узлаРазмер признаков выходного узлаВероятность случайной инактивации
15122560.15
22562560.15
32561280.1
4128640.05

Таблица 1: Таблица конфигурации гиперпараметров архитектуры сети для модуля сверточного вывода. Таблица содержит нумерацию сетевого уровня, размеры признаков входного узла, размеры признаков выходного узла и параметры вероятности случайной инактивации, используемые в графовой сети рассуждения.

Элемент конфигурацииКрупномасштабный внутренний 3D-бенчмаркБенчмарк RGB-D в помещении
Официальный идентификатор релизаScanNet v2Глубинный набор данных NYU V2
Обучающие образцы, использованные в этом исследованииСцены 1201 года795 изображений
Валидационные или тестовые образцы, используемые для оценки312 сцен валидации654 тестовых изображения
Общие семантические категории2040
Разрешение входного изображения512 × 512512 × 512
Начальная скорость обучения0.00010.0001
Пакетное количество входных выборок88
Коэффициент затухания веса0.010.01
Общие эпохи обучения300300
Количество независимых заездов55

Таблица 2: Экспериментальное разделение наборов данных и конфигурация унифицированных обучающих гиперпараметров .В таблице представлены крупномасштабные внутренние 3D-насеты данных и RGB-D набора внутренней сцены, семантические категории, настройки скорости обучения, пакетные входные выборки, скорость затухания веса и общее количество итераций обучения.

Архитектура сетевой моделиmIoUГраница F1PixelAccMeanAcc
SegFormer0,596 ± 0,0030,635 ± 0,0040,838 ± 0,0030,704 ± 0,004
ConvNeXt UperNet0,604 ± 0,0030,642 ± 0,0040,846 ± 0,0030,713 ± 0,004
Mask2Former0,612 ± 0,0030,654 ± 0,0040,853 ± 0,0030,721 ± 0,004
OneFormer0,621 ± 0,0020,663 ± 0,0030,861 ± 0,0030,733 ± 0,003
MaskDINO0,628 ± 0,0020,667 ± 0,0030,869 ± 0,0030,741 ± 0,003
CCANet0,635 ± 0,0030,671 ± 0,0040,876 ± 0,0030,745 ± 0,004
InternImage UperNet0,641 ± 0,0020,692 ± 0,0030,884 ± 0,0020,756 ± 0,003
CMPFFNet0,658 ± 0,0020,712 ± 0,0030,891 ± 0,0020,773 ± 0,003
SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Таблица 3: Общее количественное сравнение базовых уровней парсинга сцены в помещении на наборе валидации RGB-D для внутренней сцены. В таблице представлены mIoU, граничный балл F1, глобальная точность пикселей и средняя точность классов для базовой сегментации на основе внимания и маски, базы агрегации кросс-модальных признаков, прогрессивной базовой линии слияния признаков и предлагаемой архитектуры сети, управляемой структурой.

Конфигурация сетевой архитектурыmIoUГраница F1PixelAccMeanAcc
Основная основа с сдвинутым окном0,615 ± 0,0030,630 ± 0,0040,842±0,0030,706 ± 0,004
Backbone плюс структурированное перекрёстное внимание0,648 ± 0,0030,685 ± 0,0040,874 ± 0,0030,748 ± 0,004
Магистраль плюс рассуждение на основе суперпиксельных графов0,641 ± 0,0030,676 ± 0,0040,868 ± 0,0030,741 ± 0,004
Основная структура плюс потеря структурной консистенции0,632 ± 0,0030,662 ± 0,0040,859 ± 0,0030,732 ± 0,004
Магистраль плюс перекрёстное внимание и графическое рассуждение0,669 ± 0,0020,721 ± 0,0030,897 ± 0,0020,782 ± 0,003
Потери устойчивости и структурной консистенции0,660 ± 0,0020,713 ± 0,0030,889 ± 0,0020,773 ± 0,003
Основная структура плюс графическое рассуждение и потеря структурной согласованности0,653 ± 0,0030,704 ± 0,0030,881 ± 0,0030,765 ± 0,003
Полная модель без аддитивного смещения полей со знаковым расстоянием0,656 ± 0,0030,698 ± 0,0040,884 ± 0,0030,761 ± 0,004
Полная модель без адаптивного структурного взвешивания λ0,671 ± 0,0020,736 ± 0,0030,904 ± 0,0020,792 ± 0,003
Полная модель без копланарного ограничения на ребра0,666 ± 0,0020,728 ± 0,0030,899 ± 0,0020,786 ± 0,003
Полная модель без нормализации симметричного графа0,673 ± 0,0020,737 ± 0,0030,906 ± 0,0020,795 ± 0,003
Полный SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Таблица 4: Расширенный количественный абляционный анализ основных компонентов. В таблице представлены кумулятивная интеграция модулей, попарные комбинации модулей и настройки удаления компонентов для количественной оценки независимого и кооперативного вклада структурного перекрёстного внимания, смещения поля по знаковым расстояниям, адаптивного структурного взвешивания, рассуждения на суперпиксельных графах, построения копланарных ребер, нормализации симметричного графа и потери структурной согласованности.

Архитектура сетевой моделиПараметрыFLOPsПиковая памятьВремя обученияВремя выводаFPSmIoUГраница F1
SegFormer83,7 м80,1 G6,1 ГБ10,6 ч44 мс22.70.5960.635
ConvNeXt UperNet60,2 м91,5 G6,4 ГБ11,2 часа47 мс21.30.6040.642
Mask2Former44,0 м74,6 G5,8 ГБ9,4 часа41 мс24.40.6120.654
OneFormer64,1 м103.2 G7,0 ГБ12,9 ч55 мс18.20.6210.663
MaskDINO52,8 м96,8 G6,8 ГБ12,1 ч52 мс19.20.6280.667
CCANet63,5 м118,7 G7,6 ГБ14,8 ч67 мс14.90.6350.671
InternImage UperNet70,4 м112,3 G7,4 ГБ14,2 часа64 мс15.60.6410.692
CMPFFNet58,9 м104,6 G7,1 ГБ13,1 ч59 мс16.90.6580.712
SGCA_GCN66,8 м121,4 G7,9 ГБ15,6 ч61 мс16.40.6870.764

Таблица 5: Сравнение вычислительной сложности, времени обучения и эффективности вывода с общей точностью валидационных наборов. Таблица содержит обучаемые параметры, операции с плавающей точкой, пиковое использование памяти, время обучения для 300 эпох, задержку вывода по одному кадру, кадры в секунду, mIoU и показатель F1 по границе для предлагаемого метода и сравнительных сетей.

Конфигурация функции потерьmIoUГраница F1
Только кросс-энтропия (CE)0.6690.721
CE + Граница до н.э.0.6740.738
CE + потери обратной формы0.6810.752
CE + Наши SCL0.6870.764

Таблица 6: Количественное сравнение валидации функции потерь. В таблице представлены показатели mIoU и границы F1 при потере перекрестной энтропии, потери на границе бинарной перекрестной энтропии, потере при обратном преобразовании и предложенной потере структурной согласованности.

Архитектура алгоритмической моделиЛёгкая окклюзияУмеренная окклюзияТяжёлая окклюзияНеманхэттенский набор аномалийПодмножество текстур-интерференции
(mIoU)(mIoU)(mIoU)(mIoU)(mIoU)
Mask2Former0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

Таблица 7: Анализ устойчивости, специфических для подмножеств, при распределении экстремальной окклюзии и не-манхэттенских структур. Таблица отражает изменения точности разбора между подмножествами с лёгкой окклюзией, умеренной окклюзией, сильной окклюзией, вызовом освещения, интерференцией текстуры и не-манхэттенскими аномалиями.

Количество супермасштабных узловmIoUBoundaryF1Среднее время вывода (ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

Таблица 8: Анализ пространственной чувствительности масштаба распределения узлов в графе топологии. В таблице представлены mIoU, структурная граница F1 и среднее время вывода для различных настроек разделения узлов суперпикселей.

Обсуждение

Алгоритм этой статьи тесно связывает иерархические визуальные особенности, зафиксированные кодировщиком трансформатора с сдвинутым окном, с априорной глубиной 3D-ограничивающего блока Манхэттена, созданной при обнаружении отрезков строки, тем самым достигая высокоточной семантической реконструкции сложных внутренних сцен. Механизм перекрёстного внимания, управляемый структурой, заставляет визуальный сигнал выровняться с истинной геометрической границей, откалиброванной SDF, тем самым восстанавливая непрерывность низкоуровневых объектов в локально окклюзированныхобластях 42. Граф топологии строится с использованием суперпиксельных узлов, сгенерированных итеративным алгоритмом локальной кластеризации, который заставляет GCN выполнять агрегацию признаков при физических копланарных ограничениях, обеспечивая согласованность макроскопического семантическогораспределения 43. Экспериментальные результаты показывают, что метод достигает среднего пересечения по коэффициенту объединения 68,7% со стандартным отклонением 0,2%, практическим инженерным значением, структурной границей F1 76,4% при стандартном отклонении 0,3% и средним временем вывода 61 мс при конфигурации из 256 суперпиксельных узлов, что отражает сознательный компромисс, ставящий точность реконструкции границ над конечной эффективностьювывода 44. Тесты на прочность дополнительно демонстрируют, что модель обладает сильными возможностями по восстановлению топологии при экстремальных условиях масштабной потери визуального сигнала. Вводя потерю структурной согласованности, повышается точность выравнивания прогнозируемой маски с физической границей нулевой дистанции, калиброванной SDF, что обеспечивает синергетическую оптимизацию вычислительной сложности и качества парсинга45. Эта схема предлагает подход слияния признаков, основанный на законах трёхмерного пространства, и демонстрирует логическую согласованность в ремонте топологии при работе с крупномасштабной окклюзией мебели и физическим искажениемграниц 46. Результаты исследований предоставляют надёжную физико-геометрическую рамку ограничений для интеллектуального пространственного мышления и высокоточной 3D-реконструкции, а также имеют практическую инженерную ценность для задач визуальной навигации и распознавания сцен роботов в реальной физической среде.

Механизм вывода геометрической топологии, который сильно зависит от гипотезы Манхэттенского мира, страдает от смещения в подгонке при работе с неправильными архитектурными пространствами с изогнутыми стенами или неортогональнымиграницами 47. Для преодоления этого узкого места в геометрическом моделировании последующие сетевые итерации интегрируют многостепенные полиномиальные алгоритмы подгонки поверхностей и неоднородные рациональные модули извлечения кривой B-сплайна в физико-априорную ветвь. Эта универсальная стратегия пространственного моделирования превращает жёсткие ортогональные линии в динамически деформируемые топологические границы, тем самым постоянно повышая точность разбора алгоритма в аномальных пространственных планировках внутри помещений.

Геометрическая априорная экстракция основана на базовом детекторе линейных сегментов, что делает систему уязвимой к искажениям структурной маски при обработке внутренних сцен, доминирующих отражающими или прозрачнымиматериалами 48. Потеря структурной согласованности напрямую вызывает SDF, генерируемый этим детектором, создавая замкнутый цикл зависимости между априорной экстракцией и оптимизацией градиента. Когда визуальные интерференции вызывают аномальные отрезки линии, ошибочные геометрические координаты отображаются в SDF и непосредственно усиливаются потерей структурной согласованности во время обратного распространения, что заставляет параметры сети соответствовать неправильным физическимграницам 49. Последующие алгоритмические итерации введут мультимодальные адаптивные ветви синтеза для поглощения глубоких карт и инфракрасных радиометрических данных, тем самым отделяя геометрическое структурное восприятие от ограничений освещения видимым светом и расширяя границу пространственного рассуждения в экстремальных оптических условиях.

Для устранения узких мест чувствительности производительности, вызванного фиксированным масштабом узлов суперпикселя, последующие исследования разработают адаптивный модуль пула графов, который динамически определяет схему разбиения узлов на основе сложности изображения, устраняя зависимость сети от ручной настройки гиперпараметров. Для устранения ограничений в развертывании аппаратного обеспечения, вызванных вычислительными нагрузками сети суперпиксельных графов, будущие планы оптимизации включат лёгкие механизмы разделения признаков и модули агрегации с ограниченными элементами для сжатия масштаба параметров и ускорения матричных операций геометрической предыдущейветви 50.

Раскрытие информации

Авторы заявляют, что у них нет финансовых конфликтов интересов.

Благодарности

Финансирование: Ключевая программа исследований и разработок Шэньси (Программа No 2024CY2-GJHX-76).

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

Ссылки

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

Перепечатки и разрешения

Теги