Сегментация медицинских изображений является фундаментальной задачей в области компьютерного зрения и анализа медицинских изображений 1,2,3. Это включает разбиение изображения на несколько областей или объектов для дальнейшего анализа и обработки. Эта технология особенно важна в медицинской визуализации, поскольку помогает клиницистам выявлять и локализовать патологические области, тем самым повышая точность диагностики и планирование лечения. С развитием технологий медицинской визуализации, таких как магнитно-резонансная томография (МРТ), компьютерная томография (КТ) и позитронно-эмиссионная томография (ПЭТ), спрос на точные методы сегментации медицинских изображений продолжает расти. Современные методы сегментации медицинских изображений можно в широком смысле разделить на три основных подхода: методы на основе сверточной нейронной сети(CNN) 4, методы на основетрансформаторов 5 и методы на основе модели пространства состояний (SSM) 6,7. Методы на основе CNN обычно используют U-образные сетевые архитектуры для сегментации медицинских изображений. Наиболее широко используемая архитектура в этой категории —U-Net 8, которая продемонстрировала эффективность U-образной архитектуры энкодер-декодер для сегментации биомедицинских изображений. U-Net3+ сочетает плотные пропускные соединения из UNet++9 с полномасштабными пропускными соединениями для улучшения многомасштабной агрегации признаков. Однако методы, основанные на CNN, имеют ограниченные возможности для захвата долгосрочных зависимостей и, следовательно, могут не эффективно моделировать контекстную информацию для дальнего расстояния.
Методы на основе трансформаторов эффективно фиксируют дальние зависимости с помощью механизма самовнимания, который позволяет параллельно вычислять и назначать разные веса внимания разным областям интереса. UNETR++10 вводит модуль Efficient Paired Attention (EPA) для снижения количества параметров и вычислительных затрат. nnFormer 11 объединяет перемежающиеся сверточные и самовнимательные операции и вводит локально-глобальный объемный механизм самовнимания для обучения объемных представлений в трёхмерной (3D) медицинской сегментации изображений. H2Former12 предлагает эффективный иерархический гибридный визуальный трансформер, сочетающий механизмы внимания с извлечением признаков на основе CNN в энкодере. Однако методы на основе трансформеров демонстрируют квадратичную вычислительную сложность с увеличением длины последовательности, что приводит к значительно большей вычислительной стоимости. Рисунок 1 иллюстрирует мотивацию MVM-UNet и сравнивает предложенную стратегию многовидного сканирования с существующими фреймворками сегментации на основе SSM.

Рисунок 1. Сравнение MVM-UNet с существующими архитектурами сегментации на основе чисто пространственных моделей состояний (SSM). Сравнение традиционной модели сегментации на основе чистого пространства состояний (SSM) и предлагаемой архитектурой Multi-View Mamba U-Net (MVM-UNet). Верхняя панель иллюстрирует MVM-UNet, в котором модуль Multi-View 4-Directional (MV4D) извлекает взаимодополняющие признаки с помощью зигзагообразных, иерархических, спиральных и радиальных пар сканирования, интегрированных Spatial Fusion Mamba (SFusion Mamba), в то время как Multistage Fusion Mamba (MFusion Mamba) агрегирует многомасштабные элементы кодирования перед декодированием. Нижняя панель показывает представительную чисто SSM-архитектуру с использованием модулей Selective Scan 2-Dimensional (SS2D) с перекрёстным сканированием. На рисунке подчёркиваются архитектурные различия между традиционными сегментационными сетями на основе SSM и предлагаемым MVM-UNet. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Методы на основе SSM сочетают глобальные возможности моделирования трансформаторов с линейной вычислительной сложностью. Архитектура Mamba избирательно обрабатывает входную информацию с помощью селективной модели пространства состояний (Selective-SSM), позволяя модели динамически корректировать параметры в зависимости от входных данных, фильтруя нерелевантную информацию и делая акцент на информативных особенностях. Vim13 иVMamba 14 адаптируют архитектуру Mamba для задач компьютерного зрения. U-Mamba15 использует гибридную архитектуру CNN–SSM для изучения применения SSM в сегментации медицинских изображений, тогда как Mamba-UNet16 использует полностью архитектуру энкодер-декодер на основе SSM для сегментации медицинских изображений. Эти методы обеспечивают конкурентоспособную производительность при использовании значительно меньшего количества параметров. Однако современные методы на основе SSM/Mamba в основном извлекают особенности изображения с помощью простых патчей и стратегий SS2D-сканирования, которые имеют ряд ограничений для сегментации медицинских изображений. Во-первых, методы SS2D и патч-базы в первую очередь разработаны для общих задач компьютерного зрения. Local Mamba17 и MotionMamba 18 предположили, что стратегия сканирования SS2D недостаточна для всех визуальных задач, поскольку разные стратегии сканирования захватывают разные типы визуальной информации. Во-вторых, стратегия сканирования SS2D относительно проста, основана только на горизонтальных и вертикальных направлениях сканирования. В результате она может не зафиксировать сложные пространственные отношения и мелкие структурные детали. Сегментация медицинских изображений требует одновременного моделирования как глобального пространственного контекста, так и точных локальных анатомических особенностей. Кроме того, современные методы на основе SSM/Mamba обеспечивают ограниченное слияние функций между энкодером и декодером. Архитектуры, такие как UNet++ и FATNet, повышают точность сегментации за счёт улучшенного слияния признаков, подчёркивая важность эффективной интеграции признаков для сегментации медицинских изображений.
Для устранения этих ограничений в статье предлагается новая модель сегментации медицинских изображений на основе Mamba, называемая MVM-UNet. Как показано на рисунке 1, предлагаемый модуль Multi-View Four-Directional (MV4D) служит основным компонентом извлечения признаков MVM-UNet и специально разработан для сегментации медицинских изображений путём интеграции информации из четырёх различных стратегий сканирования. Каждая стратегия сканирования выделяет дополняющие элементы изображения и представляет разный вид входного изображения. Зигзагообразноесканирование 19 чередует направление движения в конце каждой строки или столбца, тем самым балансируя локальную и глобальную пространственную информацию. В отличие от этого, спиральные и радиальные схемысканирования 20 обеспечивают полное покрытие, распространяясь либо наружу от центра, либо внутрь с периферии. Иерархическоесканирование 18 фиксирует как локальные, так и глобальные признаки на различных масштабах. Для повышения надёжности каждой стратегии сканирования пары сканирования объединяются перед вводом в блок S6. Модуль Scan-view Fusion Mamba (SFusion Mamba) впоследствии интегрирует функции, извлечённые из четырёх модальностей сканирования. Для эффективного использования функций многомасштабного энкодера в этой статье также предлагается многомасштабный модуль синтеза Mamba (MFusion Mamba), который собирает и объединяет выходные данные с каждого этапа кодера перед передачей объединённых функций декодеру. MVM-UNet был оценен на наборах данных ISIC 2017, ISIC 2018 и Synapse. Экспериментальные результаты показывают, что MVM-UNet достигает конкурентоспособных результатов сегментации на наборах данных ISIC 2017, ISIC 2018 и Synapse.
Репрезентативные архитектуры сегментации привели к дальнейшему развитию сегментации медицинских изображений. U-Net также успешно применялся для анализа биомедицинских изображений, таких как подсчёт клеток, обнаружение иморфометрия 21. Архитектуры CNN, ориентированные на внимание, такие какCA-Net 22, улучшают представление признаков через комплексные механизмы внимания. Репрезентативные фреймворки сегментации на основе трансформеров, включая TransUNet23, Pyramid MedicalTransformer 24, SwinU-Net 25, TransAttUNet26 и TransCUNet27, дополнительно демонстрируют эффективность глобального моделирования признаков на основе внимания для сегментации медицинских изображений.
Дизайн MVM-UNet мотивирован двумя ограничениями существующих методов сегментации на основе SSM/Mamba. Во-первых, многие современные модели Vision Mamba используют простые двумерные стратегии сканирования, которые могут быть недостаточны для медицинских изображений с неправильными границами поражений, небольшими целями и многомасштабными анатомическими структурами. Во-вторых, традиционные U-образные архитектуры энкодер-декодера в основном передают функции через соответствующие пропускные соединения, что ограничивает прямое использование многоступенчатой информации энкодера при декодировании. Поэтому MVM-UNet вводит MV4D для улучшения многовидного пространственного моделирования и MFusion Mamba для явного агрегирования многоступенчатых функций энкодера. Эта конструкция направлена на адаптацию дальнодействующего моделирования на основе Mamba к специфическим требованиям сегментации медицинских изображений.
Хотя MVM-UNet построен на общей парадигме энкодер–декодер и моделировании последовательностей на основе Mamba, его новизна заключается в том, как эти компоненты адаптируются и интегрируются для сегментации медицинских изображений. Вместо простого включения стандартного блока Mamba в U-образную основную основу сети, предлагаемый фреймворк перерабатывает процесс пространственного моделирования через несколько задачно-ориентированных пар сканирования, вводит SFusion Mamba для интеграции специфических для сканирования представлений, улучшает MVV Block с помощью остаточных и проекционных путей, а также вставляет MFusion Mamba между энкодером и декодером для агрегирования многоступенчатых особенностей кодера перед декодированием. Этот архитектурный дизайн направлен на устранение неправильных границ, малых целевых областей и многомасштабных анатомических структур, часто наблюдаемых на медицинских изображениях.
Этот протокол наиболее подходит для задач сегментации, требующих одновременного моделирования дальнодействующей контекстной информации, неправильных границ объектов и многомасштабных анатомических структур в двумерных медицинских изображениях. По сравнению с методами сегментации на основе CNN, дизайн энкодер-декодер на базе Mamba обеспечивает эффективный механизм контекстного моделирования, сохраняя при этом U-образный рабочий процесс, знакомый исследователям сегментации медицинских изображений. По сравнению с методами на основе трансформеров, предлагаемая структура избегает прямого использования квадратичного самовнимания и предназначена для исследователей, стремящихся к глобальному контекстному моделированию с использованием относительно эффективного механизма моделирования последовательностей. Соответственно, этот протокол подходит для сегментации поражений кожи, сегментации органов брюшной полости и аналогичных двухмерных задач сегментации медицинских изображений, где важны как глобальная структурная информация, так и локальные границы.
Этот протокол также имеет ограничения, которые следует учитывать перед использованием. Это может быть не обязательно для относительно простых задач сегментации, когда лёгкий CNN уже обеспечивает достаточную производительность. Кроме того, он не предназначен напрямую для полной трёхмерной объемной сегментации без архитектурной адаптации. Исследователи с очень ограниченными аннотированными данными, ограниченными ресурсами графических процессоров (GPU) или требованием к высокоинтерпретируемым классическим моделям также должны учитывать эти ограничения перед применением протокола. В целом, этот метод предназначен для исследователей, стремящихся воспроизвести и оценить U-образную сегментационную структуру на базе Mamba, которая балансирует долгосрочное моделирование контекста, локальное представление границ и многоступенчатое слияние признаков.
Ключевые вклады следующие:
1. В этой статье представлена новая модель сегментации медицинских изображений на основе Mamba, называемая MVM-UNet. В отличие от подходов, которые напрямую включают существующие блоки на базе SS2D или стандартные блоки Mamba, MVM-UNet вводит MV4D для моделирования медицинских характеристик изображений на основе четырёх комплементарных пар сканирования, включая зигзагообразное, иерархиальное, спиральное и радиальное сканирование.
2. В данной статье разрабатывается SFusion Mamba и MVV Block для интеграции специфических для сканирования представлений и улучшения трансформации признаков. SFusion Mamba объединяет признаки, извлечённые из разных ветвей пар сканирования, тогда как остаточные и вверх-вниз проекции в блоке MVV обеспечивают дополняющие пути признаков, которые стабилизируют и обогащают представления признаков.
3. В этой статье представлена MFusion Mamba как промежуточный многоступенчатый модуль синтеза между энкодером и декодером. В отличие от обычных пропускных соединений, которые в основном передают соответствующие этапные характеристики, MFusion Mamba явно агрегирует многоступенчатые элементы энкодера посредством крупно-тонкого синтеза и предоставляет обогащённую информацию для декодирования.
4. Обширные экспериментальные результаты показывают, что предлагаемый MVM-UNet обеспечивает конкурентоспособную сегментацию на наборах данных ISIC 2017 и ISIC 2018, а также высокие показатели на наборе мультиорганной сегментации Synapse. Кроме того, комплексные исследования абляции подтверждают вклад каждого компонента в MVM-UNet.