Методическая статья

Мульти-view Vision Mamba U-образная сетевая структура для сегментации медицинских изображений

DOI:

10.3791/72616

7 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол описывает, как построить, обучить и оценить многовидную структуру Vision Mamba U-shaped Network для сегментации медицинских изображений, позволяющую воспроизводимую сегментацию кожных поражений и органов брюшной полости через стандартизированную подготовку наборов данных, внедрение моделей и оценку эффективности.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сегментация медицинских изображений требует вычислительных методов, которые точно фиксируют глобальный контекст, локальные границы и многомасштабные анатомические структуры, оставаясь при этом воспроизводимыми в различных приложениях. В этой статье представлен протокол для построения, обучения и оценки фреймворка Multi-view Vision Mamba U-shaped Network для двумерной сегментации медицинских изображений. Протокол обеспечивает воспроизводимый рабочий процесс, включающий сбор публичных наборов данных, предварительную обработку изображений и масок, построение сети, обучение моделей, выбор контрольных точек, а также количественную и качественную оценку производительности. Фреймворк включает многовидное сканирование признаков для захвата дополнительной пространственной, контурной, масштабной и граничной информации, а также применяет многоступенчатое слияние признаков в U-образной архитектуре энкодер-декодера для улучшения интеграции признаков во время сегментации. Протокол демонстрируется на основе общедоступных наборов данных по кожным поражениям и сегментации органов брюшной полости. В описанном рабочем процессе реализации фреймворк достигает конкурентоспособной сегментации с использованием стандартных метрик оценки. Следуя процедурам, представленным в этом протоколе, исследователи могут воспроизводить реализацию модели, обучать сеть с использованием определённых экспериментальных параметров, оценивать производительность сегментации и адаптировать рабочий процесс для связанных задач сегментации медицинских изображений, требующих воспроизводимого анализа на основе глубокого обучения.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сегментация медицинских изображений является фундаментальной задачей в области компьютерного зрения и анализа медицинских изображений 1,2,3. Это включает разбиение изображения на несколько областей или объектов для дальнейшего анализа и обработки. Эта технология особенно важна в медицинской визуализации, поскольку помогает клиницистам выявлять и локализовать патологические области, тем самым повышая точность диагностики и планирование лечения. С развитием технологий медицинской визуализации, таких как магнитно-резонансная томография (МРТ), компьютерная томография (КТ) и позитронно-эмиссионная томография (ПЭТ), спрос на точные методы сегментации медицинских изображений продолжает расти. Современные методы сегментации медицинских изображений можно в широком смысле разделить на три основных подхода: методы на основе сверточной нейронной сети(CNN) 4, методы на основетрансформаторов 5 и методы на основе модели пространства состояний (SSM) 6,7. Методы на основе CNN обычно используют U-образные сетевые архитектуры для сегментации медицинских изображений. Наиболее широко используемая архитектура в этой категории —U-Net 8, которая продемонстрировала эффективность U-образной архитектуры энкодер-декодер для сегментации биомедицинских изображений. U-Net3+ сочетает плотные пропускные соединения из UNet++9 с полномасштабными пропускными соединениями для улучшения многомасштабной агрегации признаков. Однако методы, основанные на CNN, имеют ограниченные возможности для захвата долгосрочных зависимостей и, следовательно, могут не эффективно моделировать контекстную информацию для дальнего расстояния.

Методы на основе трансформаторов эффективно фиксируют дальние зависимости с помощью механизма самовнимания, который позволяет параллельно вычислять и назначать разные веса внимания разным областям интереса. UNETR++10 вводит модуль Efficient Paired Attention (EPA) для снижения количества параметров и вычислительных затрат. nnFormer 11 объединяет перемежающиеся сверточные и самовнимательные операции и вводит локально-глобальный объемный механизм самовнимания для обучения объемных представлений в трёхмерной (3D) медицинской сегментации изображений. H2Former12 предлагает эффективный иерархический гибридный визуальный трансформер, сочетающий механизмы внимания с извлечением признаков на основе CNN в энкодере. Однако методы на основе трансформеров демонстрируют квадратичную вычислительную сложность с увеличением длины последовательности, что приводит к значительно большей вычислительной стоимости. Рисунок 1 иллюстрирует мотивацию MVM-UNet и сравнивает предложенную стратегию многовидного сканирования с существующими фреймворками сегментации на основе SSM.

figure-introduction-1
Рисунок 1. Сравнение MVM-UNet с существующими архитектурами сегментации на основе чисто пространственных моделей состояний (SSM). Сравнение традиционной модели сегментации на основе чистого пространства состояний (SSM) и предлагаемой архитектурой Multi-View Mamba U-Net (MVM-UNet). Верхняя панель иллюстрирует MVM-UNet, в котором модуль Multi-View 4-Directional (MV4D) извлекает взаимодополняющие признаки с помощью зигзагообразных, иерархических, спиральных и радиальных пар сканирования, интегрированных Spatial Fusion Mamba (SFusion Mamba), в то время как Multistage Fusion Mamba (MFusion Mamba) агрегирует многомасштабные элементы кодирования перед декодированием. Нижняя панель показывает представительную чисто SSM-архитектуру с использованием модулей Selective Scan 2-Dimensional (SS2D) с перекрёстным сканированием. На рисунке подчёркиваются архитектурные различия между традиционными сегментационными сетями на основе SSM и предлагаемым MVM-UNet. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Методы на основе SSM сочетают глобальные возможности моделирования трансформаторов с линейной вычислительной сложностью. Архитектура Mamba избирательно обрабатывает входную информацию с помощью селективной модели пространства состояний (Selective-SSM), позволяя модели динамически корректировать параметры в зависимости от входных данных, фильтруя нерелевантную информацию и делая акцент на информативных особенностях. Vim13 иVMamba 14 адаптируют архитектуру Mamba для задач компьютерного зрения. U-Mamba15 использует гибридную архитектуру CNN–SSM для изучения применения SSM в сегментации медицинских изображений, тогда как Mamba-UNet16 использует полностью архитектуру энкодер-декодер на основе SSM для сегментации медицинских изображений. Эти методы обеспечивают конкурентоспособную производительность при использовании значительно меньшего количества параметров. Однако современные методы на основе SSM/Mamba в основном извлекают особенности изображения с помощью простых патчей и стратегий SS2D-сканирования, которые имеют ряд ограничений для сегментации медицинских изображений. Во-первых, методы SS2D и патч-базы в первую очередь разработаны для общих задач компьютерного зрения. Local Mamba17 и MotionMamba 18 предположили, что стратегия сканирования SS2D недостаточна для всех визуальных задач, поскольку разные стратегии сканирования захватывают разные типы визуальной информации. Во-вторых, стратегия сканирования SS2D относительно проста, основана только на горизонтальных и вертикальных направлениях сканирования. В результате она может не зафиксировать сложные пространственные отношения и мелкие структурные детали. Сегментация медицинских изображений требует одновременного моделирования как глобального пространственного контекста, так и точных локальных анатомических особенностей. Кроме того, современные методы на основе SSM/Mamba обеспечивают ограниченное слияние функций между энкодером и декодером. Архитектуры, такие как UNet++ и FATNet, повышают точность сегментации за счёт улучшенного слияния признаков, подчёркивая важность эффективной интеграции признаков для сегментации медицинских изображений.

Для устранения этих ограничений в статье предлагается новая модель сегментации медицинских изображений на основе Mamba, называемая MVM-UNet. Как показано на рисунке 1, предлагаемый модуль Multi-View Four-Directional (MV4D) служит основным компонентом извлечения признаков MVM-UNet и специально разработан для сегментации медицинских изображений путём интеграции информации из четырёх различных стратегий сканирования. Каждая стратегия сканирования выделяет дополняющие элементы изображения и представляет разный вид входного изображения. Зигзагообразноесканирование 19 чередует направление движения в конце каждой строки или столбца, тем самым балансируя локальную и глобальную пространственную информацию. В отличие от этого, спиральные и радиальные схемысканирования 20 обеспечивают полное покрытие, распространяясь либо наружу от центра, либо внутрь с периферии. Иерархическоесканирование 18 фиксирует как локальные, так и глобальные признаки на различных масштабах. Для повышения надёжности каждой стратегии сканирования пары сканирования объединяются перед вводом в блок S6. Модуль Scan-view Fusion Mamba (SFusion Mamba) впоследствии интегрирует функции, извлечённые из четырёх модальностей сканирования. Для эффективного использования функций многомасштабного энкодера в этой статье также предлагается многомасштабный модуль синтеза Mamba (MFusion Mamba), который собирает и объединяет выходные данные с каждого этапа кодера перед передачей объединённых функций декодеру. MVM-UNet был оценен на наборах данных ISIC 2017, ISIC 2018 и Synapse. Экспериментальные результаты показывают, что MVM-UNet достигает конкурентоспособных результатов сегментации на наборах данных ISIC 2017, ISIC 2018 и Synapse.

Репрезентативные архитектуры сегментации привели к дальнейшему развитию сегментации медицинских изображений. U-Net также успешно применялся для анализа биомедицинских изображений, таких как подсчёт клеток, обнаружение иморфометрия 21. Архитектуры CNN, ориентированные на внимание, такие какCA-Net 22, улучшают представление признаков через комплексные механизмы внимания. Репрезентативные фреймворки сегментации на основе трансформеров, включая TransUNet23, Pyramid MedicalTransformer 24, SwinU-Net 25, TransAttUNet26 и TransCUNet27, дополнительно демонстрируют эффективность глобального моделирования признаков на основе внимания для сегментации медицинских изображений.

Дизайн MVM-UNet мотивирован двумя ограничениями существующих методов сегментации на основе SSM/Mamba. Во-первых, многие современные модели Vision Mamba используют простые двумерные стратегии сканирования, которые могут быть недостаточны для медицинских изображений с неправильными границами поражений, небольшими целями и многомасштабными анатомическими структурами. Во-вторых, традиционные U-образные архитектуры энкодер-декодера в основном передают функции через соответствующие пропускные соединения, что ограничивает прямое использование многоступенчатой информации энкодера при декодировании. Поэтому MVM-UNet вводит MV4D для улучшения многовидного пространственного моделирования и MFusion Mamba для явного агрегирования многоступенчатых функций энкодера. Эта конструкция направлена на адаптацию дальнодействующего моделирования на основе Mamba к специфическим требованиям сегментации медицинских изображений.

Хотя MVM-UNet построен на общей парадигме энкодер–декодер и моделировании последовательностей на основе Mamba, его новизна заключается в том, как эти компоненты адаптируются и интегрируются для сегментации медицинских изображений. Вместо простого включения стандартного блока Mamba в U-образную основную основу сети, предлагаемый фреймворк перерабатывает процесс пространственного моделирования через несколько задачно-ориентированных пар сканирования, вводит SFusion Mamba для интеграции специфических для сканирования представлений, улучшает MVV Block с помощью остаточных и проекционных путей, а также вставляет MFusion Mamba между энкодером и декодером для агрегирования многоступенчатых особенностей кодера перед декодированием. Этот архитектурный дизайн направлен на устранение неправильных границ, малых целевых областей и многомасштабных анатомических структур, часто наблюдаемых на медицинских изображениях.

Этот протокол наиболее подходит для задач сегментации, требующих одновременного моделирования дальнодействующей контекстной информации, неправильных границ объектов и многомасштабных анатомических структур в двумерных медицинских изображениях. По сравнению с методами сегментации на основе CNN, дизайн энкодер-декодер на базе Mamba обеспечивает эффективный механизм контекстного моделирования, сохраняя при этом U-образный рабочий процесс, знакомый исследователям сегментации медицинских изображений. По сравнению с методами на основе трансформеров, предлагаемая структура избегает прямого использования квадратичного самовнимания и предназначена для исследователей, стремящихся к глобальному контекстному моделированию с использованием относительно эффективного механизма моделирования последовательностей. Соответственно, этот протокол подходит для сегментации поражений кожи, сегментации органов брюшной полости и аналогичных двухмерных задач сегментации медицинских изображений, где важны как глобальная структурная информация, так и локальные границы.

Этот протокол также имеет ограничения, которые следует учитывать перед использованием. Это может быть не обязательно для относительно простых задач сегментации, когда лёгкий CNN уже обеспечивает достаточную производительность. Кроме того, он не предназначен напрямую для полной трёхмерной объемной сегментации без архитектурной адаптации. Исследователи с очень ограниченными аннотированными данными, ограниченными ресурсами графических процессоров (GPU) или требованием к высокоинтерпретируемым классическим моделям также должны учитывать эти ограничения перед применением протокола. В целом, этот метод предназначен для исследователей, стремящихся воспроизвести и оценить U-образную сегментационную структуру на базе Mamba, которая балансирует долгосрочное моделирование контекста, локальное представление границ и многоступенчатое слияние признаков.

Ключевые вклады следующие:

1. В этой статье представлена новая модель сегментации медицинских изображений на основе Mamba, называемая MVM-UNet. В отличие от подходов, которые напрямую включают существующие блоки на базе SS2D или стандартные блоки Mamba, MVM-UNet вводит MV4D для моделирования медицинских характеристик изображений на основе четырёх комплементарных пар сканирования, включая зигзагообразное, иерархиальное, спиральное и радиальное сканирование.

2. В данной статье разрабатывается SFusion Mamba и MVV Block для интеграции специфических для сканирования представлений и улучшения трансформации признаков. SFusion Mamba объединяет признаки, извлечённые из разных ветвей пар сканирования, тогда как остаточные и вверх-вниз проекции в блоке MVV обеспечивают дополняющие пути признаков, которые стабилизируют и обогащают представления признаков.

3. В этой статье представлена MFusion Mamba как промежуточный многоступенчатый модуль синтеза между энкодером и декодером. В отличие от обычных пропускных соединений, которые в основном передают соответствующие этапные характеристики, MFusion Mamba явно агрегирует многоступенчатые элементы энкодера посредством крупно-тонкого синтеза и предоставляет обогащённую информацию для декодирования.

4. Обширные экспериментальные результаты показывают, что предлагаемый MVM-UNet обеспечивает конкурентоспособную сегментацию на наборах данных ISIC 2017 и ISIC 2018, а также высокие показатели на наборе мультиорганной сегментации Synapse. Кроме того, комплексные исследования абляции подтверждают вклад каждого компонента в MVM-UNet.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании использовались только общедоступные и деидентифицированные наборы данных медицинских изображений, включая ISIC 2017, ISIC 2018 и Synapse. В этом исследовании не было собрано новых участков людей, животных или идентифицируемых частных медицинских записей. Набор данных ISIC 2017, использованный в этом исследовании, — это сегментационный набор данных ISIC 2017 Challenge по кожным поражениям, полученный из официального репозитория данных International Skin Imaging Collaboration (https://challenge.isic-archive.com/data/#2017). Версия набора данных, использованная в этом исследовании, соответствует задаче сегментации поражений ISIC 2017, включая официальные разделы обучения, валидации и тестирования. Набор данных был загружен 15 марта 2024 года. Набор данных ISIC 2018, использованный в этом исследовании, — это набор данных по сегментации границ поражения ISIC Challenge 2018 2018, полученный из официального репозитория данных International Skin Imaging Challenge (https://challenge.isic-archive.com/data/#2018). Версия набора данных, используемая в этом исследовании, соответствует задаче ISIC 2018 Задача 1: Сегментация границ поражения. Набор данных был загружен 8 июля 2024 года.

Набор данных Synapse, использованный в этом исследовании, — это набор данных Multi-Atlas Labeling Beyond the Cranial Vault брюшной КТ, полученный из репозитория Synapse под идентификатором присоединения syn3193805 (https://www.synapse.org/Synapse:syn3193805). Использованный в этом исследовании набор данных соответствует широко используемому набору данных по сегментации КТ брюшной полости с 30 случаями. Скачанный архив назывался Abdomen/RawData.zip, доступен под номером syn3193805. На момент скачивания репозиторий не предоставил отдельный номер версии, ярлык релиза или датированный тег. В соответствии со стандартным разделением, принятым в предыдущих исследованиях, 18 кейсов использовались для обучения, а 12 — для тестирования. Разделение данных соответствовало списку случаев, использованному TransUNet23. В частности, обучающие случаи были case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 и case0037, тогда как тестовыми случаями были case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025 и case0035. Набор данных был загружен 9 июля 2024 года. Поскольку в этом исследовании использовались только общедоступные, деидентифицированные наборы данных и не включали сбор новых данных о людях или идентифицируемой личной информации, одобрение институционального экспертного совета для вычислительных экспериментов, описанных в этом протоколе, не требовалось. Официального письменного решения об освобождении от учреждения не было получено. Если это требует местная институциональная политика, исследователи должны получить определение об освобождении до проведения вторичного анализа общедоступных наборов данных. Для этого исследования не было доступен референсный номер об освобождении от институциональной этики или формальная документация об освобождениях.

1. Подготовка наборов данных

  1. Скачайте набор данных по сегментации кожных поражений ISIC 2017 из официального репозитория International Skin Imaging Colpository. Используйте официальные разделы для обучения, валидации и тестирования. Проверьте, содержит ли набор данных 2000 обучающих изображений, 150 изображений валидации и 600 тестовых изображений.
  2. Скачайте набор данных по сегментации кожных поражений ISIC 2018 из официального репозитория International Skin Imaging Collaboration. Используйте официальные разделы для обучения, валидации и тестирования. Проверьте, содержит ли набор данных сегментации 2 594 обучающих изображений, 100 изображений валидации и 1 000 тестовых изображений.
  3. Скачайте набор данных Synapse по сегментации мультиорганов. Используйте стандартное разделение, состоящее из 18 случаев (2 212 осевых срезов) для обучения и 12 случаев (1 567 осевых срезов) для тестирования. Не вводите отдельный набор валидации.
    1. Зарезервируйте 12 тестовых случаев исключительно для окончательной оценки. Не используйте тестовые случаи для обучения моделей, настройки гиперпараметров или выбора модели. Задача сегментации включает восемь органов брюшной полости: аорту, желчный пузырь, селезёнку, левую почку, правую почку, печень, поджелудочную железу и желудок.
    2. Используйте следующий раздел набора данных Synapse. 18 обучающих случаев: case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 и case0037. 12 тестовых случаев: case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025 и case0035.
  4. Организуйте каждый набор данных в отдельные папки с изображениями и масок. Убедитесь, что у каждого изображения есть соответствующая маска сегментации с одинаковым идентификатором случая.
    1. Преобразуйте каждую маску поражения кожи в бинарную карту сегментации переднего и заднего плана. Сохраняйте оригинальные метки многоклассных органов для набора данных Synapse.
    2. Для наборов данных ISIC 2017 и ISIC 2018 после преобразования двоичной маски присваивается значение меток 0 для фоновых пикселей и 1 пикселям на переднем плане. Пиксели с исходными значениями маски больше 0 рассматриваются как передний план и преобразуются в 1, тогда как пиксели с исходными значениями маски равными 0 рассматриваются как фон и сохраняются как 0. Для набора данных Synapse сохраняйте исходные значения целых меток: 0 — фоновый класс, а 1–8 — восемь классов органов переднего плана.
  5. Измените размер изображений и масок ISIC 2017 и ISIC 2018 до 256 × 256 пикселей без сохранения исходного соотношения сторон. Не наносите обрезку или подкладку.
    1. Измените размер каждого среза Synapse CT и соответствующего отображения меток до 224 × 224 пикселей. Используйте билинейную интерполяцию для RGB-изображений, интерполяцию сплайна третьего порядка для CT-срезов и интерполяцию ближайших соседей для сегментационных масок.
    2. Изменяйте размер изображений в Python.
      1. Для наборов данных ISIC 2017 и ISIC 2018 используйте пользовательское преобразование myResize, реализованное в utils.py, которое вызывает torchvision.transforms.functional.resize для изменения размера тензоров изображения и маски до 256 × 256 пикселей. Не указывайте явный режим интерполяции или аргумент сглаживания в этом преобразовании.
      2. Для набора данных Synapse используйте scipy.ndimage.zoom в datasets/dataset.py. Измените размер срезов изображения CT до 224 × 224 пикселей с помощью интерполяции сплайна третьего порядка (порядок = 3), а также измените размер отображений меток с помощью интерполяции ближайших соседей (order = 0). При изменении размера не применяйте отдельную операцию сглаживания или anti_aliasing=Истинную настановку.
  6. Нормализуйте каждое изображение ISIC RGB перед тензорным преобразованием, используя специфичное для набора данных среднее значение и стандартное отклонение (SD) с помощью уравнения 1 следующим образом:
    figure-protocol-1(1)
    Затем масштабируйте нормированное изображение до диапазона 0–255 с помощью нормализации min–max.
    1. Используйте μ = 159.922 и σ = 28.871 для обучающего набора ISIC 2017, а μ = 148.429 и σ = 25.748 для наборов валидации и тестирования ISIC 2017. Используйте μ = 157.561 и σ = 26.706 для обучающего набора ISIC 2018, а μ = 149.034 и σ = 32.022 для наборов валидации и тестирования ISIC 2018.
    2. Преобразуйте каждое нормализованное изображение в тензор формы 3 × 256 × 256. Преобразуем каждую бинарную маску в тензор формы 1 × 256 × 256.
    3. Выполнять минимально-максимальную нормализацию независимо для каждого изображения после нормировки среднего, специфичного для набора данных, и стандартной нормировки отклонения. В частности, вычтите среднее, специфичное для набора данных, из каждого изображения и делите на соответствующее стандартное отклонение.
    4. Вычислите минимальные и максимальные значения интенсивности из нормализованного изображения и перемасштабируйте изображение до диапазона 0–255, используя эти значения минимального и максимального значения на изображение. Не используйте минимальные и максимальные значения по всему набору данных для этого этапа минимального и максимального масштабирования.
  7. Подготовьте каждый срез Synapse CT в виде двумерного изображения в оттенках серого. Преобразуйте каждый срез CT в float32 и добавьте размер канала с одним тоном, чтобы получить входной тензор с формой 1 × 224 × 224.
    1. Сохраняйте каждую карту меток Synapse как одноканальную целочисленную маску с формой 224 × 224. Не применяйте дополнительную нормализацию среднего SD на уровне набора данных в загрузчике данных.
    2. Используйте предварительно обработанные файлы Synapse, предоставленные в формате .npz, для обучающих срезов и формат .npy.h5 для тестирования томов. Загружайте массивы изображений и меток напрямую из каждого .npz-файла во время обучения и напрямую из каждого файла .npy.h5 во время тестирования. Не применяйте дополнительное обрезывание интенсивности, CT-окно, нормализацию на уровне набора данных или пересэмплирование по сырому объему в освобождённом загрузчике данных.
    3. Во время обучения модели преобразуйте каждый загруженный двумерный срез в float32, измените его размер до целевого пространственного размера с помощью scipy.ndimage.zoom с указанием порядка = 3 для срезов изображения и порядка = 0 для отображения меток, а затем преобразуйте изменённые массивы в тензоры с размером одного канала.
  8. Применяйте дополнение данных только к обучающему набору. Для ISIC 2017 и ISIC 2018 применяйте случайное горизонтальное переворот (p = 0,5), случайное вертикальное переворот (p = 0,5) и случайное вращение (p = 0,5) с углом, отобранным от 0° до 360°.
    1. Примените одинаковое геометрическое преобразование к каждой паре изображение-маска. Во время валидации и тестирования применяйте только изменение размера, нормализацию и преобразование тензоров.
    2. Для набора данных Synapse применяйте случайное вращение и случайное переворот во время обучения. Случайным образом повернуть каждую пару изображение-метка на k × 90°, где k ∈ {0,1,2,3}, случайным образом перевернуть пару изображение-метка вдоль одной пространственной оси или случайным образом повернуть пару изображение-метка под углом, отобранным от −20° до 20°.
    3. Не применяйте стохастическое усиление во время тестирования.
    4. Примените дополнение данных к набору данных Synapse с помощью взаимоисключающих ветвей, реализованных в преобразовании RandomGenerator.
      1. Для каждой обучающей выборки сначала оценивают состояние random.random() > 0.5. Если это условие выполнено, применяют random_rot_flip, состоящий из случайного поворота на 90° (k = 0, 1, 2 или 3), за которым следует случайный переворот вдоль одной пространственной оси.
      2. Если первая ветвь не выбрана, вычислите второе условие random.random() > 0.5. Если это условие выполнено, применяйте random_rotate случайно выбранным углом вращения между −20° и 20°. Если ни одно из условий не удовлетворяется, не применяйте стохастическое дополнение к образцу.
      3. Примените одно и то же преобразование как к входному образу, так и к соответствующей отображению меток.
  9. Задайте случайный сид до загрузки, предварительной обработки и обучения датасетов. Используйте случайные семена 1, 52 и 100 для основных сравнительных экспериментов и семя 100 для исследований абляции, если не указано иное.
    1. Инициализируйте генераторы случайных случаев Python, NumPy, PyTorch, PyTorch CUDA и cuDNN перед созданием загрузчика данных. Сохраняйте без изменений разделы датасетов, процедуры предварительной обработки, настройки дополнения, параметры нормализации, стратегию изменения размера и предварительную обработку оценки во всех запусках seed.
    2. Установите num_workers = 0 для экспериментов ISIC и Synapse для загрузки данных в основном процессе. Перед созданием набора данных и DataLoader инициализуйте глобальное случайное сидение с помощью функции set_seed для заседа генераторов случайных чисел Python, NumPy, PyTorch, PyTorch CUDA и cuDNN. Не определяйте отдельный worker_init_fn или специфический для DataLoader генератор случайных случаев, так как они не используются в выпущенной реализации.

2. Создание архитектуры MVM-UNet

  1. Постройте предлагаемую Multi-view Vision Mamba UNet (MVM-UNet) с использованием U-образной архитектуры энкодер-декодера.
  2. Установить размерность входного изображения на H × W × 3. Пропустите входное изображение через слой вложения патча.
    1. Реализуйте слой вложения патча с использованием 2D-свёртки с размером ядра 4 × 4, шагом 4, тремя входными каналами и 96 выходными каналами.
    2. Преобразуйте карту входных признаков в пространственное разрешение H/4 × W/4 с C = 96 выходных каналов.
  3. Постройте четыре стадии энкодера и четыре стадии декодера. Уменьшить пространственное разрешение вдвое и удвоить размер канала после каждого этапа энкодера.
  4. Используйте симметричную конфигурацию энкодер-декодер. Установите количество блоков MVV в обоих кодировщике и декодере в {2, 2, 2, 2}.
    1. Разместите по два блока MVV на каждом этапе энкодера и по два блока MVV на каждом этапе декодера.
  5. Вставьте блок MVV в каждый этап кодера и декодера. Используйте модуль MV4D как модуль извлечения основных элементов внутри каждого блока MVV.
  6. Вставьте модуль MFusion Mamba между энкодером и декодером. Используйте этот модуль для объединения многоступенчатых энкодеров перед декодированием.
  7. Настройте общий рабочий процесс MVM-UNet. Используйте MV4D для извлечения признаков по всему энкодере.
    1. Сохраняйте выходы энкодера как пропускные соединения. Передайте выходы энкодера соответствующим ступеням декодера.
    2. Передайте функции кодировщика MFusion Mamba перед декодированием. Постепенно увеличивайте образ слияния через декодер и генерируйте финальную карту сегментации с помощью сегментационной головки.
  8. Пропустите входное изображение I ∈ RB×H×W× 3 через слой вложения патча, чтобы получить figure-protocol-2 здесь C = 96.
    1. Генерируйте карты признаков энкодера: E 1 ∈ RB×H/4×W/4×C, E 2 R B×H/8×W/8×2 C, E3 R B×H/16×W/16×4 C, и E4 R B×H/32×W/32×8C. Используйте блоки MVV, содержащие MV4D, на каждом этапе энкодера.
    2. Сохраняйте все функции кодировщика для соответствующего пропускающего соединения. Передайте все функции кодировщика MFusion Mamba для многоступенчатого синтеза функций.
    3. Выровнять признаки энкодера с общим пространством признаков до грубого и тонкого слияния внутри MFusion Mamba. Передайте слитое представление декодеру.
    4. Постепенно увеличивайте представление декодера. Объедините функции декодера с E3 на H/16 × W/16, E 2 на H/8 × W/8 и E1 на H/4 × W/4.
    5. Увеличите размер финальной функции декодера до исходного разрешения изображения. Сгенерируйте карту figure-protocol-3 предсказания ∈ RB×H×W×K. Здесь K = 1 для сегментации двойных поражений и K = 8 для сегментации мультиорганов Synapse.
    6. См. рисунок 2 для общей архитектуры сети и дополнительную таблицу 1 для полной спецификации архитектуры по слоям, включая операции, основные параметры и размеры выходных признаков для каждого этапа
    7. Переходные слои кодировщик–декодер
      1. Функция энкодера понижения сэмплирования с использованием переходных слоёв с объединением патчей. Для каждого перехода возьмите выборку четырёх пространственно перемежающихся групп признаков из окрестности 2 × 2, соедините их вдоль размера канала, примените нормализацию слоя (LayerNorm) и проецируйте полученную 4C-мерную особенность на 2C-каналы с помощью линейного слоя без смещения. Эта операция уменьшает пространственное разрешение в 2 раза и удваивает размер канала.
      2. Функции апсемплирования декодера с использованием переходных слоёв расширения патчей. Примените линейную проекцию без смещения, пространственно перестановите расширенные признаки для увеличения разрешения в 2 раза и примените LayerNorm после пространственного расширения. Повторите эту операцию для постепенной реконструкции карт признаков от H/32 × W/32 до H/16 × W/16, H/8 × W/8 и H/4 × W/4.
      3. Выровнять признаки энкодера в модуле MFusion Mamba, переразмерив их до целевого пространственного разрешения с помощью билинейной интерполяции (align_corners = False), а затем применить обучаемую линейную проекцию канала перед слиянием признаков.
    8. Сегментационная головка
      1. Увеличите дискретизацию финальной карты функций декодера с H/4 × W/4 до исходного разрешения изображения (H × W) с помощью финального слоя расширения патча. Примените линейную проекцию, выполните пространственную перепланировку с коэффициентом расширения 4 и примените LayerNorm.
      2. Спроектируйте реконструированную карту функций на выходные каналы K, используя свёртку 1 × 1 после преобразования тензора в формат канал-первый.
      3. Сгенерируйте окончательное предсказание во время оценки, применяя сигмоидную активационную функцию для сегментации бинарных поражений или softmax-активацию, а затем argmax для сегментации мультиорганов Synapse. Не применяйте активационную функцию непосредственно в сегментационной головке.

figure-protocol-4
Рисунок 2. Общая архитектура Multi-View Mamba U-Net (MVM-UNet). Обзор предлагаемой архитектуры Multi-View Mamba U-Net (MVM-UNet). Входное изображение преобразуется в патч-эмбеддинги и обрабатывается через четыре этапа кодирования, состоящих из блоков Multi-View Vision (MVV), разделённых операциями объединения патчей. Особенности энкодера агрегируются многоступенчатыми термоядерными Mamba (MFusion Mamba) и распространяются на декодер через пропускные соединения. Декодер постепенно восстанавливает пространственное разрешение с помощью операций расширения патчей и генерирует итоговую карту сегментации через проекционный слой. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

3. Создание модуля MV4D

  1. Используйте модуль MV4D в качестве базового блока извлечения признаков в блоке MVV. Подайте вводные патчи в четыре пары сканирования. См. Алгоритм 1, Дополнительный файл 1 для полного псевдокода пространственного выравнивания, построения индекса пар сканирования, сбора последовательностей, обработки S6/Mamba, обратного пространственного перепорядка, слияния пар сканирования, слияния SFusion Mamba, проекции и перестройки выхода.
  2. Используйте точные зигзагообразные, иерархические, спиральные и радиальные процедуры генерации индексов сканирования, реализованные в моделях/mvmunet/core.py. Для каждой стратегии сканирования используйте прямой порядок сканирования и его обратный порядок как одну пару двунаправленного сканирования.
  3. Постройте пару зигзагообразного сканирования. Пройдите по объектам изображения в чередующихся направлениях в конце каждой строки или столбца. Используйте этот паттерн сканирования для балансировки локальной и глобальной пространственной информации.
  4. Постройте иерархическую пару сканирования. Функции захвата на нескольких пространственных масштабах. Используйте этот паттерн сканирования для усиления извлечения как локальных, так и глобальных представлений.
  5. Постройте пару спирального сканирования. Отсканируйте объекты изображения от центра к границе или от границы к центру. Используйте этот паттерн сканирования для улучшения извлечения глобальной информации о контуре.
  6. Постройте пару радиального сканирования. Сканирующие изображения вдоль нескольких радиальных направлений. Используйте этот паттерн сканирования для улучшения извлечения локальных деталей границ и ребер.
  7. Объедините каждую пару сканирования перед тем, как ввести объединённую последовательность в блок S6. Используйте парный дизайн для повышения надёжности каждой стратегии сканирования при сохранении вычислительной эффективности.
  8. Подайте выходную последовательность каждой ветви пары сканирования в блок S6. Получите четыре представления признаков, соответствующих зигзагообразным, иерархическим, спиральным и радиальным сканирующим видам.
  9. Объединять четыре извлечённых представления признаков с помощью модуля SFusion Mamba. Используйте два параллельных пути термоядерного синтеза. В первом пути интегрируйте четыре признака путём сложения по элементам.
  10. Во втором пути SFusion Mamba объедините четыре признаки. Обработайте конкатенированное представление с помощью Conv1d и Mamba. Уменьшите размер канала с помощью проекционного слоя, чтобы соответствовать выходной размерности блока S6.
  11. Настройте блок S6/Mamba, используя размер признака C в качестве размера модели. Используйте проекционный слой для отображения каждой объединённой пары сканирования обратно к размеру канала C до слияния.
  12. В SFusion Mamba выполняйте сложение по элементам в первом пути. Объедините четыре признака сканирования во втором пути перед Conv1d, Mamba и линейной проекцией. Используйте нормализацию, линейную проекцию, глубинную сепарабельную свёртку и операции активации, связанные с MV4D, как описано в шаге 4.
  13. Добавьте выходы двух путей синтеза, чтобы получить итоговый выход модуля MV4D.
  14. Постройте четыре дополняющие парные ветви сканирования вместо использования только горизонтальных и вертикальных направлений сканирования. Используйте зигзагообразное сканирование для акцента на непрерывном пространственном переходе, иерархическое сканирование для усиления многомасштабного представления, спиральное сканирование для захвата информации о контурах от центра до границы и радиальное сканирование для улучшения локального выделения локальных деталей, ориентированных на границы.
  15. Обрабатывайте каждую ветвь пары сканирования независимо. Объедините полученные признаки с помощью SFusion Mamba. Отобразите каждую обработанную последовательность обратно в её исходный пространственный порядок до слияния.
  16. Имея входное отображение признаков X ∈ RB×H×W×C, сравняем её на X seq ∈ RB×L×C, где L = H × W.
  17. Перестройте сплющенную последовательность в соответствии с индексами сканирования для каждой ветви пары сканирования. Обрабатывайте каждую перестроенную последовательность с помощью блока S6. Восстановить обработанную последовательность в исходном пространственном порядке.
  18. Объедините четыре функции сканирования через аддитивный путь и путь SFusion Mamba для получения конечного результата MV4D. См. рисунок 3 для архитектуры MV4D и алгоритма 1, дополнительный файл 1 для полного тензорного рабочего процесса реализации.
  19. Используйте полную программную реализацию в моделях/mvmunet/core.py. Этот файл содержит генераторы индекса сканирования: PairwiseScanMamba, SequenceS6, SFusion Mamba и модуль MV4D.
  20. Генерируйте индексы многопросмотрного сканирования
    1. Генерируйте индексы сканирования, следуя опубликованной реализации в моделях/mvmunet/core.py. Для входной карты признаков пространственного размера H × W выравните каждое расположение пикселя в одномерный индекс с помощью индекса: index = r × W + c, где re и c обозначают координаты строки и столбца соответственно.
    2. Генерируйте зигзагообразное сканирование, проходя диагонали изображения с постоянной r + c. Соберите допустимые индексы пикселей для каждой диагонали и чередуйте направление движения, меняя порядок каждой чётной диагонали.
    3. Сгенерируйте иерархическое сканирование, рекурсивно разделив изображение на четыре квадранта. Посещайте верхний левый, верхний правый, нижний левый и нижний правый квадранты последовательно, пока высота или ширина субрегиона не превышает 2 пикселей, а затем пройдите оставшиеся пиксели в порядке основных строк.
    4. Сгенерируйте спиральное сканирование, пройдя по внешней границе изображения слева направо вдоль верхнего ряда, вниз по правому столбцу, справа налево по нижнему ряду и вверх вдоль левого столбца, постепенно сужая границу к центру изображения.
    5. Генерируйте радиальное сканирование, сортируя каждый пиксель по его квадрату от центра изображения, а затем по его полярному углу, рассчитанному с помощью функции atan2.
    6. Генерируйте обратный скан для каждой стратегии сканирования, изменяя соответствующий порядок прямого сканирования. Комбинируйте прямую и обратную последовательность сканирования, чтобы получить одну пару для каждой стратегии сканирования перед передачей пар сканирования в модуль MV4D.

figure-protocol-5
Рисунок 3. Архитектура модуля Multi-View 4-Directional (MV4D). Структура модуля извлечения признаков с многовидным видом в 4 направлениях (MV4D). Входные патчи обрабатываются через четыре комплементарные пары сканирования, включая зигзагообразное, иерархическое, спиральное и радиальное сканирование. Признаки, извлечённые из четырёх ветвей, объединяются, обрабатываются с помощью блоков пространства состояний и интегрируются Spatial Fusion Mamba (SFusion Mamba) для генерации выходного представления признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

4. Строительство блока MVV

  1. Постройте блок MVV, используя одну основную и две вспомогательные ветви. Используйте общую структуру, показанную на рисунке 4.
  2. Применить нормализацию слоя к входной особенности в главной ветви. Введите нормализованный признак в линейный слой. Передайте трансформированную особенность к разделяемой по глубине свертке.
  3. Обрабатывайте трансформированную особенность с помощью сепарабельной свёртки по глубине. Примените функцию активации GELU. Подключите активированную функцию в модуль MV4D.
  4. Постройте первую вспомогательную ветвь как остаточное соединение идентичности. Подключите входную функцию напрямую к конечному выходу. Используйте эту ветку для сохранения исходного представления и стабилизации тренировок.
  5. Постройте вторую вспомогательную ветвь как ветвь проекции вниз-вверх. Сжать входную функцию с помощью слоя проекции вниз. Восстановить размер признака с помощью слоя проекции вверх.
  6. Объедините выходы основной ветви и обеих вспомогательных ветвей. Получите финальный выход MVV Block. См. рисунок 4 для полной архитектуры.
  7. Установите скрытую размерность главной ветви равной размеру входного канала Cs. Примените LayerNorm(Cs) перед основной линейной проекцией и используйте линейный слой с размерами CsCs. Используйте по глубине сепарабельную свёртку, состоящую из свёртки 3×3 по глубине с заполнением 1, группами = C s и отсутствием смещения, затем свёрткой по точкам 1×1 без смещения.
  8. Примените функцию активации GELU после сепарабельной свёртки по глубине. Введите активированную функцию в MV4D и примените выходную линейную проекцию размерами CsCs. Настройте ветвь проекции вниз-вверх с помощью LayerNorm(Cs), коэффициента проекции 4, проекции Cs→Cs/4, активации GELU и проекции Cs/4→C s.
  9. Объедините тождествную ветвь, проекционную вверх ветвь и основную ветвь, обработанную по дроп-траектории, используя элементное сложение, чтобы получить итоговый выход MVV Block.

figure-protocol-6
Рисунок 4. Архитектура блока Multi-View Vision (MVV). Структура блока многовидного зрения (MVV). Блок состоит из главной ветви выделения объектов, содержащей модуль Multi-View 4-Directional (MV4D) вместе с глубинными свертками, нормализацией и линейными проекционными слоями. Вспомогательная ветвь проекции вверх-вниз обеспечивает модуляцию элементов с помощью элементного умножения перед остаточным сложением для получения выходного представления признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

5. Строительство MFusion Mamba

  1. Собирайте карты функций со всех уровней энкодера. Выровняйте функции кодировщика по единому пространству представлений, изменяя их размер или проецируя при необходимости. См. Алгоритм 2, Дополнительный файл 1 для полного тензорного рабочего процесса реализации.
  2. При необходимости изменяйте размер функций энкодера до целевого пространственного разрешения. Проектировать функции с разными размерами канала в одну и ту же часть канала. Выровняйте все функции энкодера перед многоступенчатым синтезом.
  3. Введите выровненные функции энкодера в компонент грубого синтеза. Проведите грубое сплавление с использованием продукта Hadamard. Сгенерируйте грубое сплавленное представление.
  4. Введите грубое сплавленное представление в компонент тонкого синтеза. Постройте два параллельных пути тонкого синтеза. Обрабатывайте оба пути отдельно.
  5. Обработайте первый путь тонкого синтеза с помощью линейного слоя. Обработайте второй путь тонкого синтеза с помощью восходящей проекции, Conv1d, Mamba и нисходящей проекции. Восстановить измерение признака после проекции вниз.
  6. Объединить выходы двух путей тонкого синтеза с помощью произведения Адамара. Примените последний линейный слой. Получите выход MFusion Mamba.
  7. Введите выход MFusion Mamba в декодер. Декодировать слитое многоступенчатое представление вместе с функциями пропуска энкодер-декодер. Сгенерируйте окончательную карту сегментации.
  8. Выровнять признаки энкодера с разных уровней в единое пространство признаков до грубого синтеза. Обработайте выровненные представления с помощью крупных и тонких стадий плавления. См. рисунок 5 для архитектуры MFusion Mamba и Дополнительного алгоритма 2 для полного рабочего процесса реализации на тензорном уровне.
  9. Используйте параметры реализации MFusion Mamba следующим образом. Для каждой особенности энкодера Ei проецируйте размерность канала от Ci к Ct. Изменение размера проекционируемых объектов до целевого пространственного размера с помощью билинейной интерполяции с align_corners=False при необходимости.
  10. Примените продукт Hadamard для выполнения грубого синтеза по выровненным признакам энкодера. Настройте первый путь тонкого синтеза с помощью линейного слоя размеров Ct Ct. Настройте второй путь тонкого синтеза, используя восходящую проекцию Ct → 2Ct, Conv1d, блок Mamba/S6 с размерностью модели 2Ct, направлением сканирования, измерением состояния 16 и нисходящей проекцией 2Ct Ct.
  11. Объединяйте выходы путей тонкого синтеза с помощью продукта Адамара. Применим окончательную линейную проекцию размерностями Ct к Ct. Введите слитое многоступенчатое представление в декодер.
  12. Функции многоступенчатого энкодера с использованием MFusion Mamba
    1. Собрать функции кодировщика со всех четырёх ступеней кодировщика (E1,E 2, E3 и E4) и использовать их как вход для модуля MFusion Mamba. Не выбирайте только функцию соответствующего этапа кодирования для слияния декодеров.
    2. Выровнять все функции энкодера с пространственным разрешением, необходимым для текущей стадии декодера. Измените размер признаков энкодера до целевого разрешения и проецируете их до необходимого размера канала перед слиянием функций.
    3. Повторите процедуру выравнивания признаков для каждого этапа декодера. Когда декодер работает на H/16 × W/16, H/8 × W/8 и H/4 × W/4, изменяйте размер и проецируете E1,E 2,E 3 иE 4 в соответствующее целевое пространство признаков.
    4. Объединить выровненные многоступенчатые функции кодировщика с помощью операций грубого синтеза и тонкого синтеза модуля MFusion Mamba, а также объединить представление слияния с функциями декодера на соответствующем масштабе.
    5. Выполните операции проекции признаков, изменения размера и слияния в соответствии с опубликованной реализацией в моделях/mvmunet/core.py.

figure-protocol-7
Рисунок 5. Архитектура модуля многоступенчатого термоядерного синтеза Mamba (MFusion Mamba). Структура модуля многоступенчатого термоядерного синтеза Mamba (MFusion Mamba). Многомасштабные признаки энкодера сначала объединяются крупным термоядерным синтезом, а затем дорабатываются через модуль Fine Fusion, состоящий из линейной проекции, одномерной свёртки (Conv1d), блока Mamba и слоёв проекции признаков, прежде чем создать представление слияных признаков, используемое декодером. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

6. Обучение моделям

  1. Обучайте MVM-UNet на Ubuntu 22.04.1 с ядром Linux версии 6.8.0. Используйте рабочую станцию с процессором Intel Core i9-13900K 13-го поколения и видеокартой NVIDIA A800. Используйте одну и ту же аппаратную конфигурацию на протяжении всего обучения и оценки.
  2. Реализуйте и обучайте модель с использованием PyTorch 2.0.1 с CUDA 11.8. Установите все необходимые программные зависимости перед обучением.
  3. Используйте оптимизатор AdamW с начальной скоростью обучения 3 × 10−5, β1 = 0,9, β2 = 0,999, ε = 1 × 10−8 и затуханием веса 0,01. Установите размер партии на 32, если не указано иное.
  4. Обучайте каждую модель на протяжении 300 эпох. Используйте расписание косинусного отжига с частотой обучения сη min = 1 × 10−5. Установите размер входного изображения на 256 × 256 для ISIC 2017 и ISIC 2018 и на 224 × 224 для Synapse.
  5. Используйте три независимых случайных семена (1, 52 и 100) для основных сравнительных экспериментов. Повторите полный процесс обучения и оценки для каждого семя. Сообщайте итоговые количественные результаты как среднее ± SD по трём запускам.
  6. Используйте фиксированное случайное семено 100 для всех исследований абляции, если не указано иное. Сохраняйте без изменений разделы наборов данных, стратегию предварительной обработки, архитектуру сети, оптимизатор, скорость обучения, размер пакета и количество обучающих эпох во всех экспериментах по абляции.
  7. Используйте потерю BCE-Dice для сегментации бинарных поражений на ISIC 2017 и ISIC 2018. Установите BCE и вес для потери кубиков на 1.0. Используйте потерю CE-Dice для Synapse и установите как вес потерь по кросс-энтропии, так и Dice на 1.0.
  8. Изменяйте размер, нормализуйте и дополняйте обучающие изображения ISIC 2017 и ISIC 2018 с помощью процедуры предварительной обработки, описанной в Шаге 1. Примените изменение размера, случайное вращение и случайное переворот к обучающим изображениям Synapse, как описано в Шаге 1. Используйте одинаковые настройки предварительной обработки во всех тренировках.
  9. Выберите контрольные точки модели согласно протоколу валидации, специфичным для набора данных. Сохраняйте контрольную точку с лучшей валидацией для ISIC 2017 и ISIC 2018 и проводите валидацию каждые 30 эпох. Тренируйте Synapse на 300 эпох без валидационного набора и используйте финальную тренировочную контрольную точку для тестирования.
  10. Используйте официальный набор валидации только для выбора модели на ISIC 2017 и ISIC 2018. Не используйте набор тестирования Synapse для обучения, настройки гиперпараметров или выбора контрольных точек. Оставляйте все данные тестирования исключительно для окончательной оценки.
  11. Используйте следующие параметры обучения для воспроизводимости. Установите размер пакета на 32 для всех наборов данных. Используйте AdamW с начальной скоростью обучения 3 × 10−5, β1 = 0,9,β 2 = 0,999, ε = 1 × 10−8, и затуханием веса 1 × 10−2.
  12. Настройте планировщик скорости обучения косинусного отжига с T max = 50 и ηmin = 1×10−5 для ISIC 2017 и ISIC 2018. Настройте планировщик с T max = 100 и ηmin = 1×10−5 для Synapse. Оставляйте конфигурацию планировщика без изменений для всех повторяющихся экспериментов.
  13. Обучайте все модели с использованием арифметики FP32 с полной точностью. Отключите автоматическое обучение смешанной точности. Не применяйте градиентное клиппинг во время оптимизации.
  14. Сохраняйте без изменений настройки точности, стратегию обновления градиента, конфигурацию оптимизатора, график скорости обучения и протокол случайного засея во всех сравнительных экспериментах, исследованиях абляции и повторяемости.
  15. Выберите лучшую контрольную точку модели
    1. Оценивайте модель на валидационном наборе после каждой учебной эпохи для наборов данных ISIC 2017 и ISIC 2018.
    2. Вычислите потери бинарной перекрёстной энтропии (BCE)-кубиков для каждой партии валидации и вычислите средние потери валидации по всему набору валидации.
    3. Сохраняйте текущую модель как лучшую контрольную точку, когда средние потери валидации ниже ранее зафиксированных минимальных потерь валидации.
    4. Записывайте среднее пересечение по объединению (mIoU), коэффициент сходства кубиков (DSC), точность (Acc), специфичность (Spe) и чувствительность (Sen) во время валидации только для мониторинга производительности. Не используйте эти метрики как критерий выбора контрольной точки.

7. Оценка модели

  1. Оценивайте обученную модель, используя официальный набор тестирования для каждого набора данных. Используйте тестовый набор только для финальной оценки производительности.
  2. Для ISIC 2017 и ISIC 2018 рассчитывайте mIoU, DSC, Acc, Sen и Spe. Для всех расчётов используйте на уровне пикселей истинные положительные (TP), ложноположительные (FP), истинные отрицательные (TN) и ложноотрицательные (FN).
  3. Примените функцию активации сигмоидов к выходу моделей для ISIC 2017 и ISIC 2018. Преобразите отображение вероятностей в бинарную маску сегментации с использованием порога 0,5. Вычислите метрики оценки с помощью уравнений 2–6:
    figure-protocol-8 (2)
    figure-protocol-9 (3)
    figure-protocol-10 (4)
    figure-protocol-11 (5)
    figure-protocol-12 (6)
  4. Для Synapse примените функцию активации softmax к выходу модели. Назначьте каждый пиксель или воксель классу с наибольшей вероятностью с помощью операции argmax. Вычислите DSC и 95-е процентильное хаусдорфово расстояние (HD95) для каждого органа переднего плана и сообщайте средние значения для всех тестовых случаев.
  5. Сравните MVM-UNet с репрезентативными методами сегментации на основе CNN, трансформаторов и моделей пространства состояний (SSM). Используйте одинаковые разделы наборов данных, процедуры предварительной обработки, разрешения входных данных и метрики оценки для всех методов.
  6. Используйте официальные разделы обучения, валидации и тестирования для ISIC 2017 и ISIC 2018. Используйте стандартное разделение из 18 обучающих и 12 тестовых кейсов для Synapse. Установите входное разрешение на для наборов данных ISIC и для Synapse.
  7. Воспроизводите базовые методы, используя их официальные реализации, когда это возможно. Отчёт воспроизводит результаты как среднее ± SD по повторным запускам. Сохраняйте значения, представленные литературой, в первоначальном виде, и различайте их в соответствующих примечаниях к таблице.
  8. Проводите абляционные исследования с использованием фиксированного случайного семена 100, если не указано иное. Сохраняйте без изменений разделы набора данных, процедуру предварительной обработки, разрешение входных данных, оптимизатор, график скорости обучения, размер пакета, количество эпох, функцию потерь и метрики оценки во всех абляционных экспериментах.
  9. Оценить вклад MV4D, SFusion Mamba, ветви проекции вверх-вниз в блоке MVV, MFusion Mamba, размера входного изображения, значения dropout и конфигурации слоя энкодер-декодера. В каждом абляционном эксперименте изменяйте только целевую компоненту или параметр.
  10. Проведите тест Wilcoxon со знакомым рангом, используя парные результаты для каждого изображения для ISIC 2017 и ISIC 2018, а также парные результаты по каждому сценарию для Synapse. Рассмотрим p-значение меньше 0,05 для обозначения статистической значимости.
  11. Оценивайте вычислительную эффективность с использованием одной и той же аппаратной среды и разрешения входов для всех методов. Измерять время обучения за эпоху, время вывода на изображение, пиковое использование памяти GPU во время обучения, количество параметров модели и операции с плавающей запятой (FLOPs). Рассчитывайте FLOP с помощью одного прямого прохода.
  12. Выбирайте представительные качественные примеры только из тестового набора после завершения оценки модели. Сравните исходное изображение, маску с основной правдой и предсказанную маску, используя идентичные тестовые случаи для всех методов. Выберите представительные примеры, включающие малые цели, неправильные границы, неоднозначные границы и представительные многоорганные структуры.
  13. Рассчитывайте метрики оценки и проводите статистический анализ
    1. Рассчитывайте метрики сегментации для наборов данных ISIC 2017 и ISIC 2018 на Python с помощью NumPy и sklearn.metrics.confusion_matrix. Определите порог предсказанной вероятностной карты на уровне 0,5, получите пиксельные значения TP, FP, TN и FN и вычислите mIoU, DSC, Acc, Sen и Spe из этих значений.
    2. Вычислите DSC и HD95 для набора данных Synapse с использованием medpy.metric.binary.dc и medpy.metric.binary.hd95 соответственно. Примените softmax, а затем argmax к выводу модели, прежде чем вычислить метрики оценки.
    3. Вычислите количество FLOP и обучаемые параметры с помощью thop.profile с помощью одного прямого прохода.
    4. Проведите тест Wilcoxon с знаковым рангом на Python с помощью scipy.stats.wilcoxon. Используйте парные значения метрик на изображение для наборов данных ISIC 2017 и ISIC 2018, а также парные значения для каждого случая для набора данных Synapse.

8. Определение функции потерь

  1. Используйте стандартные потери по перекрестной энтропии (CE) для многоклассовой сегментации и стандартные потери BCE для бинарной сегментации. Используйте стандартную формулу потерь кубиков для сегментации. Уравнения 7–11 определяют функции потерь, используемые в этом протоколе.
    figure-protocol-13(7)
    figure-protocol-14(8)
    figure-protocol-15(9)
    figure-protocol-16(10)
    figure-protocol-17(11)
  2. Установите вес потери BCE и кубиков на уровне 1.0 для ISIC 2017 и ISIC 2018, чтобы figure-protocol-181 = 1.0 и figure-protocol-192 = 1.0. Установить вес потери CE и кубиков на 1.0 для Synapse, например , φ1 = 1.0, и φ2 = 1.0.
  3. Реализуйте функции потерь в utils.py. Используйте nn. BCELoss для семестра BCE и nn. CrossEntropyLoss для термина CE. Вычислите потерю бинарного кубика, выравнивая каждую прогнозируемую маску и маску правдивости на земле, рассчитывая потерю кубиков для каждого образца и усредняя потерю по партии. Вычислите потерю мультикласса кубиков, преобразовав карту целевых меток в формат one-hot, применив softmax к выводу модели, вычислив потери кубиков для каждого класса и усредняя потери по всем классам.
  4. Установим константу сглаживания в 1 для потерь бинарных кубиков и в 1×10−5 для потерь мультикласса в Кубике. Реализуйте потери BCE-Dice с помощью класса BceDiceLoss с wb = 1 и wd = 1. Реализуйте потери CE-кубиков с помощью класса CeDiceLoss с loss_weight = [1, 1]. Сохраняйте константы сглаживания, стратегию сокращения и программную реализацию без изменений для всех наборов данных, случайных засечек и экспериментов.
  5. Настройте снижение потерь
    1. Instantiate nn. BCELoss() и nn. CrossEntropyLoss() без явного указания аргумента редукции.
    2. Используйте стандартную настройку уменьшения потерь PyTorch (уменьшение = «среднее») для обеих функций потерь. Не используйте редукция = «сумма» или выход с неуменьшенными потерями.

9. Настройки воспроизводимости и выполнение

  1. Скачайте выпущенную реализацию с https://github.com/LIXUEGUANG002/MVM-UNet. Используйте репозиторий вместе с программными пакетами, наборами данных, аппаратными спецификациями и вычислительными ресурсами, перечисленными в Таблице материалов.
  2. Клонируйте репозиторий и войдите в каталог проекта, запустив git clone https://github.com/LIXUEGUANG002/MVM-UNet.git, затем cd MVM-Unet.
  3. Настройте эксперимент ISIC 2017 или ISIC 2018, установив имя набора данных, путь к набору, размер входа, размер пакета, количество эпох, функцию потерь, оптимизатор, планировщик скорости обучения и случайный seed в configs/config_setting.py. Запустите обучающий скрипт из корня репозитория с помощью Python train.py.
  4. Настройте эксперимент Synapse, задавая имя набора данных, путь обучающих данных, путь к тестированию тома, каталог списков, размер входных данных, количество классов, размер пакета, количество эпох, функцию потерь, оптимизатор, планировщик скорости обучения и случайное заседание в конфигурациях/config_setting_synapse.py. Запустите обучающий скрипт из корня репозитория с помощью Python train_synapse.py.
  5. Выполните вычисление только на основе вывода, установив only_test_and_save_figs = True, best_ckpt_path в обученную контрольную точку и img_save_path в выходную папку в соответствующем конфигурационном файле. Запустите Python train.py для ISIC 2017 или ISIC 2018, или Python train_synapse.py для Synapse для генерации прогнозных результатов и качественных данных.
  6. Используйте версию исходного кода
    1. Клонируйте вышедший репозиторий GitHub и ознакомьтесь с commit ee891b42c2f083c4990eed72f1d4463adc5e103e на главной ветке, прежде чем настроить наборы данных, обучающие скрипты и настройки оценки.
    2. Используйте это обязательство для воспроизведения экспериментов, описанных в этом исследовании. На момент редакции рукописи для репозитория не было доступно тегированной версии.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ожидаемые результаты и интерпретация
При правильной реализации этого протокола обученная модель MVM-UNet должна обеспечивать стабильную производительность сегментации при повторных запусках, при этом для большинства показателей оценки оцениваются лишь небольшие вариации между различными случайными семенами. Для ISIC 2017 и ISIC 2018 успешные результаты отражаются в высоких значениях DSC, mIoU, Acc, Sen и Spe, а также в прогнозируемых масках поражения, которые тесно следуют границам поражения между основой и правдой (см. рисунки 6 и 7). Для Synapse успешные результаты отражаются в высоких средних значениях DSC и низких значениях HD95 в органах переднего плана (рисунок 8). Во время выполнения протокола количественные метрики должны интерпретироваться вместе с соответствующими качественными результатами сегментации. Модель, достигающая высокого DSC, но демонстрирующая утечку границы, пропуск мелких структур или фрагментированные прогнозы, должна считаться лишь частично успешной, а также проверять процедуру предварительной обработки, выбор контрольных точек и настройки вывода.

figure-results-1
Рисунок 6. Репрезентативные качественные результаты сегментации на наборе данных ISIC 2017. Репрезентативные результаты качественной сегментации, полученные на базе данных Международного сотрудничества по визуализации кожи (ISIC) 2017 года. Каждый пример показывает исходное дермоскопическое изображение (Image), соответствующую маску сегментации на земле (GT) и прогноз, сгенерированный MVM-UNet (Pred). Репрезентативные тестовые случаи иллюстрируют эффективность сегментации поражений разного размера, морфологии и граничной сложности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-2
Рисунок 7. Репрезентативные качественные результаты сегментации в наборе данных ISIC 2018. Репрезентативные качественные результаты сегментации, полученные на базе данных Международного сотрудничества по визуализации кожи (ISIC) 2018 года. Каждый пример показывает исходное дермоскопическое изображение (Image), соответствующую маску сегментации на земле (GT) и прогноз, сгенерированный MVM-UNet (Pred). Репрезентативные тестовые случаи демонстрируют сегментационные характеристики по различным видам поражений и пограничным характеристикам. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-results-3
Рисунок 8. Репрезентативные качественные результаты сегментации на наборе данных мультиорганной компьютерной томографии Synapse. Репрезентативные результаты качественной многоорганной сегментации, полученные на базе данных Synapse Multi-Atlas Labeling Beyond the Cranial Vault. Каждый пример показывает оригинальное изображение компьютерной томографии (Image), соответствующие аннотации органов с основной правдой (GT) и предсказание, сгенерированное MVM-UNet (Pred). Репрезентативные примеры иллюстрируют согласование между предсказанными и эталонными сегментациями между несколькими органами брюшной полости. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Результаты на ISIC 2017
Для оценки воспроизводимости MVM-UNet все основные сравнительные эксперименты были повторены с использованием трёх независимых случайных семян (1, 52 и 100), и результаты были представлены как среднее ± SD. Статистическая значимость оценивалась с помощью теста Wilcoxon signed-rank на основе парных результатов по изображениям для ISIC 2017 и ISIC 2018, а также парных результатов по случаям для Synapse. Статистический анализ проводился с использованием парных метрических значений, а не средних показателей на уровне семян. Для справедливого сравнения результаты, представленные как средние ± SD, воспроизводились с использованием официальных реализаций под одними и теми же разделами набора данных, входными разрешениями и метриками оценки, когда это было возможно, тогда как результаты с одним значением сохранялись из соответствующих оригинальных публикаций.

MVM-UNet был оценён на базе датасета сегментации кожных поражений ISIC 2017 года и сравниван с представительными методами сегментации, включаяUNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36 и H2Former12 (Таблица 1). MVM-UNet достиг mIoU 80,94 ± 1,01%, DSC 91,32% ± 0,68%, точности 96,58% ± 0,27%, специфичности 98,31% ± 0,23%, а также чувствительности 91,65% ± 0,77% на трёх независимых запусках. По сравнению с оценёнными методами, MVM-UNet достиг наивысшего mIoU, DSC и чувствительности. Репрезентативные качественные результаты сегментации показаны на рисунке 6, где прогнозируемые маски точно следуют границам поражения на основе и правдивости на репрезентативных тестовых изображениях.

МодельRef.mIoU (%)DSC (%)Acc (%)Spe (%)Сен (%)
UNet876.9886.9995.6597.4386.82
TransUNet2375.3281.2391.4595.7782.63
MaLUNet3178.7888.1396.1898.4784.78
VM-UNet3280.2389.0396.2997.5889.90
UNeXt-S3378.2687.8095.9597.7487.04
HResFormer3479.89 ± 1.0588,82 ± 0,6596.25 ± 0.2497,73 ± 0,2287,72 ± 0,79
H-vmunet2880.34 ± 1.0290,68 ± 0,5596,42 ± 0,1898.23 ± 0.3288,97 ± 0,88
MISSormer3080,16 ± 0,7889,27 ± 0,6194,36 ± 0,2897,52 ± 0,3887,71 ± 0,69
H2Former1280,35 ± 0,9588,56 ± 0,7296.61 ± 0.1998.15 ± 0.1488,21 ± 0,81
MedScale-Former3580,31 ± 0,8289.11 ± 0.5995,68 ± 0,3398.24 ± 0.2189,96 ± 0,92
MCAFT3680,59 ± 0,9389,27 ± 0,6396,42 ± 0,2097,95 ± 0,1790,05 ± 0,84
MVM-UNet (Ours)80.94 ± 1.0191,32 ± 0,6896,58 ± 0,2798.31 ± 0.2391,65 ± 0,77

Таблица 1: Сравнение производительности на наборе данных ISIC 2017 по сегментации кожных поражений. Сравнение MVM-UNet с методами сегментации на основе репрезентативных сверточных нейронных сетей (CNN), трансформеров и моделей пространства состояний (SSM) с использованием среднего пересечения над объединением (mIoU), коэффициента сходства кубиков (DSC), точности (Acc.), специфичности (Spe.) и чувствительности (Sen.). Результаты для MVM-UNet представлены как среднее ± стандартное отклонение от трёх независимых экспериментов с случайными семенами. Результаты, представленные в виде отдельных значений, воспроизводились из соответствующих оригинальных публикаций.

Качественные примеры дополнительно демонстрируют, что MVM-UNet точно сегментировал как мелкие, так и крупные поражения с неправильными границами. В этих репрезентативных примерах предсказанные маски близко совпадали с соответствующими аннотациями по правде и сохраняли границы поражения с минимальными утечками или фрагментацией.

Для дальнейшей оценки статистической значимости наблюдаемых улучшений были проведены тесты Уилкоксона с рейтингом с подписью, используя парные результаты сегментации на изображение. Для метрики mIoU MVM-UNet показал статистически значимое улучшение по сравнению с MCAFT с p-значением 0,0114. Для метрики DSC MVM-UNet также значительно превосходил H-vmunet с p-значением 0,0031. Эти результаты подтверждают, что наблюдаемые улучшения по сравнению с ISIC 2017 вряд ли были связаны со случайными вариациями.

В целом, MVM-UNet достиг наивысших результатов среди сравниваемых методов mIoU, DSC и чувствительности в наборе данных ISIC 2017 (Таблица 1). Примеры качественной сегментации, показанные на рисунке 6 , согласуются с этими количественными результатами.

Результаты на ISIC 2018
MVM-UNet был дополнительно оценен на наборе сегментации кожных поражений ISIC 2018 года и сравниван с представительными методами сегментации, включая UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 и MCAFT36 (Таблица 2)). MVM-UNet достиг mIoU 82,47% ± 1,28%, DSC 90,65% ± 0,94%, точности 96,02% ± 0,36%, специфичности 97,06% ± 0,31%, а также чувствительности 91,80% ± 0,82% на трёх независимых запусках. Эти результаты показывают, что производительность MVM-UNet оставалась стабильной среди различных случайных семян. Репрезентативные результаты качественной сегментации показаны на рисунке 7.

МодельRef.mIoU (%)DSC (%)Acc (%)Spe (%)Сен (%)
UNet877.8687.5594.0596.6985.86
UNet++978.3187.8394.0295.7588.65
UTNetV23778.9788.2594.3296.4887.60
SANet3879.5288.5994.3995.9789.46
MaLUNet3180.2589.0494.6296.1989.74
VM-UNet3281.3589.7194.9196.1391.12
H-vmunet2881.93 ± 1.4590,46 ± 0,6295.19 ± 0.3096.82 ± 0.2188.37 ± 1.13
MISSormer3080.27 ± 1.2189,91 ± 0,4694,76 ± 0,2797.22 ± 0.1590.84 ± 1.07
H2Former1280,40 ± 0,8390,26 ± 0,7394,89 ± 0,3896,98 ± 0,2591.57 ± 0.54
HResFormer3481.12 ± 1.1888,86 ± 0,8494,96 ± 0,3396,43 ± 0,2291.86 ± 1.01
MedScale-Former3580,97 ± 0,7490,47 ± 0,6895.02 ± 0.4195,89 ± 0,2690,65 ± 0,92
MCAFT3681.46 ± 1.0389,06 ± 0,7695.23 ± 0.2996,72 ± 0,1791.82 ± 0.57
MVM-UNet (Ours)82.47 ± 1.2890,65 ± 0,9496.02 ± 0.3697.06 ± 0.3191.80 ± 0.82

Таблица 2: Сравнение характеристик на наборе данных ISIC 2018 по сегментации кожных поражений. Сравнение MVM-UNet с репрезентативными методами сегментации на основе CNN, Transformer и SSM с использованием среднего пересечения по объединению (mIoU), коэффициента сходства кубиков (DSC), точности (Acc.), специфичности (Spe.) и чувствительности (Sen.). Результаты для MVM-UNet представлены как среднее ± стандартное отклонение от трёх независимых экспериментов с случайными семенами. Результаты, представленные в виде отдельных значений, воспроизводились из соответствующих оригинальных публикаций.

По сравнению с H-vmunet, MVM-UNet улучшил mIoU на 0,54%. По сравнению с MedScale-Former, MVM-UNet улучшил DSC на 0,18%. MVM-UNet также достиг самой высокой точности среди сравниваемых методов. Репрезентативные качественные примеры, показанные на рисунке 7 , демонстрируют точную сегментацию представительных кожных поражений, включая небольшие области поражения и поражения с неправильными границами.

Для ISIC 2018 статистическая значимость оценивалась с помощью теста Wilcoxon signed-rank на основе парных результатов сегментации по изображению. Для метрики mIoU MVM-UNet достиг статистически значимого улучшения по сравнению с MCAFT с p-значением < 0,001. Эти результаты подтверждают, что наблюдаемое улучшение эффективности в ISIC 2018 маловероятно, что связано со случайными изменениями.

В целом, MVM-UNet достиг наивысшего mIoU, DSC и точности среди сравниваемых методов в наборе данных ISIC 2018 (Таблица 2). Качественные примеры, показанные на рисунке 7, соответствуют этим количественным улучшениям.

Производительность на Synapse
Предложенный метод также был оценён на наборе данных по сегментации мультиорганов Synapse и сравниван с репрезентативными методами, включая UNet 8,21, AttentionU-Net 39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 и MCAFT36 (Таблица 3)). Набор данных Synapse включал восемь брюшных органов: аорту, желчный пузырь, селезёнку, левую почку, правую почку, печень, поджелудочную железу и желудок. Согласно стандартному экспериментальному протоколу, для обучения использовалось 18 случаев (2 212 осевых срезов), а для тестирования — 12 случаев (1 567 осевых срезов). Отдельный набор валидации не был введён. Тестовые случаи использовались исключительно для финальной оценки и не применялись для обучения моделей, настройки гиперпараметров или выбора модели. Репрезентативные результаты качественной сегментации мультиорганов показаны на рисунке 8, а количественное сравнение суммировано в таблице 3.

МодельRef.DSCHD95Аор.Гал.Парень. (L)Парень. (R)Лив.Пан.Spl.Сто.
UNet876.8539.7889.0769.7277.7768.6993.4354.0186.6675.59
Att-UNet3977.7736.0289.5468.8877.9871.1193.5758.0487.3175.74
TransUNet2377.4831.6987.2363.1381.8777.0294.0855.8485.0675.62
TransNorm4078.430.2586.2365.1882.1878.6394.2255.3289.5376.02
Swin U-Net2579.1321.5585.4766.5383.2879.6194.2956.5890.6276.59
TransDeepLab4180.1621.2586.0469.1684.0879.8893.5361.1589.0178.36
MEW-UNet4278.9221.6886.6865.3282.8780.0293.6358.3890.1674.27
MISSormer3080.92 ± 4.2320.09 ± 1.8986,43 ± 0,9869.81 ± 4.5684.29 ± 2.1181.03 ± 3.3493,85 ± 0,8961.11 ± 4.6790.05 ± 3.7880.62 ± 1.02
H2Former1281.05 ± 2.5620.13 ± 7.2386.61 ± 3.2169.32 ± 1.2385.12 ± 4.7882.01 ± 2.8994.09 ± 2.4561.16 ± 0.7689.97 ± 4.1280,94 ± 3,56
HResFormer3480.65 ± 4.0217.48 ± 6.8989.16 ± 2.7866,94 ± 0,7884.61 ± 4.3482.15 ± 2.5693.11 ± 1.3459.92 ± 4.1291.08 ± 3.4580.75 ± 2.01
MedScale-Former3580,78 ± 1,3420.02 ± 3.7888.79 ± 4.0269,82 ± 2,5685.13 ± 0.8781.63 ± 4.7894.10 ± 2.7860,72 ± 1,8990.14 ± 1.5680.93 ± 4.56
MCAFT3681.03 ± 3.4519.98 ± 5.1289,76 ± 0,7668,96 ± 3,8984.54 ± 2.5681.98 ± 3.1294.32 ± 4.0160,85 ± 3,6789.06 ± 4.8980.91 ± 1.78
MVM-UNet (Ours)81.26 ± 1.8918.72 ± 2.1688.53 ± 3.2269.84 ± 4.2385.37 ± 2.6982.67 ± 1.6794.41 ± 3.5661.02 ± 2.7890.19 ± 0.6781.48 ± 3.12

Таблица 3: Сравнение производительности на наборе данных Synapse по сегментации мультиорганов. Сравнение MVM-UNet с репрезентативными методами сегментации на основе CNN, Transformer- и SSM с использованием коэффициента сходства кубиков (DSC), 95-го перцентиля расстояния Хаусдорфа (HD95) и органоспецифических оценок Dice для аорты (Aor), желчного пузыря (гал), левой почки (Kid). (L)), правую почку (Кид. (R)), печени (Лив), поджелудочной железы (пан), селезёнки (Spl.) и желудка (Sto.). Результаты для MVM-UNet представлены как среднее ± стандартное отклонение от трёх независимых экспериментов с случайными семенами. Результаты, представленные в виде отдельных значений, воспроизводились из соответствующих оригинальных публикаций.

MVM-UNet достиг среднего DSC 81,26% ± 1,89% и среднего HD95 18,72 ± 2,16 на трёх независимых заездах. Результаты демонстрируют стабильную производительность сегментации на наборе данных Synapse. Среди оценённых методов MVM-UNet достиг самого высокого среднего DSC и второго по низкому среднему HD95.

Для Synapse статистическая значимость оценивалась с помощью теста Wilcoxon signed-rank на основе парных значений DSC для каждого случая. MVM-UNet показал статистически значимое улучшение по сравнению с H2Former, с p-значением 0,026, что указывает на то, что наблюдаемое улучшение сегментационных результатов было статистически значимым.

Репрезентативные успешные и неоптимальные результаты
Репрезентативные успешные качественные результаты показаны на рисунках 6–8. Успешные результаты характеризуются предсказуемыми сегментационными масками, которые тесно соответствуют аннотациям на основе правды и точно определяют первичные границы поражения или органов. Репрезентативные субоптимальные исходы могут возникать для очень малых целей, границ с низким контрастом, неправильных форм поражения, органов с слабой интенсивностью контраста или анатомически неоднозначных границ, и обычно проявляются как недосегментация, чрезмерная сегментация, утечка границы или прерывистые фрагменты маски. Когда наблюдаются такие результаты, пользователям следует проверить, что изменение размера изображения, нормализация, интерполяция масок, выбор контрольных точек модели, пороговое определение вывода (для наборов данных ISIC) или предсказание argmax (для Synapse), а также методы вычисления метрик соответствуют описанным в протоколе.

Абляционное исследование модуля MV4D
Вклад модуля MV4D оценивался путём постепенного добавления пар зигзагообразного, иерархического, спирального и радиального сканирования, за которыми следовал модуль SFusion Mamba (Таблица 4; Рисунок 9). Когда использовалась только пара зигзагообразного сканирования, производительность сегментации была ограничена. Добавление иерархической пары сканирования значительно повысило производительность, что свидетельствует о преимуществах включения мультимасштабной информации. Последующее добавление пар спирального и радиального сканирования дополнительно улучшило характеристики сегментации, улучшив контурное и граничное представление. Внедрение модуля SFusion Mamba обеспечило наивысшую производительность среди оцененных конфигураций.

МодельПара зигзагообразного сканированияИерархическая пара сканированияПара спирального сканированияПара радиального сканированияSFusion MambaISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet56.7572.4658.0373.45
MVM-UNet72.3884.0173.4584.7
MVM-UNet75.6986.2076.9486.94
MVM-UNet76.4186.6178.2887.82
MVM-UNet80.9491.3282.4790.65

Таблица 4: Абляционное исследование модуля Multi-View 4-Directional (MV4D). Производительность достигается за счёт постепенного включения иерархических, спиральных и радиальных пар сканирования, а также модуля Spatial Fusion Mamba (SFusion Mamba) в архитектуру базовой зигзагообразной пары сканирования. Производительность отражается с использованием среднего пересечения по объединению (mIoU) и коэффициента сходства кубиков (DSC) на наборах данных ISIC 2017 и ISIC 2018.

figure-results-4
Рисунок 9. Абляционное исследование модуля Multi-View 4-Directional (MV4D). (A) Изменение среднего пересечения по объединению (mIoU) после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру. (B) Изменение коэффициента сходства кубиков (DSC) после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру. (C) Изменение mIoU после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру во второй экспериментальной системе. (D) Изменение DSC после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру во второй экспериментальной системе. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

В наборе данных ISIC 2017 полный модуль MV4D достиг mIoU 80,94% и DSC 91,32%. Соответствующие тенденции производительности для mIoU и DSC показаны на рисунках 9A и 9B соответственно. В наборе данных ISIC 2018 полный модуль MV4D достиг mIoU 82,47% и DSC 90,65%. Соответствующие тенденции эффективности показаны соответственно на рисунках 9C и 9D.

Если не указано иное, все абляционные эксперименты проводились с использованием фиксированного случайного семя 100, тогда как основные результаты сравнения были представлены как средние ± SD по трём независимым случайным семянным (1, 52 и 100). Следовательно, результаты абляции предназначены для сравнения относительных вкладов отдельных компонентов в контролируемой односетной среде, а не для воспроизведения итоговых результатов мультисея, представленных в основных сравнительных экспериментах.

В целом, постепенное включение дополнительных пар сканирования и модуля SFusion Mamba стабильно улучшало производительность сегментации, при этом полная конфигурация MV4D обеспечивала наивысшую производительность на обоих наборах данных.

Исследование абляции блока многовидного зрения (MVV)
Блок MVV оценивался путём сравнения базовой архитектуры с версией, включающей ветвь проекции вверх-вниз (Таблица 5). В наборе данных ISIC 2017 включение ветки Up-Down Projection увеличило mIoU с 78,83% до 80,96%, а DSC — с 88,15% до 91,02%. В наборе данных ISIC 2018 mIoU вырос с 80,32% до 82,46%, а DSC — с 89,15% до 90,57%.

МодельБазовый блок MVVПроекция вверх-внизISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet78.8388.1580.3289.15
MVM-UNet80.9691.0282.4690.57

Таблица 5: Абляционное исследование блока многовидного зрения (MVV). Сравнение производительности базового блока Multi-View Vision (MVV) с веткой проекции вверх-вниз и без неё. Производительность отражается с использованием среднего пересечения по объединению (mIoU) и коэффициента сходства кубиков (DSC) на наборах данных ISIC 2017 и ISIC 2018.

Эксперименты по абляции MVV Block проводились с использованием фиксированного случайного семена 100. Следовательно, производительность конфигурации, содержащей ветвь проекции Up-Down Projection, отражает контролируемую абляцию с одним посевом и может немного отличаться от трёхпосевной средней производительности, представленной для полной модели MVM-UNet в основных сравнительных экспериментах.

В целом, внедрение ветки проекции вверх-вниз стабильно улучшало эффективность сегментации на обоих наборах данных, при этом наблюдается рост как для mIoU, так и для DSC.

Исследование абляции модуля многоступенчатого термоядерного синтеза Mamba (MFusion Mamba)
Модуль MFusion Mamba оценивался путём сравнения различных стратегий крупного синтеза вместе с компонентом тонкого синтеза (Таблица 6; Рисунок 10). Без MFusion Mamba MVM-UNet достиг mIoU 75,47% и DSC 86,01% в наборе данных ISIC 2017, а также mIoU 77,49% и DSC 87,29% в наборе данных ISIC 2018. Среди изученных стратегий крупного синтеза продукт Hadamard достиг наибольшего улучшения. Внедрение компонента Fine Fusion дополнительно повысило производительность сегментации. Полная конфигурация MFusion Mamba достигла mIoU 80,95% и DSC 91,18% на ISIC 2017, а также mIoU 82,51% и DSC 90,58% на ISIC 2018.

МодельМаксимальный по элементам грубого синтезаГрубое слияниеСложение по элементамКрупный термоядерный продукт ХадамардМодуль тонкого синтезаISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet75.4786.0177.4987.29
MVM-UNet76.2186.4778.3587.82
MVM-UNet76.8386.8679.1188.30
MVM-UNet78.2687.8380.0688.96
MVM-UNet80.9591.1882.5190.58

Таблица 6: Абляционное исследование модуля многоступенчатого термоядерного синтеза Mamba (MFusion Mamba). Сравнение производительности различных стратегий грубого синтеза, включая максимальное слияние (Max), элементное сложение (⊕) и продукт Адамара (⊙), а также полный модуль тонкого синтеза. Производительность отражается с использованием среднего пересечения по объединению (mIoU) и коэффициента сходства кубиков (DSC) на наборах данных ISIC 2017 и ISIC 2018.

figure-results-5
Рисунок 10. Абляционное исследование модуля Multi-stage Fusion Mamba (MFusion Mamba). (A) Изменение среднего пересечения по объединению (mIoU), полученное с помощью различных стратегий крупного синтеза (максимальное, элементное сложение и произведение Адамара) и полного модуля тонкого синтеза. (B) Изменение коэффициента сходства кубиков (DSC), полученного с помощью различных стратегий крупного синтеза (максимальное, элементное сложение и произведение Адамара) и полного модуля тонкого синтеза. (C) Изменение mIoU, полученное с помощью различных стратегий крупного синтеза (максимальное, элементное сложение и произведение Адамара) и полный модуль тонкого синтеза во второй экспериментальной системе. (D) Изменение DSC, полученное с использованием различных стратегий грубого синтеза (максимальное, элементное сложение и произведение Адамара) и полный модуль тонкого синтеза при втором экспериментальном режиме. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

В наборе данных ISIC 2017 полная конфигурация MFusion Mamba достигла mIoU 80,95% и DSC 91,18%. Соответствующие тенденции производительности для mIoU и DSC показаны соответственно на рисунках 10A и 10B. В наборе данных ISIC 2018 полная конфигурация MFusion Mamba достигла mIoU 82,51% и DSC 90,58%. Соответствующие тенденции эффективности показаны на рисунках 10C и 10D соответственно. Эксперименты по абляции MFusion Mamba проводились с использованием фиксированного случайного семена 100. Следовательно, полная конфигурация MFusion Mamba представляет собой контролируемый результат абляции с одним посевом и может немного отличаться от трёхсеянной средней производительности, представленной для полной модели MVM-UNet в основных сравнительных экспериментах.

В целом, постепенное внедрение стратегии грубого синтеза продукта Hadamard и компонента Fine Fusion стабильно улучшало производительность сегментации, при этом полная конфигурация MFusion Mamba обеспечивала наивысшие показатели на обоих наборах данных.

Резюме исследований абляции
В экспериментах по абляции, постепенно внедряя иерархические, спиральные и радиальные пары сканирования вместе с модулем SFusion Mamba, что стабильно улучшало производительность сегментации (Таблица 4; Рисунок 9). Аналогично, включение ветви проекции вверх-вниз в блок MVV улучшило как mIoU, так и DSC на наборах данных ISIC 2017 и ISIC 2018 (Таблица 5). Полная конфигурация MFusion Mamba также показала наивысшую производительность среди оцениваемых многоступенчатых стратегий объединения элементов (Таблица 6; Рисунок 10).

Абляционное исследование гиперпараметров
Влияние размера входных данных и значения выпадения были оценены на наборах данных ISIC 2017 и ISIC 2018 (Таблица 7). Сравнивались три входных разрешения (256 × 256, 384 × 384 и 512 × 512). При оцененных настройках входное разрешение 256 × 256 достигло самой высокой производительности сегментации в обоих наборах данных.

МодельРазмер входа 256 × 256Размер входа 384 × 384Размер входа 512 × 512Dropout 0.0Dropout 0.1Dropout 0.2Dropout 0.3ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet80.0288.9181.7689.92
MVM-UNet79.9688.8780.9789.47
MVM-UNet77.4887.2878.7688.11
MVM-UNet79.3688.5381.1389.62
MVM-UNet80.9490.1582.4990.50
MVM-UNet79.7188.7180.4689.18

Таблица 7: Абляционное исследование размера входного изображения и значения выпадения. Сравнение производительности MVM-UNet с использованием различных размеров входных изображений и значений выпадения. Результаты сегментации отражаются с использованием среднего пересечения над объединением (mIoU) и коэффициента сходства кубиков (DSC) в наборах данных ISIC 2017 и ISIC 2018.

Также оценивались различные значения отсевающих учёбы. Среди протестированных конфигураций значение dropout 0,2 обеспечивало наивысшую производительность сегментации в обоих наборах данных и поэтому использовалось в основных экспериментах.

Абляционное исследование конфигурации слоя энкодер-декодера
Были оценены различные конфигурации уровней энкодера и декодера для изучения влияния глубины сети на производительность сегментации и вычислительные затраты (Таблица 8). Среди оцененных конфигураций симметричная архитектура {2, 2, 2}-{2, 2, 2, 2} достигла наивысшей общей производительности сегментации, сохраняя при этом относительно низкую сложность модели. Увеличение глубины сети до {2, 2, 9, 2}-{2, 9, 2, 2} обеспечило сопоставимую производительность сегментации, но увеличило как количество параметров, так и вычислительные затраты.

МодельКонфигурация слоя энкодер-декодераПараметры (M)FLOPs (G)ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet{2,2,2,1}-{2,2,2,2}28.224.1280.0288.9181.1689.64
MVM-UNet{2,2,2,2}-{2,2,2,2}28.364.3980.9590.1782.590.41
MVM-UNet{2,2,2,3}-{2,3,2,2}30.144.8879.8388.881.5689.85
MVM-UNet{2,4,2,2}-{2,2,4,2}33.465.3279.6588.781.4589.79
MVM-UNet{2,2,9,2}-{2,9,2,2}45.637.7880.9690.0982.4890.43

Таблица 8: Абляционное исследование конфигураций слоёв энкодер-декодера. Сравнение производительности различных конфигураций слоёв энкодер-декодера. Таблица содержит количество параметров модели (параметров), операций с плавающей запятой (FLOPs), среднего пересечения над объединением (mIoU) и коэффициента сходства кубиков (DSC) в наборах данных ISIC 2017 и ISIC 2018.

Сравнение вычислительных затрат
Вычислительная эффективность финальной модели MVM-UNet была сравнивана с репрезентативными базовыми методами, включая HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former и MCAFT, при одинаковой аппаратной среде и разрешении входов (Таблица 9). Оцениваемые метрики включали время обучения за эпоху, время вывода на изображение, пиковое использование памяти GPU во время обучения, количество обучаемых параметров (параметров) и FLOP. Время обучения измерялось как время, необходимое для завершения одного этапа обучения, время вывода — как среднее время обработки на тестовое изображение, а FLOP — для одного прямого прохода.

МетодRef.Время обучения (эпоха)Время вывода (ms/image)Максимальная память GPU (GB)Параметры (M)FLOPs (G)
HResFormer34520213.0819.2117.00131.70
H-vmunet288827.005.010.748.97
MISSormer3035592.8612.642.33109.45
H2Former1213029.028.833.7133.56
MedScale-Former358023.505.94.963.79
MCAFT3614534.008.730.0012.00
MVM-UNet (Ours)10426.807.928.364.39

Таблица 9: Сравнение вычислительных затрат методов MVM-UNet и репрезентативных базовых методов.Сравнение вычислительной эффективности в одинаковой аппаратной среде и разрешения входа. К представленным метрикам относятся время обучения за эпоху, время вывода на изображение, пиковое использование памяти графического процессора (GPU) во время обучения, количество параметров модели (параметров) и операции с плавающей запятой (FLOPs). Методы с доступными реализациями оценивались в одной и той же экспериментальной среде, когда это было возможно.

Как изложено в таблице 9, MVM-UNet требовал 104 с на обучающую эпоху, 26,8 мс на изображение для вывода, 7,9 ГБ максимальной памяти GPU, 28,36 миллиона обучаемых параметров и 4,39 GFLOP. По сравнению с HResFormer, MISSFormer, H2Former и MCAFT, MVM-UNet требовал меньшего времени обучения, меньшего времени вывода, меньшего пикового использования памяти GPU и меньшего количества FLOP. По сравнению с легкими моделями H-vmunet и MedScale-Former, MVM-UNet требовал большего времени обучения и использования памяти, но сохранял сопоставимую скорость вывода при относительно низкой вычислительной сложности.

Доступность данных и кода
Наборы данных ISIC 2017 и ISIC 2018 доступны в открытом доступе из архива International Skin Imaging Collaboration (ISIC), а набор данных Synapse доступен в репозитории Synapse. Подробности о получении наборов данных приведены в этическом заявлении. Кратко: набор данных ISIC 2017 был получен из официального хранилища данных ISIC 2017 Challenge (https://challenge.isic-archive.com/data/#2017), набор данных ISIC 2018 — из официального репозитория данных ISIC 2018 Challenge Task 1 (https://challenge.isic-archive.com/data/#2018), а набор данных Synapse — из репозитория Synapse под идентификатором присоединения syn3193805 (https://www.synapse.org/Synapse:syn3193805). Соответствующие даты загрузки указаны в этическом заявлении. Первоначальная публичная версия исходного кода MVM-UNet доступна по адресу https://github.com/LIXUEGUANG002/MVM-UNet. Репозиторий включает реализацию модели, основные сетевые модули, конфигурационные файлы, инструкции по организации наборов данных, обучающие скрипты и скрипты оценки. Полный пакет воспроизводимости, включая финальные конфигурационные файлы, полные скрипты экспериментов, дополнительную документацию и контрольные точки обученной модели, будет предоставлен публично после публикации.

Дополнительная таблица 1. Архитектура многоуровневой Vision Mamba UNet (MVM-UNet ). Таблица суммирует последовательную архитектуру сети MVM-UNet, включая входной уровень, вложение патчей, этапы энкодера, блоки Multi-View Vision (MVV), операции объединения патчей, многоступенчатую Fusion Mamba (MFusion Mamba), этапы декодера, финальное апсэмплинг и сегментационную головку. Для каждого этапа указаны соответствующие операции, основные параметры и размер выходных признаков. E1–E4 обозначают карты признаков ступени энкодера, используемые для многоступенчатого синтеза признаков. B, H и W обозначают размер пакета, высоту изображения и ширину изображения соответственно, а K — количество выходных классов (K = 1 для сегментации бинарных поражений кожи и K = 9 для мультиклассовой сегментации Synapse, включающей один класс фонов и восемь классов органов переднего плана). MFusion Mamba генерирует сплавленные многоступенчатые функции энкодера, которые интегрируются с соответствующими функциями декодера во время реконструкции. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 1. Псевдокод модуля Multi-View Four-Directional (MV4D) и многоступенчатого термоядерного синтеза Mamba (MFusion Mamba). Дополнительный файл представляет алгоритмический рабочий процесс двух основных модулей, используемых в MVM-UNet. Алгоритм 1 описывает полный процессуальный конвейер модуля Multi-View Four-Directional (MV4D), включая выравнивание признаков, построение четырёх последовательностей пар сканирования (зигзагообразная, иерархическая, спиральная и радиальная), селективную обработку пространства состояний (S6), Scan-view Fusion Mamba (SFusion Mamba) и реконструкцию выходной карты признаков. Алгоритм 2 описывает модуль Multi-stage Fusion Mamba (MFusion Mamba), включая выравнивание элементов многоступенчатого энкодера, грубое термоядерное слияние, тонкий синтез, интеграцию декодеров и генерацию входной функции синтезированного декодера. Переменные и тензорные размерности определяются внутри алгоритмов. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл кодирования 1. Пакет исходного кода для MVM-UNet (MVM-UNet-master). Дополнительный архив ZIP содержит полную реализацию исходного кода MVM-UNet, использованную в этом исследовании. Пакет включает архитектуру сети, модули Multi-View Four-Directional (MV4D) и Multi-stage Fusion Mamba (MFusion Mamba), конфигурационные файлы, обучающие и оценочные скрипты для наборов данных ISIC 2017, ISIC 2018 и Synapse, функции утилиты и документацию проекта, необходимые для воспроизведения экспериментов, описанных в этом протоколе. Пакет также включает файл README с инструкциями по установке, зависимостями программного обеспечения, организацией наборов данных, а также рабочими процессами обучения и вывода. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол описывает MVM-UNet — основную рамочную систему сегментации медицинских изображений на базе Mamba. Метод был разработан для устранения двух ограничений существующих моделей сегментации. Во-первых, традиционные методы на основе CNN имеют ограниченные возможности моделирования долгосрочных зависимостей и иерархической контекстуальной информации в сложных медицинскихизображениях 43. Во-вторых, методы на основе трансформеров могут моделировать глобальный контекст, но обычно требуют более высокойвычислительной стоимости — 23,25. MVM-UNet использует архитектуруMamba 13, 14, 15, 16, 17, 18, 19, 20 для достижения эффективного дальнодействующего моделирования и вводит многовидное сканирование и многоступенчатое объединение признаков для повышения точности сегментации. С точки зрения исполнения и воспроизводимости протокола, несколько этапов критически важны для получения результатов, сопоставимых с теми, что были представлены в данном исследовании. Во-первых, разделение набора данных, изменение размера изображения, интерполяция масок, стратегия нормализации и конвертация каналов должны быть согласованы с протоколом, поскольку различия в предварительной обработке могут напрямую влиять на распределение входов и границы масок. В частности, сегментационные маски следует изменять размер с помощью интерполяции ближайших соседей, чтобы избежать введения нецелочисленных значенийметок 44. Во-вторых, конфигурацию обучения, включая разрешение входа, размер пакета, настройки оптимизатора, график скорости обучения, случайное начало, коэффициенты веса потерь, правило выбора контрольной точки и порог вывода или операцию argmax, следует проверить перед сравнением результатов. Если воспроизведённые результаты явно ниже указанных значений, пользователям следует сначала проверить путь набора данных, формат аннотации, соглашение между метками переднего и заднего плана, загрузку контрольных точек, разделение валидации или тестирования, а также процедуру вычисления метрики. Утечка границы, фрагментированные маски или отсутствующие мелкие структуры обычно указывают на возможные несоответствия в предварительной обработке, интерполяции масок, выборе контрольных точек или постобработке выводов.

Основным вкладом MVM-UNet является модуль MV4D. В отличие от простых двумерных стратегий сканирования, применявшихся в предыдущих архитектурах на основе моделей состояния ипространства (14, 15, 16, 17, 18, 19, 20, MV4D использует зигзагообразные, иерархические, спиральные и радиальные пары сканирования для захвата взаимодополняющей визуальной информации. Пары зигзагообразного сканирования помогают балансировать локальную и глобальную пространственную информацию, иерархические пары сканирования улучшают извлечение многомасштабных признаков, пары спирального сканирования усиливают глобальное представление контуров, а радиальные пары улучшают локальное извлечение контурных и граничных признаков. SFusion Mamba затем интегрирует эти дополняющие сканирующие методы. Репрезентативные результаты и абляционные эксперименты (таблицы 4 и 5; Рисунок 9) Показать, что как разнообразие паттернов сканирования, так и механизм слияния способствуют улучшению эффективности сегментации. Ещё одним важным компонентом является MFusion Mamba, которая служит модулем слияния признаков между энкодером и декодером. Обычные U-образные архитектуры, включаяU-Net 8, 21,V-Net 44 и многие последующиеварианты 9, 23, 25, в основном передают информацию через поэтапные пропускные соединения. Эта стратегия может не полностью использовать комплементарные многоступенчатые представления кодировщиков. MFusion Mamba решает это ограничение, комбинируя особенности кодировщика с помощью грубого синтеза и тонкого синтеза перед декодированием. Репрезентативные результаты (Таблица 6; Рисунок 10) показать, что MFusion Mamba стабильно улучшает производительность сегментации, что указывает на то, что явное многоступенчатое слияние признаков полезно для сегментации медицинских изображений.

Методологический вклад MVM-UNet следует рассматривать как архитектурный редизайн, а не как изобретение каждой отдельной операции с нуля. U-образные архитектуры энкодер-декодера, остаточные соединения, проекционные слои и блоки Mamba/пространства состояний (SSM) были широко изучены в предыдущихисследованиях 8, 13, 14, 15, 16, 17, 18, 19, 20, 21, 23, 24, 25,29,44. Однако прямое объединение этих компонентов не обязательно решает конкретные задачи сегментации медицинских изображений. Новизна MVM-UNet заключается в скоординированном проектировании трёх аспектов. Во-первых, модуль MV4D заменяет один или ограниченный паттерн сканирования четырьмя дополняющими парными ветвями, что позволяет модели фиксировать пространственную целостность, многомасштабную структуру, информацию о глобальных контурах и детали локальных границ. Во-вторых, SFusion Mamba и MVV Block объединяются и улучшают специфические функции сканирования перед передачей на следующий этап сети. В-третьих, MFusion Mamba явно агрегирует функции многоступенчатого энкодера перед декодированием, дополняя традиционные пропускныесоединения 8, 21, 44 и улучшая использование иерархической информации. Результаты абляции (Таблицы 4–6; Рисунки 9 и 10) дополнительно подтверждают это конструктивное обоснование, показывая, что многовидное сканирование, специфическое сканирование слияния, ветвь проекции вверх-вниз и многоступенчатое слияние признаков способствуют улучшению производительности сегментации. Таким образом, вклад MVM-UNet заключается в специфической задаче и экспериментально проверенной интеграции пространственного моделирования на основе Mamba и слияния признаков энкодера и декодера для сегментации медицинских изображений.

Несмотря на высокую производительность, MVM-UNet имеет несколько ограничений. Во-первых, производительность сегментации не улучшалась стабильно при увеличении входных изображений, что говорит о том, что текущая архитектура может не полностью использовать информацию высокого разрешения. Во-вторых, модель не была широко изучена при условиях с высоким шумом или низким контрастом, которые часто встречаются в клинической практике и могут влиять на устойчивость сегментации. В-третьих, хотя модель показала высокую производительность на трех общедоступных наборах данных, необходима дальнейшая проверка более крупных и разнообразных наборов медицинской визуализации. Протокол можно адаптировать для других задач сегментации медицинских изображений, но следует тщательно внедрять несколько модификаций. Для новой задачи бинарной сегментации пользователям следует модифицировать загрузчик наборов данных, параметры нормализации, входное разрешение и порог на переднем плане, сохраняя при этом процедуру потерь и оценки бинарного BCE-Dice. Для новой задачи многоклассовой сегментации пользователям следует обновлять количество выходных классов, отображение класс-индекс, конвертацию одно-горячей метки, конфигурацию потерь CE-Dice и метрики оценки поклассам 44. Для наборов данных в оттенках серого конфигурация входного канала должна быть согласована с архитектурой модели, используя либо одноканальную входную проекцию, либо повторяя изображение в оттенках серого для создания трёхканального входа, в зависимости от реализации. Метод может работать неоптимально, когда целевые структуры крайне малы, границы слабы или неоднозначны, контраст изображений существенно отличается от обучающих данных, либо при значительном сдвиге целевого набора данных. В таких условиях пользователям может понадобиться корректировать разрешение ввода, стратегию дополнения, балансировку классов, снижение веса или тонкую настройку графика, сохраняя тот же протокол оценки для обеспечения справедливых сравнений.

В наборе данных Synapse MVM-UNet достиг высокой производительности сегментации мультиорганов при широко используемом разделе обучения на 18 и 12 случаев тестирования. Хотя предложенный метод достиг самого высокого среднего DSC среди репрезентативных базовых методов, оценённых в данном исследовании (Таблица 3), некоторые более современные методы показали более высокую производительность Synapse при различных обучающих настройках и протоколахоценки 29. Поэтому мы избегаем описания MVM-UNet как достижения общего передового уровня на Synapse и вместо этого описываем его как достижение высокой эффективности в оценённых экспериментальных условиях. Эти результаты свидетельствуют о том, что производительность MVM-UNet обусловлена адаптацией моделирования на основе Mamba для сегментации медицинскихизображений 13,14,15,16,17,18,19,20. Вместо того чтобы полагаться на единую стратегию сканирования, MVM-UNet разбивает визуальное моделирование признаков на несколько взаимодополняющих сканирующих видов и интегрирует их через SFusion Mamba. Кроме того, MFusion Mamba улучшает информационный поток между энкодером и декодером, явно агрегируя многоступенчатые функции кодера за пределами традиционных пропускныхсоединений 8,21,44. Эта конструкция позволяет предлагаемой модели достигать высокой производительности как в сегментации бинарных поражений кожи, так и в задачах сегментации мультиорганов.

Будущие работы должны быть сосредоточены на улучшении MVM-UNet для сегментации медицинских изображений высокого разрешения. Более глубокие или адаптивные многомасштабные архитектуры могут позволить модели более эффективно использовать информацию о изображениях высокого разрешения. Будущие исследования также должны оценивать устойчивость MVM-UNet при шумных, низкоконтрастных и доменно-смещённых условиях визуализации. Кроме того, предлагаемая стратегия многовидного сканирования может быть расширена на другие задачи по анализу медицинских изображений, включая обнаружениепоражений 4, локализацию органов, классификацию опухолей и трёхмерную сегментацию10,11. В заключение, MVM-UNet предоставляет эффективную и воспроизводимую основу для сегментации медицинских изображений. Интеграция модуля MV4D и MFusion Mamba позволяет модели фиксировать дополняющую пространственную информацию, многомасштабный контекст, глобальную информацию о контурах, детали локальных границ и многоступенчатые семантические признаки. Репрезентативные результаты, полученные по наборам данных ISIC 2017, ISIC 2018 и Synapse, демонстрируют эффективность предлагаемой архитектуры. Этот протокол служит практическим ориентиром для исследователей, разрабатывающих эффективные архитектуры на базе SSM/Mamba для сегментации медицинскихизображений 13,14,15,16,17,18,19,20.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конкурирующих финансовых интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование не получило внешнего финансирования.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Оборудование - GPU-рабостанция или GPU-серверПлатформа институциональных вычислений / локальная рабостанцияКастомная локальная GPU-рабостанция; Ubuntu 22.04.1 с ядром Linux 6.8.0; Intel Core i9-13900K CPU; видеокарта NVIDIA A800; 128 ГБ ОЗУ; 512 ГБ локального хранилища.Вычислительная платформа для тренировки, валидации, тестирования, абляции и экспериментов только с инференсом.
Оборудование - Графический процессор (GPU)NVIDIA CorporationВидеокарта NVIDIA A800 (80 ГБ памяти).Тренинг и инференс с ускорением GPU.
Оборудование - Центральный процессор (CPU)Intel Corporation / AMD13-го поколения Intel Core i9-13900K CPU.Хост-процессор для загрузки данных, предобработки и выполнения экспериментов.
Оборудование - Системная память (RAM)Платформа институциональных вычислений / локальная рабостанция128 ГБ системной памятиПамять для загрузки наборов данных, предобработки и тренировки.
Оборудование - ХранилищеПлатформа институциональных вычислений / локальная рабостанция2 ТБ NVMe твердотельного накопителя.Хранилище для наборов данных, контрольных точек, логов и сгенерированных предсказаний.
Софтверное окружение - Операционная системаCanonical Ltd.Рекомендуется: Ubuntu 22.04.1 LTSОперационная система для вычислительной среды.
Софтверное окружение - Conda окружениеAnaconda, Inc. / MinicondaИмя окружения: mvmunetPython окружение, используемое для установки и изоляции зависимостей.
Софтверное окружение - PythonPython Software FoundationPython 3.8Язык программирования, используемый для реализации и выполнения экспериментов.
Софтверное окружение - CUDA toolkitNVIDIA CorporationCUDA Toolkit 11.8GPU вычислительный бэкенд, необходимый для PyTorch и пакетов, связанных с Mamba.
Софтверное окружение - cuDNNNVIDIA CorporationcuDNN 8.7.0.ГПУ-ускоряемые примитивы глубокого обучения, используемые через PyTorch.
Пакет Python - PyTorchPyTorchtorch == 2.0.1Фреймворк глубокого обучения для тренировки моделей, расчета потерь, оптимизации и инференса.
Пакет Python - TorchvisionPyTorchtorchvision == 0.14.0Утилиты для преобразования изображений, используемые при предобработке и увеличении.
Пакет Python - TorchaudioPyTorchtorchaudio == 0.13.0Устанавливается в рекомендуемой среде PyTorch.
Пакет Python - timmtimm developerstimm == 0.4.12Зависимость модельного компонента или утилиты, указанная в инструкциях среды репозитория.
Пакет Python - tritonOpenAI / Triton developerstriton == 2.0.0Зависимость, используемая GPU-ускоряемыми компонентами моделирования последовательностей.
Пакет Python - causal-conv1dcausal-conv1d developerscausal_conv1d == 1.0.0Эффективная зависимость причинно-следственной свертки, необходимая для реализации Mamba.
Пакет Python - mamba-ssmMamba SSM developersmamba_ssm == 1.0.1Пакет моделирования последовательностей состояний, используемый для компонентов, связанных с Mamba/S6.
Пакет Python - NumPyNumPy developersВерсия NumPy 1.24.3.Численные вычисления и операции с массивами.
Пакет Python - SciPySciPy developersВерсия SciPy 1.10.1.Научные вычисления; scipy.ndimage.zoom импортируется в utils.py.
Пакет Python - SimpleITKInsight Software ConsortiumВерсия SimpleITK 2.2.1.Утилита ввода/вывода и предобработки медицинских изображений, импортируемая в utils.py.
Пакет Python - MedPyMedPy developersВерсия MedPy 0.4.0.Пакет для вычисления метрик медицинских изображений, импортируемый в utils.py.
Пакет Python - scikit-imagescikit-image developersВерсия scikit-image 0.21.0.Зависимость для обработки изображений, указанная в README.
Пакет Python - scikit-learnscikit-learn developersВерсия scikit-learn 1.3.2.Пакет утилит машинного обучения, указанный в README.
Пакет Python - matplotlibMatplotlib developersВерсия Matplotlib 3.7.2.Используется для сохранения качественных визуализаций.
Пакет Python - h5pyh5py developersВерсия h5py 3.9.0.Поддержка файлов HDF5 для тестовых объемов Synapse.
Пакет Python - thopTHOP developersВерсия THOP 0.1.1.post2209072238.Используется при расчете FLOPs и вычислительной стоимости, связанной с параметрами.
Пакет Python - packagingPython Packaging AuthorityВерсия packaging 23.1.Зависимость, указанная в README.
Пакет Python - pytestpytest developersВерсия pytest 7.4.0.Зависимость, указанная в README.
Пакет Python - chardetchardet developersВерсия chardet 5.2.0.Зависимость, указанная в README.
Пакет Python - yacsYACS developersВерсия yacs 0.1.8.Утилита конфигурации, зави

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang F, et al. Cross co-teaching for semi-supervised medical image segmentation. Pattern Recognit. 2024;152:110485.
  2. Gu Y, et al. Dual-scale enhanced and cross-generative consistency learning for semi-supervised medical image segmentation. Pattern Recognit. 2025;158:111140.
  3. Zhu X, Wang W, Zhang C, Wang H. Polyp-Mamba: A hybrid multi-frequency perception gated selection network for polyp segmentation. Inf Fusion. 2025;115:103161.
  4. Iqbal S, et al. TBConvL-Net: A hybrid deep learning architecture for robust medical image segmentation. Pattern Recognit. 2025;158:111147.
  5. Zhao Z, et al. Balanced feature fusion collaborative training for semi-supervised medical image segmentation. Pattern Recognit. 2025;157:110986.
  6. Zhou T, et al. MambaYOLACT: You only look at Mamba prediction head for head-neck lymph nodes. Artif Intell Rev. 2025;58(6).
  7. Zhao Y, et al. MGF-GCN: Multimodal interaction Mamba-aided graph convolutional fusion network for semantic segmentation of remote sensing images. Inf Fusion. 2025;122:103268.
  8. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2015.
  9. Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J. UNet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE Trans Med Imaging. 2019;39(6):1856-1867.
  10. Shaker A, et al. UNETR++: Delving into efficient and accurate 3D medical image segmentation. IEEE Trans Med Imaging. 2024;43(9):3377-3390.
  11. Zhou HY, et al. nnFormer: Volumetric medical image segmentation via a 3D Transformer. IEEE Trans Image Process. 2023;32:4036-4045.
  12. He A, et al. H2Former: An efficient hierarchical hybrid Transformer for medical image segmentation. IEEE Trans Med Imaging. 2023;42(9):2763-2775.
  13. Zhu L, et al. Vision Mamba: Efficient visual representation learning with bidirectional state space model. In: Proceedings of the 41st International Conference on Machine Learning (ICML). 2024.
  14. Liu Y, et al. VMamba: Visual state space model. Adv Neural Inf Process Syst. 2024;37:103031-103063.
  15. Ma J, Li F, Wang B. U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv. 2024;arXiv:2401.04722.
  16. Wang Z, et al. Mamba-UNet: UNet-like pure visual Mamba for medical image segmentation. arXiv. 2024;arXiv:2402.05079.
  17. Huang T, et al. LocalMamba: Visual state space model with windowed selective scan. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  18. Zhang Z, et al. Motion Mamba: Efficient and long sequence motion generation. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  19. Hu VT, et al. Zigma: A DiT-style zigzag Mamba diffusion model. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  20. Rahman MM, et al. Mamba in vision: A comprehensive survey of techniques and applications. arXiv. 2024;arXiv:2410.03105.
  21. Falk T, et al. U-Net: Deep learning for cell counting, detection, and morphometry. Nat Methods. 2019;16(1):67-70.
  22. Gu R, et al. CA-Net: Comprehensive attention convolutional neural networks for explainable medical image segmentation. IEEE Trans Med Imaging. 2020;40(2):699-711.
  23. Chen J, et al. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of Transformers. Med Image Anal. 2024;97:103280.
  24. Zhang Z, Zhang W. Pyramid medical Transformer for medical image segmentation. arXiv. 2021;arXiv:2104.14702.
  25. Cao H, et al. Swin-Unet: UNet-like pure Transformer for medical image segmentation. In: European Conference on Computer Vision (ECCV). Springer; 2022.
  26. Chen B, et al. TransAttUNet: Multi-level attention-guided U-Net with Transformer for medical image segmentation. IEEE Trans Emerg Top Comput Intell. 2023.
  27. Jiang S, Li J. TransCUNet: UNet cross-fused Transformer for medical image segmentation. Comput Biol Med. 2022;150:106207.
  28. Wu R, Liu Y, Liang P, Chang Q. H-vmunet: High-order Vision Mamba UNet for medical image segmentation. Neurocomputing. 2025;624:129447.
  29. Liu J, et al. Swin-UMamba: Adapting Mamba-based vision foundation models for medical image segmentation. IEEE Trans Med Imaging. 2024.
  30. Huang X, et al. MISSFormer: An effective Transformer for 2D medical image segmentation. IEEE Trans Med Imaging. 2023;42(5):1484-1494.
  31. Ruan J, et al. MALUNet: A multi-attention and lightweight U-Net for skin lesion segmentation. In: 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE; 2022.
  32. Ruan J, Xiang S. VM-UNet: Vision Mamba UNet for medical image segmentation. arXiv. 2024;arXiv:2402.02491.
  33. Valanarasu JMJ, Patel VM. UNeXt: MLP-based rapid medical image segmentation network. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2022.
  34. Ren S, Li X. HResFormer: Hybrid residual Transformer for volumetric medical image segmentation. IEEE Trans Neural Netw Learn Syst. 2025;36(6):10558-10566.
  35. Karimijafarbigloo S, Azad R, Kazerouni A, Merhof D. MedScale-Former: Self-guided multiscale Transformer for medical image segmentation. Med Image Anal. 2025;103.
  36. Yan S, et al. Multi-scale convolutional attention frequency-enhanced Transformer network for medical image segmentation. Inf Fusion. 2025;119.
  37. Gao Y, Zhou M, Metaxas DN. UTNet: A hybrid Transformer architecture for medical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2021.
  38. Mei J, et al. SANet: A slice-aware network for pulmonary nodule detection. IEEE Trans Pattern Anal Mach Intell. 2021;44(8):4374-4387.
  39. Hu XZ, Jeon WS, Rhee SY. ATT-UNet: Pixel-wise staircase attention for weed and crop detection. In: 2023 International Conference on Fuzzy Theory and Its Applications (iFUZZY). IEEE; 2023.
  40. Wang X, et al. Transferable normalization: Towards improving transferability of deep neural networks. Adv Neural Inf Process Syst. 2019;32.
  41. Azad R, et al. TransDeepLab: Convolution-free Transformer-based DeepLabV3+ for medical image segmentation. In: International Workshop on Predictive Intelligence in Medicine (PRIME). Springer; 2022.
  42. Ruan J, Gao J, Xie M, Xiang S. Learning multi-axis representation in frequency domain for medical image segmentation. Mach Learn. 2025;114(1):10.
  43. Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press; Cambridge, MA; 2016.
  44. Milletari F, Navab N, Ahmadi SA. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. In: 2016 Fourth International Conference on 3D Vision (3DV). IEEE; 2016.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

234234SSMUNet

Похожие статьи