Методическая статья

MixKNet: модифицированная U-образная сеть со сверткой гибридных каналов для сегментации медицинских изображений

DOI:

10.3791/68450

15 июля 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании представлен облегченный вариант U-Net с улучшенной точностью сегментации с использованием гибридной свертки и внимания канала, что позволяет достичь современных результатов на MoNuseg и GlaS с меньшим количеством параметров.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Технология компьютерной обработки изображений на основе искусственных нейронных сетей быстро развивалась в последние годы и нашла широкое применение в различных областях. В области обработки медицинских изображений UNet и его варианты показали большие успехи в задачах обнаружения поражений, сегментации клеток и сегментации полипов. В данном исследовании представлена модифицированная U-образная сеть с уменьшенными параметрами сети, достигнутой за счет уменьшения глубины сети и увеличения сетевых каналов для повышения обучаемости модели. Чтобы противодействовать снижению способности к обучению, вызванному сжатием глубины, вместо исходного сверточного модуля сети вводится гибридный сверточный модуль. Модель вводит механизм внимания канала между слоем и слоем свертки точки для улучшения практической возможности извлечения признаков канала. В статье также делается вывод о том, что использование свертки смешанной глубины может эффективно решить проблему размера целевой сегментации, что затрудняет подгонку одной модели для нескольких наборов данных. Предложенная модель позволяет получить самые современные результаты на двух популярных общедоступных наборах данных, MoNuseg и GlaS, со средним увеличением на 1,0% и 1,37% соответственно. Общие параметры модифицированной модели уменьшены до 1,71M, что в 38,6 раза меньше по сравнению с UCtransNet с 65,6 млн параметров.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сегментация медицинских изображений имеет решающее значение в различных клинических приложениях, включая диагностику, планирование лечения и мониторинг заболеваний. Традиционные методы обработки изображений, основанные на алгоритмах проектирования признаков, больше не подходят для обработки больших объемов данных, генерируемых в современных средах здравоохранения. К счастью, развитие технологии искусственных нейронных сетей и совершенствование аппаратных возможностей компьютеров сделали возможным обучение и развертывание крупномасштабных моделей нейронных сетей. В результате алгоритмы обработки компьютерного зрения на основе моделей машинного обучения постоянно разрабатываются и применяются в различных областях.

Наиболее репрезентативной модельной структурой в семантической сегментации медицинских изображений являетсяUNet 1 с архитектурой кодирования-декодирования. Сначала модель использует многоуровневый кодировщик для извлечения признаков разных масштабов из входного изображения. Затем декодер шаг за шагом повышает выборку, объединяя семантические признаки, выведенные энкодером соответствующего уровня, в виде пропуска соединения. Тем не менее, производительность архитектуры UNet может быть дополнительно улучшена за счет применения нескольких методов. Например, было показано, что механизмы внимания эффективны в повышении производительности сверточных нейронных сетей. Эти механизмы могут выборочно выделять существенные особенности во входных данных, что приводит к лучшему обучению представлению и точности сегментации.

В настоящее время многие исследователи сосредоточены на эффективном объединении признаков, извлеченных энкодером на стадии декодирования. Некоторые из наиболее распространенных вариантов UNet включают AttentionUNet 2, RecurrentUNet 3 и V-Net4. Эти подходыиспользуют механизмы внимания5, такие как пространственное внимание, для выделения информативных областей карт признаков и подавления неинформативных областей. Кроме того, некоторые варианты включают рекуррентные нейронные сети для моделирования последовательного характера медицинских изображений и улучшения представления признаков. Модели предварительного обучения, такие как VGG6, ResNet7 и DenseNet8, широко используются для повышения производительности U-образных сетей за счет использования их богатых знаний, полученных из крупномасштабных наборов данных. Кроме того, механизмы преобразования, такие как самовнимание и многоголовое внимание, были введены в долгосрочные зависимости моделей и захватывают глобальную контекстуальную информацию, что приводит к повышению производительности сегментации.

Однако, несмотря на то, что эти варианты улучшились по сравнению с оригинальной версиейUNet 1, они все еще имеют определенные ограничения в работе со сложными медицинскими изображениями с различными масштабами и формами. Более того, повышенная сложность этих вариантов часто приводит к более высоким вычислительным затратам и более длительному времени обучения, что ограничивает их применимость в практических условиях.

Для улучшения архитектурыUNet 1 предлагается модифицированная модель под названием MixKNet (Mix Kernel Size U-shape Net), которая уменьшает глубину сети при одновременном увеличении количества каналов для повышения способности к обучению. Однако уменьшение глубины может привести к снижению общей производительности. Чтобы смягчить эту проблему, был введен гибридно-канальный сверточный модуль, заменивший исходный сверточный нейронный модуль. Этот модуль включает в себя механизм внимания канала между слоями глубинной и точечной свертки, направленный на усиление способности модели извлекать эффективные особенности канала.

Чтобы определить практическую применимость, важно отметить, что предложенный метод был оценен на относительно небольших наборах медицинских изображений, с индивидуальным разрешением изображения в диапазоне от 500 × 500 до 1000 × 1000 пикселей. Для обучения модели все изображения были изменены до 224 × 224 пикселей. Реализация была осуществлена с помощью PyTorch на одном графическом процессоре NVIDIA RTX 3090. Эти операционные параметры позволяют предположить, что метод вычислительно осуществим для умеренных экспериментальных установок и адаптируется к ограниченным размерам наборов данных.

В заключение следует отметить, что в данной статье представлена новая модификация U-образной структуры сети и представлен модуль свертки гибридного канала вместе с механизмом внимания канала, которые улучшают производительность сегментации на наборах медицинских изображений. Основные результаты этой работы заключаются в следующем: (1) Предложение модифицированной U-образной структуры сети с гибридным модулем глубокой свертки, который заменяет исходный сверточный нейронный модуль. (2) Введение механизма внимания канала между глубоким и точечным слоями свертки для улучшения эффективной способности модели извлекать признаки канала. (3) Получение современных результатов одновременно на двух популярных общедоступных наборах данных в наборе данных ядерной сегментации MoNuseg9 со значительно меньшим количеством параметров модели (по сравнению с UCtransNet10 с 64 млн параметров) и улучшенной производительностью на наборе данных сегментации желез GlaS11 .

Остальная часть этой статьи организована следующим образом. Шаг 2 представляет собой всесторонний обзор предыдущих исследований поUNet 1 и его вариациям в сегментации медицинских изображений. Рассматриваются сильные и слабые стороны существующих подходов, а также связанные с ними работы по механизмам внимания, смешанно-глубинным сверточным сетям и их применению в моделях сегментации. На шаге 3 подробно описана архитектура предлагаемой модели MixKNet, включая модификации структуры UNet, интеграцию механизма внимания канала и использование свертки смешанной глубины. На Шаге 4 представлены результаты обширных экспериментов, сопровождаемые обсуждением и исследованием абляции для оценки вклада каждого компонента. Наконец, на шаге 5 мы завершаем работу и намечаем возможные направления будущих исследований.

Этот раздел начинается с обзора предыдущих исследований UNet и его вариантов в сегментации медицинских изображений, в котором излагаются сильные и слабые стороны существующих методов. Кроме того, обсуждаются связанные с этим исследования механизмов внимания и их применения в моделях сегментации. Также рассматриваются последние разработки, связанные с методами глубокой свертки для повышения производительности сегментации. Сравнительный анализ предложенного MixKNet (c) и других моделей представлен на рисунке 1, где пунктирными линиями обозначены пропускные соединения.

UNet и его вариации
Архитектура UNet была впервые предложена Ronneberger et al. в 2015году 1 и с тех пор широко используется для сегментации медицинских изображений. Модель состоит из пути кодирования и пути декодирования. Кодировщик извлекает высокоуровневые признаки из входного изображения, в то время как декодер повышает выборку и объединяет их для создания карты сегментации. С тех пор в архитектуру UNet были внесены различные изменения для повышения ее производительности при сегментации медицинских изображений. Одной из наиболее распространенных модификаций является внедрение пропускных соединений, которые, как было показано, повышают точность сегментации. Zhou et al.12 предложили вариант UNet, который использует плотные пропускающие соединения, что позволяет модели лучше сохранять пространственную информацию.

Еще одной популярной модификацией архитектуры UNet является добавление механизмов внимания. Эти механизмы могут помочь модели выборочно выделять наиболее важные признаки, что приводит к лучшему обучению представлений и точности сегментации. Некоторые примеры вариантов с механизмами внимания включают AttentionUNet 2, ResUNet с вентами внимания13 и Dense-UNet с вентилиями внимания14. Помимо вышеперечисленных модификаций, для сегментации медицинских изображений было предложено множество других вариантов архитектуры UNet. UCTransNet10 — это вариант архитектуры U-Net, включающий в себя пропускающие соединения и модуль трансформатора. Пропускающие соединения в UCTransNet10 переосмыслены с точки зрения каналов, что позволяет лучше использовать функции и уменьшить количество параметров. Модуль «Трансформатор» добавлен для захвата дальних зависимостей и повышения качества перевода. Было продемонстрировано, что UCTransNet10 демонстрирует самые современные результаты в нескольких тестах машинного перевода. Зихан и его коллеги предложили модель глубокого обучения под названием LViT15, которую они применили для задач анализа медицинских изображений. Чтобы расширить полуконтролируемую версию LViT15 и компенсировать недостаток качества данных изображений, они предложили механизм экспоненциальной итерации псевдометок (EPI). Кроме того, чтобы сохранить локальные особенности изображений, они предложили модуль внимания на уровне пикселей (PLAM), который выборочно фокусируется на важных особенностях изображения.

Механизм внимания
Механизмы внимания широко изучены в машинном обучении, в частности в обработке естественного языка и компьютерном зрении. В последние годы механизмы внимания также применяются к задачам анализа медицинских изображений, включая сегментацию изображений. Бахданау и др.16 представили механизм внимания в нейронном машинном переводе для улучшения качества перевода. Механизм позволяет модели выборочно фокусироваться на соответствующих частях входной последовательности, улучшая качество перевода. С тех пор были предложены различные механизмы внимания для задач анализа изображений. Одним из распространенных типов механизмов внимания является механизм пространственного внимания, который включает в себя применение веса к каждому пикселю в карте признаков в зависимости от его важности. Например, Guo et al.17 предложили механизм пространственного внимания для задачи сегментации сосудов сетчатки. Механизм использует стробируемый механизм для настройки веса пространственных объектов, улучшая способность модели различать пиксели сосуда и пиксели, не относящиеся к сосуду. Другим типом механизма внимания является внимание канала, которое фокусируется на настройке весов карт признаков по каналам. Hu et al.18 предложили сеть сжатия и возбуждения (SENet), которая применяет внимание по каналам к картам признаков, улучшая производительность задачи классификации изображений. В последнее время механизмы внимания были объединены со сверточными нейронными сетями (СНС) для задач сегментации изображений. Например, Chen et al.19 предложили управляемую вниманием сеть для сегментации опухолей головного мозга, которая сочетает в себе пространственные и канальные механизмы внимания.

Последние достижения в области полуконтролируемого и мультимодального обучения для анализа медицинских изображений и дистанционного зондирования продемонстрировали многообещающие улучшения производительности. Yang et al.20 предложили UMSCS, новую непарную мультимодальную сегментационную структуру, которая использует кросс-модальное генеративное обучение и полуконтролируемые стратегии. Zhang et al. представили несколько передовых методов: модель согласованности трех ветвей с расширенными доказательствами для полуконтролируемой сегментации21, структуру самосознания и перекрестной выборки прототипов для сегментации медицинских изображений22 и подход к оптимизации иерархических характеристик с учетом временных частот для распознавания помех радаров с синтезированной апертурой (SAR) в аэрокосмической области23. Эти работы в совокупности подчеркивают важность гибридного контроля и предметно-ориентированного моделирования признаков как в медицинских, так и в инженерных задачах визуализации.

Свертка по глубине
Свертка по глубине предназначена для захвата корреляций по каналам в картах входных признаков и, как было показано, повышает эффективность и точность сверточных нейронных сетей.

Одной из самых ранних и влиятельных моделей свертки по глубине является MobileNet24, предложенная Говардом и соавторами в 2017 году. MobileNet использует сепарабельную свертку по глубине, которая применяет свертку по глубине, за которой следует точечная свертка, чтобы уменьшить количество параметров и вычислений, необходимых для сверточных слоев. Это позволяет MobileNet достигать высочайшей точности в задачах классификации изображений, используя при этом значительно меньше параметров, чем традиционные сверточные нейронные сети. С момента появления MobileNet был предложен ряд других архитектур свертки по глубине, включая ShuffleNet25, Xception26 и ResNeXt27. Эти модели различаются по конкретной реализации глубокой свертки, но все они имеют общую цель снижения вычислительной сложности сверточных слоев при сохранении или повышении точности. Глубокая свертка также применяется к задаче семантической сегментации, в таких моделях, как PSPNet28 , использующей глубинную сепарабельную свертку для снижения требований к вычислениям и памяти крупномасштабных сверточных слоев. MixNet29 еще больше расширяет идею глубокой свертки, вводя смешанную глубокую свертку, которая использует несколько размеров ядер для захвата объектов в разных масштабах. Было показано, что он превосходит другие современные модели, сохраняя при этом сопоставимые параметры и FLOP. Эти модели продемонстрировали значительное повышение точности и эффективности по сравнению с традиционными сверточными нейронными сетями в различных задачах семантической сегментации.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом разделе описывается предлагаемая архитектура MixKNet для сегментации медицинских изображений. Модель MixKNet расширяет архитектуру UNet, включая механизмы внимания и смешанные слои глубокой свертки. Программное обеспечение, использованное в данном исследовании, указано в Таблице материалов.

1. Общая архитектура

  1. Архитектура MixKNet, показанная на рисунке 2, соответствует стандартной структуре UNet, состоящей из кодировщика и декодера. Установите форму ввода на 224 × 224 × 3. В кодировщике используйте два модуля DownBlock, каждый из которых включает в себя свертку глубины 1×1, максимальный уровень пула 2×2 и многоядерную свертку (MDConv) с размерами ядер, такими как [1, 3, 5] или [3-13].
  2. В декодере используйте два модуля UpBlock - каждый из них выполняет билинейную восходящую дискретизацию, конкатенацию пропуска соединений, свертку глубины 1×1 и многоядерную свертку.
  3. Используйте активации ReLU после каждого сверточного блока. Примените заключительную свертку 1×1 для получения выходных данных, за которой следует активация Sigmoid для двоичной сегментации, или оставьте неактивированной для внешнего Softmax в многоклассовых задачах.

2. Сплющенная U-образная форма

ПРИМЕЧАНИЕ: Уменьшите глубину архитектуры нейронной сети, чтобы уменьшить вычислительную сложность и размер модели, помня при этом, что это может снизить способность к обучению сложным представлениям данных.

  1. Сократите четырехуровневую архитектуру UNet до двухуровневой версии, как показано на рисунке 3, чтобы уменьшить количество параметров модели при сохранении основных компонентов кодирования и декодирования.
    1. Постройте плоскую архитектуру, удалив уровни 3 и 4 из путей кодировщика и декодера, и сохраните соединения элементов на уровне 2.
    2. Отрегулируйте операции понижения и повышения дискретизации в соответствии с уменьшенной глубиной использования — всего один шаг понижения дискретизации до узкого места и один шаг повышения дискретизации после.
      ПРИМЕЧАНИЕ: Такое уменьшение глубины может снизить способность модели к обучению, так как она может не отражать сложные отношения между входом и выходом. Увеличение числа каналов свертки оснований в каждом слое модели может помочь преодолеть это ограничение, повышая способность модели обучаться различительным признакам. Благодаря большему количеству каналов свертки модель может захватывать более сложные шаблоны и отношения во входных данных, компенсируя уменьшенную глубину и повышая производительность.
  2. Учтите, что увеличение числа каналов свертки может также повысить вычислительную сложность модели и использование памяти, представляя собой компромисс между обучением и скоростью вывода. Найдите подходящий баланс между производительностью модели и эффективностью вычислений.

3. Смешайте размер ядра для энкодера

  1. Чтобы повысить производительность кодировщика, используйте подход со смешанным размером ядра в модуле DC-CA (Depthwise Convolution and Channel Attention), как показано на рисунке 4. Вместо того, чтобы полагаться на один размер ядра, примените несколько углублений параллельно с различными размерами ядер (например, 1, 3, 5, 7, 9, 11, 13) для извлечения признаков в нескольких рецептивных полях.
  2. Примените пакетную нормализацию и активацию ReLU к каждой ветви по отдельности перед конкатенацией. Объедините выходные данные из каждой ветви ядра по размерности канала.
  3. Используйте точечную свертку 1×1 после конкатенации для объединения объектов и проецирования их на фиксированное количество выходных каналов, сохраняя согласованность с ожидаемым размером входных данных следующего слоя.
    ПРИМЕЧАНИЕ: Смешанный слой глубокой свертки состоит из нескольких углубительных сверток с различными размерами ядер, за которыми следует точечная свертка. Такая конструкция позволяет захватывать объекты в различных масштабах, что имеет решающее значение в задачах сегментации медицинских изображений. В первом модуле используются три размера ядра — 1, 3 и 5 — для увеличения рецептивного поля, в то время как во втором модуле используются ядра большего размера и больше групп, а именно 3, 5, 7, 9, 11 и 13.

4. Направляйте внимание в нужное русло

  1. Интегрируйте механизм внимания канала в модуль DC-CA для улучшения представления функций.
    1. Используйте свертку 1×1 с «одинаковым» заполнением для создания карт внимания по каналам. Примените объединение глобальных средних по пространственным измерениям, чтобы создать компактный дескриптор для каждого канала.
    2. Используйте облегченную сверточную сеть, состоящую из двух сверток 1×1 с активацией ReLU между ними. Избегайте разделения веса между каналами — изучайте уникальные веса внимания для каждого канала.
    3. Примените активацию сигмовидной кишки к конечному выходу, чтобы получить нормализованные оценки внимания. Повторное взвешивание карт входных признаков с помощью умножения по каналам.
      ПРИМЕЧАНИЕ: Пусть входной тензор равен x. Внимание канала реализуется с помощью следующего выражения:
      (внимание)_tensor = σ(conv(ReLU(conv(x)))) (1)
      где σ представляет сигмоидальную функцию активации, conv — операцию свертки, а ReLU — функцию активации выпрямленной линейной единицы.
  2. Получите карту внимания, выполнив операцию адаптивного пула средних на тензоре внимания с последующим расширением его в соответствии с размером выходного тензора после свертки с другим размером ядра y:
    внимание = expand(avg_pool([attention]_tensor),size(y)) (2)
  3. Вычислим выходной тензор z , выполнив поэлементное умножение входного тензора y на карту внимания:
    z = z * внимание (3)
    где * представляет поэлементное умножение

5. Наборы данных

ПРИМЕЧАНИЕ: В данном исследовании используются два общедоступных набора данных медицинских изображений, представленные в Таблице 1 и Таблице 2: GlaS (Sirinukunwattana et al.11) и MoNuSeg (Kumar et al.9).

  1. Используйте набор данных Gland Segmentation (Sirinukunwattana et al.11), полученный с помощью цифрового сканера патологии и вручную аннотированный для сегментации отдельных железистых структур в образцах тканей.
    ПРИМЕЧАНИЕ: Набор данных состоит из 165 изображений, каждое из которых имеет разрешение 500 × 500 пикселей, а также соответствующих масок сегментации наземных данных. Набор данных MoNuSeg (Kumar et al.9) содержит 51 изображение микроскопических ядер, каждое из которых имеет разрешение от 1000 × 1000 пикселей.

6. Детали реализации

  1. Реализуйте модель с помощью PyTorch на одном графическом процессоре NVIDIA RTX 3090. Используйте Ubuntu 22.04 в качестве операционной системы.
  2. Измените размер всех входных изображений до фиксированного размера 224 × 224 пикселя. Применяйте методы дополнения данных для повышения разнообразия обучения.
    1. Применяйте аугментации случайным образом в следующем порядке: горизонтальный переворот → вертикальный переворот → вращение → гамма-коррекция → логарифмическое преобразование → случайное масштабирование.
    2. Применяйте случайные горизонтальные перевороты с вероятностью 0,5, вертикальные с вероятностью 0,5 и вращения в пределах ±15 градусов с вероятностью 0,5.
    3. Применяется гамма-коррекция с вероятностью 0,3, логарифмическое преобразование с вероятностью 0,3 и случайное масштабирование с коэффициентом масштабирования от 0,9 до 1,1, применяемое с вероятностью 0,3.
    4. Нормализация изображений с использованием средних значений [0,485, 0,456, 0,406] и стандартных отклонений [0,229, 0,224, 0,225].
  3. Обучите модель с помощью оптимизатора Adam с коэффициентом обучения 0,001 и размером пакета 4. Используйте технику планирования скорости обучения «Косинусный отжиг с теплыми перезапусками», чтобы внести вариативность в график скорости обучения и предотвратить сходимость к локальным оптимумам.
    ПРИМЕЧАНИЕ: Используйте встроенную torch.optim.lr_scheduler PyTorch. Планировщик CosineAnnealingWarmRestarts. Оптимизатор и планировщик были реализованы следующим образом:
    оптимизатор = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    Планировщик = torch.optim.lr_scheduler. CosineAnnealingWarmRestarts(
    оптимизатор, T_0=10, T_mult=2, eta_min=1e-6)
    Здесь T_0=10 обозначает количество эпох до первого перезапуска, T_mult=2 удваивает период перезапуска после каждого цикла, а eta_min=1e-6 устанавливает минимальную скорость обучения. Обновляйте скорость обучения в конце каждой эпохи, вызывая scheduler.step().
  4. Используйте двоичную кросс-энтропию в качестве функции потерь. Применяйте раннюю остановку, чтобы предотвратить переобучение. Обучите модель не более 5000 эпох.
  5. Оцените производительность модели с помощью среднего значения Intersection over Union (mIoU) и коэффициента Dice.
    Игральные кости =(2|А∩В|)/(|А|+|В|) (4)
    IoU=(|А∩В|)/(|А∪В|) (5)
    ПРИМЕЧАНИЕ: mIoU — это отношение пересечения между предсказанной и наземной масками сегментации к их объединению. В то же время коэффициент Дайса — это отношение удвоенного пересечения к сумме масок предсказанной и наземной сегментации.
  6. Проведите тщательную оценку небольших наборов данных с помощью трех раундов 5-кратной перекрестной проверки, в результате чего будет получено в общей сложности 15 оценок. Случайным образом перетасовывайте сплиты с перекрестной проверкой в каждом раунде, чтобы обеспечить вариативность при сбросах. Стратификация сверток на основе распределений классов для поддержания баланса меток в каждой сгибке.
  7. Вычисление средней производительности по сверткам, чтобы снизить риск сходимости к локальным оптимумам. Проведите статистический тест, чтобы продемонстрировать, что предложенный подход обеспечивает статистически значимые улучшения по сравнению с сопоставимыми методами.
  8. Покажите репрезентативные прогнозы валидации во время обучения на рисунке 5 , чтобы проиллюстрировать постепенное улучшение качества сегментации. После завершения обучения загрузите контрольную точку модели с наилучшей производительностью на основе производительности проверки (например, наивысшего mIoU и оценки Dice).
    1. Запустите модель на проверочном наборе, чтобы создать прогнозируемые маски сегментации с использованием сохраненных параметров.
    2. Визуализируйте результаты с помощью Matplotlib, отображая входное изображение, наземную маску и прогнозируемую маску в параллельном формате.
    3. Подчеркните превосходство предложенного метода в производительности сегментации, выделив на визуализации репрезентативные области красными прямоугольниками.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сравнение с современными методами
Архитектура MixKNet была оценена на двух наборах данных сегментации медицинских изображений, GlaS и MoNuSeg, и сравнена с современными методами в этой области. Оценка проводилась путем составления данных о кубиках и IoU по предложенному методу и нескольким сопоставимым моделям, как показано в таблице 3. Результаты показывают, что архитектура MixKNet превосходит другие модели, достигая самых высоких средних оценок кубик...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании представлен MixKNet, новая модификация архитектурыUNet 1 для сегментации медицинских изображений, объединяющая свертку смешанной глубины и механизм внимания канала для повышения производительности сегментации при значительном снижении вычислительной сложности. Гибридная свертка каналов объединяет несколько сверточных ядер, работающих на отдельных группах каналов. Такая конструкция позволяет сети захватывать различные пространственные и контекст...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют об отсутствии конкурирующих финансовых интересов или других конфликтов интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Второй пакет исследовательских проектов в области социального обеспечения города Нинбо на 2023 год: исследование и применение ключевых технологий для выявления мошенничества в телекоммуникационных сетях на основе онтологии и NLP (2023S169).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
ОС Linux (Ubuntu 22.04)  Разное (Open Source Community)N/A(Version 22.04 LTS)Операционная система с открытым исходным кодом для разработки
https://releases.ubuntu.com/22.04/
NVIDIA RTX 3090 GPUNVIDIA3090Высокопроизводительный GPU для глубокого обучения
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN/A (версия ≥ 3.8)Язык программирования для разработки AI/ML
https://www.python.org/
PyTorchMeta AIN/A (Version 1.13)Фреймворк машинного обучения с открытым исходным кодом
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/AЛегкий и мощный редактор кода
https://code.visualstudio.com/

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

U Net
Видео скоро будет доступно

Похожие статьи