В этом исследовании представлен облегченный вариант U-Net с улучшенной точностью сегментации с использованием гибридной свертки и внимания канала, что позволяет достичь современных результатов на MoNuseg и GlaS с меньшим количеством параметров.
Методическая статья
В этом исследовании представлен облегченный вариант U-Net с улучшенной точностью сегментации с использованием гибридной свертки и внимания канала, что позволяет достичь современных результатов на MoNuseg и GlaS с меньшим количеством параметров.
Технология компьютерной обработки изображений на основе искусственных нейронных сетей быстро развивалась в последние годы и нашла широкое применение в различных областях. В области обработки медицинских изображений UNet и его варианты показали большие успехи в задачах обнаружения поражений, сегментации клеток и сегментации полипов. В данном исследовании представлена модифицированная U-образная сеть с уменьшенными параметрами сети, достигнутой за счет уменьшения глубины сети и увеличения сетевых каналов для повышения обучаемости модели. Чтобы противодействовать снижению способности к обучению, вызванному сжатием глубины, вместо исходного сверточного модуля сети вводится гибридный сверточный модуль. Модель вводит механизм внимания канала между слоем и слоем свертки точки для улучшения практической возможности извлечения признаков канала. В статье также делается вывод о том, что использование свертки смешанной глубины может эффективно решить проблему размера целевой сегментации, что затрудняет подгонку одной модели для нескольких наборов данных. Предложенная модель позволяет получить самые современные результаты на двух популярных общедоступных наборах данных, MoNuseg и GlaS, со средним увеличением на 1,0% и 1,37% соответственно. Общие параметры модифицированной модели уменьшены до 1,71M, что в 38,6 раза меньше по сравнению с UCtransNet с 65,6 млн параметров.
Сегментация медицинских изображений имеет решающее значение в различных клинических приложениях, включая диагностику, планирование лечения и мониторинг заболеваний. Традиционные методы обработки изображений, основанные на алгоритмах проектирования признаков, больше не подходят для обработки больших объемов данных, генерируемых в современных средах здравоохранения. К счастью, развитие технологии искусственных нейронных сетей и совершенствование аппаратных возможностей компьютеров сделали возможным обучение и развертывание крупномасштабных моделей нейронных сетей. В результате алгоритмы обработки компьютерного зрения на основе моделей машинного обучения постоянно разрабатываются и применяются в различных областях.
Наиболее репрезентативной модельной структурой в семантической сегментации медицинских изображений являетсяUNet 1 с архитектурой кодирования-декодирования. Сначала модель использует многоуровневый кодировщик для извлечения признаков разных масштабов из входного изображения. Затем декодер шаг за шагом повышает выборку, объединяя семантические признаки, выведенные энкодером соответствующего уровня, в виде пропуска соединения. Тем не менее, производительность архитектуры UNet может быть дополнительно улучшена за счет применения нескольких методов. Например, было показано, что механизмы внимания эффективны в повышении производительности сверточных нейронных сетей. Эти механизмы могут выборочно выделять существенные особенности во входных данных, что приводит к лучшему обучению представлению и точности сегментации.
В настоящее время многие исследователи сосредоточены на эффективном объединении признаков, извлеченных энкодером на стадии декодирования. Некоторые из наиболее распространенных вариантов UNet включают AttentionUNet 2, RecurrentUNet 3 и V-Net4. Эти подходыиспользуют механизмы внимания5, такие как пространственное внимание, для выделения информативных областей карт признаков и подавления неинформативных областей. Кроме того, некоторые варианты включают рекуррентные нейронные сети для моделирования последовательного характера медицинских изображений и улучшения представления признаков. Модели предварительного обучения, такие как VGG6, ResNet7 и DenseNet8, широко используются для повышения производительности U-образных сетей за счет использования их богатых знаний, полученных из крупномасштабных наборов данных. Кроме того, механизмы преобразования, такие как самовнимание и многоголовое внимание, были введены в долгосрочные зависимости моделей и захватывают глобальную контекстуальную информацию, что приводит к повышению производительности сегментации.
Однако, несмотря на то, что эти варианты улучшились по сравнению с оригинальной версиейUNet 1, они все еще имеют определенные ограничения в работе со сложными медицинскими изображениями с различными масштабами и формами. Более того, повышенная сложность этих вариантов часто приводит к более высоким вычислительным затратам и более длительному времени обучения, что ограничивает их применимость в практических условиях.
Для улучшения архитектурыUNet 1 предлагается модифицированная модель под названием MixKNet (Mix Kernel Size U-shape Net), которая уменьшает глубину сети при одновременном увеличении количества каналов для повышения способности к обучению. Однако уменьшение глубины может привести к снижению общей производительности. Чтобы смягчить эту проблему, был введен гибридно-канальный сверточный модуль, заменивший исходный сверточный нейронный модуль. Этот модуль включает в себя механизм внимания канала между слоями глубинной и точечной свертки, направленный на усиление способности модели извлекать эффективные особенности канала.
Чтобы определить практическую применимость, важно отметить, что предложенный метод был оценен на относительно небольших наборах медицинских изображений, с индивидуальным разрешением изображения в диапазоне от 500 × 500 до 1000 × 1000 пикселей. Для обучения модели все изображения были изменены до 224 × 224 пикселей. Реализация была осуществлена с помощью PyTorch на одном графическом процессоре NVIDIA RTX 3090. Эти операционные параметры позволяют предположить, что метод вычислительно осуществим для умеренных экспериментальных установок и адаптируется к ограниченным размерам наборов данных.
В заключение следует отметить, что в данной статье представлена новая модификация U-образной структуры сети и представлен модуль свертки гибридного канала вместе с механизмом внимания канала, которые улучшают производительность сегментации на наборах медицинских изображений. Основные результаты этой работы заключаются в следующем: (1) Предложение модифицированной U-образной структуры сети с гибридным модулем глубокой свертки, который заменяет исходный сверточный нейронный модуль. (2) Введение механизма внимания канала между глубоким и точечным слоями свертки для улучшения эффективной способности модели извлекать признаки канала. (3) Получение современных результатов одновременно на двух популярных общедоступных наборах данных в наборе данных ядерной сегментации MoNuseg9 со значительно меньшим количеством параметров модели (по сравнению с UCtransNet10 с 64 млн параметров) и улучшенной производительностью на наборе данных сегментации желез GlaS11 .
Остальная часть этой статьи организована следующим образом. Шаг 2 представляет собой всесторонний обзор предыдущих исследований поUNet 1 и его вариациям в сегментации медицинских изображений. Рассматриваются сильные и слабые стороны существующих подходов, а также связанные с ними работы по механизмам внимания, смешанно-глубинным сверточным сетям и их применению в моделях сегментации. На шаге 3 подробно описана архитектура предлагаемой модели MixKNet, включая модификации структуры UNet, интеграцию механизма внимания канала и использование свертки смешанной глубины. На Шаге 4 представлены результаты обширных экспериментов, сопровождаемые обсуждением и исследованием абляции для оценки вклада каждого компонента. Наконец, на шаге 5 мы завершаем работу и намечаем возможные направления будущих исследований.
Этот раздел начинается с обзора предыдущих исследований UNet и его вариантов в сегментации медицинских изображений, в котором излагаются сильные и слабые стороны существующих методов. Кроме того, обсуждаются связанные с этим исследования механизмов внимания и их применения в моделях сегментации. Также рассматриваются последние разработки, связанные с методами глубокой свертки для повышения производительности сегментации. Сравнительный анализ предложенного MixKNet (c) и других моделей представлен на рисунке 1, где пунктирными линиями обозначены пропускные соединения.
UNet и его вариации
Архитектура UNet была впервые предложена Ronneberger et al. в 2015году 1 и с тех пор широко используется для сегментации медицинских изображений. Модель состоит из пути кодирования и пути декодирования. Кодировщик извлекает высокоуровневые признаки из входного изображения, в то время как декодер повышает выборку и объединяет их для создания карты сегментации. С тех пор в архитектуру UNet были внесены различные изменения для повышения ее производительности при сегментации медицинских изображений. Одной из наиболее распространенных модификаций является внедрение пропускных соединений, которые, как было показано, повышают точность сегментации. Zhou et al.12 предложили вариант UNet, который использует плотные пропускающие соединения, что позволяет модели лучше сохранять пространственную информацию.
Еще одной популярной модификацией архитектуры UNet является добавление механизмов внимания. Эти механизмы могут помочь модели выборочно выделять наиболее важные признаки, что приводит к лучшему обучению представлений и точности сегментации. Некоторые примеры вариантов с механизмами внимания включают AttentionUNet 2, ResUNet с вентами внимания13 и Dense-UNet с вентилиями внимания14. Помимо вышеперечисленных модификаций, для сегментации медицинских изображений было предложено множество других вариантов архитектуры UNet. UCTransNet10 — это вариант архитектуры U-Net, включающий в себя пропускающие соединения и модуль трансформатора. Пропускающие соединения в UCTransNet10 переосмыслены с точки зрения каналов, что позволяет лучше использовать функции и уменьшить количество параметров. Модуль «Трансформатор» добавлен для захвата дальних зависимостей и повышения качества перевода. Было продемонстрировано, что UCTransNet10 демонстрирует самые современные результаты в нескольких тестах машинного перевода. Зихан и его коллеги предложили модель глубокого обучения под названием LViT15, которую они применили для задач анализа медицинских изображений. Чтобы расширить полуконтролируемую версию LViT15 и компенсировать недостаток качества данных изображений, они предложили механизм экспоненциальной итерации псевдометок (EPI). Кроме того, чтобы сохранить локальные особенности изображений, они предложили модуль внимания на уровне пикселей (PLAM), который выборочно фокусируется на важных особенностях изображения.
Механизм внимания
Механизмы внимания широко изучены в машинном обучении, в частности в обработке естественного языка и компьютерном зрении. В последние годы механизмы внимания также применяются к задачам анализа медицинских изображений, включая сегментацию изображений. Бахданау и др.16 представили механизм внимания в нейронном машинном переводе для улучшения качества перевода. Механизм позволяет модели выборочно фокусироваться на соответствующих частях входной последовательности, улучшая качество перевода. С тех пор были предложены различные механизмы внимания для задач анализа изображений. Одним из распространенных типов механизмов внимания является механизм пространственного внимания, который включает в себя применение веса к каждому пикселю в карте признаков в зависимости от его важности. Например, Guo et al.17 предложили механизм пространственного внимания для задачи сегментации сосудов сетчатки. Механизм использует стробируемый механизм для настройки веса пространственных объектов, улучшая способность модели различать пиксели сосуда и пиксели, не относящиеся к сосуду. Другим типом механизма внимания является внимание канала, которое фокусируется на настройке весов карт признаков по каналам. Hu et al.18 предложили сеть сжатия и возбуждения (SENet), которая применяет внимание по каналам к картам признаков, улучшая производительность задачи классификации изображений. В последнее время механизмы внимания были объединены со сверточными нейронными сетями (СНС) для задач сегментации изображений. Например, Chen et al.19 предложили управляемую вниманием сеть для сегментации опухолей головного мозга, которая сочетает в себе пространственные и канальные механизмы внимания.
Последние достижения в области полуконтролируемого и мультимодального обучения для анализа медицинских изображений и дистанционного зондирования продемонстрировали многообещающие улучшения производительности. Yang et al.20 предложили UMSCS, новую непарную мультимодальную сегментационную структуру, которая использует кросс-модальное генеративное обучение и полуконтролируемые стратегии. Zhang et al. представили несколько передовых методов: модель согласованности трех ветвей с расширенными доказательствами для полуконтролируемой сегментации21, структуру самосознания и перекрестной выборки прототипов для сегментации медицинских изображений22 и подход к оптимизации иерархических характеристик с учетом временных частот для распознавания помех радаров с синтезированной апертурой (SAR) в аэрокосмической области23. Эти работы в совокупности подчеркивают важность гибридного контроля и предметно-ориентированного моделирования признаков как в медицинских, так и в инженерных задачах визуализации.
Свертка по глубине
Свертка по глубине предназначена для захвата корреляций по каналам в картах входных признаков и, как было показано, повышает эффективность и точность сверточных нейронных сетей.
Одной из самых ранних и влиятельных моделей свертки по глубине является MobileNet24, предложенная Говардом и соавторами в 2017 году. MobileNet использует сепарабельную свертку по глубине, которая применяет свертку по глубине, за которой следует точечная свертка, чтобы уменьшить количество параметров и вычислений, необходимых для сверточных слоев. Это позволяет MobileNet достигать высочайшей точности в задачах классификации изображений, используя при этом значительно меньше параметров, чем традиционные сверточные нейронные сети. С момента появления MobileNet был предложен ряд других архитектур свертки по глубине, включая ShuffleNet25, Xception26 и ResNeXt27. Эти модели различаются по конкретной реализации глубокой свертки, но все они имеют общую цель снижения вычислительной сложности сверточных слоев при сохранении или повышении точности. Глубокая свертка также применяется к задаче семантической сегментации, в таких моделях, как PSPNet28 , использующей глубинную сепарабельную свертку для снижения требований к вычислениям и памяти крупномасштабных сверточных слоев. MixNet29 еще больше расширяет идею глубокой свертки, вводя смешанную глубокую свертку, которая использует несколько размеров ядер для захвата объектов в разных масштабах. Было показано, что он превосходит другие современные модели, сохраняя при этом сопоставимые параметры и FLOP. Эти модели продемонстрировали значительное повышение точности и эффективности по сравнению с традиционными сверточными нейронными сетями в различных задачах семантической сегментации.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
В этом разделе описывается предлагаемая архитектура MixKNet для сегментации медицинских изображений. Модель MixKNet расширяет архитектуру UNet, включая механизмы внимания и смешанные слои глубокой свертки. Программное обеспечение, использованное в данном исследовании, указано в Таблице материалов.
1. Общая архитектура
2. Сплющенная U-образная форма
ПРИМЕЧАНИЕ: Уменьшите глубину архитектуры нейронной сети, чтобы уменьшить вычислительную сложность и размер модели, помня при этом, что это может снизить способность к обучению сложным представлениям данных.
3. Смешайте размер ядра для энкодера
4. Направляйте внимание в нужное русло
5. Наборы данных
ПРИМЕЧАНИЕ: В данном исследовании используются два общедоступных набора данных медицинских изображений, представленные в Таблице 1 и Таблице 2: GlaS (Sirinukunwattana et al.11) и MoNuSeg (Kumar et al.9).
6. Детали реализации
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Сравнение с современными методами
Архитектура MixKNet была оценена на двух наборах данных сегментации медицинских изображений, GlaS и MoNuSeg, и сравнена с современными методами в этой области. Оценка проводилась путем составления данных о кубиках и IoU по предложенному методу и нескольким сопоставимым моделям, как показано в таблице 3. Результаты показывают, что архитектура MixKNet превосходит другие модели, достигая самых высоких средних оценок кубик...
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
В этом исследовании представлен MixKNet, новая модификация архитектурыUNet 1 для сегментации медицинских изображений, объединяющая свертку смешанной глубины и механизм внимания канала для повышения производительности сегментации при значительном снижении вычислительной сложности. Гибридная свертка каналов объединяет несколько сверточных ядер, работающих на отдельных группах каналов. Такая конструкция позволяет сети захватывать различные пространственные и контекст...
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Авторы заявляют об отсутствии конкурирующих финансовых интересов или других конфликтов интересов.
Второй пакет исследовательских проектов в области социального обеспечения города Нинбо на 2023 год: исследование и применение ключевых технологий для выявления мошенничества в телекоммуникационных сетях на основе онтологии и NLP (2023S169).
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
| Имя | Компания | Каталожный номер | Комментарии |
|---|---|---|---|
| ОС Linux (Ubuntu 22.04) | Разное (Open Source Community) | N/A(Version 22.04 LTS) | Операционная система с открытым исходным кодом для разработки https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | Высокопроизводительный GPU для глубокого обучения https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (версия ≥ 3.8) | Язык программирования для разработки AI/ML https://www.python.org/ |
| PyTorch | Meta AI | N/A (Version 1.13) | Фреймворк машинного обучения с открытым исходным кодом https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | Легкий и мощный редактор кода https://code.visualstudio.com/ |
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE
Запросить разрешение