Этот протокол реализует U-образную сеть глубокого обучения, интегрирующую свёртку с вертушками, двойное внимание и многомасштабное слияние для сегментирования колоректальных полипов.
Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.
Методическая статья
* These authors contributed equally
Этот протокол реализует U-образную сеть глубокого обучения, интегрирующую свёртку с вертушками, двойное внимание и многомасштабное слияние для сегментирования колоректальных полипов.
Точная сегментация колоректальных полипов крайне важна для ранней профилактики и диагностики колоректального рака. Однако из-за высокой гетерогенности полипов по форме, размеру и текстуре, а также сложности кишечной среды (такой как складки, зеркальные отражения и каловые остатки) существующие методы всё ещё сталкиваются с серьёзными трудностями в локализации границ и обнаружении мелких полипов. Для решения этих проблем в данной статье предлагается сеть сегментации полипов на основе свёртки с вертушками и двойного внимания (PWD-Net). Предлагаемая сеть использует U-образную архитектуру энкодер-декодер, где в качестве энкодера используется предварительно обученный ResNet для извлечения многоуровневых локальных признаков. В частности, модуль свёртки Вертушки (PCM) вводится на узком уровне для захвата глобальной геометрической структуры и многонаправленной контекстуальной информации полипов через ядра свёртки с несколькими углом вращения. Механизм двойного внимания (DAM), интегрирующий внимание канала и пространственное внимание, предназначен для адаптивного подавления фонового шума и усиления особенностей области полипов. Кроме того, применяется стратегия многомасштабного синтеза признаков (MSF) для объединения глубокой семантической информации с поверхностными граничными деталями, обеспечивая как полноту, так и точность результатов сегментации. Эксперименты, проведённые на наборах данных Kvasir-SEG и CVC-ClinicDB, показывают, что PWD-Net достигает средних коэффициентов кубиков 0,865 и 0,944, а также показателей IoU 0,765 и 0,892 соответственно, значительно превосходя существующие современные методы. Исследования абляции подтверждают эффективность каждого модуля, а кросс-наборы подтверждают высокую способность модели к обобщению. Это исследование предоставляет высокоточное и надёжное решение для клинической сегментации полипов, предлагая значительную ценность для ранней диагностики колоректальных предраковых поражений и поддерживая компьютерное вмешательство.
Колоректальный рак — одна из самых распространённых злокачественных опухолей в мире, с постоянно высокими показателями заболеваемости и смертности. Исследования показали, что большинство колоректальных раков развиваются из-за аденоматозных полипов, процесс, который обычно занимает 10–15 лет, что обеспечивает ценное временное окно для раннего выявления и вмешательства. Повышение уровня обнаружения аденомы (ADR) на 1% может снизить риск колоректального рака примерно на 3%, значительно снижая смертностьпациентов 1. Колоноскопия, считающаяся золотым стандартом скрининга колоректального рака, позволяет напрямую удалять полипы во время обследования, что эффективно снижает заболеваемость и смертность от рака.
Однако традиционная колоноскопия сильно зависит от опыта и уровня подготовки эндоскопистов. Такие факторы, как субъективное суждение, зрительная усталость и отвлечение, могут привести к проценту промахов от 20% до 30%, что напрямую влияет на эффективностьскрининга 2. Поэтому разработка систем автоматизированного обнаружения (CAD) для автоматической сегментации колоректальных полипов имеет большое значение для улучшения ADR и сокращения пропущенных диагнозов. Недавние клинические исследования ещё больше подчеркнули интерес к интеграции искусственного интеллекта в рабочие процессы оценки эндоскопических поражений, подчёркивая необходимость надёжных и воспроизводимых методовсегментации 3.
В последние годы глубокое обучение достигло значительных успехов в анализе медицинских изображений, особенно в сверточных нейронных сетях (CNN), которые демонстрируют сильные возможности в извлечении и представлении признаков для задач сегментацииизображений 4. Как классическая модель сегментации медицинских изображений, U-Net использует архитектуру симметричного энкодер-декодера и пропускные соединения для достижения точной сегментации на уровне пикселей, став эталоном в этойобласти. Опираясь на U-Net, было предложено множество улучшенных архитектур для решения сложных задач сегментации медицинских изображений. UNet++ сокращает семантический разрыв между отображением признаков кодировщика и декодера, вводя вложенные и плотные пропускающиесоединения 6. ResUNet++ интегрирует остаточные блоки, модули сжатия и возбуждения, расширенные свёртки и механизмы внимания, обеспечивая высокую производительность в сегментацииполипов 7. U2-Net использует двухуровневую вложенную U-образную структуру для сбора многомасштабной информации опризнаках 8. В последнее время была предложена сеть сегментации глубоких полипов на базе двойного энкодер-декодер, использующая параллельное кодирование и декодирование путей для дальнейшего повышения точностисегментации 9.
В то же время внедрение механизмов внимания открывает новые решения для усиления функций функций и подавления шума. Attention U-Net использует ворота внимания, чтобы сосредоточиться на целевых регионах, подавляя при этом нерелевантную фоновуюинформацию 10. Сеть двойного внимания (DANet) адаптивно взвешивает признаки как по каналу, так и попространственному измерениям 11, улучшая восприятие критически важных признаков. Triple Attention Networks (TANet) дополнительно повышают производительность сегментации за счёт адаптивного выбора многомасштабных функций12.
С успехом архитектур трансформеров в обработке естественного языка и компьютерномзрении 13 исследователи начали изучать их применение в сегментации медицинских изображений. TransUNet первым использовал трансформер в качестве энкодера для эффективного моделирования дальнихзависимостей 14. Swin-UNet использует чисто трансформерскую архитектуру и обеспечивает эффективную глобальную агрегацию информации с помощью механизма сдвиговогоокна 15. UTNet предлагает гибридную архитектуру, которая объединяет локальную возможность извлечения признаков CNN с глобальными возможностями моделированияTransformers 16.
В области сегментации полипов Polyp-PVT использует пирамидальный трансформер для захвата многомасштабной глобальной семантическойинформации 17, тогда как многомасштабный вложенный UNet улучшает контекстное понимание за счёт интеграцииTransformers 18. Недавние исследования также изучали стратегии обучения с отрицательной корреляцией для междоменной сегментацииполипов 19, усиления сегментации с дополнением поГомперцу 20 и архитектуры, основанные на внимание, с использованием пограничногоруководства 21. Хотя эти подходы в некоторой степени улучшают эффективность сегментации, сегментация полипов всё ещё сталкивается с рядом проблем. Во-первых, полипы демонстрируют высокую гетерогенность по морфологии, размеру и текстуре — от микрополипов размером меньше 5 мм до крупных полипов свыше 30 мм, с формами от круглых и эллиптических до сильно неправильных. Во-вторых, среда кишечника сложна и изменчива: слизистые складки, зеркальные отражения, каловые остатки и пищевые остатки создают сильные фоновые помехи. В-третьих, многие полипы имеют размытые границы, могут быть частично закрыты складками или погружаться в кишечные жидкости, что делает точную локализацию границ крайнесложной 22.
Существующие методы по-прежнему имеют явные ограничения в решении этих проблем. Традиционные CNN эффективно извлекают локальные текстурные и крайевые особенности; Однако ядра с фиксированной квадратной свёрткой плохо подходят для захвата различных геометрических форм23, особенно для сильно неправильных полипов, и не могут эффективно моделировать многонаправленные геометрические особенности. Методы на основе трансформаторов могут моделировать глобальные зависимости, но менее эффективны в захвате мелких локальных деталей и информации о границах. Кроме того, их высокая вычислительная сложность делает их менее подходящими для клинических приложений в реальномвремени 24. Современные подходы к сегментации полипов, такие как PraNet, использующий модули обратного внимания для уточнения ключевыхобластей 25, каскад внимания, ориентированные на границы, улучшающие экстракцию граничныхпризнаков 26, и CAFE-Net, объединяющий функции энкодера и декодера через механизмы перекрёстного внимания27, по-прежнему сталкиваются с недостаточным представлением признаков и неточной локализацией границ при работе с малымиполипами 28, размытые границы и сложные предыстории. Кроме того, большинство методов игнорируют геометрическую морфологию и не используют многонаправленную контекстную информацию, что приводит к неоптимальной сегментации неправильной формы полипов.
В заключение, современные методы на базе CNN не способны захватывать многонаправленные геометрические признаки из-за зависимости от ядра с фиксированной квадратной свёрткой. Подходы на основе трансформаторов предлагают глобальное моделирование, но жертвуют локальной точностью границ и требуют высоких вычислительных затрат. В то же время существующие стратегии слияния с повышенным вниманием и многомасштабного синтеза не были совместно оптимизированы в единой структуре, специально разработанной для сегментацииполипов 29. Эти пробелы мотивируют разработку метода, который одновременно охватывает геометрическое моделирование признаков, адаптивное шумоподавление и межмасштабную интеграцию признаков.
Для решения этих проблем этот протокол представляет сеть сегментации полипов, основанную на свертке Pinwheel и Dual Attention (PWD-Net). Предлагаемая сеть интегрирует геометрическое моделирование признаков, многомерное усиление внимания и многомасштабное слияние признаков, что позволяет точно сегментировать сложные полипы. Основные вклады этой работы обобщены следующим образом: модуль свёртки с вертушками (PCM), вдохновлённый структурой вертушки, предлагается новая конструкция ядра с вращающейся свёрткой, которая фиксирует многонаправленные геометрические особенности полипов посредством операций свёртки под несколькими углами (0°, 45°, 90°, 135°, 180°, 225°, 270° и 315°). Этот модуль заменяет традиционный слой свёртки на стадии узкого места, обеспечивая эффективное восприятие различных ориентаций краёв и значительно улучшая представление неправильной формы полипов. Механизм двойного внимания (DAM) устраняет фоновые шумы, такие как складки, отражения и калдыки кала на изображениях колоноскопии. Разработан модуль двойного внимания, интегрирующий внимание канала и пространственное внимание. Встроенный в пропускные соединения, этот модуль адаптивно подавляет фоновые интерференции и усиливает реакцию признаков в областях полипов, совместно определяя «что» важно (размер канала) и «место» расположения цели (пространственное измерение), обеспечивая, чтобы в последующее слияние участвовали только более тонкие элементы. Многомасштабная стратегия слияния признаков (MSF) сохраняет как глубокую семантическую информацию, так и поверхностные граничные детали с помощью иерархического механизма, введённого в декодере. Постепенно интегрируя функции энкодера с улучшенными DAM с апсемплированными функциями декодера, эта стратегия эффективно компенсирует потерю пространственных деталей, вызванную понижением дискретизации, обеспечивая точное обнаружение мелких полипов и точное определение границ.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
В данном исследовании используются только общедоступные, анонимизированные наборы изображений колоноскопии (Kvasir-SEG). Новых данных о людях не собиралось. Одобрение институциональной этики и информированное согласие пациента не требовались, что подтверждается политикой институционального обзора для ретроспективного анализа деидентифицированных публичных наборов данных.
1. Подготовка данных
2. Общая архитектура
ПРИМЕЧАНИЕ: См. рисунок 1 для макроуровневого энкодер-декодера основы PWD-Net и рисунок 2 для интеграции и взаимодействия основных модулей в потоке признаков. Общая архитектура выполнена по схеме U-образного энкодера-декодера для обработки изменений масштаба полипов и фоновых интерференций в изображениях колоноскопии.
3. Модуль свертки с вертушками (рисунок 3)

4. Механизм двойного внимания (рисунок 4)
ПРИМЕЧАНИЕ: Механизм двойного внимания (DAM) встроен в каждое пропускное соединение для подавления фонового шума и усиления особенностей области полипов как с точки зрения канала, так и пространственного измерения.


5. Многомасштабное слияние признаков
6. Функция потери и конфигурация обучения



7. Псевдокод
Алгоритм 1: Сегментация полипов с ограниченным образованием (PWD-Net)
1: Ввод: Изображение колоноскопии I ∈ RH×W×3
2: Результат: Сегментационная маска M ∈ {0,1}(H×W)
3:
4: функция PCM(X) ▷ Модуль свёртки Вертушки
5: Определим базовое ядро W (3 x 3), углы Θ = {0°, 45°, ..., 315°}
6: для каждого θ ∈ Θ делают
7: Wθ ← БилинейныйВращать (W, θ) ▷ Вращать ядро
8: Yθ ← Conv2d(X,W θ) ▷ Особенности, специфичные для направления
9: конец для
10: Yout ← ReLU(BN(Conv1 x 1(Concat({Y θ})))) ▷ Aggregate
11: возвращение Yиз аут.
12: конечная функция
13:
14: функция DAM(F) ▷ Механизм двойного внимания
15: Ac ← Sigmoid(MLP(AvgPool(F))) ▷ Channel attention (r=16)
16: As ← Sigmoid(Conv7 x 7([AvgPool(F); MaxPool(F)])) ▷ Пространственное внимание
17: F' ← F ⊗ (α · A c + β · As) ▷ Слияние с обучаемым α, β (init=0.5)
18: возвращение F'
19: конечная функция
20:
21: функция PWD-Net(I)
22: Энкодер: e1,e 2,e 3, e4, e5 ← ResNet50_Stages(I) ▷ 5-ступенчатый предобученный энкодер
23: Узкое место: b ← PCM(e5) ▷ Применить PCM в узком месте
24: Пропуск соединений: si ← DAM(ei) для i = 1, 2, 3, 4 ▷ Функции фильтр-энкодера
25: Декодер:
26: d4 ← DoubleConv(Concat(Up(b), s4))
27: d3 ← DoubleConv(Concat(Up(d4), s3))
28: d2 ← DoubleConv(Concat(Up(d3), s2))
29: d1 ← DoubleConv(Concat(Up(d2), s1))
30: M ← Sigmoid(Conv1 x 1(d1))
31: возвращение M
32: конечная функция
33:
34: Обучение:
35: для каждой эпохи делают
36: M̂ ← PWD-Net(I)
37: L ← 0,5 · BCE(M̂,M gt) + 0,5 · DiceLoss(M̂,M gt) ▷ λ = 0.5
38: Обновление параметров через обратное распространение (Adamоптимизирует r)
39: конец для
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Экспериментальная установка
Набор данных
Набор данных Kvasir SEG использовался для оценки сегментационного поведения PWD Net на изображениях колоноскопии с гетерогенными полипами. Набор данных содержит 1000-пиксельные аннотированные изображения полипов и включает вариации размера, формы, текстуры, освещения и сложности фона, что делает его подходящим для оценки обнаружения малых целей, локализации границ и устойчивости к визуальным помехам....
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Ряд проектных решений в протоколе PWD-Net критически важны для достижения надежных результатов сегментации и требуют тщательного внимания при реализации. Во-первых, выбор и инициализация основной системы энкодера напрямую влияют на поведение сходимости и конечную производительность. Протокол использует кодировщик ResNet-50, предварительно обученный на ImageNet, который обеспечивает надёжную инициализацию функций на низком и среднем уровне. Это особенно важно для задач сегментации медицин...
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Авторам нечего раскрывать.
Это исследование финансировалось Национальной программой ключевых исследований и разработок Китая (программы No 2022YFC3500200 и 2022YFC3500204).
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
| Имя | Компания | Каталожный номер | Комментарии |
|---|---|---|---|
| Adam Optimizer | — | — | Включено в PyTorch |
| Albumentations | Albumentations Team | v1.0+ | Библиотека для расширения данных |
| CUDA Toolkit | NVIDIA | v11.3+ | Ускорение GPU |
| Kvasir-SEG dataset | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib Community | v3.4+ | Визуализация кривых обучения |
| NumPy | NumPy Community | v1.21+ | Числовые вычисления |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | GPU для обучения и инференса |
| OpenCV | OpenCV Community | v4.5+ | Предобработка изображений |
| Python | Python Software Foundation | v3.8+ | Язык программирования |
| PyTorch | Meta Platforms | v1.12+ | Фреймворк для глубокого обучения |
| ResNet-50 pretrained weights | PyTorch Model Zoo | — | Предварительно обученные на ImageNet-1K |
| Ubuntu | Canonical | 18.04+ | Операционная система |