Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

HMP-MUNet: гибридная фреймворк глубокого обучения для автоматизированной сегментации поражений кожи в дермоскопических изображениях

167 просмотров

DOI:

10.3791/69449

17 марта 2026 г.

* These authors contributed equally

В этой статье

Краткое содержание

HMP-MUNet вводит гибридный фреймворк глубокого обучения для автоматизированной сегментации кожных поражений. Интегрируя модели пространства состояния с многомасштабными механизмами внимания, она повышает точность сегментации и оптимизирует вычислительную эффективность, предлагая надёжное решение для диагностики рака кожи в клинических условиях.

Аннотация

Системы компьютерной диагностики кожных поражений сталкиваются с серьёзными трудностями при достижении как высокой точности диагностики, так и вычислительной эффективности. Современные методы глубокого обучения часто требуют значительных вычислительных ресурсов, одновременно испытывая трудности с учётом сложных морфологических различий, присущих кожным поражениям на разных масштабах. High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet) — инновационный фреймворк глубокого обучения, который решает эти ограничения с помощью инновационного архитектурного дизайна, сочетающего модели пространства состояния с передовыми возможностями многомасштабной обработки.

Подход, описанный в этом исследовании, интегрирует гибридный фреймворк U-Net, который объединяет модуль пространства состояний высокого порядка зрения для глобального моделирования контекста, многомасштабную сеть расширенного синтеза внимания для иерархического извлечения признаков из нескольких рецептивных полей и параллельную многоглубинную гибкую сеть для вычислительной оптимизации. Эта архитектура использует модифицированный U-образный энкодер-декодер с увеличенными размерами канала и продвинутыми механизмами внимания для улучшения обучения признаков.

Всесторонняя оценка на эталонных наборах данных показывает коэффициент сходства кубиков 95,85% на PH2 и 90,44% на ISIC2018. Модель достигает этой превосходной точности, используя всего 7,61 млн параметров, что представляет собой впечатляющее снижение на 72,2% по сравнению с существующими архитектурами Vision Mamba, при этом сохраняя высокую точность сегментации. Лёгкая конструкция демонстрирует потенциал для применения в различных клинических условиях и методах визуализации, в ожидании клинической валидации — от специализированных дерматологических центров до учреждений первичной медицинской помощи.

HMP-MUNet предоставляет автоматизированное решение для сегментации кожных поражений, улучшающее диагностическую согласованность и поддерживающее клинические рабочие процессы, с потенциалом для дальнейшей валидации в клинической практике. Интеграция возможностей высокого порядка моделирования с практическими аспектами внедрения предлагает потенциальное решение для улучшения протоколов скрининга рака кожи и расширения доступности медицинских услуг в приложениях компьютерной диагностики.

Введение

Системы компьютерной диагностики (CAD) направлены на улучшение практик медицинской визуализации в клинических специализациях, улучшая подходы к выявлению, диагностике и планированию лечения заболеваний. 1. В дерматологии интеграция искусственного интеллекта (ИИ) и передовых методов визуализации стала ключевым инструментом для повышения точности диагностики и клинических результатов, особенно в раннем выявлении рака кожи, который составляет примерно 90% всех кожных злокачественныхопухолей. Разработка сложных алгоритмических подходов к автоматизированному анализу кожных поражений способствует развитию прецизионной медицины, обеспечивая стандартизированную, воспроизводимую диагностическую поддержку, способствующую клиническому принятию решений в различных медицинскихучреждениях 3,4.

Современная дерматологическая визуализация охватывает несколько методов, включая дермоскопию, цифровую фотографию, оптическую когерентную томографию и мультиспектральные системывизуализации. Медицинские специалисты используют дермоскопические снимки для ручной диагностики рака кожи с помощью трудоёмких и трудоёмких методов, требующих значительныхзнаний 6. Сложность поддержания диагностической согласованности в различных клинических и визуализационных условиях стимулировала развитие систем САП, обеспечивающих объективный, количественный анализ кожных поражений. Сегментация кожных поражений по дермоскопическим изображениям представляет собой фундаментальный этап предварительной обработки, который напрямую влияет на точность последующего классификационирования и клиническуюполезность 7. В целом, компьютерная диагностика рака кожи включает пять этапов: получение изображений, предварительная обработка, сегментация, выделение признаков иклассификация 8. Точное определение границ крайне важно для точной характеристики поражения, позволяя клиницистам оценивать морфологические особенности, такие как асимметрия, неровность границ, вариация цвета и диаметр — ключевые параметры установленных диагностическихкритериев 9.

Появление моделей пространственных состояний (SSM), особенно архитектуры Mamba, обеспечивает линейную вычислительную сложность, повышая вычислительную эффективность при сохранении превосходных возможностей моделирования зависимостейна дальних расстояниях 10. Недавние достижения в сегментации кожныхпоражений 11, такие какU-Net 9, Att-UNet12, UTNetV213 и UNet++14 , показали заметные улучшения точности сегментации. Например, U-Net достигает коэффициента сходства кубиков (DSC) 87,55% на наборе данных ISIC2018, UNet++ — 87,83%, а Att-UNet — 87,91%. В наборе данных PH2 U-Net достигает DSC 90,6%, аC2SDG 15 и SCR-Net16— 90,3% и 89,89% соответственно. HMP-MUNet улучшает эти модели, интегрируя многомасштабный механизм внимания и возможности параллельной обработки, уменьшая количество параметров на 72,2% и достигая превосходной точности с DSC 95,85% на наборе данных PH2 и 90,44% на наборе данных ISIC2018. Учитывая важность баланса между возможностями обучения визуального представления и потреблением вычислительных ресурсов, изучение универсальных архитектур классификации медицинских изображений, обеспечивающих оптимальные компромиссы, является важным для разработки интеллектуальной системы клиническойдиагностики 17. Структурированная пространственная структура SSM улучшает традиционные архитектуры Mamba, оптимизируя матрицы переходов состояний, повышая вычислительную эффективность и снижая накладные расходы памяти — характеристики, необходимые для клинического внедрения в различных методахвизуализации 18.

Недавние исследования показывают, что архитектуры Vision Mamba, особенно те, что используют схему коммутации на основе High-order Vision Mamba (H-VSS), достигают превосходной производительности с значительно меньшим количеством параметров по сравнению с обычными трансформаторами, что делает их особенно подходящими для клинической интеграции рабочихпроцессов 19. Однако существующие реализации Vision Mamba сталкиваются с проблемами, включая ограничения по потреблению памяти и масштабируемость в клинических условияхвнедрения 20. Современные методы сегментации медицинских изображений обычно делятся на CNN и модели, основанные на трансформаторах, где традиционные CNN ограничены ограничениями рецептивных полей, что затрудняет захват зависимостейна дальнем радиусе 21. В медицинской визуализации отделение критически важных областей, таких как поражения, от здоровой кожи требует высокой точности, что требует внедрения передовых технологических решений для решения этихзадач 22. Современные архитектуры сегментации эволюционировали для удовлетворения специфических клинических требований, включая вычислительную эффективность для приложений в реальном времени, точность критически критических диагностических задач и устойчивость при различных протоколахвизуализации 23. Продвинутые варианты U-Net, включающие механизмы внимания, многомасштабные стратегии слияния признаков и энкодеры на базе трансформаторов, продемонстрировали превосходную производительность в сложных медицинских сценарияхвизуализации 12,24. Эти архитектурные инновации напрямую усиливают клинические применения, позволяя точно определить анатомические структуры, выявить патологические области и выделить количественные биомаркеры, что имеет решающее значение для медицины, основаннойна доказательствах 25,26. Однако сложности интеграции, включая совместимость интерфейса с существующими электронными медицинскими записями (EMR), хранение и извлечение больших изображений, а также совместимость между различными институциональными системами, остаются значительными препятствиями для широкого клиническоговнедрения 27.

В этой статье представлена High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet) — новая система CAD, специально разработанная для автоматизированной сегментации кожных поражений в клинической практике. Эта структура устраняет критические пробелы в современных медицинских системах визуализации, включая инновационные архитектурные компоненты: Multi-Scale Dilated Attention Fusion Network (MSDAFN) и Parallel Multi-depth Flexible Network (PMFlex). MSDAFN реализует сложные стратегии экстракции признаков, сочетая пространственные и канальные механизмы внимания с многомасштабными расширенными свёртками, что позволяет эффективно обнаруживать тонкие характеристики поражения на различных масштабах — что крайне важно для точной диагностики различных типов поражений, встречающихся вклинической практике 28. PMFlex внедряет возможности параллельной обработки, позволяющие одновременно анализировать несколько входных потоков, значительно повышая вычислительную эффективность и сохраняя возможности моделирования высокого порядка, необходимые для клиническойточности 29. HMP-MUNet с помощью инновационных методов сегментации и вычислительных стратегий стремится расширить границы диагностики рака кожи, обеспечивая точную и точную клиническую диагностикув реальном времени 30,31.

Основные вклады этого исследования соответствуют основным целям продвижения ИБЗ в медицинской визуализации: улучшение глобального контекстного моделирования с помощью MSDAFN, улучшение эффективности выделения признаков и сращения для точной локализации поражений в различных клинических картинах; эффективная параллельная обработка с помощью PMFlex, снижающая вычислительные нагрузки при сохранении клинической точности, облегчая внедрение в клинических условиях с ограниченными ресурсами; Оптимизация клинического внедрения с помощью аппаратно-ориентированного проектирования, позволяющего эффективно обрабатывать дермоскопические изображения высокого разрешения, поддерживающие клинические рабочие процессы в реальном времени; Клиническая эффективность, продемонстрированная через комплексную оценку на стандартных наборах данных с метриками, подходящими для клинической интеграции; и интегрированное диагностическое решение, сочетающее моделирование высокого порядка, многомасштабный анализ и параллельные вычисления, предоставляющее комплексные решения для точной дерматологической диагностики. Это исследование способствует развитию компьютеризированной медицинской визуализации, предоставляя инновационные, клинически применимые решения, отвечающие как технологическим, так и практическим требованиям автоматизированного анализа кожных поражений в современных медицинских учреждениях.

Фреймворк предназначен для обработки дермоскопических изображений высокого разрешения, обычно с входным разрешением 256 × 256, обеспечивая баланс между вычислительной эффективностью и детализацией изображения. Однако вариативность оборудования и качества изображения, такая как различия в освещении, оттенке кожи и наличии волос, могут влиять на результаты сегментации. Несмотря на эти сложности, дизайн системы оптимизирован для клинических рабочих процессов в реальном времени и адаптируется к различным устройствам визуализации, обеспечивая высокую производительность в различных клинических условиях.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Это исследование проводилось в соответствии с институциональными рекомендациями по вычислительным исследованиям и обработке данных. В этом исследовании не участвовали ни люди, ни позвоночные животные.

Подготовка и предобработка наборов данных

Сбор и организация наборов данных

Дермоскопические изображения были собраны из наборов данных PH2, ISIC2018 и ISIC2017, с конкретными ссылками, предоставленными в Таблице материалов. Набор данных PH2 содержит 200 изображений высокого разрешения (1000 × 1000 пикселей), ISIC2018 включает 2 594 изображения с соответствующими сегментационными масками и ISIC2017 включает 2 150 изображений с сегментационными масками. Данные были организованы в наборы обучения, валидации и тестирования в соответствии со стандартными протоколами, обеспечивая совместимость изображений в форматах (например, .jpg, .png или .tiff) и соответствующие наземные маски истинности в бинарном формате.

Данные были организованы в наборы для обучения, валидации и тестирования согласно стандартным протоколам. Наборы данных были разделены следующим образом: для ISIC2018 было выделено 1 815 изображений для обучения, 259 — для валидации и 520 — для тестирования. За ISIC2017 было выделено 1500 изображений для обучения, 220 — для валидации и 430 — для тестирования. Для PH2 набор данных был разделён на 160 обучающих изображений, 10 валидационных изображений и 30 тестовых. Стабильное разрешение изображения — 256 × 256 пикселей — поддерживалось на протяжении всей предобработки.

Дополнение и нормализация данных

Для улучшения обобщения моделей применялись методы дополнения данных. Были реализованы горизонтальные перевороты, вертикальные перевороты и случайное вращение в диапазоне ±15°. Были применены гамма-коррекция и логарифмическое преобразование с вероятностью 0,3 каждая. Значения пикселей нормализовались с помощью статистики ImageNet (среднее = [0,485, 0,456, 0,406], стандартное отклонение = [0,229, 0,224, 0,225]).

Увеличить размер всех входных изображений до 256 × 256 пикселей: Для обеспечения вычислительной эффективности все входные изображения были изменены до равномерного разрешения 256 × 256 пикселей. Хотя изображения высокого разрешения, такие как в наборе данных (1000 × 1000 пикселей), содержат детали и информацию о текстурах, важную для точного определения границ поражения, увеличение разрешения существенно не улучшило производительность модели. Поэтому разрешение не увеличивалось для поддержания баланса между вычислительной эффективностью и точностью модели. Будущие исследования могут дополнительно исследовать влияние входных данных с более высоким разрешением, чтобы определить, оправдывают ли преимущества точности сегментации увеличение вычислительной стоимости. Изображения преобразовывались в формат RGB при необходимости. Предварительно обработанные данные сохранялись в структурированных каталогах при сохранении исходных разделений наборов данных.

Реализация архитектуры HMP-MUNet

Проектирование архитектуры сети

HMP-MUNet был настроен по иерархической U-образной структуре энкодер-декодера, как показано на рисунке 1. Сеть была настроена с прогрессивным расширением каналов: 8→16→32→64→128→256 каналов на разных уровнях кодировщиков.

Значительное архитектурное изменение было внесено за счёт сокращения глубины сети с четырёх иерархических уровней до двух, что помогает упростить модель и повысить вычислительную эффективность. Хотя глубина уменьшена, размеры канала увеличивались на каждом уровне, что позволило сети захватывать более насыщенные и выразительные черты. Для дальнейшего улучшения изучения признаков модели были введены механизмы внимания, чтобы сосредоточить сеть на наиболее релевантных признаках на нескольких уровнях. Эти механизмы внимания эффективно компенсируют потенциальную потерю иерархической абстракции признаков из-за более мелкой архитектуры.

Энкодер инициализировался с помощью двух операций Conv2D для первоначального извлечения признаков из входных тензоров X(C, H×W). Была реализована чередующаяся конфигурация трёх специализированных модулей: схема коммутации на основе Mamba высокого порядка видения (H-VSS), Параллельная многоглубинная гибкая сеть (PMFlex) и Многомасштабная сеть расширенного внимания (MSDAFN).

Модель использует статистику ImageNet (среднее и стандартное отклонение) для нормализации, избегая необходимости пересчитывать для каждого набора данных, тем самым повышая вычислительную эффективность. Он обеспечивает стабильность и обобщаемость, используя широкое применение ImageNet в задачах компьютерного зрения. Этот выбор упрощает проектирование, снижая сложность предварительной обработки и повышая возможность передачи между наборами данных, позволяя модели эффективно обобщаться на различных изображениях поражений кожи.

Реализация схемы коммутации на основе mamba-высокого порядка vision (H-VSS)                

Модуль H-VSS был реализован согласно архитектуре, показанной на рисунке 2. Нормализация слоя (LN) и активация Хардсвиша (HS) были настроены с остаточными соединениями по уравнению (1):

figure-protocol-1

Компонент локального пространственного дескриптора (LSD) был реализован для поддержания пространственной когерентности. Модуль пространственного выборочного 2D-сканирования (SS2D) был настроен с многонаправленными шаблонами сканирования согласно уравнению (2):

figure-protocol-2

Добавлена многослойная обработка перцептрона (MLP) с остаточными соединениями, как указано в уравнении (3):

figure-protocol-3

Механизм высокого порядка 2D селективного сканирования (H-SS2D) проецирует входные особенности в двумерное пространство для улучшения контекстного моделирования.

Параллельная многоглубинная гибкая сеть (PMFlex) реализация

Модуль PMFlex был сконфигурирован согласно спецификациям на рисунке 3 . Нормализация слоя применялась к входным отображениям признаков X(C, H×W), затем разбивалась на четыре сегмента вдоль размерности канала согласно уравнению (4):

figure-protocol-4

Каждая сегментированная функция Y_i обрабатывалась через общие модули Visual Mamba (VMamba). Обработанные выходы были объединены, а доработка применялась через нормализацию слоя и проекцию, как описано в уравнении (5):

figure-protocol-5

Многомасштабная сеть дилатированного синтеза внимания (MSDAFN) реализация

Модуль MSDAFN был реализован по архитектуре на рисунке 4. Параллельные операции свёртки были настроены с коэффициентами дилатации 6, 12 и 18 для многомасштабного извлечения признаков согласно уравнению (6):

figure-protocol-6

Многомасштабные признаки интегрировались через конкатенацию каналов, как указано в уравнении (7):

figure-protocol-7

Были реализованы механизмы двойного внимания для перекалибровки признаков. Веса внимания каналов рассчитывались с использованием глобального среднего пулирования согласно уравнению (8):

figure-protocol-8

Взвешивание внимания канала применялось, как описано в уравнении (9):

figure-protocol-9

Пространственное внимание было настраивано с помощью операций свёртки, следуя уравнению (10):

figure-protocol-10

Канал и пространственное внимание были объединены в соответствии с уравнением (11):

figure-protocol-11

Настройка и оптимизация обучения

Настройка среды

Экспериментальная среда была настроена на систему Ubuntu 20.04 с GPU (32 ГБ видеопамяти). Были установлены Python 3.8, фреймворк глубокого обучения (RRID: SCR_018536) и CUDA 11.8. Размер входного изображения был установлен на 256 × 256 пикселей для задач по кожным поражениям.

Функция потерь и конфигурация оптимизатора

Функция потерь BceDice была реализована для оптимизации обучения. Оптимизатор AdamW был настроен с начальной скоростью обучения 0,001, размером пакета 8 и 250 обучающими эпохами. Для регуляризации применялось снижение веса 1 × 10⁻5 .

Для базовой конфигурации данное исследование относится к работе Liu и др. (2024) над моделью Vmamba, которая использовалась в качестве визуальной модели пространства состоянийдля задачи 11 по классификации медицинских изображений. Точные конфигурации и скрипты, используемые для реализации Vmamba, основаны на их опубликованных работах и адаптированы для этого исследования с конкретными корректировками, чтобы лучше соответствовать набору данных медицинской визуализации.

Планирование скорости обучения было организовано с помощью косинусного отжига с тёплыми перезапусками. Настройте T_0 = 10 эпох для начального периода перезапуска, T_mult = 2 для умножения периодов и η_min = 1 × 10⁻6 для минимальной скорости обучения.

Оптимизация гиперпараметров

Для обеспечения воспроизводимости и согласованности все эксперименты проводились с использованием фиксированного случайного семена 42. Систематическая оптимизация гиперпараметров проводилась с акцентом на размер пакета, скорость обучения и скорость сброса. Были оценены размеры партий из 4, 8, 16 и 32. Были проверены показатели обучения 0,0005, 0,001, 0,0015 и 0,002. Производительность валидации отслеживалась с использованием коэффициента сходства кубиков (DSC) в качестве основной метрики. Размеры пакетов больше 8 могут привести к переполнению памяти на видеокартах с VRAM менее 32 ГБ.

Оценка модели и оценка эффективности

Конфигурация метрик оценки

Были внедрены комплексные метрики оценки, включая среднее пересечение по объединению (mIoU), коэффициент сходства кубиков (DSC), чувствительность (Sen), специфичность (Spe) и точность (Acc). Метрики рассчитывались по следующим формулировкам:

Среднее пересечение по объединению (mIoU) количественно определяет пересечение между предсказанной и сегментацией истинности на земле:

figure-protocol-12

Коэффициент сходства кубиков (DSC) измеряет согласованность сегментации. Значения варьируются от 0 до 1, при этом более высокие значения указывают на лучшую производительность:

figure-protocol-13

Чувствительность (Sen) измеряет способность модели обнаруживать положительные образцы:

figure-protocol-14

S-пецифицитность (Spe) оценивает правильное распознавание отрицательной образцовки:

figure-protocol-15

Точность (Acc) измеряет общую корректность прогноза:

figure-protocol-16

Параметры (M) отражают сложность модели, измеряя общие обучаемые параметры:

figure-protocol-17

где Pi — количество параметров на i-м слое, а N — общее количество слоёв. Меньшее количество параметров указывает на более лёгкие модели, подходящие для клинического применения.

Протокол абляционного исследования

Были проведены комплексные абляционные исследования для подтверждения вклада архитектурных компонентов в соответствии с экспериментальным проектированием, описанным в Таблице 1. Были оценены четыре архитектурных варианта: H-MUNet (базовый уровень без MSDAFN и PMFlex), HP-MUNet (без MSDAFN), HM-MUNet (без PMFlex) и HMP-MUNet (полная модель).

Одинаковые параметры обучения были настроены для всех вариантов: скорость обучения 0,001, размер партии 8, 250 эпох. Мониторинговалась конвергенция обучения, а улучшения производительности подтверждались для каждого добавления компонентов.

Анализ вычислительной эффективности

Измерялись показатели вычислительной эффективности, включая количество параметров, FLOP и время вывода по разным архитектурам. Оценка времени вывода модели на стандартном GPU клинического класса показывает, что, хотя она лучше всего работает на высокопроизводительных GPU, модель примерно на 70% медленнее на более распространённом оборудовании. Тем не менее, он по-прежнему способен обеспечивать эффективные скорости вывода, что делает его подходящим для практического клинического применения. Отслеживайте использование памяти GPU во время обучения для обеспечения стабильности системы. Рекомендуемая минимальная 16 ГБ памяти GPU для пакетного размера 8.

Валидация и анализ

Бенчмаркинг производительности

Производительность HMP-MUNet сравнивалась с передовыми методами на обоих наборах данных. Все сравниваемые модели реализовывались и обучались в рамках одинаковых разделений данных, предварительной обработки, дополнения данных и обучающих протоколов, чтобы гарантировать, что различия в производительности связаны исключительно с архитектурными различиями. Количественные результаты, включая улучшения DSC на 2,89% и 5,25% по наборам данных ISIC2018 и PH2, были задокументированы соответственно. Исследование подтвердило, что количество параметров уменьшено в 4,55 раза по сравнению с базовым уровнем U-Net.

Статистический анализ

Тестирование статистической значимости проводилось с использованием парных t-тестов для сравнения производительности. Для указанных метрик рассчитывались доверительные интервалы. Воспроизводимость обеспечивалась через несколько тренировочных забегов с разными случайными семенами.

Оптимальные конфигурации гиперпараметров были зафиксированы как пакетный размер 8 и скорость обучения 0,001, достигнув пикового DSC 0,9585 на наборе данных PH2 и 0,9044 на наборе данных ISIC2018, как задокументировано в экспериментальных результатах. Было обеспечено достаточное количество валидационных данных, чтобы предотвратить перенагон. Были проведены мониторинг кривых валидационных потерь для применения критериев раннего прекращения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Проектирование архитектуры HMP-MUNet для сегментации медицинских изображений

Предлагаемая архитектура HMP-MUNet продемонстрировала исключительную производительность в автоматизированных задачах сегментации кожных поражений. Рисунок 1 иллюстрирует полную архитектуру сети, демонстрируя иерархическую U-образную структуру энкодер-декодера с прогрессивным расширением каналов с 8 до 256 каналов. Интеграция трёх специали...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

В данном исследовании представлен HMP-MUNet (High-order Multi-scale Parallel Vision Mamba U-Net) — инновационный фреймворк глубокого обучения, который решает фундаментальные задачи компьютерной диагностики (CAD) для сегментации кожных поражений через инновационную интеграцию моделей пространственного состояния (SSM) с передовыми архитектурнымикомпонентами. 1. Описанный здесь подход демонстрирует, что сочетание механизмов взаимодействия признаков высокого порядка с...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторы заявляют, что у них нет конфликтов интересов, связанных с этим исследованием. Между авторами и коммерческими организациями, которые могли бы неправомерно повлиять на произведение, представленное в этой рукописи, не существует финансовых отношений. Это исследование проводилось независимо, и выводы и выводы принадлежат исключительно авторам. Текст этой рукописи был переработан и отполирован при поддержке ChatGPT, так как английский не является родным языком автора. Авторы подтверждают, что использование помощи ИИ ограничивалось редактированием языка и не включало генерации контента или анализа, которые могли бы повлиять на научную целостность работы.

Благодарности

Авторы с благодарностью выражают финансовую поддержку, предоставленную Научно-исследовательским проектом Департамента образования провинции Ляонин в рамках гранта LJ212510149013 и Общей программы Национального фонда естественных наук провинции Ляонин 2024-MSLH-377, что сделало возможным это исследование. Мы благодарим участников исследований и учреждения, которые внесли вклад в создание общедоступных наборов данных, использованных в этом исследовании, что позволило всестороннюю валидацию предлагаемой методологии.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
CUDA 11.8NVIDIA Corporation, Санта-Клара, Калифорния, СШАПрограммное обеспечение
GPU (32 ГБ VRAM)NVIDIAОперационная система
ISIC2017 Набор данныхВызов ISIChttps://challenge.isic-archive.com/dataНаборы данных
ISIC2018 Набор данныхВызов ISIChttps://challenge.isic-archive.com/dataНаборы данных
Видеокарта NVIDIA V100NVIDIA Corporation, Санта-Клара, Калифорния, СШААппаратное обеспечение
Набор данных PH2Universidade Do Portohttps://www.fc.up.pt/addi/ph2Наборы данных
Python 3.8PythonRRID:SCR_018536Программное обеспечение
PyTorch 1.13.0PyTorchRRID:SCR_018536Программное обеспечение
Ubuntu 20.04КаноническийАппаратное обеспечение

Ссылки

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

U NetVision Mamba