Это исследование проводилось в соответствии с институциональными рекомендациями по вычислительным исследованиям и обработке данных. В этом исследовании не участвовали ни люди, ни позвоночные животные.
Подготовка и предобработка наборов данных
Сбор и организация наборов данных
Дермоскопические изображения были собраны из наборов данных PH2, ISIC2018 и ISIC2017, с конкретными ссылками, предоставленными в Таблице материалов. Набор данных PH2 содержит 200 изображений высокого разрешения (1000 × 1000 пикселей), ISIC2018 включает 2 594 изображения с соответствующими сегментационными масками и ISIC2017 включает 2 150 изображений с сегментационными масками. Данные были организованы в наборы обучения, валидации и тестирования в соответствии со стандартными протоколами, обеспечивая совместимость изображений в форматах (например, .jpg, .png или .tiff) и соответствующие наземные маски истинности в бинарном формате.
Данные были организованы в наборы для обучения, валидации и тестирования согласно стандартным протоколам. Наборы данных были разделены следующим образом: для ISIC2018 было выделено 1 815 изображений для обучения, 259 — для валидации и 520 — для тестирования. За ISIC2017 было выделено 1500 изображений для обучения, 220 — для валидации и 430 — для тестирования. Для PH2 набор данных был разделён на 160 обучающих изображений, 10 валидационных изображений и 30 тестовых. Стабильное разрешение изображения — 256 × 256 пикселей — поддерживалось на протяжении всей предобработки.
Дополнение и нормализация данных
Для улучшения обобщения моделей применялись методы дополнения данных. Были реализованы горизонтальные перевороты, вертикальные перевороты и случайное вращение в диапазоне ±15°. Были применены гамма-коррекция и логарифмическое преобразование с вероятностью 0,3 каждая. Значения пикселей нормализовались с помощью статистики ImageNet (среднее = [0,485, 0,456, 0,406], стандартное отклонение = [0,229, 0,224, 0,225]).
Увеличить размер всех входных изображений до 256 × 256 пикселей: Для обеспечения вычислительной эффективности все входные изображения были изменены до равномерного разрешения 256 × 256 пикселей. Хотя изображения высокого разрешения, такие как в наборе данных (1000 × 1000 пикселей), содержат детали и информацию о текстурах, важную для точного определения границ поражения, увеличение разрешения существенно не улучшило производительность модели. Поэтому разрешение не увеличивалось для поддержания баланса между вычислительной эффективностью и точностью модели. Будущие исследования могут дополнительно исследовать влияние входных данных с более высоким разрешением, чтобы определить, оправдывают ли преимущества точности сегментации увеличение вычислительной стоимости. Изображения преобразовывались в формат RGB при необходимости. Предварительно обработанные данные сохранялись в структурированных каталогах при сохранении исходных разделений наборов данных.
Реализация архитектуры HMP-MUNet
Проектирование архитектуры сети
HMP-MUNet был настроен по иерархической U-образной структуре энкодер-декодера, как показано на рисунке 1. Сеть была настроена с прогрессивным расширением каналов: 8→16→32→64→128→256 каналов на разных уровнях кодировщиков.
Значительное архитектурное изменение было внесено за счёт сокращения глубины сети с четырёх иерархических уровней до двух, что помогает упростить модель и повысить вычислительную эффективность. Хотя глубина уменьшена, размеры канала увеличивались на каждом уровне, что позволило сети захватывать более насыщенные и выразительные черты. Для дальнейшего улучшения изучения признаков модели были введены механизмы внимания, чтобы сосредоточить сеть на наиболее релевантных признаках на нескольких уровнях. Эти механизмы внимания эффективно компенсируют потенциальную потерю иерархической абстракции признаков из-за более мелкой архитектуры.
Энкодер инициализировался с помощью двух операций Conv2D для первоначального извлечения признаков из входных тензоров X(C, H×W). Была реализована чередующаяся конфигурация трёх специализированных модулей: схема коммутации на основе Mamba высокого порядка видения (H-VSS), Параллельная многоглубинная гибкая сеть (PMFlex) и Многомасштабная сеть расширенного внимания (MSDAFN).
Модель использует статистику ImageNet (среднее и стандартное отклонение) для нормализации, избегая необходимости пересчитывать для каждого набора данных, тем самым повышая вычислительную эффективность. Он обеспечивает стабильность и обобщаемость, используя широкое применение ImageNet в задачах компьютерного зрения. Этот выбор упрощает проектирование, снижая сложность предварительной обработки и повышая возможность передачи между наборами данных, позволяя модели эффективно обобщаться на различных изображениях поражений кожи.
Реализация схемы коммутации на основе mamba-высокого порядка vision (H-VSS)
Модуль H-VSS был реализован согласно архитектуре, показанной на рисунке 2. Нормализация слоя (LN) и активация Хардсвиша (HS) были настроены с остаточными соединениями по уравнению (1):

Компонент локального пространственного дескриптора (LSD) был реализован для поддержания пространственной когерентности. Модуль пространственного выборочного 2D-сканирования (SS2D) был настроен с многонаправленными шаблонами сканирования согласно уравнению (2):

Добавлена многослойная обработка перцептрона (MLP) с остаточными соединениями, как указано в уравнении (3):

Механизм высокого порядка 2D селективного сканирования (H-SS2D) проецирует входные особенности в двумерное пространство для улучшения контекстного моделирования.
Параллельная многоглубинная гибкая сеть (PMFlex) реализация
Модуль PMFlex был сконфигурирован согласно спецификациям на рисунке 3 . Нормализация слоя применялась к входным отображениям признаков X(C, H×W), затем разбивалась на четыре сегмента вдоль размерности канала согласно уравнению (4):

Каждая сегментированная функция Y_i обрабатывалась через общие модули Visual Mamba (VMamba). Обработанные выходы были объединены, а доработка применялась через нормализацию слоя и проекцию, как описано в уравнении (5):

Многомасштабная сеть дилатированного синтеза внимания (MSDAFN) реализация
Модуль MSDAFN был реализован по архитектуре на рисунке 4. Параллельные операции свёртки были настроены с коэффициентами дилатации 6, 12 и 18 для многомасштабного извлечения признаков согласно уравнению (6):

Многомасштабные признаки интегрировались через конкатенацию каналов, как указано в уравнении (7):

Были реализованы механизмы двойного внимания для перекалибровки признаков. Веса внимания каналов рассчитывались с использованием глобального среднего пулирования согласно уравнению (8):

Взвешивание внимания канала применялось, как описано в уравнении (9):

Пространственное внимание было настраивано с помощью операций свёртки, следуя уравнению (10):

Канал и пространственное внимание были объединены в соответствии с уравнением (11):

Настройка и оптимизация обучения
Настройка среды
Экспериментальная среда была настроена на систему Ubuntu 20.04 с GPU (32 ГБ видеопамяти). Были установлены Python 3.8, фреймворк глубокого обучения (RRID: SCR_018536) и CUDA 11.8. Размер входного изображения был установлен на 256 × 256 пикселей для задач по кожным поражениям.
Функция потерь и конфигурация оптимизатора
Функция потерь BceDice была реализована для оптимизации обучения. Оптимизатор AdamW был настроен с начальной скоростью обучения 0,001, размером пакета 8 и 250 обучающими эпохами. Для регуляризации применялось снижение веса 1 × 10⁻5 .
Для базовой конфигурации данное исследование относится к работе Liu и др. (2024) над моделью Vmamba, которая использовалась в качестве визуальной модели пространства состоянийдля задачи 11 по классификации медицинских изображений. Точные конфигурации и скрипты, используемые для реализации Vmamba, основаны на их опубликованных работах и адаптированы для этого исследования с конкретными корректировками, чтобы лучше соответствовать набору данных медицинской визуализации.
Планирование скорости обучения было организовано с помощью косинусного отжига с тёплыми перезапусками. Настройте T_0 = 10 эпох для начального периода перезапуска, T_mult = 2 для умножения периодов и η_min = 1 × 10⁻6 для минимальной скорости обучения.
Оптимизация гиперпараметров
Для обеспечения воспроизводимости и согласованности все эксперименты проводились с использованием фиксированного случайного семена 42. Систематическая оптимизация гиперпараметров проводилась с акцентом на размер пакета, скорость обучения и скорость сброса. Были оценены размеры партий из 4, 8, 16 и 32. Были проверены показатели обучения 0,0005, 0,001, 0,0015 и 0,002. Производительность валидации отслеживалась с использованием коэффициента сходства кубиков (DSC) в качестве основной метрики. Размеры пакетов больше 8 могут привести к переполнению памяти на видеокартах с VRAM менее 32 ГБ.
Оценка модели и оценка эффективности
Конфигурация метрик оценки
Были внедрены комплексные метрики оценки, включая среднее пересечение по объединению (mIoU), коэффициент сходства кубиков (DSC), чувствительность (Sen), специфичность (Spe) и точность (Acc). Метрики рассчитывались по следующим формулировкам:
Среднее пересечение по объединению (mIoU) количественно определяет пересечение между предсказанной и сегментацией истинности на земле:

Коэффициент сходства кубиков (DSC) измеряет согласованность сегментации. Значения варьируются от 0 до 1, при этом более высокие значения указывают на лучшую производительность:

Чувствительность (Sen) измеряет способность модели обнаруживать положительные образцы:

S-пецифицитность (Spe) оценивает правильное распознавание отрицательной образцовки:

Точность (Acc) измеряет общую корректность прогноза:

Параметры (M) отражают сложность модели, измеряя общие обучаемые параметры:

где Pi — количество параметров на i-м слое, а N — общее количество слоёв. Меньшее количество параметров указывает на более лёгкие модели, подходящие для клинического применения.
Протокол абляционного исследования
Были проведены комплексные абляционные исследования для подтверждения вклада архитектурных компонентов в соответствии с экспериментальным проектированием, описанным в Таблице 1. Были оценены четыре архитектурных варианта: H-MUNet (базовый уровень без MSDAFN и PMFlex), HP-MUNet (без MSDAFN), HM-MUNet (без PMFlex) и HMP-MUNet (полная модель).
Одинаковые параметры обучения были настроены для всех вариантов: скорость обучения 0,001, размер партии 8, 250 эпох. Мониторинговалась конвергенция обучения, а улучшения производительности подтверждались для каждого добавления компонентов.
Анализ вычислительной эффективности
Измерялись показатели вычислительной эффективности, включая количество параметров, FLOP и время вывода по разным архитектурам. Оценка времени вывода модели на стандартном GPU клинического класса показывает, что, хотя она лучше всего работает на высокопроизводительных GPU, модель примерно на 70% медленнее на более распространённом оборудовании. Тем не менее, он по-прежнему способен обеспечивать эффективные скорости вывода, что делает его подходящим для практического клинического применения. Отслеживайте использование памяти GPU во время обучения для обеспечения стабильности системы. Рекомендуемая минимальная 16 ГБ памяти GPU для пакетного размера 8.
Валидация и анализ
Бенчмаркинг производительности
Производительность HMP-MUNet сравнивалась с передовыми методами на обоих наборах данных. Все сравниваемые модели реализовывались и обучались в рамках одинаковых разделений данных, предварительной обработки, дополнения данных и обучающих протоколов, чтобы гарантировать, что различия в производительности связаны исключительно с архитектурными различиями. Количественные результаты, включая улучшения DSC на 2,89% и 5,25% по наборам данных ISIC2018 и PH2, были задокументированы соответственно. Исследование подтвердило, что количество параметров уменьшено в 4,55 раза по сравнению с базовым уровнем U-Net.
Статистический анализ
Тестирование статистической значимости проводилось с использованием парных t-тестов для сравнения производительности. Для указанных метрик рассчитывались доверительные интервалы. Воспроизводимость обеспечивалась через несколько тренировочных забегов с разными случайными семенами.
Оптимальные конфигурации гиперпараметров были зафиксированы как пакетный размер 8 и скорость обучения 0,001, достигнув пикового DSC 0,9585 на наборе данных PH2 и 0,9044 на наборе данных ISIC2018, как задокументировано в экспериментальных результатах. Было обеспечено достаточное количество валидационных данных, чтобы предотвратить перенагон. Были проведены мониторинг кривых валидационных потерь для применения критериев раннего прекращения.