$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Ожидаемые результаты и интерпретация
При правильной реализации этого протокола обученная модель MVM-UNet должна обеспечивать стабильную производительность сегментации при повторных запусках, при этом для большинства показателей оценки оцениваются лишь небольшие вариации между различными случайными семенами. Для ISIC 2017 и ISIC 2018 успешные результаты отражаются в высоких значениях DSC, mIoU, Acc, Sen и Spe, а также в прогнозируемых масках поражения, которые тесно следуют границам поражения между основой и правдой (см. рисунки 6 и 7). Для Synapse успешные результаты отражаются в высоких средних значениях DSC и низких значениях HD95 в органах переднего плана (рисунок 8). Во время выполнения протокола количественные метрики должны интерпретироваться вместе с соответствующими качественными результатами сегментации. Модель, достигающая высокого DSC, но демонстрирующая утечку границы, пропуск мелких структур или фрагментированные прогнозы, должна считаться лишь частично успешной, а также проверять процедуру предварительной обработки, выбор контрольных точек и настройки вывода.

Рисунок 6. Репрезентативные качественные результаты сегментации на наборе данных ISIC 2017. Репрезентативные результаты качественной сегментации, полученные на базе данных Международного сотрудничества по визуализации кожи (ISIC) 2017 года. Каждый пример показывает исходное дермоскопическое изображение (Image), соответствующую маску сегментации на земле (GT) и прогноз, сгенерированный MVM-UNet (Pred). Репрезентативные тестовые случаи иллюстрируют эффективность сегментации поражений разного размера, морфологии и граничной сложности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 7. Репрезентативные качественные результаты сегментации в наборе данных ISIC 2018. Репрезентативные качественные результаты сегментации, полученные на базе данных Международного сотрудничества по визуализации кожи (ISIC) 2018 года. Каждый пример показывает исходное дермоскопическое изображение (Image), соответствующую маску сегментации на земле (GT) и прогноз, сгенерированный MVM-UNet (Pred). Репрезентативные тестовые случаи демонстрируют сегментационные характеристики по различным видам поражений и пограничным характеристикам. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 8. Репрезентативные качественные результаты сегментации на наборе данных мультиорганной компьютерной томографии Synapse. Репрезентативные результаты качественной многоорганной сегментации, полученные на базе данных Synapse Multi-Atlas Labeling Beyond the Cranial Vault. Каждый пример показывает оригинальное изображение компьютерной томографии (Image), соответствующие аннотации органов с основной правдой (GT) и предсказание, сгенерированное MVM-UNet (Pred). Репрезентативные примеры иллюстрируют согласование между предсказанными и эталонными сегментациями между несколькими органами брюшной полости. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Результаты на ISIC 2017
Для оценки воспроизводимости MVM-UNet все основные сравнительные эксперименты были повторены с использованием трёх независимых случайных семян (1, 52 и 100), и результаты были представлены как среднее ± SD. Статистическая значимость оценивалась с помощью теста Wilcoxon signed-rank на основе парных результатов по изображениям для ISIC 2017 и ISIC 2018, а также парных результатов по случаям для Synapse. Статистический анализ проводился с использованием парных метрических значений, а не средних показателей на уровне семян. Для справедливого сравнения результаты, представленные как средние ± SD, воспроизводились с использованием официальных реализаций под одними и теми же разделами набора данных, входными разрешениями и метриками оценки, когда это было возможно, тогда как результаты с одним значением сохранялись из соответствующих оригинальных публикаций.
MVM-UNet был оценён на базе датасета сегментации кожных поражений ISIC 2017 года и сравниван с представительными методами сегментации, включаяUNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36 и H2Former12 (Таблица 1). MVM-UNet достиг mIoU 80,94 ± 1,01%, DSC 91,32% ± 0,68%, точности 96,58% ± 0,27%, специфичности 98,31% ± 0,23%, а также чувствительности 91,65% ± 0,77% на трёх независимых запусках. По сравнению с оценёнными методами, MVM-UNet достиг наивысшего mIoU, DSC и чувствительности. Репрезентативные качественные результаты сегментации показаны на рисунке 6, где прогнозируемые маски точно следуют границам поражения на основе и правдивости на репрезентативных тестовых изображениях.
| Модель | Ref. | mIoU (%) | DSC (%) | Acc (%) | Spe (%) | Сен (%) |
| UNet | 8 | 76.98 | 86.99 | 95.65 | 97.43 | 86.82 |
| TransUNet | 23 | 75.32 | 81.23 | 91.45 | 95.77 | 82.63 |
| MaLUNet | 31 | 78.78 | 88.13 | 96.18 | 98.47 | 84.78 |
| VM-UNet | 32 | 80.23 | 89.03 | 96.29 | 97.58 | 89.90 |
| UNeXt-S | 33 | 78.26 | 87.80 | 95.95 | 97.74 | 87.04 |
| HResFormer | 34 | 79.89 ± 1.05 | 88,82 ± 0,65 | 96.25 ± 0.24 | 97,73 ± 0,22 | 87,72 ± 0,79 |
| H-vmunet | 28 | 80.34 ± 1.02 | 90,68 ± 0,55 | 96,42 ± 0,18 | 98.23 ± 0.32 | 88,97 ± 0,88 |
| MISSormer | 30 | 80,16 ± 0,78 | 89,27 ± 0,61 | 94,36 ± 0,28 | 97,52 ± 0,38 | 87,71 ± 0,69 |
| H2Former | 12 | 80,35 ± 0,95 | 88,56 ± 0,72 | 96.61 ± 0.19 | 98.15 ± 0.14 | 88,21 ± 0,81 |
| MedScale-Former | 35 | 80,31 ± 0,82 | 89.11 ± 0.59 | 95,68 ± 0,33 | 98.24 ± 0.21 | 89,96 ± 0,92 |
| MCAFT | 36 | 80,59 ± 0,93 | 89,27 ± 0,63 | 96,42 ± 0,20 | 97,95 ± 0,17 | 90,05 ± 0,84 |
| MVM-UNet (Ours) | — | 80.94 ± 1.01 | 91,32 ± 0,68 | 96,58 ± 0,27 | 98.31 ± 0.23 | 91,65 ± 0,77 |
Таблица 1: Сравнение производительности на наборе данных ISIC 2017 по сегментации кожных поражений. Сравнение MVM-UNet с методами сегментации на основе репрезентативных сверточных нейронных сетей (CNN), трансформеров и моделей пространства состояний (SSM) с использованием среднего пересечения над объединением (mIoU), коэффициента сходства кубиков (DSC), точности (Acc.), специфичности (Spe.) и чувствительности (Sen.). Результаты для MVM-UNet представлены как среднее ± стандартное отклонение от трёх независимых экспериментов с случайными семенами. Результаты, представленные в виде отдельных значений, воспроизводились из соответствующих оригинальных публикаций.
Качественные примеры дополнительно демонстрируют, что MVM-UNet точно сегментировал как мелкие, так и крупные поражения с неправильными границами. В этих репрезентативных примерах предсказанные маски близко совпадали с соответствующими аннотациями по правде и сохраняли границы поражения с минимальными утечками или фрагментацией.
Для дальнейшей оценки статистической значимости наблюдаемых улучшений были проведены тесты Уилкоксона с рейтингом с подписью, используя парные результаты сегментации на изображение. Для метрики mIoU MVM-UNet показал статистически значимое улучшение по сравнению с MCAFT с p-значением 0,0114. Для метрики DSC MVM-UNet также значительно превосходил H-vmunet с p-значением 0,0031. Эти результаты подтверждают, что наблюдаемые улучшения по сравнению с ISIC 2017 вряд ли были связаны со случайными вариациями.
В целом, MVM-UNet достиг наивысших результатов среди сравниваемых методов mIoU, DSC и чувствительности в наборе данных ISIC 2017 (Таблица 1). Примеры качественной сегментации, показанные на рисунке 6 , согласуются с этими количественными результатами.
Результаты на ISIC 2018
MVM-UNet был дополнительно оценен на наборе сегментации кожных поражений ISIC 2018 года и сравниван с представительными методами сегментации, включая UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 и MCAFT36 (Таблица 2)). MVM-UNet достиг mIoU 82,47% ± 1,28%, DSC 90,65% ± 0,94%, точности 96,02% ± 0,36%, специфичности 97,06% ± 0,31%, а также чувствительности 91,80% ± 0,82% на трёх независимых запусках. Эти результаты показывают, что производительность MVM-UNet оставалась стабильной среди различных случайных семян. Репрезентативные результаты качественной сегментации показаны на рисунке 7.
| Модель | Ref. | mIoU (%) | DSC (%) | Acc (%) | Spe (%) | Сен (%) |
| UNet | 8 | 77.86 | 87.55 | 94.05 | 96.69 | 85.86 |
| UNet++ | 9 | 78.31 | 87.83 | 94.02 | 95.75 | 88.65 |
| UTNetV2 | 37 | 78.97 | 88.25 | 94.32 | 96.48 | 87.60 |
| SANet | 38 | 79.52 | 88.59 | 94.39 | 95.97 | 89.46 |
| MaLUNet | 31 | 80.25 | 89.04 | 94.62 | 96.19 | 89.74 |
| VM-UNet | 32 | 81.35 | 89.71 | 94.91 | 96.13 | 91.12 |
| H-vmunet | 28 | 81.93 ± 1.45 | 90,46 ± 0,62 | 95.19 ± 0.30 | 96.82 ± 0.21 | 88.37 ± 1.13 |
| MISSormer | 30 | 80.27 ± 1.21 | 89,91 ± 0,46 | 94,76 ± 0,27 | 97.22 ± 0.15 | 90.84 ± 1.07 |
| H2Former | 12 | 80,40 ± 0,83 | 90,26 ± 0,73 | 94,89 ± 0,38 | 96,98 ± 0,25 | 91.57 ± 0.54 |
| HResFormer | 34 | 81.12 ± 1.18 | 88,86 ± 0,84 | 94,96 ± 0,33 | 96,43 ± 0,22 | 91.86 ± 1.01 |
| MedScale-Former | 35 | 80,97 ± 0,74 | 90,47 ± 0,68 | 95.02 ± 0.41 | 95,89 ± 0,26 | 90,65 ± 0,92 |
| MCAFT | 36 | 81.46 ± 1.03 | 89,06 ± 0,76 | 95.23 ± 0.29 | 96,72 ± 0,17 | 91.82 ± 0.57 |
| MVM-UNet (Ours) | — | 82.47 ± 1.28 | 90,65 ± 0,94 | 96.02 ± 0.36 | 97.06 ± 0.31 | 91.80 ± 0.82 |
Таблица 2: Сравнение характеристик на наборе данных ISIC 2018 по сегментации кожных поражений. Сравнение MVM-UNet с репрезентативными методами сегментации на основе CNN, Transformer и SSM с использованием среднего пересечения по объединению (mIoU), коэффициента сходства кубиков (DSC), точности (Acc.), специфичности (Spe.) и чувствительности (Sen.). Результаты для MVM-UNet представлены как среднее ± стандартное отклонение от трёх независимых экспериментов с случайными семенами. Результаты, представленные в виде отдельных значений, воспроизводились из соответствующих оригинальных публикаций.
По сравнению с H-vmunet, MVM-UNet улучшил mIoU на 0,54%. По сравнению с MedScale-Former, MVM-UNet улучшил DSC на 0,18%. MVM-UNet также достиг самой высокой точности среди сравниваемых методов. Репрезентативные качественные примеры, показанные на рисунке 7 , демонстрируют точную сегментацию представительных кожных поражений, включая небольшие области поражения и поражения с неправильными границами.
Для ISIC 2018 статистическая значимость оценивалась с помощью теста Wilcoxon signed-rank на основе парных результатов сегментации по изображению. Для метрики mIoU MVM-UNet достиг статистически значимого улучшения по сравнению с MCAFT с p-значением < 0,001. Эти результаты подтверждают, что наблюдаемое улучшение эффективности в ISIC 2018 маловероятно, что связано со случайными изменениями.
В целом, MVM-UNet достиг наивысшего mIoU, DSC и точности среди сравниваемых методов в наборе данных ISIC 2018 (Таблица 2). Качественные примеры, показанные на рисунке 7, соответствуют этим количественным улучшениям.
Производительность на Synapse
Предложенный метод также был оценён на наборе данных по сегментации мультиорганов Synapse и сравниван с репрезентативными методами, включая UNet 8,21, AttentionU-Net 39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 и MCAFT36 (Таблица 3)). Набор данных Synapse включал восемь брюшных органов: аорту, желчный пузырь, селезёнку, левую почку, правую почку, печень, поджелудочную железу и желудок. Согласно стандартному экспериментальному протоколу, для обучения использовалось 18 случаев (2 212 осевых срезов), а для тестирования — 12 случаев (1 567 осевых срезов). Отдельный набор валидации не был введён. Тестовые случаи использовались исключительно для финальной оценки и не применялись для обучения моделей, настройки гиперпараметров или выбора модели. Репрезентативные результаты качественной сегментации мультиорганов показаны на рисунке 8, а количественное сравнение суммировано в таблице 3.
| Модель | Ref. | DSC | HD95 | Аор. | Гал. | Парень. (L) | Парень. (R) | Лив. | Пан. | Spl. | Сто. |
| UNet | 8 | 76.85 | 39.78 | 89.07 | 69.72 | 77.77 | 68.69 | 93.43 | 54.01 | 86.66 | 75.59 |
| Att-UNet | 39 | 77.77 | 36.02 | 89.54 | 68.88 | 77.98 | 71.11 | 93.57 | 58.04 | 87.31 | 75.74 |
| TransUNet | 23 | 77.48 | 31.69 | 87.23 | 63.13 | 81.87 | 77.02 | 94.08 | 55.84 | 85.06 | 75.62 |
| TransNorm | 40 | 78.4 | 30.25 | 86.23 | 65.18 | 82.18 | 78.63 | 94.22 | 55.32 | 89.53 | 76.02 |
| Swin U-Net | 25 | 79.13 | 21.55 | 85.47 | 66.53 | 83.28 | 79.61 | 94.29 | 56.58 | 90.62 | 76.59 |
| TransDeepLab | 41 | 80.16 | 21.25 | 86.04 | 69.16 | 84.08 | 79.88 | 93.53 | 61.15 | 89.01 | 78.36 |
| MEW-UNet | 42 | 78.92 | 21.68 | 86.68 | 65.32 | 82.87 | 80.02 | 93.63 | 58.38 | 90.16 | 74.27 |
| MISSormer | 30 | 80.92 ± 4.23 | 20.09 ± 1.89 | 86,43 ± 0,98 | 69.81 ± 4.56 | 84.29 ± 2.11 | 81.03 ± 3.34 | 93,85 ± 0,89 | 61.11 ± 4.67 | 90.05 ± 3.78 | 80.62 ± 1.02 |
| H2Former | 12 | 81.05 ± 2.56 | 20.13 ± 7.23 | 86.61 ± 3.21 | 69.32 ± 1.23 | 85.12 ± 4.78 | 82.01 ± 2.89 | 94.09 ± 2.45 | 61.16 ± 0.76 | 89.97 ± 4.12 | 80,94 ± 3,56 |
| HResFormer | 34 | 80.65 ± 4.02 | 17.48 ± 6.89 | 89.16 ± 2.78 | 66,94 ± 0,78 | 84.61 ± 4.34 | 82.15 ± 2.56 | 93.11 ± 1.34 | 59.92 ± 4.12 | 91.08 ± 3.45 | 80.75 ± 2.01 |
| MedScale-Former | 35 | 80,78 ± 1,34 | 20.02 ± 3.78 | 88.79 ± 4.02 | 69,82 ± 2,56 | 85.13 ± 0.87 | 81.63 ± 4.78 | 94.10 ± 2.78 | 60,72 ± 1,89 | 90.14 ± 1.56 | 80.93 ± 4.56 |
| MCAFT | 36 | 81.03 ± 3.45 | 19.98 ± 5.12 | 89,76 ± 0,76 | 68,96 ± 3,89 | 84.54 ± 2.56 | 81.98 ± 3.12 | 94.32 ± 4.01 | 60,85 ± 3,67 | 89.06 ± 4.89 | 80.91 ± 1.78 |
| MVM-UNet (Ours) | — | 81.26 ± 1.89 | 18.72 ± 2.16 | 88.53 ± 3.22 | 69.84 ± 4.23 | 85.37 ± 2.69 | 82.67 ± 1.67 | 94.41 ± 3.56 | 61.02 ± 2.78 | 90.19 ± 0.67 | 81.48 ± 3.12 |
Таблица 3: Сравнение производительности на наборе данных Synapse по сегментации мультиорганов. Сравнение MVM-UNet с репрезентативными методами сегментации на основе CNN, Transformer- и SSM с использованием коэффициента сходства кубиков (DSC), 95-го перцентиля расстояния Хаусдорфа (HD95) и органоспецифических оценок Dice для аорты (Aor), желчного пузыря (гал), левой почки (Kid). (L)), правую почку (Кид. (R)), печени (Лив), поджелудочной железы (пан), селезёнки (Spl.) и желудка (Sto.). Результаты для MVM-UNet представлены как среднее ± стандартное отклонение от трёх независимых экспериментов с случайными семенами. Результаты, представленные в виде отдельных значений, воспроизводились из соответствующих оригинальных публикаций.
MVM-UNet достиг среднего DSC 81,26% ± 1,89% и среднего HD95 18,72 ± 2,16 на трёх независимых заездах. Результаты демонстрируют стабильную производительность сегментации на наборе данных Synapse. Среди оценённых методов MVM-UNet достиг самого высокого среднего DSC и второго по низкому среднему HD95.
Для Synapse статистическая значимость оценивалась с помощью теста Wilcoxon signed-rank на основе парных значений DSC для каждого случая. MVM-UNet показал статистически значимое улучшение по сравнению с H2Former, с p-значением 0,026, что указывает на то, что наблюдаемое улучшение сегментационных результатов было статистически значимым.
Репрезентативные успешные и неоптимальные результаты
Репрезентативные успешные качественные результаты показаны на рисунках 6–8. Успешные результаты характеризуются предсказуемыми сегментационными масками, которые тесно соответствуют аннотациям на основе правды и точно определяют первичные границы поражения или органов. Репрезентативные субоптимальные исходы могут возникать для очень малых целей, границ с низким контрастом, неправильных форм поражения, органов с слабой интенсивностью контраста или анатомически неоднозначных границ, и обычно проявляются как недосегментация, чрезмерная сегментация, утечка границы или прерывистые фрагменты маски. Когда наблюдаются такие результаты, пользователям следует проверить, что изменение размера изображения, нормализация, интерполяция масок, выбор контрольных точек модели, пороговое определение вывода (для наборов данных ISIC) или предсказание argmax (для Synapse), а также методы вычисления метрик соответствуют описанным в протоколе.
Абляционное исследование модуля MV4D
Вклад модуля MV4D оценивался путём постепенного добавления пар зигзагообразного, иерархического, спирального и радиального сканирования, за которыми следовал модуль SFusion Mamba (Таблица 4; Рисунок 9). Когда использовалась только пара зигзагообразного сканирования, производительность сегментации была ограничена. Добавление иерархической пары сканирования значительно повысило производительность, что свидетельствует о преимуществах включения мультимасштабной информации. Последующее добавление пар спирального и радиального сканирования дополнительно улучшило характеристики сегментации, улучшив контурное и граничное представление. Внедрение модуля SFusion Mamba обеспечило наивысшую производительность среди оцененных конфигураций.
| Модель | Пара зигзагообразного сканирования | Иерархическая пара сканирования | Пара спирального сканирования | Пара радиального сканирования | SFusion Mamba | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | | | | | 56.75 | 72.46 | 58.03 | 73.45 |
| MVM-UNet | ✓ | ✓ | | | | 72.38 | 84.01 | 73.45 | 84.7 |
| MVM-UNet | ✓ | ✓ | ✓ | | | 75.69 | 86.20 | 76.94 | 86.94 |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | | 76.41 | 86.61 | 78.28 | 87.82 |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | ✓ | 80.94 | 91.32 | 82.47 | 90.65 |
Таблица 4: Абляционное исследование модуля Multi-View 4-Directional (MV4D). Производительность достигается за счёт постепенного включения иерархических, спиральных и радиальных пар сканирования, а также модуля Spatial Fusion Mamba (SFusion Mamba) в архитектуру базовой зигзагообразной пары сканирования. Производительность отражается с использованием среднего пересечения по объединению (mIoU) и коэффициента сходства кубиков (DSC) на наборах данных ISIC 2017 и ISIC 2018.

Рисунок 9. Абляционное исследование модуля Multi-View 4-Directional (MV4D). (A) Изменение среднего пересечения по объединению (mIoU) после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру. (B) Изменение коэффициента сходства кубиков (DSC) после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру. (C) Изменение mIoU после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру во второй экспериментальной системе. (D) Изменение DSC после последовательного включения иерархической пары сканирования, пары спирального сканирования, пары радиального сканирования и Spatial Fusion Mamba (SFusion Mamba) в базовую архитектуру во второй экспериментальной системе. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
В наборе данных ISIC 2017 полный модуль MV4D достиг mIoU 80,94% и DSC 91,32%. Соответствующие тенденции производительности для mIoU и DSC показаны на рисунках 9A и 9B соответственно. В наборе данных ISIC 2018 полный модуль MV4D достиг mIoU 82,47% и DSC 90,65%. Соответствующие тенденции эффективности показаны соответственно на рисунках 9C и 9D.
Если не указано иное, все абляционные эксперименты проводились с использованием фиксированного случайного семя 100, тогда как основные результаты сравнения были представлены как средние ± SD по трём независимым случайным семянным (1, 52 и 100). Следовательно, результаты абляции предназначены для сравнения относительных вкладов отдельных компонентов в контролируемой односетной среде, а не для воспроизведения итоговых результатов мультисея, представленных в основных сравнительных экспериментах.
В целом, постепенное включение дополнительных пар сканирования и модуля SFusion Mamba стабильно улучшало производительность сегментации, при этом полная конфигурация MV4D обеспечивала наивысшую производительность на обоих наборах данных.
Исследование абляции блока многовидного зрения (MVV)
Блок MVV оценивался путём сравнения базовой архитектуры с версией, включающей ветвь проекции вверх-вниз (Таблица 5). В наборе данных ISIC 2017 включение ветки Up-Down Projection увеличило mIoU с 78,83% до 80,96%, а DSC — с 88,15% до 91,02%. В наборе данных ISIC 2018 mIoU вырос с 80,32% до 82,46%, а DSC — с 89,15% до 90,57%.
| Модель | Базовый блок MVV | Проекция вверх-вниз | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | | 78.83 | 88.15 | 80.32 | 89.15 |
| MVM-UNet | ✓ | ✓ | 80.96 | 91.02 | 82.46 | 90.57 |
Таблица 5: Абляционное исследование блока многовидного зрения (MVV). Сравнение производительности базового блока Multi-View Vision (MVV) с веткой проекции вверх-вниз и без неё. Производительность отражается с использованием среднего пересечения по объединению (mIoU) и коэффициента сходства кубиков (DSC) на наборах данных ISIC 2017 и ISIC 2018.
Эксперименты по абляции MVV Block проводились с использованием фиксированного случайного семена 100. Следовательно, производительность конфигурации, содержащей ветвь проекции Up-Down Projection, отражает контролируемую абляцию с одним посевом и может немного отличаться от трёхпосевной средней производительности, представленной для полной модели MVM-UNet в основных сравнительных экспериментах.
В целом, внедрение ветки проекции вверх-вниз стабильно улучшало эффективность сегментации на обоих наборах данных, при этом наблюдается рост как для mIoU, так и для DSC.
Исследование абляции модуля многоступенчатого термоядерного синтеза Mamba (MFusion Mamba)
Модуль MFusion Mamba оценивался путём сравнения различных стратегий крупного синтеза вместе с компонентом тонкого синтеза (Таблица 6; Рисунок 10). Без MFusion Mamba MVM-UNet достиг mIoU 75,47% и DSC 86,01% в наборе данных ISIC 2017, а также mIoU 77,49% и DSC 87,29% в наборе данных ISIC 2018. Среди изученных стратегий крупного синтеза продукт Hadamard достиг наибольшего улучшения. Внедрение компонента Fine Fusion дополнительно повысило производительность сегментации. Полная конфигурация MFusion Mamba достигла mIoU 80,95% и DSC 91,18% на ISIC 2017, а также mIoU 82,51% и DSC 90,58% на ISIC 2018.
| Модель | Максимальный по элементам грубого синтеза | Грубое слияниеСложение по элементам | Крупный термоядерный продукт Хадамард | Модуль тонкого синтеза | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | | | | | 75.47 | 86.01 | 77.49 | 87.29 |
| MVM-UNet | ✓ | | | | 76.21 | 86.47 | 78.35 | 87.82 |
| MVM-UNet | | ✓ | | | 76.83 | 86.86 | 79.11 | 88.30 |
| MVM-UNet | | | ✓ | | 78.26 | 87.83 | 80.06 | 88.96 |
| MVM-UNet | | | ✓ | ✓ | 80.95 | 91.18 | 82.51 | 90.58 |
Таблица 6: Абляционное исследование модуля многоступенчатого термоядерного синтеза Mamba (MFusion Mamba). Сравнение производительности различных стратегий грубого синтеза, включая максимальное слияние (Max), элементное сложение (⊕) и продукт Адамара (⊙), а также полный модуль тонкого синтеза. Производительность отражается с использованием среднего пересечения по объединению (mIoU) и коэффициента сходства кубиков (DSC) на наборах данных ISIC 2017 и ISIC 2018.

Рисунок 10. Абляционное исследование модуля Multi-stage Fusion Mamba (MFusion Mamba). (A) Изменение среднего пересечения по объединению (mIoU), полученное с помощью различных стратегий крупного синтеза (максимальное, элементное сложение и произведение Адамара) и полного модуля тонкого синтеза. (B) Изменение коэффициента сходства кубиков (DSC), полученного с помощью различных стратегий крупного синтеза (максимальное, элементное сложение и произведение Адамара) и полного модуля тонкого синтеза. (C) Изменение mIoU, полученное с помощью различных стратегий крупного синтеза (максимальное, элементное сложение и произведение Адамара) и полный модуль тонкого синтеза во второй экспериментальной системе. (D) Изменение DSC, полученное с использованием различных стратегий грубого синтеза (максимальное, элементное сложение и произведение Адамара) и полный модуль тонкого синтеза при втором экспериментальном режиме. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
В наборе данных ISIC 2017 полная конфигурация MFusion Mamba достигла mIoU 80,95% и DSC 91,18%. Соответствующие тенденции производительности для mIoU и DSC показаны соответственно на рисунках 10A и 10B. В наборе данных ISIC 2018 полная конфигурация MFusion Mamba достигла mIoU 82,51% и DSC 90,58%. Соответствующие тенденции эффективности показаны на рисунках 10C и 10D соответственно. Эксперименты по абляции MFusion Mamba проводились с использованием фиксированного случайного семена 100. Следовательно, полная конфигурация MFusion Mamba представляет собой контролируемый результат абляции с одним посевом и может немного отличаться от трёхсеянной средней производительности, представленной для полной модели MVM-UNet в основных сравнительных экспериментах.
В целом, постепенное внедрение стратегии грубого синтеза продукта Hadamard и компонента Fine Fusion стабильно улучшало производительность сегментации, при этом полная конфигурация MFusion Mamba обеспечивала наивысшие показатели на обоих наборах данных.
Резюме исследований абляции
В экспериментах по абляции, постепенно внедряя иерархические, спиральные и радиальные пары сканирования вместе с модулем SFusion Mamba, что стабильно улучшало производительность сегментации (Таблица 4; Рисунок 9). Аналогично, включение ветви проекции вверх-вниз в блок MVV улучшило как mIoU, так и DSC на наборах данных ISIC 2017 и ISIC 2018 (Таблица 5). Полная конфигурация MFusion Mamba также показала наивысшую производительность среди оцениваемых многоступенчатых стратегий объединения элементов (Таблица 6; Рисунок 10).
Абляционное исследование гиперпараметров
Влияние размера входных данных и значения выпадения были оценены на наборах данных ISIC 2017 и ISIC 2018 (Таблица 7). Сравнивались три входных разрешения (256 × 256, 384 × 384 и 512 × 512). При оцененных настройках входное разрешение 256 × 256 достигло самой высокой производительности сегментации в обоих наборах данных.
| Модель | Размер входа 256 × 256 | Размер входа 384 × 384 | Размер входа 512 × 512 | Dropout 0.0 | Dropout 0.1 | Dropout 0.2 | Dropout 0.3 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | | ✓ | | | | ✓ | | 80.02 | 88.91 | 81.76 | 89.92 |
| MVM-UNet | | | ✓ | | | ✓ | | 79.96 | 88.87 | 80.97 | 89.47 |
| MVM-UNet | ✓ | | | ✓ | | | | 77.48 | 87.28 | 78.76 | 88.11 |
| MVM-UNet | ✓ | | | | ✓ | | | 79.36 | 88.53 | 81.13 | 89.62 |
| MVM-UNet | ✓ | | | | | ✓ | | 80.94 | 90.15 | 82.49 | 90.50 |
| MVM-UNet | ✓ | | | | | | ✓ | 79.71 | 88.71 | 80.46 | 89.18 |
Таблица 7: Абляционное исследование размера входного изображения и значения выпадения. Сравнение производительности MVM-UNet с использованием различных размеров входных изображений и значений выпадения. Результаты сегментации отражаются с использованием среднего пересечения над объединением (mIoU) и коэффициента сходства кубиков (DSC) в наборах данных ISIC 2017 и ISIC 2018.
Также оценивались различные значения отсевающих учёбы. Среди протестированных конфигураций значение dropout 0,2 обеспечивало наивысшую производительность сегментации в обоих наборах данных и поэтому использовалось в основных экспериментах.
Абляционное исследование конфигурации слоя энкодер-декодера
Были оценены различные конфигурации уровней энкодера и декодера для изучения влияния глубины сети на производительность сегментации и вычислительные затраты (Таблица 8). Среди оцененных конфигураций симметричная архитектура {2, 2, 2}-{2, 2, 2, 2} достигла наивысшей общей производительности сегментации, сохраняя при этом относительно низкую сложность модели. Увеличение глубины сети до {2, 2, 9, 2}-{2, 9, 2, 2} обеспечило сопоставимую производительность сегментации, но увеличило как количество параметров, так и вычислительные затраты.
| Модель | Конфигурация слоя энкодер-декодера | Параметры (M) | FLOPs (G) | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | {2,2,2,1}-{2,2,2,2} | 28.22 | 4.12 | 80.02 | 88.91 | 81.16 | 89.64 |
| MVM-UNet | {2,2,2,2}-{2,2,2,2} | 28.36 | 4.39 | 80.95 | 90.17 | 82.5 | 90.41 |
| MVM-UNet | {2,2,2,3}-{2,3,2,2} | 30.14 | 4.88 | 79.83 | 88.8 | 81.56 | 89.85 |
| MVM-UNet | {2,4,2,2}-{2,2,4,2} | 33.46 | 5.32 | 79.65 | 88.7 | 81.45 | 89.79 |
| MVM-UNet | {2,2,9,2}-{2,9,2,2} | 45.63 | 7.78 | 80.96 | 90.09 | 82.48 | 90.43 |
Таблица 8: Абляционное исследование конфигураций слоёв энкодер-декодера. Сравнение производительности различных конфигураций слоёв энкодер-декодера. Таблица содержит количество параметров модели (параметров), операций с плавающей запятой (FLOPs), среднего пересечения над объединением (mIoU) и коэффициента сходства кубиков (DSC) в наборах данных ISIC 2017 и ISIC 2018.
Сравнение вычислительных затрат
Вычислительная эффективность финальной модели MVM-UNet была сравнивана с репрезентативными базовыми методами, включая HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former и MCAFT, при одинаковой аппаратной среде и разрешении входов (Таблица 9). Оцениваемые метрики включали время обучения за эпоху, время вывода на изображение, пиковое использование памяти GPU во время обучения, количество обучаемых параметров (параметров) и FLOP. Время обучения измерялось как время, необходимое для завершения одного этапа обучения, время вывода — как среднее время обработки на тестовое изображение, а FLOP — для одного прямого прохода.
| Метод | Ref. | Время обучения (эпоха) | Время вывода (ms/image) | Максимальная память GPU (GB) | Параметры (M) | FLOPs (G) |
| HResFormer | 34 | 520 | 213.08 | 19.2 | 117.00 | 131.70 |
| H-vmunet | 28 | 88 | 27.00 | 5.0 | 10.74 | 8.97 |
| MISSormer | 30 | 355 | 92.86 | 12.6 | 42.33 | 109.45 |
| H2Former | 12 | 130 | 29.02 | 8.8 | 33.71 | 33.56 |
| MedScale-Former | 35 | 80 | 23.50 | 5.9 | 4.96 | 3.79 |
| MCAFT | 36 | 145 | 34.00 | 8.7 | 30.00 | 12.00 |
| MVM-UNet (Ours) | — | 104 | 26.80 | 7.9 | 28.36 | 4.39 |
Таблица 9: Сравнение вычислительных затрат методов MVM-UNet и репрезентативных базовых методов.Сравнение вычислительной эффективности в одинаковой аппаратной среде и разрешения входа. К представленным метрикам относятся время обучения за эпоху, время вывода на изображение, пиковое использование памяти графического процессора (GPU) во время обучения, количество параметров модели (параметров) и операции с плавающей запятой (FLOPs). Методы с доступными реализациями оценивались в одной и той же экспериментальной среде, когда это было возможно.
Как изложено в таблице 9, MVM-UNet требовал 104 с на обучающую эпоху, 26,8 мс на изображение для вывода, 7,9 ГБ максимальной памяти GPU, 28,36 миллиона обучаемых параметров и 4,39 GFLOP. По сравнению с HResFormer, MISSFormer, H2Former и MCAFT, MVM-UNet требовал меньшего времени обучения, меньшего времени вывода, меньшего пикового использования памяти GPU и меньшего количества FLOP. По сравнению с легкими моделями H-vmunet и MedScale-Former, MVM-UNet требовал большего времени обучения и использования памяти, но сохранял сопоставимую скорость вывода при относительно низкой вычислительной сложности.
Доступность данных и кода
Наборы данных ISIC 2017 и ISIC 2018 доступны в открытом доступе из архива International Skin Imaging Collaboration (ISIC), а набор данных Synapse доступен в репозитории Synapse. Подробности о получении наборов данных приведены в этическом заявлении. Кратко: набор данных ISIC 2017 был получен из официального хранилища данных ISIC 2017 Challenge (https://challenge.isic-archive.com/data/#2017), набор данных ISIC 2018 — из официального репозитория данных ISIC 2018 Challenge Task 1 (https://challenge.isic-archive.com/data/#2018), а набор данных Synapse — из репозитория Synapse под идентификатором присоединения syn3193805 (https://www.synapse.org/Synapse:syn3193805). Соответствующие даты загрузки указаны в этическом заявлении. Первоначальная публичная версия исходного кода MVM-UNet доступна по адресу https://github.com/LIXUEGUANG002/MVM-UNet. Репозиторий включает реализацию модели, основные сетевые модули, конфигурационные файлы, инструкции по организации наборов данных, обучающие скрипты и скрипты оценки. Полный пакет воспроизводимости, включая финальные конфигурационные файлы, полные скрипты экспериментов, дополнительную документацию и контрольные точки обученной модели, будет предоставлен публично после публикации.
Дополнительная таблица 1. Архитектура многоуровневой Vision Mamba UNet (MVM-UNet ). Таблица суммирует последовательную архитектуру сети MVM-UNet, включая входной уровень, вложение патчей, этапы энкодера, блоки Multi-View Vision (MVV), операции объединения патчей, многоступенчатую Fusion Mamba (MFusion Mamba), этапы декодера, финальное апсэмплинг и сегментационную головку. Для каждого этапа указаны соответствующие операции, основные параметры и размер выходных признаков. E1–E4 обозначают карты признаков ступени энкодера, используемые для многоступенчатого синтеза признаков. B, H и W обозначают размер пакета, высоту изображения и ширину изображения соответственно, а K — количество выходных классов (K = 1 для сегментации бинарных поражений кожи и K = 9 для мультиклассовой сегментации Synapse, включающей один класс фонов и восемь классов органов переднего плана). MFusion Mamba генерирует сплавленные многоступенчатые функции энкодера, которые интегрируются с соответствующими функциями декодера во время реконструкции. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл 1. Псевдокод модуля Multi-View Four-Directional (MV4D) и многоступенчатого термоядерного синтеза Mamba (MFusion Mamba). Дополнительный файл представляет алгоритмический рабочий процесс двух основных модулей, используемых в MVM-UNet. Алгоритм 1 описывает полный процессуальный конвейер модуля Multi-View Four-Directional (MV4D), включая выравнивание признаков, построение четырёх последовательностей пар сканирования (зигзагообразная, иерархическая, спиральная и радиальная), селективную обработку пространства состояний (S6), Scan-view Fusion Mamba (SFusion Mamba) и реконструкцию выходной карты признаков. Алгоритм 2 описывает модуль Multi-stage Fusion Mamba (MFusion Mamba), включая выравнивание элементов многоступенчатого энкодера, грубое термоядерное слияние, тонкий синтез, интеграцию декодеров и генерацию входной функции синтезированного декодера. Переменные и тензорные размерности определяются внутри алгоритмов. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл кодирования 1. Пакет исходного кода для MVM-UNet (MVM-UNet-master). Дополнительный архив ZIP содержит полную реализацию исходного кода MVM-UNet, использованную в этом исследовании. Пакет включает архитектуру сети, модули Multi-View Four-Directional (MV4D) и Multi-stage Fusion Mamba (MFusion Mamba), конфигурационные файлы, обучающие и оценочные скрипты для наборов данных ISIC 2017, ISIC 2018 и Synapse, функции утилиты и документацию проекта, необходимые для воспроизведения экспериментов, описанных в этом протоколе. Пакет также включает файл README с инструкциями по установке, зависимостями программного обеспечения, организацией наборов данных, а также рабочими процессами обучения и вывода. Пожалуйста, нажмите здесь, чтобы скачать этот файл.