Оценка эффективности разработанной структуры классификации основана на традиционных показателях оценки, вытекающих из матрицы ошибок. Матрица ошибок позволяет получить полное представление о работе классификатора путем представления количества правильных и неправильных классификаций для каждого определенного класса. Таким образом можно проанализировать все типы ошибок. Например, ложноположительные и ложноотрицательные результаты особенно важны при диагностике заболеваний. Высокие значения ложноположительных результатов могут свидетельствовать о высокой чувствительности классификатора, но в то же время большое количество ложноотрицательных результатов указывает на его низкую чувствительность и создает потенциальные риски для здоровья. В данной работе используются следующие метрики эффективности: точность (accuracy), прецизионность (precision), полнота (recall), F1-мера (F1-score), специфичность (specificity), доля истинно положительных результатов (TPR) и доля ложноположительных результатов (FPR). Формулы этих метрик приведены ниже:
Точность=(TP+TN)/(TP+TN+FP+FN) (3)
Точность (Precision) = TP/(TP+FP) (4)
(5)
(6)
(7)
(8)
В данном случае TP показывает количество злокачественных раков кожи, обнаруженных системой, в то время как TN указывает количество доброкачественных образований. В свою очередь, FP демонстрирует число ошибочных решений, когда образования классифицируются как злокачественные, хотя на самом деле они являются доброкачественными. FN отражает количество ошибочно распознанных доброкачественных образцов. Применительно к классификации рака кожи минимизация ложноотрицательных результатов крайне важна из-за потенциальных неблагоприятных последствий, которые могут возникнуть в результате таких ошибок.
Результаты базовых моделей
Все вычислительные эксперименты проводились в облачной среде Google Colab. Стоит отметить, что эта платформа позволяет запускать экземпляры виртуальных машин с предустановленной операционной системой Ubuntu 20.04. Для обучения базовых моделей использовались Python версии 3.9 и фреймворк PyTorch версии 2.3.1. Кроме того, все вычислительные узлы имели идентичные характеристики, а именно: процессор Intel Xeon с частотой 2.2 GHz, графический процессор NVIDIA Tesla T4, 16 GB оперативной памяти и объем хранилища 70 GB. Таким образом, такие условия эксперимента позволили снизить вариативность, обусловленную использованием различных аппаратных платформ, и повысить надежность и воспроизводимость результатов. Полное описание экспериментальной среды приведено в Таблице 3.
Рисунок 4 демонстрирует кривые обучения, соответствующие 100 эпохам обучения для архитектуры ResNet-50. Обучение проводилось на наборе данных, содержащем 2 110 изображений, при этом размер валидационного набора данных составлял 660 изображений. Как видно, в процессе обучения точность постоянно росла, достигнув почти 90.0%. При этом повышение точности наблюдалось в течение первых 50 эпох; после этого показателя точность стала почти постоянной, что можно рассматривать как признак сходимости модели. При валидации модель продемонстрировала значение AUC, равное 86.0%, что свидетельствует о приемлемых дискриминационных свойствах.
Матрица ошибок, представленная на рисунке 5, характеризует эффективность модели ResNet-50 с точки зрения точности классификации на тестовом наборе из 660 изображений. При оценке модель правильно распознала 310 из 360 доброкачественных образцов и 239 из 300 злокачественных образцов. Однако относительно большое количество злокачественных образцов было классифицировано неверно, что привело к сравнительно высокому значению ложноотрицательных результатов. Этот результат следует рассмотреть более детально в связи с серьезными последствиями ошибок такого типа при практическом использовании классификатора. В целом точность модели составила 83.0%, при этом прецизионность (precision) составила 83.3%, полнота (recall) — 83.3%, а F1-мера — 83.3%.
Таблица 4 содержит подробное описание рабочих характеристик модели ResNet-50 для обоих классов. Классификатор продемонстрировал относительно сбалансированные показатели точности (precision): для доброкачественных образцов это значение составило 83.0%, в то время как для злокачественных образцов точность составила 84.0%. Аналогично, показатели полноты (recall) достигли 88.0% для доброкачественных новообразований и 78.0% для злокачественных. Столбец «Support» в таблице представляет количество образцов, соответствующих каждому классу.
Предлагаемая модель EDLF-SLC
На рисунке 6 показаны значения AUC при обучении и валидации предлагаемой модели на протяжении 300 эпох. Метрика AUC отражает способность модели различать доброкачественные и злокачественные классы, при этом более высокие значения указывают на лучшую дискриминационную способность. Как видно из графика, AUC обучения стабильно растет в течение всего процесса обучения, достигая максимального значения 1.00 примерно к 200-й эпохе. AUC валидации также постепенно улучшается на начальных этапах обучения, однако после примерно 150 эпох начинается выход на плато, что свидетельствует о сходимости модели. Итоговое значение AUC валидации, равное 0.95, демонстрирует высокую обобщающую способность и эффективную разделимость классов.
Матрица ошибок предлагаемой модели, представленная на Рисунке 7, показывает, что модель правильно классифицировала 299 доброкачественных образцов и 272 злокачественных образца, при этом 28 доброкачественных случаев были ошибочно классифицированы как злокачественные, а 61 злокачественный случай — как доброкачественный. В общей сложности модель обеспечила 571 правильное предсказание и 89 ошибочных классификаций. Примечательно, что большее количество ложноотрицательных результатов (злокачественные случаи, ошибочно классифицированные как доброкачественные) указывает на критическое ограничение, поскольку такие ошибки могут иметь значительные клинические последствия. Тем не менее, общая эффективность классификации остается высокой. В отличие от подходов по отбору признаков, в которых измерения намеренно удаляются перед классификацией, предлагаемая структура сохраняет полное объединенное глубокое представление, созданное несколькими гетерогенными архитектурами CNN. Такой подход был принят потому, что каждая базовая сеть извлекает взаимодополняющие характеристики поражения, и сохранение полного представления позволяет классификатору SVM использовать комбинированную дискриминативную информацию без исключения потенциально информативных признаков. Следовательно, принятая стратегия объединения признаков отдает приоритет изучению взаимодополняющих представлений при сохранении вычислительной осуществимости.
Рисунок 8 представляет репрезентативные примеры результатов классификации, полученных с помощью предложенной модели. Результаты демонстрируют, что модель присваивает высокие показатели достоверности правильно классифицированным случаям. В частности, для доброкачественных случаев наблюдаются высокие прогнозируемые вероятности (например, 99.84% и 99.85%), в то время как для злокачественных случаев также отмечаются высокие уровни достоверности (например, 99.98% и 99.96%). Эти данные указывают на то, что модель может эффективно дифференцировать доброкачественные и злокачественные образования даже в визуально сложных сценариях. Для повышения интерпретируемости используется фреймворк LIME для генерации локальных объяснений прогнозов модели, как показано на Рисунке 9A–D. LIME аппроксимирует сложную границу принятия решений модели с помощью локально интерпретируемой линейной модели. Для каждого входного изображения метод генерирует возмущенные образцы путем выборочного маскирования суперпикселей и оценки соответствующих прогнозов. Затем к этим образцам подбирается взвешенная линейная модель, где веса определяются на основе близости к исходным входным данным с использованием ядра радиально-базисной функции. Полученные коэффициенты представляют вклад каждого суперпикселя в итоговый прогноз и определяются следующим образом:
(9)
где Xj ∈ {0, 1} обозначает наличие или отсутствие j-го суперпикселя, Bj представляет собой соответствующий вес вклада, а B0 является базовым прогнозом. Положительные коэффициенты (Bj > 0) указывают на области, способствующие отнесению к злокачественному классу, тогда как отрицательные коэффициенты (Bj < 0) соответствуют признакам доброкачественности. Визуализации на основе LIME, представленные на рисунке 9B, D, выделяют наиболее влиятельные области, определяющие каждое решение по классификации. Для доброкачественных образований модель делает акцент на областях, характеризующихся однородной пигментацией и четкими границами. Напротив, в злокачественных случаях выделенные области соответствуют клинически значимым признакам, таким как неровные края, неоднородность цвета и атипичная текстура. Интенсивность выделенных областей отражает величину соответствующих коэффициентов Bj.
Эти результаты демонстрируют, что модель EDLF-SLC фокусируется на клинически значимых признаках, которые согласуются с установленными дерматологическими критериями, такими как правило ABCD. Такое соответствие повышает интерпретируемость и надежность модели, делая её более подходящей для поддержки принятия клинических решений. Кроме того, на Рисунке 10 представлены результаты сравнительной визуализации, полученные с использованием дополнительных методов объяснимости, включая Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM и EigenCAM, что дополнительно подтверждает согласованность выявленных значимых областей при использовании различных методов. Сравнение эффективности предлагаемой модели EDLF-SLC и семи базовых моделей после обучения в течение 100 эпох приведено в Таблице 5. Модель EDLF-SLC показала конкурентоспособный результат 0,88 по каждому из оцениваемых показателей по сравнению с базовыми архитектурами, протестированными в данном экспериментальном контексте. Модели EfficientNetB0 и ResNet50 также показали хорошие результаты с точностью 0,85 и 0,83 соответственно. Напротив, Inception-ResNetV2 продемонстрировала наихудшие показатели классификации среди оцениваемых моделей. С другой стороны, несмотря на относительно более низкую точность классификации, её вычислительная эффективность оставалась сопоставимой с базовыми моделями. Предложенная модель EDLF-SLC продемонстрировала конкурентоспособную эффективность по сравнению с оцениваемыми базовыми моделями в принятых экспериментальных условиях.
Для оценки эффективности предлагаемого подхода по сравнению с существующими методами в Таблице 6 представлено сравнение с репрезентативными современными методами классификации поражений кожи. Например, в работе47 была отмечена точность 0,86, в то время как в48 использовалась модель на основе ансамбля, которая достигла аналогичной точности, но продемонстрировала более низкие показатели прецизионности, полноты и F1-меры. В недавних исследованиях, основанных на ансамблевом обучении и нескольких архитектурах CNN25,49, сообщалось о точности до 0,87. В принятых экспериментальных условиях предлагаемая архитектура EDLF-SLC достигла точности 0,88, используя единую объяснимую архитектуру без необходимости в дополнительных компонентах, таких как модели сегментации поражений.
ДОСТУПНОСТЬ ДАННЫХ
Данные, подтверждающие результаты этого исследования, находятся в открытом доступе на Kaggle по адресу https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Рисунок 1: Репрезентативные дерматоскопические изображения из набора данных ISIC, иллюстрирующие два диагностических класса, использованных в данном исследовании. Образцы помечены как доброкачественные (0) и злокачественные (1), что подчеркивает вариабельность морфологии, цвета и текстуры поражений в наборе данных. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в более крупном размере.

Рисунок 2: Полный рабочий процесс предлагаемой структуры EDLF-SLC. Протокол начинается со сбора изображений из базы данных ISIC 2020, за которым следуют предобработка, аугментация данных, разделение набора данных, извлечение глубоких признаков с использованием четырех предобученных архитектур CNN, объединение признаков, классификация SVM, оценка эффективности и генерация объяснений на основе LIME. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в более крупном размере.

Рисунок 3: Примеры дополненных изображений кожных поражений, созданных с помощью методов аугментации данных. Сюда входят горизонтальное и вертикальное отражение, поворот, масштабирование и регулировка яркости. Эти преобразования увеличивают разнообразие набора данных, повышают устойчивость модели и снижают риск переобучения в процессе обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Значение площади под ROC-кривой (ROC-AUC) при обучении и валидации модели ResNet-50 на протяжении 100 эпох обучения. Синяя кривая представляет AUC обучения, в то время как оранжевая кривая представляет AUC валидации. Кривые демонстрируют быструю сходимость в течение начальных эпох обучения с последующей стабильной оптимизацией при неизменно высоких показателях валидации, что указывает на эффективное обучение и удовлетворительную обобщающую способность на валидационном наборе данных. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 5: Матрица ошибок модели ResNet-50 на тестовом наборе данных. Строки представляют истинные метки классов (0 = доброкачественные, 1 = злокачественные), в то время как столбцы представляют предсказанные метки классов. Диагональные элементы указывают на правильно классифицированные образцы (310 доброкачественных и 239 злокачественных), а внедиагональные элементы представляют ошибочно классифицированные образцы, включая 50 ложноположительных и 61 ложноотрицательных результатов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Площадь под ROC-кривой (ROC-AUC) при обучении и валидации предлагаемой модели EDLF-SLC на протяжении 300 эпох обучения. Синяя кривая представляет AUC обучения, в то время как оранжевая кривая представляет AUC валидации. Модель демонстрирует быструю сходимость в течение начальных эпох обучения с последующей стабильной оптимизацией и неизменно высокими значениями AUC обучения и валидации на протяжении всех оставшихся эпох. Стабильные показатели валидации свидетельствуют о хорошей обобщающей способности и устойчивом процессе обучения предлагаемой структуры EDLF-SLC на валидационном наборе данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Матрица ошибок предлагаемой модели EDLF-SLC на тестовом наборе данных. Строки представляют истинные метки классов (0 = доброкачественные, 1 = злокачественные), тогда как столбцы представляют прогнозируемые метки классов. Диагональные элементы указывают на правильно классифицированные образцы (299 доброкачественных и 272 злокачественных), в то время как внедиагональные элементы соответствуют ошибочно классифицированным образцам, включая 61 ложноположительный и 28 ложноотрицательный результаты. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8: Примеры прогнозов, сгенерированных предложенной моделью EDLF-SLC. На данном рисунке показаны уровни достоверности классификации доброкачественных и злокачественных поражений, что демонстрирует дискриминационную способность модели. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 9: Локальные объяснения на основе LIME для предлагаемой модели EDLF-SLC. На рисунке выделены наиболее влиятельные области суперпикселей, которые определили решения модели по классификации. (A) Исходное дерматоскопическое изображение доброкачественного поражения кожи. (B) Объяснение LIME для доброкачественного поражения, где выделенные суперпиксели указывают на области, внесшие наибольший вклад в прогноз о доброкачественности. (C) Исходное дерматоскопическое изображение злокачественного поражения кожи. (D) Объяснение LIME для злокачественного поражения, демонстрирующее дискриминантные области суперпикселей, которые преимущественно повлияли на классификацию как злокачественного. Желтые границы очерчивают влиятельные суперпиксели, определенные LIME, в то время как серые области представляют зоны с минимальным вкладом в прогноз. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 10: Сравнение методов интерпретируемости на основе карт активации классов (CAM), примененных к предложенной модели EDLF-SLC. На рисунке сравниваются карты локализации, созданные GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM и EigenCAM для одного и того же дерматоскопического изображения. На первой панели показано исходное входное изображение, за которым следуют соответствующие необработанные карты активации и наложенные тепловые карты, полученные с помощью каждого метода интерпретируемости. Визуализации демонстрируют различия в пространственной локализации и выделяют области изображения, которые вносят наибольший вклад в решение о классификации в рамках предложенной структуры EDLF-SLC. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
| Лист. | Год | Набор данных | Объем данных | Извлечение признаков | Метод | Точность |
| 9 | 2022 | Набор данных HAM10000 | 10015 изображений поражений кожи | Признаки цвета и формы | Алгоритмы ML и модели сверточных нейронных сетей (CNN) | 95.1% |
| 19 | 2023 | Набор данных PH2 | 200 аннотированных изображений | Признаки асимметрии, полос, точек/глобул, зон регрессии | Модели ML | 94.0% |
| 30 | 2024 | Набор данных HAM10000 | 10000 изображений | Признаки цвета и формы | S-MobileNet | 97.7% |
| 28 | 2025 | Наборы данных ISIC2020 и HAM10000 | ISIC2020 (12,670 изображений) и HAM10000 (10,015 изображений) | Цвет и форма | Резидуальная сеть — долгая краткосрочная память (R-LSTM50) | 95.7% (ISIC2020); 94.2% (HAM10000) |
| 32 | 2026 | Набор данных поражений кожи при оспе обезьян (MSLD) | 770 изображений | Контекст и текстура | DenseNet121, Xception, InceptionV3 и CBAM | 88% (DenseNet121) |
| 39 | 2025 | HAM10000 | 38,569 изображений | Контекст и текстура | MobileNet, ResNet50, InceptionV3 и EfficientNet | 93.6% (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2357 изображений | Контекстные и пространственные признаки | Мультимодальное глубокое обучение (DL) на основе CNN-трансформеров | 98.71% |
| 41 | 2026 | ISIC 2019 | 25,000 изображений | Контекст и текстура | TransXV2S | 95.26% |
| 42 | 2025 | HAM10000 | 10,015 изображений | Цвет и форма | ViT с YOLOv8 | 93% |
Таблица 1: Сравнение с литературой. Обзор некоторых недавно опубликованных работ, в которых используются алгоритмы глубокого обучения для классификации поражений кожи.
| Набор данных | Доброкачественный | Злокачественный | Общее количество |
| Обучающие данные | 1440 | 1197 | 2637 |
| Тестовые данные | 360 | 300 | 660 |
| Общий объем данных | 1800 | 1497 | 3297 |
Таблица 2: Распределение набора данных. Распределение доброкачественных и злокачественных образцов в наборе данных ISIC 2020, включая обучающую и тестовую выборки.
| Компонент | Спецификация |
| Операционная система | Ubuntu 20.04 |
| Язык программирования | Python 3.9 |
| Фреймворк глубокого обучения | PyTorch 2.3.1 |
| Оптимизатор | Адам |
| Планирование скорости обучения | 1e−3 |
| Количество эпох | 100/300 |
| ЦПУ | 2 vCPU 2,2 ГГц |
| ГП (графический процессор) | Tesla T4 (16 ГБ) × 1 |
| ОЗУ | 16 ГБ |
| Обучаемые параметры | 2 430 353 (9,27 МБ) |
| Необучаемые параметры | 133 434 397 (509,01 МБ) |
Таблица 3: Характеристики системы. Подробные спецификации вычислительной среды, включая программные платформы и аппаратные ресурсы, использованные для обучения и оценки модели.
| Класс | Точность (Precision) | Полнота (Recall) | F1-мера | Поддержка (Support) |
| Доброкачественный класс | 0.83 | 0.88 | 0.85 | 360 |
| Злокачественный класс | 0.84 | 0.78 | 0.81 | 300 |
| Общая точность (Accuracy) | - | - | 0.832 | 660 |
| Макросреднее | 0.84 | 0.83 | 0.83 | 660 |
| Взвешенное среднее | 0.84 | 0.83 | 0.83 | 660 |
Таблица 4: Отчет о классификации. Показатели эффективности классификации модели ResNet-50 на тестовом наборе данных, включая точность (precision), полноту (recall), F1-меру (F1-score) и количество объектов (support) для каждого класса.
| Модель | Точность | Точность | Полнота (Recall) | F1-мера | Время (с) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
Таблица 5: Сравнение производительности моделей. Сравнительная производительность предлагаемой модели EDLF-SLC и базовых моделей глубокого обучения по показателям точности (accuracy), прецизионности (precision), полноты (recall), F1-меры (F1-score) и времени вычислений.
| Модель | Точность | Точность | Полнота | F-мера (F1-score) |
| ResNet-18 [25] | 0.85 | 0.85 | 0.85 | 0.85 |
| ResNet-50 с SVM [50] | 0.87 | 0.88 | 0.98 | 0.93 |
| Гибридные модели глубокого обучения + SVM [48] | 0.86 | 0.84 | 0.8 | 0.84 |
| Гибридные модели глубокого обучения + SVM [49] | 0.86 | 0.8 | 0.6 | 0.68 |
| Предлагаемый EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 |
Таблица 6: Метрики сравнения моделей. Сравнение эффективности предлагаемого фреймворка EDLF-SLC и современных передовых подходов к классификации новообразований кожи.
Дополнительный файл 1: Алгоритм 1. Рабочий процесс предлагаемого фреймворка EDLF-SLC, описывающий предварительную обработку данных, извлечение глубоких признаков с использованием нескольких архитектур CNN, классификацию на основе SVM и интерпретируемость на базе LIME для прогнозирования поражений кожи. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительный файл 2: Алгоритм 2. Рабочий процесс локального объяснения на основе LIME, иллюстрирующий генерацию суперпикселей, выборку пертурбаций, построение суррогатной модели и визуализацию областей изображения, которые в наибольшей степени повлияли на решение по классификации. Пожалуйста, нажмите здесь, чтобы скачать этот файл.