$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании использовались общедоступные, полностью анонимизированные дермоскопические наборы данных и не включали прямого участия человека; поэтому одобрение этического комитета не требовалось. Таблица материалов содержит сведения обо всех материалах или инструментах, использованных в этом исследовании. Таблица 1 содержит детали аппаратной и программной среды, такие как тип процессора, память, операционная система и программные фреймворки. Таблица 2 содержит детали точности по классам, отзыва, результата F1 и поддержки каждой категории поражений кожи.
Общий рабочий процесс предлагаемой мультимодальной системы классификации кожных поражений
Общий план этого исследования — создать точную и понятную схему мультиклассификации кожных поражений. Рабочий процесс начинается со сбора и предварительной обработки HAM10000 набора данных, затем переходит к извлечению признаков с использованием архитектур глубокого обучения и включению клинических метаданных. После этого несколько классификаторов машинного обучения обучаются и оптимизируются, а их результаты агрегируются в ансамблевую стратегию. Наконец, прогнозы модели интерпретируются с помощью методов объяснимости, а эффективность модели оценивается для использования в реальной клинической поддержке принятия решений.
Для повышения точности прогнозирования предлагаемой системы используется мультимодальный конвейер машинного обучения, который объединяет как характеристики на основе изображений, так и клинические метаданные (как показано на рисунке 1). Модель может суммировать визуальные результаты дермоскопических изображений с информацией, связанной с пациентом, чтобы выявить более детальные закономерности, связанные с различными кожными поражениями. С таким сочетанием система сможет делать более точные прогнозы, что в конечном итоге сработает. Повысить качество и полезность классификации кожных поражений. С помощью нейронных сетей (EfficientNet-B4, DenseNet201 и MobileNetV2) извлекаются три предварительно обученные сверточные глубинные особенности: они способны захватывать различные дополняющие образы дермоскопических изображений. Эти архитектуры изучают высокие закономерности в том, как выглядят кожные поражения, такие как изменения цвета и текстуры, а также способ их построения. Затем модуль слияния признаков объединяет глубокие особенности с клиническими характеристиками и демографическими данными, создавая богатую мультимодальную функцию. Объединённые данные затем разделяются на обучающую, валидационную и тестовую данные для обеспечения надлежащего тестирования модели. Далее используется модуль слияния признаков для объединения глубоких признаков с клиническими особенностями и демографией для создания богатой мультимодальной функции. Эти данные затем делятся на обучающую, тестовую и валидационную данные для тестирования модели. Для дальнейшего повышения точности прогнозирования используется стратегия ансамбля. Это достигается путем усреднения результатов нескольких моделей и формулирования окончательного прогноза с использованием этих усредненных вероятностей для усиления обобщения и минимизации дисперсии, которая в противном случае возникла бы при использовании отдельных моделей. Кроме того, интегрированы методы объяснимости, такие как методы интерпретации моделей, которые дополнительно объясняют, как модель принимает решения. Метод интерпретации модели обеспечивает интерпретацию на уровне признаков путём количественной оценки вклада входных переменных, тогда как метод интерпретируемости модели выявляет важные области дермоскопических изображений на уровне пикселей, влияющие на прогноз. Методы интерпретации моделей предлагают объяснения на уровне признаков, количественно оценивая вклад каждой входной переменной, в то время как методы интерпретации моделей выделяет важные области на уровне пикселей в дермоскопических изображениях, влияющие на прогноз. В совокупности эти методы делают модели более интерпретируемыми и помогают клиницистам изучить способы принятия решений системой. В результате предлагаемый конвейер предоставляет систему, понятную и заботящуюся о конфиденциальности, повышая прозрачность и доверие, а также обеспечивая более надёжную диагностику рака кожи в реальной медицинской среде.
Описание набора данных с подготовкой
В этой статье основной набор данных для многоклассной классификации кожных поражений используется набор данных HAM10000 (Человек против машины с 10 000 обучающих изображений). Набор данных содержит более 10 000 дермоскопических фигурок, собранных из различных медицинских источников. Клинические источники и популяции, что делает его одним из самых широко используемых эталонных наборов данных в дерматологическом анализе изображений. Каждое изображение в наборе данных сопровождается важными клиническими метаданными, включая идентификаторы изображения, диагностические метки, возраст пациента, пол и анатомическое расположение поражения. Набор данных охватывает семь диагностических категорий: актинические кератозы (akiec), базальноклеточная карцинома (bcc), доброкачественный кератоз (bkl), дерматофиброма (df), меланоцитарные невусы (nv), сосудистые поражения (vasc) и меланома (mel).
Предобработка клинических метаданных
Дополнительные характеристики, добавленные в конвейер классификации, включали клинические метаданные, такие как возраст, пол и местоположение поражения в пациенте. Были отсутствующие или неизвестные значения, которые обрабатывались с помощью детерминированного подхода предварительной обработки. В случае возрастной переменной (числовой) медианный возраст, рассчитанный на обучающем наборе, использовался для присвоения недостающих значений. Выбор медианной импутации заключается в её устойчивости к выбросам и искажённым данным, которые часто встречаются в клинических данных. Для пола и расположения поражения (категориальные переменные) отсутствующие или неопределённые значения не исключались; Их отнесли к специальной категории с пометкой «неизвестно». Метод сохраняет все доступные выборки, и модель свободно определяет, является ли сама отсутствующая предсказательность. Затем к категориальным переменным применялось кодирование one-hot для их совместимости с моделями машинного обучения. Вся предобработка, такая как импутация, кодирование и т.д., выполнялась только на обучающем наборе, а те же преобразования были выполнены в валидационных и экспериментальных наборах для предотвращения потери данных. Выборки не исключались только из-за отсутствия клинических метаданных, что обеспечивало максимальное использование данных и методологическую согласованность.

Рисунок 1: Мультимодальная система классификации кожных поражений. Подход к исследованию сочетает дермоскопические изображения с метаданными пациента для классификации кожных поражений с использованием ансамблевых моделей глубокого обучения. Фреймворк включает предобработку, извлечение признаков, мультимодальное слияние и классификацию, что позволяет повысить диагностическую производительность и интерпретируемость. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Рабочий процесс отражает предложенную классификационную систему на основе дермоскопических изображений и клинических метаданных набора данных по HAM10000 кожным поражениям. EfficientNet-B4, DenseNet201 и MobileNetV2 используются для предварительной обработки и извлечения глубоких признаков из изображений. Клинические метаданные кодированы, а слияние признаков используется для объединения особенностей изображения с клиническими метаданными. Для решения проблемы классового дисбаланса техника балансировки классов используется в пространстве объединённых мультимодальных признаков вместо необработанных изображений или отдельных потоков признаков, где синтетические образцы сохраняют сочетание визуальных и клинических признаков и не создают нереалистичные образцы. Объединённые признаки затем обучаются на классификаторах, таких как XGBoost, LightGBM и глубоком нейронном классификаторе.

Рисунок 2: Примеры дермоскопических изображений из семи различных диагностических групп из HAM10000 набора данных. Изображения показывают типичные визуальные особенности, используемые для автоматизированной классификации. (A) Актинические кератозы (akiec), демонстрирующие шероховатые поверхности с неправильной пигментацией. (B) Базальноклеточная карцинома (БЦК) с неправильной формой и кровеносными сосудами. (C) Доброкачественные поражения, похожие на кератоз (bkl), с кератозными чертами и светло-коричневыми поверхностями. (D) Дерматофиброма (df), с центральной рубцовидной формой и пигментацией. (E) Меланоцитарные невусы (nv), доброкачественные и относительно симметричные родинки. (F) Сосудистые поражения (васк), с красновато-фиолетовым оттенком из-за кровеносных сосудов. (G) Меланома (mel), которая проявляется как неправильная форма, асимметричная и многопигментированная инфекция. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Эти дермоскопические снимки показывают визуальную гетерогенность кожных поражений, которые отличаются в пигментации, текстуре и морфологии структуры. Эти различия представляют серьёзную сложность для автоматизированных систем классификации и подчёркивают значимость систем на основе глубокого обучения. Методы извлечения признаков, чувствительные к выявлению тонких диагностических закономерностей. После описания набора данных на рисунке 2 показаны семь категорий кожных поражений, включённых в HAM10000 набор данных, которые обычно изучаются в дерматологических диагностических исследованиях. К этим классам относятся актиновые кератозы (akiec), базальноклеточная карцинома (bcc), доброкачественный кератоз (bkl), дерматофиброма (df), меланоцитарные невусы (nv), сосудистые поражения (vasc) и меланома (mel)21. Все эти типы поражений обладают уникальными визуальными особенностями, как показано на рисунке 3, включая вариации пигментационных узоров, текстуры поверхности, распределения цвета и аномалии вдоль границ поражения. Визуальные характеристики всех этих поражений различаются и характеризуются вариативностью рисунков пигментации, текстуры поверхности, распределения цвета и аномалиями на границах поражений. Это важные характеристики, которые дерматологи учитывают при проведении клинического обследования, поэтому их необходимо хорошо моделировать с помощью моделей машинного обучения для получения правильной классификации. Хотя это отличительные черты, многие из этих поражений кажутся практически идентичными, что затрудняет их различие при просмотре только дермоскопических изображений. Различие между определёнными типами поражений обычно очень тонкое, но клинически важное, что затрудняет автоматическую классификацию. Именно поэтому крайне важно создавать мощные модели ИИ, способные обучать изучению тонких визуальных изображений и тонких различий в поражениях среди классов поражений. Эти свойства не только улучшаются за счёт правильного описания, что приведёт к улучшению дискриминационных навыков модели при различных типах поражений, но и поможет более раннее диагностировать опасные состояния, такие как меланому. Наконец, он может повысить точность диагностики, помочь клиницистам принимать решения, приводящие к улучшению результатов лечения пациентов, и помогать принимать более обоснованные решения.

Рисунок 3: Распределение кожных поражений по классам в наборе данных HAM10000 . На рисунке показано распределение семи категорий поражений, рассмотренных в этом исследовании: актинические кератозы (akiec), базальноклеточная карцинома (bcc), доброкачественные кератозоподобные поражения (bkl), дерматофиброма (df), меланоцитарные невусы (nv), сосудистые поражения (васк) и меланома (mel). Этот график иллюстрирует дисбаланс классов поражения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Анализ набора данных показывает, что существует дисбаланс между классами различных типов поражений. Самый распространённый тип меланоцитарных невусов (nv), с примерно 6 705 образцами, является самым распространённым типом, за ним следуют меланома (1 113) и доброкачественный кератоз (1 099). Напротив, существуют некоторые клинически значимые поражения, которые встречаются значительно реже, такие как дерматофиброма (115) и сосудистые поражения (142). Эта несопорция представляет угрозу для моделей машинного обучения, поскольку они склонны к предвзятости в пользу классов большинства и не способны обнаруживать необычные, но клинически значимые поражения. Для решения этой проблемы и улучшения обучения модели по производительности модели по всем классам требуется продвинутая предобработка. Нужны стратегии. К ним относятся такие методы, как целенаправленное дополнение данных и балансировка классов. Данные можно сбалансировать с помощью техники (техника балансировки классов и корректировка веса класса), что стимулирует модель выявлять значимые тенденции в недостаточно представленных классах. Гиперпараметры, используемые для XGBoost и LightGBM, в основном были настроены по умолчанию с незначительными корректировками на основе предварительных экспериментов. Для глубокого нейронного классификатора архитектурные и обучающие параметры, такие как количество слоёв, нейронов, скорость обучения, размер пакета и количество эпох, были выбраны эмпирически с использованием валидационных данных. Полный набор гиперпараметров приведён в таблице 3. В целом, количество дермоскопических изображений, использованных в данном исследовании, составляет 10 015. Это даёт преимущество в том, что предоставляет обширный набор данных для обучения и тестирования, а также является утомительным, но полезным критерием. Оценить эффективность предлагаемой системы классификации кожных поражений.
Предварительная обработка данных
Конвейер предварительной обработки готовит HAM10000 набор данных к мультимодальному обучению, стандартизируя изображения, извлекая глубокие признаки, интегрируя клинические метаданные и устраняя дисбаланс классов.
Стандартизация изображений: Все дермоскопические изображения были изменены до 224 × 224 пикселей и нормализованы с помощью нормализации z-score.
(1)
Там, где я представляю исходное изображение, μ обозначает среднее по пикселям, а σ — стандартное отклонение.
Глубокое извлечение признаков: Дополнительные глубокие признаки были извлечены с помощью трёх предварительно обученных сверточных нейронных сетей: Efficient-Net B4, DenseNet201 и MobileNetV2. Каждая сеть отображает нормализованное изображение в вектор признаков.
(2)
Извлечённые признаки объединялись в единое представление:
F Fusion=F EffB4 ||Fплотность ||FMobV2 (3)
(где || означает конкатенацию)
Клиническая интеграция метаданных: Клинические характеристики, включая возраст, пол и локализацию поражения, были очищены, закодированы метками и нормализованы с помощью минимального масштабирования:
(4)
Обработанный вектор метаданныхM клинически был объединён с особенностями изображения для построения конечного мультимодального входа:
Fкомбинированный=F слияниеMклинический (5)
Разделение наборов данных: для сохранения распределения классов применялось стратифицированное разделение
D train,D test=Split(F comibed,0.8) (6)
Обработка классового дисбаланса: В наборе данных HAM10000 наблюдается серьёзный дисбаланс классов, при этом выборки «невус» (NV) преобладают как недопредставленные в других меньшинственных группах, таких как DF с VASC. Для уменьшения этой проблемы была применена «Синтетическая техника перевыборки меньшинств» (техника балансировки классов). Использование: Были получены новые синтетические образцы:
xnew=xi + λ(xzi - xi) (7)

Где xi — выборка класса меньшинства, xzi — один из ближайших соседей, а λ — случайное значение, выбранное из равномерного распределения между 0 и 1. Синтетический образец, как показано на рисунке 4, генерируется вдоль прямого сегмента, соединяющего x sub i.и xent, соединяющий xi иx zi.

Рисунок 4: Распределение классов в HAM10000 наборе данных до/после применения техники балансировки классов. (A) До балансировки классов, с дисбалансом между классами поражения. (B) После балансировки классов в комбинированном пространстве признаков, где представление всех классов равно, чтобы избежать смещения в процессе обучения классификаторов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Для решения проблемы классового дисбаланса в HAM10000 наборе данных применяется техника синтетического меньшинства сверхвыборки (метод балансировки классов). Техника балансировки классов генерирует синтетические выборки для классов меньшинств путём интерполяции между существующими точками данных, что помогает увеличить представленность недостаточно представленных категорий поражений. В результате получения большего количества примеров этих классов меньшинств получается более сбалансированный набор данных по всем семи типам поражений. Такое сбалансированное представление позволит моделям классификации лучше учиться с каждым классом и минимизировать предвзятость по классам большинства. В результате модель более справедлива по классификации и чувствительна, особенно к редким, но клинически значимым кожным поражениям.
Фреймворк обучения, сохраняющий конфиденциальность
Предлагаемая система предлагает мультимодальную систему автоматизированной классификации поражений на коже, которая учитывает конфиденциальность и может быть интерпретируема. Конечная цель системы — повысить диагностические показатели и одновременно защитить чувствительную информацию пациентов на протяжении всего процесса обучения. Конфиденциальность пациентов является необходимой необходимостью в медицинской практике, поскольку законы о конфиденциальности медицинских данных и этические вопросы имеют большое значение в медицинских учреждениях. Таким образом, предлагаемая модель будет включать децентрализованную модель обучения, основанную на идеях федеративного обучения. В этой децентрализованной среде обучение модели проводится на группе распределённых клиентов, а не на агрегировании всех данных пациентов в централизованном месте. Все участвующие клиенты обучают модель локально на своих собственных данных, и исходные данные пациентов не покидают локальную среду. В качестве альтернативы переносу чувствительных медицинских записей обновления модели или параметры отправляются на центральный сервер для агрегирования. Такой кооперативный подход к обучению позволяет различным учреждениям или источникам данных вносить вклад в обучение моделей, не жертвуя конфиденциальностью данных.
Пусть wt(k) — параметры модели k-го клиента на t-й итерате, а nk — размер выборки в этом клиенте. Обновление глобальной модели рассчитывается как:
(8)
Такая стратегия агрегирования гарантирует, что клиенты с большими наборами данных пропорционально больше вносят вклад в глобальную модель, при этом позволяя небольшим клиентам участвовать в процессе обучения. Обеспечивая совместное обучение без обмена исходными данными пациентов, предлагаемая структура сохраняет конфиденциальность и при этом использует распределённые знания между наборами данных.
Федеративная экспериментальная установка
Симулированная федеративная система обучения с набором данных HAM10000 была разработана для подтверждения эффективности предлагаемого фреймворка, ориентированного на конфиденциальность. Данные были разделены на три клиента для моделирования реальной многоинституциональной среды с неидентично распределёнными (не IID) данными. У каждого клиента разный набор классов поражений, что отражает различия в мире в разных клинических центрах. Идентичный мультимодальный конвейер извлечения признаков (EfficientNet-B4, DenseNet201, MobileNet V2 и клинические метаданные) запускался локально на каждом клиенте. В ходе обучения клиенты самостоятельно обновляли локальные модели, а изученные параметры обменивались с центральным сервером только для агрегирования алгоритмом FedAvg. Компромисс между предсказательной точностью и конфиденциальностью сравнивался между федеративной моделью и централизованным подходом обучения для оценки эффективности каждой из них. Результаты тестов, указанные на рисунке 5 , показывают, что федеративная модель может работать конкурентоспособно, при этом точность по сравнению с централизованным обучением лишь незначительно снижается, а также значительно повышается конфиденциальность данных.

Рисунок 5: Распределение HAM10000 по клиентам. Это показывает распределение данных о поражениях кожи среди клиентов, демонстрируя разнообразие в распределении данных. Это демонстрирует гетерогенность данных среди клиентов — ключевой аспект федеративного обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Гетерогенные (не IID) распределения клиентов, сформированные в HAM10000 году, были разделены на три группы для моделирования реальных клинических состояний. Распределение различных категорий поражений внутри каждого клиента отличается, особенно класс невуса (nv), который распределён неравномерно между клиентами. Такое положение свидетельствует о реальных трудностях федеративного обучения, когда данные в учреждениях распределены неравномерно.
Сравнение производительности: централизованное и федеративное обучение
Для оценки эффективности предлагаемой системы федеративного обучения был проведён сравнительный анализ между централизованными и федеративными стратегиями обучения с использованием HAM10000 набора данных, как показано на рисунке 6. В централизованной среде все выборки данных агрегировались в единый обучающий пул. Лучшая централизованная модель — stacked ensemble — достигла общей точности 96%. В отличие от этого, федеративная настройка распределяла набор данных между тремя клиентами с неидентично распределёнными (non-IID) данными, где каждый клиент обучал модель локально и делился только параметрами модели с помощью FedAvg. Федеративная модель достигла общей точности примерно 94%, что соответствует разнице производительности в 2% по сравнению с централизованным подходом, как показано в таблице 4. Это незначительное снижение ожидается из-за децентрализованной оптимизации и гетерогенного распределения данных между клиентами.
Несмотря на это небольшое изменение, федеративная модель всё равно хорошо предсказывала. В централизованном обучении поведение по классам показывает, что большинство классов, таких как неву (nv) (F1-балл = 1.00), остаются стабильными, тогда как меньшинственные классы, такие как дерматофиброма (df) (F1-балл ≈ 0.65–0.66), более чувствительны к дисбалансу распределения, что может еще сильнее повлиять на федеративные результаты. В частности, федеративная структура минимизирует вероятность раскрытия конфиденциальной информации пациентов, поскольку не требует обмена необработавшими медицинскими данными между клиентами.

Рисунок 6: Сравнение федеративного обучения и централизованного обучения. Этот рисунок сравнивает парадигмы обучения с использованием показателей производительности, таких как точность, точность, воспоминание и результат F1. Это демонстрирует способность федеративного обучения достигать эффективности, сопоставимой с традиционным подходом к обучению, при сохранении конфиденциальности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Результаты Таблицы 4 показывают, что федеративная модель обучения способна быть конкурентоспособной, и снижение точности составляет лишь небольшое значение примерно на 2% по сравнению с централизованной. Это небольшое снижение можно объяснить децентрализованной оптимизацией и не-IID распределением данных. Однако федеративная модель обладает огромным преимуществом в плане защиты конфиденциальности, поскольку чувствительная информация о пациентах не передаётся между клиентами. Для справедливого сравнения федеративной модели и централизованной модели стекированного ансамбля федеративная модель была протестирована с той же архитектурой и гиперпараметрами. Аспект сохранения конфиденциальности, обсуждаемый в этом исследовании, является концептуальным и призван подчеркнуть потенциальную интеграцию таких методов, как федеративное обучение, в будущие исследования. В текущей реализации не проводится экспериментальная проверка механизмов, сохраняющих конфиденциальность.
Мультимодальное слияние признаков
Диагностика кожных поражений обычно включает кожное наблюдение и клинический анамнез. Дерматологи в большинстве случаев не просто рассматривают дермоскопические изображения, размещая их относительно информации пациента (возраст, пол и местоположение поражения), чтобы сделать диагностические выводы. Предлагаемая система основана на вдохновении этим клиническим рабочим процессом и включает мультимодальный подход к обучению для объединения изображений и клинических данных. CNN обучаются на уже существующих глубинных деталях дермоскопических изображений. Такие сети распознают сложные визуальные узоры, включая изменения цвета, формы поражений, структурные аномалии и текстурные особенности. Тем не менее, особенности изображений могут быть недостаточны для отражания клинической ситуации поражения. Клинические метаданные, связанные с каждым изображением, таким образом, также включаются в обучение. Будет создан модуль слияния признаков, который интегрирует глубокие изображения с обработанными клиническими характеристиками и демографической информацией. Это составное представление представляет собой интегрированное мультимодальное представление признаков, включающее как визуальную, так и контекстную информацию о каждом поражении. Модель может интегрировать несколько источников данных для получения дополняющих закономерностей, повышающих общую способность к классификации. Мультимодальное представление позволяет системе более эффективно различать визуально схожие поражения, а также учитывать клинические показатели. Модель более клинически значимая и эффективная, так как является более близким аналогом того, как дерматологи изучают поражения в клинической практике.
Стекированное ансамблевое обучение
Предлагаемая структура использует стратегию стекированного ансамблевого обучения для дальнейшего повышения предсказательной способности системы. Ансамблевое обучение — это составный метод прогнозирования, использующий две или более предсказательных моделей для улучшения обобщения и минимизации ошибок прогнозирования, которые могут возникнуть с отдельными моделями. Учащиеся с несколькими базовыми объектами самостоятельно обучаются на мультимодальном представлении признаков, а не на использовании одного классификатора. Все базовые учащиеся дают оценку вероятности того, насколько вероятен выборка определённого класса поражения. Эти вероятностные прогнозы затем агрегируются на мета-уровне. Каждому базовому обучающемуся присваивается вес, чтобы показать его относительную важность для конечного предсказания. Функция активации softmax используется для расчёта агрегированного выхода с целью генерации нормализованных вероятностей класса. Метод stacked ensemble имеет ряд преимуществ. Во-первых, он минимизирует дисперсию предсказания за счёт комбинации различных моделей и тем самым повышает эффективность обобщения. Во-вторых, это усиливает силу, поскольку различные модели описывают различные тенденции в данных. В-третьих, ансамблевое обучение улучшает классификацию классов поражений меньшинств, особенно в медицинских данных, где определённые состояния, представляющие клинический интерес, менее распространены.
Объяснимая интеграция искусственного интеллекта
Медицинские системы ИИ также должны предлагать чёткие объяснения своих решений, хотя высокая точность прогнозирования крайне важна. Чтобы доверять системам ИИ и быть эффективными в их практике, клиницисты должны уметь понимать, как модель соответствует поставленному диагнозу. Для удовлетворения этой потребности предлагаемая структура включает методы объяснимого искусственного интеллекта (XAI), как показано на рисунке 7.

Рисунок 7: Матрицы путаницы различных моделей классификации для многоклассовой классификации кожных поражений. (A) XGBoost, (B) LightGBM, (C) Deep Neural Classifier и (D) Stacked Ensemble model. Каждая матрица путаницы показывает связь между истинным классом (строками) и предсказанным классом (столбцами) для всех семи типов кожных поражений: AKIEC, BCC, BKL, DF, MEL, NV и VASC. Модели XGBoost и LightGBM хорошо работают для классов nv и bkl, хотя между mel и nv есть некоторая путаница. Глубокий нейронный классификатор улучшает классификацию bkl и df и уменьшает путаницу вне диагонали. Модель Stacked Ensemble демонстрирует наибольшую согласованность классификации, при этом диагональ становится всё более доминирующей. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Система включает два популярных подхода объяснимости (метод интерпретируемости модели (SHapley Additive Explanations) и метод интерпретируемости модели (Local Interpretable Model-Aggnostic Explanations)), чтобы дать представление о том, что предсказывает модель. Метод интерпретируемости модели объясняет признаки на уровне признаков, измеряя степень, в которой каждая входная особенность внесла вклад в общее предсказание. Он помогает определить, какие клинические переменные/визуальные качества оказывают наибольшее влияние на результат классификации. Это позволяет исследователям и клиницистам увидеть общее поведение модели по всему набору данных. Метод интерпретируемости моделей, напротив, занимается локальными объяснениями отдельных предсказаний. Он подчёркивает области дермоскопического изображения, которые оказывают наибольшее влияние на решение модели. Эти визуальные объяснения на уровне пикселей позволяют клиницистам визуально осмотреть участки поражения, которые определили классификацию. Предлагаемая структура обеспечивает глобальную и локальную интерпретацию; Это достигается за счёт интеграции техники интерпретируемости моделей. Механизм двойного объяснения повышает прозрачность и позволяет клиницистам оценить, нацелена ли модель на медицински значимые закономерности.
Потенциал клинической поддержки принятия решений
Обучение, сохраняющее конфиденциальность, мультимодальное объединение признаков, ансамблевое моделирование и объяснимый ИИ — ключевые компоненты интегрированной и надёжной системы автоматической классификации кожных поражений. В идеале система должна обладать не только высокой прогностической мощностью, но и прозрачностью и безопасностью, что является двумя ключевыми факторами в медицинских системах, как показано на рисунке 8.

Рисунок 8: Кривые операционной характеристики приёмника (ROC) для модели стекированного ансамбля. (A–C) Здесь показаны кривые ROC для семи типов кожных поражений, с истинным уровнем положительных результатов (чувствительность) и ложноположительным (1-специфичность). Область под кривой (AUC) отражает эффективность модели стекированного ансамбля при различении между классами. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Эта система обеспечивает объяснимые прогнозы и защиту конфиденциальности. В результате это полезная система для других дерматологических диагностических систем. Эта система позволяет медицинским работникам и дерматологам оценивать подозрительность поражения и повышать точность диагностики, а также, как следствие, помогает врачам и дерматологам ставить диагноз на ранних стадиях, когда у них может быть более серьёзное заболевание (например, меланома). По сути, как показано на рисунке 9, эта система направлена на внедрение технологий использования высокотехнологичных систем искусственного интеллекта (ИИ) и реализации реальных приложений, чтобы помочь дерматологам ставить диагнозы более точно и уверенно, обеспечивая при этом конфиденциальность и безопасность пациентов и их комфорт.

Рисунок 9: Результаты объяснимости с использованием методов интерпретации моделей для многоклассной классификации кожных поражений. (A) График SHAP, показывающий вклад признаков, влияющих на предсказания доброкачественных и злокачественных поражений. (B) Объяснение LIME предсказания BCC, иллюстрирующее характеристики, влияющие как положительно, так и отрицательно в результат классификации. (C) Объяснение LIME предсказания AKIEC, выделяющее наиболее влиятельные особенности процесса принятия решений по модели. Эти визуализации интерпретируемости демонстрируют области и извлечённые признаки, которые существенно влияют на прогнозы модели, улучшая прозрачность и понимание процесса классификации при оценке кожных поражений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Стратегия оценки
Чтобы избежать смещения выборки и сохранить исходное распределение классов по всем категориям поражения кожи, набор данных был разделён на разделение 80:20 по схеме «поезд–тест». Обучающее подмножество затем делилось в соотношении 90:10 train: validate, чтобы настроить гиперпараметры и оптимизировать модель. Тестовый набор не использовался в процессе обучения на каком-либо этапе и применялся только в конце процесса обучения в качестве финального теста для предотвращения утечки данных и обеспечения беспристрастной оценки эффективности. Все модели предварительно обрабатывались и обучались в равных условиях, данные разделялись и дополнялись одинаково, а протоколы оценки применялись и применялись одинаково, что позволяло проводить справедливые и воспроизводимые сравнения. Модели были тщательно оценены на основе точности, точности, воспоминания, результата F1 и AUC, с детальным анализом результатов по классам для определения их устойчивости как для основных, так и для меньшинствовых классов поражений. Этот стандартизированный инструмент валидации поможет повысить надёжность, прозрачность и обобщаемость предлагаемого подхода, а также преодолеть возможные несоответствия в отчетности о результатах.