$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Мы тщательно оценили компонент объяснительного ИИ во всей нашей конвейерной системе, оценивая, насколько хорошо он предсказывается по различным типам медицинских данных, включая как структурированные клинические данные, так и медицинские изображения. Результаты показали стабильную прогнозную эффективность по оценённым наборам данных. Среди протестированных моделей модель градиентного бустинга показала наивысшую точность — 97,4%, за ней следует модель случайного леса с 94,2%. Методы глубокого обучения, применяемые к наборам изображений, достигли точности 91,3%, тогда как многослойные перцептронные модели дали немного более низкие результаты — 90,8%. Это говорит о том, что модели машинного обучения на основе ансамбля лучше всего работают на структурированных медицинских данных, тогда как архитектуры глубокого обучения отлично справляются с задачами визуализации. Таблица 6 подробно описывает различные показатели производительности функций прогнозирования, включая точность, точность, воспоминание и F1-балл, а также показатели объяснимости, такие как точность и стабильность. К этим показателям мы пришли с помощью пятикратной перекрёстной валидации и представления результатов в виде средних значений (с 95% доверительными интервалами). Доверительные интервалы не только указывают на неопределённость модели, но и делают сравнения предиктивных показателей более надёжными, учитывая память наборов данных и различия в архитектурах моделей.
| Модель | Точность (%) | Точность | Отзыв | F1-Score | Верность | Стабильность | 95% ДИ |
| Случайный лес | 94.2 | 0.93 | 0.92 | 0.92 | 0.85 | 0.82 | 93.1–95.3 |
| XGBoost | 97.4 | 0.96 | 0.95 | 0.95 | 0.92 | 0.89 | 96.5–98.3 |
| MLP | 90.8 | 0.89 | 0.88 | 0.88 | 0.80 | 0.78 | 89.6–92.0 |
| CNN (Визуализация) | 91.3 | 0.90 | 0.91 | 0.90 | 0.88 | 0.86 | 90.1–92.5 |
Таблица 6: Сравнительная производительность предиктивных моделей и методы объяснимости.
В этой таблице представлена сравнительная оценка моделей машинного и глубокого обучения с использованием предиктивных показателей производительности, включая точность, точность, запоминание, F1-балл и ROC-AUC. Кроме того, показатели объяснимости, такие как достоверность, стабильность, понимаемость и оценки доверия человека, предоставляются для всесторонней оценки как предсказательной эффективности, так и интерпретируемости.
Результаты показывают, что Gradient Boosting показала наивысшую общую прогнозную эффективность (точность 97,4%), опередив Random Forest на 3,2 процентных пункта и модели глубокого обучения более чем на 6 процентных пунктов. Это наблюдение свидетельствует о том, что методы обучения на основе ансамбля были особенно эффективны для структурированных наборов данных здравоохранения, включённых в это исследование. Меньшая разница в производительности между моделями CNN и MLP указывает на то, что само по себе увеличение сложности модели не обязательно приводило к лучшей прогнозной эффективности в оцененных экспериментальных условиях.
Чтобы продемонстрировать полезность предлагаемой структуры для различных задач аналитики здравоохранения, мы представляем результаты прогнозирования эффективности для конкретных наборов данных в Таблице 7.
Анализ, специфичный для набора данных.
Производительность варьировалась между наборами данных из-за различий в сложности признаков, размере выборки, распределении классов и модальности данных. Набор данных по раку молочной железы достиг самой высокой точности прогнозирования, вероятно, благодаря чётко определённой разделяемости признаков. Немного более низкая производительность наборов данных MIMIC-III и NIH по рентгену грудной клетки отражает большую сложность продольных клинических записей и медицинских данных визуализации. Эти результаты показывают, что производительность фреймворка зависит от характеристик набора данных и клинического контекста.
| Набор данных | Точность (%) | Точность (%) | Отзыв (%) | F1-балл (%) |
| Рак молочной железы | 97.4 | 97.2 | 97.6 | 97.1 |
| Диабет | 94.2 | 93.9 | 94.4 | 94 |
| MIMIC-III | 91.3 | 91 | 91.5 | 91.1 |
| Рентген грудной клетки NIH | 90.8 | 90.4 | 91.2 | 90.6 |
Таблица 7: Результаты прогнозной эффективности, специфичные для набора данных.
Прогнозная эффективность предлагаемой объяснимой структуры ИИ на четырёх репрезентативных наборах данных в области здравоохранения. Точность, точность, воспоминание и результат F1 отображаются в процентах (%) на независимых тестовых наборах. Более высокие значения свидетельствуют о лучшей классификации.
Для оценки предиктивной эффективности были оценены четыре модели машинного и глубокого обучения: Gradient Boosting, Random Forest, Convolutional Neneuro Network (CNN) и Multilayer Perceptron (MLP), на четырёх репрезентативных наборах данных здравоохранения. Производительность модели оценивалась с использованием точности, точности, воспоминания, показателей F1 и показателей ROC-AUC на независимых наборах тестовых данных после разделения проверки и проверки 70:15:15 и пятикратной перекрёстной валидации. Улучшения предиктивной эффективности были определены путём сравнения специфических для модели метрик оценки при идентичных условиях предварительной обработки и валидации.
Чтобы прояснить, чем производительность моделей различается в различных методах, на рисунке 4 показаны преимущества и недостатки моделей ансамбля, нейронных сетей и глубокого обучения.

Рисунок 4: Сравнительная производительность моделей машинного обучения и глубокого обучения на задачах прогнозирования здравоохранения. (A) Сравнение точности моделей градиентного усиления, Random Forest, CNN и MLP на тестовом наборе данных. (B) сравнение моделей Gradient Boosting, Random Forest, CNN и MLP по результатам F1 на тестовом наборе данных. (C) Точное сравнение моделей Gradient Boosting, Random Forest, CNN и MLP на тестовом наборе данных. (D) Сравнение моделей Gradient Boosting, Random Forest, CNN и MLP на тестовом наборе данных. Более высокие значения указывают на лучшую прогнозировку. Gradient Boosting показала наивысшую общую производительность по всем показателям оценки, за ней следует Random Forest. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Интерпретация производительности объяснимости.
SHAP стабильно достигал самых высоких показателей точности и стабильности среди оцениваемых методов объяснимости, что свидетельствует о более сильном согласовании между сгенерированными объяснениями и прогнозами базовой модели. LIME показал сравнительно низкую стабильность, что свидетельствует о большей чувствительности к локальным возмущениям и вариативности выборки. Grad-CAM предоставлял визуально интерпретируемые объяснения моделей на основе изображений, но обеспечивал немного более низкие значения точности, чем SHAP. Эти результаты показывают, что качество объяснения зависит как от выбранной техники объяснения, так и от архитектуры предиктивной модели.
Методы объяснимости, интегрированные в конвейер, оценивались с точки зрения их количественной и качественной характеристики. В частности, методы атрибуции признаков успешно выявили внутреннюю логику модели довольно последовательно в различных наборах данных.
Все методы, рассмотренные в исследовании, SHAP, достигли наивысшей точности (0,92) и стабильности (0,89) среди изученных методов объяснимости. Проще говоря, объяснения были очень точными представлениями того, что на самом деле предсказывала модель. Методы локального объяснения — это своего рода окно, через которое мы можем увидеть конкретное предсказание и понять, что модель использовала в качестве основы для принятия решения.
Результаты интерпретируемости оценивались с использованием точности, стабильности, понимаемости и доверия клинициста, полученных на основе оценки, ориентированной на человека. Объяснения SHAP, LIME и Grad-CAM сравнивались с использованием идентичных наборов данных и обученных моделей. Улучшения объяснимости оценивались путём сравнения показателей качества объяснения и оценок клинициста в рассматриваемых методах объяснительной способности. Методы визуализации для моделей глубокого обучения, работающих с изображениями, по сути создают тепловые карты, которые определяют области изображений, наиболее значимые для прогноза модели. Распределения важности признаков и сравнения производительности объяснимости по разным методам показаны на рисунке 5.

Рисунок 5: Оценка эффективности по объяснимости.На рисунке показана эффективность методов объяснимости с помощью метрик точности и стабильности. SHAP лидирует по точности (0,92) и стабильности (0,89), что отражает хорошее согласование между объяснениями и прогнозами модели. LIME является лучшим инструментом для интерпретации отдельных примеров. С другой стороны, Grad-CAM выводит визуальные тепловые карты, в основном используемые в моделях визуализации, показывая крупно наиболее важные области, отвечающие за предсказание модели, что с клинической точки зрения может быть весьма актуальным. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
После оценки предиктивных моделей и методов интерпретируемости было выявлено, что корреляция между точностью модели и надёжностью её объяснений очень сильна. Фактически, те же модели, показывавшие улучшения предсказания, объясняли свои результаты с большей стабильностью и последовательностью, когда методы интерпретируемости применялись правильно. Ансамблевые модели оказались наиболее интерпретируемыми при сочетании с методами атрибуции признаков, тогда как модели глубокого обучения лучше подходили с помощью методов визуализации, объясняемых методов. Связь, связывающая точность предсказания и надёжность объяснений, видна на рисунке 6, где подробно описана концептуальная динамика между моделью и объяснимостью.

Рисунок 6: Сравнительный анализ моделей и методы объяснения способностей.Диаграмма показывает подробное сравнение точности и объяснения показателей способностей различных моделей. Он состоит из графика рассеяния, показывающего корреляцию между точностью и стабильностью объяснения, табличного сравнения результатов и матрицы пригодности, описывающей различные методы объяснения способностей SHAP, LIME и Grad-CAM, а также их эффективность с разными типами моделей. Визуальное оформление ясно показывает, что ансамблевые модели вместе с SHAP обеспечивают отличную интерпретируемость, тогда как модели глубокого обучения объясняются с помощью визуализационных методов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Оценка, ориентированная на человека, подтвердила реальную полезность предлагаемой системы в больницах и других клинических учреждениях. Медицинские специалисты изучали результаты моделей с объяснениями и без них. Показание результатов с объяснениями привело к значительному росту доверия пользователей и интерпретируемости; средняя стоимость доверия выросла с 3,1 до 4,7 по шкале от 1 до 5. Повышение рейтинга доверия с 3,1 до 4,7 представляет собой приблизительное относительное улучшение на 51,6%. Существенное согласование между оценщиками (κ Флайса = 0,81) дополнительно указывает на последовательную оценку полезности объяснения со стороны клинициста. Эти результаты свидетельствуют о том, что результаты объяснимости могут повысить уверенность пользователей и облегчить интерпретацию клинических решений с помощью ИИ. Специалисты отметили лучшее понимание результатов моделей и большее доверие к суждению клинических ситуаций с помощью ИИ, что указывает на важность интерпретируемости в реальной реализации медицинской помощи.
Мы дополнительно проверили надёжность нашей системы с помощью абляционного анализа. Удаление критически важных признаков, которые с помощью методов объяснимости считались необходимыми, приводило к значительной потере производительности прогнозирования. Таким образом, результат показывает, что признаки были не только релевантными, но и значимыми для прогностической задачи. Кроме того, результаты объяснения показывали лишь незначительные различия при объяснении различных входных выборок, что демонстрировало стабильность и надёжность методов объяснимости.
Для проверки целесообразности конвейера для практического применения мы измерили его вычислительную скорость. Внедрение методов объяснимости привело к некоторому увеличению времени вычисления, особенно при атрибуции признаков и создании визуализаций. Тем не менее, общее время исполнения оставалось возможным и не слишком долгим. Рисунок 7 показывает, как вычислительное время распределяется между различными этапами конвейера, такими как предобработка, обучение модели, генерация объяснимости, оценка и визуализация.

Рисунок 7: Разбивка времени выполнения конвейера. Эта диаграмма показывает, как вычислительное время распределяется между различными этапами объяснимого ИИ-конвейера, такими как предобработка, обучение моделей, создание объяснения способностей, оценка и визуализация. Данные показывают, что большая часть временной линии занимается обучением моделей, после чего следует обработка объяснения способностей. С другой стороны, времени на предобработку и отчётность довольно минимальны. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Мы также проверили прочность предлагаемой структуры с помощью абляционного анализа. Исключение ключевых характеристик, выявленных методами объяснимости, показало явное снижение предсказательной эффективности, что является явным признаком того, что эти характеристики не только актуальны, но и весьма важны. Кроме того, выходы объяснения были довольно стабильны даже при небольшом изменении входных выборок, что подтверждает согласованность и надёжность методов объяснимости.
Короче говоря, объединяя измерение предсказательной эффективности, объяснимости и ориентированной на человека валидацию, было показано, что предлагаемая структура эффективна. Система не только делала очень точные прогнозы, но и оставалась очень интерпретируемой и простой в использовании. Внедрение методов объяснимости сделало весь процесс прозрачным, не снижая производительность модели. Улучшения, которые мы увидели в точности прогнозирования и интерпретируемости, были достигнуты не только под строгим экспериментальным контролем, но и статистически значимыми, что свидетельствует о выносливости и достоверности предлагаемого способа. Парные сравнения предиктивных моделей проводились с использованием парных t-тестов на перекрёстных валидационных сгибах. Статистически значимые различия были обнаружены между моделями градиентного бустинга и конкурирующими моделями (p < 0,05), что подтверждает превосходство предлагаемой конфигурации.
Общие выводы.
В совокупности результаты показывают, что предсказательная эффективность, качество объяснения и доверие клиницисты могут оцениваться в рамках единого и воспроизводимого рабочего процесса. Фреймворк поддерживал единую производительность на различных наборах данных в здравоохранении, одновременно поддерживая прозрачную интерпретацию через объяснения SHAP, LIME и Grad-CAM. Однако результаты следует интерпретировать в контексте выбранных наборов данных и настроек валидации, а перед внедрением в реальном мире необходима дополнительная внешняя валидация.
ДОСТУПНОСТЬ ДАННЫХ:
Мы получили наборы данных, используемые в текущих исследованиях, из публичных источников, которые можно найти в известных хранилищах данных. Например, данные, касающиеся рака груди и диабета, доступны для скачивания из Репозитория машинного обучения UCI по адресу: https://archive.ics.uci.edu/ml/index.php
Электронный набор данных медицинских записей (MIMIC-III) можно получить через Physio Net по адресу:
https://physionet.org/content/mimiciii/1.4/
Данные рентгеновской визуализации грудной клетки были взяты из набора данных NIH Chest X-ray и доступны по адресу: https://www.kaggle.com/datasets/nih-chest-xrays/data
Все набора данных, которые мы изучали в этом исследовании, анонимизированы и становятся публично доступными. Этапы предварительной обработки, обученная модель и результаты объяснения, полученные в ходе исследования, доступны соответствующему автору, если будет сделан разумный запрос. Исходный код, скрипты предварительной обработки, конфигурационные файлы и ресурсы воспроизводимости будут размещены в публичном репозитории после принятия рукописи.