Исследовательская статья

Воспроизводимый протокол для разработки и оценки объяснимых фреймворков искусственного интеллекта в аналитике здравоохранения

DOI:

10.3791/71999

31 июля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь мы представляем воспроизводимый протокол для разработки и оценки объяснимых моделей искусственного интеллекта для аналитики здравоохранения. Рабочий процесс интегрирует предварительную обработку данных, предиктивное моделирование, объяснимость на основе SHAP, LIME и Grad-CAM, количественную оценку и ориентированную на человека валидацию для поддержки прозрачного и надёжного клинического принятия решений.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Объяснимый искусственный интеллект (XAI) всё больше признаётся незаменимым инструментом для создания надёжных систем ИИ в здравоохранении, где прозрачность и способность объяснять решения являются важными компонентами клинического принятия решений. В данной публикации представлен воспроизводимый экспериментальный подход к разработке и оценке объяснимых систем ИИ для аналитики в здравоохранении. Разработанный конвейер объединяет этапы предварительной обработки данных, предиктивного моделирования, генерации интерпретации и оценки в единый бесшовный рабочий процесс, который может применяться как к структурированным клиническим данным, так и к наборам данных медицинской визуализации. Модели ансамблевого машинного обучения показали высокую предиктивную эффективность на структурированных табличных наборах данных, тогда как модели глубокого обучения эффективны для изучения сложных закономерностей в медицинских данных визуализации. Такие методы, как SHAP, LIME и Grad-CAM, являются глобальными и локальными объяснениями, способствующими интерпретации моделей. Очень полезно. Количественная оценка фреймворка охватывает множество различных метрик, таких как точность, точность, запоминание, балл F1, ROC-AUC, показатели объяснения, точность и стабильность. Результаты показывают, что при контроле экспериментальных условий структура демонстрировала улучшение предсказательной эффективности и качества объяснения в оцененных экспериментальных условиях. Как документ, управляемый протоколом, эта работа подтверждает воспроизводимость и масштабируемость, а также постоянную реализацию другими живыми существами. Эта прозрачная, понятная модель искусственного интеллекта является основой, на которой клиническая поддержка принятия решений и системы аналитической аналитики в здравоохранении завоевывают доверие и использование в широком масштабе.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Искусственный интеллект (ИИ) стал важной частью современного здравоохранения, поддерживая диагностику, прогнозирование, стратификацию рисков, анализ медицинских изображений и принятие клиническихрешений 1. Достижения в области машинного и глубокого обучения позволили системам здравоохранения обрабатывать большие объемы структурированных и неструктурированных данных, часто достигая прогнозных показателей, сопоставимых или превосходящих традиционные статистическиеподходы 2. Несмотря на эти достижения, многие модели ИИ работают как сложные «чёрные ящики», что затрудняет для клиницистов и заинтересованных сторон в здравоохранении понять, как формируютсяпрогнозы 3. Отсутствие прозрачности может ограничить доверие, внедрение и подотчетность в условиях высокопоставленных медицинскихучреждений 4,5.

Объяснимый искусственный интеллект (XAI) стал перспективным подходом для повышения прозрачности и интерпретируемости моделей машинногообучения 6. Широко используемые методы объяснения, включая SHAP (аддитивные объяснения Шепли), LIME (локально интерпретируемые модели-агностические объяснения) и отображение активации классов с градиентным взвешенным уровнем (Grad-CAM), дают представление о поведении модели с помощью атрибуции признаков и визуальных механизмов объяснения 7,8,9. Эти методы всё чаще применяются в медицинских приложениях для поддержки клинической интерпретации, аудита моделей и поддержки принятиярешений 10,11. Однако сама объяснимость не гарантирует надёжности, воспроизводимости или клинической полезности. Недавние исследования выявили проблемы, связанные с нестабильностью объяснения, чувствительностью к возмущениям, ограниченной валидацией клиницистами и несоответствиями между результатами объяснения и истинным модельнымрассуждением 12,13,14,15.

Помимо проблем с объяснимостью, воспроизводимость остаётся значимой проблемой в исследованиях в области машинного обучения вздравоохранении 16,17,18. Многие опубликованные исследования содержат ограниченную информацию о процедурах предварительной обработки, программных средах, конфигурациях гиперпараметров, стратегиях валидации и рабочих процессах реализации, что затрудняет независимоевоспроизведение 19,20,21. Кроме того, исследования ИИ в здравоохранении часто сосредоточены на предиктивной эффективности, предоставляя ограниченные рекомендации по оценке качества объяснения, оценке с центром клинициста и практических аспектоввнедрения 22. Эти ограничения могут препятствовать переводу объяснимых систем ИИ из исследовательских сред в реальные медицинскиеучреждения 23,24,25,26,27.

Современные рабочие процессы XAI в здравоохранении часто оценивают отдельные методы объяснения или предиктивные модели в изоляции и редко предоставляют стандартизированные протоколы, интегрирующие подготовку данных, предиктивное моделирование, оценку объяснимости, оценку на человеке и ресурсывоспроизводимости 28,29,30,31 . В результате исследователи и практики могут столкнуться с трудностями при воспроизведении рабочих процессов, сравнении методов объяснения или оценке практической полезности объяснимых систем ИИ в различных медицинских наборах данных и области применения. Поэтому необходим комплексный и воспроизводимый протокол для обеспечения последовательного внедрения, оценки и отчетности о объяснённых рабочих процессах ИИв здравоохранении 32, 33, 34, 35.

Здесь мы представляем воспроизводимый протокол для разработки, оценки и интерпретации объяснимых систем искусственного интеллекта в аналитике здравоохранения. Протокол интегрирует предварительную обработку данных, предиктивное моделирование, оценку объяснимости с помощью SHAP, LIME и Grad-CAM, оценку, ориентированную на клинициста, процедуры валидации и ресурсы воспроизводимости в едином рабочем процессе. Цель — предоставить стандартизированную структуру, которая поддерживает прозрачную разработку моделей, оценку качества объяснения и воспроизводимое внедрение в различных медицинских наборахданных 36, 37, 38, 39. Методологический вклад этой работы заключается в интеграции предиктивной аналитики, оценки объяснимости, валидации клинициста и практик воспроизводимости в единый протокол, подходящий для исследований, образования и ориентированных на внедрение исследований в области ИИв здравоохранении 40,41,42,43.

Основной вклад этой работы — не разработка нового алгоритма объяснимости.

Вместо этого он предоставляет стандартизированный, воспроизводимый и экспериментально валидированный протокол, интегрирующий предиктивное моделирование, оценку объяснимости, визуализацию, оценку и ориентированную на человека интерпретацию в единый рабочий процесс, подходящий для аналитики здравоохранения и распространения протоколов на основе JoVE. Основная цель этой работы — не внедрить новый предиктивный алгоритм, а предоставить стандартизированный, воспроизводимый и экспериментально валидированный протокол для реализации объяснимых рабочих процессов искусственного интеллекта в аналитике здравоохранения. Протокол объединяет предварительную обработку данных, предиктивное моделирование, оценку объяснимости, ориентированную на клинициста оценку и ресурсы воспроизводимости в единую структуру, подходящую для внедрения, репликации и образовательного распространения.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Все наборы данных, использованные в этом исследовании, были получены из общедоступных и полностью анонимизированных репозиториев, включая UCI Machine Learning Repository, базу данных PhysioNet MIMIC-III и наборы данных NIH по рентгену грудной клетки. Никакой идентифицирующей информации о пациентах не было получено. Исследование соответствовало институциональным рекомендациям по этике исследований для вторичного анализа публично доступных деидентифицированных данных. Официальное одобрение Институционального наблюдательного совета не требовалось, так как напрямую не привлекались человеческие участники и не использовалась защищённая медицинская информация.

1. Обзор экспериментальных рамок

  1. Разработать воспроизводимый, объяснимый конвейер искусственного интеллекта (XAI) для прозрачной аналитики здравоохранения. Организуйте рабочий процесс на уровень данных, уровень предварительной обработки, слой моделирования, слой объяснимости, уровень оценки и уровень визуализации.
  2. Интегрировать эти модули в единый рабочий процесс, способный обрабатывать структурированные клинические данные, электронные медицинские карты и наборы данных медицинской визуализации.
  3. Убедитесь, что каждый модуль способствует воспроизводимости, интерпретируемости, масштабируемости и стандартизированному экспериментальному исполнению.
  4. Спроектировать модульную архитектуру для поддержки непрерывного потока данных и гарантировать, что каждый этап конвейера способствует воспроизводимости, интерпретируемости и масштабируемости на протяжении всего экспериментального рабочего процесса.

2. Вычислительная среда и конфигурация системы

  1. Установите необходимые программные зависимости перед выполнением рабочего процесса, открыв командный терминал и выполнив следующую команду:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Проверьте успешную установку всех программных пакетов и совместимость с версиями, указанными в Таблице материалов , прежде чем приступать к предварительной обработке данных и разработке модели.
  3. Используйте Python 3.11 в качестве основной среды программирования. Установите и настройте NumPy 1.26 и Pandas 2.1 для обработки данных и задач по разработке функций. Установите Scikit-learn 1.5 для разработки и оценки моделей машинного обучения.
  4. Установите TensorFlow 2.15 для обучения и вывода моделей глубокого обучения. Установите SHAP 0.46 и LIME 0.2.0 для анализа объяснимости. Установите OpenCV 4.10 для обработки изображений. Установите Matplotlib 3.9 и Seaborn 0.13 для визуализации данных и отчетности по результатам. Обратитесь к Таблице материалов для полных спецификаций программного обеспечения и необходимых для воспроизводимости деталей реализации.
  5. Настройте вычислительную среду с помощью рабочей станции с многоядерным процессором, ускорением графического процессора (GPU) и достаточным объемом памяти для работы с большими наборами данных в здравоохранении и глубокого обучения.
  6. Установка фиксированных случайных семян для разбиения данных, инициализации модели и процедур обучения для обеспечения воспроизводимости между экспериментальными запусками. Включить механизмы логирования для записи операций предварительной обработки данных, конфигураций моделей, настроек гиперпараметров, процедур обучения и результатов оценки на протяжении всего рабочего процесса.
  7. Настройте архитектуры моделей, параметры оптимизации, скорость обучения, размеры пакетов, настройки обучения и значения гиперпараметров согласно спецификациям, изложенным в Таблице 1. Соблюдайте эти настройки во время экспериментов с репликацией, чтобы обеспечить согласованность с опубликованными результатами.
  8. Ожидаемый результат — полностью настроенная и воспроизводимая вычислительная среда со всеми необходимыми программными пакетами, аппаратными ресурсами, механизмами логирования и настройками конфигурации моделей, доступными для последующего предварительной обработки данных, разработки моделей, анализа объяснимости и оценки.
КомпонентПараметрЦенностьОписание
Случайный лесn_estimators100Количество деревьев
Случайный лесmax_depthНетГлубина дерева
XGBoostlearning_rate0.01Скорость обучения
XGBoostn_estimators100Ускоряющие патроны
CNNЭпохи25Эпохи обучения
CNNbatch_size32Размер партии
CNNОптимизаторАдамАлгоритм оптимизации
MLPhidden_layers2Количество скрытых слоёв
MLPАктивацияReLUФункция активации
Общие заведенияtrain_split70%Коэффициент обучающих данных
Общие заведенияvalidation_split15%Коэффициент валидации
Общие заведенияtest_split15%Коэффициент тестирования

Таблица 1: Детали реализации и конфигурация гиперпараметров.

В этой таблице представлены вычислительная среда, библиотеки программного обеспечения, конфигурации моделей машинного обучения и глубокого обучения, настройки оптимизации, скорости обучения, размеры пакетов, параметры обучения и значения гиперпараметров, используемые при экспериментальной оценке предлагаемого объяснимого фреймворка ИИ.

3. Подготовка и предобработка наборов данных

  1. Выберите общедоступные наборы данных в здравоохранении для обеспечения прозрачности и воспроизводимости экспериментального рабочего процесса.
  2. Используйте четыре репрезентативных медицинских сценария для проверки предлагаемой основы: (i) диагностика рака груди с использованием Dataset по раку молочной железы штата Висконсин, (ii) прогнозирование риска диабета с использованием Pima Indians Diabetes Dataset, (iii) прогнозирование клинических исходов с использованием электронных медицинских записей MIMIC-III, и (iv) классификации торакальных заболеваний с использованием набора данных NIH Chest X-ray. Выбирайте эти наборы данных для оценки структурированных клинических записей, лонгитюдных электронных медицинских карт и медицинских визуализационных методов, часто используемых в системах поддержки принятия решений в здравоохранении.
  3. Импортируйте каждый набор данных в среду Python и разделяйте записи на входные признаки и целевые переменные. Организовывать структурированные клинические данные для задач прогнозирования заболеваний, электронные медицинские карты для анализа долгосрочных результатов и наборы данных медицинской визуализации для задач диагностической классификации. Проверьте целостность каждого набора данных перед переходом к операциям предварительной обработки.
  4. Выявлять и устранять недостающие значения с помощью соответствующих методов импутации. Стандартизировать численные признаки с помощью процедур масштабирования признаков и нормализации для обеспечения сопоставимости между переменными.
  5. Кодировать категориальные переменные с использованием подходящих методов кодирования, основанных на характеристиках набора данных. Проводите выбор признаков с использованием корреляционного анализа и моделей мер важности признаков для выявления наиболее релевантных переменных и снижения размерности данных.
  6. До обучения модели уменьшите размер всех медицинских изображений до 224 224 пикселей. Нормализуйте значения интенсивности пикселей в соответствии с требованиями выбранной архитектуры глубокого обучения. Применяйте методы увеличения данных, включая вращение изображения и горизонтальное переворачивание, чтобы улучшить обобщение модели и снизить перенагон. Проверьте качество изображения и обеспечьте согласованность размеров изображения по всему набору данных.
  7. Оценивайте целостность данных, оценивая полноту, согласованность и согласованность признаков набора данных. Проверьте, правильно ли все записи присвоены соответствующим целевой классам. Изучите характеристики наборов данных, включая размер выборки, количество признаков и модальность данных, как изложено в Таблице 2.
  8. Внедрять процедуры валидации, специфичные для набора данных, чтобы обеспечить методологическую строгость и воспроизводимость. Записывайте размер выборки, распределение классов, стратегию разделения «обучая-валидация-тестирование», меры по предотвращению утечек, процедуры оптимизации гиперпараметров, кросс-валидационный дизайн и внешний протокол тестирования для каждого набора данных. Краткое изложение этих процедур валидации в таблице 3.
  9. Проводите проверки качества предварительной обработки, оценивая обработку недостающих значений, удаление выбросов, масштабирование признаков, категориальное кодирование, сохранение распределения классов и процедуры разделения наборов данных. Проверьте, что операции предварительной обработки применяются последовательно во всех наборах данных.
  10. Подтвердите отсутствие значительных утечек данных при разделении данных. Изучите результаты предварительной проверки, представленные на рисунке 1 , чтобы убедиться, что стандартизированные наборы данных сгенерированы для последующих анализов машинного обучения и объяснимости.
  11. Ожидаемый результат — генерируйте очищенные и стандартизированные наборы данных с отсутствующими значениями, соответствующим образом обработанными, закодированными категориальными переменными, нормализующими числовыми признаками и разделением записей на учебные, валидационные и тестовые подмножества. Убедитесь, что характеристики наборов данных, распределения классов и процедуры валидации соответствуют тем, что указаны в Таблице 2 и Таблице 3, и подтвердите успешную проверку предварительной обработки, как показано на рисунке 1.
Набор данныхТипСэмплыОсобенностиЦель
Рак молочной железыТабличная форма56930Доброкачественные/злокачественные
ДиабетТабличная форма7688Результаты при диабете
MIMIC-IIIEHR~60 000Клинические переменныеСмертность
Рентген грудной клеткиВизуализация~112 000ИзображенияМетки болезней

Таблица 2: Характеристики набора данных и случаи использования в здравоохранении.

В этой таблице представлено сводное описание наборов данных в области здравоохранения, использованных в исследовании, включая тип набора данных, количество выборок, количество признаков, целевые переменные, область применения в здравоохранении и связанные с ними клинические случаи использования. Наборы данных включают структурированные клинические записи, электронные медицинские записи и данные медицинской визуализации, чтобы продемонстрировать применимость рамок в различных сценариях медицинской аналитики.

Набор данныхРазмер выборкиРаспределение классовСтратегия разделенияПредотвращение протечекГиперпараметрический поискПерекрёстная валидацияВнешний тест
Рак молочной железы (UCI, Висконсин)569357 Доброкачественный / 212 Злокачественный70/15/15Предобработка только поездаПоиск по сетке5-кратная стратифицированная CVНезависимый Удерживающий Набор
Диабет индейцев Пима768500 недиабетиков / 268 диабетиков70/15/15Предобработка только поездаПоиск по сетке5-кратная стратифицированная CVНезависимый Удерживающий Набор
МИМИК-III ЭМК5274Когорты, стратифицированные по результатам70/15/15 Уровень пациентаРазделение на уровне пациентаСлучайный поискПятикратное CV на уровне пациентаНезависимый Удерживающий Набор
Рентген грудной клетки NIH112120Пневмония/Нормальный стратифицированный70/15/15Разделение на уровне изображенияСлучайный поиск5-кратная стратифицированная CVНезависимый Удерживающий Набор

Таблица 3: Валидация на уровне набора данных и экспериментальное проектирование.

В этой таблице представлена методология валидации, используемая для каждого набора данных, включая размер выборки, распределение классов, стратегию разделения «обучая-валидация-тест», процедуры предотвращения утечек, методы оптимизации гиперпараметров, кросс-валидационный дизайн и внешние протоколы тестирования. Эти меры были внедрены для обеспечения методологической строгости, воспроизводимости и объективной оценки модели.

figure-protocol-1
Рисунок 1: Валидация конвейера предварительной обработки данных.
Результаты валидации ключевых предварительных операций, выполненных до разработки модели. (A) Анализ отсутствующей стоимости по репрезентативным признакам здравоохранения. (B) Распределение числовой переменной до и после обработки выбросов. (C) Валидация масштабирования признаков с использованием стандартизации. (D) Валидация категориального кодирования. (E) Распределение классов после предварительной обработки. (F) Валидация разбиения данных с проверкой и тестированием обучения. Эти результаты подтверждают успешную предобработку и подготовку наборов данных для предиктивного моделирования и анализа объяснимости. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

4. Архитектура системы Объяснимой ИИ Фреймворка

  1. Организуйте фреймворк с помощью многоуровневой архитектуры для облегчения модульной обработки, повышения прозрачности рабочих процессов и поддержки воспроизводимой реализации. Настройте слой данных для получения и управления необработавшими наборами данных о здравоохранении. Перед началом операций предварительной обработки маршрутизируйте все входящие наборы данных через слой данных.
  2. Выполнять процедуры очистки данных, трансформации, нормализации, инженерии признаков и кодирования в пределах слоя предварительной обработки. Убедитесь, что все операции предобработки завершены до разработки модели.
  3. Разрабатывайте предиктивные модели внутри слоя моделирования с использованием алгоритмов машинного обучения и глубокого обучения. Обучайте модели градиентного бустинга, случайного леса, многослойного перцептрона (MLP) и сверточных нейронных сетей (CNN) с использованием предварительно обработанных наборов данных и оптимизированных конфигураций гиперпараметров.
  4. Применяйте методы объяснимости внутри слоя объяснимости для интерпретации прогнозов модели. Генерируйте объяснения атрибуции признаков с помощью SHAP и LIME для структурированных наборов данных. Генерируйте тепловые карты Grad-CAM для моделей на основе изображений с целью визуализации областей, участвующих в прогнозировании моделей.
  5. Оценивайте предиктивные и объяснимые характеристики в пределах уровня оценки. Рассчитывайте точность, точность, отзыв, показатели F1, ROC-AUC, точность, стабильность и метрики, ориентированные на клинициста. Фиксируйте все результаты оценки для последующего анализа и отчетности.
  6. Генерируйте клинически интерпретируемые визуальные результаты внутри слоя визуализации. Создавайте графики сравнения производительности, визуализации важности признаков, сводные графики SHAP, объяснения LIME, тепловые карты Grad-CAM и ориентированные на клиницистов отчетные панели. Храните все визуальные результаты для включения в итоговый экспериментальный отчёт.
  7. Перед выполнением рабочих процессов ознакомьтесь с полной архитектурой фреймворка, показанной на рисунке 2 .
  8. Ожидаемый результат — генерировать полностью обученные модели машинного обучения и глубокого обучения, включая архитектуры градиентного усиления, случайного леса, CNN и MLP. Храните конфигурации модели, оптимизированные гиперпараметры, обучающие журналы, файлы контрольных точек, выходы объяснённости и артефакты визуализации для последующего анализа оценки и интерпретации.

figure-protocol-2
Рисунок 2: Архитектурная система объяснимой AI-фреймворка для аналитики в здравоохранении. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

5. Выполнение рабочих процессов

  1. Получайте наборы данных по здравоохранению из общедоступных репозиториев и храните их в структурированных форматах, подходящих для анализа машинного обучения и глубокого обучения. Перед началом экспериментальной процедуры ознакомьтесь с полным рабочим процессом, показанным на рисунке 3 .
  2. Выполнять очистку и предварительную обработку данных в соответствии с процедурами, описанными в разделе 3. Нормализуйте числовые переменные с помощью соответствующих методов масштабирования. Кодировать категориальные переменные с помощью подходящих методов кодирования. Выявлять и приписывать недостающие значения с помощью стратегий импутации, специфичных для набора данных. Проверьте качество данных, согласованность признаков и полноту набора данных перед тем, как приступить к разработке модели.
  3. Разделите каждый набор данных на подмножества обучения, проверки и тестирования для поддержки беспристрастной оценки модели. Сохранять распределения классов при разделении наборов данных и внедрять меры по предотвращению утечек, где это применимо. Резервируйте тестовое подмножество исключительно для окончательной оценки модели.
  4. Обучать модели машинного обучения на структурированных наборах данных с использованием алгоритмов на основе ансамбля, включая Gradient Boosting и Random Forest. Обучайте модели глубокого обучения на наборах данных визуализации с использованием архитектур сверточной нейронной сети (CNN), способных изучать признаки пространственных изображений. Обновлять параметры модели итеративно во время обучения и отслеживать результаты валидации после каждого этапа обучения. Применяйте раннюю остановку, когда результаты валидации ухудшаются или не улучшаются согласно заранее установленным критериям остановки.
  5. Оптимизируйте гиперпараметры модели с помощью систематических стратегий поиска, включая сеточный поиск и рандомизированный поиск. Корректируйте скорость обучения, количество оценщиков, глубину дерева, размер партии, количество эпох и другие параметры, специфичные для модели, в зависимости от эффективности валидации. Выберите окончательную модель на основе предиктивных результатов и возможностей обобщения по наборам валидационных данных.
  6. Применяйте методы объяснимости после завершения обучения модели. Генерировать глобальные объяснения с помощью методов атрибуции признаков для выявления переменных, наиболее сильных в прогнозировании моделей. Генерируйте локальные объяснения для анализа отдельных случаев предсказания и оценки поведения модели на уровне выборки. Создайте тепловые карты Grad-CAM для моделей классификации изображений, чтобы выделить области изображения, влияющие на прогнозируемый результат. Храните все результаты объяснений для последующего анализа и отчетности.
  7. Оценивать предсказательные характеристики с использованием точности, точности, отзыва, F1-балла и рабочей характеристики приёмника под кривой (ROC-AUC). Оценивайте качество объяснения с помощью метрик точности и стабильности для оценки надёжности и согласованности объяснения. Сравните производительность модели между наборами данных и методы объяснимости для оценки устойчивости и обобщённости фреймворка.
  8. Генерируйте результаты визуализации и аналитические отчёты для передачи результатов в клинически интерпретируемой форме. Создавайте таблицы сравнения производительности, графики важности признаков, визуализации SHAP, результаты объяснений LIME, тепловые карты Grad-CAM и другие клинически значимые визуализации. Проверьте все визуальные результаты, чтобы обеспечить ясность и последовательность перед подачей отчетов.
  9. Документируйте все операции предварительной обработки, конфигурации моделей, настройки гиперпараметров, процедуры объяснимости, стратегии валидации и результаты оценки. Вести подробные экспериментальные записи для облегчения воспроизводимости и независимого воспроизведения рабочего процесса. Проверяйте согласованность результатов при повторных экспериментальных запусках и архивируйте все артефакты рабочего процесса для будущей ссылки.
  10. Ожидаемый результат — сгенерировать полностью обученную предиктивную модель с оптимизированными гиперпараметрами, сохранёнными весами модели, обучающими журналами, метриками производительности и результатами объяснимости, включая объяснения SHAP, LIME и тепловые карты Grad-CAM. Храните все артефакты модели, отчёты по оценке и результаты визуализации для последующего анализа и оценки воспроизводимости.

figure-protocol-3
Рисунок 3: Сквозной рабочий процесс объяснимого ИИ-пайплайна. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

6. Оценка модели и оценка объяснимости

  1. Оценивать производительность предиктивной модели с использованием стандартных классификационных метрик, включая точность, точность, отзыв, F1-балл и рабочую характеристику приёмника под кривой (ROC-AUC). Рассчитайте точность для измерения общей корректности классификации.
  2. Рассчитайте точность для оценки доли правильно идентифицированных положительных прогнозов. Рассчитывайте отзыв, чтобы оценить способность модели выявлять положительные случаи. Рассчитайте счёт Формулы-1, чтобы сбалансировать точность и воспоминание. Рассчитайте ROC-AUC для оценки дискриминационных результатов по различным порогам классификации.
  3. Применяйте эти метрики оценки последовательно во всех наборах данных и архитектурах моделей для облегчения объективного сравнения производительности. Записывайте все метрические значения и храните результаты оценки для последующих статистических анализов и отчетности.
  4. Оценивайте эффективность объяснимости с помощью метрик точности и стабильности. Рассчитайте достоверность, чтобы определить, насколько сгенерированные объяснения точно отражают прогнозы модели и поведение при принятии решений.
  5. Рассчитайте устойчивость, сравнивая объяснения, полученные из аналогичных входных выборок, и количественно оценивая согласованность результатов объяснений. Проверьте, что значения точности и стабильности соответствуют заранее заданным критериям качества, прежде чем интерпретировать объяснения модели.
  6. Сравните производительность объяснимости между выходами SHAP, LIME и Grad-CAM.
  7. Ожидаемый результат — генерируйте количественные результаты, включая точность, точность, отзыв, F1-балл, ROC-AUC, метрики точности и стабильности. Создавать результаты и визуализации объяснимости, подходящие для научной отчетности, оценки воспроизводимости и клинической интерпретации.

7. Оценка, ориентированная на человека

  1. Нанимите 12 медицинских специалистов, включая 6 врачей, 3 радиолога и 3 аналитика клинических данных. Выбирайте участников с предыдущим опытом принятия клинических решений, интерпретации медицинских изображений, аналитики здравоохранения или электронного обзора медицинских записей. Получите информированное согласие всех участников перед началом процедуры оценки.
  2. Случайным образом выберите 100 случаев из тестовых наборов данных после завершения обучения модели и анализа объяснимости. Сгенерируйте два условия оценки для каждого случая:
    1. Вывод только с предсказаниями и
    2. предсказание сопровождается информацией о объяснимости. Рандомизировать порядок представления кейсов и условия оценки, чтобы минимизировать смещение презентации и эффекты обучения.
  3. Подготовьте стандартизированные формы оценки, содержащие результаты прогнозирования, результаты объяснений и анкеты оценки. Представляйте индивидуальные случаи участникам с помощью компьютерного интерфейса оценки.
  4. Инструктировать участников рассматривать каждый случай самостоятельно, не обсуждая ответы с другими оценщиками. Позволить участникам выполнять все оценки в одинаковых экспериментальных условиях.
  5. Проведите пятибалльный опросник по шкале Ликерта, адаптированный из опубликованных объяснимых исследований оценки искусственного интеллекта. Инструктировать участников оценивать доверие, интерпретируемость и удобство использования для каждого рассмотренного случая. Записывайте ответы на анкету в электронном виде и проверяйте выполнение всех вопросов опроса перед переходом к статистическому анализу.
  6. Измерять объективные показатели клинической полезности в процессе оценки. Фиксируйте согласование решений, сравнивая решения участников с соответствующими эталонными метками или результатами на основе истины. Рассчитайте согласованность решений как процент решений участников, соответствующих результату отчёта.
  7. Фиксируйте время рассмотрения каждого дела, измеряя интервал между представлением дела и подачей окончательного ответа. Рассчитывайте среднее время повторения отдельно для условий только предсказания и прогноза с объяснением.
  8. Рассчитывайте средние показатели доверия, интерпретируемости и удобства использования для всех участников и оценочных случаев. Сравните баллы, полученные при условиях только предсказания и прогноза с объяснением.
  9. Проведите парные t-тесты после завершения всех оценок участников, чтобы определить, статистически значимы ли различия в доверии, интерпретируемости, удобстве использования, согласовании решений и времени рассмотрения. Используйте порог значимости p 0,05 для всех статистических сравнений.
  10. Рассчитайте Fleiss Kappa после сбора ответов всех участников для оценки согласия между оценщиками. Используйте агрегированные оценки участников для определения согласованности оценок среди рецензентов. Интерпретировать ценности Fleiss Kappa в соответствии с установленными руководящими принципами соглашения и фиксировать полученную статистику соглашения.
  11. Краткое изложение демографических данных участников, методологии оценки, дизайна анкеты, процедур статистического анализа, объективных показателей эффективности и результатов согласования между оценщиками в таблице 4.
  12. Проанализировать результаты модели при обоих условиях оценки и сравнить ответы участников по разным условиям. Убедитесь, что объяснения улучшают доверие, интерпретируемость и удобство использования, не негативно сказываясь на качестве принятия решений.
  13. Подтвердите согласованность оценок участников с помощью рассчитанной статистики Fleiss Kappa. Записывайте все результаты оценки для последующего отчёта и оценки воспроизводимости.
  14. Ожидаемый результат — генерировать рейтинги доверия клиницистов, оценки интерпретируемости, оценки удобства использования, меры согласования решений, статистику времени рассмотрения, результаты парных t-тестов и статистику межоценочных согласований. Подготовьте количественные доказательства, описывающие медицинскую полезность, интерпретируемость и надёжность объяснимой системы искусственного интеллекта.
ПараметрЦенность
Эксперты12
Врачи6
Радиологи3
Аналитики клинических данных3
Рассмотренные дела100
Проектирование оценкиРандомизированное (только предсказание против предсказания+объяснения)
Геодезический инструмент5-балльная шкала Ликерта
Оценка доверияИнтерпретируемость, доверие, удобство использования
Статистический тестПарный t-тест (p 0.05)
Надёжность между рейтингамиFleiss Kappa
Объективные показателиСоглашение о принятии решения, время рассмотрения

Таблица 4: Протокол оценки, ориентированный на человека, и дизайн оценки клиницистами.

В этой таблице представлена система оценки клинициста, используемая для оценки интерпретируемости, надёжности и удобства использования объяснимой системы ИИ. Обобщена информация о демографии участников, методологии обзора случаев, дизайне опроса, процедурах статистического анализа, оценке надёжности между оценщиками и объективных мерах оценки.

8. Валидация и оценка воспроизводимости

  1. Провести исследования валидации и абляции для оценки надёжности и надёжности предлагаемой структуры. Определите признаки с высокими баллами важности с помощью выбранных методов объяснимости. Постепенно удалять важные признаки и переучить предсказательные модели после каждого этапа удаления признаков.
  2. Оценивайте производительность модели после каждого абляционного эксперимента с использованием точности, точности, воспоминания, показателей F1 и ROC-AUC. Сравните полученные показатели эффективности с базовой моделью, чтобы определить вклад отдельных признаков в прогнозные результаты.
  3. Оценивайте устойчивость объяснения, генерируя объяснения для аналогичных входных образцов с помощью SHAP, LIME и Grad-CAM. Сравнивайте результаты объяснения по повторным оценкам и количественно оценивайте согласованность с использованием заранее заданных метрик устойчивости. Проверьте, что объяснения остаются стабильными при незначительных изменениях входных данных и повторяющихся экспериментальных запусках.
  4. Записывайте все экспериментальные процедуры на протяжении всего рабочего процесса. Операции предварительной обработки данных, процедуры разбиения наборов данных, архитектуры моделей, настройки гиперпараметров, обучающие конфигурации, методы объяснимости, стратегии валидации и метрики оценки. Храните все параметры конфигурации и экспериментальные результаты в структурированном формате для облегчения воспроизводимости и независимой проверки.
  5. Проверьте все экспериментальные записи для обеспечения полноты и согласованности. Убедитесь, что рабочий процесс можно воспроизвести с помощью задокументированных процедур, конфигурационных файлов и программных спецификаций. Поддерживать модульную структуру рабочего процесса для облегчения адаптации протокола для будущих исследований и поддерживать преобразование в видеооснованный экспериментальный протокол, соответствующий методологическим требованиям JoVE.

9. Ресурсы воспроизводимости

  1. Выполнять все эксперименты с фиксированными случайными семенами, чтобы обеспечить воспроизводимые результаты при повторяющихся запусках. Поддерживать исходный код, скрипты предобработки, конфигурационные файлы, спецификации среды, параметры модели и скрипты визуализации в общедоступном репозитории.
  2. Предоставить подробные инструкции по сбору наборов данных, предварительной обработке, выполнению экспериментов, обучению моделей, генерации объяснимости, процедурам валидации и регенерации всех представленных таблиц и рисунков. Архивируйте все компоненты рабочего процесса, необходимые для независимой репликации, включая спецификации программного обеспечения, рабочие процессы предварительной обработки, конфигурационные файлы, инструкции доступа к набору данных, контрольные точки модели и визуализационные ресурсы.
  3. Краткое описание программных ресурсов, рабочих процессов предварительной обработки, конфигурационных файлов, инструкций доступа к набору данных и воспроизводимых ресурсов, используемых на протяжении всего фреймворка, в таблице 5.
  4. Ожидаемый результат — Сгенерировать полный воспроизводимый экспериментальный пакет, содержащий скрипты предварительной обработки, конфигурационные файлы, обученные модели, контрольные точки модели, результаты объяснимости, отчёты по валидации, артефакты визуализации, спецификации программного обеспечения и документацию, необходимую для независимого копирования и проверки предлагаемого фреймворка.
РесурсОписание
Исходный кодСкрипты реализации Python для предварительной обработки данных, обучения моделей, объяснимости и оценки
Файл окруженияrequirements.txt содержит зависимости и версии пакетов
Конфигурационные файлыНастройки архитектуры моделей, гиперпараметры и конфигурации экспериментов
Исправлены случайные семяСемя = 42, используемое для воспроизводимых экспериментов
Инструкции доступа к набору данныхСсылки и процедуры для получения наборов данных по государственному здравоохранению
Скрипты предварительной обработкиСкрипты для очистки данных, нормализации, кодирования и выбора функций
Скрипты для генерации фигурокСкрипты для регенерации всех рукописных фигур
Скрипты генерации таблицСкрипты для воспроизведения отчетных таблиц и метрик
Примеры входных данныхПримеры наборов данных и входные файлы
Примеры выходных данныхРезультаты прогнозирования, объяснения и отчёты по оценке

Таблица 5: Ресурсы воспроизводимости и экспериментальные активы.

В этой таблице представлены ресурсы, предоставленные для поддержки экспериментальной воспроизводимости, включая исходный код, скрипты предварительной обработки, конфигурационные файлы, спецификации среды, инструкции доступа к набору данных, фиксированные случайные настройки seed, скрипты генерации фигурок и примеры файлов ввода/вывода, необходимые для воспроизведения сообщаемых результатов.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы тщательно оценили компонент объяснительного ИИ во всей нашей конвейерной системе, оценивая, насколько хорошо он предсказывается по различным типам медицинских данных, включая как структурированные клинические данные, так и медицинские изображения. Результаты показали стабильную прогнозную эффективность по оценённым наборам данных. Среди протестированных моделей модель градиентного бустинга показала наивысшую точность — 97,4%, за ней следует модель случайного леса с 94,2%. Методы глубокого обучения, применяемые к наборам изображений, достигли точности 91,3%, тогда как многослойные перцептронные модели дали немного более низкие результаты — 90,8%. Это говорит о том, что модели машинного обучения на основе ансамбля лучше всего работают на структурированных медицинских данных, тогда как архитектуры глубокого обучения отлично справляются с задачами визуализации. Таблица 6 подробно описывает различные показатели производительности функций прогнозирования, включая точность, точность, воспоминание и F1-балл, а также показатели объяснимости, такие как точность и стабильность. К этим показателям мы пришли с помощью пятикратной перекрёстной валидации и представления результатов в виде средних значений (с 95% доверительными интервалами). Доверительные интервалы не только указывают на неопределённость модели, но и делают сравнения предиктивных показателей более надёжными, учитывая память наборов данных и различия в архитектурах моделей.

МодельТочность (%)ТочностьОтзывF1-ScoreВерностьСтабильность95% ДИ
Случайный лес94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN (Визуализация)91.30.900.910.900.880.8690.1–92.5

Таблица 6: Сравнительная производительность предиктивных моделей и методы объяснимости.
В этой таблице представлена сравнительная оценка моделей машинного и глубокого обучения с использованием предиктивных показателей производительности, включая точность, точность, запоминание, F1-балл и ROC-AUC. Кроме того, показатели объяснимости, такие как достоверность, стабильность, понимаемость и оценки доверия человека, предоставляются для всесторонней оценки как предсказательной эффективности, так и интерпретируемости.

Результаты показывают, что Gradient Boosting показала наивысшую общую прогнозную эффективность (точность 97,4%), опередив Random Forest на 3,2 процентных пункта и модели глубокого обучения более чем на 6 процентных пунктов. Это наблюдение свидетельствует о том, что методы обучения на основе ансамбля были особенно эффективны для структурированных наборов данных здравоохранения, включённых в это исследование. Меньшая разница в производительности между моделями CNN и MLP указывает на то, что само по себе увеличение сложности модели не обязательно приводило к лучшей прогнозной эффективности в оцененных экспериментальных условиях.
Чтобы продемонстрировать полезность предлагаемой структуры для различных задач аналитики здравоохранения, мы представляем результаты прогнозирования эффективности для конкретных наборов данных в Таблице 7.

Анализ, специфичный для набора данных.
Производительность варьировалась между наборами данных из-за различий в сложности признаков, размере выборки, распределении классов и модальности данных. Набор данных по раку молочной железы достиг самой высокой точности прогнозирования, вероятно, благодаря чётко определённой разделяемости признаков. Немного более низкая производительность наборов данных MIMIC-III и NIH по рентгену грудной клетки отражает большую сложность продольных клинических записей и медицинских данных визуализации. Эти результаты показывают, что производительность фреймворка зависит от характеристик набора данных и клинического контекста.

Набор данныхТочность (%)Точность (%)Отзыв (%)F1-балл (%)
Рак молочной железы97.497.297.697.1
Диабет94.293.994.494
MIMIC-III91.39191.591.1
Рентген грудной клетки NIH90.890.491.290.6

Таблица 7: Результаты прогнозной эффективности, специфичные для набора данных.
Прогнозная эффективность предлагаемой объяснимой структуры ИИ на четырёх репрезентативных наборах данных в области здравоохранения. Точность, точность, воспоминание и результат F1 отображаются в процентах (%) на независимых тестовых наборах. Более высокие значения свидетельствуют о лучшей классификации.

Для оценки предиктивной эффективности были оценены четыре модели машинного и глубокого обучения: Gradient Boosting, Random Forest, Convolutional Neneuro Network (CNN) и Multilayer Perceptron (MLP), на четырёх репрезентативных наборах данных здравоохранения. Производительность модели оценивалась с использованием точности, точности, воспоминания, показателей F1 и показателей ROC-AUC на независимых наборах тестовых данных после разделения проверки и проверки 70:15:15 и пятикратной перекрёстной валидации. Улучшения предиктивной эффективности были определены путём сравнения специфических для модели метрик оценки при идентичных условиях предварительной обработки и валидации.
Чтобы прояснить, чем производительность моделей различается в различных методах, на рисунке 4 показаны преимущества и недостатки моделей ансамбля, нейронных сетей и глубокого обучения.

figure-results-1
Рисунок 4: Сравнительная производительность моделей машинного обучения и глубокого обучения на задачах прогнозирования здравоохранения. (A) Сравнение точности моделей градиентного усиления, Random Forest, CNN и MLP на тестовом наборе данных. (B) сравнение моделей Gradient Boosting, Random Forest, CNN и MLP по результатам F1 на тестовом наборе данных. (C) Точное сравнение моделей Gradient Boosting, Random Forest, CNN и MLP на тестовом наборе данных. (D) Сравнение моделей Gradient Boosting, Random Forest, CNN и MLP на тестовом наборе данных. Более высокие значения указывают на лучшую прогнозировку. Gradient Boosting показала наивысшую общую производительность по всем показателям оценки, за ней следует Random Forest. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Интерпретация производительности объяснимости.
SHAP стабильно достигал самых высоких показателей точности и стабильности среди оцениваемых методов объяснимости, что свидетельствует о более сильном согласовании между сгенерированными объяснениями и прогнозами базовой модели. LIME показал сравнительно низкую стабильность, что свидетельствует о большей чувствительности к локальным возмущениям и вариативности выборки. Grad-CAM предоставлял визуально интерпретируемые объяснения моделей на основе изображений, но обеспечивал немного более низкие значения точности, чем SHAP. Эти результаты показывают, что качество объяснения зависит как от выбранной техники объяснения, так и от архитектуры предиктивной модели.

Методы объяснимости, интегрированные в конвейер, оценивались с точки зрения их количественной и качественной характеристики. В частности, методы атрибуции признаков успешно выявили внутреннюю логику модели довольно последовательно в различных наборах данных.
Все методы, рассмотренные в исследовании, SHAP, достигли наивысшей точности (0,92) и стабильности (0,89) среди изученных методов объяснимости. Проще говоря, объяснения были очень точными представлениями того, что на самом деле предсказывала модель. Методы локального объяснения — это своего рода окно, через которое мы можем увидеть конкретное предсказание и понять, что модель использовала в качестве основы для принятия решения.

Результаты интерпретируемости оценивались с использованием точности, стабильности, понимаемости и доверия клинициста, полученных на основе оценки, ориентированной на человека. Объяснения SHAP, LIME и Grad-CAM сравнивались с использованием идентичных наборов данных и обученных моделей. Улучшения объяснимости оценивались путём сравнения показателей качества объяснения и оценок клинициста в рассматриваемых методах объяснительной способности. Методы визуализации для моделей глубокого обучения, работающих с изображениями, по сути создают тепловые карты, которые определяют области изображений, наиболее значимые для прогноза модели. Распределения важности признаков и сравнения производительности объяснимости по разным методам показаны на рисунке 5.

figure-results-2
Рисунок 5: Оценка эффективности по объяснимости.На рисунке показана эффективность методов объяснимости с помощью метрик точности и стабильности. SHAP лидирует по точности (0,92) и стабильности (0,89), что отражает хорошее согласование между объяснениями и прогнозами модели. LIME является лучшим инструментом для интерпретации отдельных примеров. С другой стороны, Grad-CAM выводит визуальные тепловые карты, в основном используемые в моделях визуализации, показывая крупно наиболее важные области, отвечающие за предсказание модели, что с клинической точки зрения может быть весьма актуальным. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

После оценки предиктивных моделей и методов интерпретируемости было выявлено, что корреляция между точностью модели и надёжностью её объяснений очень сильна. Фактически, те же модели, показывавшие улучшения предсказания, объясняли свои результаты с большей стабильностью и последовательностью, когда методы интерпретируемости применялись правильно. Ансамблевые модели оказались наиболее интерпретируемыми при сочетании с методами атрибуции признаков, тогда как модели глубокого обучения лучше подходили с помощью методов визуализации, объясняемых методов. Связь, связывающая точность предсказания и надёжность объяснений, видна на рисунке 6, где подробно описана концептуальная динамика между моделью и объяснимостью.

figure-results-3
Рисунок 6: Сравнительный анализ моделей и методы объяснения способностей.Диаграмма показывает подробное сравнение точности и объяснения показателей способностей различных моделей. Он состоит из графика рассеяния, показывающего корреляцию между точностью и стабильностью объяснения, табличного сравнения результатов и матрицы пригодности, описывающей различные методы объяснения способностей SHAP, LIME и Grad-CAM, а также их эффективность с разными типами моделей. Визуальное оформление ясно показывает, что ансамблевые модели вместе с SHAP обеспечивают отличную интерпретируемость, тогда как модели глубокого обучения объясняются с помощью визуализационных методов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Оценка, ориентированная на человека, подтвердила реальную полезность предлагаемой системы в больницах и других клинических учреждениях. Медицинские специалисты изучали результаты моделей с объяснениями и без них. Показание результатов с объяснениями привело к значительному росту доверия пользователей и интерпретируемости; средняя стоимость доверия выросла с 3,1 до 4,7 по шкале от 1 до 5. Повышение рейтинга доверия с 3,1 до 4,7 представляет собой приблизительное относительное улучшение на 51,6%. Существенное согласование между оценщиками (κ Флайса = 0,81) дополнительно указывает на последовательную оценку полезности объяснения со стороны клинициста. Эти результаты свидетельствуют о том, что результаты объяснимости могут повысить уверенность пользователей и облегчить интерпретацию клинических решений с помощью ИИ. Специалисты отметили лучшее понимание результатов моделей и большее доверие к суждению клинических ситуаций с помощью ИИ, что указывает на важность интерпретируемости в реальной реализации медицинской помощи.

Мы дополнительно проверили надёжность нашей системы с помощью абляционного анализа. Удаление критически важных признаков, которые с помощью методов объяснимости считались необходимыми, приводило к значительной потере производительности прогнозирования. Таким образом, результат показывает, что признаки были не только релевантными, но и значимыми для прогностической задачи. Кроме того, результаты объяснения показывали лишь незначительные различия при объяснении различных входных выборок, что демонстрировало стабильность и надёжность методов объяснимости.

Для проверки целесообразности конвейера для практического применения мы измерили его вычислительную скорость. Внедрение методов объяснимости привело к некоторому увеличению времени вычисления, особенно при атрибуции признаков и создании визуализаций. Тем не менее, общее время исполнения оставалось возможным и не слишком долгим. Рисунок 7 показывает, как вычислительное время распределяется между различными этапами конвейера, такими как предобработка, обучение модели, генерация объяснимости, оценка и визуализация.

figure-results-4
Рисунок 7: Разбивка времени выполнения конвейера. Эта диаграмма показывает, как вычислительное время распределяется между различными этапами объяснимого ИИ-конвейера, такими как предобработка, обучение моделей, создание объяснения способностей, оценка и визуализация. Данные показывают, что большая часть временной линии занимается обучением моделей, после чего следует обработка объяснения способностей. С другой стороны, времени на предобработку и отчётность довольно минимальны. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Мы также проверили прочность предлагаемой структуры с помощью абляционного анализа. Исключение ключевых характеристик, выявленных методами объяснимости, показало явное снижение предсказательной эффективности, что является явным признаком того, что эти характеристики не только актуальны, но и весьма важны. Кроме того, выходы объяснения были довольно стабильны даже при небольшом изменении входных выборок, что подтверждает согласованность и надёжность методов объяснимости.

Короче говоря, объединяя измерение предсказательной эффективности, объяснимости и ориентированной на человека валидацию, было показано, что предлагаемая структура эффективна. Система не только делала очень точные прогнозы, но и оставалась очень интерпретируемой и простой в использовании. Внедрение методов объяснимости сделало весь процесс прозрачным, не снижая производительность модели. Улучшения, которые мы увидели в точности прогнозирования и интерпретируемости, были достигнуты не только под строгим экспериментальным контролем, но и статистически значимыми, что свидетельствует о выносливости и достоверности предлагаемого способа. Парные сравнения предиктивных моделей проводились с использованием парных t-тестов на перекрёстных валидационных сгибах. Статистически значимые различия были обнаружены между моделями градиентного бустинга и конкурирующими моделями (p < 0,05), что подтверждает превосходство предлагаемой конфигурации.

Общие выводы.
В совокупности результаты показывают, что предсказательная эффективность, качество объяснения и доверие клиницисты могут оцениваться в рамках единого и воспроизводимого рабочего процесса. Фреймворк поддерживал единую производительность на различных наборах данных в здравоохранении, одновременно поддерживая прозрачную интерпретацию через объяснения SHAP, LIME и Grad-CAM. Однако результаты следует интерпретировать в контексте выбранных наборов данных и настроек валидации, а перед внедрением в реальном мире необходима дополнительная внешняя валидация.

ДОСТУПНОСТЬ ДАННЫХ:
Мы получили наборы данных, используемые в текущих исследованиях, из публичных источников, которые можно найти в известных хранилищах данных. Например, данные, касающиеся рака груди и диабета, доступны для скачивания из Репозитория машинного обучения UCI по адресу: https://archive.ics.uci.edu/ml/index.php

Электронный набор данных медицинских записей (MIMIC-III) можно получить через Physio Net по адресу:
https://physionet.org/content/mimiciii/1.4/

Данные рентгеновской визуализации грудной клетки были взяты из набора данных NIH Chest X-ray и доступны по адресу: https://www.kaggle.com/datasets/nih-chest-xrays/data

Все набора данных, которые мы изучали в этом исследовании, анонимизированы и становятся публично доступными. Этапы предварительной обработки, обученная модель и результаты объяснения, полученные в ходе исследования, доступны соответствующему автору, если будет сделан разумный запрос. Исходный код, скрипты предварительной обработки, конфигурационные файлы и ресурсы воспроизводимости будут размещены в публичном репозитории после принятия рукописи.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании был разработан и оценён воспроизводимый объяснимый рабочий процесс искусственного интеллекта (XAI) для аналитики в здравоохранении, который интегрирует предиктивное моделирование, оценку объяснимости, оценку, ориентированную на клинициста, и ресурсы воспроизводимости в одном протоколе. Результаты показали, что модели машинного обучения на основе ансамбля, особенно Gradient Boosting и Random Forest, достигли наивысших предиктивных показателей на оцененных структурированных наборах данных здравоохранения, тогда как модели глубокого обучения были более подходящими для анализов на основе изображений. Эти результаты подчёркивают важность выбора архитектур моделей по характеристикам данных, а не предполагать, что более сложные модели всегда будут обеспечивать лучшие характеристики. Ключевым вкладом этой работы является интеграция предиктивного моделирования, оценки объяснимости, ориентированной на человека оценки и практик воспроизводимости в стандартизированный рабочий процесс. В отличие от исследований, которые рассматривают методы объяснимости в изоляции, предлагаемая структура предлагает методологию, основанную на протоколах, поддерживающую прозрачные и воспроизводимые эксперименты на различных наборах данных в области здравоохранения.

Анализ объяснимости показал измеримые различия между оцениваемыми методами. SHAP достиг наивысших показателей точности и стабильности в оцененных экспериментальных условиях, что свидетельствует о более точном согласовании между сгенерированными объяснениями и прогнозами модели. LIME предоставлял полезные локальные объяснения, но демонстрировал меньшую стабильность, тогда как Grad-CAM генерировал интуитивно понятные визуальные объяснения для данных изображения. Эти результаты свидетельствуют о том, что качество объяснения зависит как от выбранного метода объяснимости, так и от базовой предиктивной модели. Оценка, ориентированная на человека, дополнительно показала, что включение объяснений повышает доверие и интерпретируемость клинициста. Наблюдаемое повышение рейтингов доверия и значительное согласие между оценщиками (κ Флейса = 0,81) свидетельствуют о последовательной оценке полезности объяснения среди участников. Эти результаты подтверждают потенциальную ценность методов объяснимости для повышения прозрачности и принятия пользователями в системах поддержки принятия решений в здравоохранении.

При интерпретации результатов следует учитывать несколько ограничений. Во-первых, фреймворк был оценён с использованием ограниченного числа общедоступных наборов данных и может не полностью отражать вариабельность, встречающуюся в реальной клинической среде. Во-вторых, оценка клинициста включала относительно небольшую группу участников, что может ограничивать обобщаемость. В-третьих, методы объяснимости, изучаемые в этом исследовании, являются постфактическими методами и, следовательно, подвержены известным ограничениям, включая чувствительность к возмущениям и возможные расхождения между объяснениями и истинным модельным рассуждением. Наконец, внешняя валидация в независимых медицинских учреждениях выходила за рамки данного исследования.

Будущие исследования должны исследовать мультимодальную аналитику здравоохранения, интегрирующую клинические записи, медицинскую визуализацию, физиологические сигналы и данные носимых сенсоров. Требуется дополнительная работа для оценки методов причинного и контрфактического объяснения, количественной оценки неопределённости, оценки справедливости, калибровочного анализа и проспективной клинической валидации. Такие исследования могут дополнительно повысить прозрачность, надёжность и применимость объяснимых систем ИИ в здравоохранении.

Помимо оценки производительности, следует рассмотреть ряд практических задач внедрения и изменений протокола, чтобы обеспечить надёжное внедрение предлагаемой объяснимой структуры ИИ в различных медицинских средах.

Ограничения методов объяснимости

SHAP, LIME и Grad-CAM, хотя и дают полезные сведения о поведении моделей, имеют ряд недостатков. В литературе отмечается, что эти инструменты могут быть нестабильными при повторных запусках, быть довольно чувствительными к возмущениям, различаться между наборами данных и иногда неточно отражать реальные причины модели. Поэтому постфактические объяснения следует рассматривать только как дополнительные доказательства, а не как реальное изображение причинных механизмов принятия решений. Правильная проверка надёжности объяснений по-прежнему является крайне важным шагом перед их применением в значимых клинических условиях.

Это также соответствует результатам недавних исследований биомедицинского ИИ, которые подчеркивают необходимость объяснения валидации надёжности до её внедрения в клинических условиях. Включение объяснимости используется как ключевой аспект валидации в системах прогнозирования остановки сердца, чтобы они могли быть более прозрачными и завоевать доверие клиническихпрогнозов 41. Аналогично, сегментация ультразвуковых изображений печени с использованием методов объяснимости, основанной на визуализации, была направлена на повышение интерпретируемости без исключения того факта, что пост-хок объяснения ограничены. Эти статьи подтверждают, что проверки согласованности объяснения, тесты на устойчивость объяснения и клинически значимая валидация результатов необходимы для достижения наивысшего уровня клинической готовностик использованию 42.

Калибровка, справедливость, надёжность и внешняя обобщение

Будущие версии предлагаемой рамки будут включать оценку вероятностной калибровки с помощью калибровочных кривых и балла Бриера, оценку неопределённости с помощью байесовских и ансамблевых методов, аудит справедливости демографических подгрупп и проверку устойчивости при наличии шумных данных и меняющихся условий домена. Эти анализы особенно важны в медицинских учреждениях, где уверенность моделей, справедливая эффективность и надёжность в условиях меняющихся клинических условий напрямую влияют на безопасность пациентов и клиническое внедрение. Недавние научные рамки с поддержкой ИИ также подчёркивали важность надёжных, прозрачных и надёжных систем поддержки принятия решений, выходящих за рамки традиционной прогнозной оценки эффективности. Недавние научные рамки с поддержкой ИИ также подчеркнули важность надёжных, прозрачных и надёжных систем поддержки принятия решений, выходящих за рамки традиционной прогнозной оценки эффективности 43.

Устранение неполадок и модификации протокола

Для успешного внедрения предлагаемой объяснимой структуры ИИ необходимо учитывать несколько практических моментов. Типичной проблемой является перенастройка, например, при обучении моделей глубокого обучения на относительно небольших наборах данных здравоохранения. Перенастройка может быть снижена с помощью кросс-валидации, ранней остановки, регуляризации dropout, расширения данных и тщательной оптимизации гиперпараметров. Наблюдение за результатами валидации во время обучения — хороший способ избежать очень сложной модели, которая плохо обобщает.

Ещё одной очень важной проблемой в наборах данных здравоохранения является классовый дисбаланс, то есть положительные клинические результаты встречаются гораздо реже, чем отрицательные. Для решения этой проблемы в моделировании должны быть стратифицированная выборка, корректировка по весу классов, синтетическое перевыборка меньшинств и использование сбалансированных показателей оценки, таких как F1-балл и ROC-AUC. Игнорирование классового дисбаланса рискует привести к появлению показателей эффективности, которые не совсем отражают модель и клинических прогнозов, которые могут быть предвзятыми.

Наборы данных медицинской визуализации обычно не являются идеальными и могут быть повреждены шумом, артефактами при получении, нестабильным качеством и т.д. Эти факторы также различаются в зависимости от типа устройства для визуализации. Такие факторы могут негативно влиять на предсказательные показатели, а также на результаты объяснимости. Поэтому следует применять стандартизированные этапы предварительной обработки, нормализацию изображения, проверку качества и методы дополнения данных, чтобы обеспечить устойчивость и надёжность модели.

SHAP позволяет делать выводы очень информативных объяснений признаков. Однако случаи нестабильности нельзя исключать, особенно когда существуют сильно коррелированные признаки или когда результаты модели очень чувствительны к незначительным изменениям в входных данных. Для повышения согласованности и надёжности объяснения рекомендуется многократное написание, оценка стабильности на протяжении нескольких запусков, использование стратегий группировки признаков и проверка других методов объяснимости, таких как LIME.

Когда речь идёт о крупномасштабных медицинских данных и огромных архитектурах глубоких нейронных сетей, ограничения памяти GPU могут стать одним из основных ограничений. Потребности в памяти можно значительно снизить за счёт изменения размера пакета, смешанного точного обучения, сокращения моделей, уменьшения размерности признаков и внедрения эффективной загрузки данных. Кроме того, исследователи, внедряющие фреймворк на малоресурсных системах, могут рассмотреть возможность использования облачных вычислений или распределённого обучения.

Модульная конструкция предлагаемой структуры позволяет легко вносить изменения в различных медицинских приложениях. В зависимости от клинической задачи учёные могут изменять одну или несколько отдельных моделей прогнозирования, добавлять новые методы объяснения, использовать разные типы медицинских данных вместе или включать модули количественной оценки и калибровки неопределённости без изменения общего рабочего процесса. Эта гибкость помогает сделать фреймворк применимым в самых разных случаях аналитики в здравоохранении, при этом оставаясь воспроизводимым и интерпретируемым.

Регуляторные и этические аспекты:

Более понятные системы ИИ могут значительно помочь в здравоохранении. Но этого недостаточно. Правила регуляторов, предусматривающие прозрачность, подотчетность, конфиденциальность и безопасность пациентов, должны быть соблюдены. Даже если объяснимость может повысить доверие и интерпретируемость, она сама по себе не может обеспечить клиническую достоверность. Ответственное внедрение требует перспективной клинической валидации, оценки справедливости, регуляторного обзора и мониторинга после развертывания. Кроме того, при внедрении этой структуры в будущем следует учитывать конфиденциальность пациентов, надзор клинициста и справедливую работу в различных демографических группах. Чтобы интегрироваться в реальные клинические рабочие процессы, системы ИИ и медицинские специалисты должны взаимодействовать без сбоев. Поэтому информация о объяснимости должна быть частью существующих электронных медицинских карт и платформ поддержки клинических решений, а не отдельных инструментов, которые работают самостоятельно. Окончательный выбор должен принимать врачи, тогда как объяснимый ИИ — это всего лишь вспомогательная технология, которая повышает прозрачность, поддерживает обоснованные доказательства и облегчает коммуникацию между медицинскими работниками и пациентами.

В этой статье представлен воспроизводимый протокол для разработки, оценки и интерпретации объяснимых систем искусственного интеллекта в аналитике здравоохранения. Вклад методологически и ориентирован на рабочие процессы, предоставляя исследователям и клиницистам стандартизированную структуру, которую можно воспроизводить, адаптировать и расширять в различных медицинских приложениях. Он объединяет различные аспекты, такие как предобработка данных, предиктивное моделирование, методы объяснимости и оценка производительности, в едином едином виде. Методология продемонстрировала высокую прогнозную эффективность по нескольким наборам данных в области здравоохранения. В анализе структурированных данных ансамбли моделей являются лучшими результатами, а модели глубокого обучения оказались очень эффективными для задач медицинской визуализации. Кроме того, использование методов объяснения облегчает пользователям понимание моделей, так как предлагает как глобальные, так и локальные интерпретации прогнозных результатов. Таким образом, это не только повышает доверие клиницистов, но и повышает удобство использования моделей. Результаты показывают, что объяснимый ИИ может поддерживать разработку прозрачных и интерпретируемых систем аналитических систем здравоохранения, чтобы найти компромисс между точностью и интерпретируемостью моделей, которые необходимы для надёжной и надежной аналитики в здравоохранении. Таким образом, представленный здесь метод является очень эффективным и простым инструментом для анализа медицинских данных, который может помочь медицинским специалистам использовать технологии ИИ, которым они доверяют. В этой статье представлен воспроизводимый протокол для разработки, оценки и интерпретации объяснимых моделей искусственного интеллекта в аналитике здравоохранения. Интегрируя предварительную обработку данных, предиктивное моделирование, оценку объяснимости, ориентированную на клинициста и ресурсы воспроизводимости в единый рабочий процесс, протокол предоставляет практическую основу для прозрачных исследований в области ИИ в здравоохранении. Рабочий процесс может быть адаптирован к разнообразным наборам данных в здравоохранении и областям приложений, поддерживая воспроизводимую реализацию, оценку и отчётность объяснимых систем машинного обучения.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конкурирующих финансовых интересов или конфликтов интересов, связанных с этой работой. Исследование проводилось независимо без каких-либо коммерческих или финансовых связей, которые могли бы быть расценены как потенциальный конфликт интересов.

Раскрытие информации об использовании искусственного интеллекта

Инструменты искусственного интеллекта использовались для уточнения языка, проверки грамматики и редакционной помощи при подготовке рукописей. Весь научный контент, экспериментальный дизайн, анализ данных, интерпретация и окончательная проверка рукописей выполнялись авторами. Авторы проанализировали и проверили все результаты с помощью искусственного интеллекта, чтобы обеспечить точность, целостность и соответствие рекомендациям журнала.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают благодарность своим соответствующим учреждениям за предоставление необходимой инфраструктуры и исследовательской поддержки для проведения этого исследования. Авторы также признают использование общедоступных наборов данных и открытых инструментов, которые способствовали разработке и оценке предлагаемой объяснимой структуры ИИ. Особая благодарность выражаем экспертам в области области, предоставивших ценные инсайты на этапе оценки, ориентированной на человека.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
GPU WorkstationManufacturer dependentNATraining deep learning models
Jupyter NotebookProject JupyterLatest stable releaseInteractive experiment execution
LIMELIMEVersion 0.2.0Local interpretable explanations
MatplotlibMatplotlib ProjectVersion 3.9Data visualization
MIMIC-III DatabasePhysioNetVersion 1.4Electronic health record analysis
NIH Chest X-ray DatasetNIH Clinical CenterPublic DatasetThoracic disease classification
NumPyNumPy DevelopersVersion 1.26Numerical computing and array operations
OpenCVOpenCV FoundationVersion 4.10Image preprocessing
PandasPandas Development TeamVersion 2.1Data manipulation and preprocessing
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryPublic DatasetDiabetes risk prediction
Python 3.11Python Software FoundationVersion 3.11Primary programming environment
Scikit-learnscikit-learnVersion 1.5Machine learning algorithms and evaluation
SeabornSeabornVersion 0.13Statistical visualization
SHAPSHAPVersion 0.46Feature attribution and explainability
TensorFlowTensorFlowVersion 2.15Deep learning model development
Windows / Ubuntu LinuxMicrosoft / CanonicalNAOperating system
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryPublic DatasetBreast cancer diagnosis

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

Похожие статьи