Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

Воспроизводимый протокол для разработки и оценки объяснимых фреймворков искусственного интеллекта в аналитике здравоохранения

93 просмотров

DOI:

10.3791/71999

31 июля 2026 г.

В этой статье

Краткое содержание

Здесь мы представляем воспроизводимый протокол для разработки и оценки объяснимых моделей искусственного интеллекта для аналитики здравоохранения. Рабочий процесс интегрирует предварительную обработку данных, предиктивное моделирование, объяснимость на основе SHAP, LIME и Grad-CAM, количественную оценку и ориентированную на человека валидацию для поддержки прозрачного и надёжного клинического принятия решений.

Аннотация

Объяснимый искусственный интеллект (XAI) всё больше признаётся незаменимым инструментом для создания надёжных систем ИИ в здравоохранении, где прозрачность и способность объяснять решения являются важными компонентами клинического принятия решений. В данной публикации представлен воспроизводимый экспериментальный подход к разработке и оценке объяснимых систем ИИ для аналитики в здравоохранении. Разработанный конвейер объединяет этапы предварительной обработки данных, предиктивного моделирования, генерации интерпретации и оценки в единый бесшовный рабочий процесс, который может применяться как к структурированным клиническим данным, так и к наборам данных медицинской визуализации. Модели ансамблевого машинного обучения показали высокую предиктивную эффективность на структурированных табличных наборах данных, тогда как модели глубокого обучения эффективны для изучения сложных закономерностей в медицинских данных визуализации. Такие методы, как SHAP, LIME и Grad-CAM, являются глобальными и локальными объяснениями, способствующими интерпретации моделей. Очень полезно. Количественная оценка фреймворка охватывает множество различных метрик, таких как точность, точность, запоминание, балл F1, ROC-AUC, показатели объяснения, точность и стабильность. Результаты показывают, что при контроле экспериментальных условий структура демонстрировала улучшение предсказательной эффективности и качества объяснения в оцененных экспериментальных условиях. Как документ, управляемый протоколом, эта работа подтверждает воспроизводимость и масштабируемость, а также постоянную реализацию другими живыми существами. Эта прозрачная, понятная модель искусственного интеллекта является основой, на которой клиническая поддержка принятия решений и системы аналитической аналитики в здравоохранении завоевывают доверие и использование в широком масштабе.

Введение

Искусственный интеллект (ИИ) стал важной частью современного здравоохранения, поддерживая диагностику, прогнозирование, стратификацию рисков, анализ медицинских изображений и принятие клиническихрешений 1. Достижения в области машинного и глубокого обучения позволили системам здравоохранения обрабатывать большие объемы структурированных и неструктурированных данных, часто достигая прогнозных показателей, сопоставимых или превосходящих традиционные статистическиеподходы 2. Несмотря на эти достижения, многие модели ИИ работают как сложные «чёрные ящики», что затрудняет для клиницистов и заинтересованных сторон в здравоохранении понять, как формируютсяпрогнозы 3. Отсутствие прозрачности может ограничить доверие, внедрение и подотчетность в условиях высокопоставленных медицинскихучреждений 4,5.

Объяснимый искусственный интеллект (XAI) стал перспективным подходом для повышения прозрачности и интерпретируемости моделей машинногообучения 6. Широко используемые методы объяснения, включая SHAP (аддитивные объяснения Шепли), LIME (локально интерпретируемые модели-агностические объяснения) и отображение активации классов с градиентным взвешенным уровнем (Grad-CAM), дают представление о поведении модели с помощью атрибуции признаков и визуальных механизмов объяснения 7,8,9. Эти методы всё чаще применяются в медицинских приложениях для поддержки клинической интерпретации, аудита моделей и поддержки принятиярешений 10,11. Однако сама объяснимость не гарантирует надёжности, воспроизводимости или клинической полезности. Недавние исследования выявили проблемы, связанные с нестабильностью объяснения, чувствительностью к возмущениям, ограниченной валидацией клиницистами и несоответствиями между результатами объяснения и истинным модельнымрассуждением 12,13,14,15.

Помимо проблем с объяснимостью, воспроизводимость остаётся значимой проблемой в исследованиях в области машинного обучения вздравоохранении 16,17,18. Многие опубликованные исследования содержат ограниченную информацию о процедурах предварительной обработки, программных средах, конфигурациях гиперпараметров, стратегиях валидации и рабочих процессах реализации, что затрудняет независимоевоспроизведение 19,20,21. Кроме того, исследования ИИ в здравоохранении часто сосредоточены на предиктивной эффективности, предоставляя ограниченные рекомендации по оценке качества объяснения, оценке с центром клинициста и практических аспектоввнедрения 22. Эти ограничения могут препятствовать переводу объяснимых систем ИИ из исследовательских сред в реальные медицинскиеучреждения 23,24,25,26,27.

Современные рабочие процессы XAI в здравоохранении часто оценивают отдельные методы объяснения или предиктивные модели в изоляции и редко предоставляют стандартизированные протоколы, интегрирующие подготовку данных, предиктивное моделирование, оценку объяснимости, оценку на человеке и ресурсывоспроизводимости 28,29,30,31 . В результате исследователи и практики могут столкнуться с трудностями при воспроизведении рабочих процессов, сравнении методов объяснения или оценке практической полезности объяснимых систем ИИ в различных медицинских наборах данных и области применения. Поэтому необходим комплексный и воспроизводимый протокол для обеспечения последовательного внедрения, оценки и отчетности о объяснённых рабочих процессах ИИв здравоохранении 32, 33, 34, 35.

Здесь мы представляем воспроизводимый протокол для разработки, оценки и интерпретации объяснимых систем искусственного интеллекта в аналитике здравоохранения. Протокол интегрирует предварительную обработку данных, предиктивное моделирование, оценку объяснимости с помощью SHAP, LIME и Grad-CAM, оценку, ориентированную на клинициста, процедуры валидации и ресурсы воспроизводимости в едином рабочем процессе. Цель — предоставить стандартизированную структуру, которая поддерживает прозрачную разработку моделей, оценку качества объяснения и воспроизводимое внедрение в различных медицинских наборахданных 36, 37, 38, 39. Методологический вклад этой работы заключается в интеграции предиктивной аналитики, оценки объяснимости, валидации клинициста и практик воспроизводимости в единый протокол, подходящий для исследований, образования и ориентированных на внедрение исследований в области ИИв здравоохранении 40,41,42,43.

Основной вклад этой работы — не разработка нового алгоритма объяснимости.

Вместо этого он предоставляет стандартизированный, воспроизводимый и экспериментально валидированный протокол, интегрирующий предиктивное моделирование, оценку объяснимости, визуализацию, оценку и ориентированную на человека интерпретацию в единый рабочий процесс, подходящий для аналитики здравоохранения и распространения протоколов на основе JoVE. Основная цель этой работы — не внедрить новый предиктивный алгоритм, а предоставить стандартизированный, воспроизводимый и экспериментально валидированный протокол для реализации объяснимых рабочих процессов искусственного интеллекта в аналитике здравоохранения. Протокол объединяет предварительную обработку данных, предиктивное моделирование, оценку объяснимости, ориентированную на клинициста оценку и ресурсы воспроизводимости в единую структуру, подходящую для внедрения, репликации и образовательного распространения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Все наборы данных, использованные в этом исследовании, были получены из общедоступных и полностью анонимизированных репозиториев, включая UCI Machine Learning Repository, базу данных PhysioNet MIMIC-III и наборы данных NIH по рентгену грудной клетки. Никакой идентифицирующей информации о пациентах не было получено. Исследование соответствовало институциональным рекомендациям по этике исследований для вторичного анализа публично доступных деидентифицированных данных. Официальное одобрение Институционального наблюдательного совета не требовалось, так как напрямую не привлекались человеческие участники и не использовалась защищённая медицинская информация.

1. Обзор экспериментальных рамок

  1. Разработать воспроизводимый, объяснимый конвейер искусственного интеллекта (XAI) для прозрачной аналитики здравоохранения. Организуйте рабочий процесс на уровень данных, уровень предварительной обработки, слой моделирования, слой объяснимости, уровень оценки и уровень визуализации.
  2. Интегрировать эти модули в единый рабочий процесс, способный обрабатывать структурированные клинические данные, электронные медицинские карты и наборы данных медицинской визуализации.
  3. Убедитесь, что каждый модуль способствует воспроизводимости, интерпретируемости, масштабируемости и стандартизированному экспериментальному исполнению.
  4. Спроектировать модульную архитектуру для поддержки непрерывного потока данных и гарантировать, что каждый этап конвейера способствует воспроизводимости, интерпретируемости и масштабируемости на протяжении всего экспериментального рабочего процесса.

2. Вычислительная среда и конфигурация системы

  1. Установите необходимые программные зависимости перед выполнением рабочего процесса, открыв командный терминал и выполнив следующую команду:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Проверьте успешную установку всех программных пакетов и совместимость с версиями, указанными в Таблице материалов , прежде чем приступать к предварительной обработке данных и разработке модели.
  3. Используйте Python 3.11 в качестве основной среды программирования. Установите и настройте NumPy 1.26 и Pandas 2.1 для обработки данных и задач по разработке функций. Установите Scikit-learn 1.5 для разработки и оценки моделей машинного обучения.
  4. Установите TensorFlow 2.15 для обучения и вывода моделей глубокого обучения. Установите SHAP 0.46 и LIME 0.2.0 для анализа объяснимости. Установите OpenCV 4.10 для обработки изображений. Установите Matplotlib 3.9 и Seaborn 0.13 для визуализации данных и отчетности по результатам. Обратитесь к Таблице материалов для полных спецификаций программного обеспечения и необходимых для воспроизводимости деталей реализации.
  5. Настройте вычислительную среду с помощью рабочей станции с многоядерным процессором, ускорением графического процессора (GPU) и достаточным объемом памяти для работы с большими наборами данных в здравоохранении и глубокого обучения.
  6. Установка фиксированных случайных семян для разбиения данных, инициализации модели и процедур обучения для обеспечения воспроизводимости между экспериментальными запусками. Включить механизмы логирования для записи операций предварительной обработки данных, конфигураций моделей, настроек гиперпараметров, процедур обучения и результатов оценки на протяжении всего рабочего процесса.
  7. Настройте архитектуры моделей, параметры оптимизации, скорость обучения, размеры пакетов, настройки обучения и значения гиперпараметров согласно спецификациям, изложенным в Таблице 1. Соблюдайте эти настройки во время экспериментов с репликацией, чтобы обеспечить согласованность с опубликованными результатами.
  8. Ожидаемый результат — полностью настроенная и воспроизводимая вычислительная среда со всеми необходимыми программными пакетами, аппаратными ресурсами, механизмами логирования и настройками конфигурации моделей, доступными для последующего предварительной обработки данных, разработки моделей, анализа объяснимости и оценки.
КомпонентПараметрЦенностьОписание
Случайный лесn_estimators100Количество деревьев
Случайный лесmax_depthНетГлубина дерева
XGBoostlearning_rate0.01Скорость обучения
XGBoostn_estimators100Ускоряющие патроны
CNNЭпохи25Эпохи обучения
CNNbatch_size32Размер партии
CNNОптимизаторАдамАлгоритм оптимизации
MLPhidden_layers2Количество скрытых слоёв
MLPАктивацияReLUФункция активации
Общие заведенияtrain_split70%Коэффициент обучающих данных
Общие заведенияvalidation_split15%Коэффициент валидации
Общие заведенияtest_split15%Коэффициент тестирования

Таблица 1: Детали реализации и конфигурация гиперпараметров.

В этой таблице представлены вычислительная среда, библиотеки программного обеспечения, конфигурации моделей машинного обучения и глубокого обучения, настройки оптимизации, скорости обучения, размеры пакетов, параметры обучения и значения гиперпараметров, используемые при экспериментальной оценке предлагаемого объяснимого фреймворка ИИ.

3. Подготовка и предобработка наборов данных

  1. Выберите общедоступные наборы данных в здравоохранении для обеспечения прозрачности и воспроизводимости экспериментального рабочего процесса.
  2. Используйте четыре репрезентативных медицинских сценария для проверки предлагаемой основы: (i) диагностика рака груди с использованием Dataset по раку молочной железы штата Висконсин, (ii) прогнозирование риска диабета с использованием Pima Indians Diabetes Dataset, (iii) прогнозирование клинических исходов с использованием электронных медицинских записей MIMIC-III, и (iv) классификации торакальных заболеваний с использованием набора данных NIH Chest X-ray. Выбирайте эти наборы данных для оценки структурированных клинических записей, лонгитюдных электронных медицинских карт и медицинских визуализационных методов, часто используемых в системах поддержки принятия решений в здравоохранении.
  3. Импортируйте каждый набор данных в среду Python и разделяйте записи на входные признаки и целевые переменные. Организовывать структурированные клинические данные для задач прогнозирования заболеваний, электронные медицинские карты для анализа долгосрочных результатов и наборы данных медицинской визуализации для задач диагностической классификации. Проверьте целостность каждого набора данных перед переходом к операциям предварительной обработки.
  4. Выявлять и устранять недостающие значения с помощью соответствующих методов импутации. Стандартизировать численные признаки с помощью процедур масштабирования признаков и нормализации для обеспечения сопоставимости между переменными.
  5. Кодировать категориальные переменные с использованием подходящих методов кодирования, основанных на характеристиках набора данных. Проводите выбор признаков с использованием корреляционного анализа и моделей мер важности признаков для выявления наиболее релевантных переменных и снижения размерности данных.
  6. До обучения модели уменьшите размер всех медицинских изображений до 224 224 пикселей. Нормализуйте значения интенсивности пикселей в соответствии с требованиями выбранной архитектуры глубокого обучения. Применяйте методы увеличения данных, включая вращение изображения и горизонтальное переворачивание, чтобы улучшить обобщение модели и снизить перенагон. Проверьте качество изображения и обеспечьте согласованность размеров изображения по всему набору данных.
  7. Оценивайте целостность данных, оценивая полноту, согласованность и согласованность признаков набора данных. Проверьте, правильно ли все записи присвоены соответствующим целевой классам. Изучите характеристики наборов данных, включая размер выборки, количество признаков и модальность данных, как изложено в Таблице 2.
  8. Внедрять процедуры валидации, специфичные для набора данных, чтобы обеспечить методологическую строгость и воспроизводимость. Записывайте размер выборки, распределение классов, стратегию разделения «обучая-валидация-тестирование», меры по предотвращению утечек, процедуры оптимизации гиперпараметров, кросс-валидационный дизайн и внешний протокол тестирования для каждого набора данных. Краткое изложение этих процедур валидации в таблице 3.
  9. Проводите проверки качества предварительной обработки, оценивая обработку недостающих значений, удаление выбросов, масштабирование признаков, категориальное кодирование, сохранение распределения классов и процедуры разделения наборов данных. Проверьте, что операции предварительной обработки применяются последовательно во всех наборах данных.
  10. Подтвердите отсутствие значительных утечек данных при разделении данных. Изучите результаты предварительной проверки, представленные на рисунке 1 , чтобы убедиться, что стандартизированные наборы данных сгенерированы для последующих анализов машинного обучения и объяснимости.
  11. Ожидаемый результат — генерируйте очищенные и стандартизированные наборы данных с отсутствующими значениями, соответствующим образом обработанными, закодированными категориальными переменными, нормализующими числовыми признаками и разделением записей на учебные, валидационные и тестовые подмножества. Убедитесь, что характеристики наборов данных, распределения классов и процедуры валидации соответствуют тем, что указаны в Таблице 2 и Таблице 3, и подтвердите успешную проверку предварительной обработки, как показано на рисунке 1.
Набор данныхТипСэмплыОсобенностиЦель
Рак молочной железыТабличная форма56930Доброкачественные/злокачественные
ДиабетТабличная форма7688Результаты при диабете
MIMIC-IIIEHR~60 000Клинические переменныеСмертность
Рентген грудной клеткиВизуализация~112 000ИзображенияМетки болезней

Таблица 2: Характеристики набора данных и случаи использования в здравоохранении.

В этой таблице представлено сводное описание наборов данных в области здравоохранения, использованных в исследовании, включая тип набора данных, количество выборок, количество признаков, целевые переменные, область применения в здравоохранении и связанные с ними клинические случаи использования. Наборы данных включают структурированные клинические записи, электронные медицинские записи и данные медицинской визуализации, чтобы продемонстрировать применимость рамок в различных сценариях медицинской аналитики.

Набор данныхРазмер выборкиРаспределение классовСтратегия разделенияПредотвращение протечекГиперпараметрический поискПерекрёстная валидацияВнешний тест
Рак молочной железы (UCI, Висконсин)569357 Доброкачественный / 212 Злокачественный70/15/15Предобработка только поездаПоиск по сетке5-кратная стратифицированная CVНезависимый Удерживающий Набор
Диабет индейцев Пима768500 недиабетиков / 268 диабетиков70/15/15Предобработка только поездаПоиск по сетке5-кратная стратифицированная CVНезависимый Удерживающий Набор
МИМИК-III ЭМК5274Когорты, стратифицированные по результатам70/15/15 Уровень пациентаРазделение на уровне пациентаСлучайный поискПятикратное CV на уровне пациентаНезависимый Удерживающий Набор
Рентген грудной клетки NIH112120Пневмония/Нормальный стратифицированный70/15/15Разделение на уровне изображенияСлучайный поиск5-кратная стратифицированная CVНезависимый Удерживающий Набор

Таблица 3: Валидация на уровне набора данных и экспериментальное проектирование.

В этой таблице представлена методология валидации, используемая для каждого набора данных, включая размер выборки, распределение классов, стратегию разделения «обучая-валидация-тест», процедуры предотвращения утечек, методы оптимизации гиперпараметров, кросс-валидационный дизайн и внешние протоколы тестирования. Эти меры были внедрены для обеспечения методологической строгости, воспроизводимости и объективной оценки модели.

figure-protocol-1
Рисунок 1: Валидация конвейера предварительной обработки данных.
Результаты валидации ключевых предварительных операций, выполненных до разработки модели. (A) Анализ отсутствующей стоимости по репрезентативным признакам здравоохранения. (B) Распределение числовой переменной до и после обработки выбросов. (C) Валидация масштабирования признаков с использованием стандартизации. (D) Валидация категориального кодирования. (E) Распределение классов после предварительной обработки. (F) Валидация разбиения данных с проверкой и тестированием обучения. Эти результаты подтверждают успешную предобработку и подготовку наборов данных для предиктивного моделирования и анализа объяснимости. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

4. Архитектура системы Объяснимой ИИ Фреймворка

  1. Организуйте фреймворк с помощью многоуровневой архитектуры для облегчения модульной обработки, повышения прозрачности рабочих процессов и поддержки воспроизводимой реализации. Настройте слой данных для получения и управления необработавшими наборами данных о здравоохранении. Перед началом операций предварительной обработки маршрутизируйте все входящие наборы данных через слой данных.
  2. Выполнять процедуры очистки данных, трансформации, нормализации, инженерии признаков и кодирования в пределах слоя предварительной обработки. Убедитесь, что все операции предобработки завершены до разработки модели.
  3. Разрабатывайте предиктивные модели внутри слоя моделирования с использованием алгоритмов машинного обучения и глубокого обучения. Обучайте модели градиентного бустинга, случайного леса, многослойного перцептрона (MLP) и сверточных нейронных сетей (CNN) с использованием предварительно обработанных наборов данных и оптимизированных конфигураций гиперпараметров.
  4. Применяйте методы объяснимости внутри слоя объяснимости для интерпретации прогнозов модели. Генерируйте объяснения атрибуции признаков с помощью SHAP и LIME для структурированных наборов данных. Генерируйте тепловые карты Grad-CAM для моделей на основе изображений с целью визуализации областей, участвующих в прогнозировании моделей.
  5. Оценивайте предиктивные и объяснимые характеристики в пределах уровня оценки. Рассчитывайте точность, точность, отзыв, показатели F1, ROC-AUC, точность, стабильность и метрики, ориентированные на клинициста. Фиксируйте все результаты оценки для последующего анализа и отчетности.
  6. Генерируйте клинически интерпретируемые визуальные результаты внутри слоя визуализации. Создавайте графики сравнения производительности, визуализации важности признаков, сводные графики SHAP, объяснения LIME, тепловые карты Grad-CAM и ориентированные на клиницистов отчетные панели. Храните все визуальные результаты для включения в итоговый экспериментальный отчёт.
  7. Перед выполнением рабочих процессов ознакомьтесь с полной архитектурой фреймворка, показанной на рисунке 2 .
  8. Ожидаемый результат — генерировать полностью обученные модели машинного обучения и глубокого обучения, включая архитектуры градиентного усиления, случайного леса, CNN и MLP. Храните конфигурации модели, оптимизированные гиперпараметры, обучающие журналы, файлы контрольных точек, выходы объяснённости и артефакты визуализации для последующего анализа оценки и интерпретации.

figure-protocol-2
Рисунок 2: Архитектурная система объяснимой AI-фреймворка для аналитики в здравоохранении. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

5. Выполнение рабочих процессов

  1. Получайте наборы данных по здравоохранению из общедоступных репозиториев и храните их в структурированных форматах, подходящих для анализа машинного обучения и глубокого обучения. Перед началом экспериментальной процедуры ознакомьтесь с полным рабочим процессом, показанным на рисунке 3 .
  2. Выполнять очистку и предварительную обработку данных в соответствии с процедурами, описанными в разделе 3. Нормализуйте числовые переменные с помощью соответствующих методов масштабирования. Кодировать категориальные переменные с помощью подходящих методов кодирования. Выявлять и приписывать недостающие значения с помощью стратегий импутации, специфичных для набора данных. Проверьте качество данных, согласованность признаков и полноту набора данных перед тем, как приступить к разработке модели.
  3. Разделите каждый набор данных на подмножества обучения, проверки и тестирования для поддержки беспристрастной оценки модели. Сохранять распределения классов при разделении наборов данных и внедрять меры по предотвращению утечек, где это применимо. Резервируйте тестовое подмножество исключительно для окончательной оценки модели.
  4. Обучать модели машинного обучения на структурированных наборах данных с использованием алгоритмов на основе ансамбля, включая Gradient Boosting и Random Forest. Обучайте модели глубокого обучения на наборах данных визуализации с использованием архитектур сверточной нейронной сети (CNN), способных изучать признаки пространственных изображений. Обновлять параметры модели итеративно во время обучения и отслеживать результаты валидации после каждого этапа обучения. Применяйте раннюю остановку, когда результаты валидации ухудшаются или не улучшаются согласно заранее установленным критериям остановки.
  5. Оптимизируйте гиперпараметры модели с помощью систематических стратегий поиска, включая сеточный поиск и рандомизированный поиск. Корректируйте скорость обучения, количество оценщиков, глубину дерева, размер партии, количество эпох и другие параметры, специфичные для модели, в зависимости от эффективности валидации. Выберите окончательную модель на основе предиктивных результатов и возможностей обобщения по наборам валидационных данных.
  6. Применяйте методы объяснимости после завершения обучения модели. Генерировать глобальные объяснения с помощью методов атрибуции признаков для выявления переменных, наиболее сильных в прогнозировании моделей. Генерируйте локальные объяснения для анализа отдельных случаев предсказания и оценки поведения модели на уровне выборки. Создайте тепловые карты Grad-CAM для моделей классификации изображений, чтобы выделить области изображения, влияющие на прогнозируемый результат. Храните все результаты объяснений для последующего анализа и отчетности.
  7. Оценивать предсказательные характеристики с использованием точности, точности, отзыва, F1-балла и рабочей характеристики приёмника под кривой (ROC-AUC). Оценивайте качество объяснения с помощью метрик точности и стабильности для оценки надёжности и согласованности объяснения. Сравните производительность модели между наборами данных и методы объяснимости для оценки устойчивости и обобщённости фреймворка.
  8. Генерируйте результаты визуализации и аналитические отчёты для передачи результатов в клинически интерпретируемой форме. Создавайте таблицы сравнения производительности, графики важности признаков, визуализации SHAP, результаты объяснений LIME, тепловые карты Grad-CAM и другие клинически значимые визуализации. Проверьте все визуальные результаты, чтобы обеспечить ясность и последовательность перед подачей отчетов.
  9. Документируйте все операции предварительной обработки, конфигурации моделей, настройки гиперпараметров, процедуры объяснимости, стратегии валидации и результаты оценки. Вести подробные экспериментальные записи для облегчения воспроизводимости и независимого воспроизведения рабочего процесса. Проверяйте согласованность результатов при повторных экспериментальных запусках и архивируйте все артефакты рабочего процесса для будущей ссылки.
  10. Ожидаемый результат — сгенерировать полностью обученную предиктивную модель с оптимизированными гиперпараметрами, сохранёнными весами модели, обучающими журналами, метриками производительности и результатами объяснимости, включая объяснения SHAP, LIME и тепловые карты Grad-CAM. Храните все артефакты модели, отчёты по оценке и результаты визуализации для последующего анализа и оценки воспроизводимости.

figure-protocol-3
Рисунок 3: Сквозной рабочий процесс объяснимого ИИ-пайплайна. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

6. Оценка модели и оценка объяснимости

  1. Оценивать производительность предиктивной модели с использованием стандартных классификационных метрик, включая точность, точность, отзыв, F1-балл и рабочую характеристику приёмника под кривой (ROC-AUC). Рассчитайте точность для измерения общей корректности классификации.
  2. Рассчитайте точность для оценки доли правильно идентифицированных положительных прогнозов. Рассчитывайте отзыв, чтобы оценить способность модели выявлять положительные случаи. Рассчитайте счёт Формулы-1, чтобы сбалансировать точность и воспоминание. Рассчитайте ROC-AUC для оценки дискриминационных результатов по различным порогам классификации.
  3. Применяйте эти метрики оценки последовательно во всех наборах данных и архитектурах моделей для облегчения объективного сравнения производительности. Записывайте все метрические значения и храните результаты оценки для последующих статистических анализов и отчетности.
  4. Оценивайте эффективность объяснимости с помощью метрик точности и стабильности. Рассчитайте достоверность, чтобы определить, насколько сгенерированные объяснения точно отражают прогнозы модели и поведение при принятии решений.
  5. Рассчитайте устойчивость, сравнивая объяснения, полученные из аналогичных входных выборок, и количественно оценивая согласованность результатов объяснений. Проверьте, что значения точности и стабильности соответствуют заранее заданным критериям качества, прежде чем интерпретировать объяснения модели.
  6. Сравните производительность объяснимости между выходами SHAP, LIME и Grad-CAM.
  7. Ожидаемый результат — генерируйте количественные результаты, включая точность, точность, отзыв, F1-балл, ROC-AUC, метрики точности и стабильности. Создавать результаты и визуализации объяснимости, подходящие для научной отчетности, оценки воспроизводимости и клинической интерпретации.

7. Оценка, ориентированная на человека

  1. Нанимите 12 медицинских специалистов, включая 6 врачей, 3 радиолога и 3 аналитика клинических данных. Выбирайте участников с предыдущим опытом принятия клинических решений, интерпретации медицинских изображений, аналитики здравоохранения или электронного обзора медицинских записей. Получите информированное согласие всех участников перед началом процедуры оценки.
  2. Случайным образом выберите 100 случаев из тестовых наборов данных после завершения обучения модели и анализа объяснимости. Сгенерируйте два условия оценки для каждого случая:
    1. Вывод только с предсказаниями и
    2. предсказание сопровождается информацией о объяснимости. Рандомизировать порядок представления кейсов и условия оценки, чтобы минимизировать смещение презентации и эффекты обучения.
  3. Подготовьте стандартизированные формы оценки, содержащие результаты прогнозирования, результаты объяснений и анкеты оценки. Представляйте индивидуальные случаи участникам с помощью компьютерного интерфейса оценки.
  4. Инструктировать участников рассматривать каждый случай самостоятельно, не обсуждая ответы с другими оценщиками. Позволить участникам выполнять все оценки в одинаковых экспериментальных условиях.
  5. Проведите пятибалльный опросник по шкале Ликерта, адаптированный из опубликованных объяснимых исследований оценки искусственного интеллекта. Инструктировать участников оценивать доверие, интерпретируемость и удобство использования для каждого рассмотренного случая. Записывайте ответы на анкету в электронном виде и проверяйте выполнение всех вопросов опроса перед переходом к статистическому анализу.
  6. Измерять объективные показатели клинической полезности в процессе оценки. Фиксируйте согласование решений, сравнивая решения участников с соответствующими эталонными метками или результатами на основе истины. Рассчитайте согласованность решений как процент решений участников, соответствующих результату отчёта.
  7. Фиксируйте время рассмотрения каждого дела, измеряя интервал между представлением дела и подачей окончательного ответа. Рассчитывайте среднее время повторения отдельно для условий только предсказания и прогноза с объяснением.
  8. Рассчитывайте средние показатели доверия, интерпретируемости и удобства использования для всех участников и оценочных случаев. Сравните баллы, полученные при условиях только предсказания и прогноза с объяснением.
  9. Проведите парные t-тесты после завершения всех оценок участников, чтобы определить, статистически значимы ли различия в доверии, интерпретируемости, удобстве использования, согласовании решений и времени рассмотрения. Используйте порог значимости p 0,05 для всех статистических сравнений.
  10. Рассчитайте Fleiss Kappa после сбора ответов всех участников для оценки согласия между оценщиками. Используйте агрегированные оценки участников для определения согласованности оценок среди рецензентов. Интерпретировать ценности Fleiss Kappa в соответствии с установленными руководящими принципами соглашения и фиксировать полученную статистику соглашения.
  11. Краткое изложение демографических данных участников, методологии оценки, дизайна анкеты, процедур статистического анализа, объективных показателей эффективности и результатов согласования между оценщиками в таблице 4.
  12. Проанализировать результаты модели при обоих условиях оценки и сравнить ответы участников по разным условиям. Убедитесь, что объяснения улучшают доверие, интерпретируемость и удобство использования, не негативно сказываясь на качестве принятия решений.
  13. Подтвердите согласованность оценок участников с помощью рассчитанной статистики Fleiss Kappa. Записывайте все результаты оценки для последующего отчёта и оценки воспроизводимости.
  14. Ожидаемый результат — генерировать рейтинги доверия клиницистов, оценки интерпретируемости, оценки удобства использования, меры согласования решений, статистику времени рассмотрения, результаты парных t-тестов и статистику межоценочных согласований. Подготовьте количественные доказательства, описывающие медицинскую полезность, интерпретируемость и надёжность объяснимой системы искусственного интеллекта.
ПараметрЦенность
Эксперты12
Врачи6
Радиологи3
Аналитики клинических данных3
Рассмотренные дела100
Проектирование оценкиРандомизированное (только предсказание против предсказания+объяснения)
Геодезический инструмент5-балльная шкала Ликерта
Оценка доверияИнтерпретируемость, доверие, удобство использования
Статистический тестПарный t-тест (p 0.05)
Надёжность между рейтингамиFleiss Kappa
Объективные показателиСоглашение о принятии решения, время рассмотрения

Таблица 4: Протокол оценки, ориентированный на человека, и дизайн оценки клиницистами.

В этой таблице представлена система оценки клинициста, используемая для оценки интерпретируемости, надёжности и удобства использования объяснимой системы ИИ. Обобщена информация о демографии участников, методологии обзора случаев, дизайне опроса, процедурах статистического анализа, оценке надёжности между оценщиками и объективных мерах оценки.

8. Валидация и оценка воспроизводимости

  1. Провести исследования валидации и абляции для оценки надёжности и надёжности предлагаемой структуры. Определите признаки с высокими баллами важности с помощью выбранных методов объяснимости. Постепенно удалять важные признаки и переучить предсказательные модели после каждого этапа удаления признаков.
  2. Оценивайте производительность модели после каждого абляционного эксперимента с использованием точности, точности, воспоминания, показателей F1 и ROC-AUC. Сравните полученные показатели эффективности с базовой моделью, чтобы определить вклад отдельных признаков в прогнозные результаты.
  3. Оценивайте устойчивость объяснения, генерируя объяснения для аналогичных входных образцов с помощью SHAP, LIME и Grad-CAM. Сравнивайте результаты объяснения по повторным оценкам и количественно оценивайте согласованность с использованием заранее заданных метрик устойчивости. Проверьте, что объяснения остаются стабильными при незначительных изменениях входных данных и повторяющихся экспериментальных запусках.
  4. Записывайте все экспериментальные процедуры на протяжении всего рабочего процесса. Операции предварительной обработки данных, процедуры разбиения наборов данных, архитектуры моделей, настройки гиперпараметров, обучающие конфигурации, методы объяснимости, стратегии валидации и метрики оценки. Храните все параметры конфигурации и экспериментальные результаты в структурированном формате для облегчения воспроизводимости и независимой проверки.
  5. Проверьте все экспериментальные записи для обеспечения полноты и согласованности. Убедитесь, что рабочий процесс можно воспроизвести с помощью задокументированных процедур, конфигурационных файлов и программных спецификаций. Поддерживать модульную структуру рабочего процесса для облегчения адаптации протокола для будущих исследований и поддерживать преобразование в видеооснованный экспериментальный протокол, соответствующий методологическим требованиям JoVE.

9. Ресурсы воспроизводимости

  1. Выполнять все эксперименты с фиксированными случайными семенами, чтобы обеспечить воспроизводимые результаты при повторяющихся запусках. Поддерживать исходный код, скрипты предобработки, конфигурационные файлы, спецификации среды, параметры модели и скрипты визуализации в общедоступном репозитории.
  2. Предоставить подробные инструкции по сбору наборов данных, предварительной обработке, выполнению экспериментов, обучению моделей, генерации объяснимости, процедурам валидации и регенерации всех представленных таблиц и рисунков. Архивируйте все компоненты рабочего процесса, необходимые для независимой репликации, включая спецификации программного обеспечения, рабочие процессы предварительной обработки, конфигурационные файлы, инструкции доступа к набору данных, контрольные точки модели и визуализационные ресурсы.
  3. Краткое описание программных ресурсов, рабочих процессов предварительной обработки, конфигурационных файлов, инструкций доступа к набору данных и воспроизводимых ресурсов, используемых на протяжении всего фреймворка, в таблице 5.
  4. Ожидаемый результат — Сгенерировать полный воспроизводимый экспериментальный пакет, содержащий скрипты предварительной обработки, конфигурационные файлы, обученные модели, контрольные точки модели, результаты объяснимости, отчёты по валидации, артефакты визуализации, спецификации программного обеспечения и документацию, необходимую для независимого копирования и проверки предлагаемого фреймворка.
РесурсОписание
Исходный кодСкрипты реализации Python для предварительной обработки данных, обучения моделей, объяснимости и оценки
Файл окруженияrequirements.txt содержит зависимости и версии пакетов
Конфигурационные файлыНастройки архитектуры моделей, гиперпараметры и конфигурации экспериментов
Исправлены случайные семяСемя = 42, используемое для воспроизводимых экспериментов
Инструкции доступа к набору данныхСсылки и процедуры для получения наборов данных по государственному здравоохранению
Скрипты предварительной обработкиСкрипты для очистки данных, нормализации, кодирования и выбора функций
Скрипты для генерации фигурокСкрипты для регенерации всех рукописных фигур
Скрипты генерации таблицСкрипты для воспроизведения отчетных таблиц и метрик
Примеры входных данныхПримеры наборов данных и входные файлы
Примеры выходных данныхРезультаты прогнозирования, объяснения и отчёты по оценке

Таблица 5: Ресурсы воспроизводимости и экспериментальные активы.

В этой таблице представлены ресурсы, предоставленные для поддержки экспериментальной воспроизводимости, включая исходный код, скрипты предварительной обработки, конфигурационные файлы, спецификации среды, инструкции доступа к набору данных, фиксированные случайные настройки seed, скрипты генерации фигурок и примеры файлов ввода/вывода, необходимые для воспроизведения сообщаемых результатов.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Мы тщательно оценили компонент объяснительного ИИ во всей нашей конвейерной системе, оценивая, насколько хорошо он предсказывается по различным типам медицинских данных, включая как структурированные клинические данные, так и медицинские изображения. Результаты показали стабильную прогнозную эффективность по оценённым наборам данных. Среди протестированных моделей модель градиентного бустинга показала наивысшую точность — 97,4%, за ней следует модель случайного леса с 94,2%. Методы глубо...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

В этом исследовании был разработан и оценён воспроизводимый объяснимый рабочий процесс искусственного интеллекта (XAI) для аналитики в здравоохранении, который интегрирует предиктивное моделирование, оценку объяснимости, оценку, ориентированную на клинициста, и ресурсы воспроизводимости в одном протоколе. Результаты показали, что модели машинного обучения на основе ансамбля, особенно Gradient Boosting и Random Forest, достигли наивысших предиктивных показателей на оцененных структурирова...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторы заявляют, что у них нет конкурирующих финансовых интересов или конфликтов интересов, связанных с этой работой. Исследование проводилось независимо без каких-либо коммерческих или финансовых связей, которые могли бы быть расценены как потенциальный конфликт интересов.

Раскрытие информации об использовании искусственного интеллекта

Инструменты искусственного интеллекта использовались для уточнения языка, проверки грамматики и редакционной помощи при подготовке рукописей. Весь научный контент, экспериментальный дизайн, анализ данных, интерпретация и окончательная проверка рукописей выполнялись авторами. Авторы проанализировали и проверили все результаты с помощью искусственного интеллекта, чтобы обеспечить точность, целостность и соответствие рекомендациям журнала.

Благодарности

Авторы выражают благодарность своим соответствующим учреждениям за предоставление необходимой инфраструктуры и исследовательской поддержки для проведения этого исследования. Авторы также признают использование общедоступных наборов данных и открытых инструментов, которые способствовали разработке и оценке предлагаемой объяснимой структуры ИИ. Особая благодарность выражаем экспертам в области области, предоставивших ценные инсайты на этапе оценки, ориентированной на человека.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
GPU WorkstationManufacturer dependentNATraining deep learning models
Jupyter NotebookProject JupyterLatest stable releaseInteractive experiment execution
LIMELIMEVersion 0.2.0Local interpretable explanations
MatplotlibMatplotlib ProjectVersion 3.9Data visualization
MIMIC-III DatabasePhysioNetVersion 1.4Electronic health record analysis
NIH Chest X-ray DatasetNIH Clinical CenterPublic DatasetThoracic disease classification
NumPyNumPy DevelopersVersion 1.26Numerical computing and array operations
OpenCVOpenCV FoundationVersion 4.10Image preprocessing
PandasPandas Development TeamVersion 2.1Data manipulation and preprocessing
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryPublic DatasetDiabetes risk prediction
Python 3.11Python Software FoundationVersion 3.11Primary programming environment
Scikit-learnscikit-learnVersion 1.5Machine learning algorithms and evaluation
SeabornSeabornVersion 0.13Statistical visualization
SHAPSHAPVersion 0.46Feature attribution and explainability
TensorFlowTensorFlowVersion 2.15Deep learning model development
Windows / Ubuntu LinuxMicrosoft / CanonicalNAOperating system
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryPublic DatasetBreast cancer diagnosis

Ссылки

  1. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  2. Ribeiro MT, Singh S, Guestrin C. Why should I trust you. Explaining the predictions of any classifier. Presented at: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-44. doi:10.1145/2939672.2939778.
  3. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 2020;128(2):336-59.
  4. Tjoa E, Guan C. A survey on explainable artificial intelligence: Toward medical XAI. IEEE Trans Neural Netw Learn Syst. 2021;32(11):4793-813.
  5. Samek W, et al. Explainable AI: Interpreting, Explaining and Visualizing Deep Learning. Springer; Cham; 2019.
  6. Arrieta AB, et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  7. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. Wiley Interdiscip Rev Data Min Knowl Discov. 2020;10(5):e1312.
  8. Topol E. Deep medicine: How artificial intelligence can make healthcare human again. Nat Med. 2020;25:44-56.
  9. Esteva A, et al. A guide to deep learning in healthcare. Nat Med. 2019;25(1):24-9.
  10. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28:31-38.
  11. Doshi-Velez F, Kim B. Towards a rigorous science of interpretable machine learning. arXiv. 2021. doi:10.48550/arXiv.1702.08608.
  12. Molnar C. Interpretable Machine Learning. Lulu Press; 2022.
  13. Rudin C. Stop explaining black box machine learning models for high-stakes decisions and use interpretable models instead. Nat Mach Intell. 2019;1(5):206-15.
  14. Zhang Q, Zhu S. Visual interpretability for deep learning: A survey. Front Inf Technol Electron Eng. 2020;21:27-39.
  15. Holzinger A, Biemann C, Pattichis CS, Kell DB. What do we need to build explainable AI systems for the medical domain. arXiv. 2020. Available at: https://arxiv.org/abs/1712.09923.
  16. McDermott MB, et al. Reproducibility in machine learning for health. Nat Med. 2021;27:1016-23.
  17. Kelly CJ, et al. Key challenges for delivering clinical impact with AI. BMC Med. 2019;17:195.
  18. Ahmad MA, Teredesai A, Eckert C. Interpretable machine learning in healthcare. Proc ACM Conf Health Inference Learn. 2021;4:1-7.
  19. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable AI in healthcare. Lancet Digit Health. 2021;3(11):e745-50.
  20. Carvalho DV, Pereira EM, Cardoso JS. Machine learning interpretability: A survey on methods and metrics. Inf Fusion. 2020;58:82-115.
  21. Chen RJ, et al. Synthetic data in healthcare: A narrative review. Nat Biomed Eng. 2021;5:493-97.
  22. Zhou B, et al. Learning deep features for discriminative localization. Presented at: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016. p. 2921-29.
  23. Vellido A. The importance of interpretability and visualization in machine learning for applications in medicine and health care. Expert Syst Appl. 2020;146:113222.
  24. Lipton ZC. The mythos of model interpretability. Commun ACM. 2018;61(10):36-43.
  25. Guidotti R, et al. A survey of methods for explaining black box models. ACM Comput Surv. 2018;51(5):93.
  26. Suresh H, Guttag J. A framework for understanding unintended consequences of machine learning. Commun ACM. 2021;64(12):42-50.
  27. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-40.
  28. Rajkomar A, Dean J, Kohane I. Machine learning in medicine. N Engl J Med. 2019;380(14):1347-58.
  29. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. Presented at: Advances in Neural Information Processing Systems. 2017;30:4765-74.
  30. Agarwal R, et al. Neural additive models: Interpretable machine learning with neural nets. Presented at: Advances in Neural Information Processing Systems. 2021;34:4699-711.
  31. Singh C, Murdoch WJ, Yu B. Hierarchical interpretations for neural network predictions. Proc Natl Acad Sci U S A. 2020;117(32):19950-57.
  32. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(5):176-85.
  33. Wang F, Preininger A. AI in health care: Applications, challenges, and future directions. Annu Rev Biomed Data Sci. 2019;2:221-52.
  34. Azizi S, et al. Big self-supervised models advance medical AI. Nat Med. 2021;27(8):1431-42.
  35. Zhang Y, et al. Explainable deep learning for healthcare: Methods, applications and challenges. IEEE Access. 2020;8:120455-475.
  36. Holzinger A, et al. Explainable AI methods: A brief overview. Mach Learn Knowl Extr. 2021;3(2):606-27.
  37. Rudin C, Radin J. Why are we using black box models in AI when we do not need to  A lesson from an explainable AI competition. Nat Mach Intell. 2019;1(5):206-15.
  38. Doshi-Velez F, et al. Accountability of AI Under the Law: The Role of Explanation. Harvard University; Cambridge; 2020.
  39. Kaur H, et al. Interpreting interpretability: Understanding data scientists' use of interpretability tools for machine learning. Presented at: Proceedings of the CHI Conference on Human Factors in Computing Systems; 2020. p. 1-14.
  40. Caruana R, et al. Intelligible models for healthcare: Predicting pneumonia risk and hospital 30-day readmission. Presented at: Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2015. p. 1721-30.
  41. Mangalote IAC, et al. Development and validation of a class imbalance-resilient cardiac arrest prediction framework incorporating multiscale aggregation, ICA and explainability. IEEE Trans Biomed Eng. 2025;72(5):1674-84.
  42. Ansari MY, Mangalote IAC, Masri D, Dakua SP. Neural network-based fast liver ultrasound image segmentation. Presented at: 2023 International Joint Conference on Neural Networks; 2023. p. 1-8.
  43. Dakua SP, et al. Artificial intelligence enabled biomineralization for eco-friendly nanomaterial synthesis: Charting future trends. Nano Select. 2025;6(5):e202400118.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

233233XAI