Методическая статья

Воспроизводимый экспериментальный протокол разработки и оценки моделей объяснимого искусственного интеллекта в системах здравоохранения

2 просмотров

DOI:

10.3791/73848

15 сентября 2026 г.

В этой статье

Краткое содержание

В данном протоколе представлен воспроизводимый рабочий процесс разработки, оценки и интерпретации моделей объяснимого искусственного интеллекта в здравоохранении. Он объединяет стандартизированную подготовку данных, разработку моделей, методы обеспечения объяснимости, количественную оценку и практику обеспечения воспроизводимости для повышения прозрачности, надежности и клинической применимости.

Аннотация

Искусственный интеллект (И) все чаще внедряется в качестве ценного инструмента для принятия клинических решений, прогнозирования заболеваний, медицинской диагностики и персонализированного здравоохранения. Однако отсутствие прозрачности, непоследовательное применение методов объяснимого искусственного интеллекта (XAI) и ограниченная воспроизводимость остаются серьезными препятствиями для надежного развертывания моделей ИИ в клинических условиях. В данной работе предлагается систематический, воспроизводимый и прозрачный протокол разработки, оценки и интерпретации объяснимых моделей ИИ для применения в здравоохранении. Рабочий процесс начинается с настройки вычислительной среды, за которой следуют сбор и характеристика данных, предобработка, конструирование признаков, разработка модели, оптимизация гиперпараметров, оценка прогностической эффективности, анализ объяснимости, статистическая валидация и оценка воспроизводимости. Протокол включает методы XAI, такие как SHapley Additive exPlanations (SHAP), Local Interpretable Model-agnostic Explanations (LIME), Gradient-weighted Class Activation Mapping (Grad-CAM), интегрированные градиенты, визуализация внимания и контрфактуальные объяснения для создания как глобальных, так и локальных интерпретаций модели. В протоколе особое внимание уделяется нескольким ключевым компонентам, включая подготовку стандартизированных наборов данных здравоохранения, разработку стабильных моделей машинного обучения, оценку прогностической эффективности, создание клинически значимых объяснений и статистическую оценку воспроизводимости в повторяющихся экспериментах. Интегрируя разработку модели, объяснимость, количественную и качественную оценку, статистическую валидацию и анализ воспроизводимости в единый рабочий процесс, данный протокол предоставляет комплексную основу для создания прозрачных и воспроизводимых моделей ИИ для применения в сфере здравоохранения.

Введение

И стал неотъемлемым компонентом современного здравоохранения, обеспечивая интеллектуальный анализ сложных клинических данных и поддерживая принятие обоснованных медицинских решений1. Стремительная цифровизация здравоохранения за счет электронных медицинских карт, систем медицинской визуализации, носимых устройств и геномных технологий привела к созданию огромных объемов гетерогенных данных, которые требуют передовых вычислительных подходов для эффективной интерпретации2.

Алгоритмы машинного обучения (ML) и глубокого обучения (DL) продемонстрировали выдающиеся возможности в извлечении значимых закономерностей из многомерных наборов данных здравоохранения, что позволило повысить точность диагностики, прогнозирование заболеваний и оценку исходов лечения пациентов3. Модели на базе ИИ были успешно применены в радиологии, патологии, кардиологии, онкологии, офтальмологии и других медицинских специальностях для помощи клиницистам в выявлении заболеваний на более ранних стадиях и рекомендации персонализированных стратегий лечения4. Эти технологии также способствовали оптимизации рабочих процессов, снижению вариабельности диагностики и улучшению использования ресурсов здравоохранения5.

Последние достижения в области компьютерного оборудования, облачных вычислений и AI-фреймворков с открытым исходным кодом ускорили разработку и внедрение интеллектуальных приложений для здравоохранения6. В результате искусственный интеллект (И) стал ключевой технологией, обеспечивающей развитие прецизионной медицины и систем поддержки принятия клинических решений7. Несмотря на эти успехи, широкое внедрение ИИ в повседневную клиническую практику остается ограниченным, поскольку многие высокоэффективные модели практически не дают представления о том, как формируются их прогнозы8.

Большинство алгоритмов глубокого обучения функционируют как сложные модели «черного ящика», внутренний процесс принятия решений в которых трудно понять клиницистам и исследователям9. Хотя эти модели часто демонстрируют отличные прогностические показатели, отсутствие прозрачности подрывает доверие пользователей и создает трудности для клинической валидации, получения разрешений от регулирующих органов и обеспечения безопасности пациентов10. Специалисты здравоохранения должны иметь возможность обосновать решения, принятые с помощью ИИ, прежде чем внедрять их в рутинную клиническую практику, особенно в медицинских условиях с высоким уровнем риска1.

XAI стал эффективным подходом к повышению прозрачности и интерпретируемости моделей машинного обучения12. Вместо того чтобы рассматривать прогностические модели как «черные ящики», методы XAI предоставляют информацию о признаках, областях изображения или клинических переменных, которые влияют на конкретные прогнозы13. Такие объяснения позволяют клиницистам лучше понять поведение модели, выявить потенциальные систематические ошибки и определить, соответствуют ли решения, созданные ИИ, установленным медицинским знаниям14.

Для применения в сфере здравоохранения было предложено несколько методов обеспечения интерпретируемости. Метод SHapley Additive explanations (SHAP) оценивает вклад каждого признака в прогноз модели на основе теории кооперативных игр15. Метод Local Interpretable Model-agnostic Explanations (LIME) создает упрощенную модель для объяснения прогнозов «черного ящика»16. Для задач анализа медицинских изображений с использованием моделей глубокого обучения применяется метод Gradient-weighted activation maps (Grad-CAM), который создает тепловые карты, визуально указывающие области изображения, повлиявшие на решение о классификации17. Комбинация этих методов значительно повысила прозрачность систем ИИ в различных областях здравоохранения18.

Несмотря на растущее внимание к методам объяснимости в сфере здравоохранения, их применение в литературе остается неоднородным. Исследователи расходятся не только в выборе стратегий предварительной обработки данных, но и в проектировании архитектуры моделей, метриках оценки и даже в самих методах интерпретации19. Кроме того, во многих работах сообщается о высокой прогностической точности, однако отсутствует тщательная оценка качества объяснений или их воспроизводимости20.

Воспроизводимость является одним из основных препятствий в современной науке об искусственном интеллекте (И). В публикациях часто не указываются версия программного обеспечения, вычислительная среда, конвейер предобработки данных, настройки гиперпараметров, инициализация случайного числа (random seed) и конфигурации оборудования21. Из-за этого независимые исследователи часто не могут воспроизвести опубликованные результаты или проверить описанные методы, используя другие наборы данных или программные платформы2. Отсутствие детальной документации является одним из факторов, затрудняющих проведение сравнительного анализа (бенчмаркинга), совместные исследования и клиническое внедрение систем ИИ23.

Признавая эти проблемы, ряд организаций и регулирующих органов подчеркнули важность прозрачного, надежного и воспроизводимого ИИ для применения в здравоохранении24. Существующие рекомендации по отчетности улучшили методологическое описание, но в основном они описывают то, что должно быть отражено в отчете, а не предоставляют стандартизированные экспериментальные процедуры, которые исследователи могли бы внедрить напрямую25. Следовательно, сохраняется потребность в комплексном протоколе, который объединял бы подготовку наборов данных, разработку модели, анализ объяснимости, статистическую оценку и методы обеспечения воспроизводимости в единый экспериментальный рабочий процесс26.

Стандартизированный экспериментальный протокол дает несколько преимуществ сообществу специалистов по ИИ в здравоохранении. Кроме того, он способствует методологической последовательности, облегчает сравнение независимых исследований, повышает прозрачность вычислительных экспериментов и обеспечивает надежную валидацию опубликованных результатов27. Стандартизированные рабочие процессы также помогают в обучении, проведении совместных исследований и нормативной оценке благодаря четко документированным процедурам, которые воспроизводимы в различных лабораториях и медицинских учреждениях28.

Был разработан и протестирован воспроизводимый экспериментальный протокол для обучения и оценки моделей ИИ в системах здравоохранения. Протокол определяет стандарты настройки вычислительной среды, предварительной обработки наборов данных здравоохранения, разработки моделей машинного обучения, применения методов XAI, оценки прогностической эффективности, проведения статистической валидации и оценки воспроизводимости29. Интеграция таких компонентов в единый рабочий процесс, вероятно, повысит прозрачность, надежность и воспроизводимость исследований ИИ в здравоохранении, а также поможет в разработке доверенных интеллектуальных систем здравоохранения30.

Протокол

Для проведения эксперимента по валидации использовался общедоступный деидентифицированный набор данных Pima Indians Diabetes Dataset; исследование не затрагивало идентифицируемые записи пациентов и не требовало набора новых участников. Таким образом, информированное согласие и одобрение институционального IRB/этического комитета не требовались, а весь анализ проводился в соответствии с условиями использования набора данных и правилами проведения исследований данного учреждения.

В приведенном примере валидации используется общедоступный набор данных Pima Indians Diabetes Dataset, содержащий 768 записей для бинарного прогнозирования диабета. К этому набору данных был применен полный девятиэтапный основной рабочий процесс. Девять основных этапов включали выбор и валидацию набора данных, настройку вычислительной среды, предварительную обработку данных, разделение набора данных, разработку и обучение модели, оценку прогностической и вычислительной эффективности, анализ интерпретируемости, статистическую валидацию и оценку воспроизводимости. Внешняя валидация и экспертная клиническая оценка были оставлены в качестве дополнительных модулей валидации и не проводились в данном примере. На Рисунке 1 представлена схема основного протокола, а в Таблице 1 обобщены только девять основных этапов, реализованных в данной валидации; дополнительные внешняя валидация и экспертная клиническая оценка описаны в Протоколе отдельно и не включены в девять экспериментальных этапов.

1. Выбор и валидация набора данных здравоохранения

  1. Выберите набор данных Pima Indians Diabetes Dataset в качестве основного набора данных для практического примера валидации. Проверьте источник набора данных, размер выборки, целевую переменную прогнозирования, распределение классов и структуру данных.
  2. Примените предопределенные критерии включения, исключения и качества данных. Удалите дубликаты и недостоверные записи перед разработкой модели.
  3. Запишите источник набора данных, его характеристики, задачу прогнозирования, распределение классов, критерии включения и исключения, а также стратегию разделения данных в Таблице 2.
  4. Примените критерии принятия решений для выбора набора данных и модели:
    1. Определите цель прогнозирования перед выбором набора данных, архитектуры модели, стратегии предобработки или метода интерпретируемости.
    2. Приведите модальность набора данных в соответствие с целью прогнозирования. Выберите табличные данные для структурированных клинических переменных, данные визуализации для медицинских изображений, временные ряды для физиологических сигналов, текстовые данные для клинических описаний или мультимодальные данные, если для одного и того же пациента или объекта исследования доступны дополняющие друг друга модальности.
    3. Оцените потенциальные наборы данных по размеру выборки, доступности результатов, распределению классов, количеству пропусков, качеству аннотаций, клинической значимости, полноте данных и доступности. Выберите набор данных, который удовлетворяет предопределенным требованиям.
    4. Используйте традиционные модели машинного обучения для структурированных табличных данных, если размер выборки, вычислительные ресурсы или требования к интерпретируемости ограничивают использование сложных архитектур. Выбирайте архитектуры глубокого обучения при наличии достаточного объема обучающих данных и многомерных входных данных, таких как медицинские изображения, физиологические сигналы или клинические тексты.
    5. Выбирайте мультимодальные архитектуры только в том случае, если для одного и того же пациента или объекта исследования доступны несколько модальностей и они могут быть надежно сопоставлены без риска утечки данных. Выберите операции предобработки в соответствии с характеристиками выбранной модальности данных.
    6. Выберите методы интерпретируемости в соответствии с моделью и модальностью данных. Используйте модельно-независимые методы, такие как SHAP или LIME, для соответствующих табличных моделей, и специфичные для конкретной модальности методы, такие как Grad-CAM, для моделей на основе изображений, где это применимо.
    7. Документируйте обоснование выбора набора данных, стратегии предобработки, модели и метода интерпретируемости. Сохраните эти решения как часть протокола воспроизводимости.

2. Настройка вычислительной среды для разработки модели XAI

  1. Настройте операционную систему, ЦП, ОЗУ, хранилище и ГП в соответствии с требованиями выбранной модели. Создайте изолированную среду Python и установите необходимые библиотеки для машинного обучения, глубокого обучения, статистического анализа, визуализации и XAI.
  2. Запишите фактическую вычислительную среду, архитектуру модели и гиперпараметры, использованные при проведенной валидации, в Таблице 3. Укажите оптимизатор, скорость обучения, размер пакета, максимальное количество эпох, функцию потерь, параметры регуляризации, стратегию валидации, конфигурацию ранней остановки, конфигурацию случайного числа (random seed), методы интерпретируемости, аппаратное обеспечение, операционную систему, версию Python и версии соответствующих программных библиотек. Отделите эти экспериментально использованные настройки от общих или рекомендуемых настроек протокола.
  3. Используйте конфигурацию, указанную в Таблице 3, при воспроизведении валидации набора данных Pima Indians Diabetes Dataset и соответствующих результатов прогнозирования, интерпретируемости, статистического анализа и воспроизводимости.
  4. Запустите скрипт валидации, чтобы подтвердить успешный импорт пакетов, загрузку набора данных, выполнение модели и генерацию выходных данных. Сохраните итоговую конфигурацию среды для обеспечения воспроизводимости.

3. Подготовка и характеристика наборов данных здравоохранения для разработки моделей XAI

  1. Выбор и получение набора данных здравоохранения
    1. Выберите набор данных здравоохранения, подходящий для определенной задачи клинического прогнозирования. Оцените подходящие наборы данных в соответствии с целью исследования, типом данных, размером выборки, качеством аннотаций, балансом классов и клинической значимостью.
    2. Отдавайте предпочтение общедоступным эталонным наборам данных, если они адекватно решают задачу прогнозирования и облегчают независимую валидацию.
    3. Перед получением институциональных или внутренних наборов данных получите необходимые этические одобрения, разрешения учреждения и авторизацию на доступ к данным. Получите выбранный набор данных из проверенного репозитория или авторизованной институциональной базы данных.
    4. Сохраните исходные файлы набора данных без изменений и зафиксируйте поставщика данных, версию, информацию о получении, условия лицензирования, критерии включения, критерии исключения и сопроводительные метаданные. Организуйте набор данных по отдельным каталогам для необработанных данных, аннотаций, метаданных и дополнительной информации.
  2. Характеристика набора данных здравоохранения
    1. Определите переменные-предикторы, метки исходов, типы признаков, модальности данных и распределение классов. Определите количество субъектов, образцов, размерность признаков и доступные аннотации.
    2. Подтвердите, что характеристики набора данных совместимы с выбранным методом ИИ.
    3. Используйте набор данных Pima Indians Diabetes Dataset в качестве единственного рабочего экспериментального набора данных для валидации основного девятиэтапного протокола. Включайте дополнительные наборы данных, перечисленные в Таблице 2, только для демонстрации применимости общего протокола к клиническим табличным данным, электронным медицинским картам, дермоскопическим изображениям, физиологическим временным рядам и медицинским изображениям. Не используйте эти дополнительные наборы данных для обучения моделей, тестирования, статистической валидации или получения представленных экспериментальных результатов.
  3. Оценка качества набора данных
    1. Проверьте набор данных на наличие дублирующих записей, поврежденных файлов, пропущенных значений, ошибок аннотирования и некорректных записей данных. Удалите подтвержденные дубликаты и исправьте проверенные нарушения форматирования. Задокументируйте все процедуры контроля качества набора данных.
    2. При использовании мультимодальных наборов данных проверьте соответствие данных визуализации, клинических, лабораторных и физиологических данных с помощью идентификаторов субъектов.
    3. Удалите дублирующие или противоречивые записи, обработайте пропущенные значения, стандартизируйте числовые признаки, закодируйте категориальные переменные и примените специфическую для каждой модальности предобработку. Разделите набор данных на независимые обучающую, валидационную и тестовую выборки. См. Рисунок 2 для ознакомления с рабочим процессом подготовки, предобработки, разделения и оценки качества набора данных здравоохранения.
  4. Обеспечение конфиденциальности данных и этического соответствия
    1. Удалите прямые идентификаторы из данных здравоохранения. Примените процедуры анонимизации или псевдонимизации, если это необходимо. Обрабатывайте информацию о здоровье пациентов в соответствии с применимыми этическими требованиями, требованиями по защите данных, информированным согласием и институциональными требованиями.
    2. Зафиксируйте применимое этическое одобрение, отказ от него, процедуры управления данными, методы анонимизации и рабочий процесс подготовки набора данных.
    3. Оцените потенциальную алгоритмическую предвзятость, сравнивая эффективность модели в соответствующих демографических или клинических подгруппах, если такая информация доступна и этически допустима.
    4. Задокументируйте целевое использование, целевую популяцию, ограничения модели, потенциальные режимы сбоев, требования к человеческому надзору, а также применимые этические, нормативные требования по защите данных и требования здравоохранения.
    5. Зафиксируйте выявленные ограничения справедливости и соображения ответственного ИИ в составе итоговой документации модели.
      ПРИМЕЧАНИЕ: Получите стандартизированный и задокументированный набор данных здравоохранения, который подходит для разработки модели ИИ, соответствует этическим нормам и не содержит серьезных выявленных противоречий.

4. Предобработка и разделение медицинских данных для обучения модели ИИ

  1. Проведите контроль качества
    1. Проверьте набор данных на наличие дубликатов записей, пропущенных значений, некорректных значений, противоречивых меток, выбросов и поврежденных файлов.
    2. Удалите или исправьте некорректные наблюдения в соответствии с заранее определенными критериями и зафиксируйте все случаи исключения. Проверьте согласованность предикторных переменных и меток результатов.
  2. Обработайте пропущенные данные
    1. Количественно оцените объем пропусков для каждой переменной. Примените заранее определенную стратегию импутации или исключения.
    2. Оцените параметры импутации, используя только обучающую выборку, и примените полученное преобразование к валидационным и тестовым данным.
  3. Нормализуйте и преобразуйте данные
    1. Примените масштабирование признаков, нормализацию, кодирование, снижение размерности или другие преобразования, требуемые выбранной моделью. Выполняйте все зависящие от данных преобразования, используя только обучающую выборку.
    2. Примените полученные преобразования без изменений к валидационным и тестовым данным.
  4. Количественно оцените дисбаланс классов в обучающей выборке. Примените взвешивание классов, SMOTE, оверсэмплинг или аугментацию только к обучающему набору данных. Сохраните исходное распределение в валидационном и тестовом наборах данных.
  5. Убедитесь, что ни один субъект, дубликат наблюдения, аугментированный образец, статистика предобработки, критерий отбора признаков или синтетический образец не являются общими для обучающей и оценочных выборок.

5. Разработка и настройка модели XAI

  1. Определите архитектуру модели, указав модальности входных данных, операции предварительной обработки, кодировщики признаков для каждой модальности, механизм слияния признаков, слой прогнозирования и модуль интерпретируемости.
  2. Выберите архитектуру машинного или глубокого обучения в соответствии с задачей прогнозирования и модальностью входных данных. Настройте входной слой, компоненты извлечения признаков, скрытые слои, выходной слой и функции активации. Определите оптимизатор, скорость обучения, размер пакета (batch size), функцию потерь, количество эпох, параметры регуляризации, дропаут (dropout), условие ранней остановки и график изменения скорости обучения.
  3. Оптимизируйте гиперпараметры, используя только обучающую и валидационную выборки.
  4. Запишите окончательный вариант архитектуры и конфигурацию гиперпараметров в Таблицу 3.
  5. Проверьте совместимость размерностей входных и выходных данных перед началом обучения.
    ПРИМЕЧАНИЕ: Создайте полностью сконфигурированную модель XAI, включающую подходящую архитектуру, определенные гиперпараметры и интегрированные методы обеспечения интерпретируемости.

6. Обучение, оптимизация и сохранение модели XAI

  1. Загрузите предопределенные обучающий и валидационный наборы данных, а также окончательную конфигурацию модели. Инициализируйте модель, используя заданный случайный seed и параметры обучения.
  2. Обучите модель, используя указанный оптимизатор, функцию потерь, размер пакета (batch size) и критерии остановки.
  3. Отслеживайте показатели валидации и сохраните контрольную точку (checkpoint), соответствующую предопределенному критерию выбора модели. Оцените выбранную контрольную точку на независимом тестовом наборе данных без дальнейшей оптимизации.
  4. Сохраните обученную модель, конфигурацию предобработки, гиперпараметры, случайный seed и лог обучения.
    ПРИМЕЧАНИЕ: Получите оптимизированную модель XAI, обученную и валидированную с использованием подготовленного набора данных из сферы здравоохранения. Сохраните наиболее эффективную модель, гиперпараметры, логи обучения, конфигурацию предобработки и вычислительную среду для обеспечения воспроизводимости.

7. Оценка прогностической и вычислительной эффективности

  1. Оценка прогностической эффективности
    1. После завершения обучения модели и оптимизации гиперпараметров загрузите оптимизированную модель и независимый тестовый набор данных. Параметры обученной модели и конвейер предобработки должны оставаться неизменными во время тестирования.
    2. Сгенерируйте прогнозы для всех образцов в тестовом наборе данных. Сравните полученные прогнозы с соответствующими истинными метками.
  2. Расчет показателей эффективности
    1. Выберите метрики оценки в соответствии с типом задачи прогнозирования.
    2. Для задач классификации, по мере необходимости, рассчитайте точность (accuracy), прецизионность (precision), полноту (recall), специфичность (specificity), F1-меру (F1-score), сбалансированную точность (balanced accuracy), коэффициент корреляции Мэтьюза (MCC) и площадь под ROC-кривой (AUC-ROC). Для задач регрессии, по мере необходимости, рассчитайте среднюю абсолютную ошибку (MAE), среднеквадратичную ошибку (RMSE), коэффициент детерминации (R2) и другие соответствующие показатели.
  3. Оценка обобщающей способности и устойчивости модели
    1. Если такие данные доступны, оцените модель с использованием внешнего набора данных, собранного независимо от обучающего набора.
    2. Для оценки переносимости предпочтительно использовать внешние наборы данных, полученные в другом медицинском учреждении, географическом регионе или от другой популяции пациентов.
    3. При наличии лонгитюдных наборов данных проведите временную валидацию с использованием данных, собранных за более поздний период.
    4. При наличии многоцентровых данных проведите многоцентровую валидацию, оценивая итоговую модель отдельно в каждом из участвующих учреждений.
    5. При возможности проведите географическую валидацию с использованием независимой популяции из другого географического региона.
    6. Приведите данные о различиях в эффективности и доверительных интервалах между обучающим и внешними наборами данных.
  4. Оценка вычислительной эффективности
    1. Измерьте время обучения модели в заданном вычислительном окружении, время вывода и тестирования при идентичных вычислительных условиях, а также потребление памяти, размер модели и загрузку оборудования.
    2. Повторите вычислительные измерения в нескольких независимых запусках.
    3. Рассчитайте среднее время выполнения, чтобы снизить влияние экспериментальной вариативности.
  5. Сравнение эффективности моделей
    1. Выберите подходящие общепринятые методы машинного или глубокого обучения для сравнительной оценки.
    2. Оцените предлагаемую модель XAI и модели-компараторы с использованием одного и того же набора данных. Примените идентичные процедуры предобработки и метрики оценки ко всем сравниваемым моделям.
    3. Проведите все сравнительные эксперименты в одном и том же вычислительном окружении.
      ПРИМЕЧАНИЕ: Получите экспериментальные доказательства прогностической стабильности и воспроизводимости при протестированных вычислительных условиях и на данном наборе данных.

8. Генерация и оценка результатов XAI

  1. Формирование объяснений модели
    1. Загрузите оптимизированную модель XAI. Выберите образцы для оценки, которые не использовались при обучении модели. Примените предопределенные методы интерпретируемости, не изменяя обученную модель или конвейер предобработки.
    2. Сформируйте глобальные и локальные объяснения модели
      1. Сформируйте глобальные объяснения для характеристики общего поведения прогностической модели.
      2. Сформируйте локальные объяснения для характеристики отдельных прогнозов модели.
      3. Примените SHAP к набору данных по диабету индейцев племени Пима (Pima Indians Diabetes Dataset) для получения глобальных и локальных объяснений прогнозов табличной модели.
      4. Постройте сводный график SHAP (summary plot) для визуализации общего направления и величины вклада признаков.
      5. Постройте график важности признаков SHAP, используя средние абсолютные значения SHAP, чтобы ранжировать признаки по их общему вкладу в прогнозы модели.
      6. Постройте каскадный график SHAP (waterfall plot) для репрезентативного прогноза из тестового набора, чтобы проиллюстрировать вклад признаков для конкретного пациента.
      7. Постройте график зависимости признаков SHAP (feature-dependence plot), чтобы изучить связь между выбранным признаком и его вкладом в выходные данные модели.
      8. Примените LIME к репрезентативным прогнозам из тестового набора для получения локальных объяснений отдельных прогнозов модели.
      9. Сформируйте контрфактуалное объяснение для конкретного пациента, чтобы проиллюстрировать изменения признаков, связанные с изменением прогнозируемого результата.
      10. Выберите дополнительные методы интерпретируемости в соответствии с модальностью данных и архитектурой модели.
      11. При необходимости используйте Grad-CAM или карты значимости (saliency maps) для совместимых моделей на основе изображений, визуализацию внимания (attention visualizations) для архитектур на базе трансформеров и интегрированные градиенты (Integrated Gradients) для дифференцируемых моделей.
      12. Рассматривайте Grad-CAM, картирование значимости, визуализацию внимания и интегрированные градиенты как общие варианты протокола, зависящие от модальности; не интерпретируйте и не представляйте их как экспериментальные результаты валидации набора данных Pima Indians Diabetes Dataset, если соответствующие анализы фактически не проводились.
    3. Применение методов интерпретируемости к валидации данных Pima
      1. Примените SHAP и LIME к набору данных Pima Indians Diabetes Dataset для получения глобальных и локальных объяснений прогнозов табличной модели.
      2. Создайте визуализации SHAP: сводный график, график важности признаков, каскадный график и график зависимости признаков на основе результатов валидации Pima.
      3. Сформируйте локальное объяснение LIME для репрезентативных прогнозов из тестового набора.
      4. Сформируйте контрфактуалное объяснение для конкретного пациента, чтобы проиллюстрировать изменения признаков, связанные с изменением прогноза модели.
      5. Рассматривайте Grad-CAM, визуализацию внимания, картирование значимости и интегрированные градиенты как варианты интерпретируемости, зависящие от модальности, для других типов медицинских данных и архитектур моделей.
      6. Не представляйте Grad-CAM, визуализацию внимания, картирование значимости или интегрированные градиенты в качестве экспериментальных выводов при валидации данных Pima, если соответствующие анализы фактически не проводились.
  2. Оценка качества объяснений
    1. Оцените, отражают ли созданные объяснения процесс прогнозирования модели. Оцените стабильность объяснений при повторных экспериментальных запусках и согласованность результатов объяснения при идентичных вычислительных условиях.
    2. При необходимости оцените чувствительность результатов объяснения к изменениям входных данных. Сравните полученные объяснения с доступными предметными знаниями или экспертными интерпретациями.
    3. Выявите прогностические признаки или анатомические области, которые соответствуют установленным медицинским знаниям, если такие сравнения возможны.
    4. Зафиксируйте степень согласия или несогласия между сформированными объяснениями и доступной клинической интерпретацией.
  3. Количественная оценка неопределенности прогноза
    1. Рассчитайте оценки достоверности прогноза для оцениваемых образцов, используя метод оценки неопределенности, подходящий для выбранной архитектуры модели и области применения в здравоохранении.
    2. При необходимости примените метод Monte Carlo dropout, прогнозирование на основе ансамблей, байесовский вывод, конформное прогнозирование или другой валидированный подход к оценке неопределенности.
    3. При использовании Monte Carlo dropout повторите итерации стохастического прогнозирования и вычислите средний прогноз и прогностическую дисперсию для каждого оцениваемого образца.
    4. Укажите достоверность прогноза или интервалы неопределенности вместе с соответствующими прогнозами модели.
    5. Оцените, позволяют ли оценки неопределенности выявить прогнозы с более низкой надежностью или повышенной ошибкой. Сохраните метод оценки неопределенности, параметры, случайные числа (seeds) и полученные результаты оценки неопределенности для обеспечения воспроизводимости.
  4. Документирование и сохранение результатов интерпретируемости
    1. Сохраните все сформированные показатели важности признаков, тепловые карты, карты значимости, визуализации внимания и интерпретации для конкретных пациентов. Сохраните результаты интерпретируемости в стандартизированных форматах файлов. Архивируйте результаты вместе с обученной моделью и конфигурацией предобработки.
    2. Зафиксируйте вычислительные настройки, параметры объяснения, время выполнения и версии программного обеспечения, использованные для генерации объяснений. Сохраните полную документацию по интерпретируемости для облегчения независимого анализа и обеспечения воспроизводимости.
  5. Количественная оценка качества объяснений
    1. Оцените достоверность (faithfulness) объяснения путем систематического возмущения или маскирования признаков, определенных как важные, и измерения соответствующего изменения выходных данных модели. Рассчитайте показатель достоверности объяснения, сравнив величину атрибуции с результирующим изменением прогноза модели.
    2. Оцените стабильность объяснения, создавая объяснения для повторных запусков, возмущенных входных данных или клинически схожих образцов, и вычисляя сходство между полученными паттернами атрибуции. Рассчитайте показатель недостоверности (infidelity), измерив расхождение между прогнозируемым изменением выхода и изменением, оцененным на основе атрибуции объяснения при контролируемых возмущениях входных данных.
    3. Для объяснений медицинских изображений оцените точность локализации, используя определенную экспертом область интереса (ROI), если доступны эталонные аннотации. Оцените клиническую полезность, получив независимые оценки от квалифицированных клинических экспертов с использованием предопределенных критериев интерпретации.
    4. Рассчитайте каппу Коэна или каппу Фляйсса, если несколько экспертов независимо оценивают релевантность или согласованность объяснений.
      ПРИМЕЧАНИЕ: Сформируйте глобальные и локальные объяснения, характеризующие прогностическое поведение обученной ИИ-модели. Сохраните результаты интерпретируемости и соответствующие конфигурации для прозрачной интерпретации и воспроизводимой оценки.

9. Проведение статистической валидации и оценки воспроизводимости

  1. Выполните статистическую валидацию
    1. Выберите статистические методы в соответствии с целью исследования, дизайном эксперимента, распределением данных и характеристиками оцениваемых переменных.
    2. Непрерывные переменные следует представлять в виде среднего значения ± стандартное отклонение или медиана и межквартильный размах, в зависимости от ситуации, а категориальные переменные — в виде абсолютных значений и процентов.
    3. Выполните пятикратную перекрестную проверку на обучающем наборе данных для оценки стабильности работы модели и представьте значения точности (accuracy), AUC-ROC, прецизионности (precision), полноты (recall) и F1-меры в виде среднего значения. ± стандартное отклонение по фолдам. Оцените 95%-е доверительные интервалы для показателей эффективности на независимом тестовом наборе с использованием 1 0 бутстреп-ресемплов.
    4. Сравните предлагаемую модель с базовыми моделями CNN, Random Forest и SVM, используя тест МакНемара для парного сравнения точности, тест Делонга для сравнения коррелированных значений AUC-ROC и парный бутстреп-тест с 10 итерациями ресэмплинга для сравнения F1-меры.
    5. Приведите соответствующий статистический критерий и точное значение p для каждого сравнения, используя двусторонний уровень значимости α = 0.05.
  2. Статистическое сравнение эффективности моделей
    1. Сравните предлагаемую модель объяснимого ИИ с выбранными базовыми моделями современного уровня на основе машинного и глубокого обучения.
    2. Примените t-критерий Стьюдента t—тест или U-критерий Манна-Уитни при сравнении двух групп, в зависимости от ситуации. Для соответствующих параметрических сравнений с участием более чем двух групп применяйте однофакторный дисперсионный анализ (ANOVA). Для соответствующих непараметрических сравнений с участием более чем двух групп применяйте критерий Краскела-Уоллиса.
    3. Рассмотрите p < 0,05 статистически значимо, как указано в оригинальной рукописи.
    4. Используйте двусторонний уровень значимости α = 0,05 для всех заранее определенных статистических сравнений; приведите соответствующие значения статистик критерия и p-значения.
    5. Приведите 95%-е доверительные интервалы для основных показателей прогностической эффективности.
    6. При необходимости используйте бутстреп-ресемплинг для оценки доверительных интервалов показателей эффективности. Для сравнения коррелированных значений ROC-AUC в случаях, когда одни и те же субъекты оцениваются двумя моделями, используйте тест Делонга. Для сравнения парных результатов категориальной классификации, полученных для одних и тех же субъектов, используйте тест Макнемара. При необходимости используйте процедуры парного бутстрепа для сравнения F1-меры или других производных показателей эффективности.
    7. Оцените калибровку с помощью калибровочных кривых, наклона и свободного члена калибровочной прямой, а также оценки Брайера при наличии вероятностных прогнозов.
    8. Для валидации обработанного набора данных по диабету индейцев племени Пима (Pima Indians Diabetes Dataset) используйте предопределенное парное статистическое сравнение, указанное для предлагаемой и базовых моделей. Последовательно применяйте выбранный тест к парным прогнозам на тестовой выборке или к измерениям производительности при повторных запусках, в зависимости от типа сравнения. Используйте двусторонний уровень значимости α = 0,05, а также укажите значение статистики теста и точное значение p. Не сообщайте о проведении альтернативных статистических тестов, если их результаты не представлены в разделе «Результаты».
    9. Примените двусторонние критерии и интерпретируйте статистическую значимость, используя заранее определенный порог p < 0.05.
  3. Оценка робастности модели
    1. Повторите полную процедуру обучения и оценки 10 раз, используя различные случайные значения seed, при этом сохраняя предопределенное разделение набора данных, процедуры предобработки, архитектуру модели, гиперпараметры, программную среду и протокол оценки.
    2. Запишите значения AUC-ROC, точности (accuracy) и F1-меры для каждого независимого запуска и рассчитайте среднее значение. ± стандартное отклонение по 10 повторностям.
    3. Сравните полученные значения производительности в нескольких повторных запусках для оценки стабильности прогнозирования и воспроизводимости при различных вариантах случайной инициализации.
  4. Оценка объяснимости и воспроизводимости
    1. Формируйте атрибуции признаков, карты внимания или иные результаты интерпретации в нескольких экспериментальных запусках, если предусмотрена оценка стабильности объяснений. Проведите количественное сравнение полученных результатов интерпретации между повторными запусками, используя соответствующий показатель сходства или меру согласованности на основе ранжирования.
    2. Для текущей валидации набора данных по диабету у индейцев племени Пима не следует приводить количественные метрики стабильности объяснений, если соответствующие повторные выводы объяснений и анализы не были выполнены.
    3. Оцените степень согласованности между объяснениями, сгенерированными моделью, и интерпретациями клиницистов при наличии соответствующих клинических оценок. Для оценки согласованности между экспертами рассчитайте коэффициент каппа Коэна или каппа Фляйсса, в зависимости от ситуации.
  5. Воспроизводимость документации
    1. Сохраните исходные данные, процедуры предварительной обработки, исходный код, обученные модели, конфигурации гиперпараметров, результаты интерпретируемости, скрипты статистического анализа и полученные результаты.
    2. Зафиксируйте программную среду и конфигурацию оборудования, использованные на протяжении всего рабочего процесса. Независимо повторите выполнение полного рабочего процесса, используя архивные файлы и конфигурации.
    3. Сравните результаты воспроизведенного прогнозного анализа с исходными экспериментальными данными, а объяснения воспроизведенной модели — с исходными результатами анализа интерпретируемости.
    4. Зафиксируйте любые различия, наблюдаемые в процессе репликации. Обновите экспериментальную документацию, чтобы отразить наблюдения по воспроизводимости, выявленные в ходе независимого выполнения.
      ПРИМЕЧАНИЕ: Получите статистически подтвержденные результаты прогностической эффективности и интерпретируемости, которые могут быть оценены в ходе повторяющихся экспериментов. Сохраните достаточную вычислительную, аналитическую и методологическую документацию для обеспечения независимой проверки всего рабочего процесса.
  6. Контрольный список по воспроизводимости
    1. Зафиксируйте название набора данных, версию, дату получения, источник, критерии включения, критерии исключения и итоговый размер выборки. Зафиксируйте все операции по предварительной обработке, параметры преобразования, настройки нормализации, процедуры отбора признаков и правила разделения данных.
    2. Зафиксируйте операционную систему, ЦП, ГП, объем оперативной памяти, версию Python, версии фреймворков и версий библиотек. Зафиксируйте все спецификации архитектуры модели и гиперпараметры.
    3. Зафиксируйте оптимизатор, скорость обучения, размер пакета, количество эпох, функцию потерь, параметры регуляризации и критерии ранней остановки. Зафиксируйте все значения случайных чисел (seed) и настройки генератора случайных чисел.
    4. Сохраните веса обученной модели и конфигурации предобработки. Сохраните журналы обучения, скрипты оценки, скрипты статистического анализа и результаты интерпретируемости. Зафиксируйте версии модели и программного обеспечения, использованные в финальных экспериментах.
    5. Сохраните полную вычислительную среду, необходимую для независимого воспроизведения.
    6. Документируйте доступность исходного кода, наборов данных, весов моделей и вспомогательных материалов с учетом этических, правовых, лицензионных ограничений и требований конфиденциальности.
    7. Независимо повторите выполнение архивного рабочего процесса и сравните воспроизведенные результаты с исходными.
    8. Задокументируйте все требования к воспроизводимости, используя стандартизированный контрольный список.

Результаты

Предложенная структура XAI была реализована с использованием набора данных Pima Indians Diabetes Dataset в качестве репрезентативного набора данных из сферы здравоохранения. Pima Indians Diabetes Dataset использовался как единственный набор данных для экспериментальной валидации. Все представленные результаты прогнозирования, объяснимости, статистические данные и результаты воспроизводимости были получены на основе этого набора данных. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10, OhioT1DM и BraTS 2021 не подвергались экспериментальной оценке и включены только в качестве примеров, иллюстрирующих применимость общего протокола к различным модальностям медицинских данных. Полный набор данных использовался после удаления недействительных и дублирующих записей, а перед разработкой модели были выполнены указанные операции по предварительной обработке. Набор данных был разделен на независимые обучающую, валидационную и тестовую подвыборки с использованием предопределенной стратегии стратифицированного разделения. Независимость образцов между тремя подвыборками поддерживалась для минимизации возможности утечки данных.

Прогностическая модель была настроена с использованием предопределенной архитектуры и гиперпараметров. Модель обучали с помощью оптимизатора Adam с заданными скоростью обучения и размером пакета в течение максимум 100 эпох. Была применена процедура ранней остановки на основе потерь на валидационной выборке, и была сохранена модель с наилучшими показателями валидации. Для разделения набора данных, инициализации модели и проведения повторных экспериментов были заданы случайные значения (random seeds) для обеспечения воспроизводимости результатов.

Обученная модель была оценена на независимой тестовой выборке с использованием таких показателей, как точность (accuracy), прецизионность (precision), полнота (recall), специфичность, F1-мера, коэффициент корреляции Мэтьюза (MCC), площадь под ROC-кривой (AUC-ROC) и средняя точность (AP). Предложенная модель сравнивали с заранее определенными базовыми моделями, используя идентичные процедуры предобработки, разбиение данных и протоколы оценки. На основе прогнозов для независимой тестовой выборки были построены ROC-кривые (кривые рабочих характеристик приемника), кривые прецизионности-полноты и матрица ошибок.

Для оценки стабильности работы была выполнена пятикратная перекрестная проверка на обучающих данных. Были рассчитаны 95% доверительные интервалы для основных показателей эффективности, а также проведено заранее определенное статистическое сравнение предлагаемой модели с базовыми моделями.

Пятикратная перекрестная проверка показала точность 93.01 ± 0.48%, AUC-ROC 0.954 ± 0.07, прецизионность 92.42 ± 0.87%, полноту 93.02 ± 0.45% и F1-меру 92.72 ± 0.62%. 95% бутстреп-доверительные интервалы, рассчитанные на основе 1 0 ресэмплов, составили 0.897–0.973 для точности, 0.890–0.970 для прецизионности, 0.80–0.963 для полноты, 0.87–0.965 для F1-меры и 0.931–0.984 для AUC-ROC. Статистическое сравнение с базовыми моделями CNN, Random Forest и SVM проводилось с использованием теста Макнемара для оценки точности, теста Делонга для AUC-ROC и парного бутстреп-тестирования с 1 0 ресэмплами для F1-меры.

Полная процедура обучения и оценки была повторена в 10 независимых запусках с использованием различных случайных значений seed. Повторные запуски обеспечили AUC-ROC 0,957 ± 0,008, точность 93,24 ± 0,74% и F1-меру 92,35 ± 0,92%, что указывает на относительно низкую вариабельность между повторными исполнениями. Показатели эффективности, полученные в ходе повторных запусков, были обобщены с использованием среднего значения и стандартного отклонения. Вариабельность между запусками была изучена, чтобы определить, остается ли прогностическая эффективность стабильной при многократном исполнении.

В данном практическом примере внешняя валидация не проводилась, так как независимый внешний набор данных не использовался. Соответственно, все представленные результаты прогнозирования, статистические данные и результаты воспроизводимости были получены на основе набора данных Pima Indians Diabetes с использованием предопределенных разделений на обучающую, валидационную и независимую тестовую выборки. Внешняя валидация оставлена в протоколе в качестве дополнительной процедуры для случаев, когда доступен независимый набор данных из другого учреждения, популяции, географического региона или за другой временной период.

Пояснения к моделям были созданы с использованием методов интерпретируемости, применимых к табличному набору данных Pima Indians Diabetes Dataset, включая SHAP и LIME. Была проведена оценка глобальной значимости признаков, а также сформированы локальные пояснения для конкретных пациентов с использованием отложенных тестовых выборок. Результаты интерпретации были зафиксированы вместе с соответствующими предсказаниями моделей и значениями признаков для обеспечения воспроизводимости и последующего анализа.

Для ясности данный практический пример включал девять основных этапов рабочего процесса, указанных в Таблице 1. Внешняя валидация и оценка клиническими экспертами были оставлены в качестве дополнительных модулей валидации общего протокола. Внешняя валидация не проводилась, так как независимый внешний набор данных не использовался, а оценка клиническими экспертами не проводилась, поскольку в данный практический пример не была включена официальная экспертная комиссия. Соответственно, эти дополнительные модули не считаются частью девятиэтапного экспериментального рабочего процесса и не представлены в качестве экспериментальных результатов.

Процедуры предварительной обработки и разделения данных позволили получить стандартизированный набор данных, пригодный для разработки модели. Дубликаты и противоречивые записи были удалены, пропущенные значения обработаны в соответствии с заранее определенной стратегией, числовые признаки стандартизированы, а набор данных разделен на независимые обучающую, валидационную и тестовую выборки. Характеристики результирующего набора данных и процедуры предварительной обработки обобщены в Таблице 2. Общий рабочий процесс подготовки и предварительной обработки набора данных здравоохранения проиллюстрирован на Рисунке 2, тогда как рабочий процесс экспериментальной подготовки, предварительной обработки, разделения и оценки качества, примененный конкретно к набору данных Pima Indians Diabetes Dataset, показан на Рисунке 3. Итоговая вычислительная среда, архитектура модели и конфигурация гиперпараметров, использованные для получения представленных результатов, обобщены в Таблице 3.

Выполнение разделов 3 и 4 позволило получить стандартизированный набор данных здравоохранения, пригодный для разработки модели. В ходе процедур предобработки были удалены дубликаты и противоречивые записи, заполнены пропущенные значения, стандартизированы числовые признаки, закодированы категориальные переменные (где это было применимо), а также произведено разделение набора данных на обучающую, валидационную и тестовую выборки. Полученные данные обеспечили стандартизированный ввод, необходимый для последующей разработки модели.

После завершения Разделов 5 и 6 сконфигурированная модель продемонстрировала стабильную сходимость в процессе обучения. Кривые обучения показали одновременное снижение потерь при обучении и валидации, а также рост точности при обучении и валидации. Оптимизация гиперпараметров улучшила обобщающую способность модели, при этом признаков существенного переобучения выявлено не было. Для обеспечения воспроизводимости оптимизированная модель была архивирована вместе с окончательной архитектурой, настройками гиперпараметров, версиями программного обеспечения, значениями случайных чисел (seed) и весами обученной модели. Спецификации обучения модели и результаты оптимизации обобщены в Таблице 4, а соответствующие кривые обучения при обучении и валидации представлены на Рисунке 4.

В разделе 7 оценивалась прогностическая эффективность модели с использованием стандартизированных показателей эффективности. Оцениваемые метрики классификации включали точность (accuracy), прецизионность (precision), полноту (recall), специфичность (specificity), F1-меру (F1-score), коэффициент корреляции Мэтьюза (MCC), AUC-ROC и среднюю точность (AP). Предложенная модель сравнивалась с заранее определенными базовыми моделями с использованием тех же разделений наборов данных, процедур предобработки и протокола оценки. Сравнение прогностической эффективности представлено в Таблице 5, в то время как ROC-кривые, кривые прецизионности-полноты, матрица ошибок и сравнительные показатели эффективности показаны на Рисунке 5.

В продолжение Раздела 8 были созданы как глобальные, так и локальные объяснения предсказаний модели для оценки ее интерпретируемости. Объяснения модели были созданы с помощью SHAP и LIME для табличного набора данных Pima Indians Diabetes Dataset, а для иллюстрации изменения предсказания было создано специфичное для конкретного пациента контрфактуальное объяснение. SHAP использовался для генерации глобальной значимости признаков, а также визуализаций в виде диаграмм waterfall и зависимостей признаков для конкретных пациентов, в то время как LIME применялся для создания локальных объяснений на основе отложенных тестовых выборок. Соответствующие результаты интерпретируемости представлены на Рисунке 6.

На заключительном этапе протокола оценивались статистическая достоверность и воспроизводимость рабочего процесса. Полный рабочий процесс был повторен в 10 независимых запусках с использованием различных случайных чисел (random seeds) при сохранении той же стратегии разделения набора данных, параметров предобработки, архитектуры модели, гиперпараметров, программной среды и процедур оценки. Повторные запуски дали значение AUC-ROC 0.957 ± 0.08, точность (accuracy) 93.24 ± 0.74% и F1-меру 92.35 ± 0.92%, что указывает на относительно низкую вариабельность между повторными итерациями.

В настоящей валидационной работе количественная оценка стабильности объяснений не проводилась. Несмотря на то, что для набора данных Pima Indians Diabetes Dataset были созданы объяснения с помощью SHAP и LIME, отдельный анализ ранговой корреляции или перекрытия признаков между запусками не выполнялся. Следовательно, численные показатели стабильности объяснений или согласованности атрибуции не приводятся. Количественная оценка стабильности объяснений сохранена в общем протоколе в качестве необязательной процедуры проверки воспроизводимости для тех случаев, когда доступны результаты многократного получения объяснений.

Статистические сравнения оценивали с использованием заранее определенного порога значимости p < 0.05. В соответствующих случаях применялись двусторонние статистические тесты; для количественной оценки статистической значимости и неопределенности наблюдаемых различий в эффективности приводились соответствующие статистики теста, значения p и 95% доверительные интервалы. Результаты экспериментальной статистической валидации и воспроизводимости, включая показатели перекрестной проверки, доверительные интервалы, статистические сравнения и вариабельность при повторных запусках, обобщены в Таблице 6. Соответствующий статистический анализ и анализ воспроизводимости представлены на Рисунке 7.

Эти результаты предоставили экспериментальные доказательства прогностической стабильности и воспроизводимости при протестированных вычислительных условиях и наборе данных. Вычислительная среда, характеристики набора данных, процедуры предобработки, конфигурация модели, статистический анализ и настройки интерпретируемости, необходимые для независимого воспроизведения, были задокументированы в соответствии с контрольным списком воспроизводимости, представленным в Таблице 7. Экспертная клиническая оценка сгенерированных результатов XAI в приведенном в данной работе примере валидации не проводилась.

В целом, применение данного протокола позволило создать стандартизированный набор данных здравоохранения, подходящий для разработки моделей ИИ, и оптимизированную модель с использованием предопределенных настроек гиперпараметров. Описанный рабочий процесс обеспечил систематическую оценку прогностической способности, генерацию объяснений модели с помощью соответствующих методов XAI, а также статистическую оценку устойчивости и воспроизводимости модели. В совокупности результаты продемонстрировали возможность реализации и воспроизводимости предложенного рабочего процесса XAI в экспериментальных условиях, рассмотренных в примере валидации.

figure-results-1
Рисунок 1: Девятиэтапный основной рабочий процесс разработки воспроизводимых и объяснимых моделей ИИ в здравоохранении.Рабочий процесс включает следующие этапы: (1) определение задачи прогнозирования в здравоохранении, (2) конфигурация вычислительной среды, (3) сбор и валидация набора данных, (4) предобработка данных, (5) разделение набора данных, (6) обучение прогностической модели, (7) оценка прогностической эффективности, (8) анализ объяснимости и (9) статистическая валидация и оценка воспроизводимости. Внешняя валидация и оценка клиническими экспертами рассматриваются как дополнительные расширения протокола и не включены в основной девятиэтапный рабочий процесс. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-2
Рисунок 2: Рабочий процесс подготовки и предобработки набора данных для здравоохранения. (A) Сбор данных здравоохранения из клинических записей, медицинских изображений, физиологических сигналов и мультимодальных источников данных. (B) Интеграция и предобработка данных, включая обработку пропущенных значений, нормализацию, удаление шума и аугментацию. (C) Разделение набора данных на обучающую, валидационную и тестовую выборки. (D) Оценка качества, демонстрирующая распределение классов, нормализацию признаков и результаты предобработки перед разработкой модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-3
Рисунок 3: Экспериментальный рабочий процесс подготовки, предварительной обработки, разделения и оценки качества набора данных Pima Indians Diabetes Dataset. Рабочий процесс включает получение набора данных, оценку качества данных, обработку недопустимых и пропущенных значений, стандартизацию численных признаков, разделение набора данных на обучающую, валидационную и независимую тестовую подвыборки, а также окончательную проверку качества перед разработкой модели. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-4
Рисунок 4: Кривые обучения при тренировке и валидации предлагаемой модели с использованием набора данных Pima Indians Diabetes Dataset. (A) Потери при обучении и валидации на протяжении всего периода обучения. (B) Точность при обучении и валидации на протяжении всего периода обучения. (C) Увеличенный вид потерь в течение эпох 50–10. (D) Увеличенный вид точности в течение эпох 50–10. Лучшие показатели валидации были достигнуты на 78-й эпохе с потерями при валидации 0.142 и точностью валидации 94.6%. Ранняя остановка была инициирована на 8-й эпохе при значении patience, равном 10 эпохам. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-5
Рисунок 5: Экспериментальная оценка прогностической эффективности предлагаемой структуры XAI с использованием независимой тестовой выборки (n = 154). (A) ROC-кривая (кривая рабочих характеристик приемника), демонстрирующая дискриминационную способность предлагаемой модели XAI и базовых моделей. (B) Кривые точности-полноты (PR-кривые), демонстрирующие показатели точности и полноты предлагаемой модели XAI и базовых моделей. (C) Матрица ошибок предлагаемой модели XAI на независимой тестовой выборке с соответствующими значениями точности, чувствительности (полноты) и специфичности. (D) Сравнение точности, прецизионности, полноты, специфичности, F1-меры, коэффициента корреляции Мэтьюза (MCC), площади под ROC-кривой (AUC) и средней точности (AP) для всех оцениваемых моделей. Все количественные результаты, представленные на этом рисунке, относятся к валидационному эксперименту наборе данных по диабету индейцев племени Пима (Pima Indians Diabetes Dataset). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-6
Рисунок 6: Результаты интерпретируемости, полученные на основе прогнозов предложенной модели на независимом тестовом наборе данных Pima Indians Diabetes Dataset. (A) Глобальный сводный график SHAP, показывающий распределение вкладов признаков во всем тестовом наборе. (B) График важности признаков SHAP, основанный на средних абсолютных значениях SHAP. (C) Индивидуальный для пациента водопадный график SHAP, показывающий вклад отдельных признаков в прогнозируемую вероятность диабета. (D) Локальное объяснение LIME, показывающее вклад признаков для тестового пациента №125. (E) График зависимости SHAP, показывающий взаимосвязь между значениями глюкозы и их вкладами SHAP. (F) Индивидуальное для пациента контрфактуальное объяснение, показывающее минимальные изменения признаков, связанные с изменением прогноза модели. Сокращения: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-7
Рисунок 7: Экспериментальная статистическая валидация и анализ воспроизводимости предлагаемой модели с использованием набора данных Pima Indians Diabetes Dataset. (A) Результаты пятикратной перекрестной проверки на обучающей выборке. (B) 95% бутстреп-доверительные интервалы для показателей эффективности на независимой тестовой выборке. (C) Статистическое сравнение с базовыми моделями, включая используемый статистический критерий, значение статистики теста, p-value и уровень значимости. (D) Стабильность работы модели в 10 независимых запусках с различными случайными значениями seed. Для сравнения парной точности классификации использовался критерий Макнемара, для коррелированного ROC-AUC — тест Делона, а для сравнения F1-меры — парный бутстреп-тест с 1 0 повторных выборок. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

ЭтапДействие по протоколуОжидаемый результатСтатус реализации
1Выбор и валидация набора данных здравоохраненияПроверенный набор данных, цель прогнозирования, распределение классов и информация о качестве данныхВыполнено
2Настройка вычислительной средыПроверенное оборудование, программное обеспечение, библиотеки, версии и конфигурация вычисленийВыполнено
3Предварительная обработка и контроль качества данных здравоохраненияОчищенный, преобразованный и стандартизированный набор данныхВыполнено
4Разбиение набора данныхНезависимые обучающие, валидационные и тестовые наборы данныхВыполнено
5Разработка и оптимизация прогностической модели / модели XAIОкончательная архитектура модели и гиперпараметрыВыполнено
6Обучение и сохранение моделиОбученная модель, контрольная точка, конфигурация обучения и логиВыполнено
7Оценка прогностической и вычислительной эффективностиМетрики эффективности на тестовом наборе и сравнение производительностиВыполнено
8Генерация и оценка результатов интерпретируемостиРезультаты SHAP/LIME и соответствующие поясненияВыполнено
9Статистическая валидация и оценка воспроизводимостиДоверительные интервалы, статистические тесты, результаты повторных запусков и показатели воспроизводимостиВыполнено

Таблица 1: Резюме основного девятиэтапного рабочего процесса протокола, примененного в ходе валидации с использованием набора данных по диабету индейцев племени Пима (Pima Indians Diabetes Dataset). В таблице девять этапов, реализованных в практическом примере с использованием набора данных Pima Indians Diabetes Dataset, отделены от внешней валидации и оценки клиническими экспертами, которые остаются дополнительными компонентами общего протокола.

Набор данныхИсточник данныхКлиническое применениеМодальность данныхИспытуемые/ЗаписиОбразцыКлассыРаспределение классовОбучающая/валидационная/тестовая выборкиРоль в настоящем исследованииСтатус валидацииURL-адрес источника
Набор данных по диабету у индейцев племени пимаРепозиторий машинного обучения UCIПрогнозирование диабетаКлиническая таблица768 записей768250 лиц без сахарного диабета; 268 лиц с сахарным диабетом60% / 20% / 20%Основной набор данных экспериментальной валидацииВыполнено — основной рабочий процесс из девяти этапов завершенБаза данных диабета индейцев племени Пима (Pima Indians Diabetes Database)
TCGA-BRCAЦентр общих геномных данных (GDC) Национального института рака (NCI), проект TCGA-BRCAКлассификация рака молочной железыКлиническая и гистопатологическая характеристика1 098 случаевЗависимость от набора данных в зависимости от типа данныхЗависящий от конечной точкиОтсутствие единого распределения классов по всему набору данныхНеприменимо — экспериментальное разделение не проводилосьПример только для иллюстрации применимости протоколаНе использовалось для экспериментальной валидацииhttps://portal.gdc.cancer.gov/projects/TCGA-BRCA
TCGA-UCECNCI Genomic Data Commons (GDC), проект TCGA-UCECКлассификация рака эндометрияКлиническая и гистопатологическая характеристикаКогорта проекта; размер зависит от выбранного типа данных и фильтровЗависимость набора данных от типа данныхЗависящий от конечной точкиОтсутствие единого распределения классов по всему набору данныхНеприменимо — разделение на экспериментальные группы не проводилосьПример применимости протоколаНе используется для экспериментальной валидацииhttps://portal.gdc.cancer.gov/projects/TCGA-UCEC
MIMIC-IIIPhysioNet, клиническая база данных MIMIC-III v1.4Прогнозирование клинических исходовКлинические временные ряды46 520 пациентов58 976 госпитализаций в отделения интенсивной терапииЗависящий от задачиОтсутствие единого распределения классов по всей базе данныхНеприменимо — разделение на экспериментальные группы не проводилосьПример применимости протоколаНе используется для экспериментальной валидацииhttps://physionet.org/content/mimiciii/1.4/
ISIC 2019Конкурс International Skin Imaging Collaboration (ISIC)Классификация кожных пораженийДерматоскопические изображенияНеприменимо – набор изображений25 331 обучающее изображение8 категорий обученияАКИЕЦ 867; БК 323; БКЛ 2624; ДФ 239; МЕЛ 452; НВ 12875; ВАСК 253; ПлК 628Неприменимо — разделение на экспериментальные группы не проводилосьПример только для области применения протоколаНе использовалось для экспериментальной валидацииhttps://challenge.isic-archive.com/landing/2019/
HAM100Harvard Dataverse / Архив ISICКлассификация поражений кожиДермоскопические изображения7 470 уникальных поражений10 015 изображений7AKIEC 327; БК 514; БКЛ 1 09; ДФ 115; МЕЛ 1 13; НВ 6 705; ВАСК 142Неприменимо — разделение на экспериментальные группы не проводилосьПример только для применимости протоколаНе используется для экспериментальной валидации**Оценка влияния ионизирующего излучения на жизнеспособность клеток с использованием анализа MTT** **Абстракт** В данной работе представлен подробный протокол проведения анализа MTT (3-(4,5-диметилтиазол-2-ил)-2,5-дифенилтетразолиум бромид) для оценки влияния ионизирующего излучения на жизнеспособность клеток. Анализ MTT является широко используемым колориметрическим методом определения метаболической активности клеток, который служит индикатором их жизнеспособности и пролиферации. В этом эксперименте клетки подвергаются воздействию различных доз ионизирующего излучения, после чего их жизнеспособность оценивается по способности митохондриальных дегидрогеназ восстанавливать тетразолиевую соль MTT до образующихся кристаллов формазана. В протоколе подробно описываются этапы подготовки клеток, процесс облучения, процедура окрашивания MTT и последующее измерение оптической плотности с использованием планшетного ридера. Результаты выражаются в процентах жизнеспособности клеток по сравнению с необлученной контрольной группой. Данный метод предоставляет количественную основу для изучения радиочувствительности различных клеточных линий и оценки эффективности радиопротекторов или радиосенсибилизаторов. **Ключевые слова** ионизирующее излучение, жизнеспособность клеток, анализ MTT, радиобиология, метаболическая активность, цитоксичность, пролиферация клеток, митохондриальная активность
OhioT1DMнабор данных OhioT1DM, распространяемый в открытом доступе для исследовательских целейМониторинг и прогнозирование диабетаКлинические временные ряды12 участников24 XML-файла, распределенных по обучающей, проверочной и тестовой выборкамНепрерывное прогнозирование уровня глюкозы; не является задачей фиксированной классификацииНеприменимоФайлы для обучения/разработки и тестирования, определенные набором данных; экспериментальное разделение здесь не выполнялосьПример применимости протоколаНе используется для экспериментальной валидации**Методы анализа экспрессии генов и белков при изучении нейровоспаления** **Аннотация** Нейровоспаление характеризуется активацией микроглии и астроцитов, что приводит к высвобождению провоспалительных цитокинов и хемокинов. Понимание молекулярных механизмов, лежащих в основе этих процессов, имеет решающее значение для разработки терапевтических стратегий при нейродегенеративных заболеваниях и травмах центральной нервной системы. В данной статье представлены и подробно описываются общепринятые методы анализа экспрессии генов и белков, используемые для изучения нейровоспаления. Мы рассматриваем количественную полимеразную цепную реакцию с обратной транскрипцией (RT-qPCR) для анализа мРНК, вестерн-блоттинг для определения уровней белков и иммуногистохимическое окрашивание для визуализации пространственной локализации маркеров воспаления в тканях мозга. В работе приводятся детальные протоколы, рекомендации по выбору контрольных групп и методы статистической обработки данных, что позволяет исследователям точно количественно определять и локализовать воспалительные ответы в нейрональных моделях. **Ключевые слова** нейровоспаление, микроглия, астроциты, RT-qPCR, вестерн-блоттинг, иммуногистохимия, экспрессия генов, маркеры воспаления **Введение** Воспаление в центральной нервной системе (ЦНС) является сложным динамическим процессом, который может играть как защитную, так и патологическую роль. Основными эффекторными клетками нейровоспаления являются микроглия (резидентные макрофаги мозга) и астроциты. При воздействии патогенов, повреждений или белковых агрегатов эти клетки переходят в активированное состояние, изменяя свой профиль экспрессии генов и секретируя широкий спектр медиаторов, включая интерлейкины (например, IL-1β, IL-6), фактор некроза опухоли (TNF-α) и хемокины (например, MCP-1). Для изучения этих изменений исследователи полагаются на комплексный подход, сочетающий анализ транскрипции и трансляции. Анализ мРНК с помощью RT-qPCR позволяет обнаружить ранние изменения в экспрессии генов и высокую чувствительность к низким уровням транскриптов. Вестерн-блоттинг обеспечивает подтверждение наличия и количества функциональных белков. Иммуногистохимический анализ (ИГХ) критически важен для определения того, какие именно типы клеток экспрессируют данные маркеры и как они распределены в различных анатомических областях мозга. **Материалы и методы** **1. Анализ экспрессии мРНК с помощью RT-qPCR** **Приготовление РНК и синтез кДНК** 1. Выделение общей РНК из тканей мозга или культур клеток проводили с использованием набора RNeasy Mini Kit (Qiagen) в соответствии с инструкциями производителя. 2. Концентрацию и чистоту РНК определяли с помощью спектрофотометра NanoDrop. 3. Синтез первой цепи кДНК осуществляли из 1 мкг общей РНК с использованием High-Capacity cDNA Reverse Transcription Kit (Applied Biosystems). **Количественная ПЦР в реальном времени** 1. Реакции проводили с использованием SYBR Green PCR Master Mix. 2. Специфические праймеры были разработаны для целевых генов нейровоспаления (например, *Tnf*, *Il1b*, *Il6*, *Gfap*, *Iba1*). 3. В качестве внутреннего контроля (референсного гена) использовали *Gapdh* или *Actb*. 4. Амплификацию проводили в приборе StepOnePlus Real-Time PCR System. 5. Относительный уровень экспрессии генов рассчитывали методом $2^{-\Delta\Delta\text{Ct}}$. **2. Анализ уровней белков методом вестерн-блоттинга** **Экстракция белков и электрофорез** 1. Ткани мозга гомогенизировали в лизирующем буфере RIPA с добавлением ингибиторов протеаз и фосфатаз. 2. Общую концентрацию белка определяли методом Брэдфорд. 3. Равные количества белка (20–40 мкг) разделяли с помощью SDS-PAGE (10% или 12% полиакриламидный гель). **Перенос и иммунодетекция** 1. Белки переносили на PVDF-мембрану с помощью электропереноса. 2. Мембраны блокировали 5% раствором БСА или обезжиренного сухого молока в ТБС-Т (TBS-T) в течение 1 часа при комнатной температуре. 3. Инкубацию с первичными антителами (например, против Iba1, GFAP, NF-κB) проводили в течение ночи при 4°C. 4. После промывки мембраны инкубировали с соответствующими антителами вторичного уровня, конъюгированными с пероксидазой хрена (HRP). 5. Хемилюминесцентный сигнал визуализировали с помощью системы ECL и анализировали с помощью программного обеспечения ImageJ для денситометрии. **3. Иммуногистохимический анализ (ИГХ)** **Фиксация и подготовка срезов** 1. Мозг фиксировали перфузией 4% раствором параформальдегида (PFA), после чего ткани погружали в 4% PFA на 24 часа. 2. Срезы толщиной 30–40 мкм готовили с помощью криостата. **Процедура окрашивания** 1. Срезы инкубировали в растворе Триттона Х-100 (0,3% в PBS) для обеспечения проницаемости мембран. 2. Блокировали нормальной сывороткой соответствующего вида (например, козьей) для минимизации неспецифического связывания. 3. Инкубировали с первичными антителами (например, anti-Iba1 для микроглии, anti-GFAP для астроцитов) в течение 48 часов при 4°C. 4. Специфическое связывание визуализировали с помощью флуоресцентно-меченых вторичных антител или метода иммунопероксидазы с использованием DAB (диаминобензидина). 5. Срезы монтировали и анализировали с помощью флуоресцентного или светового микроскопа. **Результаты и обсуждение** Применение данных методов позволяет детально картировать нейровоспалительный ответ. RT-qPCR выявляет быстрый подъем уровней мРНК провоспалительных цитокинов, что свидетельствует об активации транскрипционных факторов, таких как NF-κB. Вестерн-блоттинг подтверждает, что эти транскрипты транслируются в белки, которые затем секретируются или выполняют структурные функции. ИГХ-анализ позволяет отличить общую активацию глии от локализованного ответа в конкретных областях (например, в гиппокампе или коре) и оценить морфологические изменения, такие как утолщение отростков микроглии и гипертрофия астроцитов. Интеграция этих трех подходов обеспечивает высокую достоверность данных: если повышение уровня мРНК сопровождается увеличением количества белка и соответствующим изменением клеточной морфологии в ткани, это дает веские доказательства наличия нейровоспалительного процесса. **Заключение** Описанные методы анализа экспрессии генов и белков представляют собой базовый инструментарий для любого исследования нейровоспаления. Точное следование протоколам, использование соответствующих контролей и комбинирование молекулярных и гистологических методов позволяют глубоко понять механизмы нейроиммунного взаимодействия и оценить эффективность потенциальных противовоспалительных препаратов.
BraTS 2021RSNA-ASNR-MICCAI BraTS 2021; CBICA/Пенсильванский университетСегментация/классификация опухолей головного мозгаМРТ2 040 случаев в контрольной когорте1251 аннотированного обучающего случая; по четыре модальности МРТ на случайЗависимый от задачиОтсутствие единого распределения классов по всему набору данныхКогорты, определенные по результатам испытания; разделение на экспериментальные группы не проводилосьПример применимости протоколаНе используется для экспериментальной валидацииhttps://www.med.upenn.edu/cbica/brats2021/

Таблица 2: Характеристики наборов данных здравоохранения и применимость предлагаемого протокола. В таблице обобщены источники данных, варианты клинического применения, модальности, характеристики образцов, распределение классов, стратегии разделения наборов данных, статус валидации и информация об источниках для наборов данных здравоохранения, рассмотренных в протоколе. Набор данных Pima Indians Diabetes Dataset служит основным рабочим примером для валидации протокола.

Элемент конфигурацииУсловия фактической рабочей валидацииСтатус / Интерпретация
Набор данныхНабор данных по диабету индейцев племени пимаНабор данных для фактической экспериментальной валидации
Алгоритм / МодельТабличная прогностическая модель для бинарной классификации диабетаИспользуйте точное название архитектуры из протокола эксперимента, если оно задокументировано отдельно
Скорость обучения0.001Экспериментальная установка
ОптимизаторАдамЭкспериментальная установка
Размер партии32Экспериментальная установка
Максимальное количество эпох100Экспериментальная установка
Функция потерьПерекрестная энтропияЭкспериментальная установка
Функция активацииReLU (линейный выпрямитель)Экспериментальная установка
Дропаут (исключение нейронов)0.5Экспериментальная установка
Регуляризация весов (Weight Decay)1e-4Экспериментальная установка
Пакетная нормализацияВключеноЭкспериментальная установка
Аугментация данных / Балансировка классовАктивированоУказывайте SMOTE только в том случае, если данный метод действительно применялся в представленном прогоне
Стратегия валидации5-кратная перекрестная проверкаЭкспериментальная установка
Ранняя остановкаПериод ожидания (patience) = 10 эпохЭкспериментальная установка
Случайное число (Random Seed)42Используйте ту же конфигурацию начального значения (seed), которая была зафиксирована для данного эксперимента
Повторные запуски10 независимых запусков с использованием различных случайных значений (seeds)Анализ воспроизводимости экспериментов
Размер входного изображенияНеприменимоНабор данных Pima представляет собой табличные данные
Размерность признаков512Используйте только в том случае, если это окончательное реализованное представление признаков
ОбъяснимостьSHAP + LIME; контрфактуальное объяснение показано на рисунке 6Фактический отчет об анализе XAI (объяснимого искусственного интеллекта)
Метрики оценкиТочность, прецизионность, полнота, специфичность, F1-мера, коэффициент корреляции Мэтьюса (MCC), AUC-ROC, средняя точность (AP)Приведенные метрики экспериментальной оценки
ОборудованиеGPU NVIDIAЗамените на точную модель ГП, если она была зафиксирована
Программное обеспечение / ФреймворкPython 3.1; Scikit-learn; компоненты фреймворка, использованные в реализацииИспользуйте точные версии пакетов, если они зафиксированы

Таблица 3: Вычислительная среда, архитектура модели и конфигурация гиперпараметров, использованные для реализации протокола. В таблице указаны вычислительная платформа, программная среда, архитектура модели, конфигурация входных данных, параметры оптимизации, настройки регуляризации и параметры воспроизводимости, использованные для реализации предложенного рабочего процесса XAI.

ПараметрРепрезентативная спецификация / результат
ОптимизаторАдам
Скорость обучения0.001
Размер партии32
Максимальное количество эпох100
Период ожидания при ранней остановке10 эпох
Лучшая эпоха78
Эпоха ранней остановки88
Наилучшее значение функции потерь на валидационной выборке0.142
Наилучшая точность валидации94.6%
Результаты обученияПотери при обучении и валидации снижались и достигли сходимости
Результаты валидацииТочность обучения и валидации увеличилась и стабилизировалась
Результат оптимизацииНаилучшая производительность модели достигнута на 78-й эпохе
Контроль переобученияРанняя остановка предотвратила дальнейшую оптимизацию после выбранной наилучшей эпохи

Таблица 4: Спецификации обучения модели и результаты оптимизации. В таблице приведены сведения об оптимизаторе, скорости обучения, размере пакета, максимальном количестве эпох обучения, показателях валидации, сходимости обучения, результате оптимизации и стратегии контроля переобучения, использованных при разработке модели.

МодельТочность (%)Прецизионность (%)Полнота (%)Специфичность (%)F1-мера (%)MCCAUC (ROC)AP (PR)
Предлагаемая модель XAI93.594.592.494.693.40.870.960.94
Глубокое обучение (CNN)89.189.88.19088.90.780.920.9
Случайный лес (Random Forest)84.38583.285.784.10.670.860.81
Метод опорных векторов (SVM)78.679.37.18078.20.540.790.72
Базовая модель (мажоритарный класс)62.162.110076.600.50.5

Таблица 5: Сравнение прогностической эффективности оцениваемых моделей. В таблице приведено сравнение предлагаемой модели XAI с оцениваемыми базовыми моделями по таким показателям, как точность (accuracy), прецизионность (precision), полнота (recall), специфичность (specificity), F1-мера (F1-score), коэффициент корреляции Мэтьюза, площадь под ROC-кривой и средняя точность (average precision).

Валидационный анализСравнение / МетрикаСтатистический критерийСтатистический критерийpp-значениеЭкспериментальный результат / 95% ДИ
Пятикратная кросс-валидацияТочностьОписательная (среднее значение ± СО)93.01 ± 0.48%
Пятикратная перекрестная проверкаAUC-ROCОписательная (среднее значение ± СО)0.954 ± 0.007
Пятикратная перекрестная проверкаТочностьОписательная (средн ± СО)92.42 ± 0.87%
Пятикратная перекрестная проверкаПолнотаОписательная (среднее значение ± СО)93.02 ± 0.45%
Пятикратная кросс-валидацияF-мераОписательная (среднее значение ± СО)92.72 ± 0.62%
95% бутстрэп-доверительный интервалТочностьБутстрэп (10 повторных выборок)0.935 [0.897, 0.973]
95%-й бутстрэп-доверительный интервалТочностьБутстрэп (1 00 повторных выборок)0.930 [0.890, 0.970]
95% бутстрэп-доверительный интервалПолнота (Recall)Бутстреп (10 повторных выборок)0.922 [0.880, 0.963]
95% бутстреп-доверительный интервалF-мераБутстреп (1 0 повторных выборок)0.926 [0.887, 0.965]
95%-ный бутстреп-доверительный интервалAUC-ROC (площадь под ROC-кривой)Бутстреп (10 повторных выборок)0.958 [0.931, 0.984]
Предлагаемая модель в сравнении с CNNТочность (%)Критерий Макнемара9.320.0023Значимый (α = 0.05)
Предлагаемая модель в сравнении с CNNAUC-ROCКритерий Делона3.870.0001Значимый (α = 0.05)
Предлагаемая модель в сравнении с CNNF1-мераПарный бутстрэп (1 0 ресемплов)2.810.0044Значительный (α = 0.05)
Предлагаемая модель в сравнении со случайным лесомТочность (%)Критерий Макнемара14.270.0002Значимый (α = 0.05)
Предлагаемая модель в сравнении со случайным лесомAUC-ROCТест Делонга5.86<0.0001Значимый (α = 0.05)
Предлагаемая модель в сравнении со случайным лесомF-мераПарный бутстрап (1 0 повторных выборок)4.030.0003Значимый (α = 0.05)
Предлагаемая модель в сравнении с SVMТочность (%)Критерий Макнемара16.08<0.0001Значимый (α = 0.05)
Предлагаемая модель в сравнении с SVMAUC-ROCТест Делонга6.95<0.0001Значительный (α = 0.05)
Предлагаемая модель в сравнении с SVMF-мераПарный бутстреп (1 0 повторных выборок)4.62<0.0001Значимый (α = 0.05)
Воспроизводимость при повторных запусках (10 независимых запусков)AUC-ROCОписательный (средн ± СО)0.957 ± 0.008
Воспроизводимость при повторных запусках (10 независимых запусков)Точность (%)Описательная (среднее значение ± СКО)93.24 ± 0.74%
Воспроизводимость при повторных запусках (10 независимых запусков)F1-мера (%)Описательная (среднее значение ± СО)92.35 ± 0.92%

Таблица 6: Результаты статистической валидации и воспроизводимости, полученные в ходе экспериментальной реализации с использованием набора данных Pima Indians Diabetes Dataset. В таблице обобщены показатели эффективности перекрестной проверки по пяти складываниям, 95% доверительные интервалы на основе бутстрэпа, статистические сравнения предлагаемой модели с базовыми моделями, а также воспроизводимость при повторных запусках с использованием 10 независимых случайных значений seed. В данной работе внешняя валидация и оценка клиническими экспертами не проводились.

Нет.Пункт контрольного спискаНеобходимая документацияРекомендуемая запись / проверка
1Программная средаОперационная система, язык программирования и программная средаЗафиксируйте точные версии операционной системы и языка программирования.
2Версии программного обеспечения и библиотекВерсии основных программных библиотек и пакетовЗаписывайте точные названия и версии пакетов/библиотек.
3Технические характеристики оборудованияХарактеристики ЦП, ГП, ОЗУ, накопителей и ускорителейЗафиксируйте используемые вычислительные мощности.
4Идентификация набора данныхНазвание набора данных, источник, версия и информация о доступеЗаписывайте точный источник/версию набора данных и дату доступа, где это применимо.
5Характеристики набора данныхРазмер выборки и распределение классовЗафиксируйте общее количество образцов и распределение по классам для каждого разделения выборки.
6Разбиение набора данныхСтратегия обучения, валидации и независимой тестовой выборкиЗадокументируйте пропорции/количество разделения данных и стратификацию.
7Предотвращение утечек данныхПроцедура, используемая для предотвращения утечки информацииРазделение документов на обучающую и тестовую выборки и оценка параметров предобработки исключительно на обучающих данных.
8Параметры предварительной обработкиНастройки очистки, обработки пропущенных значений, нормализации, кодирования и преобразованияЗафиксируйте все операции по предварительной обработке и значения параметров.
9Аугментация данныхМетоды аугментации и настройки параметров, если применимоДокументируйте методы, вероятности и диапазоны параметров.
10Архитектура моделиИтоговая архитектура и конфигурация моделиЗадокументируйте тип модели, слои/компоненты, размерности и функции активации.
11ГиперпараметрыОбучение и оптимизация гиперпараметровЗафиксируйте скорость обучения, размер пакета, оптимизатор, количество эпох, параметры ранней остановки и настроенные параметры.
12Случайные значения (seeds)Случайные числовые последовательности (seed), использованные для обеспечения воспроизводимости выполненияЗафиксируйте значения seed (начальных значений генератора случайных чисел) для разделения данных, инициализации и повторных запусков.
13Конфигурация обученияПроцедура обучения и стратегия выбора моделиВалидация документов, создание контрольных точек и критерии выбора модели.
14Метрики оценкиПредопределенные метрики прогностической и статистической оценкиЗафиксируйте все зарегистрированные показатели эффективности.
15Доверительные интервалыИнтервалы неопределенности для показателей эффективностиЗадокументируйте процедуру оценки доверительного интервала (ДИ) и бутстреп-перевыборки, где это применимо.
16Статистические критерииСтатистические процедуры для сравнения моделейДокументируйте тест, статистический показатель, значение p, порог значимости и допущения.
17Анализ повторяемости результатовНезависимые запуски с использованием различных случайных чисел (сидов)Зафиксируйте количество прогонов и среднее значение ± СО ключевых показателей.
18Конфигурация интерпретируемостиМетоды интерпретируемости и настройки параметровДокументируйте SHAP, LIME, Grad-CAM, внимание, контрфактуальные объяснения или иные применимые настройки.
19Оценка объяснимостиОбъективная оценка надежности и полезности объясненийДостоверность документа, стабильность, недостоверность, локализация и экспертная оценка, где применимо.
20Артефакты моделиВеса обученной модели и конфигурационные файлыАрхивируйте финальную обученную модель, архитектуру/конфигурацию и информацию по ее выбору.
21Доступность кодаКод, необходимый для предобработки, обучения, оценки и генерации объясненийРепозиторий записей или информация о контролируемом доступе к коду, если применимо.
22Документация по исполнениюКоманды, скрипты, конфигурационные файлы и инструкцииЗафиксируйте команды и конфигурацию, необходимые для воспроизведения рабочего процесса.
23Выходная документацияПрогнозы, результаты оценки, рисунки и выходные данные объясненийАрхивируйте полученные результаты и свяжите их с соответствующим экспериментом/запуском.
24Проверка воспроизводимостиПроверка согласованности результатов независимых повторных экспериментовСравните результаты повторных запусков и представьте предопределенные показатели вариабельности.

Таблица 7: Контрольный список воспроизводимости для независимого повторения предлагаемого рабочего процесса XAI. В контрольном списке указаны требования к вычислительным ресурсам, наборам данных, предварительной обработке, разработке моделей, оценке, статистической проверке, интерпретируемости и документации, необходимые для воспроизведения экспериментального рабочего процесса.

Обсуждение

Результаты демонстрируют полезность предлагаемого протокола в качестве стандартизированного и воспроизводимого рабочего процесса для разработки и оценки систем XAI на различных наборах данных в сфере здравоохранения. Как показано в Таблице 2 и на Рисунке 3, систематическая предобработка позволила получить стандартизированные данные и повысить их качество за счет обработки пропущенных значений, нормализации данных, масштабирования признаков и разделения набора данных. Эти этапы предобработки имеют решающее значение, поскольку вариативность в подготовке данных может привести к возникновению систематической ошибки, снижению прогностической точности и поставить под угрозу надежность анализа объяснимости. Следовательно, для обеспечения воспроизводимости и предотвращения утечки данных19,20 к обучающей, валидационной и тестовой выборкам должны применяться согласованные процедуры предобработки.

Результаты обучения модели, представленные на Рисунке 4 и в Таблице 4, демонстрируют согласованный и стабильный процесс обучения. Одновременное снижение потерь при обучении и валидации, наряду с ростом прогностической точности, указывает на надлежащую сходимость модели без существенного переобучения. Оптимизация гиперпараметров, ранняя остановка, дропаут и регуляризация дополнительно способствуют стабильности и воспроизводимости обучения модели. Нестабильность кривых обучения может свидетельствовать о неправильном выборе скорости обучения, недостаточном объеме обучающих данных или избыточной сложности модели. Следовательно, необходимо контролировать сходимость модели на протяжении всего процесса обучения для выявления и устранения этих потенциальных проблем.

Таблица 5 и Рисунок 5 демонстрируют прогностическую эффективность с использованием нескольких метрик оценки, включая точность (accuracy), прецизионность (precision), полноту (recall), специфичность, F1-меру, коэффициент корреляции Мэтьюса и площадь под ROC-кривой (AUC-ROC). ROC-кривая и кривая прецизионности-полноты позволяют оценить дискриминационную способность модели, в то время как матрица ошибок иллюстрирует распределение правильных и неправильных классификаций по классам. Оценка с использованием нескольких метрик эффективности особенно важна для несбалансированных медицинских наборов данных, поскольку одна лишь общая точность может недостаточно полно характеризовать работу модели.

Рисунок 6 представлены результаты интерпретируемости, полученные на основе набора данных по диабету индейцев племени Пима, которые демонстрируют взаимодополняющую роль методов интерпретируемости, примененных в ходе данной валидации. Глобальный анализ SHAP характеризует общий вклад и относительную значимость входных признаков для прогнозов модели, в то время как графики-водопады (waterfall plots) и графики зависимости SHAP обеспечивают интерпретацию поведения модели на уровне отдельных пациентов и конкретных признаков. LIME предоставляет дополнительное локальное объяснение, выявляя признаки, которые повлияли на прогноз для отдельного объекта из тестового набора. Контрфактуальное объяснение для конкретного пациента дополнительно иллюстрирует минимальные изменения признаков, связанные с изменением прогнозируемого результата. В совокупности эти подходы обеспечивают взаимодополняющие глобальные и локальные перспективы поведения модели, повышая прозрачность и интерпретируемость табличной прогностической модели. Grad-CAM, визуализация внимания (attention visualization), карты значимости (saliency mapping) и интегрированные градиенты (Integrated Gradients) не применялись в валидации на данных Пима и оставлены в общем протоколе только в качестве опций, зависящих от модальности данных.

Статистическая валидация (Таблица 6 и Рисунок 7) и оценка воспроизводимости демонстрируют стабильность прогностической эффективности в различных экспериментальных сериях. Сочетание кросс-валидации, оценки доверительного интервала, проверки гипотез и оценки воспроизводимости при повторных запусках обеспечивает систематическую основу для анализа робастности модели. Такая валидация особенно важна для применения в здравоохранении, поскольку воспроизводимость в независимых экспериментах служит доказательством надежности и обобщающей способности моделей ИИ перед их внедрением в клиническую практику21,23.

Для успешной реализации данного протокола критически важны несколько этапов. Перед извлечением признаков и обучением модели выполните очистку данных, чтобы минимизировать потенциальную систематическую ошибку, возникающую из-за неполных, противоречивых или ошибочных данных. Проводите оптимизацию гиперпараметров, используя только обучающую и валидационную выборки, и сохраняйте независимость тестового набора данных на протяжении всего процесса разработки и оптимизации модели. Четко документируйте состояния генератора случайных чисел, версии программного обеспечения, конфигурации оборудования и настройки предобработки для обеспечения воспроизводимости результатов на различных вычислительных платформах. Кроме того, выбирайте методы интерпретируемости в зависимости от прогностической модели и модальности медицинских данных, чтобы получить понятные и клинически значимые объяснения20,29,30.

Данный протокол имеет несколько ограничений. Точность и надежность прогнозов и объяснений модели существенно зависят от наличия достаточно больших, репрезентативных и высококачественных наборов данных из сферы здравоохранения. Недостаточная представленность определенных групп пациентов, ошибки измерения, пропущенные переменные и неоднородность источников данных могут отрицательно сказаться как на прогностической способности, так и на стабильности объяснений модели. Кроме того, современные подходы к интерпретируемости позволяют охарактеризовать поведение модели, но не обязательно устанавливают причинно-следственные механизмы. Следовательно, результаты XAI следует интерпретировать совместно с соответствующим клиническим опытом.

В целом, данный протокол представляет собой стандартизированный подход к воспроизводимой разработке, оценке и анализу интерпретируемости моделей в различных областях здравоохранения. Благодаря интеграции стандартизированной предобработки, оптимизации гиперпараметров, оценки с использованием нескольких метрик эффективности, дополнительных методов обеспечения интерпретируемости и статистической валидации, данный рабочий процесс обеспечивает прозрачную и прослеживаемую основу для исследований в области ИИ в здравоохранении.

Результаты далее указывают на то, что прозрачная и последовательная разработка моделей ИИ может быть обеспечена путем сочетания систематической предобработки данных, стандартизированных процедур разработки моделей, комплексной оценки эффективности, нескольких методов объяснимости и строгой статистической валидации. Данный протокол может быть адаптирован для клинических баз данных, медицинских изображений, физиологических сигналов и мультимодальных данных здравоохранения, сохраняя при этом структуру для воспроизводимого экспериментирования в различных вычислительных средах. Благодаря стандартизированной реализации, дополнительным методам объяснимости и оценке воспроизводимости, протокол создает основу для разработки объяснимых и надежных моделей ИИ и может служить методологическим фундаментом для будущих биомедицинских исследований и последующей внешней и клинической валидации.

Раскрытие информации

Авторы заявляют об отсутствии конкурирующих финансовых интересов, коммерческих или личных связей, которые могли бы повлиять на результаты работы, представленной в данном исследовании. Авторы не имеют конфликтов интересов, о которых следовало бы сообщить.

Благодарности

Авторы выражают благодарность за институциональную поддержку, оказанную соответствующими аффилированными организациями в ходе разработки и экспериментальной валидации данного протокола XAI в здравоохранении. Авторы также благодарят за предоставление вычислительных мощностей и программных ресурсов, использованных для проведения экспериментального анализа. Данное исследование не имело внешнего финансирования. Авторы подтверждают использование Python 3.1, Matplotlib 3.9 и SciPy 1.13 для вычислительного анализа, визуализации данных и создания рисунков, представленных в настоящем исследовании.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
CaptumMeta AIПоследняя стабильная версияИнтерпретируемость PyTorch
CUDA ToolkitNVIDIA12.2GPU-ускорение
cuDNNNVIDIA9.xБэкенд для глубокого обучения
GitGit SCMПоследняя стабильная версияКонтроль версий
GitHubGitHub Inc.Веб-платформаРепозиторий исходного кода
Grad-CAMjacobgilПоследний релизВизуализация CNN
Jupyter NotebookProject JupyterПоследняя стабильная версияИнтерактивная разработка
LightGBMMicrosoft4.xГрадиентный бустинг
LIMELIME Community0.2.0Локальная интерпретируемость
MatplotlibMatplotlib Developers3.9Визуализация
Microsoft ExcelMicrosoftMicrosoft 365Организация данных
NumPyNumPy Developers1.26Числовые вычисления
NVIDIA RTX 4090 GPUNVIDIA24 GB VRAMОбучение моделей
OpenCVOpenCV Organization4.10Предобработка изображений
PandasPandas Development Team2.2Предобработка данных
Pillow (PIL)Python Imaging Library10.xОбработка изображений
PlotlyPlotly Technologies5.xИнтерактивная визуализация
PythonPython Software Foundation3.1Среда программирования
PyTorchPyTorch Foundation2.3Глубокое обучение
Scikit-learnScikit-learn Developers1.5Машинное обучение
SciPySciPy Developers1.13Научные вычисления
SeabornSeaborn Developers0.13Статистические графики
SHAPSHAP Community0.46Глобальная интерпретируемость
SimpleITKInsight Software Consortium2.xОбработка медицинских изображений
StatsmodelsStatsmodels Developers0.14Статистический анализ
Оперативная память (RAM)Любой производитель32 GB или вышеПамять
TensorBoardGoogle2.15Мониторинг обучения
TensorFlowGoogle2.15Глубокое обучение
Ubuntu Linux / Windows 11Canonical / Microsoft2.04 LTS / 1Операционная система
Visual Studio CodeMicrosoftПоследняя стабильная версияРазработка кода
XGBoostXGBoost Developers2.1Градиентный бустинг

Ссылки

  1. Acosta JN, Falcone GJ, Rajpurkar P, Topol EJ. Multimodal biomedical AI. Nat Med. 2022;28(9):1773-1784.
  2. Tang AS, et al. Harnessing EHR data for health research. Nat Med. 2024;30(7):1847-1855.
  3. Zhang A, Xing L, Zou J, Wu JC. Shifting machine learning for healthcare from development to deployment and from models to data. Nat Biomed Eng. 2022;6(11):1330-1345.
  4. Bera K, et al. Predicting cancer outcomes with radiomics and artificial intelligence in radiology. Nat Rev Clin Oncol. 2022;19(2):132-146.
  5. Wenderott K, Krups J, Zaruchas F, Weigl M. Effects of artificial intelligence implementation on efficiency in medical imaging—a systematic literature review and meta-analysis. NPJ Digit Med. 2024;7(1):265.
  6. Kaissis GA, Makowski MR, Rückert D, Braren RF. Secure, privacy-preserving and federated machine learning in medical imaging. Nat Mach Intell. 2020;2(6):305-311.
  7. He J, et al. The practical implementation of artificial intelligence technologies in medicine. Nat Med. 2019;25(1):30-36.
  8. Antoniadi AM, et al. Current challenges and future opportunities for XAI in machine learning-based clinical decision support systems: A systematic review. Appl Sci (Basel). 2021;11(11):5088.
  9. Samek W, et al. Explaining deep neural networks and beyond: A review of methods and applications. Proc IEEE. 2021;109(3):247-278.
  10. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. WIREs Data Min Knowl Discov. 2019;9(4).
  11. Markus AF, Kors JA, Rijnbeek PR. The role of explainability in creating trustworthy artificial intelligence for health care: A comprehensive survey of the terminology, design choices, and evaluation strategies. Nat Biomed Eng. 2021;5(9):996-1011.
  12. Arrieta AB, et al. Explainable Artificial Intelligence (XAI): Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  13. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization [conference paper]. Presented at: IEEE International Conference on Computer Vision (ICCV); Venice, Italy; 2017:618-626. https://openaccess.thecvf.com/content_iccv_2017/html/Selvaraju_Grad-CAM_Visual_Explanations_ICCV_2017_paper.html
  14. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(12):572-584.
  15. Sundararajan M, Taly A, Yan Q. Axiomatic attribution for deep networks [conference paper]. Presented at: 34th International Conference on Machine Learning; Sydney, Australia; 2017;70:3319-3328. https://proceedings.mlr.press/v70/sundararajan17a.html
  16. Ribeiro MT, Singh S, Guestrin C. “Why should I trust you?”: Explaining the predictions of any classifier [conference paper]. Presented at: 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; San Francisco, CA; 2016:1135-1144.
  17. Desai S, Ramaswamy HG. Ablation-CAM: Visual explanations for deep convolutional network via gradient-free localization [conference paper]. Presented at: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV); 2020:983-991.
  18. Belle V, Papantonis I. Principles and practice of explainable machine learning. Front Big Data. 2021;4:688969.
  19. Vilone G, Longo L. Notions of explainability and evaluation approaches for explainable artificial intelligence. Inf Fusion. 2021;76:89-106.
  20. Ali S, et al. Explainable artificial intelligence (XAI): What we know and what is left to attain trustworthy artificial intelligence. Inf Fusion. 2023;99:101805.
  21. Gundersen OE, Kjensmo S. State of the art: Reproducibility in artificial intelligence [conference paper]. Presented at: Thirty-Second AAAI Conference on Artificial Intelligence; New Orleans, LA; 2018:1644-1651. https://ojs.aaai.org/index.php/AAAI/article/view/11503
  22. Hutson M. Artificial intelligence faces reproducibility crisis. Science. 2018;359(6377):725-726.
  23. Pineau J, et al. Improving reproducibility in machine learning research: A report from the NeurIPS 2019 reproducibility program. J Mach Learn Res. 2021;22(164):1-20.
  24. U.S. Food and Drug Administration, Health Canada, Medicines and Healthcare products Regulatory Agency. Good Machine Learning Practice for Medical Device Development: Guiding Principles. 2021.
  25. Liu X, et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: The CONSORT-AI extension. Nat Med. 2020;26(9):1364-1374.
  26. Mongan J, Moy L, Kahn CE Jr. Checklist for Artificial Intelligence in Medical Imaging (CLAIM): A guide for authors and reviewers. Radiol Artif Intell. 2020;2(2).
  27. Peng RD. Reproducible research in computational science. Science. 2011;334(6060):1226-1227.
  28. Collins GS, et al. Protocol for development of the TRIPOD-AI and PROBAST-AI reporting and risk-of-bias tools for studies developing, validating, or updating prediction models based on artificial intelligence. BMJ Open. 2021;11.
  29. Kapoor S, Narayanan A. Leakage and the reproducibility crisis in machine-learning-based science. Patterns. 2023;4(9):100804.
  30. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-1340.

Перепечатки и разрешения

Теги

Объяснимый ИИмодели ИИ в здравоохраненииинтерпретируемость моделейвоспроизводимый протоколпрогностическая эффективностьконструирование признаковстатистическая валидацияобъяснения SHAPобъяснения LIMEконтрфактические объяснения