Все наборы данных, использованные в этом исследовании, были получены из общедоступных и полностью анонимизированных репозиториев, включая UCI Machine Learning Repository, базу данных PhysioNet MIMIC-III и наборы данных NIH по рентгену грудной клетки. Никакой идентифицирующей информации о пациентах не было получено. Исследование соответствовало институциональным рекомендациям по этике исследований для вторичного анализа публично доступных деидентифицированных данных. Официальное одобрение Институционального наблюдательного совета не требовалось, так как напрямую не привлекались человеческие участники и не использовалась защищённая медицинская информация.
1. Обзор экспериментальных рамок
- Разработать воспроизводимый, объяснимый конвейер искусственного интеллекта (XAI) для прозрачной аналитики здравоохранения. Организуйте рабочий процесс на уровень данных, уровень предварительной обработки, слой моделирования, слой объяснимости, уровень оценки и уровень визуализации.
- Интегрировать эти модули в единый рабочий процесс, способный обрабатывать структурированные клинические данные, электронные медицинские карты и наборы данных медицинской визуализации.
- Убедитесь, что каждый модуль способствует воспроизводимости, интерпретируемости, масштабируемости и стандартизированному экспериментальному исполнению.
- Спроектировать модульную архитектуру для поддержки непрерывного потока данных и гарантировать, что каждый этап конвейера способствует воспроизводимости, интерпретируемости и масштабируемости на протяжении всего экспериментального рабочего процесса.
2. Вычислительная среда и конфигурация системы
- Установите необходимые программные зависимости перед выполнением рабочего процесса, открыв командный терминал и выполнив следующую команду:
pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
- Проверьте успешную установку всех программных пакетов и совместимость с версиями, указанными в Таблице материалов , прежде чем приступать к предварительной обработке данных и разработке модели.
- Используйте Python 3.11 в качестве основной среды программирования. Установите и настройте NumPy 1.26 и Pandas 2.1 для обработки данных и задач по разработке функций. Установите Scikit-learn 1.5 для разработки и оценки моделей машинного обучения.
- Установите TensorFlow 2.15 для обучения и вывода моделей глубокого обучения. Установите SHAP 0.46 и LIME 0.2.0 для анализа объяснимости. Установите OpenCV 4.10 для обработки изображений. Установите Matplotlib 3.9 и Seaborn 0.13 для визуализации данных и отчетности по результатам. Обратитесь к Таблице материалов для полных спецификаций программного обеспечения и необходимых для воспроизводимости деталей реализации.
- Настройте вычислительную среду с помощью рабочей станции с многоядерным процессором, ускорением графического процессора (GPU) и достаточным объемом памяти для работы с большими наборами данных в здравоохранении и глубокого обучения.
- Установка фиксированных случайных семян для разбиения данных, инициализации модели и процедур обучения для обеспечения воспроизводимости между экспериментальными запусками. Включить механизмы логирования для записи операций предварительной обработки данных, конфигураций моделей, настроек гиперпараметров, процедур обучения и результатов оценки на протяжении всего рабочего процесса.
- Настройте архитектуры моделей, параметры оптимизации, скорость обучения, размеры пакетов, настройки обучения и значения гиперпараметров согласно спецификациям, изложенным в Таблице 1. Соблюдайте эти настройки во время экспериментов с репликацией, чтобы обеспечить согласованность с опубликованными результатами.
- Ожидаемый результат — полностью настроенная и воспроизводимая вычислительная среда со всеми необходимыми программными пакетами, аппаратными ресурсами, механизмами логирования и настройками конфигурации моделей, доступными для последующего предварительной обработки данных, разработки моделей, анализа объяснимости и оценки.
| Компонент | Параметр | Ценность | Описание |
| Случайный лес | n_estimators | 100 | Количество деревьев |
| Случайный лес | max_depth | Нет | Глубина дерева |
| XGBoost | learning_rate | 0.01 | Скорость обучения |
| XGBoost | n_estimators | 100 | Ускоряющие патроны |
| CNN | Эпохи | 25 | Эпохи обучения |
| CNN | batch_size | 32 | Размер партии |
| CNN | Оптимизатор | Адам | Алгоритм оптимизации |
| MLP | hidden_layers | 2 | Количество скрытых слоёв |
| MLP | Активация | ReLU | Функция активации |
| Общие заведения | train_split | 70% | Коэффициент обучающих данных |
| Общие заведения | validation_split | 15% | Коэффициент валидации |
| Общие заведения | test_split | 15% | Коэффициент тестирования |
Таблица 1: Детали реализации и конфигурация гиперпараметров.
В этой таблице представлены вычислительная среда, библиотеки программного обеспечения, конфигурации моделей машинного обучения и глубокого обучения, настройки оптимизации, скорости обучения, размеры пакетов, параметры обучения и значения гиперпараметров, используемые при экспериментальной оценке предлагаемого объяснимого фреймворка ИИ.
3. Подготовка и предобработка наборов данных
- Выберите общедоступные наборы данных в здравоохранении для обеспечения прозрачности и воспроизводимости экспериментального рабочего процесса.
- Используйте четыре репрезентативных медицинских сценария для проверки предлагаемой основы: (i) диагностика рака груди с использованием Dataset по раку молочной железы штата Висконсин, (ii) прогнозирование риска диабета с использованием Pima Indians Diabetes Dataset, (iii) прогнозирование клинических исходов с использованием электронных медицинских записей MIMIC-III, и (iv) классификации торакальных заболеваний с использованием набора данных NIH Chest X-ray. Выбирайте эти наборы данных для оценки структурированных клинических записей, лонгитюдных электронных медицинских карт и медицинских визуализационных методов, часто используемых в системах поддержки принятия решений в здравоохранении.
- Импортируйте каждый набор данных в среду Python и разделяйте записи на входные признаки и целевые переменные. Организовывать структурированные клинические данные для задач прогнозирования заболеваний, электронные медицинские карты для анализа долгосрочных результатов и наборы данных медицинской визуализации для задач диагностической классификации. Проверьте целостность каждого набора данных перед переходом к операциям предварительной обработки.
- Выявлять и устранять недостающие значения с помощью соответствующих методов импутации. Стандартизировать численные признаки с помощью процедур масштабирования признаков и нормализации для обеспечения сопоставимости между переменными.
- Кодировать категориальные переменные с использованием подходящих методов кодирования, основанных на характеристиках набора данных. Проводите выбор признаков с использованием корреляционного анализа и моделей мер важности признаков для выявления наиболее релевантных переменных и снижения размерности данных.
- До обучения модели уменьшите размер всех медицинских изображений до 224 224 пикселей. Нормализуйте значения интенсивности пикселей в соответствии с требованиями выбранной архитектуры глубокого обучения. Применяйте методы увеличения данных, включая вращение изображения и горизонтальное переворачивание, чтобы улучшить обобщение модели и снизить перенагон. Проверьте качество изображения и обеспечьте согласованность размеров изображения по всему набору данных.
- Оценивайте целостность данных, оценивая полноту, согласованность и согласованность признаков набора данных. Проверьте, правильно ли все записи присвоены соответствующим целевой классам. Изучите характеристики наборов данных, включая размер выборки, количество признаков и модальность данных, как изложено в Таблице 2.
- Внедрять процедуры валидации, специфичные для набора данных, чтобы обеспечить методологическую строгость и воспроизводимость. Записывайте размер выборки, распределение классов, стратегию разделения «обучая-валидация-тестирование», меры по предотвращению утечек, процедуры оптимизации гиперпараметров, кросс-валидационный дизайн и внешний протокол тестирования для каждого набора данных. Краткое изложение этих процедур валидации в таблице 3.
- Проводите проверки качества предварительной обработки, оценивая обработку недостающих значений, удаление выбросов, масштабирование признаков, категориальное кодирование, сохранение распределения классов и процедуры разделения наборов данных. Проверьте, что операции предварительной обработки применяются последовательно во всех наборах данных.
- Подтвердите отсутствие значительных утечек данных при разделении данных. Изучите результаты предварительной проверки, представленные на рисунке 1 , чтобы убедиться, что стандартизированные наборы данных сгенерированы для последующих анализов машинного обучения и объяснимости.
- Ожидаемый результат — генерируйте очищенные и стандартизированные наборы данных с отсутствующими значениями, соответствующим образом обработанными, закодированными категориальными переменными, нормализующими числовыми признаками и разделением записей на учебные, валидационные и тестовые подмножества. Убедитесь, что характеристики наборов данных, распределения классов и процедуры валидации соответствуют тем, что указаны в Таблице 2 и Таблице 3, и подтвердите успешную проверку предварительной обработки, как показано на рисунке 1.
| Набор данных | Тип | Сэмплы | Особенности | Цель |
| Рак молочной железы | Табличная форма | 569 | 30 | Доброкачественные/злокачественные |
| Диабет | Табличная форма | 768 | 8 | Результаты при диабете |
| MIMIC-III | EHR | ~60 000 | Клинические переменные | Смертность |
| Рентген грудной клетки | Визуализация | ~112 000 | Изображения | Метки болезней |
Таблица 2: Характеристики набора данных и случаи использования в здравоохранении.
В этой таблице представлено сводное описание наборов данных в области здравоохранения, использованных в исследовании, включая тип набора данных, количество выборок, количество признаков, целевые переменные, область применения в здравоохранении и связанные с ними клинические случаи использования. Наборы данных включают структурированные клинические записи, электронные медицинские записи и данные медицинской визуализации, чтобы продемонстрировать применимость рамок в различных сценариях медицинской аналитики.
| Набор данных | Размер выборки | Распределение классов | Стратегия разделения | Предотвращение протечек | Гиперпараметрический поиск | Перекрёстная валидация | Внешний тест |
| Рак молочной железы (UCI, Висконсин) | 569 | 357 Доброкачественный / 212 Злокачественный | 70/15/15 | Предобработка только поезда | Поиск по сетке | 5-кратная стратифицированная CV | Независимый Удерживающий Набор |
| Диабет индейцев Пима | 768 | 500 недиабетиков / 268 диабетиков | 70/15/15 | Предобработка только поезда | Поиск по сетке | 5-кратная стратифицированная CV | Независимый Удерживающий Набор |
| МИМИК-III ЭМК | 5274 | Когорты, стратифицированные по результатам | 70/15/15 Уровень пациента | Разделение на уровне пациента | Случайный поиск | Пятикратное CV на уровне пациента | Независимый Удерживающий Набор |
| Рентген грудной клетки NIH | 112120 | Пневмония/Нормальный стратифицированный | 70/15/15 | Разделение на уровне изображения | Случайный поиск | 5-кратная стратифицированная CV | Независимый Удерживающий Набор |
Таблица 3: Валидация на уровне набора данных и экспериментальное проектирование.
В этой таблице представлена методология валидации, используемая для каждого набора данных, включая размер выборки, распределение классов, стратегию разделения «обучая-валидация-тест», процедуры предотвращения утечек, методы оптимизации гиперпараметров, кросс-валидационный дизайн и внешние протоколы тестирования. Эти меры были внедрены для обеспечения методологической строгости, воспроизводимости и объективной оценки модели.

Рисунок 1: Валидация конвейера предварительной обработки данных.
Результаты валидации ключевых предварительных операций, выполненных до разработки модели. (A) Анализ отсутствующей стоимости по репрезентативным признакам здравоохранения. (B) Распределение числовой переменной до и после обработки выбросов. (C) Валидация масштабирования признаков с использованием стандартизации. (D) Валидация категориального кодирования. (E) Распределение классов после предварительной обработки. (F) Валидация разбиения данных с проверкой и тестированием обучения. Эти результаты подтверждают успешную предобработку и подготовку наборов данных для предиктивного моделирования и анализа объяснимости. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
4. Архитектура системы Объяснимой ИИ Фреймворка
- Организуйте фреймворк с помощью многоуровневой архитектуры для облегчения модульной обработки, повышения прозрачности рабочих процессов и поддержки воспроизводимой реализации. Настройте слой данных для получения и управления необработавшими наборами данных о здравоохранении. Перед началом операций предварительной обработки маршрутизируйте все входящие наборы данных через слой данных.
- Выполнять процедуры очистки данных, трансформации, нормализации, инженерии признаков и кодирования в пределах слоя предварительной обработки. Убедитесь, что все операции предобработки завершены до разработки модели.
- Разрабатывайте предиктивные модели внутри слоя моделирования с использованием алгоритмов машинного обучения и глубокого обучения. Обучайте модели градиентного бустинга, случайного леса, многослойного перцептрона (MLP) и сверточных нейронных сетей (CNN) с использованием предварительно обработанных наборов данных и оптимизированных конфигураций гиперпараметров.
- Применяйте методы объяснимости внутри слоя объяснимости для интерпретации прогнозов модели. Генерируйте объяснения атрибуции признаков с помощью SHAP и LIME для структурированных наборов данных. Генерируйте тепловые карты Grad-CAM для моделей на основе изображений с целью визуализации областей, участвующих в прогнозировании моделей.
- Оценивайте предиктивные и объяснимые характеристики в пределах уровня оценки. Рассчитывайте точность, точность, отзыв, показатели F1, ROC-AUC, точность, стабильность и метрики, ориентированные на клинициста. Фиксируйте все результаты оценки для последующего анализа и отчетности.
- Генерируйте клинически интерпретируемые визуальные результаты внутри слоя визуализации. Создавайте графики сравнения производительности, визуализации важности признаков, сводные графики SHAP, объяснения LIME, тепловые карты Grad-CAM и ориентированные на клиницистов отчетные панели. Храните все визуальные результаты для включения в итоговый экспериментальный отчёт.
- Перед выполнением рабочих процессов ознакомьтесь с полной архитектурой фреймворка, показанной на рисунке 2 .
- Ожидаемый результат — генерировать полностью обученные модели машинного обучения и глубокого обучения, включая архитектуры градиентного усиления, случайного леса, CNN и MLP. Храните конфигурации модели, оптимизированные гиперпараметры, обучающие журналы, файлы контрольных точек, выходы объяснённости и артефакты визуализации для последующего анализа оценки и интерпретации.

Рисунок 2: Архитектурная система объяснимой AI-фреймворка для аналитики в здравоохранении. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.
5. Выполнение рабочих процессов
- Получайте наборы данных по здравоохранению из общедоступных репозиториев и храните их в структурированных форматах, подходящих для анализа машинного обучения и глубокого обучения. Перед началом экспериментальной процедуры ознакомьтесь с полным рабочим процессом, показанным на рисунке 3 .
- Выполнять очистку и предварительную обработку данных в соответствии с процедурами, описанными в разделе 3. Нормализуйте числовые переменные с помощью соответствующих методов масштабирования. Кодировать категориальные переменные с помощью подходящих методов кодирования. Выявлять и приписывать недостающие значения с помощью стратегий импутации, специфичных для набора данных. Проверьте качество данных, согласованность признаков и полноту набора данных перед тем, как приступить к разработке модели.
- Разделите каждый набор данных на подмножества обучения, проверки и тестирования для поддержки беспристрастной оценки модели. Сохранять распределения классов при разделении наборов данных и внедрять меры по предотвращению утечек, где это применимо. Резервируйте тестовое подмножество исключительно для окончательной оценки модели.
- Обучать модели машинного обучения на структурированных наборах данных с использованием алгоритмов на основе ансамбля, включая Gradient Boosting и Random Forest. Обучайте модели глубокого обучения на наборах данных визуализации с использованием архитектур сверточной нейронной сети (CNN), способных изучать признаки пространственных изображений. Обновлять параметры модели итеративно во время обучения и отслеживать результаты валидации после каждого этапа обучения. Применяйте раннюю остановку, когда результаты валидации ухудшаются или не улучшаются согласно заранее установленным критериям остановки.
- Оптимизируйте гиперпараметры модели с помощью систематических стратегий поиска, включая сеточный поиск и рандомизированный поиск. Корректируйте скорость обучения, количество оценщиков, глубину дерева, размер партии, количество эпох и другие параметры, специфичные для модели, в зависимости от эффективности валидации. Выберите окончательную модель на основе предиктивных результатов и возможностей обобщения по наборам валидационных данных.
- Применяйте методы объяснимости после завершения обучения модели. Генерировать глобальные объяснения с помощью методов атрибуции признаков для выявления переменных, наиболее сильных в прогнозировании моделей. Генерируйте локальные объяснения для анализа отдельных случаев предсказания и оценки поведения модели на уровне выборки. Создайте тепловые карты Grad-CAM для моделей классификации изображений, чтобы выделить области изображения, влияющие на прогнозируемый результат. Храните все результаты объяснений для последующего анализа и отчетности.
- Оценивать предсказательные характеристики с использованием точности, точности, отзыва, F1-балла и рабочей характеристики приёмника под кривой (ROC-AUC). Оценивайте качество объяснения с помощью метрик точности и стабильности для оценки надёжности и согласованности объяснения. Сравните производительность модели между наборами данных и методы объяснимости для оценки устойчивости и обобщённости фреймворка.
- Генерируйте результаты визуализации и аналитические отчёты для передачи результатов в клинически интерпретируемой форме. Создавайте таблицы сравнения производительности, графики важности признаков, визуализации SHAP, результаты объяснений LIME, тепловые карты Grad-CAM и другие клинически значимые визуализации. Проверьте все визуальные результаты, чтобы обеспечить ясность и последовательность перед подачей отчетов.
- Документируйте все операции предварительной обработки, конфигурации моделей, настройки гиперпараметров, процедуры объяснимости, стратегии валидации и результаты оценки. Вести подробные экспериментальные записи для облегчения воспроизводимости и независимого воспроизведения рабочего процесса. Проверяйте согласованность результатов при повторных экспериментальных запусках и архивируйте все артефакты рабочего процесса для будущей ссылки.
- Ожидаемый результат — сгенерировать полностью обученную предиктивную модель с оптимизированными гиперпараметрами, сохранёнными весами модели, обучающими журналами, метриками производительности и результатами объяснимости, включая объяснения SHAP, LIME и тепловые карты Grad-CAM. Храните все артефакты модели, отчёты по оценке и результаты визуализации для последующего анализа и оценки воспроизводимости.

Рисунок 3: Сквозной рабочий процесс объяснимого ИИ-пайплайна. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.
6. Оценка модели и оценка объяснимости
- Оценивать производительность предиктивной модели с использованием стандартных классификационных метрик, включая точность, точность, отзыв, F1-балл и рабочую характеристику приёмника под кривой (ROC-AUC). Рассчитайте точность для измерения общей корректности классификации.
- Рассчитайте точность для оценки доли правильно идентифицированных положительных прогнозов. Рассчитывайте отзыв, чтобы оценить способность модели выявлять положительные случаи. Рассчитайте счёт Формулы-1, чтобы сбалансировать точность и воспоминание. Рассчитайте ROC-AUC для оценки дискриминационных результатов по различным порогам классификации.
- Применяйте эти метрики оценки последовательно во всех наборах данных и архитектурах моделей для облегчения объективного сравнения производительности. Записывайте все метрические значения и храните результаты оценки для последующих статистических анализов и отчетности.
- Оценивайте эффективность объяснимости с помощью метрик точности и стабильности. Рассчитайте достоверность, чтобы определить, насколько сгенерированные объяснения точно отражают прогнозы модели и поведение при принятии решений.
- Рассчитайте устойчивость, сравнивая объяснения, полученные из аналогичных входных выборок, и количественно оценивая согласованность результатов объяснений. Проверьте, что значения точности и стабильности соответствуют заранее заданным критериям качества, прежде чем интерпретировать объяснения модели.
- Сравните производительность объяснимости между выходами SHAP, LIME и Grad-CAM.
- Ожидаемый результат — генерируйте количественные результаты, включая точность, точность, отзыв, F1-балл, ROC-AUC, метрики точности и стабильности. Создавать результаты и визуализации объяснимости, подходящие для научной отчетности, оценки воспроизводимости и клинической интерпретации.
7. Оценка, ориентированная на человека
- Нанимите 12 медицинских специалистов, включая 6 врачей, 3 радиолога и 3 аналитика клинических данных. Выбирайте участников с предыдущим опытом принятия клинических решений, интерпретации медицинских изображений, аналитики здравоохранения или электронного обзора медицинских записей. Получите информированное согласие всех участников перед началом процедуры оценки.
- Случайным образом выберите 100 случаев из тестовых наборов данных после завершения обучения модели и анализа объяснимости. Сгенерируйте два условия оценки для каждого случая:
- Вывод только с предсказаниями и
- предсказание сопровождается информацией о объяснимости. Рандомизировать порядок представления кейсов и условия оценки, чтобы минимизировать смещение презентации и эффекты обучения.
- Подготовьте стандартизированные формы оценки, содержащие результаты прогнозирования, результаты объяснений и анкеты оценки. Представляйте индивидуальные случаи участникам с помощью компьютерного интерфейса оценки.
- Инструктировать участников рассматривать каждый случай самостоятельно, не обсуждая ответы с другими оценщиками. Позволить участникам выполнять все оценки в одинаковых экспериментальных условиях.
- Проведите пятибалльный опросник по шкале Ликерта, адаптированный из опубликованных объяснимых исследований оценки искусственного интеллекта. Инструктировать участников оценивать доверие, интерпретируемость и удобство использования для каждого рассмотренного случая. Записывайте ответы на анкету в электронном виде и проверяйте выполнение всех вопросов опроса перед переходом к статистическому анализу.
- Измерять объективные показатели клинической полезности в процессе оценки. Фиксируйте согласование решений, сравнивая решения участников с соответствующими эталонными метками или результатами на основе истины. Рассчитайте согласованность решений как процент решений участников, соответствующих результату отчёта.
- Фиксируйте время рассмотрения каждого дела, измеряя интервал между представлением дела и подачей окончательного ответа. Рассчитывайте среднее время повторения отдельно для условий только предсказания и прогноза с объяснением.
- Рассчитывайте средние показатели доверия, интерпретируемости и удобства использования для всех участников и оценочных случаев. Сравните баллы, полученные при условиях только предсказания и прогноза с объяснением.
- Проведите парные t-тесты после завершения всех оценок участников, чтобы определить, статистически значимы ли различия в доверии, интерпретируемости, удобстве использования, согласовании решений и времени рассмотрения. Используйте порог значимости p 0,05 для всех статистических сравнений.
- Рассчитайте Fleiss Kappa после сбора ответов всех участников для оценки согласия между оценщиками. Используйте агрегированные оценки участников для определения согласованности оценок среди рецензентов. Интерпретировать ценности Fleiss Kappa в соответствии с установленными руководящими принципами соглашения и фиксировать полученную статистику соглашения.
- Краткое изложение демографических данных участников, методологии оценки, дизайна анкеты, процедур статистического анализа, объективных показателей эффективности и результатов согласования между оценщиками в таблице 4.
- Проанализировать результаты модели при обоих условиях оценки и сравнить ответы участников по разным условиям. Убедитесь, что объяснения улучшают доверие, интерпретируемость и удобство использования, не негативно сказываясь на качестве принятия решений.
- Подтвердите согласованность оценок участников с помощью рассчитанной статистики Fleiss Kappa. Записывайте все результаты оценки для последующего отчёта и оценки воспроизводимости.
- Ожидаемый результат — генерировать рейтинги доверия клиницистов, оценки интерпретируемости, оценки удобства использования, меры согласования решений, статистику времени рассмотрения, результаты парных t-тестов и статистику межоценочных согласований. Подготовьте количественные доказательства, описывающие медицинскую полезность, интерпретируемость и надёжность объяснимой системы искусственного интеллекта.
| Параметр | Ценность |
| Эксперты | 12 |
| Врачи | 6 |
| Радиологи | 3 |
| Аналитики клинических данных | 3 |
| Рассмотренные дела | 100 |
| Проектирование оценки | Рандомизированное (только предсказание против предсказания+объяснения) |
| Геодезический инструмент | 5-балльная шкала Ликерта |
| Оценка доверия | Интерпретируемость, доверие, удобство использования |
| Статистический тест | Парный t-тест (p 0.05) |
| Надёжность между рейтингами | Fleiss Kappa |
| Объективные показатели | Соглашение о принятии решения, время рассмотрения |
Таблица 4: Протокол оценки, ориентированный на человека, и дизайн оценки клиницистами.
В этой таблице представлена система оценки клинициста, используемая для оценки интерпретируемости, надёжности и удобства использования объяснимой системы ИИ. Обобщена информация о демографии участников, методологии обзора случаев, дизайне опроса, процедурах статистического анализа, оценке надёжности между оценщиками и объективных мерах оценки.
8. Валидация и оценка воспроизводимости
- Провести исследования валидации и абляции для оценки надёжности и надёжности предлагаемой структуры. Определите признаки с высокими баллами важности с помощью выбранных методов объяснимости. Постепенно удалять важные признаки и переучить предсказательные модели после каждого этапа удаления признаков.
- Оценивайте производительность модели после каждого абляционного эксперимента с использованием точности, точности, воспоминания, показателей F1 и ROC-AUC. Сравните полученные показатели эффективности с базовой моделью, чтобы определить вклад отдельных признаков в прогнозные результаты.
- Оценивайте устойчивость объяснения, генерируя объяснения для аналогичных входных образцов с помощью SHAP, LIME и Grad-CAM. Сравнивайте результаты объяснения по повторным оценкам и количественно оценивайте согласованность с использованием заранее заданных метрик устойчивости. Проверьте, что объяснения остаются стабильными при незначительных изменениях входных данных и повторяющихся экспериментальных запусках.
- Записывайте все экспериментальные процедуры на протяжении всего рабочего процесса. Операции предварительной обработки данных, процедуры разбиения наборов данных, архитектуры моделей, настройки гиперпараметров, обучающие конфигурации, методы объяснимости, стратегии валидации и метрики оценки. Храните все параметры конфигурации и экспериментальные результаты в структурированном формате для облегчения воспроизводимости и независимой проверки.
- Проверьте все экспериментальные записи для обеспечения полноты и согласованности. Убедитесь, что рабочий процесс можно воспроизвести с помощью задокументированных процедур, конфигурационных файлов и программных спецификаций. Поддерживать модульную структуру рабочего процесса для облегчения адаптации протокола для будущих исследований и поддерживать преобразование в видеооснованный экспериментальный протокол, соответствующий методологическим требованиям JoVE.
9. Ресурсы воспроизводимости
- Выполнять все эксперименты с фиксированными случайными семенами, чтобы обеспечить воспроизводимые результаты при повторяющихся запусках. Поддерживать исходный код, скрипты предобработки, конфигурационные файлы, спецификации среды, параметры модели и скрипты визуализации в общедоступном репозитории.
- Предоставить подробные инструкции по сбору наборов данных, предварительной обработке, выполнению экспериментов, обучению моделей, генерации объяснимости, процедурам валидации и регенерации всех представленных таблиц и рисунков. Архивируйте все компоненты рабочего процесса, необходимые для независимой репликации, включая спецификации программного обеспечения, рабочие процессы предварительной обработки, конфигурационные файлы, инструкции доступа к набору данных, контрольные точки модели и визуализационные ресурсы.
- Краткое описание программных ресурсов, рабочих процессов предварительной обработки, конфигурационных файлов, инструкций доступа к набору данных и воспроизводимых ресурсов, используемых на протяжении всего фреймворка, в таблице 5.
- Ожидаемый результат — Сгенерировать полный воспроизводимый экспериментальный пакет, содержащий скрипты предварительной обработки, конфигурационные файлы, обученные модели, контрольные точки модели, результаты объяснимости, отчёты по валидации, артефакты визуализации, спецификации программного обеспечения и документацию, необходимую для независимого копирования и проверки предлагаемого фреймворка.
| Ресурс | Описание |
| Исходный код | Скрипты реализации Python для предварительной обработки данных, обучения моделей, объяснимости и оценки |
| Файл окружения | requirements.txt содержит зависимости и версии пакетов |
| Конфигурационные файлы | Настройки архитектуры моделей, гиперпараметры и конфигурации экспериментов |
| Исправлены случайные семя | Семя = 42, используемое для воспроизводимых экспериментов |
| Инструкции доступа к набору данных | Ссылки и процедуры для получения наборов данных по государственному здравоохранению |
| Скрипты предварительной обработки | Скрипты для очистки данных, нормализации, кодирования и выбора функций |
| Скрипты для генерации фигурок | Скрипты для регенерации всех рукописных фигур |
| Скрипты генерации таблиц | Скрипты для воспроизведения отчетных таблиц и метрик |
| Примеры входных данных | Примеры наборов данных и входные файлы |
| Примеры выходных данных | Результаты прогнозирования, объяснения и отчёты по оценке |
Таблица 5: Ресурсы воспроизводимости и экспериментальные активы.
В этой таблице представлены ресурсы, предоставленные для поддержки экспериментальной воспроизводимости, включая исходный код, скрипты предварительной обработки, конфигурационные файлы, спецификации среды, инструкции доступа к набору данных, фиксированные случайные настройки seed, скрипты генерации фигурок и примеры файлов ввода/вывода, необходимые для воспроизведения сообщаемых результатов.