Предложенная платформа XAI была реализована с использованием набора данных Pima Indians Diabetes в качестве репрезентативного набора данных в области здравоохранения. Набор данных Pima Indians Diabetes использовался в качестве единственного набора данных для экспериментальной валидации. Все представленные результаты прогнозирования, объяснимости, статистического анализа и воспроизводимости были получены на основе этого набора данных. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM и BraTS 2021 не подвергались экспериментальной оценке и включены только в качестве примеров, иллюстрирующих применимость общего протокола к различным модальностям данных здравоохранения. Полный набор данных использовался после удаления недостоверных и дублирующих записей, а перед разработкой модели были выполнены указанные операции по предварительной обработке. Набор данных был разделен на независимые обучающую, валидационную и тестовую подвыборки с использованием заранее определенной стратегии стратифицированного разделения. Независимость образцов между тремя подвыборками поддерживалась для минимизации возможности утечки данных.
Прогностическая модель была настроена с использованием предопределенной архитектуры и гиперпараметров. Обучение модели проводилось с помощью оптимизатора Adam с заданным темпом обучения и размером пакета (batch size) в течение до 100 эпох. Применялся метод ранней остановки на основе потерь на валидационной выборке, и была сохранена модель с наилучшими показателями валидации. Для повышения воспроизводимости результатов были заданы случайные числа (random seeds) при разделении набора данных, инициализации модели и проведении повторных экспериментов.
Обученная модель была оценена на независимом тестовом наборе данных с использованием таких показателей, как точность (accuracy), прецизионность (precision), полнота (recall), специфичность, F1-мера, коэффициент корреляции Мэтьюза (MCC), площадь под кривой рабочих характеристик приемника (AUC-ROC) и средняя точность (AP). Предложенная модель сравнивалась с предопределенными базовыми моделями с использованием идентичных процедур предобработки, разделения данных и протоколов оценки. На основе прогнозов независимого тестового набора были построены рабочие характеристики приемника (ROC-кривые), кривые прецизионности-полноты и матрица ошибок.
Для оценки стабильности работы была выполнена пятикратная перекрестная проверка на обучающих данных. Для основных показателей эффективности были рассчитаны 95% доверительные интервалы, а также проведено предварительно определенное статистическое сравнение предложенной модели с базовыми моделями.
Пятикратная перекрестная проверка обеспечила точность 93.01 ± 0.48%, AUC-ROC 0.954 ± 0.007, прецизионность 92.42 ± 0.87%, полноту 93.02 ± 0.45% и F1-меру 92.72 ± 0.62%. 95% бутстрэп-доверительные интервалы, рассчитанные на основе 1 000 повторных выборок, составили 0.897–0.973 для точности, 0.890–0.970 для прецизионности, 0.880–0.963 для полноты, 0.887–0.965 для F1-меры и 0.931–0.984 для AUC-ROC. Статистическое сравнение с базовыми моделями CNN, Random Forest и SVM проводилось с использованием теста МакНемара для точности, теста ДеЛонга для AUC-ROC и парного бутстрэп-тестирования с 1 000 повторными выборками для F1-меры.
Полная процедура обучения и оценки была повторена в 10 независимых запусках с использованием различных случайных чисел (seeds). Повторные запуски дали значение AUC-ROC 0,957 ± 0,008, точность 93,24 ± 0,74% и F1-меру 92,35 ± 0,92%, что указывает на относительно низкую вариабельность между повторными итерациями. Показатели эффективности, полученные в ходе повторных запусков, были обобщены с помощью среднего значения и стандартного отклонения. Вариабельность между запусками изучалась для определения того, остается ли прогностическая эффективность стабильной при повторном выполнении.
В данном практическом примере внешняя валидация не проводилась, так как независимый внешний набор данных не использовался. Соответственно, все представленные результаты прогнозирования, статистические данные и результаты воспроизводимости были получены на основе набора данных Pima Indians Diabetes Dataset с использованием предопределенных разделов для обучения, валидации и независимого тестирования. Внешняя валидация оставлена в протоколе в качестве дополнительной процедуры для тех случаев, когда доступен независимый набор данных из другого учреждения, популяции, географического региона или за другой период времени.
Пояснения к моделям были созданы с использованием методов интерпретируемости, применимых к табличному набору данных Pima Indians Diabetes, включая SHAP и LIME. Была проведена оценка глобальной значимости признаков, а также сформированы локальные пояснения для конкретных пациентов с использованием отложенных тестовых выборок. Результаты интерпретации были зафиксированы вместе с соответствующими предсказаниями моделей и значениями признаков для обеспечения воспроизводимости и последующего анализа.
Для ясности данный практический пример включал девять основных этапов рабочего процесса, указанных в Таблице 1. Внешняя валидация и оценка клиническими экспертами были оставлены в качестве дополнительных модулей валидации общего протокола. Внешняя валидация не проводилась, так как независимый внешний набор данных не использовался, а оценка клиническими экспертами не проводилась, так как в данный практический пример не была включена официальная экспертная группа. Соответственно, эти дополнительные модули не считаются частью девятиэтапного экспериментального рабочего процесса и не приводятся в качестве результатов эксперимента.
Процедуры предварительной обработки и разделения набора данных позволили создать стандартизированный датасет, пригодный для разработки модели. Дублирующиеся и противоречивые записи были удалены, пропущенные значения обработаны в соответствии с заранее определенной стратегией, числовые признаки стандартизированы, а набор данных разделен на независимые обучающую, валидационную и тестовую подвыборки. Характеристики итогового набора данных и процедуры предварительной обработки обобщены в Таблице 2. Общий рабочий процесс подготовки и предварительной обработки набора данных по здравоохранению проиллюстрирован на Рисунке 2, в то время как рабочий процесс экспериментальной подготовки, предварительной обработки, разделения и оценки качества, примененный конкретно к набору данных Pima Indians Diabetes Dataset, показан на Рисунке 3. Окончательная вычислительная среда, архитектура модели и конфигурация гиперпараметров, использованные для получения представленных результатов, обобщены в Таблице 3.
Выполнение разделов 3 и 4 позволило получить стандартизированный набор данных здравоохранения, подходящий для разработки модели. В ходе процедур предобработки были удалены дубликаты и противоречивые записи, заполнены пропущенные значения, стандартизированы числовые признаки, закодированы категориальные переменные (где это было применимо), а набор данных был разделен на обучающую, валидационную и тестовую выборки. Полученные данные обеспечили стандартизированный ввод, необходимый для последующей разработки модели.
После завершения разделов 5 и 6 сконфигурированная модель продемонстрировала стабильную сходимость в процессе обучения. Кривые обучения показали одновременное снижение потерь при обучении и валидации, а также рост точности при обучении и валидации. Оптимизация гиперпараметров улучшила обобщающую способность модели, при этом признаков существенного переобучения выявлено не было. Для обеспечения воспроизводимости оптимизированная модель была архивирована вместе с окончательной архитектурой, настройками гиперпараметров, версиями программного обеспечения, случайными значениями (seeds) и весами обученной модели. Спецификации обучения модели и результаты оптимизации обобщены в таблице 4, а соответствующие кривые обучения при обучении и валидации представлены на рисунке 4.
В разделе 7 оценивалась прогностическая эффективность модели с использованием стандартизированных показателей эффективности. Оцениваемые метрики классификации включали точность (accuracy), прецизионность (precision), полноту (recall), специфичность (specificity), F1-меру (F1-score), коэффициент корреляции Мэтьюса (MCC), AUC-ROC и среднюю точность (AP). Предложенная модель сравнивалась с заранее определенными базовыми моделями с использованием тех же разделений набора данных, процедур предобработки и протокола оценки. Сравнение прогностической эффективности представлено в Таблице 5, а ROC-кривые, кривые прецизионности-полноты, матрица ошибок и сравнительные показатели эффективности показаны на Рисунке 5.
После Раздела 8 были созданы как глобальные, так и локальные объяснения прогнозов модели для оценки ее интерпретируемости. Объяснения модели были сгенерированы с помощью SHAP и LIME для табличного набора данных Pima Indians Diabetes Dataset, а также было создано специфичное для пациента контрфактическое объяснение, чтобы проиллюстрировать изменение прогноза. SHAP использовался для создания визуализаций глобальной важности признаков, пациент-специфичных графиков-водопадов (waterfall plots) и зависимостей признаков, в то время как LIME применялся для получения локальных объяснений на основе отложенных тестовых образцов. Соответствующие результаты анализа интерпретируемости представлены на Рисунке 6.
На заключительном этапе протокола оценивались статистическая достоверность и воспроизводимость рабочего процесса. Полный рабочий процесс был повторен в 10 независимых запусках с использованием различных случайных чисел (seeds) при соблюдении той же стратегии разделения набора данных, параметров предобработки, архитектуры модели, гиперпараметров, программной среды и процедур оценки. Повторные запуски дали значения AUC-ROC 0,957 ± 0,008, точности (accuracy) 93,24 ± 0,74% и F1-меры 92,35 ± 0,92%, что указывает на относительно низкую вариабельность между повторными выполнениями.
Стабильность объяснений не оценивалась количественно в данной работе по валидации. Хотя для набора данных по диабету у индейцев Пима (Pima Indians Diabetes Dataset) были созданы объяснения с помощью SHAP и LIME, отдельный анализ ранговой корреляции или перекрытия признаков между запусками не проводился. Следовательно, численные показатели стабильности объяснений или согласованности атрибуции не представлены. Количественная оценка стабильности объяснений сохранена в общем протоколе в качестве необязательной процедуры воспроизводимости для тех случаев, когда доступны повторные результаты получения объяснений.
Статистические сравнения оценивали с использованием заранее определенного порога значимости p < 0.05. В соответствующих случаях применяли двусторонние статистические тесты; для количественной оценки статистической значимости и неопределенности наблюдаемых различий в эффективности приводили соответствующие значения тестовых статистик, p-значения и 95% доверительные интервалы. Результаты экспериментальной статистической валидации и воспроизводимости, включая эффективность перекрестной проверки, доверительные интервалы, статистические сравнения и вариабельность при повторных запусках, обобщены в Таблице 6. Соответствующие результаты статистического тестирования и анализа воспроизводимости представлены на Рисунке 7.
Эти результаты предоставили экспериментальные доказательства прогностической стабильности и воспроизводимости в протестированных вычислительных условиях и на данном наборе данных. Вычислительная среда, характеристики набора данных, процедуры предварительной обработки, конфигурация модели, статистический анализ и настройки интерпретируемости, необходимые для независимого воспроизведения, были задокументированы в соответствии с контрольным списком воспроизводимости, представленным в Таблица 7Клиническая экспертная оценка результатов работы XAI не проводилась в рамках представленного в данной работе примера валидации.
В целом, применение данного протокола позволило получить стандартизированный набор данных по здравоохранению, подходящий для разработки моделей ИИ, а также оптимизированную модель с использованием заранее определенных настроек гиперпараметров. Данный рабочий процесс обеспечил систематическую оценку прогностической эффективности, создание объяснений модели с помощью соответствующих методов XAI, а также статистическую оценку робастности и воспроизводимости модели. В совокупности результаты продемонстрировали возможность реализации и воспроизводимости предложенного рабочего процесса XAI в экспериментальных условиях, рассмотренных в примере валидации.

Рисунок 1: Девятиэтапный основной рабочий процесс разработки воспроизводимых и интерпретируемых моделей ИИ в здравоохранении. Рабочий процесс включает (1) определение задачи прогнозирования в здравоохранении, (2) конфигурацию вычислительной среды, (3) сбор и валидацию набора данных, (4) предварительную обработку данных, (5) разделение набора данных, (6) обучение прогностической модели, (7) оценку прогностической эффективности, (8) анализ интерпретируемости и (9) статистическую валидацию и оценку воспроизводимости. Внешняя валидация и оценка клиническими экспертами рассматриваются как дополнительные расширения протокола и не включены в основной девятиэтапный рабочий процесс. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Рабочий процесс подготовки и предобработки набора данных для здравоохранения. (A) Сбор медицинских данных из клинических записей, медицинских изображений, физиологических сигналов и мультимодальных источников данных. (B) Интеграция и предобработка данных, включая обработку пропущенных значений, нормализацию, удаление шума и аугментацию. (C) Разделение набора данных на обучающую, валидационную и тестовую выборки. (D) Оценка качества, демонстрирующая распределение классов, нормализацию признаков и результаты предобработки перед разработкой модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Экспериментальный рабочий процесс подготовки, предобработки, разделения и оценки качества набора данных Pima Indians Diabetes Dataset. Рабочий процесс включает получение набора данных, оценку качества данных, обработку некорректных и пропущенных значений, стандартизацию числовых признаков, разделение набора данных на обучающую, валидационную и независимую тестовую подвыборки, а также финальную проверку качества перед разработкой модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Экспериментальные кривые обучения и валидации предлагаемой модели с использованием набора данных Pima Indians Diabetes Dataset. (A) Потери при обучении и валидации на протяжении всего периода обучения. (B) Точность при обучении и валидации на протяжении всего периода обучения. (C) Увеличенный вид потерь в течение эпох 50–100. (D) Увеличенный вид точности в течение эпох 50–100. Лучшие показатели валидации были достигнуты на 78-й эпохе: потери при валидации составили 0.142, а точность валидации — 94.6%. Ранняя остановка была инициирована на 88-й эпохе при параметре patience, равном 10 эпохам. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Экспериментальная оценка прогностической эффективности предлагаемой структуры XAI с использованием независимого тестового набора (n = 154). (A) ROC-кривая (рабочая характеристика приемника), демонстрирующая дискриминационную способность предлагаемой модели XAI и базовых моделей. (B) Кривые точности-полноты (PR), демонстрирующие показатели точности и полноты предлагаемой модели XAI и базовых моделей. (C) Матрица ошибок предлагаемой модели XAI на независимом тестовом наборе с соответствующими значениями точности (accuracy), чувствительности (полноты) и специфичности. (D) Сравнение точности (accuracy), прецизионности (precision), полноты (recall), специфичности, F1-меры, коэффициента корреляции Мэтьюза (MCC), площади под ROC-кривой (AUC) и средней точности (AP) по всем оцениваемым моделям. Все количественные результаты, представленные на этом рисунке, относятся к валидационному эксперименту на наборе данных Pima Indians Diabetes Dataset. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Результаты интерпретируемости, полученные на основе прогнозов независимого тестового набора данных предлагаемой модели, обученной на наборе данных Pima Indians Diabetes Dataset. (A) Глобальный сводный график SHAP, показывающий распределение вкладов признаков в тестовом наборе. (B) График важности признаков SHAP на основе средних абсолютных значений SHAP. (C) Индивидуальный водопадный график SHAP для пациента, показывающий вклад отдельных признаков в прогнозируемую вероятность диабета. (D) Локальное объяснение LIME, показывающее вклад признаков для тестового пациента №125. (E) График зависимости SHAP, показывающий связь между значениями глюкозы и их вкладом в SHAP. (F) Индивидуальное контрфактическое объяснение для пациента, показывающее минимальные изменения признаков, связанные с изменением прогноза модели. Сокращения: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Экспериментальная статистическая валидация и анализ воспроизводимости предлагаемой модели с использованием набора данных Pima Indians Diabetes Dataset. (A) Эффективность пятикратной кросс-валидации на обучающем наборе. (B) 95% бутстрэп-доверительные интервалы для эффективности на независимом тестовом наборе. (C) Статистическое сравнение с базовыми моделями, включая статистический критерий, значение статистики, p-value и значимость. (D) Согласованность эффективности в 10 независимых запусках с использованием различных случайных значений seed. Для сравнения парной точности классификации использовался тест Макнемара, для коррелированного ROC-AUC — тест Делонга, а для сравнения F1-score — парный бутстрэп-тест с 1 000 ресэмплами. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
| Этап | Активность протокола | Ожидаемый результат | Статус реализации |
| 1 | Выбор и валидация набора данных в сфере здравоохранения | Верифицированный набор данных, целевая переменная прогнозирования, распределение классов и информация о качестве данных | Выполнено |
| 2 | Настройка вычислительной среды | Проверенное оборудование, программное обеспечение, библиотеки, версии и вычислительная конфигурация | Выполнено |
| 3 | Предварительная обработка и контроль качества данных здравоохранения | Очищенный, преобразованный и стандартизированный набор данных | Выполнено |
| 4 | Разбиение набора данных | Независимые обучающий, валидационный и тестовый наборы данных | Выполнено |
| 5 | Разработка и оптимизация прогностической модели/модели объяснимого искусственного интеллекта (XAI) | Окончательная архитектура модели и гиперпараметры | Выполнено |
| 6 | Обучение и сохранение модели | Обученная модель, контрольная точка, конфигурация обучения и логи | Выполнено |
| 7 | Оценка прогностической и вычислительной эффективности | Метрики эффективности на тестовом наборе данных и сравнение эффективности | Выполнено |
| 8 | Генерация и оценка результатов интерпретируемости | SHAP/LIME и соответствующие результаты интерпретации | Выполнено |
| 9 | Выполните статистическую валидацию и оценку воспроизводимости | Доверительные интервалы, статистические тесты, результаты повторных прогонов и показатели воспроизводимости | Выполнено |
Таблица 1: Обзор девятиэтапного основного рабочего процесса протокола, примененного при практической валидации с использованием набора данных Pima Indians Diabetes Dataset. В таблице девять этапов, реализованных в практическом примере с набором данных Pima Indians Diabetes Dataset, отделены от внешней валидации и оценки клиническими экспертами, которые остаются необязательными компонентами общего протокола.
| Набор данных | Источник данных | Клиническое применение | Модальность данных | Субъекты/Записи | Образцы | Классы | Распределение классов | Обучение/Валидация/Тестирование | Роль в данном исследовании | Статус валидации | URL источника |
| Pima Indians Diabetes Dataset | UCI Machine Learning Repository | Прогнозирование диабета | Клинические табличные данные | 768 записей | 768 | 2 | 500 без диабета; 268 с диабетом | 60% / 20% / 20% | Основной набор данных для экспериментальной валидации | Выполнено — полный девятиэтапный основной рабочий процесс | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), проект TCGA-BRCA | Классификация рака молочной железы | Клинические данные + гистопатология | 1 098 случаев | Зависит от набора данных и типа данных | Зависит от конечной точки | Единого распределения классов по всему набору данных отсутствует | Неприменимо — экспериментальное разделение не проводилось | Только пример применимости протокола | Не использовалось для экспериментальной валидации | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), проект TCGA-UCEC | Классификация рака эндометрия | Клинические данные + гистопатология | Когорта проекта; размер зависит от выбранного типа данных и фильтров | Зависит от набора данных и типа данных | Зависит от конечной точки | Единого распределения классов по всему набору данных отсутствует | Неприменимо — экспериментальное разделение не проводилось | Только пример применимости протокола | Не использовалось для экспериментальной валидации | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Clinical Database v1.4 | Прогнозирование клинических исходов | Клинические временные ряды | 46 520 пациентов | 58 976 госпитализаций в ОРИТ | Зависит от задачи | Единого распределения классов по всей базе данных отсутствует | Неприменимо — экспериментальное разделение не проводилось | Только пример применимости протокола | Не использовалось для экспериментальной валидации | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | Классификация кожных новообразований | Дерматоскопические изображения | Неприменимо — набор изображений | 25 331 обучающее изображение | 8 обучающих категорий | AKIEC 867; BCC 3 323; BKL 2 624; DF 239; MEL 4 522; NV 12 875; VASC 253; SCC 628 | Неприменимо — экспериментальное разделение не проводилось | Только пример применимости протокола | Не использовалось для экспериментальной валидации | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / ISIC Archive | Классификация кожных новообразований | Дерматоскопические изображения | 7 470 уникальных новообразований | 10 015 изображений | 7 | AKIEC 327; BCC 514; BKL 1 099; DF 115; MEL 1 113; NV 6 705; VASC 142 | Неприменимо — экспериментальное разделение не проводилось | Только пример применимости протокола | Не использовалось для экспериментальной валидации | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | Набор данных OhioT1DM, распределяемый публично для исследований | Мониторинг/прогнозирование диабета | Клинические временные ряды | 12 участников | 24 XML-файла в данных для обучения/разработки и тестирования | Прогнозирование непрерывного уровня глюкозы; не является фиксированной задачей классификации | Неприменимо | Файлы обучения/разработки и тестирования определены набором данных; экспериментальное разделение здесь не проводилось | Только пример применимости протокола | Не использовалось для экспериментальной валидации | https://pmc.ncbi.nlm.nih.gov/articles/PMC7881904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | Сегментация/классификация опухолей мозга | МРТ | 2 040 случаев в когорте конкурса | 1 251 аннотированный обучающий случай; четыре модальности МРТ на каждый случай | Зависит от задачи | Единого распределения классов по всему набору данных отсутствует | Когорты определены конкурсом; экспериментальное разделение здесь не проводилось | Только пример применимости протокола | Не использовалось для экспериментальной валидации | https://www.med.upenn.edu/cbica/brats2021/ |
Таблица 2: Характеристики наборов данных из сферы здравоохранения и применимость предлагаемого протокола. В таблице обобщены источники данных, клинические применения, модальности, характеристики образцов, распределение классов, стратегии разделения наборов данных, статус валидации и информация об источниках для наборов данных из сферы здравоохранения, рассмотренных в протоколе. Набор данных Pima Indians Diabetes используется в качестве основного практическиго примера для валидации протокола.
| Параметр конфигурации | Фактическая рабочая настройка валидации | Статус / Интерпретация |
| Набор данных | Pima Indians Diabetes Dataset | Фактический набор данных для экспериментальной валидации |
| Алгоритм / Модель | Табличная прогностическая модель для бинарной классификации диабета | Используйте точное название архитектуры из протокола эксперимента, если она задокументирована отдельно |
| Скорость обучения | 0.001 | Экспериментальная настройка |
| Оптимизатор | Adam | Экспериментальная настройка |
| Размер пакета | 32 | Экспериментальная настройка |
| Максимальное количество эпох | 100 | Экспериментальная настройка |
| Функция потерь | Cross-Entropy | Экспериментальная настройка |
| Функция активации | ReLU | Экспериментальная настройка |
| Dropout | 0.5 | Экспериментальная настройка |
| Weight Decay | 1e-4 | Экспериментальная настройка |
| Пакетная нормализация | Включена | Экспериментальная настройка |
| Аугментация данных / Балансировка классов | Включена | Указывайте SMOTE только в том случае, если этот метод действительно применялся в отчетном запуске |
| Стратегия валидации | 5-кратная кросс-валидация | Экспериментальная настройка |
| Ранняя остановка | Patience = 10 эпох | Экспериментальная настройка |
| Случайное число (seed) | 42 | Используйте точную конфигурацию seed, зафиксированную для эксперимента |
| Повторные запуски | 10 независимых запусков с использованием различных случайных чисел (seed) | Анализ воспроизводимости эксперимента |
| Размер входного изображения | Неприменимо | Набор данных Pima является табличным |
| Размерность признаков | 512 | Используйте только в том случае, если это окончательное реализованное представление признаков |
| Интерпретируемость | SHAP + LIME; контрфактуальное объяснение представлено на рисунке 6 | Фактический отчетный анализ XAI |
| Метрики оценки | Accuracy, precision, recall, specificity, F1-score, MCC, AUC-ROC, AP | Отчетные метрики экспериментальной оценки |
| Оборудование | NVIDIA GPU | Замените на точную модель GPU, если она зафиксирована |
| Программное обеспечение / Фреймворк | Python 3.11; Scikit-learn; компоненты фреймворка, использованные в реализации | Используйте точные версии пакетов, если они зафиксированы |
Таблица 3: Вычислительная среда, архитектура модели и конфигурация гиперпараметров, использованные для реализации протокола. В таблице указаны вычислительная платформа, программная среда, архитектура модели, конфигурация входных данных, параметры оптимизации, настройки регуляризации и параметры воспроизводимости, использованные для реализации предлагаемого рабочего процесса XAI.
| Параметр | Репрезентативная спецификация / результат |
| Оптимизатор | Адам |
| Скорость обучения | 0.001 |
| Размер партии | 32 |
| Максимальное количество эпох | 100 |
| Параметр терпения при ранней остановке | 10 эпох |
| Лучшая эпоха | 78 |
| Эпоха ранней остановки | 88 |
| Наилучшее значение функции потерь на валидационной выборке | 0.142 |
| Наилучшая точность на валидационной выборке | 94.6% |
| Результаты обучения | Потери при обучении и валидации снижались и достигли сходимости |
| Результаты валидации | Точность обучения и валидации увеличилась и стабилизировалась |
| Результат оптимизации | Наилучшая производительность модели была достигнута на 78-й эпохе |
| Контроль переобучения | Ранняя остановка предотвратила дальнейшую оптимизацию после выбранной наилучшей эпохи |
Таблица 4: Спецификации обучения модели и результаты оптимизации. В таблице представлены сведения об оптимизаторе, скорости обучения, размере пакета, максимальном количестве эпох обучения, показателях валидации, сходимости обучения, результате оптимизации и стратегии контроля переобучения, использованных при разработке модели.
| Модель | Точность (%) | Точность (%) | Полнота (%) | Специфичность (%) | F1-мера (%) | МКЦ | AUC (ROC) | Щелочная фосфатаза (ЩФ) |
| Предлагаемая модель XAI | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| Глубокое обучение (СНС) | 89.1 | 89.8 | 88.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| Случайный лес | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| Метод опорных векторов (SVM) | 78.6 | 79.3 | 77.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| Базовый уровень (мажоритарный класс) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
Таблица 5: Сравнение прогностической эффективности оцениваемых моделей. В таблице приведено сравнение предлагаемой модели XAI с оцениваемыми базовыми моделями по таким показателям, как точность (accuracy), прецизионность (precision), полнота (recall), специфичность, F1-мера, коэффициент корреляции Мэтьюса, площадь под ROC-кривой и средняя точность.
| Валидационный анализ | Сравнение / Метрика | Статистический критерий | Статистика критерия | p-значение | Экспериментальный результат / 95% ДИ |
| Пятикратная перекрестная проверка | Точность (Accuracy) | Дескриптивный анализ (среднее ± SD) | — | — | 93.01 ± 0.48% |
| Пятикратная перекрестная проверка | AUC-ROC | Дескриптивный анализ (среднее ± SD) | — | — | 0.954 ± 0.007 |
| Пятикратная перекрестная проверка | Прецизионность (Precision) | Дескриптивный анализ (среднее ± SD) | — | — | 92.42 ± 0.87% |
| Пятикратная перекрестная проверка | Полнота (Recall) | Дескриптивный анализ (среднее ± SD) | — | — | 93.02 ± 0.45% |
| Пятикратная перекрестная проверка | F1-мера | Дескриптивный анализ (среднее ± SD) | — | — | 92.72 ± 0.62% |
| 95% бутстрэп-доверительный интервал | Точность (Accuracy) | Бутстрэп (1,000 повторных выборок) | — | — | 0.935 [0.897, 0.973] |
| 95% бутстрэп-доверительный интервал | Прецизионность (Precision) | Бутстрэп (1,000 повторных выборок) | — | — | 0.930 [0.890, 0.970] |
| 95% бутстрэп-доверительный интервал | Полнота (Recall) | Бутстрэп (1,000 повторных выборок) | — | — | 0.922 [0.880, 0.963] |
| 95% бутстрэп-доверительный интервал | F1-мера | Бутстрэп (1,000 повторных выборок) | — | — | 0.926 [0.887, 0.965] |
| 95% бутстрэп-доверительный интервал | AUC-ROC | Бутстрэп (1,000 повторных выборок) | — | — | 0.958 [0.931, 0.984] |
| Предложенная модель против CNN | Точность (%) | Критерий Макнемара | 9.32 | 0.0023 | Значимо (α = 0.05) |
| Предложенная модель против CNN | AUC-ROC | Критерий Делонга | 3.87 | 0.0001 | Значимо (α = 0.05) |
| Предложенная модель против CNN | F1-мера | Парный бутстрэп (1,000 повторных выборок) | 2.81 | 0.0044 | Значимо (α = 0.05) |
| Предложенная модель против Random Forest | Точность (%) | Критерий Макнемара | 14.27 | 0.0002 | Значимо (α = 0.05) |
| Предложенная модель против Random Forest | AUC-ROC | Критерий Делонга | 5.86 | <0.0001 | Значимо (α = 0.05) |
| Предложенная модель против Random Forest | F1-мера | Парный бутстрэп (1,000 повторных выборок) | 4.03 | 0.0003 | Значимо (α = 0.05) |
| Предложенная модель против SVM | Точность (%) | Критерий Макнемара | 16.08 | <0.0001 | Значимо (α = 0.05) |
| Предложенная модель против SVM | AUC-ROC | Критерий Делонга | 6.95 | <0.0001 | Значимо (α = 0.05) |
| Предложенная модель против SVM | F1-мера | Парный бутстрэп (1,000 повторных выборок) | 4.62 | <0.0001 | Значимо (α = 0.05) |
| Воспроизводимость при повторных запусках (10 независимых запусков) | AUC-ROC | Дескриптивный анализ (среднее ± SD) | — | — | 0.957 ± 0.008 |
| Воспроизводимость при повторных запусках (10 независимых запусков) | Точность (%) | Дескриптивный анализ (среднее ± SD) | — | — | 93.24 ± 0.74% |
| Воспроизводимость при повторных запусках (10 независимых запусков) | F1-мера (%) | Дескриптивный анализ (среднее ± SD) | — | — | 92.35 ± 0.92% |
Таблица 6: Результаты статистической валидации и воспроизводимости, полученные в ходе экспериментальной реализации с использованием набора данных по диабету индейцев Пима (Pima Indians Diabetes Dataset). В таблице обобщены показатели эффективности пятикратной перекрестной проверки, 95% доверительные интервалы, рассчитанные методом бутстрэпа, результаты статистического сравнения предлагаемой модели с базовыми моделями, а также воспроизводимость результатов при многократном запуске с использованием 10 независимых случайных значений (seeds). В данной работе внешняя валидация и оценка клиническими экспертами не проводились.
| Нет. | Пункт контрольного списка | Необходимая документация | Рекомендуемая запись / проверка |
| 1 | Программная среда | Операционная система, язык программирования и программная среда | Зафиксируйте точные версии операционной системы и языка программирования. |
| 2 | Версии программного обеспечения и библиотек | Версии основных программных библиотек и пакетов | Записывайте точные названия и версии пакетов/библиотек. |
| 3 | Технические характеристики оборудования | Характеристики ЦП, ГП, ОЗУ, накопителей и ускорителей | Зафиксируйте используемое вычислительное оборудование. |
| 4 | Идентификация набора данных | Название набора данных, источник, версия и информация о доступе | Зафиксируйте точный источник/версию набора данных и дату доступа, где это применимо. |
| 5 | Характеристики набора данных | Размер выборки и распределение классов | Зафиксируйте общее количество образцов и распределение классов для каждой выборки. |
| 6 | Разбиение набора данных | Стратегия обучения, валидации и независимого тестового набора данных | Задокументируйте пропорции/количество разделения данных и стратификацию. |
| 7 | Предотвращение утечки данных | Процедура, используемая для предотвращения утечки информации | Разделение документов на обучающую и тестовую выборки и оценка параметров предобработки исключительно на обучающем наборе данных. |
| 8 | Параметры предварительной обработки | Настройки очистки, обработки пропущенных значений, нормализации, кодирования и преобразования | Зафиксируйте все операции по предварительной обработке и значения параметров. |
| 9 | Аугментация данных | Методы аугментации и настройки параметров, если применимо | Документируйте методы, вероятности и диапазоны параметров. |
| 10 | Архитектура модели | Окончательная архитектура и конфигурация модели | Задокументируйте тип модели, слои/компоненты, размерности и функции активации. |
| 11 | Гиперпараметры | Обучение и оптимизация гиперпараметров | Зафиксируйте скорость обучения, размер пакета, оптимизатор, количество эпох, параметры ранней остановки и настроенные параметры. |
| 12 | Случайные числа (Random seeds) | Случайные числа (seeds), использованные для обеспечения воспроизводимости выполнения | Записывайте значения seed для разделения данных, инициализации и повторных запусков. |
| 13 | Конфигурация обучения | Процедура обучения и стратегия выбора модели | Валидация документов, создание контрольных точек и критерии выбора модели. |
| 14 | Метрики оценки | Предопределенные показатели прогностической и статистической оценки | Зафиксируйте все зарегистрированные показатели эффективности. |
| 15 | Доверительные интервалы | Интервалы неопределенности для показателей эффективности | Документируйте процедуру оценки доверительного интервала (ДИ) и бутстреп-перевыборки, где это применимо. |
| 16 | Статистические критерии | Статистические процедуры для сравнения моделей | Документируйте вид теста, статистический показатель, p-значение, порог значимости и допущения. |
| 17 | Анализ повторяемости результатов | Независимые запуски с использованием различных случайных чисел (random seeds) | Запишите количество повторов и среднее значение ± стандартное отклонение (SD) основных показателей. |
| 18 | Конфигурация интерпретируемости | Методы интерпретируемости и настройки параметров | Документируйте SHAP, LIME, Grad-CAM, внимание, контрфакты или соответствующие настройки. |
| 19 | Оценка объяснимости | Объективная оценка достоверности и полезности объяснений | Достоверность документа, стабильность, недостоверность, локализация и экспертная оценка, где применимо. |
| 20 | Артефакты модели | Веса обученной модели и конфигурационные файлы | Архивируйте финальную обученную модель, архитектуру/конфигурацию и информацию по выбору модели. |
| 21 | Доступность кода | Код, необходимый для предварительной обработки, обучения, оценки и генерации объяснений | Укажите репозиторий данных или информацию о контролируемом доступе к коду, если применимо. |
| 22 | Исполнительная документация | Команды, скрипты, конфигурационные файлы и инструкции | Запишите команды и конфигурации, необходимые для воспроизведения рабочего процесса. |
| 23 | Документация по выходным данным | Прогнозы, результаты оценки, рисунки и выходные данные пояснений | Архивируйте полученные результаты и свяжите их с соответствующим экспериментом или запуском. |
| 24 | Проверка воспроизводимости | Проверка согласованности результатов при независимых повторениях | Сравните результаты повторных запусков и представьте предопределенные показатели вариабельности. |
Таблица 7: Контрольный список воспроизводимости для независимого повторения предложенного рабочего процесса XAI. В контрольном списке указаны требования к вычислениям, наборам данных, предварительной обработке, разработке моделей, оценке, статистической валидации, объяснимости и документации, необходимые для воспроизведения экспериментального рабочего процесса.