Анализ прогностической эффективности
FedMediFormer-XAI продемонстрировал более высокую прогностическую эффективность по сравнению с оцениваемыми унимодальными и традиционными базовыми моделями. Аугментация на основе диффузионных моделей улучшила репрезентативность миноритарного класса; результаты прогностической эффективности приведены в Таблице 3. Оценка при повторных запусках показала стабильную прогностическую эффективность всех исследованных моделей. FedMediFormer-XAI достиг наилучших общих показателей: точность (accuracy) составила 94.20 ± 0.34% (95% CI: 93.78–94.62), прецизионность (precision) — 93.10 ± 0.30% (95% CI: 92.73–93.47), полнота (recall) — 92.80 ± 0.28% (95% CI: 92.45–93.15), а F1-мера (F1-score) — 92.90 ± 0.28% (95% CI: 92.55–93.25). Модель достигла значения MCC 0.88 ± 0.02 (95% CI: 0.86–0.90) и AUC-ROC 0.96 ± 0.01 (95% CI: 0.95–0.97). Следующие по эффективности результаты показал централизованный мультимодальный трансформер, в то время как унимодальные и традиционные модели машинного обучения продемонстрировали сравнительно более низкую прогностическую эффективность. Эти результаты указывают на то, что мультимодальное обучение представлениям в сочетании с федеративной оптимизацией обеспечивает более высокую и стабильную эффективность классификации диабета.
Абляционное исследование
Для оценки вклада аугментации с помощью диффузии, федеративного обучения, рекомендации лекарственных средств на основе GraphSAGE и мультимодального слияния использовалось покомпонентное абляционное исследование. Полная архитектура FedMediFormer-XAI достигла точности (accuracy) 94.20 ± 0.34%, прецизионности (precision) 93.10 ± 0.30%, полноты (recall) 92.80 ± 0.28%, F1-меры 92.90 ± 0.28%, MCC 0.88 ± 0.02 и AUC-ROC 0.96 ± 0.01 по результатам пяти независимых запусков. Удаление аугментации с помощью диффузии снизило точность до 91.80 ± 0.42%, что соответствует снижению на 2.40 процентного пункта, в то время как F1-мера и AUC-ROC снизились до 90.30 ± 0.38% и 0.94 ± 0.01 соответственно. Данное снижение указывает на вклад диффузионной аугментации в репрезентативность миноритарного класса и робастность прогнозирования.
Исключение федеративного обучения привело к снижению точности до 93.10 ± 0.37%, что на 1.10 процентного пункта меньше по сравнению с полной структурой. Точность (precision), полнота (recall), F1-мера, коэффициент корреляции Мэтьюза (MCC) и AUC-ROC также снизились до 92.20 ± 0.34%, 91.80 ± 0.32%, 92.00 ± 0.33%, 0.86 ± 0.02 и 0.95 ± 0.01 соответственно. Данное сравнение демонстрирует вклад федеративной конфигурации в прогностическую эффективность.
Удаление компонента персонализированного подбора лекарственных средств на основе GraphSAGE привело к сравнительно небольшому изменению эффективности прогнозирования диабета: точность снизилась до 93.80 ± 0.35%, а F1-мера — до 92.60 ± 0.30%. Соответствующие значения MCC и AUC-ROC составили 0.87 ± 0.02 и 0.96 ± 0.01 соответственно. Этот результат указывает на то, что GraphSAGE в первую очередь способствует персонализированному подбору медикаментов, а не напрямую определяет эффективность классификации диабета.
Наибольшее снижение наблюдалось при удалении мультимодального слияния. Точность снизилась до 87,60 ± 0,55%, что представляет собой снижение на 6,60 процентного пункта, в то время как прецизионность, полнота, F1-мера, коэффициент MCC и AUC-ROC снизились до 86,80 ± 0,51%, 85,90 ± 0,54%, 86,30 ± 0,52%, 0,76 ± 0,03 и 0,91 ± 0,01 соответственно. Этот результат демонстрирует важность совместного моделирования взаимодополняющей информации из клинических данных, данных НМГ и ретинальных модальностей.
Анализ федеративного обучения
Структура федеративного обучения позволила осуществлять совместное обучение моделей на распределенных клиентских узлах при сохранении децентрализованной обработки необработанных данных пациентов. В процессе обучения локальная модель каждого клиента дорабатывалась индивидуально и объединялась с помощью метода федеративного усреднения (Federated Averaging). После 100 раундов обмена данными глобальная модель сошлась, и ее прогностическая эффективность осталась сопоставимой с показателями централизованного обучения. Структура федеративного обучения продемонстрировала стабильную сходимость на протяжении раундов обмена данными, несмотря на гетерогенное распределение данных на клиентских узлах. Защищенный обмен параметрами обеспечил децентрализованную обработку данных, при этом глобальная модель сохранила конкурентоспособную прогностическую эффективность по сравнению с централизованным базовым вариантом. В таблице 4 приведено сравнение централизованной и федеративной реализаций. Федеративное обучение потребовало дополнительного времени на обучение из-за накладных расходов на связь, сохраняя при этом прогностическую эффективность, сравнимую с централизованным обучением.
Анализ эффективности на уровне наборов данных
Для оценки обобщающей способности модели в различных модальностях здравоохранения мы оценивали эффективность на каждом наборе данных по отдельности. Мультимодальная модель FedMediFormer-XAI продемонстрировала высокую и в целом конкурентоспособную эффективность на всех оцениваемых наборах данных. Она достигла точности 91.8%, 93.1%, 92.4% и 94.2% на наборах данных Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM и APTOS 2019 соответственно. Хотя на наборе данных APTOS 2019 была достигнута несколько более высокая точность (94.7%) и прецизионность (93.9%), чем у мультимодальной модели, предлагаемый мультимодальный подход сохранил конкурентоспособную эффективность на всех наборах данных и обеспечил показатель AUC-ROC 0.96, что сопоставимо с наивысшим значением AUC-ROC на уровне отдельных наборов данных. Общие результаты на уровне наборов данных представлены в Таблице 5. При использовании отдельных наборов данных наилучшая эффективность была достигнута при анализе изображений сетчатки, тогда как мультимодальное объединение обеспечило наиболее стабильные и сбалансированные прогнозы.
Анализ персонализированных рекомендаций по лекарственным препаратам
Компонент рекомендаций на основе графовых нейронных сетей был оценен с использованием данных об эффективности лекарственных средств и данных о лекарственных взаимодействиях; при этом потенциальные препараты ранжировались в соответствии с вычисленными показателями пригодности конкретного препарата для данного пациента, а противопоказанные комбинации исключались в процессе генерации рекомендаций. Использование формата гетерогенного графа и моделирование взаимодействий «пациент-препарат» и «препарат-препарат» позволило провести тщательный анализ, что способствовало персонализированному подбору лекарств и оценке безопасности. Модель рекомендаций GraphSAGE эффективно выявила сложные взаимосвязи между пациентами, заболеваниями, результатами лабораторных исследований и лекарственными препаратами. Персонализированные рекомендации продемонстрировали высокую точность ранжирования, сохраняя при этом клинически значимые обоснования благодаря анализу окрестностей графа и атрибуции признаков.
Согласно Таблице 6, модуль персонализированных рекомендаций по лекарственным препаратам был оценен с помощью показателей Precision@5, Recall@5 и NDCG@5. Эти метрики количественно определяют релевантность и качество ранжирования пяти лучших персонализированных рекомендаций по медикаментам, сформированных модулем рекомендаций на основе GraphSAGE. Система рекомендаций продемонстрировала высокие показатели ранжирования: precision = 0.89, recall = 0.84 и NDCG = 0.91.
Анализ объяснимости
В структуру включены методы SHAP, интегрированные градиенты (Integrated Gradients), визуализация внимания и контрфактуальные объяснения для поддержки интерпретации мультимодальных прогнозов. Метод SHAP использовался для количественной оценки вклада отдельных признаков, интегрированные градиенты — для соотнесения прогнозов с входными признаками, визуализация внимания — для изучения фокуса модели по различным модальностям, а контрфактуальные объяснения — для выявления изменений признаков, связанных с альтернативными прогнозами. На рисунке 8 представлен репрезентативный сводный график SHAP, полученный с помощью обученной модели FedMediFormer-XAI, в то время как на рисунке 9 приведены репрезентативные результаты визуализации внимания, извлеченные из обученного трансформера. Данные рисунки представляют собой результаты оценки модели, а не схематические иллюстрации предлагаемой архитектуры.
На Рисунке 8 представлены агрегированные рейтинги важности признаков. Признаки с более высокими абсолютными значениями SHAP оказали большее влияние на прогнозы модели, что также хорошо согласуется с имеющимися клиническими знаниями.
Рисунок 9 представляет репрезентативные визуализации внимания, извлеченные непосредственно из обученной модели FedMediFormer-XAI для случайно выбранного отложенного тестового образца. Визуализации включают внимание к клиническим признакам, временное внимание CGM, пространственное внимание к сетчатке и кросс-модальное внимание между тремя модальностями. Визуализация внимания дополнительно продемонстрировала изученное моделью распределение внимания по нескольким модальностям. Для выбранного образца наблюдалось относительно более выраженное внимание к HbA1c, длительности диабета и возрасту среди клинических признаков, в то время как карта внимания CGM выделила несколько периодов с заметной вариабельностью глюкозы. Карта внимания к сетчатке определила конкретные области изображения, вносящие вклад в представление модели, а матрица кросс-модального внимания продемонстрировала как внутримодальные, так и кросс-модальные паттерны внимания. Как показано на Рисунке 9, репрезентативные карты внимания, полученные с помощью модели, выделяют выбранные временные паттерны глюкозы, влиятельные клинические переменные и диагностически значимые области изображений сетчатки в отложенном тестовом образце.
Результаты оценки с участием людей
Был разработан проспективный протокол оценки с участием людей для анализа доверия клиницистов, интерпретируемости, удобства использования, клинической полезности и релевантности объяснений в условиях предоставления только прогноза и в условиях предоставления прогноза вместе с объяснением. В предлагаемой оценке примут участие эндокринологи, диабетологи и клинические фармакологи при наличии соответствующего одобрения Институционального комитета по этике и информированного согласия. Поскольку данная оценка предназначена для будущей проспективной реализации, показатели результатов на уровне клиницистов в настоящем протоколе не приводятся.
В таблице 7 обобщены предлагаемый дизайн проспективной оценки клиницистами и предопределенные критерии для анализа влияния объяснений на доверие клиницистов, интерпретируемость и воспринимаемую полезность. В ходе проспективной оценки будет проведено сравнение экспертных оценок предсказаний модели с сопровождающими их объяснениями и без них с использованием предопределенных критериев по шкале Лайкерта. Предлагаемая структура проспективной человеко-ориентированной оценки объяснимости представлена на рисунке 10

Рисунок 1: Общая архитектура системы FedMediFormer-XAI. Схематический обзор системы FedMediFormer-XAI, демонстрирующий сбор и предобработку мультимодальных данных, аугментацию на основе диффузионных моделей, обучение трансформеров для конкретных модальностей, федеративное обучение модели, персонализированный подбор лекарственных средств на основе GraphSAGE и анализ интерпретируемости. Система обеспечивает прогнозирование диабета, персонализированные рекомендации по медикаментозному лечению и интерпретируемые результаты работы модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Конвейер сбора и предварительной обработки мультимодальных наборов данных. Схематический рабочий процесс сбора и предварительной обработки мультимодальных наборов данных, используемых в FedMediFormer-XAI. Клинические данные и данные о здоровье населения, записи НМГ, изображения сетчатки и фармакологическая информация проходят специфичный для каждой модальности контроль качества, предварительную обработку, нормализацию, кодирование и аугментацию перед преобразованием в представления, готовые для использования в модели для последующего анализа. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 3: Рабочий процесс аугментации данных на основе диффузии. Схематическое описание процесса аугментации структурированных табличных обучающих данных с использованием TabDDPM. Сгенерированные образцы проходят оценку качества и сходства распределения перед объединением с исходными обучающими данными для улучшения баланса классов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Архитектура предлагаемой мультимодальной структуры на основе трансформеров. Схематическая архитектура, включающая (A) энкодер TabTransformer для клинических данных, (B) темпоральный энкодер-трансформер для данных CGM и (C) энкодер Vision Transformer для изображений сетчатки. (D) Модально-специфические представления объединяются с помощью кросс-модального внимания для создания единого мультимодального представления. (E) Специфические для конкретных задач предсказательные головы формируют выходные данные модели. (F) Компоненты регуляризации и оптимизации поддерживают обучение модели, а (G) функции потерь для классификации, регрессии и кросс-модальной согласованности направляют процесс оптимизации. Полученное мультимодальное представление используется для последующего прогнозирования, рекомендаций и задач интерпретируемости. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Структура коммуникации федеративного обучения. Схематический рабочий процесс федеративного обучения для распределенных клиентов-больниц. Локальные мультимодальные модели обучаются с использованием специфических данных клиентов, а защищенные обновления моделей передаются на центральный сервер для федеративного усреднения (Federated Averaging). Агрегированная глобальная модель повторно распределяется между клиентами для последующих раундов обмена данными. Структура также иллюстрирует безопасный обмен параметрами и оценку требований к конфиденциальности, связи и вычислительным ресурсам. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Рабочий процесс персонализированного подбора лекарственных средств на основе графов. Схематическое изображение рабочего процесса персонализированного подбора лекарств на базе GraphSAGE. Фармакологические данные и данные представления пациентов организованы в виде гетерогенного графа, который включает соответствующие медицинские сущности и связи между ними. GraphSAGE формирует представления пациентов и лекарств, которые используются для расчета показателей совместимости пациента и препарата, а также для ранжирования потенциальных лекарственных средств. Противопоказанные или небезопасные комбинации препаратов отфильтровываются перед формированием итогового списка Top-K рекомендаций, при этом информация на основе графа служит поддержкой для интерпретации данных рекомендаций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Структура оценки интерпретируемости. Схематический обзор рабочего процесса обеспечения интерпретируемости. (A) анализ SHAP оценивает глобальный и локальный вклад признаков; (B) интегрированные градиенты (Integrated Gradients) предоставляют объяснения на основе атрибуции; (C) визуализация внимания определяет влиятельные признаки и взаимодействия модальностей; и (D) контрфактуальный анализ выявляет изменения признаков, связанные с изменением прогнозов. Полученные результаты объяснения способствуют интерпретации прогнозов модели и персонализированных рекомендаций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8: Репрезентативный анализ важности признаков SHAP, полученный с помощью обученной модели FedMediFormer-XAI. Обобщающий график SHAP показывает распределение значений SHAP по оцениваемым образцам, при этом признаки ранжированы согласно их среднему абсолютному вкладу SHAP. Положительные значения SHAP указывают на вклад в более высокий прогнозируемый риск диабета, в то время как отрицательные значения указывают на вклад в более низкий прогнозируемый риск. Цвет соответствует значению признака: более высокие значения показаны красным, более низкие — синим. График представляет собой реальный результат интерпретируемости, полученный из модели, а не схематичную иллюстрацию. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9: Репрезентативные результаты анализа внимания, сгенерированные обученной моделью FedMediFormer-XAI для одного случайно выбранного тестового образца из отложенной выборки. (A) Внимание к клиническим признакам, полученное из головы внимания мультимодального трансформера, демонстрирующее относительные веса внимания, присвоенные клиническим признакам. (B) Временное внимание по последовательности CGM, иллюстрирующее периоды времени, получившие более высокое внимание модели. (C) Пространственное внимание для изображения глазного дна сетчатки, включающее исходное изображение, тепловую карту внимания и наложение карты внимания. (D) Кросс-модальное внимание между токенами клинической модальности, CGM и модальности сетчатки, демонстрирующее внутримодальное и кросс-модальное взвешивание информации. Представленные визуализации являются выходными данными, сгенерированными обученной моделью. Веса внимания показаны для выбранного тестового образца и должны интерпретироваться как паттерны внимания модели, а не как независимые показатели клинической причинно-следственной связи. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
| Набор данных | Тип данных | Образцы/Записи | Особенности/Содержание | Цель | Общедоступность |
| Набор данных по диабету у индейцев племени пима | Клинические таблицы | 768 пациентов | 8 клинических переменных | Прогнозирование риска развития диабета | Публичный |
| Показатели здоровья при диабете CDC | Здоровье населения | 253 680 записей | Демографические данные, образ жизни, показатели здоровья | Анализ рисков для популяции | Общедоступный |
| Набор данных OhioT1DM | Временные ряды CGM (непрерывного мониторинга глюкозы) | 12 испытуемых | Глюкоза, инсулин, приемы пищи, физические нагрузки, сон | Моделирование темпорального диабета | Общедоступный |
| APTOS 2019: обнаружение слепоты | Изображения сетчатки | 3 662 изображения | Фотографии глазного дна с метками степени тяжести | Анализ диабетической ретинопатии | Общедоступный |
| Набор данных с отзывами о лекарственных препаратах | Фармакологический | 215 063 отзыва | Эффективность препаратов, рейтинги, отзывы | Рекомендация лекарственных препаратов | Общедоступный |
| Открытые данные DrugBank | Граф знаний о лекарственных препаратах | Тысячи лекарственных препаратов | Лекарственные взаимодействия, мишени, сигнальные пути | Построение графика | Общественный/академический доступ |
Таблица 1: Характеристики наборов данных. Сводка общедоступных наборов данных, использованных в данном исследовании, включая тип набора данных, размер выборки, модальность данных, содержание признаков, целевое назначение и доступность.
| Набор данных | Модальность | Целевой показатель прогнозирования | Уровень слияния |
| Диабет у индейцев племени пима | Клинический | Классификация сахарного диабета | Эмбеддинг признаков |
| Показатели состояния здоровья при диабете по данным CDC | Здоровье населения | Прогнозирование риска развития диабета | Вложение признаков |
| OhioT1DM | Непрерывный мониторинг глюкозы | Прогнозирование динамики уровня глюкозы | Вложение признаков |
| APTOS 2019 | Изображения глазного дна | Анализ диабетической ретинопатии | Встраивание признаков |
| Обзор лекарственных средств + DrugBank | Фармакологический | Рекомендация по применению лекарственного препарата | Вложение графа |
Таблица 2: Стратегия интеграции мультимодального набора данных. Обзор наборов данных, использованных для мультимодального анализа диабета, включая модальность данных, цель прогнозирования и уровень интеграции специфических для модальности представлений. Клинические данные, данные о здоровье населения, данные непрерывного мониторинга глюкозы и ретинальные изображения представлены в виде эмбеддингов признаков, в то время как фармакологическая информация интегрируется с помощью графовых эмбеддингов для персонализированного подбора препаратов.
| Модель | Точность (Accuracy), среднее ± SD (95% CI) | Прецизионность (Precision), среднее ± SD (95% CI) | Полнота (Recall), среднее ± SD (95% CI) | F1-мера (F1-score), среднее ± SD (95% CI) | MCC, среднее ± SD (95% CI) | AUC-ROC, среднее ± SD (95% CI) |
| Random Forest | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| Temporal Transformer | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| Centralized Multimodal Transformer | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
Таблица 3: Эффективность прогнозирования диабета. Сравнительная прогностическая эффективность FedMediFormer-XAI и базовых моделей машинного и глубокого обучения с использованием метрик accuracy, precision, recall, F1-score, MCC и AUC-ROC.
| Показатель | Централизованное обучение | Федеративное обучение |
| Точность (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| Сохранение конфиденциальности | Нет | Да |
| Требуется передача исходных данных | Да | Нет |
| Раунды связи | Н/Д | 100 |
| Время обучения (часов) | 4.8 | 5.6 |
| Соответствие нормативным требованиям | Среднее | Высокое |
Таблица 4: Сравнение эффективности федеративного и централизованного обучения. Сравнение реализаций централизованного и федеративного обучения с точки зрения прогностической эффективности, требований к обмену необработанными данными, количества раундов связи и времени обучения.
| Набор данных | Точность (%) | Прецизионность (%) | Полнота (%) | AUC-ROC (площадь под ROC-кривой) |
| Набор данных по диабету у индейцев племени Пима | 91.8 | 90.5 | 89.8 | 0.93 |
| Показатели здоровья при диабете по данным CDC | 93.1 | 92.2 | 91.6 | 0.95 |
| Набор данных OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| Обнаружение слепоты APTOS 2019 | 94.7 | 93.9 | 93.5 | 0.96 |
| Мультимодальный синтез (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Таблица 5: Результаты на уровне набора данных. Анализ эффективности по отдельным наборам данных и в условиях мультимодального слияния. Результаты иллюстрируют вклад различных модальностей данных в общую прогностическую способность.
| Метрика | Значение |
| Точность@5 | 0.89 |
| Полнота@5 (Recall@5) | 0.84 |
| NDCG@5 | 0.91 |
| Точность обнаружения лекарственных взаимодействий | 0.95 |
| Охват рекомендаций | 0.88 |
| Средний ранг взаимности (MRR) | 0.86 |
| Показатель соблюдения требований безопасности | 0.94 |
Таблица 6: Эффективность персонализированного подбора лекарственных препаратов. Оценка персонализированного подбора лекарственных препаратов на основе графов с использованием метрик ранжирования, точности определения взаимодействий, охвата рекомендаций и оценки безопасности медикаментов.
| Критерий оценки | Предлагаемый план оценки |
| Доверие клинициста | Оценка по пятибалльной шкале Лайкерта |
| Интерпретируемость | Оценка по пятибалльной шкале Лайкерта |
| Клиническая значимость | Оценка по пятибалльной шкале Лайкерта |
| Полезность пояснений | Оценка по пятибалльной шкале Лайкерта |
| Воспринимаемая полезность | Оценка по пятибалльной шкале Лайкерта |
| Межэкспертное согласие | Каппа Фляйсса, рассчитывается после проспективной оценки |
| Статистическое сравнение | Парный статистический критерий, в зависимости от данных после сбора |
| Участники | 12 клиницистов, при условии одобрения этического комитета и информированного согласия |
| Статус оценки | Проспективная/будущая оценка |
Таблица 7: Предлагаемые критерии оценки с участием человека. Предлагаемая перспективная структура оценки с участием клиницистов для анализа полезности, клинической значимости, интерпретируемости, достоверности и удобства использования объяснений FedMediFormer-XAI. Оценка включает стандартизированную проверку по пятибалльной шкале Лайкерта, определение согласованности экспертов с помощью каппы Флесса, статистическое сравнение условий «только прогноз» и «прогноз плюс объяснение», а также 95% доверительные интервалы. Оценка клиницистом должна проводиться только после получения одобрения соответствующего Институционального комитета по этике и информированного согласия.
Дополнительная таблица 1: Стратегия валидации набора данных. Для обеспечения воспроизводимости и надежной оценки модели были реализованы разделение набора данных, процедуры валидации, стратегии балансировки классов и меры контроля качества. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 2: Параметры диффузионной модели. Настройки конфигурации диффузионной модели TabDDPM, включая параметры обучения, настройки оптимизации, размерности латентного пространства, стратегию планирования шума и спецификации генерации синтетических образцов. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 3: Конфигурация мультимодального трансформера. Конфигурация архитектуры мультимодального трансформера, включая клинический, временной и визуальный энкодеры, размерности эмбеддингов и слияния, количество голов внимания, оптимизатор, скорость обучения, размер пакета, количество эпох обучения, критерий ранней остановки и комбинированную функцию потерь при обучении. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 4: Конфигурация федеративного обучения. Параметры, использованные для федеративного обучения с сохранением конфиденциальности, включая количество участвующих больниц, раунды связи, эпохи локального обучения, долю участия клиентов, алгоритм агрегации, оптимизатор, скорость обучения, метод шифрования, протокол связи и политику обмена необработанными данными. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 5: Конфигурация GraphSAGE. Конфигурация персонализированного модуля рекомендации лекарственных препаратов на основе гетерогенного GraphSAGE, включая тип графа, размерности скрытого слоя и эмбеддингов, количество слоеий графа, размер выборки окрестности, оптимизатор, скорость обучения, размер пакета, количество эпох обучения, функцию потерь Bayesian Personalized Ranking и количество лучших рекомендаций по препаратам. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 6: Метрики оценки интерпретируемости. Количественные и ориентированные на человека метрики, используемые для оценки интерпретируемости платформы FedMediFormer-XAI. Метрики позволяют оценить достоверность, стабильность, согласованность, разреженность, полноту, чувствительность, недостоверность объяснений, согласие между экспертами и качество объяснений с точки зрения клинициста. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 7: Метрики оценки. Для оценки производительности, робастности, качества ранжирования и интерпретируемости системы используются метрики прогнозирования, федеративного обучения, рекомендаций и объяснимости. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 8: Дизайн оценки с участием человека. Дизайн исследования по оценке с участием клиницистов, включая группы участников, условия оценки, критерии оценки и процедуры статистического анализа. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 9: Ресурсы для воспроизводимости. Сводка наборов данных, спецификаций реализации, конфигурационных файлов, процедур оценки, документации и экспериментальных записей, необходимых для обеспечения воспроизводимости предлагаемого фреймворка FedMediFormer-XAI. Пожалуйста, нажмите здесь, чтобы скачать этот файл.