Анализ прогностической эффективности
FedMediFormer-XAI продемонстрировал более высокую прогностическую эффективность по сравнению с оцененными унимодальными и традиционными базовыми моделями. Аугментация на основе диффузионных моделей улучшила репрезентативность миноритарного класса; результаты прогностической эффективности обобщены в Таблице 3. Оценка по результатам многократных запусков показала стабильную прогностическую эффективность всех исследованных моделей. FedMediFormer-XAI достиг наивысших общих показателей: точность (accuracy) составила 94.20 ± 0.34% (95% CI: 93.78–94.62), прецизионность (precision) — 93.10 ± 0.30% (95% CI: 92.73–93.47), полнота (recall) — 92.80 ± 0.28% (95% CI: 92.45–93.15) и F1-мера (F1-score) — 92.90 ± 0.28% (95% CI: 92.55–93.25). Модель достигла значения MCC 0.88 ± 0.02 (95% CI: 0.86–0.90) и AUC-ROC 0.96 ± 0.01 (95% CI: 0.95–0.97). Следующие по эффективности результаты показал централизованный мультимодальный трансформер, тогда как унимодальные и традиционные модели машинного обучения продемонстрировали сравнительно более низкую прогностическую эффективность. Эти результаты указывают на то, что мультимодальное обучение представлений в сочетании с федеративной оптимизацией обеспечивает более высокую и стабильную эффективность классификации диабета.
Абляционное исследование
Покомпонентный абляционный анализ использовался для оценки вклада аугментации с помощью диффузии, федеративного обучения, рекомендаций препаратов на основе GraphSAGE и мультимодального слияния. Полная архитектура FedMediFormer-XAI по результатам пяти независимых запусков обеспечила точность (accuracy) 94.20 ± 0.34%, прецизионность (precision) 93.10 ± 0.30%, полноту (recall) 92.80 ± 0.28%, F1-меру 92.90 ± 0.28%, коэффициент корреляции Мэтьюса (MCC) 0.88 ± 0.02 и AUC-ROC 0.96 ± 0.01. Исключение аугментации с помощью диффузии снизило точность до 91.80 ± 0.42%, что соответствует падению на 2.40 процентных пункта, в то время как F1-мера и AUC-ROC снизились до 90.30 ± 0.38% и 0.94 ± 0.01 соответственно. Данное снижение указывает на вклад диффузионной аугментации в репрезентативность миноритарного класса и робастность прогнозирования.
Исключение федеративного обучения привело к снижению точности до 93,10 ± 0,37%, что на 1,10 процентных пункта меньше по сравнению с полным фреймворком. Прецизионность, полнота, F1-мера, коэффициент корреляции Мэтьюса (MCC) и AUC-ROC также снизились до 92,20 ± 0,34%, 91,80 ± 0,32%, 92,00 ± 0,33%, 0,86 ± 0,02 и 0,95 ± 0,01 соответственно. Данное сравнение демонстрирует вклад федеративной конфигурации в прогностическую эффективность.
Исключение компонента персонализированного подбора лекарственных препаратов на основе GraphSAGE привело к сравнительно небольшому изменению показателей прогнозирования диабета: точность снизилась до 93.80 ± 0.35%, а F1-мера — до 92.60 ± 0.30%. Соответствующие значения MCC и AUC-ROC составили 0.87 ± 0.02 и 0.96 ± 0.01 соответственно. Этот результат указывает на то, что GraphSAGE в первую очередь способствует персонализированному подбору лекарств, а не напрямую определяет эффективность классификации диабета.
Наибольшее снижение наблюдалось при исключении мультимодального слияния. Точность снизилась до 87.60 ± 0.55%, что составляет снижение на 6.60 процентных пункта, в то время как прецизионность, полнота, F1-мера, MCC и AUC-ROC снизились до 86.80 ± 0.51%, 85.90 ± 0.54%, 86.30 ± 0.52%, 0.76 ± 0.03 и 0.91 ± 0.01 соответственно. Этот результат демонстрирует важность совместного моделирования дополняющей друг друга информации из клинических данных, данных CGM и ретинальных модальностей.
Анализ федеративного обучения
Методика федеративного обучения позволила осуществлять совместное обучение модели на распределенных клиентских узлах, сохраняя децентрализованный подход к обработке необработанных данных пациентов. В процессе обучения локальная модель каждого клиента дорабатывалась индивидуально и объединялась с помощью метода федеративного усреднения (Federated Averaging). После 100 раундов обмена данными глобальная модель сошлась, и ее прогностическая эффективность осталась на уровне централизованного обучения. Система федеративного обучения продемонстрировала стабильную сходимость на протяжении всех раундов связи, несмотря на гетерогенное распределение данных между клиентами. Защищенный обмен параметрами обеспечил децентрализованную обработку данных, при этом глобальная модель сохранила конкурентоспособную прогностическую способность по сравнению с базовым централизованным вариантом. В таблице 4 приведено сравнение централизованной и федеративной реализаций. Федеративное обучение потребовало дополнительного времени на обучение из-за накладных расходов на связь, при этом сохранив прогностическую эффективность, сопоставимую с централизованным обучением.
Анализ эффективности на уровне наборов данных
Для оценки обобщающей способности в различных модальностях здравоохранения мы отдельно проанализировали эффективность на каждом наборе данных. Мультимодальная модель FedMediFormer-XAI продемонстрировала высокую и в целом конкурентоспособную эффективность на всех оцениваемых наборах данных. Она достигла точности (accuracy) 91.8%, 93.1%, 92.4% и 94.2% на наборах данных Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM и APTOS 2019 соответственно. Несмотря на то, что на наборе данных APTOS 2019 были достигнуты несколько более высокие показатели точности (accuracy, 94.7%) и прецизионности (precision, 93.9%), чем у мультимодальной модели, предлагаемый мультимодальный подход сохранил конкурентоспособную эффективность на всех наборах данных и достиг значения AUC-ROC 0.96, что сопоставимо с максимальным значением AUC-ROC на уровне отдельных наборов данных. Общие результаты на уровне наборов данных представлены в Таблице 5. При использовании отдельных наборов данных наилучшие результаты показал анализ изображений сетчатки, тогда как мультимодальное слияние обеспечило наиболее стабильные и сбалансированные прогнозы.
Анализ персонализированных рекомендаций по подбору лекарственных средств
Компонент рекомендаций на базе графовой нейронной сети был оценен с использованием информации об эффективности препаратов и данных о лекарственных взаимодействиях; при этом потенциальные лекарственные средства ранжировались согласно вычисленным показателям пригодности препарата для конкретного пациента, а противопоказанные комбинации исключались в процессе генерации рекомендаций. Использование формата гетерогенного графа и моделирование взаимодействий «пациент — лекарство» и «лекарство — лекарство» позволили провести детальный анализ, что обеспечило поддержку персонализированного выбора препаратов и оценку безопасности. Модель рекомендаций GraphSAGE эффективно выявила сложные взаимосвязи между пациентами, заболеваниями, результатами лабораторных исследований и лекарственными средствами. Персонализированные рекомендации продемонстрировали высокую эффективность ранжирования при сохранении клинически значимых объяснений, полученных с помощью анализа окрестностей графа и атрибуции признаков.
Согласно Таблице 6, модуль персонализированных рекомендаций по лекарственным препаратам оценивали с помощью показателей Precision@5, Recall@5 и NDCG@5. Эти метрики количественно определяют релевантность и качество ранжирования пяти наиболее подходящих персонализированных рекомендаций по медикаментам, сформированных модулем рекомендаций на основе GraphSAGE. Система рекомендаций продемонстрировала высокие показатели ранжирования: точность (precision) = 0.89, полнота (recall) = 0.84 и NDCG = 0.91.
Анализ интерпретируемости
В рамках данной структуры используются методы SHAP, интегрированные градиенты (Integrated Gradients), визуализация внимания и контрфактуальные объяснения для поддержки интерпретации мультимодальных прогнозов. SHAP применялся для количественной оценки вклада отдельных признаков, интегрированные градиенты — для соотнесения прогнозов с входными признаками, визуализация внимания — для изучения фокуса модели по различным модальностям, а контрфактуальные объяснения — для выявления изменений признаков, связанных с альтернативными прогнозами. На рисунке 8 представлен репрезентативный сводный график SHAP, полученный с помощью обученной модели FedMediFormer-XAI, тогда как на рисунке 9 приведены репрезентативные результаты визуализации внимания, извлеченные из обученного трансформера. Эти рисунки представляют собой выходные данные, полученные в ходе оценки модели, а не схематические иллюстрации предлагаемой архитектуры.
На рисунке 8 представлены совокупные рейтинги значимости признаков. Признаки с более высокими абсолютными значениями SHAP оказывали большее влияние на прогнозы модели и также хорошо согласовались с существующими клиническими данными.
Рисунок 9 представляет типичные визуализации внимания, извлеченные непосредственно из обученной модели FedMediFormer-XAI для случайно выбранного контрольного тестового образца. Визуализации включают внимание к клиническим признакам, временное внимание к CGM, пространственное внимание к сетчатке и кросс-модальное внимание между тремя модальностями. Визуализация внимания дополнительно продемонстрировала изученное моделью распределение внимания между несколькими модальностями. В выбранном образце среди клинических признаков наблюдалось относительно более выраженное внимание к HbA1c, длительности диабета и возрасту, в то время как карта внимания CGM выделила несколько периодов с заметной вариабельностью глюкозы. Карта внимания к сетчатке определила конкретные области изображения, вносящие вклад в представление модели, а матрица кросс-модального внимания продемонстрировала как внутримодальные, так и кросс-модальные паттерны внимания. Как показано на Рисунке 9, репрезентативные карты внимания, полученные с помощью модели, выделяют определенные временные паттерны глюкозы, влиятельные клинические переменные и диагностически значимые области изображения сетчатки в контрольном тестовом образце.
Результаты человекоцентричной оценки
Был разработан проспективный протокол человекоцентричной оценки для анализа доверия клиницистов, интерпретируемости, удобства использования, клинической полезности и релевантности объяснений в условиях «только прогноз» и «прогноз с объяснением». В предлагаемой оценке примут участие эндокринологи, диабетологи и клинические фармакологи при наличии соответствующего одобрения Институционального комитета по этике и информированного согласия. Поскольку данная оценка предназначена для последующего проспективного внедрения, показатели результатов на уровне клиницистов в настоящем протоколе не приводятся.
В таблице 7 обобщены предлагаемый дизайн проспективной оценки клиницистами и заранее определенные критерии для анализа влияния пояснений на доверие клиницистов, интерпретируемость и воспринимаемую полезность. В ходе проспективной оценки будут сравниваться оценки предсказаний модели клиницистами с использованием сопроводительных пояснений и без них на основе заранее определенных критериев по шкале Лайкерта. Предлагаемая структура проспективной человекоцентрированной оценки объяснимости представлена на рисунке 10

Рисунок 1: Общая архитектура фреймворка FedMediFormer-XAI. Схематический обзор фреймворка FedMediFormer-XAI, демонстрирующий сбор и предобработку мультимодальных данных, аугментацию на основе диффузионных моделей, обучение трансформеров для конкретных модальностей, федеративное обучение моделей, персонализированный подбор лекарственных средств на базе GraphSAGE и анализ объяснимости. Фреймворк обеспечивает прогнозирование диабета, выдачу персонализированных рекомендаций по медикаментозному лечению и интерпретируемые выходные данные модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Конвейер сбора и предобработки мультимодального набора данных. Схематичный рабочий процесс сбора и предобработки мультимодальных наборов данных, используемых в FedMediFormer-XAI. Клинические данные и данные о здоровье населения, записи CGM, изображения сетчатки и фармакологическая информация проходят специфичный для каждой модальности контроль качества, предобработку, нормализацию, кодирование и аугментацию перед преобразованием в представления, готовые для использования в модели при последующем анализе. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Схема процесса аугментации данных на основе диффузионных моделей. Схематический рабочий процесс аугментации структурированных табличных обучающих данных с использованием TabDDPM. Сгенерированные образцы проходят оценку качества и сходства распределения перед объединением с исходными обучающими данными для улучшения баланса классов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Архитектура предлагаемой мультимодальной структуры трансформера. Схематическая архитектура, состоящая из (A) энкодера TabTransformer для клинических данных, (B) темпорального трансформерного энкодера для данных CGM и (C) Vision Transformer энкодера для изображений сетчатки. (D) Специфические для каждой модальности представления объединяются с помощью кросс-модального внимания для создания единого мультимодального представления. (E) Специфические для конкретной задачи головы прогнозирования генерируют выходные данные модели. (F) Компоненты регуляризации и оптимизации поддерживают обучение модели, а (G) функции потерь для классификации, регрессии и кросс-модальной согласованности направляют процесс оптимизации. Полученное мультимодальное представление используется для последующих задач прогнозирования, рекомендаций и интерпретируемости. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Структура коммуникации при федеративном обучении. Схематический рабочий процесс федеративного обучения с участием распределенных клиентов-больниц. Локальные мультимодальные модели обучаются на данных конкретного клиента, а защищенные обновления моделей передаются на центральный сервер для федеративного усреднения (Federated Averaging). Агрегированная глобальная модель повторно распределяется между клиентами для последующих раундов взаимодействия. Структура также иллюстрирует безопасный обмен параметрами и оценку требований к конфиденциальности, связи и вычислительным ресурсам. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Алгоритм персонализированного подбора лекарственных препаратов на основе графов. Схема рабочего процесса персонализированного подбора лекарств с использованием GraphSAGE. Фармакологические данные и данные о состоянии пациентов организованы в виде гетерогенного графа, включающего соответствующие медицинские сущности и связи между ними. GraphSAGE формирует представления пациентов и препаратов, которые используются для расчета показателей совместимости пациента с препаратом и ранжирования потенциальных лекарственных средств. Противопоказанные или небезопасные комбинации препаратов отфильтровываются перед формированием итогового списка из K лучших рекомендаций (Top-K), при этом информация на основе графов служит поддержкой для интерпретации этих рекомендаций. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Система оценки объяснимости. Схематический обзор процесса обеспечения объяснимости. (A) анализ SHAP оценивает глобальный и локальный вклад признаков; (B) интегрированные градиенты (Integrated Gradients) предоставляют объяснения на основе атрибуции; (C) визуализация внимания определяет значимые признаки и взаимодействия модальностей; и (D) контрфактуальный анализ определяет изменения признаков, связанные с изменением прогнозов. Полученные результаты объяснения помогают интерпретировать прогнозы модели и персонализированные рекомендации. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8: Репрезентативный анализ важности признаков SHAP, полученный с помощью обученной модели FedMediFormer-XAI. Сводный график SHAP показывает распределение значений SHAP по оцениваемым образцам, при этом признаки ранжированы в соответствии с их средним абсолютным вкладом SHAP. Положительные значения SHAP указывают на вклад в более высокий прогнозируемый риск диабета, тогда как отрицательные значения указывают на вклад в более низкий прогнозируемый риск. Цвет соответствует значению признака: более высокие значения признака показаны красным цветом, а более низкие — синим. График представляет собой фактический результат интерпретируемости, полученный на основе модели, а не схематическую иллюстрацию. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 9: Репрезентативные результаты механизмов внимания, сгенерированные обученной моделью FedMediFormer-XAI для одного случайно выбранного контрольного тестового образца. (A) Внимание к клиническим признакам, полученное из головки внимания мультимодального трансформера, демонстрирующее относительные веса внимания, присвоенные клиническим признакам. (B) Временное внимание по последовательности CGM, иллюстрирующее периоды времени, получившие более высокое внимание модели. (C) Пространственное внимание для изображения глазного дна, включая исходное изображение, тепловую карту внимания и наложенную карту внимания. (D) Кросс-модальное внимание между токенами клинических данных, CGM и ретинальной модальности, демонстрирующее внутримодальное и кросс-модальное взвешивание информации. Представленные визуализации являются выходными данными, сгенерированными обученной моделью. Веса внимания показаны для выбранного тестового образца и должны интерпретироваться как паттерны внимания модели, а не как независимые показатели клинической причинно-следственной связи. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
| Набор данных | Тип данных | Образцы/Записи | Особенности/Содержание | Цель | Общедоступность |
| Набор данных по диабету индейцев племени пима | Клиническая таблица | 768 пациентов | 8 клинических переменных | Прогнозирование риска развития диабета | Общедоступный |
| Показатели состояния здоровья при диабете согласно данным CDC | Здравоохранение населения | 253 680 записей | Демографические данные, образ жизни, показатели здоровья | Анализ популяционного риска | Общедоступный |
| Набор данных OhioT1DM | Временные ряды НМГ (непрерывного мониторинга глюкозы) | 12 испытуемых | Глюкоза, инсулин, питание, физические нагрузки, сон | Моделирование временных аспектов диабета | Общедоступный |
| Обнаружение слепоты APTOS 2019 | Изображения сетчатки | 3 662 изображения | Фотографии глазного дна с метками степени тяжести | Анализ диабетической ретинопатии | Общедоступный |
| Набор данных с отзывами о лекарственных препаратах | Фармакологический | 215 063 отзыва | Эффективность лекарственных средств, рейтинги, отзывы | Рекомендация лекарственного препарата | Общедоступный |
| Открытые данные DrugBank | Граф знаний о лекарственных препаратах | Тысячи лекарственных препаратов | Лекарственные взаимодействия, мишени, пути | Построение графа | Общественный/Академический доступ |
Таблица 1: Характеристики наборов данных. Сводка общедоступных наборов данных, использованных в данном исследовании, включая тип набора данных, размер выборки, модальность данных, содержание признаков, предназначение и доступность.
| Набор данных | Модальность | Цель прогнозирования | Уровень слияния |
| Диабет у индейцев пима | Клинический | Классификация сахарного диабета | Вложение признаков |
| Показатели здоровья при диабете согласно CDC | Здоровье населения | Прогнозирование риска развития диабета | Вложение признаков |
| OhioT1DM | Непрерывный мониторинг глюкозы | Прогнозирование тенденций изменения уровня глюкозы | Вложение признаков |
| APTOS 2019 | Изображения глазного дна сетчатки | Анализ диабетической ретинопатии | Встраивание признаков |
| Обзор лекарственных средств + DrugBank | Фармакологический | Рекомендация лекарственного препарата | Эмбеддинг графа |
Таблица 2: Стратегия интеграции мультимодального набора данных. Обзор наборов данных, использованных для мультимодального анализа диабета, включая модальность данных, целевую переменную прогнозирования и уровень интеграции специфических для каждой модальности представлений. Клинические данные, данные о здоровье населения, данные непрерывного мониторинга глюкозы и изображения сетчатки представлены в виде векторных вложений признаков, в то время как фармакологическая информация интегрируется с помощью графовых вложений для персонализированного подбора лекарственных препаратов.
| Модель | Точность, среднее значение ± SD (95% ДИ) | Прецизионность, среднее значение ± СО (95% ДИ) | Полнота, среднее значение ± СО (95% ДИ) | F1-мера, среднее значение ± СО (95% ДИ) | MCC, среднее значение ± СО (95% ДИ) | AUC-ROC, среднее значение ± SD (95% CI) |
| Случайный лес | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| Временной трансформер | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| Централизованный мультимодальный трансформер | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
Таблица 3: Эффективность прогнозирования диабета. Сравнительная прогностическая эффективность FedMediFormer-XAI и базовых моделей машинного и глубокого обучения с использованием метрик точности (accuracy), прецизионности (precision), полноты (recall), F1-меры, MCC и AUC-ROC.
| Показатель | Централизованное обучение | Федеративное обучение |
| Точность (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| Сохранение конфиденциальности | Нет | Да |
| Требуется обмен необработанными данными | Да | Нет |
| Раунды связи | Н/Д | 100 |
| Время обучения (часов) | 4.8 | 5.6 |
| Соответствие нормативным требованиям | Среднее | Высокое |
Таблица 4: Сравнение эффективности федеративного и централизованного обучения. Сравнение реализаций централизованного и федеративного обучения с точки зрения прогностической способности, требований к обмену необработанными данными, количества раундов связи и времени обучения.
| Набор данных | Точность (%) | Точность (%) | Полнота (%) | AUC-ROC |
| Набор данных по диабету индейцев племени Пима | 91.8 | 90.5 | 89.8 | 0.93 |
| Показатели здоровья при диабете согласно CDC | 93.1 | 92.2 | 91.6 | 0.95 |
| Набор данных OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| APTOS 2019: определение слепоты | 94.7 | 93.9 | 93.5 | 0.96 |
| Мультимодальный синтез (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
Таблица 5: Результаты на уровне наборов данных. Анализ эффективности по отдельным наборам данных и в условиях мультимодального объединения. Результаты иллюстрируют вклад различных модальностей данных в общую прогностическую способность.
| Метрика | Значение |
| Точность@5 | 0.89 |
| Полнота при k=5 (Recall@5) | 0.84 |
| NDCG@5 | 0.91 |
| Точность определения лекарственного взаимодействия | 0.95 |
| Охват рекомендаций | 0.88 |
| Средний обратный ранг (MRR) | 0.86 |
| Показатель соблюдения техники безопасности | 0.94 |
Таблица 6: Эффективность персонализированных рекомендаций лекарственных препаратов. Оценка персонализированных рекомендаций лекарственных препаратов на основе графов с использованием метрик ранжирования, точности обнаружения взаимодействий, охвата рекомендаций и оценки безопасности медикаментов.
| Критерий оценки | Предлагаемый план оценки |
| Доверие клиницистов | Оценка по пятибалльной шкале Лайкерта |
| Интерпретируемость | Оценка по пятибалльной шкале Лайкерта |
| Клиническая значимость | Оценка по пятибалльной шкале Лайкерта |
| Полезность объяснения | Оценка по пятибалльной шкале Лайкерта |
| Субъективно воспринимаемая полезность | Оценка по пятибалльной шкале Лайкерта |
| Межэкспертное согласие | Коэффициент каппа Фляйсса, который будет рассчитан после проспективной оценки |
| Статистическое сравнение | Парный статистический критерий, применяемый по мере необходимости после сбора данных |
| Участники | 12 клиницистов, при условии одобрения этическим комитетом и получения информированного согласия |
| Статус оценки | Перспективная/будущая оценка |
Таблица 7: Предлагаемые критерии человеко-ориентированной оценки. Предлагаемая проспективная структура оценки с участием клиницистов для анализа полезности, клинической значимости, интерпретируемости, надежности и удобства использования объяснений FedMediFormer-XAI. Оценка включает стандартизированную пятибалльную шкалу Лайкерта, определение согласованности между экспертами с помощью каппы Флейсса, статистическое сравнение условий «только прогноз» и «прогноз плюс объяснение», а также 95% доверительные интервалы. Оценка клиницистами должна проводиться только после получения одобрения соответствующего Институционального комитета по этике и информированного согласия.
Дополнительная таблица 1: Стратегия валидации набора данных. Для обеспечения воспроизводимости и надежной оценки модели были реализованы разделение набора данных, процедуры валидации, стратегии балансировки классов и меры контроля качества. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 2: Параметры диффузионной модели. Настройки конфигурации диффузионной модели TabDDPM, включая параметры обучения, настройки оптимизации, латентные размерности, стратегию планирования шума и спецификации генерации синтетических образцов. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 3: Конфигурация мультимодального трансформера. Конфигурация архитектуры мультимодального трансформера, включая клинический, временной и визуальный энкодеры, размерности эмбеддинга и слияния, количество голов внимания, оптимизатор, скорость обучения, размер пакета, количество эпох обучения, критерий ранней остановки и комбинированную функцию потерь при обучении. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 4: Конфигурация федеративного обучения. Параметры, использованные для федеративного обучения с обеспечением конфиденциальности, включая количество участвующих больниц, раунды связи, эпохи локального обучения, коэффициент участия клиентов, алгоритм агрегации, оптимизатор, скорость обучения, метод шифрования, протокол связи и политику обмена исходными данными. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 5: Конфигурация GraphSAGE. Конфигурация гетерогенного модуля персонализированного подбора лекарственных средств на основе GraphSAGE, включая тип графа, размерности скрытых слоев и эмбеддингов, количество слоев графа, размер выборки соседства, оптимизатор, скорость обучения, размер пакета, количество эпох обучения, функцию потерь Bayesian Personalized Ranking и количество рекомендуемых препаратов в топ-списке. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 6: Метрики оценки объяснимости. Количественные и человеко-ориентированные метрики, используемые для оценки объяснимости системы FedMediFormer-XAI. Метрики позволяют оценить точность (fidelity), стабильность, согласованность, разреженность, полноту, чувствительность, неточность (infidelity), согласованность между экспертами и воспринимаемое клиницистами качество объяснений. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 7: Метрики оценки. Метрики прогнозирования, федеративного обучения, рекомендаций и объяснимости используются для оценки производительности, робастности, качества ранжирования и интерпретируемости системы. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 8: Дизайн оценки с участием человека. Дизайн исследования по оценке с участием клиницистов, включая группы участников, условия оценки, критерии анализа и процедуры статистического анализа. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная таблица 9: Ресурсы для воспроизводимости. Сводка наборов данных, спецификаций реализации, конфигурационных файлов, процедур оценки, документации и экспериментальных записей, необходимых для обеспечения воспроизводимости предлагаемой структуры FedMediFormer-XAI. Пожалуйста, нажмите здесь, чтобы скачать этот файл.