$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Заявление о источниках данных и этике
В этом ретроспективном исследовании использовались данные MIMIC-IV (версия 3.1) — общедоступной, деидентифицированной базы данных ЭМК по критической терапии, размещённой на PhysioNet. База данных включает демографическую информацию, жизненные показатели, лабораторные анализы, диагнозы, процедуры и медикаменты.
Доступ к MIMIC-IV требует подтверждения авторизации и соблюдения соглашения об использовании данных PhysioNet и требований к обучению. Следователи прошли необходимое обучение и получили доступ (номер сертификата: 68351548). Поскольку база данных не идентифицирована, это исследование анализировало анонимизированные данные и не включало прямого контакта с пациентами; поэтому информированное согласие не требовалось. Полный пошаговый рабочий процесс исполняемого моделирования иллюстрируется на рисунке 1.

Рисунок 1. Общий процесс моделирования прогнозирования риска остеопороза (OP) у пациентов с диабетом. Схематическое представление конвейера исследования, включая идентификацию когорт, извлечение данных, инженерию признаков, мультимодельное бенчмаркинг, выбор модели на основе эффективности валидации и интерпретацию конечной модели на основе SHAP. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Изучение популяции и извлечение данных
Данные были извлечены из базы данных Medical Information Mart for Intensive Care IV (MIMIC-IV) с помощью инструмента управления базой данных. Для обеспечения воспроизводимости точные SQL-запросы, включая имена таблиц и логику фильтрации, используемую для поиска когорт, приведены в дополнительном файле 1. Взрослые пациенты (≥18 лет) с диагнозом сахарный диабет идентифицировались с помощью кодов ICD-9 (249, 250) и кодов ICD-10 (E08–E13). Основной результат, OP, был определен с использованием кодов ICD-9 (733.x) и ICD-10 (M80, M81, M82). В первоначальной допустимой когорте диабетиков (n = 46 226) было выявлено 3 672 положительных события (пациенты с ОП) и 42 554 отрицательных события (пациенты без ОП). Подробная схема отбора пациентов и отток населения представлена на рисунке 2.

Рисунок 2. Блок-схема отбора пациентов и построения когорт. Блок-схема иллюстрирует поэтапное происхождение когорт из базы данных MIMIC-IV (v3.1). Взрослые пациенты с сахарным диабетом были выявлены с помощью кодов ИКБ, после чего исключены пациенты с возрастом и возрастом Lt; 18 лет, отсутствующие критически важные данные и gt; 30%, или недействительные записи. Финальная группа была разделена на ОП (положительные события) и не-ОП (негативные события). Дисбаланс классов был устранен с помощью случайного недовыборки и применения SMOTE к обучающим данным до стратифицированного разделения наборов данных. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Инженерия особенностей
Для обеспечения справедливого бенчмаркинга между несколькими алгоритмами машинного обучения и точной воспроизводимости была применена идентичная последовательность этапов предварительной обработки: выбор признаков, импутация отсутствующих значений, непрерывное масштабирование признаков, балансировка классов и разделение наборов данных. Полный список входных функций, включая имена переменных, единицы и источники данных, изложен в Таблице 1.
| Особенности | Total (n = 14 688) | Тренировочный набор (n = 9 546) | Валидационный набор (n = 2 204) | Тестовый набор (n = 2 938) | Значение p |
| Пол | | | | | 0.345 |
| Мужской | 6222 (42.36%) | 4045 (42.37%) | 935 (42.42%) | 1242 (42.27%) | |
| Женский | 8466 (57.64%) | 5501 (57.63%) | 1269 (57.58%) | 1696 (57.73%) | |
| Возраст | 0,28 (−0,40, 0,94) | 0,28 (−0,43, 0,94) | 0,23 (−0,46, 0,89) | 0,28 (−0,39, 0,95) | 0.1655 |
| Эритроциты | −0,14 (−0,79, 0,49) | −0,13 (−0,79, 0,49) | −0,17 (−0,83, 0,48) | −0,14 (−0,76, 0,49) | 0.3641 |
| Гематокрит | −0,14 (−0,81, 0,52) | −0,13 (−0,80, 0,52) | −0,14 (−0,87, 0,51) | −0,16 (−0,81, 0,52) | 0.3709 |
| Гемоглобин | −0,12 (−0,79, 0,52) | −0,12 (−0,79, 0,51) | −0,15 (−0,86, 0,53) | −0,13 (−0,78, 0,52) | 0.3616 |
| RDW | −0,16 (−0,59, 0,45) | −0,17 (−0,59, 0,46) | −0,14 (−0,59, 0,45) | −0,17 (−0,60, 0,42) | 0.5803 |
| Фосфат | −0,14 (−0,60, 0,38) | −0,15 (−0,61, 0,38) | −0,11 (−0,57, 0,38) | −0,13 (−0,56, 0,34) | 0.415 |
| MCV | 0,05 (−0,50, 0,63) | 0,06 (−0,50, 0,65) | 0,03 (−0,49, 0,65) | 0,02 (−0,50, 0,59) | 0.5408 |
| Магний | −0,10 (−0,52, 0,37) | −0,10 (−0,52, 0,37) | −0,10 (−0,52, 0,37) | −0,09 (−0,50, 0,37) | 0.7797 |
| Белые кровяные клетки | −0,16 (−0,47, 0,21) | −0,16 (−0,47, 0,20) | −0,15 (−0,48, 0,25) | −0,16 (−0,46, 0,20) | 0.6856 |
| Анион Гэп | −0,12 (−0,64, 0,45) | −0,13 (−0,64, 0,45) | −0,07 (−0,61, 0,48) | −0,13 (−0,64, 0,45) | 0.1217 |
| Креатинин | −0,30 (−0,48, 0,01) | −0,30 (−0,48, 0,01) | −0,30 (−0,46, 0,01) | −0,30 (−0,48, −0,00) | 0.3323 |
| MCH | 0,11 (−0,48, 0,62) | 0,12 (−0,48, 0,62) | 0,11 (−0,47, 0,62) | 0,09 (−0,48, 0,61) | 0.5195 |
| Количество тромбоцитов | −0,09 (−0,61, 0,49) | −0,09 (−0,61, 0,49) | −0,08 (−0,62, 0,47) | −0,10 (−0,62, 0,48) | 0.9709 |
| MCHC | −0,00 (−0,59, 0,59) | −0.00 (−0.60, 0.59) | −0,00 (−0,57, 0,58) | 0,00 (−0,57, 0,60) | 0.9263 |
| Хлорид | 0,05 (−0,54, 0,64) | 0,05 (−0,52, 0,65) | 0,03 (−0,59, 0,62) | 0,07 (−0,52, 0,62) | 0.4675 |
| Калий | −0,07 (−0,67, 0,53) | −0,09 (−0,67, 0,53) | −0,07 (−0,67, 0,53) | −0,07 (−0,62, 0,53) | 0.3071 |
| Натрий | 0,05 (−0,56, 0,60) | 0,05 (−0,55, 0,60) | −0.00 (−0.60, 0.60) | 0,07 (−0,57, 0,61) | 0.3492 |
| Азот мочевины | −0,28 (−0,60, 0,29) | −0,28 (−0,60, 0,29) | −0,26 (−0,59, 0,31) | −0,28 (−0,59, 0,25) | 0.6826 |
| Общий кальций | 0,02 (−0,61, 0,59) | 0,02 (−0,61, 0,59) | −0,01 (−0,59, 0,56) | 0,01 (−0,61, 0,60) | 0.8203 |
Таблица 1. Исходные характеристики и инженерные особенности исследовательской когорты. Категориальные переменные представлены как n (%). Непрерывные переменные представлены как медиана (межквартильный диапазон) стандартизированных значений. P значений были рассчитаны для сравнения распределений между наборами обучения, валидации и тестов с использованием соответствующих статистических тестов.
Непрерывные переменные с повторяющимися измерениями агрегировались с использованием арифметического среднего значения в течение всего окна наблюдения в отделении интенсивной терапии, чтобы получить один вектор признака на каждого пациента. Переменные с уровнем отсутствия свыше 30% были исключены. Для оставшихся числовых переменных отсутствующие значения вводились с помощью алгоритма K-Ближайших соседей (KNN) (n_neighbors = 5, веса = «равномерно»). Категориальные переменные вводились с использованием наиболее частой категории и затем преобразовывались с помощью бинарного отображения, при этом невидимым категориям присваивался вектор нулей.
Непрерывные переменные стандартизировались с помощью формулы масштабирования z-score (). Признаки с нулевой дисперсией были явно удалены до масштабирования. Все параметры предварительной обработки (μ и σ.) оценивались строго на обучающем наборе и последовательно применялись к валидационным и тестовым наборам.
Учитывая серьёзный дисбаланс классов (3 672 против 42 554), гибридная стратегия балансировки применялась исключительно к обучающим данным, чтобы избежать завышения оценок эффективности. Во-первых, для уменьшения большинству отрицательного класса использовалась случайная недовыборка с целью достижения соотношения 1:2 (положительно:отрицательно) (получилось 7 344 отрицательных выборки). Далее к положительному классу применялась Synthetic Minority Over-Sampleling Technique (SMOTE) для достижения окончательного сбалансированного соотношения 1:1 (7 344 против 7 344)8.
Наконец, когорта была разделена на уровне пациентов на обучение (65%), валидационные (15%) и тестовые (20%) с использованием стратифицированной выборки. Для строгого контроля всех случайных процессов при импутации, балансировке и расщеплении применялся глобальный случайный заседок (random_state = 42).
Архитектура модели
Для выявления наиболее подходящей предиктивной модели риска ОП у пациентов с диабетом была использована масштабная система бенчмаркинга для сравнения 70 вариантов алгоритмов ML в рамках идентичного протокола представления данных и оценки. Кандидатные семейства моделей включали регулярные линейные классификаторы, поддерживающие векторные машины (SVM), kNN, ансамбли деревьев, архитектуры градиентного бустинга и многослойныеперцептроны 9,10,11,12,13,14,15,16,17.
Вместо традиционного поиска по сетке, гиперпараметрическая оптимизация проводилась путём оценки заранее определённых, надёжных конфигураций для этих 70 вариантов моделей на обучающем разделе. Выбор строго основывался на максимизации площади под кривой рабочей характеристики приёмника (ROC) (AUC) на валидационном наборе. Окончательная модель с наилучшей производительностью была настроена с n_estimators = 200, при этом другие параметры оставались на стандартных настройках программного пакета, указанного в Таблице материалов. Метрики оценки, включая AUC, точность, F1-балл, точность и воспоминание, рассчитывались с использованием стандартного порога вероятности 0,5.
Для поддержки клинической прозрачности SHAP применялся к выбранной модели с использованием метода TreeExplainer. Учитывая древообразный характер конечной модели, в качестве фоновой конфигурации использовались точные ожидаемые значения, зависящие от пути дерева.