$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Доступ к базам данных и программная среда
Получите авторизованный доступ к базе данных Medical Information Mart for Intensive Care IV (MIMIC-IV, v3.1) после прохождения необходимого обучения по этическому использованию данных (Certification ID: 69002811). Согласно Мерам по этическому обзору наук о жизни и медицинских исследований с участием людей (18 февраля 2023 года, Китай), статья 32 предусматривает, что исследования с использованием легально полученных публичных данных, данных, созданных без вмешательства в общественное поведение или анонимизированной информации, освобождаются от этической проверки. В соответствии с этическими положениями, это исследование было освобождено от институционального этического одобрения. Протокол использования данных и этические нормы строго соблюдались, а исследование проводилось исключительно в научных целях. Настройте среду базы данных с помощью PostgreSQL (v17.1.11). Используйте Navicat Premium (v17) в качестве интерфейса управления базами данных и запросов для запуска SQL-запросов и экспорта извлеченных наборов данных для анализа.
Отбор пациентов
Идентифицировать пациентов с раком лёгких в MIMIC-IV с помощью кодов Международной классификации заболеваний, Девятая и Десятая редакции (ICD-9 и ICD-10)17. Применяйте следующие критерии исключения последовательно: возраст <18 лет или >90 лет; Отсутствие измерений альбумина в сыворотке в течение первых 24 часов после поступления в отделение интенсивной терапии; Многократные госпитализации в отделения интенсивной терапии или больницы; Продолжительность пребывания в реанимации <24 часа.
Переменная экстракция
Извлечь переменные из MIMIC-IV (v3.1) с помощью PostgreSQL (v17.1.11) через Navicat Premium (v17), включая: демографию, жизненно важные показатели, лабораторные анализы, сопутствующие заболевания, терапевтические вмешательства, показатели тяжести и исходы. Демография: возраст, пол. Жизненно важные показатели в течение первых 24 часов после госпитализации в реанимацию: частота сердечных сокращений (HR), частота дыхания (RR), насыщение кислородом (SpO₂) и температура. Лабораторные показатели в течение первых 24 часов: сывороточный альбумин, глюкоза, креатинин, азот мочевины, общий билирубин, гемоглобин, количество эритроцитов (эритроцитов), количество лейкоцитов (WBC), количество тромбоцитов, ширина распределения эритроцитов (RDW), аланинаминотрансфераза (ALT), аспартатаминотрансфераза (AST), протромбиновое время (PT), кальций, калий, натрий, хлорид. Сопутствующие заболевания по диагностическим записям: гипертония, печёночный цирроз, хроническая болезнь почек, сахарный диабет, хронический бронхит, застойная сердечная недостаточность и хроническая обструктивная болезнь лёгких (ХОБЛ). Показатели тяжести при поступлении в отделение интенсивной терапии: оценка последовательной органной недостаточности (SOFA), упрощённый балл острой физиологии II (SAPS II), ИНДЕКС СОПУТСТВУЮЩИХ ЗАБОЛЕВАНИЙ ЧАРЛСОНА, острая физиология и хроническая оценка здоровья II (APACHE II). Терапевтические вмешательства: системные кортикостероиды, антибиотики, вазопрессоры. Фактор образа жизни: история курения. Для всех лабораторных переменных и оценок тяжести в течение первых 24 часов, если доступно несколько измерений, вычислите среднее значение запервый день и используйте это значение для анализа. Исключить переменные с отсутствующими данными более чем на 20%. Для переменных с отсутству ≤20%, выполняйте импутацию с помощью алгоритма missForest — случайного метода машинного обучения на основе леса для обработки смешанных клинических данных. Доля отсутствующих данных по ключевым переменным приведена в дополнительной таблице 1.
Определение результата
Определите основной исход как смертность от всех причин в течение 28 дней после госпитализации в реанимацию. Определить статус смертности с помощью записей о смерти, доступных в базе данных MIMIC-IV. Классифицировать пациентов как выживших или не выживших на основе 28-дневной смертности.
Статистический анализ
Оценить распределение непрерывных переменных с помощью теста Шапиро–Вилка. Сравните нормально распределённые переменные с помощью t-теста Стьюдента и ненормально распределенные переменные с помощью теста ранговой суммы Уилкоксона. Сравните категориальные переменные с помощью теста хи-квадрата. Выполнить регрессию оператора наименьшей абсолютной усадки и отбора (LASSO) с 10-кратной перекрёстной валидацией для выбора кандидатных переменных и снижения мультиколлинеарности. Постройте многомерные модели пропорциональных рисков Кокса для оценки независимой связи между сывороточным альбумином и смертностью за 28 дней. Сывороточный альбумин был введён как непрерывная, так и категориальная переменная, а ковариаты, выбранные с помощью регрессии LASSO, были включены для корректировки. Были оценены коэффициенты риска (HR) и 95% доверительные интервалы (CI). Изучите нелинейные ассоциации с помощью анализа ограниченного кубического сплайна (RCS). Узлы размещались на заранее заданных процентилях распределения альбумина, а нелинейность оценивалась с помощью теста сплайн-терминов. Сгенерируйте кривые выживаемости Каплана–Мейера и сравните распределения выживаемости с помощью логарифмического теста.
Разработка и валидация моделей машинного обучения
Случайным образом разделите набор данных на уровне пациентов на обучающий набор (70%), валидационный набор (15%) и независимый набор тестов (15%). Выполнять выбор признаков с помощью обучающего набора только путём идентификации пересечения переменных, выбранных регрессией LASSO, и алгоритмом Боруты, обеспечивая сохранение только стабильных и релевантных предикторов. Обучить восемь классификаторов машинного обучения на обучающем наборе, включая логистическую регрессию, случайный лес, дерево решений, машину опорного вектора, XGBoost, LightGBM, наивного Байеса дополнения и классификатор векторов поддержки. Производительность модели сначала оценивалась в валидационном наборе, а затем подтверждена в независимом тестовом наборе с использованием AUC-ROC, AUC-PR, точности, чувствительности, специфичности, калибровочных кривых, анализа кривой принятия решений и кривых обучения.
Интерпретация модели и конечная точка
Определить наиболее эффективную модель машинного обучения на основе показателей эффективности валидации. Применяйте SHapley Additive Explanations (SHAP) для количественной оценки вклада каждой особенности в прогнозирование смертности. Генерируйте сводные графики SHAP и графики зависимостей для визуализации относительной важности и направленности сывороточного альбумина и других предикторов. Завершите анализ, интегрируя статистические и машинные результаты для создания интерпретируемой структуры стратификации рисков.