Целью данного исследования является разработка и внешняя валидация веб-системы, интегрирующей модели машинного обучения для ранней диагностики и клинического фенотипирования ОРДС, связанной с пневмонией, с целью облегчения точного лечения.
Research Article
Целью данного исследования является разработка и внешняя валидация веб-системы, интегрирующей модели машинного обучения для ранней диагностики и клинического фенотипирования ОРДС, связанной с пневмонией, с целью облегчения точного лечения.
Острый респираторный дистресс-синдром (ОРДС) — это высокогетерогенное заболевание с клиническими проявлениями, которые могут пересекаться с тяжёлой пневмонией, что создаёт трудности для точной дифференцировки. Поэтому срочно необходимы раннее прогнозирование и быстрая кластеризация подтипов пациентов с ОРДС у пациентов. Целью данного исследования является разработка веб-системы, включающей валидированные модели ранней диагностики у постели пациента и классификации клинических подгрупп, для прогнозирования развития и фенотипов ОРДС, связанной с пневмонией. Диагностические и подгрупповые модели были разработаны и валидированы из двух крупных баз данных — Medical Information Mart for Intensive Care IV (MIMIC-IV) и Telehealth Intensive Care Unit (eICU) — и интегрированы в веб-систему прогнозирования. Анализировали данные пациентов с пневмонией, госпитализированных более 24 часов в период с 2008 по 2019 год. В когорту производных MIMIC-IV входили 24 987 пациентов с пневмонией (14 121 — с ОРДС, связанной с пневмонией); В когорту верификации eICU было 20 676 пациентов с пневмонией (9946 с ОРДС, связанной с пневмонией). В диагностике метод стекирования машинного обучения показал лучшие результаты с AUC 0,919, точностью 70,00%, точностью 69,88% и воспоминанием 82,27% в когорте производных MIMIC-IV. AUC, точность, точность и отзыв в когорте валидации eICU составили соответственно 0,915, 70,87%, 69,70% и 69,70%. ОРДС, связанный с пневмонией, был классифицирован на три клинических фенотипа с разными клиническими характеристиками и исходами, каждый из которых по-разному реагировал на лечение. Среди пациентов с кластерами 0 и 1 уровень госпитальной смертности был выше среди тех, кто получил раннее лечение кортикостероидами, чем среди тех, кто не получал его, тогда как среди пациентов кластера 2 уровень госпитальной смертности был ниже среди тех, кто получал кортикостероиды, чем среди тех, кто их не принимал. Мы провели веб-трансформацию прогнозирования диагноза и классификации клинических подгрупп ОРДС, связанной с пневмонией. Наши веб-модели ранней диагностики у постели и клинической подгрупповой классификации ОРДС, связанной с пневмонией, могут помочь клиницистам в диагностике и лечении заболевания, а также в продвижении индивидуального точного лечения.
Острая дыхательная недостаточность, особенно острый респираторный дистресс-синдром (ОРДС) после инфекции лёгких, является распространённой и разрушительной проблемой, встречающейся у тяжело больных пациентов. Исследования показали, что заболеваемость ОРДС достигает 10% среди пациентов в отделении интенсивной терапии (ICU)1, а уровень смертности составляет примерно 40%2,3. Тяжёлая пневмония широко считается основной причинойОРДС 4. Поскольку клинические симптомы тяжёлой пневмонии и ОРДС схожи, часто сложно отличить ОРДС от тяжёлой пневмонии. Таким образом, раннее предсказание развития ОРДС в случаях пневмонии может снизить заболеваемость ОРДС и показателисмертности 5. Кроме того, поскольку ОРДС является высокогетерогеннымзаболеванием 6, ранняя и правильная классификация подгрупп ОРДС может позволить проводить прецизионную медицину. Такая классификация также является одним из основных направлений исследований респираторных критических заболеваний по всему миру. 7 цель — повысить эффективность целевого вмешательства в подгруппы.
В настоящее время независимые факторы риска ОРДС изученытщательно, 8, но немногие из них сосредоточились на прогнозировании ОРДС у пациентов с пневмонией. Кроме того, не проводилось исследований по конкретным клиническим фенотипам ОРДС, связанной с пневмонией; большинство исследований фенотипа были сосредоточены на всей популяции пациентов с ОРДС. Калфи и др. классифицировали ОРДС на гипервоспалительные и гиповоспалительные фенотипы. Для определения этих биологических фенотипов плазменные биомаркеры должны использоваться в качестве категорических определяющих переменных, однако такое исследование недоступно у постели пациента. В одном исследовании были использованы доступные клинические индикаторы для классификации ОРДС на три клинических фенотипа, ответы которых на рандомизированные вмешательства также оценивались, но исследование основывалось на всей популяции пациентов сОРДС 10. Определение клинических фенотипов ОРДС по разным причинам, таким как пневмония, может дать более точные и точные результаты.
Целями этого исследования были использование машинного обучения для построения предиктивной модели ОРДС, связанной с пневмонией, с использованием ранних клинических данных; использовать ранние и легко доступные клинические данные для классификации ОРДС, связанной с пневмонией, по клиническим фенотипам и изучения различий в их клинических характеристиках, исходах и ответах на лечение; а также реализовать модель прогнозирования и классификации в виде веб-приложения, которое поможет клиницистам в диагностике и лечении ОРДС, связанной с пневмонией, и будет способствовать дальнейшим исследованиям.
Access restricted. Please log in or start a trial to view this content.
В этом исследовании были доступны базы данных11 (Medical Information Mart for Intensive Care IV (MIMIC-IV) (версия 1.0, PhysioNet: https://physionet.org/content/mimiciv/1.0/) и базы данных12 Telehealth Intensive Care Unit (eICU) (версия 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/) после завершения экзамена Protecting Human Research Participants (ID записи: 44151052). Это исследование было проведено в соответствии с принципами Хельсинкской декларации (2013), и пациенты дали согласие на фиксацию их данных в обеих базах данных. Этическое одобрение этого исследования было отменено, поскольку данные в базах данных eICU и MIMIC-IV были полностью анонимизированы (личные идентификаторы не сохранялись).
Материалы и инструменты
Источники данных: база данных MIMIC-IV: версия 1.0, одноцентровый реестр открытого доступа, содержащий 76 540 поступлений в отделения интенсивной терапии (2008-2019), доступ через PhysioNet. База данных eICU: версия 2.0, многоцентровая база данных с >200 000 электронных медицинских записей из 335 подразделений в 208 больницах США (2014–2015), доступ осуществляется через PhysioNet. Программное обеспечение и среда исполнения: RapidMiner Studio: версия 9.10.001 (среда выполнения: Windows 10 Pro 64-bit), используется для создания моделей (классификация/кластеризация) и выбора функций; IBM SPSS Statistics: версия 23.0 (среда выполнения: Windows 10 Pro 64-bit), используется для статистического анализа и отсутствующих значений; Java Development Kit (JDK): версия Java SE 8u381 (среда выполнения: Windows 10 Pro 64-bit), используется для разработки веб-приложений; поддерживающая IDE: Eclipse IDE 2023-09; Apache Tomcat: версия 9.0.85, используется для развертывания веб-приложения.
Дизайн и окружение исследования
Концепция этого исследования иллюстрирована на дополнительном рисунке 1. В этом исследовании анализировали данные из двух крупных источников — Медицинского информационного центра интенсивной терапии IV (MIMIC-IV) и баз данных отделения интенсивной терапии телемедицины (eICU), чтобы построить предиктивную модель ОРДС, связанной с пневмонией, и классифицировать поражённых пациентов по клиническим фенотипам. Это исследование следовало рекомендациям Прозрачной отчетности многомерной модели прогнозирования индивидуального прогноза или диагностики (TRIPOD).
Образцы исследований
Данные обучения и тестирования этого исследования были получены из MIMIC-IV. Источником внешней верификации была многоцентровая база данных eICU. В этом исследовании использовалась Международная классификация заболеваний (Девятая и Десятая редакции) для извлечения данных о пациентах с пневмонией и ОРДС, связанной с пневмонией. Пациенты, госпитализированные менее 24 часов, были исключены.
Предикторы
После оценки доступности данных и частоты отсутствия клинических переменных в наборах данных MIMIC-IV и eICU было выбрано 52 переменных для ОРДС, связанной с пневмонией, в качестве кандидатов для обучения в машинном обучении, включая демографические характеристики пациентов, лабораторные результаты и показатели тяжести заболевания. В этом исследовании использовался алгоритм веса по корреляции (основанный на весе корреляции между переменными и результатами) для скрининга ключевых предикторов (переменных, которые в конечном итоге включаются в модели) из 52 кандидатных переменных, а затем отбора факторов кластеризации подгрупп из ключевых предикторов.
Для этого откройте RapidMiner Studio, создайте новый процесс и добавьте оператор Weight by Correlation, нажав на Process > Operators > Feature Selection > Weight by Correlation. Установите параметр: порог корреляции = 0,04 (сохранять переменные с весом > 0,04). Чтобы заставить модель учитывать ранние стадии заболевания и своевременность, максимальные и минимальные значения лабораторных показателей были получены в течение 24 часов после поступления. Поскольку балл острой физиологии III (APSIII) не был включён в базу данных eICU, вместо этого использовались баллы по Острой физиологии и хронической оценке здоровья IV (APACHE IV). В этом исследовании данные были очищены и интерполированы недостающие значения с помощью метода множественной импутации, а также стандартизировали входные переменные при разработке моделей прогнозирования и субфенотипирования.
Статистический анализ
Откройте SPSS 23.0, импортируйте предобработанный набор данных и выберите Анализ > описательной статистике > исследовать. Проверьте графики нормальности с тестами , чтобы выполнить тест Колмогорова–Смирнова для непрерывных переменных. Косвенные распределенные переменные указываются как медиана (межквартильный диапазон, IQR); Категориальные переменные отображаются как количество (процент, %). Для сравнения непрерывных переменных между группами использовался тест Манна-Уитни U или тест Крускаля-Уоллиса, если это уместно. Для сравнения категориальных переменных между группами использовался хи-квадрат тест Пирсона или точный тест Фишера, если это уместно.
Разработка моделей и веб-презентация
Для разработки модели в этом исследовании когорта вывода MIMIC-IV была разделена на обучающий набор (90% от всей выборки случайным образом выбранный для разработки модели и настройки гиперпараметров) и тестовый набор (10% от всей выборки, случайно выбранной для внутреннего тестирования); в этом исследовании проводилась внешняя верификация в отделении интенсивной терапии. В этом исследовании было реализовано машинное обучение с помощью пяти методов: дерево решений, логистическая регрессия, наивный байес, стекинг (базовыми обучающимися были логистическая регрессия, наивный байес и методы случайного леса; обучающимся был метод дерева решений) и случайный лес. Дерево решений: нажмите на Операторы процесса > > Моделирование > классификации > Дерево принятия решений с алгоритмом = C4.5, Минимальный размер листа = 5. Для логистической регрессии: нажмите на Операторы процесса >> моделирование > классификации > Логистическая регрессия с силой регуляризации = 0,1, Максимальные итерации = 100. Для наивного Байеса: нажмите на Process > Operators > Modeling > Classification > Naive Bayes с типом ядра = Гауссовым. Для случайного леса: нажмите на Операторы процесса > > Моделирование > классификации > случайный лес с числом деревьев = 100, максимальной глубина = 20. Для стекирования: нажмите на Операторы процесса > > Моделирование > ансамбль > Стекирование с базовыми обучающимися = Логистическая регрессия + наивный Байес + случайный лес; Стекинг ученика = дерево решений. В этом исследовании измерялись предсказательные характеристики разработанной модели путём вычисления площади под кривой рабочей характеристики приёмника (AUC), точности, точности и отзыва.
При построении классификации клинических подгрупп ОРДС, связанных с пневмонией, в этом исследовании использовалась кластеризация k-средних с ключевыми предикторами. Для определения оптимального количества кластера k было изучено значение статистики разрыва на графике статистики разрыва, что указывало оптимальное количество кластеров. В этом исследовании проанализировали клинические характеристики и результаты различных фенотипов, а также мы сравнили различия в показателях смертности в больнице среди пациентов с разными кластерами, которые получали или не получали раннее лечение кортикостероидами низко- и средних доз.
В RapidMiner Studio выберите File > Export Model и сохраните модели прогнозирования диагноза и классификации подгрупп в файлах .model. Используйте JDK Java SE 8u381 и Eclipse IDE 2023-09 для написания веб-страниц на языке Java; Импортируйте .model файлы в проект. В этом исследовании использовался язык Java для создания веб-страницы, в которую были встроены диагностическая модель и модель кластеризации клинических подгрупп, и мы загрузили модель онлайн.
Access restricted. Please log in or start a trial to view this content.
Участники
База данных MIMIC-IV включала данные 24 987 пациентов с пневмонией, из которых 14 121 имел ОРДС, связанную с пневмонией (Таблица 1). База данных eICU включала данные 20 676 пациентов с пневмонией, из которых 9946 имели ОРДС, связанную с пневмонией (Дополнительная таблица 1).
Создание и проверка модели прогнозирования ОРДС, связанной с пневмонией,
Мы использовали данные когорты MIMIC-IV для построения диагностич...
Access restricted. Please log in or start a trial to view this content.
Как известно, это первая диагностическая модель и модель классификации клинических подгрупп, использующая машинное обучение для сообщения о ОРДС у пациентов с пневмонией, а также крупнейшее исследование, сообщающее о диагнозе и классификации клинических подгрупп ОРДС, связанной с пневмонией. В этом исследовании мы вывели и проверили две модели на основе машинного обучения и преобразовали их в веб-приложения для клинической практики и последующих исследований. В когорте валидации eICU про...
Access restricted. Please log in or start a trial to view this content.
Авторы заявляют, что у них нет конкурирующих интересов.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Apache Tomcat | Apache software foundation | Версия 9.0.85 | |
| Eclipse IDE | Затмение | 2023-09 | |
| Java Development Kit | Ява | Версия Java SE 8u381 | |
| Студия RapidMiner | Altair Engineering Inc. | Версия 9.10.001 | |
| Статистика SPSS | IBM | Версия 23.0 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission