Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

Интеллектуальная модель диагностики и лечения на основе клинических данных для лечения хронической обструктивной болезни легких в домашних условиях

532 просмотров

DOI:

10.3791/69024

24 октября 2025 г.

В этой статье

Краткое содержание

Модель, основанная на клинических данных, сочетающая XGBoost и LSTM, улучшает реабилитацию при ХОБЛ в домашних условиях, повышая точность данных и прогнозирование. Он достигает 98% точности и улучшения показателей на 42,5%, устраняя ограничения традиционного лечения в больнице.

Аннотация

Традиционное стационарное реабилитационное лечение хронической обструктивной болезни легких (ХОБЛ) имеет такие проблемы, как нехватка ресурсов, высокая стоимость и неудобная транспортировка. Для повышения удобства реабилитационного лечения ХОБЛ предложена интеллектуальная модель диагностики и лечения на основе клинических данных для управления реабилитацией при ХОБЛ в домашних условиях. Интеллектуальная модель диагностики и лечения для реабилитации ХОБЛ в домашних условиях оптимизирована за счет сочетания алгоритма XGBoost и сети долговременной кратковременной памяти. Полученные результаты свидетельствуют о том, что алгоритм XGBoost обладает самой высокой точностью обработки клинических структурированных данных, в то время как алгоритм случайного леса (RF) имеет наименьшую точность обработки клинических структурированных данных. Когда количество обучающих выборок равно 300, показатели точности составляют 98% и 83% соответственно. Для обработки показателей мониторинга используется интеграция алгоритма XGBoost и сети длительной кратковременной памяти, что приводит к наибольшему темпу улучшения и наименьшей среднеквадратичной ошибке. При размере выборки 1000 коэффициент улучшения показателей мониторинга составляет 42,5%, а среднеквадратичная ошибка равна 0,041. Предложенный в исследовании метод позволяет эффективно обрабатывать клинические данные, повышать точность обработки данных, а также точно прогнозировать будущие изменения ХОБЛ.

Введение

ХОБЛ является распространенным хроническим заболеванием с высоким уровнем инвалидности и смертности, что существенно влияет на уровень жизни пациентов. Традиционная модель управления реабилитацией имеет такие проблемы, как задержка информации и несвоевременное вмешательство в борьбу с ХОБЛ. Тем не менее, с развитием технологий, некоторые новые технологии, такие как алгоритм Extreme Gradient Boosting (XGBoost), открыли новые возможности для лечения ХОБЛ1. В то время как XGBoost продемонстрировал применимость в различных контекстах мониторинга здоровья, в том числе в спортивной медицине, это исследование специально использует его сильные стороны для лечения ХОБЛ в условиях домашней реабилитации. Основное внимание по-прежнему уделяется повышению прогностической точности и персонализированному уходу за пациентами с ХОБЛ с использованием данных клинического и дистанционного мониторинга2. Например, собирая физиологические показатели, такие как частота сердечных сокращений, частота дыхания и т. д., эта комбинация не только помогает в ведении пациентов с ХОБЛ, но и предлагает свежие перспективы и подходык управлению здоровьем. XGBoost — это эффективный алгоритм дерева принятия решений на основе градиентного бустинга (GB). XGBoost использует методы параллельных вычислений и кэширования, чтобы ускорить обучение и справиться с администрированием больших баз данных и сложных характеристик. Кроме того, он хорошо справляется с различными типами наборов данных, обладает отличной способностью к обобщению4. Длительная кратковременная память (LSTM) — это специальная структура RNN, обычно используемая для обработки и обучения данных временных рядов. LSTM чувствителен ко времени и способен выявлять закономерности и характеристики в данных временных рядов, что делает его полезным для таких задач, как обработка сигналов и прогнозирование временных рядов. Для достижения точного прогнозирования и персонализированного вмешательства в заболевание предложен метод применения интеллектуального режима диагностики и лечения клинических данных для лечения ХОБЛ в домашних условиях. В исследовании инновационным образом сочетаются XGBoost и LSTM для оптимизации интеллектуальной диагностики и режима лечения ХОБЛ в домашних условиях. Комбинация этих двух факторов позволяет обеспечить точное прогнозирование заболевания и предоставить персонализированные планы вмешательств на основе данных для повышения уровня интеллекта при лечении ХОБЛ в домашних условиях.

Чтобы гарантировать полезность предложенной модели, следует учесть несколько параметров и ограничений. Для этого метода могут потребоваться структурированные клинические данные (например, данные о функции легких и данные о кислороде в крови) и данные дистанционного мониторинга (например, частота сердечных сокращений, сатурация кислорода, уровни активности), периодически собираемые с надежных носимых датчиков или домашних устройств мониторинга. Для стабильного обучения размер выборки должен составлять минимум 300 выборок, а для оптимальной производительности предпочтительно иметь 1000 или более выборок. Существуют также вычислительные потребности, особенно с точки зрения обучения LSTM, которые требуют достаточной вычислительной мощности или использования облачных решений для развертывания для возможности прогнозирования.

ХОБЛ – это прогрессирующее, необратимое респираторное заболевание, характеризующееся ограничением оттока, острыми обострениями и ухудшением качества жизни (КЖ). Он оказывает значительное влияние на группы населения в системах здравоохранения, благополучия и здравоохранения по всему миру; следовательно, раннее прогнозирование и своевременное вмешательство в связи с ХОБЛ являются неотъемлемой частью ограничения прогрессирования патологического заболевания и госпитализации5. Было показано, что методы машинного обучения (ML) улучшают диагностику и прогностический путь ХОБЛ с клинически значимыми данными с помощью передовых подходов к моделированию, основанных на данных. Было отмечено, что XGBoost создает наиболее эффективные и успешные модели машинного обучения для несбалансированных данных и нелинейных взаимодействий между клиническими переменными6. Сообщается об отличной точности классификации легочных заболеваний с помощью XGBoost и Support Vector Machines (SVM) с электронными данными о носу. Кроме того, были построены прогностические модели на основе машинного обучения для прогнозирования риска ХОБЛ с использованием несбалансированных клинических данных, что рекомендовало XGBoost для повышения прогностической надежности7. Кроме того, была подтверждена высокая производительность XGBoost среди других моделей машинного обучения в задачах классификации ХОБЛ. Ансамблевое обучение также эффективно используется с использованием нескольких самообучающихся моделей ML для идентификации и классификации ХОБЛ, а также выявления рака легких, особенно с учетом роли XGBoost в данных респираторной диагностики8. Таким образом, эти предыдущие исследования обеспечивают основу для использования XGBoost в модифицированном приложении с использованием возможностей трансформера LSTM для построения интеллектуальной модели диагностики и лечения для людей, живущих с ХОБЛ в домашних условиях, для повышения точности прогнозирования и улучшения персонализированного здоровьяи оказания медицинской помощи.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Это исследование было рассмотрено и одобрено Этическим комитетом онкологической больницы Тайчжоу. Перед сбором данных было получено письменное информированное согласие всех участников в соответствии с институциональными и национальными этическими стандартами. Используемые реагенты и программное обеспечение перечислены в Таблице материалов.

1. Обзор рабочего процесса

Сквозной рабочий процесс обработки структурированных клинических данных с помощью XGBoost показан на рисунке 1 и включает в себя прием признаков, построение дерева, остаточные обновления, регуляризацию и оценку. На рисунке 2 показан рабочий процесс предварительной обработки и моделирования последовательностей для данных удаленного мониторинга с помощью LSTM, охватывающий 10-минутную повторную выборку, обработку разрывов, 7-дневное неперекрывающееся окно, сетевую архитектуру и вывод.

2. Набор пациентов и демография

Пациенты набирались последовательно из амбулаторных клиник и стационарных отделений онкологической больницы Тайчжоу в период с марта 2023 года по январь 2024 года. Критериями включения были подтвержденный диагноз ХОБЛ по критериям GOLD (ОФВ1/ФЖЕЛ < 70%), стабильное состояние на момент включения в исследование и возраст от 40 до 80 лет. Критерии исключения включали тяжелые сопутствующие заболевания, такие как рак легких, неконтролируемые сердечно-сосудистые заболевания или когнитивные нарушения, препятствующие информированному согласию. В исследование было включено 214 пациентов (средний возраст 63,7 ± 8,9 лет; 68% мужчин; 54% нынешних или бывших курильщиков).

3. Сбор данных

Клинически структурированные данные включали функцию легких (ОФВ1, ФЖЕЛ), насыщение крови кислородом (SpO2), продолжительность пребывания в больнице и продолжительность заболевания. Функция легких иSpO2 регистрировались в процентах, пребывание в больнице — в днях, а продолжительность заболевания — в годах. Данные удаленного мониторинга собирали с помощью сертифицированных носимых оксиметров и трекеров активности, проверенных на соответствие золотым стандартам больниц: пульсоксиметры сверяли с мониторами Masimo Rad-97 (средняя абсолютная ошибка 1,8% в диапазоне 90-100% SpO2 ), датчики сердечного ритма проверяли по электрокардиографии (средняя ошибка 2,3 уд/мин), а счетчики шагов калибровали по протоколу беговой дорожки. Необработанные данные экспортировались в виде файлов CSV с отметками времени с интервалом в 10 минут.

4. Обоснование размера выборки

Пороговые значения в 300 обучающих выборок для XGBoost и около 1000 неперекрывающихся 7-дневных последовательностей для LSTM были подтверждены экспериментами и анализом мощности/моделирования. Апостериорный анализ мощности с использованием G*Power (версия 3.1) показал, что 300 образцов обеспечивают >80% мощности для обнаружения среднего размера эффекта (f2 Коэна = 0,15) при α = 0,05 в логистической регрессии. Моделирование показало, что для стабильной сходимости LSTM на многомерных физиологических временных рядах необходимо около 1000 последовательностей. Эмпирические данные обобщены в таблице 1 и визуализированы на рисунках 3 и 4.

5. Предварительная обработка данных

Отсутствующие записи, обозначенные как пробелы, сигнальные значения или NaN, были импутированы с использованием среднего значения обучающего набора для каждого признака, чтобы избежать целевой утечки:

figure-protocol-1(1)

где mj — количество наблюдаемых значений для признака j. То же figure-protocol-2 самое было применено к валидационным и тестовым наборам. Чтобы устранить смещение, связанное со шкалой, функции были стандартизированы с помощью нормализации z-оценки с использованием параметров, предназначенных только для обучения:

figure-protocol-3(2)

где μj и σj — среднее значение и стандартное отклонение признака j, оцененное по обучающим данным. Для сигналов временных рядов (SpO2, частота сердечных сокращений, шаги) потоки были выровнены в соответствии с 10-минутной каденцией; Короткие гэпы до 30 мин заполнялись вперед, а более длинные гэпы сглаживались трехточечной скользящей средней. Затем было применено 7-дневное скользящее окно с 1008 временными шагами для формирования неперекрывающихся последовательностей для предотвращения утечки (см. рис. 2).

6. Обучение модели

Для структурированных клинических данных XGBoost был настроен с помощью сеточного поиска по скорости обучения (0,01-0,3), максимальной глубине (3-10) и количеству оценок (100-500) в рамках бинарной логистической цели (рабочий процесс на рисунке 1). Для данных удаленного мониторинга LSTM состоял из двух скрытых слоев LSTM по 128 единиц каждый, инициализации Ксавьера, коэффициента отсева 0,5 и выходного слоя сигмовидной кишки; оптимизация использовала Adam с коэффициентом обучения 0,001, реализованным в TensorFlow (конвейер на рисунке 2). Переобучение было смягчено с помощью отсева и досрочного прекращения (терпение = 10), а дисбаланс классов был устранен с помощью SMOTE.

7. Стратегия оценки

Структурированные данные оценивались с помощью стратифицированной 10-кратной перекрестной валидации. Данные временных рядов оценивались с проверкой с пошаговой проверкой для сохранения временного порядка. Метрики включали точность, прецизионность, полноту, F-меру, площадь под кривой ROC (AUC) и среднеквадратичную ошибку (MSE). Различия между моделями оценивались с помощью теста Вилкоксона со знаком ранга (двустороннего). Цифры включают 95% доверительные полосы или погрешности для количественной оценки неопределенности. Этот выбор напрямую связан с рисками утечки временных рядов и необходимостью статистической значимости, запрашиваемой составителями обзора.

8. Клиническая актуальность и пилотное тестирование

Гибридная модель предсказывала снижениеSpO2 за 6-12 ч до начала клинических проявлений у 78% наблюдаемых пациентов и снижение MSE на 42,5% относительно исходных уровней. В четырехнедельном пилотном проекте с участием 20 пациентов с ХОБЛ еженедельные оценки модельного риска совпадали с оценками врачей в 85% обзоров, что подтверждает потенциал клинической интеграции.

9. Программное обеспечение и окружающая среда

Анализ проводился в Python 3.10.6 с scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 и PyTorch 1.13 на Ubuntu 20.04 LTS с графическим процессором NVIDIA RTX 3080, CUDA 11.6 и cuDNN 8.2. Полные версии и поставщики перечислены в ненумерованном Описании материалов.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Стабильность размера выборки и оптимальная производительность
Чтобы наглядно продемонстрировать порог стабильности, мы сначала представим таблицу 1, а затем кривые обучения на рисунках 3 и 4. В таблице 1 представлены средние ± SD точности, AUC и MSE по возрастающим размерам обучения для классификатора XGBoost на структурированных данных и для LSTM на многомерных временных рядах. Как показано ...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Резюме основных выводов
ХОБЛ создает значительную клиническую и социальную нагрузку из-за нарушения дыхания, ограниченной подвижности и рецидивирующих острых обострений10. Использование непрерывного мониторинга дома с объяснимой аналитикой может снизить эту нагрузку, обеспечивая более раннее обнаружение и целенаправленное вмешательство. В этом исследовании гибридный рабочий процесс, объединяющий XGBoost для структурированных клинических перемен...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторам нечего раскрывать.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
КУДАНДВО11.6Платформа параллельных вычислений и модель программирования, используемая для ускорения вычислений на графических процессорах.
cuDNNНДВО8.2Библиотека с ускорением на GPU для глубоких нейронных сетей для оптимизации производительности обучения моделей.
Аппарат ЭКГФилипсPageWriter TC70Используется для проверки измерений частоты сердечных сокращений с носимого устройства.
Графический процессорНДВОВидеокарта RTX 3080Высокопроизводительный графический процессор, используемый для ускорения обучения модели на больших наборах данных.
Модель LSTM--Нейронная сеть с длинной кратковременной памятью, используемая для обработки данных временных рядов.
ПульсоксиметрМасимоРад-97Используется для измерения насыщения крови кислородом (SpO2) и проверки точности носимого устройства.
ПитонPython Software Foundation3.10.6Язык программирования, используемый для обработки данных, обучения и оценки моделей.
ТензорФлоуГугл2.13Программная библиотека, используемая для обучения модели LSTM и выполнения нейросетевых вычислений.
Носимый трекер активностиФитбитЗаряд 5Используется для отслеживания шагов и уровня физической активности.
XGBoost--Программная библиотека, используемая для градиентного бустинга (машинного обучения).

Ссылки

  1. Stolz, D., et al. Towards the elimination of chronic obstructive pulmonary disease: A Lancet Commission. Lancet. 400 (10356), 921-972 (2022).
  2. Adeloye, D., et al. Global, regional, and national prevalence of, and risk factors for, chronic obstructive pulmonary disease (COPD) in 2019: A systematic review and modelling analysis. Lancet Respir Med. 10 (5), 447-458 (2022).
  3. Asselman, A., Khaldi, M., Aammou, S. Enhancing the prediction of student performance based on the machine learning XGBoost algorithm. Interact Learn Environ. 31 (6), 3360-3379 (2023).
  4. Deng, Y., Lumley, T. Multiple imputation through xgboost. J Comput Graph Stat. 33 (2), 352-363 (2024).
  5. Binson, V. A., Subramoniam, M., Sunny, Y., Mathew, L. Prediction of pulmonary diseases with electronic nose using SVM and XGBoost. IEEE Sens J. 21 (18), 20886-20895 (2021).
  6. Wang, X., et al. Machine learning-enabled risk prediction of chronic obstructive pulmonary disease with un-balanced data. Comput Methods Programs Biomed. 230, 107340(2023).
  7. Non-invasive diagnosis of COPD with E-nose using XGBoost algorithm. Binson, V. A., et al. Proc Int Conf Adv Comput Commun Embedded Secure Syst, , 297-301 (2021).
  8. Feng, Y., et al. Predicting chronic obstructive pulmonary disease (COPD) with optimized machine learning via leveraging comparative analysis of XGBoost and CatBoost. J Ambient Intell Humaniz Comput. 16 (4), 613-627 (2025).
  9. Binson, V. A., Subramoniam, M., Mathew, L. Detection of COPD and lung cancer with electronic nose using ensemble learning methods. Clin Chim Acta. 523, 231-238 (2021).
  10. Boers, E., et al. Forecasting the global economic and health burden of COPD from 2025 through 2050. Chest J. , (2025).
  11. Lones, M. A. Avoiding common machine learning pitfalls. Patterns (N Y). 5 (10), 101046(2024).
  12. Patharkar, A., Cai, F., Al-Hindawi, F., Wu, T. Predictive modeling of biomedical temporal data in healthcare applications: Review and future directions. Front Physiol. 15, 1386760(2024).
  13. Prater, R., Hanne, T., Dornberger, R. Generalized performance of LSTM in time-series forecasting. Appl Artif Intell. 38 (1), 2377510(2024).
  14. Lima Marinho, T., do Nascimento, D. C., Pimentel, B. A. Optimization on selecting XGBoost hyperparameters using meta-learning. Expert Syst. 41 (9), e13611(2024).
  15. Jang, Y. Feature-based ensemble modeling for addressing diabetes data imbalance using the SMOTE, RUS, and random forest methods: A prediction study. Ewha Med J. 48 (2), e32(2025).
  16. Tian, H., Yuan, H., Yan, K., Guo, J. A cosine adaptive particle swarm optimization based long-short term memory method for urban green area prediction. PeerJ Comput Sci. 10, e2048(2024).
  17. Johnston, H., Nair, N., Du, D. Estimating calibrated risks using focal loss and gradient-boosted trees for clinical risk prediction. Electronics (Basel). 14 (9), 1838(2025).
  18. Del Chicca, S., et al. Wearable and thermal drift-compensated monitoring system based on fiber bragg grating sensors for a 3D-printed foot prosthesis. Sensors (Basel). 25 (3), 885(2025).
  19. Wu, X., et al. Optimizing recurrent neural networks: A study on gradient normalization of weights for enhanced training efficiency. Appl Sci (Basel). 14 (15), 6578(2024).
  20. Agarwal, M., Anand, S., Patro, M., Gothi, D. Early versus non-early desaturation during 6MWT in COPD patients: A follow-up study. Lung India. 40 (3), 235-241 (2023).
  21. Thölke, P., et al. Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data. Neuroimage. 277, 120253(2023).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

XGBoost