Исследовательская статья

Ранняя диагностика астматического заболевания на основе вычислительного интеллекта: исследование саудовского случая

DOI:

10.3791/70040

16 июня 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Текущее исследование рассматривает несколько алгоритмов машинного обучения на саудовском наборе данных для выявления астмы. В отличие от передовых методов, использующих машинное обучение на клинических наборах данных для диагностики астмы, предлагаемая схема обеспечивает более высокую эффективность с улучшением точности постановки диагноза на 3,9%.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Согласно исследованиям, выявлено увеличение числа хронических заболеваний, включая астму. Количество пациентов с астмой в Саудовской Аравии вызывает беспокойство из-за погодных условий и образа жизни, особенно в постпандемичную эпоху. Он требует решения для снижения числа инфекций путём разработки интеллектуальной системы для раннего выявления астмы, тем самым предотвратив заболевание или обеспечив раннее лечение. В этом исследовании машинное обучение использовалось для разработки инструментов для отслеживания симптомов астмы на ранних стадиях. Хотя ранее предпринимались различные попытки применения машинного обучения для прогнозирования возникновения астмы. Тем не менее, сосредотачивание на выявлении заболевания на стадии до появления симптомов, особенно в контексте Саудовской Аравии, остаётся относительно недооценённой областью. Набор данных для текущего исследования был получен в Университетской больнице короля Фахада в Даммаме, Саудовская Аравия, и включал стандартные тесты, проводимые пациентам, включая анализы крови, вирусные и биохимические тесты. Набор данных содержит 17 значимых признаков и информацию о 328 пациентах с астмой: 165 положительных, 163 отрицательных. Методы, выбранные для применения здесь, включают случайные леса (RF), искусственные нейронные сети (ANN), поддерживающие векторные машины (SVM) и наивные байесов (NB). Каждый из этих методов был выбран на основе своих отличительных черт. Экспериментальные результаты показали, что методы RF, SVM и ANN показали 94%, что является самой высокой точностью, и улучшило современный уровень на 3,9%. Стоит отметить, что девять из семнадцати возможных признаков были использованы для достижения вышеуказанной точности. Несмотря на то, что RF, SVM и ANN достигают одинаковой точности, ANN имеет более высокую стоимость ошибок. Таким образом, RF и SVM превосходят в зависимости от закономерности результатов, и поэтому их рекомендуют для этой задачи.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Проведя обширные исследования, учёные заметили, что хронические заболевания становятся всё болеераспространёнными 1. Астма — это хроническое воспалительное заболевание дыхательных путей, характеризующееся повторяющимися эпизодами одышки и свистящего дыхания. Распространённость астмы варьируется по всему миру — от 1 до 20% как у детей, так и у взрослых, затрагивая миллионы людей повсему миру 2. Эти масштабные изменения связаны с экологическими изменениями, включая те, что происходит в разных странах, а также с использованием различных инструментов оценки и разнообразных эпидемиологических определений астмы. Астма имеет относительно низкую смертность по сравнению с рядом других известных хронических заболеваний2. Однако по сообщениям, уровень астмы в Королевстве Саудовская Аравияувеличивается на 3,4.

Астма — это хроническое воспалительное состояние, приводящее к сужению просвета. Сужение авиационного маршрута вызвано расширением выбросов биологических жидкостей, а также утолщением делителей бронхов из-за отёка, субэпителиального фиброза и гипертрофии гладкой мышцы. Патофизиологические аппараты, управляемые различными типами клеток, включая иммунные, использовались для оценки этихсостояний 5. Из-за суровых погодных условий и преимущественно образа жизни в помещении в Саудовской Аравии астма является одним из самых распространённых хронических заболеваний. Несколько исследований показали подавляющий уровеньастмы 6. Болезнь стала серьёзной проблемой, требующей системы раннего реагирования, чтобы снизить количество случаев и сделать возможным раннее медитирование для предотвращения или вылечения болезни на более ранней стадии.

В отличие от отдельных людей, астма оказывает глубокое влияние на сообщества и семьи. Если не контролировать, он накладывает суровые ограничения на жизнь пациента и мешает ему заниматься многими повседневными делами. В Саудовской Аравии суровые погодные условия, включая жаркую атмосферу, массовые песчаные бури и чрезмерное использование внутренних систем кондиционирования и охлаждения, являются значительными факторами развития астмы. Саудовское торакальное общество (STS) предприняло заметные усилия для обеспечения лучших лекарств отреспираторных инфекций 7. Однако для снижения уровня заражения необходим проактивный диагноз астмы, особенно в постпандемичном (COVID-19) сценарии. Также было сделано вывод, что семейный анамнез, курение и аллергический ринит являются одними из самых значимых факторов риска развития астмы среди взрослых Саудовской Аравии. Были рекомендованы дополнительные исследования для изучения других факторов, заложивших основу исследования.

В данном исследовании, учитывая предыдущие исследования по диагностике астмы, цель — повысить точность диагностики. Предлагаемые методы, включая случайный лес (RF), искусственную нейронную сеть (ANN), машину опорного вектора (SVM) и наивный байесовый метод (NB), использовались в предыдущих исследованиях, что дало заметное улучшение результатов диагностики. Например, исследователи использовали ANN, SVM и NB в исследованиях 8,9,10. В текущем исследовании были изучены методы машинного обучения, которые помогают служить системой раннего предупреждения, которая обнаруживает даже незначительные признаки астмы на самых ранних стадиях (предсимптоматической стадии). Распространённость астматических заболеваний в Саудовской Аравии, особенно в постпандемичную эпоху, включая такие факторы, как домашний образ жизни из-за суровых погодных условий, вентиляционные каналы и песчаные бури, являются одними из основных факторов. Однако нет значимых исследований, изучающих ключевые факторы, наблюдавшиеся в недавнем прошлом. Чтобы восполнить этот пробел в исследовании, текущее исследование направлено на изучение роли машинного обучения в раннем выявлении астмы среди взрослых в Саудовской Аравии. Кроме того, основная цель — достичь максимальной точности с минимальным количеством признаков. Хотя в прошлом были заметные попытки использовать машинное обучение для прогнозирования присутствия астмы 8,9,10. Текущее исследование направлено на использование саудовского набора данных, впервые полученного в государственной больнице восточной провинции, с акцентом на раннюю диагностику заболевания (превентивная диагностика). Машинное обучение (ML) признано методом извлечения знаний из собранныхданных 11,12. Он обеспечивает точность предсказания, достигаемая в процессе обучения предыдущих экземпляров с использованием различных методов машинного обучения. ML охватывает множество методов, алгоритмов и стратегий для решения аналитических и прогнозных задач в широких медицинских областях, таких как раннее выявление существования заболеваний13,14.

Было проведено несколько исследований для прогнозирования астматического заболевания с использованием различных методов. Исследователи разработали искусственную нейронную сеть (ANN) для классификации астмы в зависимости от динамических и статических тестовпациентов 8. Измеряемые параметры спирометрии, импульсной осциллометрии (IOS), аускультации, результатов аллергии и информации о симптомах используются в ANN. Определённая информация позволяет ANN предложить соответствующую классификацию астмы. Аналогично, учёные провели исследование, направленное на решение проблем диагностики заболеванийгрудной клетки 7. Для диагностики заболеваний грудной клетки, таких как астма, использовались аппараты поддержки векторов (SVM) и адаптивные методы SVM (ASVM). Наилучшая точность классификации всех заболеваний грудной клетки была достигнута с помощью метода ASVM. Исследователи использовали несколько структур нейронных сетей, таких как многослойная NN (MLNN) с алгоритмом обратного распространения (BPA) с одним и двумя скрытыми слоями, вероятностная NN (PNN), квантование по обучающим векторам (LVQ) и общая регрессия NN (GRNN), для диагностики заболеваний грудной клетки, включаяастму 15. Кроме того, некоторые провели сравнительное исследование, направленное на диагностику заболеваний грудной клетки с помощью искусственной иммунной системы (AIS). Упомянутые исследования реализовали различные структуры диагностики заболеваний грудной клетки с использованием различных наборов данных. При астме наивысший результат был достигнут с помощью AIS с общей точностью 90,91%16. Кроме того, исследователи изучали эффективность глубокого NN (DNN) для повышения точности диагностики астмы и сравнивали прогнозные результаты различных алгоритмов машинного обучения, особенно с логистической регрессией и SVM. Исследование показало, что эмпирический тест с использованием модели признаков астмы более эффективен для точной диагностикиастмы 9. Другое исследование продемонстрировало значительную возможность машинного обучения с использованием данных телемониторинга для прогнозирования обострений астмы до их возникновения с помощью выбранных методов машинного обучения, таких как SVM и Naïve Bayes, для реализации своегоэксперимента 10.

Кроме того, исследователи применяли несколько методов машинного обучения для превентивной диагностики болезни Альцгеймера (AD), включая SVM, k-NN, адаптивный бустинг (AdaBoost) и экстремальный градиентный бустинг (XGBoost)17. Учёные также провели исследование для предварительной диагностики диабета, изучая четыре подхода машинного обучения: NB, SVM, K-NN и ANN. Три основных показателя саудовского набора показали наивысшую среднюю точность — 68%. Эффективность методов измерения сравнивалась на основе точности, точности, отзыва и результата F1. ANN показал наивысшую точность классификации — 77,5%18. Аналогично, та же группа исследователей проводила эксперименты с использованием четырёх методов классификации — а именно NB, SVM, K-NN и ANN — для превентивной диагностики хронической болезни почек, применяемых к саудовскому наборуданных 19. Кроме того, авторы провели исследование для примитивной диагностики рака щитовидной железы с помощью четырёх методов машинного обучения: ANN, SVM, RF и NB. Используя 14 особенностей саудовского набора данных, авторы получили наивысшую среднюю точность — 95%. Результаты методов измерения сравнивались с использованием точности, точности, отзыва и результата F1. RF достигла самой высокой точности классификации — 90,91%20. Исследователи также провели два исследования, которые дали впечатляющие результаты в проактивной диагностике ревматоидного артрита. Несколько методов машинного обучения, таких как SVM, логистическая регрессия (LR) и AdaBoost, были включены в шорт-лист и использовались как кандидатские техники для голосования. Изначально использовался один набор данных, а другой сбалансировался с помощью SMOTE. Новая техника голосования с ансамблем была протестирована двумя последовательными методами выбора признаков. А именно, прямой и обратный выбор используется для поиска лучшего подмножества пространства признаков, которое содержит наивысшие показатели для каждой техники. Используя 30 признаков исходных данных и технику последовательного прямого выбора признаков, полученные проценты были многообещающими: точность, запоминание и точность составляли соответственно 94,03%, 96% и 93,51%21. Аналогично, другие интеллектуальные методы в медицине и смежных областях можно найти во многихисследованиях 22,23,24,25,26.

Предлагаемые методы в этой работе — RF, SVM, ANN и NB благодаря выдающимся результатам для аналогичных задач. В текущем исследовании результаты получены в ходе экспериментов. После различных этапов оптимизации и выбора признаков показано, что предлагаемые методы являются перспективными для диагностики астмы с использованием целевого набора данных.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом разделе описываются алгоритмы машинного обучения, изучаемые в предложенном подходе к диагностике астмы. Критерии и причины выбора предлагаемого метода основаны на всестороннем обзоре литературы и долгой истории работы с превентивной диагностикой ряда хронических заболеваний 27,28,29,30,31. Эти алгоритмы дали многообещающие результаты. Все материалы и инструменты, использованные в этом исследовании, перечислены в Таблице материалов.

Опорные векторные машины (SVM)
Алгоритм SVM является одним из самых успешных алгоритмов в области распознавания образов и классификации32. Используется бинарная классификация, где обучающий набор векторов классифицируется на два класса. Он относится к семейству алгоритмов супервизируемого обучения, где желаемый результат генерируется поднадзором 32. По сравнению с другими алгоритмами классификации в машинном обучении, SVM обеспечивает лучшие результаты по классификации. Поэтому он широко применяется во многих приложениях, таких как распознавание речи, лица и почерка. Кроме того, SVM применяется в различных областях, включая прогнозирование заболеваний и прогнозирование запасов. Кроме того, из-за своей нечувствительности к шуму или перенагону, SVM может обрабатывать несбалансированные данные, что является типичным случаем в медицинской диагностике, где число положительных случаев меньше, чемотрицательных 32.

В классификации SVM разделяет два класса, рисуя границу решения, в которой может прогнозировать метки, различая один или несколько векторовпризнаков 32. Граница принятия решения называется гиперплоскостью, которая находится дальше всего от ближайших точек данных каждого класса. Эти точки называются опорными векторами. На рисунке 1 показаны некоторые кандидатные гиперплоскости в линейно сепарабельных данных. Уравнение 1 демонстрирует уравнение гиперплоскости, а уравнения 2 и 3 показывают элементы, расположенные выше и подплоскостью 32:

figure-protocol-1Уравнение гиперплоскости (1)

Здесь w — вектор, представляющий вес, x — вектор, представляющий вход, а b. — потенциальное смещение.

figure-protocol-2Для всех j такие, что figure-protocol-3 = +1 (2)

figure-protocol-4Для всех i, таких что figure-protocol-5 = -1 (3)

figure-protocol-6
Рисунок 1: Типичный SVM с двумя разделяемыми классами. Этот рисунок визуализирует типичный SVM с двумя разделяемыми классами. Сокращения; SVM = поддерживающая векторная машина. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Искусственная нейронная сеть (ИНС)
ANN — это метод вычислительного интеллекта в мягких вычислениях, который имитирует функциональность человеческой мозговой системы. У него огромное количество взаимосвязанныхнейронов 33. Он входит в число алгоритмов контролируемого машинного обучения, которые могут учиться на примерных наборах данных и улучшать их производительность через обучение, генерируя полезныерезультаты 33. Архитектура ANN состоит из нескольких уровней: входного слоя, скрытого и выходного. Каждый из них состоит из множества связанныхнейронов 33.

Нейрон, получающий данные снаружи, выполняет обработку и затем отправляет данные на другой слой — входной слой. Цель входного слоя — не выполнять сложные процессы с данными; Это просто дублирование входного значения и отправка его на следующий уровень33. Выходной слой содержит нейроны, которые генерируют данные для пользовательской программы. Между этими двумя слоями скрытый слой расположен как необязательный слой для выполнения вычислительных процессов. Скрытый слой служит промежуточным слоем, который принимает входные данные от входных нейронов, выполняет математические операции над ними, а затем передаёт результаты другомуслою 33. Рисунок 2 показывает архитектуру ANN.

figure-protocol-7
Рисунок 2: Обратная передача и обратное распространение в типичной структуре ШН. Этот рисунок визуализирует прямую сеть с обратным распространением в типичной структуре ANN. Сокращения; ANN = искусственная нейронная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Feed-forward NN — это подход, который хранит входные данные в прямом направлении. В противоположном направлении процесс обратного распространения происходит, когда веса нейронной сети обновляются в обратном подходе для получения градиентов, используя нейронную сеть с несколькими скрытыми слоями. Недостатком этого процесса является исчезновение или взрыв градиентов. Функция активации сохраняет нелинейные характеристики их ANN, что позволяет ей изучать детальные связи между входными и выходными данными, как это называется универсальным приближением. Рисунок 3 демонстрирует основную архитектуру искусственной нейронной сети. Он также иллюстрирует функцию активации, применяемую к выходу каждого нейрона, которая представляет собой сумму всех входных весов. Смещение сохраняет сумму всех весов и включено в входнейрона 33.

figure-protocol-8
Рисунок 3: Типичный одноперцептронный нейрон для ИНН. На этом рисунке изображён один нейрон перцептрона типичного АНН. Сокращения; ANN = искусственная нейронная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Случайный лес (RF)
RF — один из ведущих алгоритмов классификации в машинном обучении. Он состоит из нескольких отдельных деревьев решений, работающих вместе как ансамбль и выпускающихитоговый результат 29. Основная концепция успешной работы RF заключается в том, что он состоит из множества умеренно некоррелированных деревьев (формирующих лес), которые выступают в роли комитета. Таким образом, они будут эффективнее, чем все модели, работающие независимо34. Алгоритм RF был в первую очередь разработан группойисследователей 35. Чтобы лучше понять, как работает RF, важно разобраться в деревахрешений 35. Он одинаково применим как к дискретным, так и к непрерывным задачам, в частности к классификации, обнаружению и регрессии соответственно36. Чем больше деревьев в лесу, тем ближе к точности будет результат, но с дополнительной вычислительнойсложностью 36, как показано на рисунке 4.

figure-protocol-9
Рисунок 4: Схема случайного леса. Этот рисунок демонстрирует схему типичного случайного леса. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Наивный Байес (NB)
Наивный Байес (NB) — это алгоритм классификации, который использует теорему Байеса для классификации объектов. Это очень популярный метод, применяемый в большинстве медицинских областей, особенно для диагностики симптомов. В этом методе объекты принимают основные предположения независимости, что делает связь между атрибутами независимой друг от друга. Из-за своей наивности он входит в число самых простых алгоритмов классификации в машинномобучении 37. На основе данного набора данных NB определяет вероятность получения конкретного результата. Модель NB простая в разработке, способна работать с существенными данными и представляет собой сложный и вычислительно лёгкий алгоритм. Кроме того, он выполняет скромные функции, что приводит к числовым и номинальным знаниям. Прочность и простое интерпретирование обучения также являются потенциальными преимуществами классификатора NB. Если он применяется к ограниченному объёму данных, результат будет относительно неточен. Это зависит от огромных записей, которые считаются менее точными по сравнению с другимиметодами 37.

Статистический анализ
Статистический анализ набора данных помогает визуализировать и понять закономерность набора данных для более эффективной предварительной обработки и моделирования. В этом отношении были выполнены следующие шаги. Во-первых, чтобы выяснить, являются ли демографические характеристики дисбалансированы между положительными и отрицательными группами, включая возраст и пол, проводится статистический анализ на программном обеспечении SPSS. Во-вторых, собрать количественные данные с помощью независимого t-теста выборки, если нормальное распределение и однородность дисперсии были выполнены, либо тест Мэн-Уитни U. Наконец, категориальные данные были собраны с помощью теста хи-квадрат или точного тестаФишера 38.

Реализация
Описание набора данных
Набор данных для текущего исследования был получен в Университетской больнице короля Фахада в Даммаме, Саудовская Аравия, после одобрения институциональным обзорным советом (IRB). Указанные данные были собраны по стандартным тестам среди пациентов. Астма часто диагностируется с помощью стандартных тестов у пациентов, включая анализы крови, вирусы и биохимические тесты. Для текущего исследования пациенты и здоровые контрольные группы (HC) были набраны и клинически оценены на основе стандартных сортировок и патологических тестов, проведённых в больнице по рекомендации врачей отделения. Критерии включения и исключения были определены врачами на основе лабораторных результатов. Впоследствии для исследования были предоставлены квалифицированные и проверенные данные. Набор данных содержит семнадцать характеристик, которые доступны для всех пациентов с астмой. В наборе данных представлено 328 случаев, из которых 165 — положительные на астму и 163 — на астму. Распределение пола и возраста между положительными и отрицательными группами приведено в Таблице 1.

ИнстанцииПоложительноОтрицательно
Мужской14510738
Женский18357126
Total328164164

Таблица 1: Распределение пола в наборах данных. В этой таблице показано распределение полов в наборе данных.

Таблица 2 показывает возрастное распределение между двумя классами.

Возрастной диапазонВозрастное распределение (класс = 1)Возрастное распределение (класс = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Таблица 2: Возрастное распределение наборов данных. В этой таблице показано возрастное распределение в наборе данных.

Возраст (p < 0,001 в тесте Man-Whitney U) и пол (p < 0,001 в тесте Chi-квадрат) были несбалансированы между положительной и отрицательной группами. Однако в процессе найма нет предвзятости. Считается, что несбалансированное распределение может отражать уникальное возрастное распределение этой когорты пациентов. Критерии включения включают клинические факторы наличия и отсутствия заболевания; Учитываются демографические данные, включая пол, возраст и местное население. Кроме того, данные были собраны по информированному согласию. Возраст и пол включены в набор функций, как указано ниже. Однако явные возрастные и гендерные анализы не входят в область исследования и остаются в качестве будущей работы.

Набор данных хранится в виде числовых значений. Столбец «Класс» содержит значения 0 и 1, где 0 обозначает «Нормального пациента», а 1 — «Пациента с астмой».
В этом отношении использовались следующие семнадцать атрибутов:
Класс: (0 = «Нормальный», 1 = «Пациент с астмой»)

1. возраст в годах (ВОЗРАСТ)

2. пол (1 = мужчина, 0 = женщина): ПОЛ

3. Базофилы (BASO)

4. Эозинофилы (EOS)

5. Гематокрит (ГКТ)

6. Гемоглобин (HGB)

7. Лимфоциты (ЛИМ)

8. Средний корпускулярный гемоглобин (MCH)

9. Средняя концентрация корпускулярного гемоглобина (MCHC)

10. Средний корпускулярный объём (MCV)

11. Моноциты (МОНО)

12. Средний объём тромбоцитов (MPV)

13. Функция нейтрофилов (NEUT)

14. Количество тромбоцитов (PLATELET_COUNT)

15. Количество эритроцитов (эритроциты)

16. Ширина распределения эритроцитов (RDW)

17. Лейкоциты (лейкоциты)

Статистические особенности набора данных
Для лучшего понимания статистический анализ набора изображен в следующихтаблицах 38. Таблица 3 показывает средние, медианные, стандартные отклонения, максимум и минимальные значения рассматриваемого набора данных.

ЗлойМедианаСтандартное отклонениеМаксМин
ВОЗРАСТ39.13618.136932
ГЕНДЕР0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
МОНО1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
РБК5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Класс0.50.50.500810

Таблица 3: Статистические особенности набора данных. В этой таблице перечислены статистические характеристики данных.

Кроме того, в таблице 4 показаны полученные коэффициенты корреляции между каждым атрибутом и атрибутом класса. Его значения находятся между 0 (наименее коррелированным) и 1 (наиболее коррелированным). Он добавляется в качестве предварительного статистического анализа для объяснения характеристик набора данных. MPV, гендер, HGB, MCHC и возраст — одни из самых значимых особенностей.

Пары атрибутовКоэффициент корреляции
ВОЗРАСТ0.212473
ГЕНДЕР0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
МОНО0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
РБК0.030787
RDW0.025979
WBC0.148842
Класс1

Таблица 4: Корреляция с атрибутом класса. В этой таблице показана корреляция между атрибутами (признаками) и атрибутом класса.

Экспериментальная установка
В текущем исследовании для предварительной обработки собранного набора данных используется язык программирования Python. Из-за человеческой ошибки при вводе и выборе данных отсутствуют конкретные значения. Для обработки отсутствующих значений в наборе данных использовались методы импутации. Это делается путём замены пропущенных значений на среднее значение атрибута. Благодаря своей простоте, совместимости моделей и сохранению средних значений выборки, как обсуждалось с медицинскими специалистами. Кроме того, выбор признаков выполняется с использованием коэффициентов корреляции для ранжирования атрибутов. Признаки с более высокими значениями корреляции были выбраны для анализа вместе с полным набором признаков. Библиотеки Python использовались для реализации предлагаемого подхода, настройки гиперпараметров и получения результатов. Выбор и устранение признаков выполнялись методом выбора атрибутов для выявления групп признаков с наивысшей точностью. Кроме того, Python использовался для оценки точности с помощью 10-кратной перекрёстной валидации и методов оценки прямого коэффициента разбивания, как определённо в заданныхуравнениях 39,40. Наконец, среднее значение результатов всех методов оценки было рассчитано для сравнения использованных методов и определения метода с наилучшей средней точностью38. Кроме того, матрицы путаницы были созданы с использованием оптимальных параметров SVM, ANN, RF и NB. Затем было проведено сравнение соотношений ложноположительных (FP), ложноотрицательных (FN), истинных положительных (TP) и истинных отрицательных (TN) с помощью расчёта F1-балла, который является эффективной мерой для сравнения лучшегометода 41,42.

Метрики оценки
Для оценки эффективности предлагаемого подхода рассматриваются четыре хорошо известных метрики эффективности. А именно: точность, точность, отзыв и результат Формулы-1. Точность классификации является основным показателем, поскольку процент правильно классифицированных экземпляров рассчитывается для каждого случая. Точность — это общее количество ожидаемых очков TP. Отзыв — это количество TP больше, чем каждый реальный положительный результат. Результаты F1 для каждого класса. В зависимости от возможностей выходов получаются следующиеметрики 43,44,45:

Истинно положительный результат (TP): результат правильного диагноза астмы.

Ложноположительный результат (FP): результат неправильного диагноза астмы.

Истинно отрицательный (TN): результат правильных случаев, диагностированных как не астма.

Ложноотрицательный результат (FN): результат неправильного диагноза как неастма.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Стратегия оптимизации
Для определения оптимальных параметров для каждого из предложенных подходов применялась техника поиска по сетке. Возможные значения конкретных параметров размещаются в методе поиска по сетке. Таким образом, он может достичь максимальной производительности для повышения точности.

Рисунки 5–7 показывают результаты метода поиска по сетке для всех четырёх предложенных подходов и процедуру реализации на наборе данных с помощью ведущих восемнадцати атрибутов. Рисунок 5 показывает точность SVM, полученные при различных значениях параметров. Входные значения для стоимости и гаммы, соответствующих нескольким типам ядер, следующие:

Типы ядер: линейное, радиальное, сигмовидное и полиномиальное.

Гамма: 0,001 и 0,0001.

Стоимость: 1, 10, 100 и 1000.

figure-protocol-13
Рисунок 5: SVM с разными типами стоимости и гаммы. Этот рисунок демонстрирует поведение SVM с разными типами стоимости и гаммы. Сокращения; SVM = поддерживающая векторная машина. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Для RF систематически вводные значения, указанные на рисунке 6 , следующие:

Имена параметров вместе с соответствующими значениями приведены ниже:

Количество функций: 'auto', 'sqrt'.

Максимальная глубина: 1, 3, 5, 7.

Разделённые MIN сэмплы: 2, 3, 4, 5.

MIN-образцы листа: 2, 3, 4, 5.

figure-protocol-14
Рисунок 6: RF с разными значениями глубины и минимальным содержанием образцов. Этот рисунок показывает поведение радиочастот с разной глубиной и минимальными значениями образца листьев. Сокращения; RF = случайный лес. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Для ANN аналитические входные значения указаны на рисунке 7.

Имена параметров вместе с соответствующими значениями следующие:

Скрытые размеры слоёв: (50, 50, 50), (50, 100, 50) и (100,).
Активация: 'tanh' и 'relu'.
Решатель: 'sgd' и 'adam'.
Альфа: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 и 0,05.
Скорость обучения: «постоянная» и «адаптивная».

figure-protocol-15
Рисунок 7: ANN с разными альфа-значениями и скрытыми размерами слоев. Этот рисунок показывает поведение ANN с разными альфа-значениями и скрытыми размерами слоев. Сокращения; ANN = искусственная нейронная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

КлассификаторПараметрЦенность
SVMГамма0.0001
Тип ядра'rbf'
Стоимость 'C'10
Случайное состояние42
RFМаксимальная глубина3
Мин пробовал лист2
Сплит мин-сэмплов2
Случайное состояние42
ЭННАктивация'relu'
альфа0.001
размер скрытого слоя(50,50,50)
Скорость обучения«постоянный»
Решатель'Адам'
Случайное состояние42

Таблица 5: Сводка оптимальных параметров для предлагаемых классификаторов. В этой таблице представлены оптимальные параметры, полученные для предложенных классификаторов.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Влияние выбора признаков
В текущем исследовании для выбора признака используется метод корреляционного коэффициента на основе рекурсивного устранения признаков. Коэффициент корреляции используется для упорядочения признаков от самого высокого к наименьшему в соответствии с их значениями корреляции. Рекурсивное устранение признаков используется для помощи в выборе подходящих признаков для модели, поскольку постепенно устраняет самые слабые признаки, пока не останется т...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В текущем исследовании используются несколько алгоритмов машинного обучения, включая SVM, ANN, RF и NB. Проведя несколько экспериментов, тонкой настройки гиперпараметров и выбора признаков, было установлено, что SVM, ANN и RF демонстрируют выдающуюся диагностическую точность 94%, тогда как NB сравнительно ниже — 83,33%. Результаты были проверены с помощью 10-кратной перекрёстной валидации и оптимизированного выбора признаков, а также лучшего коэффициента разделения. Согласно приведённым ...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Набор данных получен из больницы по номеру IRB-2020-09-429. Авторы заявляют, что у них нет конфликтов интересов для публикации в текущем исследовании. Исследование было добавлено в репозиторий Research Square в виде препринта со следующейцитатой 50.

ВКЛАД АВТОРОВ:
Концептуализация проводилась S.O., M.I.B.A. и A.R.; Надзор осуществлялся S.O., M.I.B.A. и J.A.; Оригинальный черновик выполняли S.S.A., E.A. и Z.A.; Реализация осуществлялась S.A.A., Y.A. и R.A.; Валидацию проводили J.A., M.A. и S.D.; Кураторство данных осуществлялось A.B., Y.A., E.A. и Z.A.; Рецензирование и редактирование выполняли A.R., S.D. и A.B.; Администрирование проекта осуществлялось A.R., S.D. и M.A., а привлечение финансирования осуществлялось A.B., S.D. и A.R.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы хотели бы выразить признательность поддержке медицинских специалистов в подтверждении результатов исследования.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Excel 365MicrosoftExcel 365Используется для хранения необработанных данных в формате csv
Laptop/MachineDellXPS9320RAM 16GB, 12th Gen Intel(R) Core(TM) i7-1260P
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Используется для создания и обучения моделей 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Используется для создания и обучения моделей 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Используется для создания и обучения моделей 
Python 3.12.12Google colab Notebook Python 3.12.12Используется для создания и обучения моделей 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Используется для создания и обучения моделей 
SPSS IBM, USAВерсия 26.0Используется для статистического анализа
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Используется для создания и обучения моделей 

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи