$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом разделе описываются алгоритмы машинного обучения, изучаемые в предложенном подходе к диагностике астмы. Критерии и причины выбора предлагаемого метода основаны на всестороннем обзоре литературы и долгой истории работы с превентивной диагностикой ряда хронических заболеваний 27,28,29,30,31. Эти алгоритмы дали многообещающие результаты. Все материалы и инструменты, использованные в этом исследовании, перечислены в Таблице материалов.
Опорные векторные машины (SVM)
Алгоритм SVM является одним из самых успешных алгоритмов в области распознавания образов и классификации32. Используется бинарная классификация, где обучающий набор векторов классифицируется на два класса. Он относится к семейству алгоритмов супервизируемого обучения, где желаемый результат генерируется поднадзором 32. По сравнению с другими алгоритмами классификации в машинном обучении, SVM обеспечивает лучшие результаты по классификации. Поэтому он широко применяется во многих приложениях, таких как распознавание речи, лица и почерка. Кроме того, SVM применяется в различных областях, включая прогнозирование заболеваний и прогнозирование запасов. Кроме того, из-за своей нечувствительности к шуму или перенагону, SVM может обрабатывать несбалансированные данные, что является типичным случаем в медицинской диагностике, где число положительных случаев меньше, чемотрицательных 32.
В классификации SVM разделяет два класса, рисуя границу решения, в которой может прогнозировать метки, различая один или несколько векторовпризнаков 32. Граница принятия решения называется гиперплоскостью, которая находится дальше всего от ближайших точек данных каждого класса. Эти точки называются опорными векторами. На рисунке 1 показаны некоторые кандидатные гиперплоскости в линейно сепарабельных данных. Уравнение 1 демонстрирует уравнение гиперплоскости, а уравнения 2 и 3 показывают элементы, расположенные выше и подплоскостью 32:
Уравнение гиперплоскости (1)
Здесь w — вектор, представляющий вес, x — вектор, представляющий вход, а b. — потенциальное смещение.
Для всех j такие, что
= +1 (2)
Для всех i, таких что
= -1 (3)

Рисунок 1: Типичный SVM с двумя разделяемыми классами. Этот рисунок визуализирует типичный SVM с двумя разделяемыми классами. Сокращения; SVM = поддерживающая векторная машина. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Искусственная нейронная сеть (ИНС)
ANN — это метод вычислительного интеллекта в мягких вычислениях, который имитирует функциональность человеческой мозговой системы. У него огромное количество взаимосвязанныхнейронов 33. Он входит в число алгоритмов контролируемого машинного обучения, которые могут учиться на примерных наборах данных и улучшать их производительность через обучение, генерируя полезныерезультаты 33. Архитектура ANN состоит из нескольких уровней: входного слоя, скрытого и выходного. Каждый из них состоит из множества связанныхнейронов 33.
Нейрон, получающий данные снаружи, выполняет обработку и затем отправляет данные на другой слой — входной слой. Цель входного слоя — не выполнять сложные процессы с данными; Это просто дублирование входного значения и отправка его на следующий уровень33. Выходной слой содержит нейроны, которые генерируют данные для пользовательской программы. Между этими двумя слоями скрытый слой расположен как необязательный слой для выполнения вычислительных процессов. Скрытый слой служит промежуточным слоем, который принимает входные данные от входных нейронов, выполняет математические операции над ними, а затем передаёт результаты другомуслою 33. Рисунок 2 показывает архитектуру ANN.

Рисунок 2: Обратная передача и обратное распространение в типичной структуре ШН. Этот рисунок визуализирует прямую сеть с обратным распространением в типичной структуре ANN. Сокращения; ANN = искусственная нейронная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Feed-forward NN — это подход, который хранит входные данные в прямом направлении. В противоположном направлении процесс обратного распространения происходит, когда веса нейронной сети обновляются в обратном подходе для получения градиентов, используя нейронную сеть с несколькими скрытыми слоями. Недостатком этого процесса является исчезновение или взрыв градиентов. Функция активации сохраняет нелинейные характеристики их ANN, что позволяет ей изучать детальные связи между входными и выходными данными, как это называется универсальным приближением. Рисунок 3 демонстрирует основную архитектуру искусственной нейронной сети. Он также иллюстрирует функцию активации, применяемую к выходу каждого нейрона, которая представляет собой сумму всех входных весов. Смещение сохраняет сумму всех весов и включено в входнейрона 33.

Рисунок 3: Типичный одноперцептронный нейрон для ИНН. На этом рисунке изображён один нейрон перцептрона типичного АНН. Сокращения; ANN = искусственная нейронная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Случайный лес (RF)
RF — один из ведущих алгоритмов классификации в машинном обучении. Он состоит из нескольких отдельных деревьев решений, работающих вместе как ансамбль и выпускающихитоговый результат 29. Основная концепция успешной работы RF заключается в том, что он состоит из множества умеренно некоррелированных деревьев (формирующих лес), которые выступают в роли комитета. Таким образом, они будут эффективнее, чем все модели, работающие независимо34. Алгоритм RF был в первую очередь разработан группойисследователей 35. Чтобы лучше понять, как работает RF, важно разобраться в деревахрешений 35. Он одинаково применим как к дискретным, так и к непрерывным задачам, в частности к классификации, обнаружению и регрессии соответственно36. Чем больше деревьев в лесу, тем ближе к точности будет результат, но с дополнительной вычислительнойсложностью 36, как показано на рисунке 4.

Рисунок 4: Схема случайного леса. Этот рисунок демонстрирует схему типичного случайного леса. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Наивный Байес (NB)
Наивный Байес (NB) — это алгоритм классификации, который использует теорему Байеса для классификации объектов. Это очень популярный метод, применяемый в большинстве медицинских областей, особенно для диагностики симптомов. В этом методе объекты принимают основные предположения независимости, что делает связь между атрибутами независимой друг от друга. Из-за своей наивности он входит в число самых простых алгоритмов классификации в машинномобучении 37. На основе данного набора данных NB определяет вероятность получения конкретного результата. Модель NB простая в разработке, способна работать с существенными данными и представляет собой сложный и вычислительно лёгкий алгоритм. Кроме того, он выполняет скромные функции, что приводит к числовым и номинальным знаниям. Прочность и простое интерпретирование обучения также являются потенциальными преимуществами классификатора NB. Если он применяется к ограниченному объёму данных, результат будет относительно неточен. Это зависит от огромных записей, которые считаются менее точными по сравнению с другимиметодами 37.
Статистический анализ
Статистический анализ набора данных помогает визуализировать и понять закономерность набора данных для более эффективной предварительной обработки и моделирования. В этом отношении были выполнены следующие шаги. Во-первых, чтобы выяснить, являются ли демографические характеристики дисбалансированы между положительными и отрицательными группами, включая возраст и пол, проводится статистический анализ на программном обеспечении SPSS. Во-вторых, собрать количественные данные с помощью независимого t-теста выборки, если нормальное распределение и однородность дисперсии были выполнены, либо тест Мэн-Уитни U. Наконец, категориальные данные были собраны с помощью теста хи-квадрат или точного тестаФишера 38.
Реализация
Описание набора данных
Набор данных для текущего исследования был получен в Университетской больнице короля Фахада в Даммаме, Саудовская Аравия, после одобрения институциональным обзорным советом (IRB). Указанные данные были собраны по стандартным тестам среди пациентов. Астма часто диагностируется с помощью стандартных тестов у пациентов, включая анализы крови, вирусы и биохимические тесты. Для текущего исследования пациенты и здоровые контрольные группы (HC) были набраны и клинически оценены на основе стандартных сортировок и патологических тестов, проведённых в больнице по рекомендации врачей отделения. Критерии включения и исключения были определены врачами на основе лабораторных результатов. Впоследствии для исследования были предоставлены квалифицированные и проверенные данные. Набор данных содержит семнадцать характеристик, которые доступны для всех пациентов с астмой. В наборе данных представлено 328 случаев, из которых 165 — положительные на астму и 163 — на астму. Распределение пола и возраста между положительными и отрицательными группами приведено в Таблице 1.
| Инстанции | Положительно | Отрицательно |
| Мужской | 145 | 107 | 38 |
| Женский | 183 | 57 | 126 |
| Total | 328 | 164 | 164 |
Таблица 1: Распределение пола в наборах данных. В этой таблице показано распределение полов в наборе данных.
Таблица 2 показывает возрастное распределение между двумя классами.
| Возрастной диапазон | Возрастное распределение (класс = 1) | Возрастное распределение (класс = 0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
Таблица 2: Возрастное распределение наборов данных. В этой таблице показано возрастное распределение в наборе данных.
Возраст (p < 0,001 в тесте Man-Whitney U) и пол (p < 0,001 в тесте Chi-квадрат) были несбалансированы между положительной и отрицательной группами. Однако в процессе найма нет предвзятости. Считается, что несбалансированное распределение может отражать уникальное возрастное распределение этой когорты пациентов. Критерии включения включают клинические факторы наличия и отсутствия заболевания; Учитываются демографические данные, включая пол, возраст и местное население. Кроме того, данные были собраны по информированному согласию. Возраст и пол включены в набор функций, как указано ниже. Однако явные возрастные и гендерные анализы не входят в область исследования и остаются в качестве будущей работы.
Набор данных хранится в виде числовых значений. Столбец «Класс» содержит значения 0 и 1, где 0 обозначает «Нормального пациента», а 1 — «Пациента с астмой».
В этом отношении использовались следующие семнадцать атрибутов:
Класс: (0 = «Нормальный», 1 = «Пациент с астмой»)
1. возраст в годах (ВОЗРАСТ)
2. пол (1 = мужчина, 0 = женщина): ПОЛ
3. Базофилы (BASO)
4. Эозинофилы (EOS)
5. Гематокрит (ГКТ)
6. Гемоглобин (HGB)
7. Лимфоциты (ЛИМ)
8. Средний корпускулярный гемоглобин (MCH)
9. Средняя концентрация корпускулярного гемоглобина (MCHC)
10. Средний корпускулярный объём (MCV)
11. Моноциты (МОНО)
12. Средний объём тромбоцитов (MPV)
13. Функция нейтрофилов (NEUT)
14. Количество тромбоцитов (PLATELET_COUNT)
15. Количество эритроцитов (эритроциты)
16. Ширина распределения эритроцитов (RDW)
17. Лейкоциты (лейкоциты)
Статистические особенности набора данных
Для лучшего понимания статистический анализ набора изображен в следующихтаблицах 38. Таблица 3 показывает средние, медианные, стандартные отклонения, максимум и минимальные значения рассматриваемого набора данных.
| Злой | Медиана | Стандартное отклонение | Макс | Мин |
| ВОЗРАСТ | 39.1 | 36 | 18.136 | 93 | 2 |
| ГЕНДЕР | 0.442 | 0 | 0.4974 | 1 | 0 |
| BASO | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| LYMP | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| МОНО | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| NEUT | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| РБК | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| Класс | 0.5 | 0.5 | 0.5008 | 1 | 0 |
Таблица 3: Статистические особенности набора данных. В этой таблице перечислены статистические характеристики данных.
Кроме того, в таблице 4 показаны полученные коэффициенты корреляции между каждым атрибутом и атрибутом класса. Его значения находятся между 0 (наименее коррелированным) и 1 (наиболее коррелированным). Он добавляется в качестве предварительного статистического анализа для объяснения характеристик набора данных. MPV, гендер, HGB, MCHC и возраст — одни из самых значимых особенностей.
| Пары атрибутов | Коэффициент корреляции |
| ВОЗРАСТ | 0.212473 |
| ГЕНДЕР | 0.423584 |
| BASO | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| LYMP | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| МОНО | 0.055476 |
| MPV | 0.564992 |
| NEUT | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| РБК | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| Класс | 1 |
Таблица 4: Корреляция с атрибутом класса. В этой таблице показана корреляция между атрибутами (признаками) и атрибутом класса.
Экспериментальная установка
В текущем исследовании для предварительной обработки собранного набора данных используется язык программирования Python. Из-за человеческой ошибки при вводе и выборе данных отсутствуют конкретные значения. Для обработки отсутствующих значений в наборе данных использовались методы импутации. Это делается путём замены пропущенных значений на среднее значение атрибута. Благодаря своей простоте, совместимости моделей и сохранению средних значений выборки, как обсуждалось с медицинскими специалистами. Кроме того, выбор признаков выполняется с использованием коэффициентов корреляции для ранжирования атрибутов. Признаки с более высокими значениями корреляции были выбраны для анализа вместе с полным набором признаков. Библиотеки Python использовались для реализации предлагаемого подхода, настройки гиперпараметров и получения результатов. Выбор и устранение признаков выполнялись методом выбора атрибутов для выявления групп признаков с наивысшей точностью. Кроме того, Python использовался для оценки точности с помощью 10-кратной перекрёстной валидации и методов оценки прямого коэффициента разбивания, как определённо в заданныхуравнениях 39,40. Наконец, среднее значение результатов всех методов оценки было рассчитано для сравнения использованных методов и определения метода с наилучшей средней точностью38. Кроме того, матрицы путаницы были созданы с использованием оптимальных параметров SVM, ANN, RF и NB. Затем было проведено сравнение соотношений ложноположительных (FP), ложноотрицательных (FN), истинных положительных (TP) и истинных отрицательных (TN) с помощью расчёта F1-балла, который является эффективной мерой для сравнения лучшегометода 41,42.
Метрики оценки
Для оценки эффективности предлагаемого подхода рассматриваются четыре хорошо известных метрики эффективности. А именно: точность, точность, отзыв и результат Формулы-1. Точность классификации является основным показателем, поскольку процент правильно классифицированных экземпляров рассчитывается для каждого случая. Точность — это общее количество ожидаемых очков TP. Отзыв — это количество TP больше, чем каждый реальный положительный результат. Результаты F1 для каждого класса. В зависимости от возможностей выходов получаются следующиеметрики 43,44,45:
Истинно положительный результат (TP): результат правильного диагноза астмы.
Ложноположительный результат (FP): результат неправильного диагноза астмы.
Истинно отрицательный (TN): результат правильных случаев, диагностированных как не астма.
Ложноотрицательный результат (FN): результат неправильного диагноза как неастма.
(4)
(5)
(6)
Стратегия оптимизации
Для определения оптимальных параметров для каждого из предложенных подходов применялась техника поиска по сетке. Возможные значения конкретных параметров размещаются в методе поиска по сетке. Таким образом, он может достичь максимальной производительности для повышения точности.
Рисунки 5–7 показывают результаты метода поиска по сетке для всех четырёх предложенных подходов и процедуру реализации на наборе данных с помощью ведущих восемнадцати атрибутов. Рисунок 5 показывает точность SVM, полученные при различных значениях параметров. Входные значения для стоимости и гаммы, соответствующих нескольким типам ядер, следующие:
Типы ядер: линейное, радиальное, сигмовидное и полиномиальное.
Гамма: 0,001 и 0,0001.
Стоимость: 1, 10, 100 и 1000.

Рисунок 5: SVM с разными типами стоимости и гаммы. Этот рисунок демонстрирует поведение SVM с разными типами стоимости и гаммы. Сокращения; SVM = поддерживающая векторная машина. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Для RF систематически вводные значения, указанные на рисунке 6 , следующие:
Имена параметров вместе с соответствующими значениями приведены ниже:
Количество функций: 'auto', 'sqrt'.
Максимальная глубина: 1, 3, 5, 7.
Разделённые MIN сэмплы: 2, 3, 4, 5.
MIN-образцы листа: 2, 3, 4, 5.

Рисунок 6: RF с разными значениями глубины и минимальным содержанием образцов. Этот рисунок показывает поведение радиочастот с разной глубиной и минимальными значениями образца листьев. Сокращения; RF = случайный лес. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Для ANN аналитические входные значения указаны на рисунке 7.
Имена параметров вместе с соответствующими значениями следующие:
Скрытые размеры слоёв: (50, 50, 50), (50, 100, 50) и (100,).
Активация: 'tanh' и 'relu'.
Решатель: 'sgd' и 'adam'.
Альфа: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 и 0,05.
Скорость обучения: «постоянная» и «адаптивная».

Рисунок 7: ANN с разными альфа-значениями и скрытыми размерами слоев. Этот рисунок показывает поведение ANN с разными альфа-значениями и скрытыми размерами слоев. Сокращения; ANN = искусственная нейронная сеть. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
| Классификатор | Параметр | Ценность |
| SVM | Гамма | 0.0001 |
| Тип ядра | 'rbf' |
| Стоимость 'C' | 10 |
| Случайное состояние | 42 |
| RF | Максимальная глубина | 3 |
| Мин пробовал лист | 2 |
| Сплит мин-сэмплов | 2 |
| Случайное состояние | 42 |
| ЭНН | Активация | 'relu' |
| альфа | 0.001 |
| размер скрытого слоя | (50,50,50) |
| Скорость обучения | «постоянный» |
| Решатель | 'Адам' |
| Случайное состояние | 42 |
Таблица 5: Сводка оптимальных параметров для предлагаемых классификаторов. В этой таблице представлены оптимальные параметры, полученные для предложенных классификаторов.