Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Ранняя диагностика гипотиреоза в Восточной провинции Саудовской Аравии с помощью методов вычислительного интеллекта

180 просмотров

DOI:

10.3791/70065

22 мая 2026 г.

В этой статье

Краткое содержание

В данном исследовании рассматриваются четыре алгоритма машинного обучения: K-ближайшие соседи (KNN), опорная векторная машина (SVM), усиление экстремального градиента (XGBoost) и классификатор мягкого голосования в проактивной диагностике гипотиреоза. Алгоритмы были включены в шорт-лист на основе критического обзора литературы и использовались на основе локально собранного набора данных из Саудовской Аравии.

Аннотация

Гипотиреоз — одно из самых распространённых, но недиагностированных заболеваний в Саудовской Аравии. Он чаще встречается у пожилых и беременных женщин, а также у пациентов с диабетом и апноэ сна. Гипотиреоз характеризуется недостаточным выработкой гормонов щитовидной железы, что при отсутствии лечения может привести к другим хроническим заболеваниям. По этой причине в исследовании предлагаются методы машинного обучения для превентивной диагностики этого заболевания, используя простой клинический набор данных из Саудовской Аравии. Учитывая размер данных, эта работа служит доказательством концепции. Алгоритмы, такие как KNN, SVM, градиентное усиление и классификатор ансамбля мягкого голосования, были выбраны за их перспективные результаты в проактивной диагностике гипотиреоза и сопутствующих заболеваний по сравнению с другими алгоритмами в литературе. Лучшей моделью стал классификатор мягкого голосования, достигший точности 94,7%. SVM, KNN и XGBoost достигли соответственно точности 94%, 93,42% и 92,1%. Эти результаты были получены с помощью 10-кратной перекрестной валидации и прямого последовательного выбора признаков.

Введение

Дисфункция щитовидной железы (ТД) — одно из самых распространённых хронических эндокринных заболеваний, с разной распространённостью в разныхпопуляциях. 1. Два самых распространённых заболевания щитовидной железы — это гипотиреоз и гипертиреоз. Гипотиреоз — это распространённое состояние, возникающее из-за недостаточной выработки гормонов щитовидной железы. Хотя обычно лечение можно контролировать, в тяжёлых случаях это может привести к смерти, если не лечить. Наиболее распространённые симптомы гипотиреоза у взрослых включают усталость, запоры, вялость, набор веса, сухость кожи и изменения голоса. Однако клинические показатели могут различаться в зависимости от возраста, пола и другихфакторов 3. Сообщается, что заболевание поражает 5% населения, и ещё 5% остаются недиагностированными, в то время как 99% этих пациентов страдают первичным гипотиреозом. Он широко распространен в странах Персидского залива, хотя часто остаётсянедиагностированным 4. Врожденный гипотиреоз затрагивает примерно одного из 3450 младенцев в Саудовской Аравии. Другие поперечные исследования, сосредоточенные исключительно на женщинах, отмечали более высокие показатели распространённости в диапазоне от 13% до 35%. Кроме того, это доказывает, что самки более восприимчивы, чемсамцы 6. Гипотиреоз, если его не лечить, может привести к дислипидемии, когнитивным нарушениям, гипертонии, бесплодию и нервно-мышечной дисфункции7. Следовательно, данное исследование направлено на использование методов машинного обучения для проактивной диагностики гипотиреоза с использованием набора данных из специализированной больницы короля Фахада (KFUH) в Даммаме, Саудовская Аравия.

Гипотиреоз бывает трудно диагностировать, поскольку его симптомы часто путают с симптомами других заболеваний8. Более того, поздний диагноз гипотиреоза может негативно сказаться на интеллектуальных способностяхпациента 9. Тест на стимулирующий гормон щитовидной железы (ТТГ) является наиболее используемым диагностическим методом выявления гипотиреоза9. Однако появление подходов, стратегий и инструментов искусственного интеллекта и машинного обучения помогло решить диагностические и прогностические проблемы в различных медицинских областях. ML используется для оценки значимости клинических факторов и их комбинаций для прогнозирования, таких как прогнозирование прогрессирования заболевания, извлечение медицинских знаний для исследования результатов, терапевтическое планирование и поддержка, а также общее уход запациентами 10. С огромным объёмом медицинских данных у врачей теперь есть ценный ресурс для открытия новых и потенциально ценных знаний с помощью машинногообучения 11,12.

Используя простой клинический набор данных из саудовского набора данных, это исследование направлено на помощь медицинским работникам страны в ранней диагностике гипотиреоза и внедрении этой предиктивной системы в больницах с ограниченными компьютерными ресурсами и оборудованием. Кроме того, предыдущие исследования в этой области не использовали саудовские данные. Это даёт возможность интегрировать саудовские данные вместе с предыдущими исследованиями. Исследования использовали саудовские данные для прогнозирования заболеваний почек, диабета, щитовидной железы и болезни Альцгеймера соответственно, с высокой точностью 13,14,15. Этот опыт мотивирует применять эти методы к другим заболеваниям в Саудовской Аравии. Эти исследования входят в число новейших работ в области машинного обучения и искусственного интеллекта вмедицине 16,17,18,19.

Предлагаемое исследование рассматривает применение методов машинного обучения на простом клиническом саудовском наборе данных по гипотиреозу для прогнозирования присутствия заболевания до того, как оно полностью проявится в симптомах. Цель — разработать систему на основе машинного обучения, которая предоставляет ранние предупреждения о возможном развитии гипотиреоза. Это также облегчит использование этой диагностической системы местными больницами с ограниченным оборудованием. Это исследование стало первым, в котором рассматривается это заболевание с использованием саудовских данных, с акцентом на предсимптоматическую стадию. Набор данных охватывает широкий спектр пациентов местных саудовских больниц с широким возрастным диапазоном, сочетанием положительных и отрицательных случаев гипертиреоза.

В этом исследовании использовались четыре алгоритма машинного обучения: поддерживающая векторная машина (SVM), K-ближайшие соседи (KNN), экстремальное усиление градиентов (XGBoost) и классификатор мягкого голосования, состоящий из SVM и KNN. Каждый из четырёх алгоритмов доказал свои возможности в медицине. Алгоритм KNN был выбран за свою простоту и за достижение точности теста 77,5% при превентивной диагностике сахарного диабета (DM)20. В то же время SVM был выбран за свою устойчивость21, и недавно он был использован для прогнозирования риска смертности у пациентов сCOVID-19 22. Кроме того, XGBoost был выбран за высокие показатели23, достигнув точного прогнозного показателя 94% по исходам гипертонии, и для улучшения результатов из наиболее эффективных алгоритмов использовалась система стекирования.  Кроме того, для выявления заболеваний щитовидной железы с точностью 100% использован классификатор голосования24.

Основная цель текущего исследования — ранняя диагностика гипотиреоза в саудовской популяции с использованием оригинальных рутинных клинических данных и передовых алгоритмов машинного обучения. Четыре метода, использованные в этом исследовании, были реализованы на платформе Jupyter с использованием языка программирования Python, используя набор данных гипотиреоза. Для улучшения производительности использовалась 10-кратная кросс-валидация с гиперпараметрической настройкой. Затем был реализован последовательный выбор признаков с помощью техники прямого отбора, в результате чего классификатор голосовающего ансамбля достиг наивысшей точности — 94,7%. За ней последовали соответственно SVM, KNN и XGBoost. Что касается отзыва, классификатор ансамбля мягкого голосования набрал наивысший балл — 95,5%. В целом, оптимальной моделью для превентивного диагноза гипотиреоза стал классификатор ансамбля мягкого голосования, который получил наивысший балл по всем показателям эффективности в данном исследовании.

Было проведено несколько исследований по диагностике общих заболеваний щитовидной железы и внедрению технологий, особенно машинного обучения, как компьютерного решения. LSTM-CNN, AlexNet, скорректированные модели GoogLeNet, IndRNN–CNN и скорректированные модели глубокого обучения ResNet были использованы с использованием рамановской спектроскопии для различения образцов сыворотки 32 пациентов с гипотиреозом, 38 пациентов с гипертиреозом и 29 контрольных участников. Их модель получила точность 84%, 91%, 75%, 82% и 71% соответственно25.

Алгоритмы машинного обучения, такие как SVM, KNN, логистическая регрессия и случайный лес, использовались для прогнозирования частоты гипотиреоза, вызванного радиацией, у пациентов с нозоглоткойкарциномой 26. Их модель достигла значения AUC 0,7. Кроме того, авторы использовали различные алгоритмы машинного обучения для прогнозирования тенденции лечения пациентов с гипотиреозом, проходящих лечение LT4. Среди 10 классификаторов классификатор дополнительного дерева достиг самой высокой точности — 84%.

В другом исследовании авторы создали и протестировали стратегию машинного обучения для выявления людей с гипертиреозом и гипотиреозом, которым немедленно потребуется медицинскоелечение 27. Они внедрили алгоритмы решения с градиентным бустингом (GBDT), SVM, ANN и алгоритмы логистической регрессии. Их модели показали AUROC 93,8% и 90,9% соответственно для гипертиреоза и гипотиреоза. В другом исследовании авторы использовали машинное обучение для выявления заболеваний щитовидной железы, включая гипотиреоз и гипертиреоз. Их модели включали SVM, ANN, KNN, логистическую регрессию и дерево решений, с наивысшей точностью 96,92%, достигнутой логистическойрегрессией 28. Недавно группа исследователей применила различные методы, включая SVM, дерево решений, Naïve Bayes и ансамбль, для прогнозирования и обнаружения гипотиреоза. Дерево решений показало наивысшую точность — 97,6%29. Другое исследование применило алгоритм Байеса на основе ядра гибридной дифференциальной эволюции для снижения характеристик набора по гипертиреозу и гипотиреозу с 21 до 10. Позже они применили к этому подмножеству признаков классификатор Naïve Bayes на основе ядра, достигнув точности 97,97%30. Аналогично, в другом исследовании авторы использовали несколько алгоритмов машинного обучения для прогнозирования риска заболеваний щитовидной железы в наборе данных sick-euthyroid из Калифорнийского университета. Их эксперимент показал, что ANN превосходит все остальные методы, достигнув точности 95%31. Кроме того, Джа и др. использовали предложенные методы увеличения признаков на основе глубоких нейронных сетей для прогнозирования заболеваний щитовидной железы, достигнув выдающейся точности 99,95%32.

Согласно предыдущей литературе, для выявления заболеваний щитовидной железы использовался однородный голосовающий ансамбль с множественным выбором атрибутов, применяя следующие алгоритмы: случайный лес, градиентное усиление, дерево решений и логистическая регрессия, достигая 100%точности 24. Кроме того, авторы применили модель машины экстремального обучения к открытому набору данных по гипотиреозу на Kaggle, достигнув точности 92%. В наборе данных было 3772 образца: 3481 — гипотиреоид, остальные— отрицательные 33. Недавно в одном из исследований авторы использовали пакетированный CART для классификации гипотиреоза. Предлагаемая ими модель достигла впечатляющей точности 99,9%. Кроме того, T4U, TSH и TBG были выявлены как наиболее значимые факторы, связанные сгипотиреозом 34. В другом исследовании авторы предложили и сравнили различные модели машинного и глубокого обучения, в которых дерево принятия решений и случайный лес достигли точности 99,5% и 99,3% соответственно. Они использовали набор данных Weka, содержащий 30 атрибутов и 3772 образцаиз 35.

Этот краткий обзор литературы показывает, что, хотя большинство применяемых методов показали очень хорошие или отличные результаты, ни один из них не использовал простой медицинский набор данных из Саудовской Аравии. Также отмечалось, что большинство рассматриваемых публикаций использовали наборы данных изображения, что повышало объем работы по сбору данных и усложняло применение очень сложных моделей, созданных нетехническими специалистами. Кроме того, большинство этих работ были посвящены общим заболеваниям щитовидной железы, при этом очень мало публикаций уделяли внимание гипотиреозу. Эта ситуация предоставляет возможность исследовать базовые модели машинного обучения на простом клиническом наборе данных из саудовского набора данных, чтобы помочь местным больницам с ограниченным компьютеризированным оборудованием в превентивной диагностике заболевания.

Краткое введение в алгоритмы, изучаемые в текущем исследовании, приведено в Дополнительном файле 1. Четыре алгоритма: K-Ближайший сосед (KNN)36,37,38,39,40, Support Vector Machine (SVM)41,42,43,44,45, Extreme Ggradent Boosting (XGBoost)46,47,48 и VotingEnsemble 49,50.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

1. Методология

ПРИМЕЧАНИЕ: Как описано в таблице материалов, эксперимент для этого исследования проводился на Python на Jupyter Notebook, который использовался для разработки моделей машинного обучения для превентивной диагностики гипотиреоза. На этапе предварительной обработки использовались Microsoft Excel и библиотека Python Scikit-Learn. K-ближайший сосед (KNN), машина опорного вектора (SVM), усиление экстремального градиента (XGBoost) и классификатор ансамбля мягкого голосования, состоящий из KNN и SVM, затем использовались GridSearchCV и 10-кратная кросс-валидация для получения оптимальных гиперпараметров. Кроме того, важность признаков для каждого классификатора была построена с использованием важности перестановок.

  1. Используйте последовательный выбор признаков с помощью техники переадресации библиотеки mxl-tend.
  2. Примените последовательный селектор признаков ко всем моделям с помощью 10-кратной перекрёстной валидации для выбора лучшего подмножества признаков.
  3. Оценить среднюю точность, воспоминание, точность, F1-балл и потерю логарифма всех моделей, созданных с помощью 10-кратной перекрестной валидации для определения лучшей модели.
  4. Кроме того, генерируйте матрицы путаницы и области под кривыми рабочей характеристики приёмника (AUROC) для каждой модели с использованием оптимальных гиперпараметров и лучшего подмножества признаков.
  5. Подтвердить диагностические результаты командой из трёх экспертов в области отоларингологии, общей медицины и радиологии. Рисунок 1 описывает основы экспериментальных результатов.

figure-protocol-1
Рисунок 1: Экспериментальная структура. Это экспериментальная основа исследования. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

ПРИМЕЧАНИЕ: Саудовские данные по гипотиреозу были получены из специализированной больницы короля Фахада (KFSH) в Даммаме, Саудовская Аравия. Это государственная больница, аффилированная с Университетом Имама Абдулрахмана бин Фейсала (ранее известным как Университет Даммама). Даммам находится в восточной провинции, и большинство пациентов принадлежат к тому же региону. С одобрения Институционального контрольного совета (IRB) набор данных был собран во время стандартных процедур сортировки и испытаний в больнице и зарегистрирован как медицинские записи пациентов (PHR) в системе управления больницей, зарегистрированных в период с 2020 по 2021 годы. Набор данных содержит стандартные клинические тесты 152 пациентов (100 женщин и 52 мужчины) в возрасте от 11 до 92 лет, из которых 89 были положительно диагностированы с гипотиреозом. В то же время оставшиеся 63 пациента были диагностированы без гипотиреоза, но с другими заболеваниями, такими как болезнь Альцгеймера. В наборе данных было 483 атрибута, которые были сокращены до 18 в ходе предварительной обработки путём удаления атрибутов с отсутствующими значениями свыше 30%. Таблица 1 описывает используемые в этом исследовании функции.

ОсобенностиОписание 
ВозрастВозраст в годах.
ПолМужчина или женщина.
Белые кровяные клетки (лейкоциты)Количество лейкоцитов.
ТемператураТемпература тела в градусах Цельсия (°C).
Эритроциты (эритроциты)Количество эритроцитов.
ТромбоцитыКоличество тромбоцитов.
MPVСредний объём тромбоцитов
ПульсоксиметрияИзмерение кислорода в крови (насыщение кислородом).
MCHСредний корпускулярный гемоглобин.
RDWШирина распределения эритроцит.
MCVСредний корпускулярный объём.
MCHCСредняя концентрация корпускулярного гемоглобина
ПульсПульс.
ГематокритОбъем эритроцитов.
Давление – систолическоеСамое высокое давление.
ГемоглобинУровень гемоглобина в крови.
Давление – диастолическоеСамое низкое давление.
Частота дыханияЧастота дыхания в минуту.

Таблица 1: Описание набора данных. В этой таблице представлен набор данных описания.

2. Статистический анализ

ПРИМЕЧАНИЕ: Статистический анализ набора данных помогает визуализировать и понять его закономерность для более эффективной предварительной обработки и моделирования данных. Таблица 2 демонстрирует статистический анализ набора по заболеваниям гипотиреоза, сравнивающий результаты в группах с ГТ и не-ГТ.

  1. Чтобы выяснить, дисбалансированы ли демографические характеристики между положительными и отрицательными группами, проведите статистический анализ на программном обеспечении SPSS (версия: 26.0, IBM, США).
  2. Собрать количественные данные с использованием независимого t-теста выборки, если нормальное распределение и однородность дисперсии были выполнены, либо с помощью теста Мэн-Уитни U.
  3. Собрать категориальные данные с помощью теста хи-квадрата или точного теста Фишера.
ПеременнаяГипотиреоз (n = 89)Негипотиреоз (n = 63)Значение t / UЗначение p
Возраст43.00 (33.00, 54.00)76.00 (70.00, 80.50)5.388< 0,001
Частота дыхания20.00 (20.00, 20.00)20.00 (20.00, 21.50)2.5610.004
Давление – систолическое117.72 ± 16.46127,85 ± 17,773.3020.001
Давление – диастолическое73.00 (68.00, 79.00)72.95 (65.00, 80.25)2.0760.892
Пульс79.09 ± 12.1982.35 ± 12.721.470.145
Температура36.60 (36.50, 36.80)36.70 (36.60, 36.90)2.5760.029
Пульсоксиметрия99.00 (99.00, 100.00)99.00 (98.00, 99.00)1.0880.005
Гематокрит38.20 (35.88, 40.23)37.30 (31.30, 41.30)1.4710.318
Эритроциты4.52 (4.26, 4.81)4.37 (3.81, 4.89)1.360.104
Гемоглобин12.70 (11.70, 13.53)12.30 (10.00, 13.85)1.4810.345
RDW13.80 (13.38, 14.93)14.90 (13.80, 16.45)2.2120.002
MCV83.54 ± 6.8585.05 ± 8.531.0420.3
Тромбоциты261.23 ± 63.97223,62 ± 68,88−2.9450.004
MCHC33.60 (32.80, 34.02)33.20 (32.30, 34.00)1.3140.06
MCH28.00 (26.55, 29.57)28.10 (26.55, 30.20)1.780.468
MPV8,81 ± 0,878.79 ± 1.38−0,0740.941
Белые кровяные клетки6.10 (4.80, 7.43)7.20 (5.70, 8.90)2.0750.017

Таблица 2: Статистический анализ признаков. В этой таблице представлен статистический анализ признаков как в HT, так и в не-HT-группах. Сокращения; HT = гипотиреоз.

ПРИМЕЧАНИЕ: В Таблице 2 группы с ГТ и не-ГТ значительно различаются по возрасту, частоте дыхания, давлению-систолическому давлению, температуре, пульсоксиметру, RDW, тромбоцитам и лейкоцитам. Поэтому физиологические признаки могут использоваться для различия этих двух групп.

3. Предварительная обработка данных

  1. Загрузка исходных данных CSV. Используемый для этого исследования набор данных выполнен в формате CSV. Сначала CSV-файл импортировался в его сыром формате. Он приведён ниже:
    clean_data = PD. DataFrame (нормализовано, столбцы=['пол', 'возраст', 'пульс', 'давление - систолическое', 'давление - диастолическое', 'температура', 'дыхательная частота', 'mcv', 'mch', 'mchc', 'гематокрит', 'лейкоциты', 'гемоглобин', 'эритроциты', 'RDW', 'тромбоциты', 'MPV', 'пульсоксиметрия', 'описание'])
  2. Выполнять предварительную обработку данных, включая удаление выбросов, обработку отсутствующих значений и нормализацию, чтобы улучшить представление и точность данных модели.
  3. Используйте Microsoft Excel для начальной обработки набора данных, включая удаление выбросов. Удалите выбросы в «Пульсоксиметр», «Систолический АД», «Диастолический АД» и «Частота дыхания» с помощью диаграммы рассеяния и замените их соответствующими значениями.
  4. Обработка отсутствующих значений
    Импорт набора данных импортировался в Python и предпроцессировался с помощью библиотек NumPy, Pandas и Scikit-learn. Используйте KNN imputer из библиотеки sklearn для обработки пропущенных значений.
    ПРИМЕЧАНИЕ: Использовались евклидова метрика и значение ближайшего соседа 5. Он приведён ниже:
    imputer = KNNImputer(n_neighbors=5)
    данные = imputer.fit_transform(clean_data)
    Scaler = MinMaxScaler()
    scaler.fit(data)
  5. Закодировать строки в бинарные формы.
    ПРИМЕЧАНИЕ: Целое число единицы означало «Положительный» и «Женский» в разделах «Описание» и «Гендер» соответственно, тогда как ноль — «Отрицательный» и «Мужчина» в «Описании» и «Гендер» соответственно. Затем набор данных масштабировался с помощью MinMaxScaler из библиотеки sklearn, отображая значения в диапазоне 0–1. Он приведён ниже:
    normalized = scaler.transform(data)

4. Создание и оценка моделей

ПРИМЕЧАНИЕ: Разделение данных для перекрёстной валидации: После различных экспериментов с разными сгибами было установлено оптимальное 10-кратное кросс-валидирование, которое впоследствии было применено.

  1. Обучайте каждую модель с заданными гиперпараметрами.
  2. Выполняйте выбор признаков и переучите модели на выбранных объектах.
    ПРИМЕЧАНИЕ: В предлагаемом исследовании была применена техника прямого последовательного выбора признаков. Затем модели оптимизировались для наилучшего набора функций. Для шагов 4.1–4.2 был развернут следующий сегмент кода:
    из sklearn.model_selection импорта train_test_split, GridSearchCV, StratifiedKFold
    kf = StratifiedKFold(n_splits=10,shuffle=True, random_state=1)
    В сетке использовался стратифицированный k fold с 10 сплитами, а точность была показателем подсчёта очков. Код ниже объясняет, как это было реализовано, на примере с использованием SVM.
    параметры = {
    'kernel': ['линейный', 'poly', 'rbf', 'sigmoid'],
    'C': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 100],
    «гамма»: [1, 0.1, 0.01, 0.001, 0.0001]
    }svm = SVC(random_state = 1)
    svm_GS = GridSearchCV(svm,
    параметры,
    cv=kf,
    подсчёт='точность'
    )
    svm_GS.fit(X, y)
    fig = plot_cv_results(svm_GS.cv_results_, 'C', 'kernel')
    sfs1 = SFS(estimator=svm,
    k_features=(1, 18),
    вперёд=True,
    floating=Ложно,
    подсчёт очков='точность',
    cv=kf)
  3. Оцените показатели эффективности и выберите окончательную модель.
    ПРИМЕЧАНИЕ: Показатель производительности: В этом исследовании использовались наиболее часто используемые показатели эффективности в классификации, а именно: точность, точность, воспоминание, F1–Score и логарифмические потери. Эти показатели эффективности кратко описаны ниже вместе с их формулами.
    Точность (PR): Количество истинно положительных наблюдений, которые принадлежат общему общему числу ожидаемых положительных наблюдений. Она задаётся формулой:
    figure-protocol-2(1)
    Отзыв (RE): Представлять количество фактически положительных случаев, прогнозируемых как положительных. Она задаётся формулой:
    figure-protocol-3(2)
    Точность (AC): Это процент правильных предсказаний, сделанных моделью. Он задаётся следующим образом:
    figure-protocol-4(3)
    Где:
    Истинно положительный (TP): Количество правильно классифицированных случаев гипотиреоза.
    Ложноположительный результат (FP): Количество неправильно классифицированных случаев гипотиреоза.
    Истинно отрицательный (TN): Количество правильно классифицированных случаев негипотиреоза.
    Ложноотрицательный результат (FN): Количество неправильно классифицированных случаев негипотиреоза.
    F1–Балл: это взвешенное среднее воспоминания и точности. Он задаётся формулой
    figure-protocol-5(4)
    Логарифмические потери: Это насколько предсказанная вероятность совпадает с фактическим истинным значением. Это
    задаётся формулой:
    figure-protocol-6(5)
    Где N и M обозначают соответственно количество образцов и признаков, Yij обозначает ,принадлежит ли i образец к j-муклассу или нет, Pij — вероятность принадлежности i-йвыборки к j-муклассу. В этом исследовании также была нанесена характеристика работы приёмника (ROC), что полезно для прогнозирования вероятности бинарного результата. Это было сделано для визуализации производительности моделей при различных пороговых настройках. ROC показывает, насколько хорошо модель различает классы.
  4. Стратегия оптимизации
    ПРИМЕЧАНИЕ: Оптимизация гиперпараметров не может быть переоценена для достижения наилучших результатов в любом исследовании машинного обучения. В этом исследовании использовался GridSearchCV с стратифицированной 10-кратной кросс-валидацией для определения оптимальных гиперпараметров для каждой модели. GridSearchCV — это инструмент для точной настройки параметров модели. Он работает, просматривая все параметры, указанные в сетке параметров, и выбирая лучшие комбинации. Настройка гиперпараметров крайне важна для определения максимальной точности в каждой модели. Гиперпараметры каждой модели, включая диапазон, лучшее значение и полученную точность, представлены в таблице 3.
АлгоритмИмя гиперпараметраДиапазон гиперпараметровЛучшее соотношение цены и качестваТочность при наилучшем соотношении и ценности
K-NNМетрика«Минковски», «Манхэттен», «Евклид»Минковски84.21%
N_neighbors3, 5, 7, 9, 11, 135
SVMЯдро'линейный', 'полиамор', 'rbf', 'сигмоид'Линейный92.76%
Стоимость (C)1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 1009
Гамма1, 0.1, 0.01, 0.001, 0.00011
XGBoostN_estimators5,01,00,15,02,00,25020089.47%

Таблица 3: Оптимальный гиперпараметр. Это показывает оптимальный гиперпараметр каждой модели.

Рисунки 2–4 показывают подход поиска по сетке для поиска гиперпараметров для техник KNN, SVM и XGBoost, а также то, как они были реализованы с использованием всех признаков.

figure-protocol-7
Рисунок 2: Производительность KNN. Это показатели KNN по различным метрикам и подсчетам соседей. Сокращения; KNN = K ближайший сосед. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

figure-protocol-8
Рисунок 3: Производительность SVM. Это производительность SVM с значениями ядра и функции затрат. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой фигуры.

figure-protocol-9
Рисунок 4: Производительность XGBoost. Это производительность XGBoost с разными значениями Booster и N_estimator. Сокращения; XGBoost = Экстремальное ускорение градиента. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

  1. Создать мягкий классификатор голосования для дальнейшего повышения производительности модели, комбинируя лучшие параметры, полученные из классификаторов KNN и SVM. Он состоит из одного классификатора KNN и двух классификаторов SVM.
  2. Замените одно из ядер SVM на 'rbf' — второе по величине ядро после 'линейного'.
  3. ПРИМЕЧАНИЕ: Классификаторы и соответствующие их гиперпараметры были выбраны потому, что они дали наилучшую производительность после множества попыток проб и ошибок на всех классификаторах и их гиперпараметрах. Кроме того, основываясь на долгой истории работы с превентивной диагностикой различных заболеваний с использованием клинических наборов данных, собранных аналогично тем, что были в14,15, эта комбинация демонстрирует многообещающую диагностическую точность, что дополнительно продемонстрировано в экспериментальных разделах. Таблица 4 показывает классификаторы, используемые для мягкого голосования, их гиперпараметры и полученную точность.
АлгоритмКлассификаторыГиперпараметрыТочность
Мягкий классификатор голосованияK-NNМетрикаМинковский
N_neighbors5
SVM1ЯдроЛинейный
Стоимость (C)988.81%
Гамма1
SVM2ЯдроRBF
Стоимость (C)9
Гамма1

Таблица 4: Гиперпараметры классификатора голосования. Это показывает комбинацию классификаторов голосования и гиперпараметры.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Производительность моделей
Результаты четырёх моделей, созданных в этом исследовании, сравнивались и анализировались с учётом их точности, воспоминания и тестирования. Алгоритм GridsearchCV использовался для определения наилучшего гиперпараметра для каждой модели с использованием всех признаков. Производительность каждой модели оценивалась с помощью стратифицированной 10-кратной перекрестной валидации. В таблице 5 представлены результаты производитель...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

В этом исследовании изучаются алгоритмы машинного обучения на клиническом наборе данных Саудовской Аравии с целью разработки превентивной диагностической модели гипотиреоза. Были созданы четыре модели: KNN, SVM, XGBoost и Soft Voting Ensemble Classifier. Все четыре модели определили возраст и частоту дыхания как значимые показатели при превентивной диагностике заболевания. Среди четырёх моделей классификатор голосования продемонстрировал превосходные результаты по всем метрикам, использо...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Набор данных получен из больницы по номеру IRB-2020-09-429. У авторов нет конфликтов интересов, чтобы сообщать относительно текущего исследования.

Благодарности

Авторы выражают признательность поддержке медицинских работников в подтверждении результатов исследования.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Ноутбук/МашинаDellXPS9320ОЗУ 16 ГБ, 12-е поколение Intel(R) Core(TM) i7-1260P
Excel 365MicrosoftExcel 365Используется для хранения исходных данных в формате csv
Python 3.12.12Google colab Notebook Python 3.12.12Используется для обучения сборке моделей и bbsp;
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Используется для обучения сборке моделей и bbsp;
Панды 2.2.2Google colab Notebook Панды 2.2.2Используется для обучения сборке моделей и bbsp;
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Используется для обучения сборке моделей и bbsp;
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Используется для обучения сборке моделей и bbsp;
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Используется для обучения сборке моделей и bbsp;
SPSS IBM, СШАSklearn 1.6.1Используется для статистического анализа

Ссылки

  1. Biondi, B., Kahaly, G. J., Robertson, R. P. Thyroid dysfunction and diabetes mellitus: two closely associated disorders. Endocr Rev. 40 (3), 789-824 (2018).
  2. Khan, A., Khan, M. M. A., Akhtar, S. Thyroid disorders, etiology and prevalence. J. Med. Sci. 2 (2), 89-94 (2002).
  3. Bianco, A. C. Hypothyroidism. Lancet. 390 (10101), 1550-1562 (2019).
  4. Chiovato, L., Magri, F., Carle, A. Hypothyroidism in context: where we’ve been and where we’re going. Adv. Ther. 36 (2), 47-58 (2019).
  5. Alzahrani, A. S., et al. Diagnosis and management of hypothyroidism in gulf cooperation council (GCC) countries. Adv. Ther. 37 (7), 3097-3111 (2020).
  6. Alhajri, A. H. M., Saleh Al Saad, A. M. S., Idrees, H., Hamednalla Mohamed, O. M., Mohammednoor, M., et al. Prevalence and risk factors of subclinical and overt hypothyroidism in Saudi Arabia: A Systematic Review. Cureus. 17 (6), e86336(2025).
  7. Gaitonde, D. Y., Rowley, K. D., Sweeney, L. B. Hypothyroidism: An update. Am. Fam. Physician. 86 (3), 244-251 (2012).
  8. Bianco, A. C. Emerging therapies in hypothyroidism. Annu. Rev. Med. 75, 307-319 (2024).
  9. Pulungan, A. B., Oldenkamp, M. E., Sarinus, A., Van Trotsenburg, P., Windarti, W., et al. Effect of delayed diagnosis and treatment of congenital hypothyroidism on intelligence and quality of life: an observational study. Horm. Res. Paediatr. 28 (4), 396-401 (2019).
  10. Musleh, D., Rahman, A., Almossaeed, H., Balhareth, F., Alqahtani, G., et al. AI-enabled diagnosis using YOLOv9: leveraging X-Ray image analysis in dentistry. Big Data Cogn. Comput. 10 (1), 16(2026).
  11. Alassaf, R. A., et al. Preemptive diagnosis of chronic kidney disease using machine learning techniques. International Conference on Innovations in Information Technology (IIT), Al Ain, United Arab Emirates, , 99-104 (2018).
  12. Rahman, A., Youldash, M., Alshammari, G., Sebiany, A., Alzayat, J., et al. Diabetic retinopathy detection: a hybrid intelligent approach. Comput. Mat. Contin. 80 (3), 4561-4576 (2024).
  13. Luca, M., Cimitile, M., Iammarino, M., Iammarino, M. Thyroid disease treatment prediction with machine learning approaches. Procedia Comput. Sci. 192, 1031-1040 (2021).
  14. Olatunji, S. O., Alansari, A., Alkhorasani, H., Alsubaii, M., Sakloua, R., et al. Preemptive diagnosis of Alzheimer's disease in the eastern province of Saudi Arabia using computational intelligence techniques. Comput. Intell. Neurosci. 2022, 5476714(2022).
  15. Olatunji, S. O., Alansari, A., Alkhorasani, H., Alsubaii, M., Sakloua, R., et al. A novel ensemble-based technique for the preemptive diagnosis of Rheumatoid Arthritis disease in the eastern province of Saudi Arabia using clinical data. Comput Math Methods Med. 2022, 2339546(2022).
  16. Rahman, A. Geo-spatial disease clustering for public health decision making. Informatica. 46 (6), 21-32 (2022).
  17. Gollapalli, M., Rahman, A., Kudos, S. A., Foula, M. S., Alkhalifa, A. M., et al. Appendicitis diagnosis: ensemble machine learning and explainable artificial intelligence-based comprehensive approach. Big Data Cogn. Comput. 8 (9), 108(2024).
  18. Youldash, M., Rahman, A., Alsayed, M., Sebiany, A., Alzayat, J., et al. Early detection and classification of diabetic retinopathy: a deep learning approach. AI. 5 (4), 2586-2617 (2024).
  19. Zagrouba, R., Khan, M. A., et al. Modelling and simulation of COVID-19 outbreak prediction using supervised machine learning. Comput. Mat. Contin. 66 (3), 2397-2407 (2021).
  20. Wu, X., et al. Top 10 algorithms in data mining. Knowl. Inf. Syst. 14 (1), 1-37 (2008).
  21. Chen, T., Guestrin, C. XGBoost: A Scalable tree boosting system. Proc. ACM SIGKDD, 1, 785-794 (2016).
  22. Atta-ur-Rahman,, Sultan, K., Naseer, I., Majeed, R., Musleh, D., et al. Supervised machine learning-based prediction of COVID-19. Comput. Mat. Contin. 69 (1), 21-34 (2021).
  23. Chang, W., et al. A machine-learning-based prediction method for hypertension outcomes based on medical data. Diagnostics. 9 (4), 178(2019).
  24. Akhtar, T., et al. Effective voting ensemble of homogenous ensembling with multiple attribute-selection approaches for improved identification of thyroid disorder. Electronics. 10 (23), 3026(2021).
  25. Li, Y., et al. Serum Raman spectroscopy combined with deep neural network for analysis and rapid screening of hyperthyroidism and hypothyroidism. Photodiagnosis Photodyn. Ther. 35, 102382(2021).
  26. Ren, W., et al. Dosiomics-based prediction of radiation-induced hypothyroidism in Nasopharyngeal Carcinoma patients. Phys. Medica. 89, 219-225 (2021).
  27. Hu, M., et al. Development and preliminary validation of a machine learning system for thyroid dysfunction diagnosis based on routine laboratory tests. Commun Med. 2 (1), 9(2022).
  28. Chaganti, R., Rustam, F., De La Torre Díez, I., Mazón, J. L. V., Rodríguez, C. L., et al. Thyroid disease prediction using selective features and machine learning techniques. Cancers. 14 (16), 3914(2022).
  29. Almahshi, H. M., Almasri, E. A., Alquran, H., Mustafa, W. A., Alkhayyat, A. Hypothyroidism prediction and detection using machine learning. IICETA, , 159-163 (2022).
  30. Geetha, K., Baboo, S. S. An empirical model for thyroid disease classification using evolutionary multivariate Bayesian prediction method. Glob. J. Comput. Sci. Technol. 16 (1), 1-10 (2016).
  31. Islam, S. S., Haque, S., Miah, M. S. U., Bin, T. Application of machine learning algorithms to predict the thyroid disease risk: an experimental comparative study. PeerJ Comput. Sci. 8 (1), e898 1-35 (2022).
  32. Jha, R., Bhattacharjee, V., Mustafi, A. Increasing the prediction accuracy for thyroid disease: a step towards better health for society. Wirel. Pers. Commun. 122 (2), 1921-1938 (2022).
  33. Cicek, I. B., Kucukakcali, Z. Classification of hypothyroid disease with extreme learning Machine Model. J. Cogn. Syst. 5 (2), 64-68 (2020).
  34. Res, A. M., Evren, B. Estimating hypothyroidism with the bagged CART model based on clinical dataset and identification of risk factors. Ann. Med. Res. 29 (10), 1189-1193 (2022).
  35. Guleria, K., Sharma, S., Kumar, S., Tiwari, S. Early prediction of hypothyroidism and multiclass classification using predictive machine learning and deep learning. Meas. Sensors. 24, 100482(2022).
  36. Bach, M. New undersampling method based on the kNN approach. Procedia Comput Sci. 207 (1), 3403-3412 (2022).
  37. Sajjad, M., Ismail, M., Atta-ur-Rahman,, et al. Generalized and open selection approaches for the population mean: accounting for non-response and measurement error in single-phase sampling. J Stat Theory Appl. 24, 394-411 (2025).
  38. Dash, S., Biswa, S., Banerjee, D., Rahman, A. Edge and fog computing in healthcare: a review. Scalable Computing: Practice and Experience. 20 (2), 191-205 (2019).
  39. Hantom, W. H., Rahman, A. Arabic spam tweets classification: A comprehensive machine learning approach. AI. 5 (3), 1049-1065 (2024).
  40. Arafat, H., Alfeilat, A., Hassanat, A. B. A., Lasassmeh, O., Tarawneh, A. S. Effects of distance measure choice on k-nearest neighbor classifier performance: a review. Big Data. 7 (4), 221-248 (2019).
  41. Brereton, R. G., Lloyd, G. R. Support vector machines for classification and regression. Analyst. 135 (2), 230-267 (2010).
  42. Musleh, D. A., Olatunji, S. O., Almajed, A. A., Alghamdi, A. S., Alamoudi, B. K., et al. Ensemble learning based sustainable approach to carbonate reservoirs permeability prediction. Sustainability. 15 (19), 14403(2023).
  43. Vapnik, V., Golowich, S. E., Ave, M., Hill, M. Support vector method for function approximation, regression estimation, and signal processing. NIPS'96: Proceedings of the 10th International Conference on Neural Information Processing Systems, , 281-287 (1996).
  44. Noble, W. S. What is a support vector machine? Nat. Biotechnol. 24 (12), 1565-1567 (2006).
  45. Sharifmousavi, S. S., Borhani, M. S. Support vector machine-based model for diagnosis of multiple sclerosis using the plasma levels of selenium, vitamin B12, and vitamin D3. Informatics Med. Unlocked. 20, 100382(2020).
  46. Brownlee, J. A Gentle introduction to XGBoost for applied machine learning. , MachineLearningMastery.com (2021).
  47. Chen, M., Liu, Q., Chen, S., Liu, Y., Zhang, C., et al. XGBoost-based algorithm interpretation and application on post-fault transient stability status prediction of power system. IEEE Access. 7 (1), 13149-13158 (2019).
  48. Alabbad, D. A., Ajibi, S. Y., Alotaibi, R. B., Alsqer, N. K., Alqahtani, R. A., et al. Birthweight range prediction and classification: a machine learning-based sustainable approach. Mach. Learn. Knowl. Extr. 6 (2), 770-788 (2024).
  49. Ahmed, M. I. B., Zaghdoud, R. A., Al-Abdulqader, M., Kurdi, M., Altamimi, R., et al. Ensemble machine learning based identification of adult epilepsy. Math. Model. Eng. Probl. 10 (1), 84-92 (2023).
  50. Manconi, A., Armano, G., Gnocchi, M., Milanesi, L. A soft-voting ensemble classifier for detecting patients affected by COVID-19. Appl. Sci. 12 (1), 7554(2022).
  51. Gollapalli, M., et al. A novel stacking ensemble for detecting three types of diabetes mellitus using a Saudi Arabian dataset: pre-diabetes, T1DM, and T2DM. Comput. Biol. Med. 147, 105757(2022).
  52. Rahman, A., Abbas, S., Gollapalli, M., Ahmed, R., Aftab, S., et al. Rainfall prediction system using machine learning fusion for smart cities. Sensors. 22 (9), 3504(2022).
  53. Alotaibi, S. M., Atta-ur-Rahman,, Basheer, M. I., Khan, M. A. Ensemble machine learning based identification of pediatric epilepsy. Comput. Mat. Contin. 68 (1), 149-165 (2021).
  54. Adnan Khan, M., Abbas, S., Atta, A., Ditta, A., Alquhayz, H., et al. Intelligent cloud-based heart disease prediction system empowered with supervised machine learning. Comput. Mat. Contin. 65 (1), 139-151 (2020).
  55. Sharma, R., Mahanti, G. K., Panda, G., Rath, A., Dash, S., et al. Comparative performance analysis of binary variants of FOX optimization algorithm with half-quadratic ensemble ranking method for thyroid cancer detection. Sci. Rep. 13 (1), 19598(2023).
  56. Ahmed, M. S., Rahman, A., AlGhamdi, F., AlDakheel, S., Hakami, H., et al. Joint diagnosis of pneumonia, COVID-19, and tuberculosis from chest x-ray images: a deep learning approach. Diagn. 13 (15), 2562(2023).
  57. Dalal, S., Lilhore, U. K., Faujdar, N., et al. Enhancing thyroid disease prediction with improved XGBoost model and bias management techniques. Multimed Tools Appl. 84, 16757-16788 (2025).
  58. Rahman, A. Solar panel surface defect and dust detection: deep learning approach. J. Imaging. 11 (9), 287(2025).
  59. Sadek, S. H., Khalifa, W. A., Azoz, A. M. Pulmonary consequences of hypothyroidism. Ann. Thorac. Med. 12 (3), 204-208 (2017).
  60. Haghbin, M., Razmjooei, F., Abbasi, F., Rouhie, R., Pourabbas, P., et al. Evaluation of the hematological parameters, inflammatory biomarkers, and thyroid hormones in hypothyroidism patients. BMC Res. Notes. 17 (1), 390(2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

SVMKNN