La disfunzione tiroidea (TD) è una delle malattie endocrine croniche più comuni, con una prevalenza variabile tra lepopolazioni 1. I due disturbi più comuni delle ghiandole tiroidei sono l'ipotiroidismo e l'ipertiroidismo. L'ipotiroidismo è una condizione diffusa che deriva da una produzione insufficiente di ormoni tiroidei. Sebbene generalmente sia gestibile con il trattamento, nei casi gravi può essere fatale se non viene affrontata. I sintomi più comuni dell'ipotiroidismo negli adulti includono stanchezza, stitichezza, letargia, aumento di peso, pelle secca e cambiamenti della voce. Tuttavia, le presentazioni cliniche possono variare in base all'età, al genere e ad altrifattori 3. Si riporta che la malattia colpisce il 5% della popolazione generale e un ulteriore 5% rimane non diagnosticato, mentre il 99% di questi pazienti soffre di ipotiroidismo primario. È diffusa negli Stati del Golfo Arabico, anche se spesso rimanesottodiagnosticata 4. L'ipotiroidismo congenito colpisce circa uno su 3.450 neonati in Arabia Saudita. Altri studi trasversali focalizzati esclusivamente sulle donne hanno riportato tassi di prevalenza più elevati, che variavano dal 13% al 35%5. Inoltre, dimostrando che le femmine sono più suscettibili deimaschi 6. L'ipotiroidismo, se non trattato, può portare a dislipidemia, deficit cognitivo, ipertensione, infertilità e disfunzioneneuromuscolare 7. Di conseguenza, questo studio mira a impiegare metodi di machine learning per diagnosticare proattivamente l'ipotiroidismo utilizzando un dataset del King Fahad Specialist Hospital (KFUH) di Dammam, Arabia Saudita.
L'ipotiroidismo può essere difficile da diagnosticare perché i sintomi spesso vengono scambiati per quelli di altremalattie 8. Inoltre, una diagnosi tardiva di ipotiroidismo può influire negativamente sulle capacità intellettive di unpaziente 9. Il test dell'ormone stimolante della tiroide (TSH) è il metodo diagnostico più utilizzato per rilevare l'ipotiroidismo9. Tuttavia, l'arrivo di approcci, strategie e strumenti di intelligence artificiale e machine learning ha contribuito a risolvere problemi diagnostici e prognostici in varie aree mediche. L'ML viene utilizzato per valutare l'importanza dei fattori clinici e delle loro combinazioni per la prognosi, come la previsione della progressione della malattia, l'estrazione di conoscenze mediche per la ricerca sugli esiti, la pianificazione e il supporto terapeutico, e la cura complessiva del paziente10. Con grandi volumi di dati medici disponibili, i medici dispongono ora di una risorsa preziosa per scoprire nuove conoscenze potenzialmente preziose attraverso il machinelearning 11,12.
Utilizzando un semplice dataset clinico proveniente dal dataset saudita, questo studio mira ad assistere gli operatori sanitari del paese nella diagnosi precoce dell'ipotiroidismo e a implementare questo sistema predittivo in ospedali con risorse e attrezzature informatiche limitate. Inoltre, studi precedenti in questo campo non hanno utilizzato il dataset saudita. Questo rappresenta un'opportunità per integrare il dataset saudita insieme a ricerche precedenti. Gli studi hanno utilizzato un dataset saudita per prevedere rispettivamente malattie renali, diabete, tiroide e Alzheimer, raggiungendo un'altaaccuratezza 13,14,15. Questa esperienza motiva l'applicazione di questi metodi ad altre malattie in Arabia Saudita. Gli studi sono tra gli ultimi lavori nel campo medico (16,17,18,19).
Lo studio proposto discute l'implementazione di tecniche di machine learning su un semplice dataset clinico saudita per l'ipotiroidismo, al fine di prevedere la presenza della malattia prima che diventi completamente sintomatica. L'obiettivo è sviluppare un sistema basato su machine learning che fornisca avvisi precoci di un possibile episodio di ipotiroidismo. Renderà inoltre più facile per gli ospedali locali con attrezzature limitate utilizzare questo sistema diagnostico. Questo studio è il primo a esaminare questa malattia utilizzando il dataset saudita, concentrandosi sulla fase pre-sintomatica. Il dataset copre una vasta popolazione di pazienti ospedalieri locali sauditi, con una fascia d'età ampia e un mix di casi positivi e negativi di ipertiroidismo.
Questo studio ha utilizzato quattro algoritmi di apprendimento automatico: support vector machine (SVM), K-nearest neighbors (KNN), eXtreme gradient boosting (XGBoost) e un classificatore di ensemble soft voting composto da SVM e KNN. Ognuno dei quattro algoritmi ha dimostrato le proprie capacità nel campo medico. L'algoritmo KNN è stato selezionato per la sua semplicità e per aver raggiunto una precisione del test del 77,5% nella diagnosi preventiva di diabete mellito (DM)20. Contemporaneamente, SVM è stata scelta per la sua robustezza21, ed è stata recentemente utilizzata per prevedere il rischio di mortalità nei pazientiCOVID-19 22. Inoltre, XGBoost è stato selezionato per la sua forte performance23, raggiungendo un punteggio predittivo accurato del 94% per gli esiti di ipertensione, e è stato impigato lo stacking per migliorare i risultati degli algoritmi con le migliori prestazioni. Inoltre, è stato utilizzato un classificatore per l'ensemble di votanti per identificare i disturbi della tiroide con una precisionedel 100% 24.
L'obiettivo principale del presente studio è la diagnosi precoce dell'ipotiroidismo in una popolazione saudita, utilizzando dati clinici originali di routine e algoritmi di machine learning all'avanguardia. Le quattro tecniche utilizzate in questo studio sono state implementate sulla piattaforma Jupyter utilizzando il linguaggio di programmazione Python, utilizzando il dataset sull'ipotiroidismo. È stata utilizzata una validazione incrociata a 10 volte con accordatura iperparametrica per migliorare le prestazioni. È stata quindi implementata una selezione sequenziale delle caratteristiche con una tecnica di selezione anticipata, portando il classificatore dell'ensemble a votare a raggiungere la massima accuratezza del 94,7%. SVM, KNN e XGBoost, rispettivamente, lo seguirono. Per quanto riguarda il richelo, il classificatore di ensemble con voto morbido ha ottenuto il punteggio più alto con il 95,5%. Nel complesso, il modello ottimale per la diagnosi preventiva dell'ipotiroidismo è stato il classificatore di ensemble a voto morbido, che ha raggiunto il punteggio più alto in tutte le misure di performance valutate in questo studio.
Sono stati condotti diversi studi sulla diagnosi dei disturbi generali della tiroide e sull'implementazione della tecnologia, in particolare l'apprendimento automatico, come soluzione assistita da computer. LSTM-CNN, AlexNet, i modelli di deep learning modificati GoogLeNet, IndRNN–CNN e ResNet adattati sono stati utilizzati tramite spettroscopia Raman per distinguere campioni sierici da 32 pazienti con ipotiroidismo, 38 pazienti con ipertiroidismo e 29 soggetti di controllo. Il loro modello ha ottenuto una precisione dell'84%, 91%, 75%, 82% e 71%,rispettivamente 25%.
Algoritmi di machine learning come SVM, KNN, regressione logistica e foresta random sono stati utilizzati per prevedere l'incidenza dell'ipotiroidismo indotto da radiazioni nei pazienti con carcinomanasofaringeo 26. Il loro modello ha raggiunto un valore AUC di 0,7. Inoltre, gli autori hanno utilizzato vari algoritmi di apprendimento automatico per prevedere la tendenza del trattamento dei pazienti con ipotiroidismo sottoposti a LT4. Tra 10 classificatori, il classificatore extra-tree ha raggiunto la massima accuratezza dell'84%.
In un altro studio, gli autori hanno creato e testato una strategia di apprendimento automatico per identificare persone con ipertiroidismo e ipotiroidismo che avrebbero beneficiato di un trattamento medicoimmediato 27. Hanno implementato alberi decisionali di gradiente boosting (GBDT), SVM, ANN e algoritmi di regressione logistica. I loro modelli hanno ottenuto rispettivamente un AUROC del 93,8% e del 90,9% per ipertiroidismo e ipotiroidismo. In un altro studio, gli autori hanno utilizzato il machine learning per rilevare disturbi della tiroide, che comprendono ipotiroidismo e ipertiroidismo. I loro modelli includevano SVM, ANN, KNN, regressione logistica e albero decisionale, con la massima accuratezza del 96,92% raggiunta dalla RegressioneLogistica 28. Recentemente, un gruppo di ricercatori ha applicato diversi metodi, tra cui SVM, albero decisionale, Naïve Bayes e ensemble, per prevedere e rilevare l'ipotiroidismo. L'albero decisionale ha raggiunto la massima accuratezza, con il 97,6%29. Un altro studio ha applicato l'algoritmo di Naïve Bayes basato sul kernel ibrido dell'evoluzione differenziale per ridurre da 21 a 10 le caratteristiche di un dataset tiroideo di ipertiroidismo e ipotiroidismo. Successivamente hanno applicato il classificatore Naïve Bayes basato sul kernel al sottoinsieme delle caratteristiche, raggiungendo una precisione del 97,97%30. Allo stesso modo, in un altro studio, gli autori hanno utilizzato diversi algoritmi di apprendimento automatico per prevedere il rischio di malattie tiroidee sul dataset di malattie eutiroide della California University. Il loro esperimento dimostrò che l'ANN superava tutti gli altri metodi, raggiungendo una precisione del 95%31. Inoltre, Jha et al. hanno utilizzato tecniche proposte di aumento delle caratteristiche basate su reti neurali profonde per prevedere le malattie tiroidee, raggiungendo un'eccezionale accuratezza del 99,95%32.
Secondo la letteratura precedente, è stato utilizzato un insieme omogeneo di voto con selezione multipla di attributi per identificare le malattie tiroidee, impiegando i seguenti algoritmi: foresta casuale, gradient boosting, albero decisionale e regressione logistica, ottenendo una precisionedel 100% 24. Inoltre, gli autori hanno applicato il modello di machine di apprendimento estremo al dataset open-access sull'ipotiroidismo su Kaggle, raggiungendo una precisione del 92%. Il dataset conteneva 3772 campioni: 3481 ipotiroidei e gli altrinegativi 33. Recentemente, in uno studio, gli autori hanno utilizzato CART in sacchetto per classificare l'ipotiroidismo. Il loro modello proposto ha raggiunto un'impressionante accuratezza del 99,9%. Inoltre, T4U, TSH e TBG sono stati identificati come i fattori più significativi associati all'ipotiroidismo34. In un altro studio, gli autori hanno proposto e confrontato diversi modelli di machine learning e deep learning, in cui l'albero decisionale e la foresta casuale hanno raggiunto rispettivamente una precisione del 99,5% e del 99,3%. Hanno utilizzato un dataset Weka contenente 30 attributi e 3772campioni 35.
Questa breve revisione della letteratura dimostra che, sebbene la maggior parte dei metodi impiegati abbia ottenuto risultati da buoni a eccellenti, nessuno ha utilizzato un semplice dataset clinico proveniente dall'Arabia Saudita. È stato inoltre osservato che la maggior parte delle pubblicazioni in esame utilizzava dataset di imaging, il che aumentava il lavoro necessario per la raccolta dei dati e aumentava la difficoltà nell'applicare modelli molto complessi creati da persone non tecniche. Inoltre, la maggior parte di questi studi è stata condotta su disturbi generali della tiroide, con pochissime pubblicazioni che enfatizzassero l'ipotiroidismo. Questa situazione offre l'opportunità di indagare modelli di machine learning di base su un semplice dataset clinico proveniente dal dataset saudita, per assistere gli ospedali locali con attrezzature informatizzate limitate nella diagnosi preventiva della malattia.
La breve introduzione agli algoritmi indagati nello studio attuale è fornita nel Supplementary File 1. I quattro algoritmi sono K-Nearest Neighbor (KNN)36,37,38,39,40, Support Vector Machine (SVM)41,42,43,44,45, Extreme Gradient Boosting (XGBoost)46,47,48 e l'ensemble divotazione 49,50.