A disfunção tireoidiana (TD) é uma das doenças endócrinas crônicas mais comuns, com prevalência variável entre aspopulações 1. Os dois distúrbios mais comuns das glândulas tireoides são hipotireoidismo e hipertireoidismo. O hipotireoidismo é uma condição prevalente que resulta da produção insuficiente de hormônios da tireoide. Embora geralmente seja controlável com tratamento, em casos graves pode ser fatal se não for tratada. Os sintomas mais comuns de hipotireoidismo em adultos incluem fadiga, constipação, letargia, ganho de peso, pele seca e alterações na voz. No entanto, as apresentações clínicas podem variar conforme idade, gênero e outrosfatores 3. Relata-se que a doença afeta 5% da população geral, e outros 5% permanecem sem diagnóstico, enquanto 99% desses pacientes sofrem de hipotireoidismo primário. É amplamente distribuído nos Estados do Golfo Árabe, embora frequentemente permaneçasubdiagnosticado 4. O hipotireoidismo congênito afeta aproximadamente um em cada 3.450 bebês na Arábia Saudita. Outros estudos transversais focados exclusivamente em mulheres relataram taxas de prevalência mais altas, variando de 13% a 35%5. Além disso, provando que as fêmeas são mais suscetíveis que osmachos 6. O hipotireoidismo, se não tratado, pode levar a dislipidemia, comprometimento cognitivo, hipertensão, infertilidade e disfunçãoneuromuscular 7. Consequentemente, este estudo tem como objetivo empregar métodos de aprendizado de máquina para diagnosticar proativamente hipotireoidismo usando um conjunto de dados do Hospital Especializado King Fahad (KFUH) em Dammam, Arábia Saudita.
O hipotireoidismo pode ser difícil de diagnosticar porque os sintomas frequentemente são confundidos com os de outrasdoenças 8. Além disso, um diagnóstico tardio de hipotireoidismo pode afetar negativamente as habilidades intelectuais de umpaciente 9. O teste do hormônio estimulante da tireoide (TSH) é o método diagnóstico mais utilizado para detectar hipotireoidismo9. No entanto, a chegada de abordagens, estratégias e ferramentas de inteligência artificial e aprendizado de máquina ajudou a resolver problemas diagnósticos e prognósticos em diversas áreas médicas. O ML é usado para avaliar a importância dos fatores clínicos e suas combinações para o prognóstico, como previsão da progressão da doença, extração de conhecimento médico para pesquisa de resultados, planejamento e suporte terapêutico, e atendimento geralao paciente 10. Com grandes volumes de dados médicos disponíveis, os profissionais de saúde agora têm um recurso valioso para descobrir novos e potencialmente valiosos conhecimentos por meio do aprendizadode máquina 11,12.
Utilizando um conjunto de dados clínico simples do conjunto de dados saudita, este estudo visa ajudar os profissionais de saúde do país a diagnosticar o hipotireoidismo precocemente e implementar esse sistema preditivo em hospitais com recursos e equipamentos computacionais limitados. Além disso, estudos anteriores nessa área não utilizaram o conjunto de dados saudita. Isso representa uma oportunidade para incorporar o conjunto de dados saudita junto a pesquisas anteriores. Os estudos utilizaram um conjunto de dados saudita para prever doença renal, diabetes, tireoide e doença de Alzheimer, respectivamente, alcançando alta precisão13, 14 e 15. Essa experiência motiva a aplicação desses métodos a outras doenças na Arábia Saudita. Os estudos estão entre os trabalhos mais recentes em aprendizado de máquina e inteligência artificial na área médica 16,17,18,19.
O estudo proposto discute a implantação de técnicas de aprendizado de máquina em um simples conjunto clínico saudita para hipotireoidismo, a fim de prever a presença da doença antes que ela se torne totalmente sintomática. O objetivo é desenvolver um sistema baseado em aprendizado de máquina que forneça alertas precoces sobre uma possível ocorrência de hipotireoidismo. Também facilitará o uso desse sistema de diagnóstico por hospitais locais com equipamentos limitados. Este estudo é o primeiro a examinar essa doença usando o conjunto de dados saudita, focando no estágio pré-sintomático. O conjunto de dados cobre uma ampla população de pacientes hospitalares sauditas locais, com uma ampla faixa etária e uma mistura de casos positivos e negativos de hipertireoidismo.
Este estudo utilizou quatro algoritmos de aprendizado de máquina: machine de suporte vetorial (SVM), K-vizinhos mais próximos (KNN), eXtreme gradient boosting (XGBoost) e um classificador de conjunto de votação suave composto por SVM e KNN. Cada um dos quatro algoritmos já provou suas capacidades na área médica. O algoritmo KNN foi selecionado por sua simplicidade e por alcançar uma precisão de 77,5% nos testes no diagnóstico preventivo de diabetes mellitus (DM)20. Ao mesmo tempo, a SVM foi escolhida por sua robustez21, e recentemente tem sido usada para prever o risco de mortalidade em pacientes comCOVID-19 22. Além disso, o XGBoost foi selecionado por seu forte desempenho23, alcançando uma pontuação preditiva precisa de 94% para desfechos de hipertensão, e o empilhamento foi empregado para aprimorar os resultados dos algoritmos de melhor desempenho. Além disso, um classificador de conjunto de votação foi utilizado para identificar distúrbios da tireoide com 100% de precisão24.
O objetivo principal do estudo atual é o diagnóstico precoce do hipotireoidismo em uma população saudita, utilizando dados clínicos rotineiros originais e algoritmos de aprendizado de máquina de última geração. As quatro técnicas usadas neste estudo foram implementadas na plataforma Jupyter usando a linguagem de programação Python, utilizando o conjunto de dados de hipotireoidismo. A validação cruzada de 10 vezes com ajuste de hiperparâmetros foi usada para melhorar o desempenho. A seleção sequencial de características com técnica de seleção frontal foi então implementada, resultando no classificador do conjunto de votação alcançando a maior precisão de 94,7%. SVM, KNN e XGBoost, respectivamente, seguiram-na. Quanto à recall, o classificador de conjunto de votação suave alcançou a maior pontuação, com 95,5%. No geral, o modelo ideal para o diagnóstico preventivo de hipotireoidismo foi o classificador de conjunto de votação suave, que alcançou a maior pontuação em todas as medidas de desempenho avaliadas neste estudo.
Diversos estudos foram realizados para diagnosticar distúrbios gerais da tireoide e para implementar tecnologias, especialmente aprendizado de máquina, como solução assistida por computador. LSTM-CNN, AlexNet, os modelos ajustados de GoogLeNet, IndRNN–CNN e os modelos ajustados de aprendizado profundo ResNet foram implantados usando espectroscopia Raman para distinguir amostras séricas de 32 pacientes com hipotireoidismo, 38 pacientes com hipertireoidismo e 29 sujeitos controle. O modelo deles obteve precisão de 84%, 91%, 75%, 82% e 71%, respectivamente25%.
Algoritmos de aprendizado de máquina como SVM, KNN, regressão logística e floresta aleatória têm sido utilizados para prever a incidência de hipotireoidismo induzido por radiação em pacientes com carcinomanasofaríngeo 26. O modelo deles alcançou um valor AUC de 0,7. Além disso, os autores utilizaram vários algoritmos de aprendizado de máquina para prever a tendência de tratamento de pacientes com hipotireoidismo que receberam tratamento com LT4. Entre 10 classificadores, o classificador extra-tree alcançou a maior precisão de 84%.
Em outro estudo, os autores criaram e testaram uma estratégia de aprendizado de máquina para identificar pessoas com hipertireoidismo e hipotireoidismo que se beneficiariam de tratamento médicoimediato 27. Eles implementaram árvore de decisão de gradiente boosting (GBDT), SVM, ANN e algoritmos de regressão logística. Seus modelos obtiveram um AUROC de 93,8% e 90,9% para hipertireoidismo e hipotireoidismo, respectivamente. Em outro estudo, os autores usaram aprendizado de máquina para detectar distúrbios da tireoide, que incluem hipotireoidismo e hipertireoidismo. Seus modelos incluíam SVM, ANN, KNN, regressão logística e árvore de decisão, com a maior precisão de 96,92% alcançada pela RegressãoLogística 28. Recentemente, um grupo de pesquisadores aplicou diferentes métodos, incluindo SVM, árvore de decisão, Naïve Bayes e ensemble, para prever e detectar hipotireoidismo. A árvore de decisão alcançou a maior precisão, com 97,6%29. Outro estudo aplicou o algoritmo de Naïve Bayes baseado no núcleo híbrido de evolução diferencial para reduzir os atributos de um conjunto de dados de tireoide de hipertireoidismo e doenças hipotireoidistas de 21 para 10. Posteriormente, aplicaram o classificador Naïve Bayes baseado em kernel ao subconjunto de características, alcançando 97,97% de precisão30. Da mesma forma, em outro estudo, os autores usaram vários algoritmos de aprendizado de máquina para prever o risco de doença da tireoide no conjunto de dados de doença-eutireoide da Universidade da Califórnia. O experimento demonstrou que a RNA superou todos os outros métodos, alcançando uma precisão de 95%31. Além disso, Jha et al. utilizaram técnicas propostas de aumento de características baseadas em redes neurais profundas para prever doenças da tireoide, alcançando uma precisão excepcional de 99,95%32.
De acordo com literatura anterior, um conjunto de votação homogêneo com seleção múltipla de atributos foi usado para identificar doenças da tireoide, empregando os seguintes algoritmos: floresta aleatória, aumento de gradiente, árvore de decisão e regressão logística, obtendo 100% de precisão24. Além disso, os autores aplicaram o modelo de máquina de aprendizado extremo ao conjunto de dados de acesso aberto para hipotireoidismo no Kaggle, alcançando 92% de precisão. O conjunto de dados continha 3772 amostras: 3481 hipotireoidiana e o restantenegativo 33. Recentemente, em um estudo, os autores utilizaram CART embalado para classificar o hipotireoidismo. O modelo proposto deles alcançou uma impressionante precisão de 99,9%. Além disso, T4U, TSH e TBG foram identificados como os fatores mais significativos associados ao hipotireoidismo34. Em outro estudo, os autores propuseram e compararam diferentes modelos de aprendizado de máquina e deep learning, nos quais a árvore de decisão e a floresta aleatória alcançaram uma precisão de 99,5% e 99,3%, respectivamente. Eles usaram um conjunto de dados Weka contendo 30 atributos e 3772amostras, 35.
Esta breve revisão da literatura demonstra que, embora a maioria dos métodos empregados tenha alcançado resultados muito bons a excelentes, nenhum utilizou um conjunto de dados clínico simples da Arábia Saudita. Também foi observado que a maioria das publicações em análise utilizava conjuntos de dados de imagem, o que aumentou o trabalho necessário para a coleta de dados e aumentou a dificuldade de aplicar modelos muito complexos criados por pessoas não técnicas. Além disso, a maioria desses trabalhos foi feita sobre distúrbios gerais da tireoide, com pouquíssimas publicações enfatizando o hipotireoidismo. Essa situação oferece uma oportunidade para investigar modelos básicos de aprendizado de máquina em um conjunto de dados clínico simples do conjunto de dados saudita para auxiliar hospitais locais com equipamentos computadorizados limitados a diagnosticar preventivamente a doença.
A breve introdução aos algoritmos investigados no estudo atual é apresentada no Arquivo Suplementar 1. Os quatro algoritmos são K-Nearest Neighbor (KNN)36,37,38,39,40, Support Vector Machine (SVM)41,42,43,44,45, Extreme Gradient Boosting (XGBoost)46,47,48 e conjunto de votação 49,50.