O aprendizado de máquina com biomarcadores multimodais aprimora a previsão e o monitoramento de doenças, oferecendo promessa para avanços em saúde em diversos domínios, melhorando os resultados da saúde por meio da previsão precisa da doença.
Research Article
O aprendizado de máquina com biomarcadores multimodais aprimora a previsão e o monitoramento de doenças, oferecendo promessa para avanços em saúde em diversos domínios, melhorando os resultados da saúde por meio da previsão precisa da doença.
Todos os anos, muitas pessoas ao redor do mundo são progressivamente afetadas pelas condições devastadoras de problemas de saúde, como doenças cardíacas, infecções respiratórias, disfunção neurológica, estresse cognitivo, câncer, derrame, diabetes, etc., que levam a complicações graves de saúde e anomalias associadas. Assim, análises precoces de saúde são cruciais, pois possibilitam intervenções oportunas com terapias direcionadas, potencialmente proporcionando alívio imediato e benefícios sustentados a longo prazo que podem retardar a progressão da doença. Devido aos complexos processos fisiopatológicos e aos ensaios clínicos heterogêneos em diversas condições de saúde, há necessidade de biomarcadores altamente sensíveis e multimodais, além de abordagens investigativas eficazes para detectar e monitorar com precisão os resultados de saúde dos pacientes. Portanto, algoritmos de aprendizado de máquina com várias categorias e técnicas são considerados para prever resultados, incluindo prognóstico, avaliação de risco, estratificação de pacientes e monitoramento de doenças. O fluxo do trabalho proposto é dividido em três etapas, já que a primeira etapa define a importância da saúde com estudos de caso, seguida pelos tradicionais algoritmos de Aprendizado de Máquina (ML), abordagens tradicionais de Deep Learning (DL) e técnicas modernas de DL (TabNet e AutoInt) na segunda etapa. Por fim, os experimentos são implementados para justificar os resultados. Este trabalho destaca o agrupamento de modalidades ao integrar biomarcadores moleculares de proteínas, químicos e genéticos com características emergentes do ML. Os resultados indicam uma melhora significativa na previsão da precisão usando a metodologia proposta.
O sistema de saúde está utilizando cada vez mais análises preditivas para monitorar os pacientes e diagnosticar os resultados de saúde de forma oportuna, facilitando o cuidado proativo e melhorando os resultados dos pacientes. Ao integrar análises preditivas com biomarcadores, os profissionais podem aumentar a precisão do diagnóstico, identificar tratamentos eficazes, monitorar o progresso da terapia e obter insights valiosos sobre os mecanismos da doença, levando a decisões de tratamento mais informadas e eficazes. Biomarcadores referem-se às características de moléculas biológicas ou indicadores encontrados em amostras, como biofluidos, tecidos, células, DNA, RNA, sangue e urina, que medem a presença ou progressão de uma doença no corpo humano, ajudando a avaliar a eficácia dotratamento 1.
Os avanços na aplicação de biomarcadores moleculares desempenham um papel crucial na medicina personalizada, medindo com precisão moléculas específicas para identificar problemas de saúde únicos em pacientes, possibilitando estratégias de tratamento direcionadas desde os estágiosiniciais 2. No futuro, abordagens multimodais ajudarão a integrar múltiplas modalidades de padrões complexos de doenças, permitindo uma identificação mais precisa do prognóstico de doenças em câncer e doenças neurodegenerativas por meio de técnicas avançadas de análisepreditiva 3. A metodologia de ponta utiliza dados multi-ômicos, bioinformática e algoritmos de ML para identificar novos biomarcadores, possibilitando o perfilamento de risco específico para cada paciente e estratégias subjetivas de tratamento para doenças cardiovasculares (DCV) e outras doençascomplexas 4. A combinação de biomarcadores moleculares e abordagens multi-ômicas tem potencial para aumentar a precisão diagnóstica e a estratificação terapêutica em doenças neurológicas5.
Com o avanço das técnicas de ML, biomarcadores moleculares multimodais podem integrar diversos tipos de dados para identificar novas assinaturas de doenças em diversas condições de saúde, permitindo diagnósticos mais precisos e estratégias de tratamento personalizadas. Aproveitando esse potencial, o autor explora várias técnicas de ML na saúde para prever fatores de risco para diagnóstico de doenças e destaca sua importância em diferentes setoresda saúde 6. Com a ML transformando o diagnóstico e o tratamento de doenças, as clínicas farmacêuticas estão cada vez mais utilizando algoritmos de tomada de decisão para analisar os resultados de saúde dos pacientes e atender às suas necessidades diárias, possibilitando um cuidado mais informadoe eficaz 7. Aproveitando a potencial necessidade de integração multimodal de dados, este estudo desenvolveu biomarcadores usando dados multimodais (ressonância magnética e genética) para prever o desenvolvimento e a progressão da doença de Alzheimer, mostrando que dados genéticos previam melhor a progressão futura do Alzheimer em sujeitos controles normais, enquanto os dados de ressonância magnética caracterizaram melhor o comprometimento cognitivo leve estável, combinando ambos, desempenho de classificação de melhorqualidade 8.
Avançando ainda mais na aplicação da análise multimodal de dados, o aprendizado profundo multimodal utiliza dados de expressão gênica para identificar medicamentos que direcionam linhas celulares específicas de moléculas biológicas novas, elucidando assim como variações genômicas influenciam a resposta aotratamento 9. Em conjunto com avanços na análise multimodal de dados, biomarcadores não invasivos, avaliados usando métricas de IA e ML, estão emergindo como ferramentas promissoras para diagnóstico, com perfis de especificidade e sensibilidade variados em comparação com biomarcadores invasivos, dependendo da aplicação específica e do contextodos dados 10. Em linha com a crescente importância da análise multimodal de dados, modelos de conjunto de Deep Learning (DL) podem lidar eficazmente com dados complexos ao integrar novos biomarcadores, incluindo interações gene-proteína, para aprimorar a pesquisa sobre câncer e otimizar estratégiasde tratamento 11. À medida que os modelos de conjunto DL continuam a avançar na pesquisa sobre câncer, a análise preditiva desempenha um papel crucial no diagnóstico e tratamento da doença, analisando grandes quantidades de dados coletivos de múltiplas fontes, incluindo diversas condições de saúde, para fornecer uma visão abrangente do status, como avaliação de risco ediagnóstico 12.
O objetivo do protocolo proposto é implementar algoritmos baseados em ML e DL que integrem os marcadores biológicos distintos para aumentar a precisão das análises em saúde. Técnicas convencionais de predição que utilizam biomarcadores normalmente dependem de dados de modalidade única e modelos estatísticos lineares, que podem não capturar adequadamente as relações intrincadas e não lineares que influenciam o desenvolvimento da doença e as diferenças individuais. A incorporação de grandes volumes de dados de observações, registros eletrônicos de saúde, leituras laboratoriais, medições físicas e avaliações clínicas oferece uma oportunidade significativa para sintetizar e otimizar a avaliação de risco no diagnósticode paciente 13. Biomarcadores desempenham um papel crucial na medicina de precisão, permitindo tratamentos direcionados no momento certo. Embora os biomarcadores sejam complexos e representem desafios na medição de subtipos de doenças e crescimento molecular, eles são inestimáveis para avaliar reações tóxicas sob diversas condições anormais, facilitando assim análises adicionais. Ao utilizar biomarcadores durante a observação clínica, os profissionais de saúde podem prever com mais precisão a progressão da doença e monitorar as respostas ao tratamento. Em última análise, a convergência de biomarcadores moleculares multimodais na análise de dados em saúde com IA permite um reconhecimento de padrões mais eficaz, combinando características existentes para mitigar o impacto clínico.
Quando comparados a abordagens de ponta, especialmente o trabalho de Somepalli et al.14, onde os autores propuseram algoritmos de ML em dados genômicos, como dados metabólicos, epigenéticos e proteômicos, e propuseram diretrizes gerais para a seleção de algoritmos de ML. No entanto, há uma limitação na análise dos dados. No trabalhoexistente, 15 métodos de integração não supervisionada foram aplicados a dados ômicos, focando em desafios computacionais. Em contraste, há limitações no escopo e na análise dos métodos. Além disso, Huang et al.16 abordaram a maioria dos métodos de DL para análise de diversas aplicações, visando compreender o poder do big data e dos frameworks computacionais. As desvantagens incluíam desequilíbrio de dados, superajuste e questões de interpretação. O protocolo proposto é crucial para abordar uma lacuna crítica na pesquisa integrativa de biomarcadores, já que as técnicas atuais não combinam efetivamente dados biológicos de alta dimensão e diversidade. Ao utilizar ML e DL sofisticados que se destacam em reconhecimento de padrões, seleção de características e fusão multimodal, a submissão proposta visa identificar assinaturas preditivas robustas que melhorem o diagnóstico precoce, o prognóstico e as opções individuais de tratamento. Este protocolo aborda diretamente as limitações das avaliações de biomarcadores desconexas ao apresentar um modelo abrangente e orientado por dados que permite previsões de saúde escaláveis, interpretáveis e clinicamente relevantes.
Access restricted. Please log in or start a trial to view this content.
1. Fluxo de trabalho experimental
A Figura 1 ilustra um fluxo de trabalho organizado e modular projetado para categorizar biomarcadores moleculares em categorias de Risco ou Indicação Diagnóstica, utilizando técnicas de aprendizado de máquina e deep learning. Aqui está uma explicação detalhada, passo a passo, do processo:

Figura 1: Diagrama de fluxo do trabalho proposto. O fluxo de trabalho do problema proposto está representado nesta figura. As etapas são pré-processamento de dados, engenharia de características, desenvolvimento de modelos, divisão, avaliação de modelos usando métricas e análise de biomarcadores. Por favor, clique aqui para ver uma versão ampliada desta figura.
2. Descrição do conjunto de dados
O nome do conjunto de dados é all_sequence_variants com extensão csv. Existem colunas com nomes como 'id', 'variação', 'posição', 'external_link', 'gene_symbol', 'entrez_gene_id', 'referência', condições', 'indication_types', onde todas são do tipo objeto, exceto id como tipo int e entrez_gene_id como tipo float. O número total de linhas é 42.818 com 9 colunas. Além disso, o conjunto de dados possui valores nulos para variação, posição, external_link, entrez_gene_id, referência, condições e indication_types. O conjunto de dados é retirado do link fornecido como: https://markerdb.ca/downloads17
3. Pré-processamento de conjunto de dados
Nessa etapa, o pré-processamento de dados começa com a coleta de informações do conjunto de dados, descrição, identificação de duplicados e localização de valores ausentes/nulos. Não há impacto da característica external_link quando medida pelo coeficiente de correlação, e, portanto, ela é removida. Os valores nulos das colunas categóricas e numéricas são preenchidos com a mediana e a média, respectivamente. Por fim, a forma do conjunto de dados de entrada e saída é (42787, 6)(42787,). As colunas de entrada são 'id', 'variação', 'posição', 'gene_symbol', 'entrez_gene_id', 'condições', enquanto a coluna alvo é indication_types.
4. Biomarcadores: Categorias, desafios de dados e o papel do risco molecular
Um biomarcador é uma característica quantificável que indica atividades biológicas normais ou anormais ou respostas a várias exposições ou intervenções. Os biomarcadores podem ser de natureza molecular, histológica, radiográfica ou fisiológica e são divididos em sete categorias principais: (1) Um biomarcador diagnóstico determina se um indivíduo possui uma doença ou distúrbio específico e se ele pertence a um subtipo, (2) Um biomarcador de monitoramento indica a progressão de uma doença e sua resposta ao tratamento, (3) Um biomarcador de resposta mostra se o paciente está reagindo a um medicamento ou terapia, como uma alteração na frequência cardíaca, (4) Um biomarcador preditivo pode determinar se um indivíduo está em risco de desenvolver determinada doença e como pode responder a um tratamento específico, (5) Um biomarcador prognóstico pode oferecer insights sobre a probabilidade de progressão ou recorrência da doença caso o paciente esteja predisposto a um determinado desfecho de saúde, (6) Um biomarcador de risco avalia o nível potencial de risco para uma condição antes que o paciente receba um diagnóstico oficial, e (7) Um biomarcador de segurança avalia o potencial para reações tóxicas ou adversas que possam surgir do tratamento. Este estudo foca principalmente na análise de biomarcadores moleculares relacionados à avaliação de riscos e diagnósticos, conforme descrito na Figura 2. Dada a enorme quantidade de dados clínicos disponíveis mundialmente, os biomarcadores são essenciais para orientar decisões clínicas, avançar pesquisas e facilitar a medicina personalizada.

Figura 2: Categoria de biomarcadores para tomada de decisão clínica. As decisões do biomarcador são representadas neste diagrama. Com base nas análises aplicadas aos biomarcadores, decisões clínicas são consideradas e algoritmos de ML são implementados. Por favor, clique aqui para ver uma versão ampliada desta figura.
Encontrar e compreender informações clinicamente úteis sobre biomarcadores é desafiador devido à grande variedade de tipos, características e qualidades dos biomarcadores. O rápido crescimento dos estudos de biomarcadores nas últimas duas décadas complicou ainda mais o acesso a dados abrangentes e atualizados, especialmente para biomarcadores moleculares. Isso levou a questões como achados inconsistentes, redescoberta redundante de biomarcadores existentes, resultados contraditórios e oportunidades negligenciadas de utilizar biomarcadoresestabelecidos 18. O surgimento das medições "ômicas" agravou esse problema, resultando na proliferação de novos biomarcadores moleculares em testes clínicos e na literatura, o que torna cada vez mais difícil navegar e aplicar o conhecimento sobre biomarcadoresde forma eficaz 19.
O MarkerDB 2.0 oferece acesso a diversos biomarcadores moleculares para finsexperimentais 20. Diversos biomarcadores são utilizados em pesquisas clínicas e aplicações de saúde para diagnosticar, prever e monitorar doenças. Entre eles, biomarcadores proteicos utilizam biofluidos como soro, sangue, líquido cefalorraquidiano (LCR), líquido peritoneal, líquido amniótico, plasma e urina para analisar condições como diabetes mellitus, tuberculose, síndrome de Down e distúrbios relacionados à miopatia. Da mesma forma, biomarcadores genéticos utilizam símbolos genéticos como LRP1, LPP, MAPT e SPI1 para analisar condições como degeneração macular relacionada à idade, doenças alérgicas, doença de Alzheimer, câncer e asma. Além disso, biomarcadores moleculares multimodais ajudam a medir o risco do paciente e indicadoresdiagnósticos 21. Este trabalho destaca a necessidade de análises em saúde utilizando abordagens de ML para aprimorar o diagnóstico, a previsão e o tratamento personalizado de doenças.
5. Modelagem de abordagens estatísticas de ML para descoberta de biomarcadores
A aplicação de abordagens de ML transformou o campo da saúde de diversas maneiras. Especificamente, biomarcadores moleculares foram analisados usando várias técnicas de ML, incluindo Análise de Componentes Principais (PCA), clustering K-means (KMA), Análise de Vizinhos Mais Próximos (NNA) e algoritmosde redes neurais 22. Esses modelos identificam padrões complexos a partir de características escolhidas, gerenciam dados incompletos ou inconsistentes e suportam o acompanhamento em tempo real do avanço da doença. Além de diagnosticar doenças, algoritmos de ML fornecem insights significativos sobre questões dos pacientes por meio de exame e visualização de dados, possibilitando um atendimento rápido edirecionado 23. Como resultado, isso melhora os resultados de saúde dos pacientes em condições incomuns. Além disso, a capacidade da ML de revolucionar a descoberta de biomarcadores e os resultados terapêuticos em diversas doenças, incluindo a análise de biomarcadores moleculares, está se tornando cada vez mais vibrante.
Os algoritmos de ML são categorizados em cinco tipos principais, conforme apresentado na Figura 3. Aprendizagem supervisionada é o processo de treinamento em conjuntos de dados rotulados para entender as relações entrada-saída, tornando-a ideal para tarefas como classificação e regressão, como árvores de decisão e máquinas de vetores de suporte. O aprendizado não supervisionado identifica padrões dentro de dados não rotulados e é frequentemente aplicado para agrupamento e redução de dimensionalidade, com técnicas como clusterização k-means e análise de componentes principais. O aprendizado semi-supervisionado combina dados rotulados e não rotulados para gerar previsões. A aprendizagem por reforço foca na tomada de decisões informadas pelo feedback do ambiente, e é frequentemente usada em jogos e robótica, com métodos como Q-learning e redes profundas de aprendizado por reforço. O deep learning utiliza redes neurais artificiais com múltiplas camadas para identificar padrões intrincados nos dados. Essa técnica ajuda a prever biomarcadores para doenças comuns, incluindo câncer, AVC, doença de Alzheimer e doença de Parkinson. Diversos programas clinicamente aprovados utilizam essatecnologia 24,25. O diagnóstico preciso de pacientes com tumores malignos normalmente depende da aquisição e análise patológica de amostras de tecido, que fornecem informações críticas sobre grau histológico, subtipo, estágio e vários outros biomarcadores tumorais.

Figura 3: Categorização de algoritmos de aprendizado de máquina para tomada de decisão clínica. Os tipos de algoritmos de ML no diagrama são ilustrados para ajudar a entender a metodologia aplicada. Por favor, clique aqui para ver uma versão ampliada desta figura.
Estatística e ML são duas disciplinas separadas que frequentemente se cruzam. Estatística envolve coletar, analisar e interpretar dados, normalmente trabalhando com conjuntos de dados menores e bem definidos, e foca principalmente em comparar e resumir informações. Por outro lado, ML é um subconjunto da inteligência artificial que cria modelos preditivos, frequentemente lidando com conjuntos de dados grandes e complexos. Embora a estatística desempenhe um papel importante na pesquisa confirmatória e na compreensão dos mecanismos subjacentes, a aprendizagem automática é mais eficaz em pesquisas exploratórias, na descoberta de padrões complexos e no gerenciamento de dados ausentes. Métodos como regressão logística podem ser considerados tanto como modelos estatísticos quanto como modelos de ML supervisionado, ilustrando as distinções tênues entre os dois domínios. Em última análise, os pesquisadores devem avaliar seus objetivos de pesquisa e a natureza de seus dados para selecionar o método mais adequado.
6. Modelagem de MLP e Variantes de MLP
MLP, também conhecido como perceptron multicamada, é um tipo de arquitetura de rede neural que apresenta múltiplas camadas de neurônios entre as camadas de entrada e saída, conforme ilustrado na Figura 4. O MLP foi introduzido na década de 1950 e ganhou amplo uso com o progresso e avanços na retropropagação na década de 1980, o que ajudou a minimizar a perda. Os princípios básicos de aprendizado do MLP são redes neurais, pesos e valores de viés para calcular a saída. Por fim, conhecer a função de ativação e o valor do limiar para obter a saída na camada de saída. Na metodologia proposta, os nós na camada de entrada, camada oculta e camada de saída correspondem a características clínicas e gênicas, camadas totalmente conectadas com ativação ReLU e um único neurônio com ativação sigmoide para prever o resultado binário do tipo de indicação (Risco, Diagnóstico), respectivamente. As principais vantagens são que são fáceis de treinar e interpretar. No entanto, o MLP simples não consegue lidar com grandes conjuntos de dados e é sensível à taxa de aprendizado26. Portanto, para superar essas desvantagens, o MLP com Learning Rate Scheduler é considerado com a arquitetura apresentada na Figura 3B. MLP com LR é um mecanismo dinâmico poderoso com decaimento acentuado, decaimento exponencial, decaimento inverso do tempo, ReduceLROnPlateau e recozimento cosseno. Em vez de um valor LR fixo, a taxa de aprendizado muda com base no desempenho e treinamento do modelo.

Figura 4: Modelagem de Perceptron e MLP multicamadas com um agendador LR. (A) Perceptron Multicamada: A estrutura do MLP é ilustrada com a Camada de Entrada, Camada Oculta e Camada de Saída. A primeira camada recebe a entrada e a processa na segunda camada com ativações, e a saída é recebida na última camada. MLP é simples de implementar. (B) MLP com LR Scheduler: Isso é semelhante ao MLP; no entanto, um Agendador de Taxa de Aprendizagem é adicionado para controlar a velocidade de treinamento e obter uma melhor taxa de convergência. A taxa de aprendizado é reduzida em um platô. Isso reduz os mínimos ultrapassando. Por favor, clique aqui para ver uma versão ampliada desta figura.
Essa abordagem é mais eficiente, confiável e eficaz para dados tabulares. Além disso, há benefícios como melhoria estável da convergência em dados ruidosos, maior generalização e redução do esforço na sintonia dos hiperparâmetros. No entanto, para algumas tarefas de previsão, podem surgir dificuldades, como ficar preso em mínimos locais. Além disso, na arquitetura ampla e profunda do MLP apresentada na Figura 5, componentes amplos e profundos são introduzidos no MLP para se destacar em mapeamento de correlação, memorização de regras e aprendizado de novos padrões, mantendo altos padrões de generalização. Ao combinar esses aspectos na camada de saída, a saída binária é previstaem 27. No entanto, há limitações na generalização de características invisíveis e na supergeneralização. Em conclusão, MLP com Batch Norm e Dropout é usado para normalizar o processo de treinamento, incorporando o dropout para aprendizado e a generalização de atributos desconhecidos. Em particular, essa técnica pode ser aplicada a dados de alta dimensão e ajuda a evitar o sobreajuste. No entanto, essa técnica sofre com limitações no tamanho do lote, aumento do consumo de memória (devido às camadas de Normalização em Lote) e não é uma solução universal28,29.

Figura 5: Modelagem de rede MLP ampla e Deep. O diagrama ilustra o caminho profundo do MLP, que pode capturar relações não lineares e combina a saída com uma unidade sigmoide para classificação. Essa arquitetura captura aprendizado de padrões e conhecimento para dados heterogêneos de biomarcadores. Por favor, clique aqui para ver uma versão ampliada desta figura.
7. TabNet
A TabNet é um modelo de aprendizado profundo conhecido como Rede Tabular, desenvolvido pela equipe de pesquisado Google 30. A principal motivação do modelo TabNet é conciliar as diferenças entre as abordagens de DL para imagem, texto, fala (CNN, Autoencoder, Transformers) e ML baseada em árvores (XGBoost, Random Forest, LightGBM). Além disso, as limitações das abordagens DL têm um enorme impacto no modelo TabNet, sendo o MLP um modelo parametrizado. Acima de tudo, as abordagens DL carecem de interpretação em problemas do mundo real, aprendizagem auto-supervisionada e capacidade de aprendizagemsequencial 31. Os modelos TabNet estão restritos a aplicações como previsão de riscode seguro 32, estimativa de conteúdo de cinzas de carvão33, previsão de toxicidadequímica 34 e detecção de trapaça em testeseducacionais 35. A arquitetura do TabNet é apresentada na Figura 6.

Figura 6: Modelagem de rede tabular. A rede tabular recebe características de entrada em formato tabular e aplica a técnica do transformador de forma sequencial em cada bloco. O bloco GLU, também conhecido como bloco de Unidade Linear Gated, controla o fluxo de informação pela rede, facilitando a seleção de características e o aprendizado estável. A saída é apresentada na camada de saída a partir da saída acumulada. Por favor, clique aqui para ver uma versão ampliada desta figura.
A partir do diagrama arquitetônico acima, o sistema é dividido em quatro componentes: bloco de entrada, Transformador de Características Compartilhadas, Etapas de Decisão Sequenciais e o cálculo de perdas usando otimização. Nas características categóricas, as características são convertidas em inteiros seguindo a camada de embedding. Ao mesmo tempo, as características contínuas são tomadas como são. Finalmente, as características são convertidas em um vetor unificado onde x ∈ Rd. Na próxima etapa, camadas totalmente conectadas com funções de ativação são implementadas, seguidas por uma transformação para converter os dados em vetor, e uma decisão é tomada. Na terceira etapa, o transformador de atenção, o mascaramento, o transformador de decisão e a acumulação de previsões são usados em sucessão. Os objetivos dessa etapa são atenção seletiva, raciocínio sequencial e caminhos de decisão. Na última etapa, são usados métodos binários de entropia cruzada ou similares para encontrar a perda e otimizar o valor. Além disso, a regularização é realizada usando atenção esparsa para evitar o sobreajuste.
8. AutoInt
Aprendizagem Automática de Interação de Características via Redes Neurais Auto-Atentas (AutoInt) é a forma completa de AutoInt, introduzida na previsão de taxa de cliques (CTR)36 e posteriormente aplicada a várias aplicações, incluindo previsão de defeitosde software 37, sistemas derecomendação 38 e detecção degenoma 39. Existem limitações nas abordagens existentes de ML, incluindo o manuseio de dados esparsos de alta dimensão, características combinatórias de ordem superior, compreensão da capacidade de previsão da característica e a necessidade de engenharia manual de características. Todos esses desafios mencionados são abordados pelo modelo AutoInt com eficiência, eficácia e explicabilidade. O objetivo do AutoInt na metodologia proposta é prever se a variante dada é do tipo de indicação de Risco ou Diagnóstico. São propostas sete etapas para o conjunto de dados fornecido, conforme mostrado na Figura 6, junto com o código-fonte. Primeiramente, a leitura de dados e o pré-processamento são implementados para codificar todas as características categóricas como inteiros e mapear os rótulos para 0 e 1 para Risco e Diagnóstico, respectivamente. Na segunda etapa, a representação de características é realizada para criar a matriz de incorporação; por sua vez, a matriz é convertida para normalizar as características numéricas. Existem camadas interagentes onde a interação automática neutra entre as características é aprendida sem interação manual com os transformadores. Além disso, múltiplas cabeças aprendem diferentes tipos de interações e, finalmente, as características são concatenadas, aprimorando a representação. Conexões residuais estão presentes para aprender tanto interações de ordem inferior quanto superior, como 1 característica, 2 características, 3 características, e assim por diante. Finalmente, a partir da rede residual, as saídas são passadas para a função sigmoide para cálculos de valores binários, como mostrado na Figura 7.

Figura 7: Modelagem da rede AutoInt. A Rede AutoInt aprende automaticamente as características, onde a camada de incorporação pega as características e as mapeia para a próxima camada usando um mecanismo de autoatenção e conexões residuais. O último componente possui a camada MLP e funções de ativação para produzir a saída. Por favor, clique aqui para ver uma versão ampliada desta figura.
Access restricted. Please log in or start a trial to view this content.
Os experimentos são realizados usando abordagens de ML e DL para comparar seu desempenho. Ao mesmo tempo, é considerada a criação de modelos de ML que utilizem tanto mecanismos de aprendizagem supervisionada quanto não supervisionada. As técnicas supervisionadas utilizadas nessa metodologia são Regressão Logística, Árvore de Decisão, Floresta Aleatória, Gradient Boost, Máquina de Vetores de Suporte e algoritmos K-Vizinho Mais Próximo. Esses algoritmos vão desde modelos estatísticos simpl...
Access restricted. Please log in or start a trial to view this content.
O trabalho proposto discute claramente a importância dos biomarcadores na identificação e monitoramento de uma doença e suas características. A abordagem sugerida para a metodologia de biomarcadores baseia-se em quatro etapas essenciais: preparação cuidadosa dos dados (limpeza, codificação, eliminação de identificadores); codificação uniforme de alvo (Risco=0, Diagnóstico=1); normalização de recursos e deep embedding de alta qualidade para modelos como AutoInt37/T...
Access restricted. Please log in or start a trial to view this content.
Os autores não têm nada a revelar.
Os autores não receberam financiamento externo.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| Modelo AutoInt | Universidade de Pequim | https://github.com/shichence/AutoInt | Aprendizagem Automática de Interação de Características via Redes Neurais Auto-Atentas: Algoritmo eficiente para aprender automaticamente interações de características de alta ordem para características categóricas e numéricas (esparsas) |
| deepctr_torch.modelos | Código aberto | https://github.com/shenweichen/DeepCTR-Torch | Pacote modular e extensível de modelos CTR baseados em deep learning para construir seu próprio modelo personalizado facilmente. |
| Colaboratório do Google | https://colab.research.google.com/ | Baseado em nuvem ambiente para escrever e executar código Python através do navegador para aprendizado de máquina e análise de dados | |
| Keras 2.6.0 | Keras | https://keras.io/ | Fornece uma interface em Python para execução de redes neurais que roda sobre o Tensorflow |
| MarkerDB 2.0 | MarkerDB | https://markerdb.ca/downloads | Banco de dados disponível publicamente de biomarcadores moleculares |
| Matplotlib 3.4.3 | Matplotlib | https://matplotlib.org/ | Biblioteca de visualização para python |
| Entorpecido 1.21.4 | Dormente | https://numpy.org/ | Pacote fundamental para computação científica com Python |
| Pandas 1.3.4 | Pandas | https://pandas.pydata.org/ | Ferramenta poderosa, flexível e fácil de usar de código aberto para análise e manipulação de dados, construída sobre a linguagem de programação Python. |
| Python 3.8.10 | Fundação de Software Python | https://www.python.org/ | Linguagem de programação popular que integra sistemas de aprendizado profundo de forma mais eficaz. |
| pytorch_tabnet.tab_model | Pytorch | https://pypi.org/project/pytorch-tabnet/ | Para implementar problemas de classificação binária/multiclasse e regressão. |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/ | Módulo Python para algoritmos de aprendizado de máquina |
| Seaborn | Seaborn | https://seaborn.pydata.org/ | Biblioteca de visualização de dados de alto nível para desenhar gráficos estatísticos atraentes e informativos |
| Modelo TabNet | https://github.com/dreamquark-ai/tabnet | TabNet é uma rede neural de ponta a ponta projetada para lidar diretamente com dados tabulares | |
| Tensorflow 2.6.0 | https://www.tensorflow.org/ | Uma plataforma de ponta a ponta para aprendizado de máquina |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission