Research Article

Biomarcadores Moleculares Multimodais Baseados em Aprendizado de Máquina para Análise Preditiva de Saúde

DOI:

10.3791/69241

January 16th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O aprendizado de máquina com biomarcadores multimodais aprimora a previsão e o monitoramento de doenças, oferecendo promessa para avanços em saúde em diversos domínios, melhorando os resultados da saúde por meio da previsão precisa da doença.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos os anos, muitas pessoas ao redor do mundo são progressivamente afetadas pelas condições devastadoras de problemas de saúde, como doenças cardíacas, infecções respiratórias, disfunção neurológica, estresse cognitivo, câncer, derrame, diabetes, etc., que levam a complicações graves de saúde e anomalias associadas. Assim, análises precoces de saúde são cruciais, pois possibilitam intervenções oportunas com terapias direcionadas, potencialmente proporcionando alívio imediato e benefícios sustentados a longo prazo que podem retardar a progressão da doença. Devido aos complexos processos fisiopatológicos e aos ensaios clínicos heterogêneos em diversas condições de saúde, há necessidade de biomarcadores altamente sensíveis e multimodais, além de abordagens investigativas eficazes para detectar e monitorar com precisão os resultados de saúde dos pacientes. Portanto, algoritmos de aprendizado de máquina com várias categorias e técnicas são considerados para prever resultados, incluindo prognóstico, avaliação de risco, estratificação de pacientes e monitoramento de doenças. O fluxo do trabalho proposto é dividido em três etapas, já que a primeira etapa define a importância da saúde com estudos de caso, seguida pelos tradicionais algoritmos de Aprendizado de Máquina (ML), abordagens tradicionais de Deep Learning (DL) e técnicas modernas de DL (TabNet e AutoInt) na segunda etapa. Por fim, os experimentos são implementados para justificar os resultados. Este trabalho destaca o agrupamento de modalidades ao integrar biomarcadores moleculares de proteínas, químicos e genéticos com características emergentes do ML. Os resultados indicam uma melhora significativa na previsão da precisão usando a metodologia proposta.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O sistema de saúde está utilizando cada vez mais análises preditivas para monitorar os pacientes e diagnosticar os resultados de saúde de forma oportuna, facilitando o cuidado proativo e melhorando os resultados dos pacientes. Ao integrar análises preditivas com biomarcadores, os profissionais podem aumentar a precisão do diagnóstico, identificar tratamentos eficazes, monitorar o progresso da terapia e obter insights valiosos sobre os mecanismos da doença, levando a decisões de tratamento mais informadas e eficazes. Biomarcadores referem-se às características de moléculas biológicas ou indicadores encontrados em amostras, como biofluidos, tecidos, células, DNA, RNA, sangue e urina, que medem a presença ou progressão de uma doença no corpo humano, ajudando a avaliar a eficácia dotratamento 1.

Os avanços na aplicação de biomarcadores moleculares desempenham um papel crucial na medicina personalizada, medindo com precisão moléculas específicas para identificar problemas de saúde únicos em pacientes, possibilitando estratégias de tratamento direcionadas desde os estágiosiniciais 2. No futuro, abordagens multimodais ajudarão a integrar múltiplas modalidades de padrões complexos de doenças, permitindo uma identificação mais precisa do prognóstico de doenças em câncer e doenças neurodegenerativas por meio de técnicas avançadas de análisepreditiva 3. A metodologia de ponta utiliza dados multi-ômicos, bioinformática e algoritmos de ML para identificar novos biomarcadores, possibilitando o perfilamento de risco específico para cada paciente e estratégias subjetivas de tratamento para doenças cardiovasculares (DCV) e outras doençascomplexas 4. A combinação de biomarcadores moleculares e abordagens multi-ômicas tem potencial para aumentar a precisão diagnóstica e a estratificação terapêutica em doenças neurológicas5.

Com o avanço das técnicas de ML, biomarcadores moleculares multimodais podem integrar diversos tipos de dados para identificar novas assinaturas de doenças em diversas condições de saúde, permitindo diagnósticos mais precisos e estratégias de tratamento personalizadas. Aproveitando esse potencial, o autor explora várias técnicas de ML na saúde para prever fatores de risco para diagnóstico de doenças e destaca sua importância em diferentes setoresda saúde 6. Com a ML transformando o diagnóstico e o tratamento de doenças, as clínicas farmacêuticas estão cada vez mais utilizando algoritmos de tomada de decisão para analisar os resultados de saúde dos pacientes e atender às suas necessidades diárias, possibilitando um cuidado mais informadoe eficaz 7. Aproveitando a potencial necessidade de integração multimodal de dados, este estudo desenvolveu biomarcadores usando dados multimodais (ressonância magnética e genética) para prever o desenvolvimento e a progressão da doença de Alzheimer, mostrando que dados genéticos previam melhor a progressão futura do Alzheimer em sujeitos controles normais, enquanto os dados de ressonância magnética caracterizaram melhor o comprometimento cognitivo leve estável, combinando ambos, desempenho de classificação de melhorqualidade 8.

Avançando ainda mais na aplicação da análise multimodal de dados, o aprendizado profundo multimodal utiliza dados de expressão gênica para identificar medicamentos que direcionam linhas celulares específicas de moléculas biológicas novas, elucidando assim como variações genômicas influenciam a resposta aotratamento 9. Em conjunto com avanços na análise multimodal de dados, biomarcadores não invasivos, avaliados usando métricas de IA e ML, estão emergindo como ferramentas promissoras para diagnóstico, com perfis de especificidade e sensibilidade variados em comparação com biomarcadores invasivos, dependendo da aplicação específica e do contextodos dados 10. Em linha com a crescente importância da análise multimodal de dados, modelos de conjunto de Deep Learning (DL) podem lidar eficazmente com dados complexos ao integrar novos biomarcadores, incluindo interações gene-proteína, para aprimorar a pesquisa sobre câncer e otimizar estratégiasde tratamento 11. À medida que os modelos de conjunto DL continuam a avançar na pesquisa sobre câncer, a análise preditiva desempenha um papel crucial no diagnóstico e tratamento da doença, analisando grandes quantidades de dados coletivos de múltiplas fontes, incluindo diversas condições de saúde, para fornecer uma visão abrangente do status, como avaliação de risco ediagnóstico 12.

O objetivo do protocolo proposto é implementar algoritmos baseados em ML e DL que integrem os marcadores biológicos distintos para aumentar a precisão das análises em saúde. Técnicas convencionais de predição que utilizam biomarcadores normalmente dependem de dados de modalidade única e modelos estatísticos lineares, que podem não capturar adequadamente as relações intrincadas e não lineares que influenciam o desenvolvimento da doença e as diferenças individuais. A incorporação de grandes volumes de dados de observações, registros eletrônicos de saúde, leituras laboratoriais, medições físicas e avaliações clínicas oferece uma oportunidade significativa para sintetizar e otimizar a avaliação de risco no diagnósticode paciente 13. Biomarcadores desempenham um papel crucial na medicina de precisão, permitindo tratamentos direcionados no momento certo. Embora os biomarcadores sejam complexos e representem desafios na medição de subtipos de doenças e crescimento molecular, eles são inestimáveis para avaliar reações tóxicas sob diversas condições anormais, facilitando assim análises adicionais. Ao utilizar biomarcadores durante a observação clínica, os profissionais de saúde podem prever com mais precisão a progressão da doença e monitorar as respostas ao tratamento. Em última análise, a convergência de biomarcadores moleculares multimodais na análise de dados em saúde com IA permite um reconhecimento de padrões mais eficaz, combinando características existentes para mitigar o impacto clínico.

Quando comparados a abordagens de ponta, especialmente o trabalho de Somepalli et al.14, onde os autores propuseram algoritmos de ML em dados genômicos, como dados metabólicos, epigenéticos e proteômicos, e propuseram diretrizes gerais para a seleção de algoritmos de ML. No entanto, há uma limitação na análise dos dados. No trabalhoexistente, 15 métodos de integração não supervisionada foram aplicados a dados ômicos, focando em desafios computacionais. Em contraste, há limitações no escopo e na análise dos métodos. Além disso, Huang et al.16 abordaram a maioria dos métodos de DL para análise de diversas aplicações, visando compreender o poder do big data e dos frameworks computacionais. As desvantagens incluíam desequilíbrio de dados, superajuste e questões de interpretação. O protocolo proposto é crucial para abordar uma lacuna crítica na pesquisa integrativa de biomarcadores, já que as técnicas atuais não combinam efetivamente dados biológicos de alta dimensão e diversidade. Ao utilizar ML e DL sofisticados que se destacam em reconhecimento de padrões, seleção de características e fusão multimodal, a submissão proposta visa identificar assinaturas preditivas robustas que melhorem o diagnóstico precoce, o prognóstico e as opções individuais de tratamento. Este protocolo aborda diretamente as limitações das avaliações de biomarcadores desconexas ao apresentar um modelo abrangente e orientado por dados que permite previsões de saúde escaláveis, interpretáveis e clinicamente relevantes.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Fluxo de trabalho experimental

A Figura 1 ilustra um fluxo de trabalho organizado e modular projetado para categorizar biomarcadores moleculares em categorias de Risco ou Indicação Diagnóstica, utilizando técnicas de aprendizado de máquina e deep learning. Aqui está uma explicação detalhada, passo a passo, do processo:

  1. Aquisição de conjuntos de dados
    O conjunto de dados é coletado do MarkerDB 2.0, um banco de dados curado de biomarcadores moleculares.
  2. Pré-processamento de dados
    Isso garante qualidade e consistência dos dados ao lidar com valores nulos e entradas ausentes, codificando características categóricas usando o LabelEncoder e escalando características numéricas (por exemplo, entrez_gene_id) usando o StandardScaler.
  3. Engenharia de características
    Recomenda-se selecionar características relevantes que influenciem a classificação de biomarcadores, previnam vazamentos de dados e melhorem o desempenho do modelo.
  4. Desenvolvimento de modelos
    As abordagens utilizadas são Regressão Logística, Floresta Aleatória, XGBoost, enquanto em DL: MLP, MLP com LR Scheduler, AutoInt, TabNet. As atividades realizadas são ajuste de hiperparâmetros, validação cruzada e otimização para tarefas de classificação.
  5. Divisão de dados
    Aqui, o Conjunto de treinamento (80%) é usado para aprender parâmetros do modelo, e o Set de teste (20%) é usado para avaliar o modelo com dados não vistos. Na etapa final, métricas de avaliação são usadas para garantir que o desempenho seja medido de forma holística, especialmente em cenários de classe desequilibrados.

figure-protocol-1
Figura 1: Diagrama de fluxo do trabalho proposto. O fluxo de trabalho do problema proposto está representado nesta figura. As etapas são pré-processamento de dados, engenharia de características, desenvolvimento de modelos, divisão, avaliação de modelos usando métricas e análise de biomarcadores. Por favor, clique aqui para ver uma versão ampliada desta figura.

2. Descrição do conjunto de dados

O nome do conjunto de dados é all_sequence_variants com extensão csv. Existem colunas com nomes como 'id', 'variação', 'posição', 'external_link', 'gene_symbol', 'entrez_gene_id', 'referência', condições', 'indication_types', onde todas são do tipo objeto, exceto id como tipo int e entrez_gene_id como tipo float. O número total de linhas é 42.818 com 9 colunas. Além disso, o conjunto de dados possui valores nulos para variação, posição, external_link, entrez_gene_id, referência, condições e indication_types. O conjunto de dados é retirado do link fornecido como: https://markerdb.ca/downloads17

3. Pré-processamento de conjunto de dados

Nessa etapa, o pré-processamento de dados começa com a coleta de informações do conjunto de dados, descrição, identificação de duplicados e localização de valores ausentes/nulos. Não há impacto da característica external_link quando medida pelo coeficiente de correlação, e, portanto, ela é removida. Os valores nulos das colunas categóricas e numéricas são preenchidos com a mediana e a média, respectivamente. Por fim, a forma do conjunto de dados de entrada e saída é (42787, 6)(42787,). As colunas de entrada são 'id', 'variação', 'posição', 'gene_symbol', 'entrez_gene_id', 'condições', enquanto a coluna alvo é indication_types.

4. Biomarcadores: Categorias, desafios de dados e o papel do risco molecular

Um biomarcador é uma característica quantificável que indica atividades biológicas normais ou anormais ou respostas a várias exposições ou intervenções. Os biomarcadores podem ser de natureza molecular, histológica, radiográfica ou fisiológica e são divididos em sete categorias principais: (1) Um biomarcador diagnóstico determina se um indivíduo possui uma doença ou distúrbio específico e se ele pertence a um subtipo, (2) Um biomarcador de monitoramento indica a progressão de uma doença e sua resposta ao tratamento, (3) Um biomarcador de resposta mostra se o paciente está reagindo a um medicamento ou terapia, como uma alteração na frequência cardíaca, (4) Um biomarcador preditivo pode determinar se um indivíduo está em risco de desenvolver determinada doença e como pode responder a um tratamento específico, (5) Um biomarcador prognóstico pode oferecer insights sobre a probabilidade de progressão ou recorrência da doença caso o paciente esteja predisposto a um determinado desfecho de saúde, (6) Um biomarcador de risco avalia o nível potencial de risco para uma condição antes que o paciente receba um diagnóstico oficial, e (7) Um biomarcador de segurança avalia o potencial para reações tóxicas ou adversas que possam surgir do tratamento. Este estudo foca principalmente na análise de biomarcadores moleculares relacionados à avaliação de riscos e diagnósticos, conforme descrito na Figura 2. Dada a enorme quantidade de dados clínicos disponíveis mundialmente, os biomarcadores são essenciais para orientar decisões clínicas, avançar pesquisas e facilitar a medicina personalizada.

figure-protocol-2
Figura 2: Categoria de biomarcadores para tomada de decisão clínica. As decisões do biomarcador são representadas neste diagrama. Com base nas análises aplicadas aos biomarcadores, decisões clínicas são consideradas e algoritmos de ML são implementados. Por favor, clique aqui para ver uma versão ampliada desta figura.

Encontrar e compreender informações clinicamente úteis sobre biomarcadores é desafiador devido à grande variedade de tipos, características e qualidades dos biomarcadores. O rápido crescimento dos estudos de biomarcadores nas últimas duas décadas complicou ainda mais o acesso a dados abrangentes e atualizados, especialmente para biomarcadores moleculares. Isso levou a questões como achados inconsistentes, redescoberta redundante de biomarcadores existentes, resultados contraditórios e oportunidades negligenciadas de utilizar biomarcadoresestabelecidos 18. O surgimento das medições "ômicas" agravou esse problema, resultando na proliferação de novos biomarcadores moleculares em testes clínicos e na literatura, o que torna cada vez mais difícil navegar e aplicar o conhecimento sobre biomarcadoresde forma eficaz 19.

O MarkerDB 2.0 oferece acesso a diversos biomarcadores moleculares para finsexperimentais 20. Diversos biomarcadores são utilizados em pesquisas clínicas e aplicações de saúde para diagnosticar, prever e monitorar doenças. Entre eles, biomarcadores proteicos utilizam biofluidos como soro, sangue, líquido cefalorraquidiano (LCR), líquido peritoneal, líquido amniótico, plasma e urina para analisar condições como diabetes mellitus, tuberculose, síndrome de Down e distúrbios relacionados à miopatia. Da mesma forma, biomarcadores genéticos utilizam símbolos genéticos como LRP1, LPP, MAPT e SPI1 para analisar condições como degeneração macular relacionada à idade, doenças alérgicas, doença de Alzheimer, câncer e asma. Além disso, biomarcadores moleculares multimodais ajudam a medir o risco do paciente e indicadoresdiagnósticos 21. Este trabalho destaca a necessidade de análises em saúde utilizando abordagens de ML para aprimorar o diagnóstico, a previsão e o tratamento personalizado de doenças.

5. Modelagem de abordagens estatísticas de ML para descoberta de biomarcadores

A aplicação de abordagens de ML transformou o campo da saúde de diversas maneiras. Especificamente, biomarcadores moleculares foram analisados usando várias técnicas de ML, incluindo Análise de Componentes Principais (PCA), clustering K-means (KMA), Análise de Vizinhos Mais Próximos (NNA) e algoritmosde redes neurais 22. Esses modelos identificam padrões complexos a partir de características escolhidas, gerenciam dados incompletos ou inconsistentes e suportam o acompanhamento em tempo real do avanço da doença. Além de diagnosticar doenças, algoritmos de ML fornecem insights significativos sobre questões dos pacientes por meio de exame e visualização de dados, possibilitando um atendimento rápido edirecionado 23. Como resultado, isso melhora os resultados de saúde dos pacientes em condições incomuns. Além disso, a capacidade da ML de revolucionar a descoberta de biomarcadores e os resultados terapêuticos em diversas doenças, incluindo a análise de biomarcadores moleculares, está se tornando cada vez mais vibrante.

Os algoritmos de ML são categorizados em cinco tipos principais, conforme apresentado na Figura 3. Aprendizagem supervisionada é o processo de treinamento em conjuntos de dados rotulados para entender as relações entrada-saída, tornando-a ideal para tarefas como classificação e regressão, como árvores de decisão e máquinas de vetores de suporte. O aprendizado não supervisionado identifica padrões dentro de dados não rotulados e é frequentemente aplicado para agrupamento e redução de dimensionalidade, com técnicas como clusterização k-means e análise de componentes principais. O aprendizado semi-supervisionado combina dados rotulados e não rotulados para gerar previsões. A aprendizagem por reforço foca na tomada de decisões informadas pelo feedback do ambiente, e é frequentemente usada em jogos e robótica, com métodos como Q-learning e redes profundas de aprendizado por reforço. O deep learning utiliza redes neurais artificiais com múltiplas camadas para identificar padrões intrincados nos dados. Essa técnica ajuda a prever biomarcadores para doenças comuns, incluindo câncer, AVC, doença de Alzheimer e doença de Parkinson. Diversos programas clinicamente aprovados utilizam essatecnologia 24,25. O diagnóstico preciso de pacientes com tumores malignos normalmente depende da aquisição e análise patológica de amostras de tecido, que fornecem informações críticas sobre grau histológico, subtipo, estágio e vários outros biomarcadores tumorais.

figure-protocol-3
Figura 3: Categorização de algoritmos de aprendizado de máquina para tomada de decisão clínica. Os tipos de algoritmos de ML no diagrama são ilustrados para ajudar a entender a metodologia aplicada. Por favor, clique aqui para ver uma versão ampliada desta figura.

Estatística e ML são duas disciplinas separadas que frequentemente se cruzam. Estatística envolve coletar, analisar e interpretar dados, normalmente trabalhando com conjuntos de dados menores e bem definidos, e foca principalmente em comparar e resumir informações. Por outro lado, ML é um subconjunto da inteligência artificial que cria modelos preditivos, frequentemente lidando com conjuntos de dados grandes e complexos. Embora a estatística desempenhe um papel importante na pesquisa confirmatória e na compreensão dos mecanismos subjacentes, a aprendizagem automática é mais eficaz em pesquisas exploratórias, na descoberta de padrões complexos e no gerenciamento de dados ausentes. Métodos como regressão logística podem ser considerados tanto como modelos estatísticos quanto como modelos de ML supervisionado, ilustrando as distinções tênues entre os dois domínios. Em última análise, os pesquisadores devem avaliar seus objetivos de pesquisa e a natureza de seus dados para selecionar o método mais adequado.

6. Modelagem de MLP e Variantes de MLP

MLP, também conhecido como perceptron multicamada, é um tipo de arquitetura de rede neural que apresenta múltiplas camadas de neurônios entre as camadas de entrada e saída, conforme ilustrado na Figura 4. O MLP foi introduzido na década de 1950 e ganhou amplo uso com o progresso e avanços na retropropagação na década de 1980, o que ajudou a minimizar a perda. Os princípios básicos de aprendizado do MLP são redes neurais, pesos e valores de viés para calcular a saída. Por fim, conhecer a função de ativação e o valor do limiar para obter a saída na camada de saída. Na metodologia proposta, os nós na camada de entrada, camada oculta e camada de saída correspondem a características clínicas e gênicas, camadas totalmente conectadas com ativação ReLU e um único neurônio com ativação sigmoide para prever o resultado binário do tipo de indicação (Risco, Diagnóstico), respectivamente. As principais vantagens são que são fáceis de treinar e interpretar. No entanto, o MLP simples não consegue lidar com grandes conjuntos de dados e é sensível à taxa de aprendizado26. Portanto, para superar essas desvantagens, o MLP com Learning Rate Scheduler é considerado com a arquitetura apresentada na Figura 3B. MLP com LR é um mecanismo dinâmico poderoso com decaimento acentuado, decaimento exponencial, decaimento inverso do tempo, ReduceLROnPlateau e recozimento cosseno. Em vez de um valor LR fixo, a taxa de aprendizado muda com base no desempenho e treinamento do modelo.

figure-protocol-4
Figura 4: Modelagem de Perceptron e MLP multicamadas com um agendador LR. (A) Perceptron Multicamada: A estrutura do MLP é ilustrada com a Camada de Entrada, Camada Oculta e Camada de Saída. A primeira camada recebe a entrada e a processa na segunda camada com ativações, e a saída é recebida na última camada. MLP é simples de implementar. (B) MLP com LR Scheduler: Isso é semelhante ao MLP; no entanto, um Agendador de Taxa de Aprendizagem é adicionado para controlar a velocidade de treinamento e obter uma melhor taxa de convergência. A taxa de aprendizado é reduzida em um platô. Isso reduz os mínimos ultrapassando. Por favor, clique aqui para ver uma versão ampliada desta figura.

Essa abordagem é mais eficiente, confiável e eficaz para dados tabulares. Além disso, há benefícios como melhoria estável da convergência em dados ruidosos, maior generalização e redução do esforço na sintonia dos hiperparâmetros. No entanto, para algumas tarefas de previsão, podem surgir dificuldades, como ficar preso em mínimos locais. Além disso, na arquitetura ampla e profunda do MLP apresentada na Figura 5, componentes amplos e profundos são introduzidos no MLP para se destacar em mapeamento de correlação, memorização de regras e aprendizado de novos padrões, mantendo altos padrões de generalização. Ao combinar esses aspectos na camada de saída, a saída binária é previstaem 27. No entanto, há limitações na generalização de características invisíveis e na supergeneralização. Em conclusão, MLP com Batch Norm e Dropout é usado para normalizar o processo de treinamento, incorporando o dropout para aprendizado e a generalização de atributos desconhecidos. Em particular, essa técnica pode ser aplicada a dados de alta dimensão e ajuda a evitar o sobreajuste. No entanto, essa técnica sofre com limitações no tamanho do lote, aumento do consumo de memória (devido às camadas de Normalização em Lote) e não é uma solução universal28,29.

figure-protocol-5
Figura 5: Modelagem de rede MLP ampla e Deep. O diagrama ilustra o caminho profundo do MLP, que pode capturar relações não lineares e combina a saída com uma unidade sigmoide para classificação. Essa arquitetura captura aprendizado de padrões e conhecimento para dados heterogêneos de biomarcadores. Por favor, clique aqui para ver uma versão ampliada desta figura.

7. TabNet

A TabNet é um modelo de aprendizado profundo conhecido como Rede Tabular, desenvolvido pela equipe de pesquisado Google 30. A principal motivação do modelo TabNet é conciliar as diferenças entre as abordagens de DL para imagem, texto, fala (CNN, Autoencoder, Transformers) e ML baseada em árvores (XGBoost, Random Forest, LightGBM). Além disso, as limitações das abordagens DL têm um enorme impacto no modelo TabNet, sendo o MLP um modelo parametrizado. Acima de tudo, as abordagens DL carecem de interpretação em problemas do mundo real, aprendizagem auto-supervisionada e capacidade de aprendizagemsequencial 31. Os modelos TabNet estão restritos a aplicações como previsão de riscode seguro 32, estimativa de conteúdo de cinzas de carvão33, previsão de toxicidadequímica 34 e detecção de trapaça em testeseducacionais 35. A arquitetura do TabNet é apresentada na Figura 6.

figure-protocol-6
Figura 6: Modelagem de rede tabular. A rede tabular recebe características de entrada em formato tabular e aplica a técnica do transformador de forma sequencial em cada bloco. O bloco GLU, também conhecido como bloco de Unidade Linear Gated, controla o fluxo de informação pela rede, facilitando a seleção de características e o aprendizado estável. A saída é apresentada na camada de saída a partir da saída acumulada. Por favor, clique aqui para ver uma versão ampliada desta figura.

A partir do diagrama arquitetônico acima, o sistema é dividido em quatro componentes: bloco de entrada, Transformador de Características Compartilhadas, Etapas de Decisão Sequenciais e o cálculo de perdas usando otimização. Nas características categóricas, as características são convertidas em inteiros seguindo a camada de embedding. Ao mesmo tempo, as características contínuas são tomadas como são. Finalmente, as características são convertidas em um vetor unificado onde x ∈ Rd. Na próxima etapa, camadas totalmente conectadas com funções de ativação são implementadas, seguidas por uma transformação para converter os dados em vetor, e uma decisão é tomada. Na terceira etapa, o transformador de atenção, o mascaramento, o transformador de decisão e a acumulação de previsões são usados em sucessão. Os objetivos dessa etapa são atenção seletiva, raciocínio sequencial e caminhos de decisão. Na última etapa, são usados métodos binários de entropia cruzada ou similares para encontrar a perda e otimizar o valor. Além disso, a regularização é realizada usando atenção esparsa para evitar o sobreajuste.

8. AutoInt

Aprendizagem Automática de Interação de Características via Redes Neurais Auto-Atentas (AutoInt) é a forma completa de AutoInt, introduzida na previsão de taxa de cliques (CTR)36 e posteriormente aplicada a várias aplicações, incluindo previsão de defeitosde software 37, sistemas derecomendação 38 e detecção degenoma 39. Existem limitações nas abordagens existentes de ML, incluindo o manuseio de dados esparsos de alta dimensão, características combinatórias de ordem superior, compreensão da capacidade de previsão da característica e a necessidade de engenharia manual de características. Todos esses desafios mencionados são abordados pelo modelo AutoInt com eficiência, eficácia e explicabilidade. O objetivo do AutoInt na metodologia proposta é prever se a variante dada é do tipo de indicação de Risco ou Diagnóstico. São propostas sete etapas para o conjunto de dados fornecido, conforme mostrado na Figura 6, junto com o código-fonte. Primeiramente, a leitura de dados e o pré-processamento são implementados para codificar todas as características categóricas como inteiros e mapear os rótulos para 0 e 1 para Risco e Diagnóstico, respectivamente. Na segunda etapa, a representação de características é realizada para criar a matriz de incorporação; por sua vez, a matriz é convertida para normalizar as características numéricas. Existem camadas interagentes onde a interação automática neutra entre as características é aprendida sem interação manual com os transformadores. Além disso, múltiplas cabeças aprendem diferentes tipos de interações e, finalmente, as características são concatenadas, aprimorando a representação. Conexões residuais estão presentes para aprender tanto interações de ordem inferior quanto superior, como 1 característica, 2 características, 3 características, e assim por diante. Finalmente, a partir da rede residual, as saídas são passadas para a função sigmoide para cálculos de valores binários, como mostrado na Figura 7.

figure-protocol-7
Figura 7: Modelagem da rede AutoInt. A Rede AutoInt aprende automaticamente as características, onde a camada de incorporação pega as características e as mapeia para a próxima camada usando um mecanismo de autoatenção e conexões residuais. O último componente possui a camada MLP e funções de ativação para produzir a saída. Por favor, clique aqui para ver uma versão ampliada desta figura.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os experimentos são realizados usando abordagens de ML e DL para comparar seu desempenho. Ao mesmo tempo, é considerada a criação de modelos de ML que utilizem tanto mecanismos de aprendizagem supervisionada quanto não supervisionada. As técnicas supervisionadas utilizadas nessa metodologia são Regressão Logística, Árvore de Decisão, Floresta Aleatória, Gradient Boost, Máquina de Vetores de Suporte e algoritmos K-Vizinho Mais Próximo. Esses algoritmos vão desde modelos estatísticos simpl...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O trabalho proposto discute claramente a importância dos biomarcadores na identificação e monitoramento de uma doença e suas características. A abordagem sugerida para a metodologia de biomarcadores baseia-se em quatro etapas essenciais: preparação cuidadosa dos dados (limpeza, codificação, eliminação de identificadores); codificação uniforme de alvo (Risco=0, Diagnóstico=1); normalização de recursos e deep embedding de alta qualidade para modelos como AutoInt37/T...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a revelar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não receberam financiamento externo.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Modelo AutoIntUniversidade de Pequimhttps://github.com/shichence/AutoIntAprendizagem Automática de Interação de Características via Redes Neurais Auto-Atentas: Algoritmo eficiente para aprender automaticamente interações de características de alta ordem para características categóricas e numéricas (esparsas)
deepctr_torch.modelosCódigo abertohttps://github.com/shenweichen/DeepCTR-TorchPacote modular e extensível de modelos CTR baseados em deep learning para construir seu próprio modelo personalizado facilmente.
Colaboratório do GoogleGooglehttps://colab.research.google.com/Baseado em nuvem   ambiente para escrever e executar código Python através do navegador para aprendizado de máquina e análise de dados
Keras 2.6.0Kerashttps://keras.io/Fornece uma interface em Python para execução de redes neurais que roda sobre o Tensorflow
MarkerDB 2.0MarkerDBhttps://markerdb.ca/downloadsBanco de dados disponível publicamente de biomarcadores moleculares
Matplotlib 3.4.3Matplotlib https://matplotlib.org/Biblioteca de visualização para python
Entorpecido 1.21.4Dormentehttps://numpy.org/Pacote fundamental para computação científica com Python
Pandas 1.3.4Pandashttps://pandas.pydata.org/Ferramenta poderosa, flexível e fácil de usar de código aberto para análise e manipulação de dados, construída sobre a linguagem de programação Python.
Python 3.8.10Fundação de Software Pythonhttps://www.python.org/Linguagem de programação popular que integra sistemas de aprendizado profundo de forma mais eficaz.
pytorch_tabnet.tab_modelPytorchhttps://pypi.org/project/pytorch-tabnet/Para implementar problemas de classificação binária/multiclasse e regressão.
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/Módulo Python para algoritmos de aprendizado de máquina
SeabornSeabornhttps://seaborn.pydata.org/Biblioteca de visualização de dados de alto nível para desenhar gráficos estatísticos atraentes e informativos
Modelo TabNetGooglehttps://github.com/dreamquark-ai/tabnetTabNet é uma rede neural de ponta a ponta projetada para lidar diretamente com dados tabulares
Tensorflow 2.6.0Googlehttps://www.tensorflow.org/Uma plataforma de ponta a ponta para aprendizado de máquina

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Mollarasouli, F., Bakirhan, N. K., Ozkan, S. A. Introduction to biomarkers. The detection of biomarkers. , Academic Press. 1-22 (2022).
  2. Doroszkiewicz, J., Groblewska, M., Mroczko, B. Molecular biomarkers and their implications for the early diagnosis of selected neurodegenerative diseases. Int J Mol Sci. 23 (9), 4610(2022).
  3. Steyaert, S., et al. Multimodal data fusion for cancer biomarker discovery with deep learning. Nat Mach Intell. 5 (4), 351-362 (2023).
  4. DeGroat, W., et al. Multimodal AI/ML for discovering novel biomarkers and predicting disease using multi-omics profiles of patients with cardiovascular diseases. Sci Rep. 14 (1), 26503(2024).
  5. Myrou, A., Barmpagiannos, K., Ioakimidou, A., Savopoulos, C. Molecular biomarkers in neurological diseases: advances in diagnosis and prognosis. Int J Mol Sci. 26 (5), 2231(2025).
  6. Bansal, A., Shukla, A. K., Bansal, S. Machine learning methods for predictive analytics in health care. Proc IEEE Int Conf Syst Modeling Adv Res Trends. , 258-262 (2021).
  7. Adeghe, E. P., Okolo, C. A., Ojeyinka, O. T. A review of the use of machine learning in predictive analytics for patient health outcomes in pharmacy practice. OARJ Life Sci. 7 (1), 052-058 (2024).
  8. Mirabnahrazam, G., et al. Machine learning based multimodal neuroimaging genomics dementia score for predicting future conversion to Alzheimer's disease. J Alzheimers Dis. 87 (3), 1345-1365 (2022).
  9. Taj, F., Stein, L. D. MMDRP: drug response prediction and biomarker discovery using multimodal deep learning. Bioinform Adv. 4 (1), vbae010(2024).
  10. Lazaros, K., et al. Non-invasive biomarkers in the era of big data and machine learning. Sens. 25 (5), 1396(2025).
  11. Mathema, V. B., Sen, P., Lamichhane, S., Orešič, M., Khoomrung, S. Deep learning facilitates multi-data type analysis and predictive biomarker discovery in cancer precision medicine. Comput Struct Biotechnol J. 21, 1372-1382 (2023).
  12. Pearson, T. A., et al. Precision health analytics with predictive analytics and implementation research: JACC state-of-the-art review. JACC. 76 (3), 306-320 (2020).
  13. Parvin, N., Joo, S. W., Jung, J. H., Mandal, T. K. Multimodal AI in biomedicine: Pioneering the future of biomaterials, diagnostics, and personalized healthcare. Nanomaterials. 15 (12), 895(2025).
  14. Somepalli, G., Goldblum, M., Schwarzschild, A., Bruss, C. B., Goldstein, T. SAINT: Improved neural networks for tabular data via row attention and contrastive pre-training. arXiv. , (2021).
  15. Libbrecht, M. W., Noble, W. S. Machine learning applications in genetics and genomics. Nat Rev Genet. 16 (6), 321-332 (2015).
  16. Huang, S., Chaudhary, K., Garmire, L. X. More is better: Recent progress in multi-omics data integration methods. Front Genet. 8, 84(2017).
  17. Li, Y., Huang, C., Ding, L., Li, Z., Pan, Y., Gao, X. Deep learning in bioinformatics: introduction, application, and perspective in the big data era. Methods. 166, 4-21 (2019).
  18. Frangogiannis, N. G. Biomarkers: Hopes and challenges in the path from discovery to clinical practice. Transl Res. 159 (4), 197-204 (2012).
  19. Frantzi, M., et al. Omics-derived biomarkers and novel drug targets for improved intervention in advanced prostate cancer. Diagn. 10 (9), 658(2020).
  20. Jackson, H., et al. MarkerDB 2.0: A comprehensive molecular biomarker database for 2025. Nucleic Acids Res. 53, D1415-D1426 (2025).
  21. DeGroat, W., et al. IntelliGenes: A novel machine learning pipeline for biomarker discovery and predictive analysis using multi-genomic profiles. Bioinform. 39 (12), btad755(2023).
  22. Thelagathoti, R. K., et al. A hybrid sequential feature selection approach for identifying new potential mRNA biomarkers for Usher syndrome using machine learning. Biomol. 15 (7), 963(2025).
  23. Ng, S., Masarone, S., Watson, D., Barnes, M. R. The benefits and pitfalls of machine learning for biomarker discovery. Cell Tissue Res. 394 (1), 17-31 (2023).
  24. Chudzik, A., Śledzianowski, A., Przybyszewski, A. W. Machine learning and digital biomarkers can detect early stages of neurodegenerative diseases. Sens. 24 (5), 1572(2024).
  25. Chang, C. H., Lin, C. H., Lane, H. Y. Machine learning and novel biomarkers for the diagnosis of Alzheimer's disease. Int J Mol Sci. 22 (5), 2761(2021).
  26. Bzdo, D., Altman, N., Krzywinski, M. Statistics versus machine learning. Nat Methods. 15 (4), 233-234 (2018).
  27. Bikku, T. Multi-layered deep learning perceptron approach for health risk prediction. J Big Data. 7 (1), 50(2020).
  28. Smith, L. N. A disciplined approach to neural network hyper-parameters: part 1-learning rate, batch size, momentum, and weight decay. arXiv. , (2018).
  29. Kim, T. Generalizing MLPs with dropouts, batch normalization, and skip connections. arXiv. , (2021).
  30. Chen, G., Chen, P., Shi, Y., Hsieh, C. Y., Liao, B., Zhang, S. Rethinking the usage of batch normalization and dropout in the training of deep neural networks. arXiv. , (2019).
  31. Arik, S. Ö, Pfister, T. Tabnet: attentive interpretable tabular learning. Proc AAAI Conf Artif Intell. 35 (8), 6679-6687 (2021).
  32. Qamar, T., Bawany, N. Z. Understanding the black-box: towards interpretable and reliable deep learning models. PeerJ Comput Sci. 9, e1629(2023).
  33. McDonnell, K., Murphy, F., Sheehan, B., Masello, L., Castignani, G. Deep learning in insurance: accuracy and model interpretability using TabNet. Expert Syst Appl. 217, 119543(2023).
  34. Zhou, M., Wen, Z., Xu, G., Zhang, Z., Zhou, C. Deep learning with TabNet: Rapid coal ash content estimation via X-ray fluorescence. Int J Coal Prep Util. 45 (3), 523-547 (2025).
  35. Mustafa, F. M., et al. TabNet and TabTransformer: Novel deep learning models for chemical toxicity prediction in comparison with machine learning. J Appl Toxicol. , (2025).
  36. Zhen, Y., Zhu, X. An ensemble learning approach based on TabNet and machine learning models for cheating detection in educational tests. Educ Psychol Meas. 84 (4), 780-809 (2024).
  37. Song, W., et al. Autoint: Automatic feature interaction learning via self-attentive neural networks. Proc ACM Int Conf Inf Knowl Manage. , 1161-1170 (2019).
  38. Jadhav, S., Manikandan, S., Ryu, D. Enhancing the software defect prediction using AutoInt. IEEE Int Conf Big Data Smart Comput. , 103-104 (2025).
  39. He, H., Zhang, R., Zhang, Y., Ren, J. AAIN: Attentional aggregative interaction network for deep learning based recommender systems. Neurocomputing. 547, 126374(2023).
  40. Fan, Y., Waldmann, P. Tabular deep learning: A comparative study applied to multi-task genome-wide prediction. BMC Bioinform. 25 (1), 22(2024).
  41. Kanász, R., Drotár, P., Gnip, P., Zoričák, M. Clash of titans on imbalanced data: TabNet vs XGBoost. Conf IEEE Trans Artif. , 320-325 (2024).
  42. Hwang, Y., Song, J. Recent deep learning methods for tabular data. Commun Stat Appl Methods. 30 (2), 215-226 (2023).
  43. Gorishniy, Y., et al. TabR: Tabular deep learning meets nearest neighbors in 2023. arXiv. , (2023).
  44. Kalidindi, A., Arrama, M. B. A TabTransformer based model for detecting botnet-attacks on internet of things using deep learning. J Theor Appl Inf Technol. 101 (13), 5206-5218 (2023).
  45. Holzmüller, D., Grinsztajn, L., Steinwart, I. RealMLP: Advancing MLPs and default parameters for tabular data. ELLIS Workshop on Representation Learning and Generative Models for Structured Data. , (2025).
  46. Zhu, B., et al. Xtab: cross-table pretraining for tabular transformers. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Machine Learning BiomarkersMultimodal BiomarkersPredictive Health AnalyticsMolecular BiomarkersDisease MonitoringRisk AssessmentPatient StratificationDeep Learning TechniquesProtein BiomarkersGenetic Biomarkers

Related Articles