Research Article

Biomarcadores moleculares multimodales basados en aprendizaje automático para análisis predictivo de la salud

DOI:

10.3791/69241

January 16th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El aprendizaje automático con biomarcadores multimodales mejora la predicción y monitorización de enfermedades, ofreciendo promesas para los avances sanitarios en diversos ámbitos y mejorando los resultados sanitarios mediante una predicción precisa de enfermedades.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cada año, muchas personas en todo el mundo se ven afectadas progresivamente por las devastadoras condiciones de salud como enfermedades cardíacas, infecciones respiratorias, disfunción neurológica, estrés cognitivo, cáncer, ictus, diabetes, etc., que conducen a graves complicaciones de salud y anomalías asociadas. Por ello, el análisis temprano de la salud es crucial, ya que permite una intervención oportuna con terapias dirigidas, proporcionando potencialmente alivio inmediato y beneficios sostenidos a largo plazo que pueden ralentizar la progresión de la enfermedad. Debido a los complejos procesos fisiopatológicos y a los ensayos clínicos heterogéneos en diversas condiciones de salud, es necesario biomarcadores altamente sensibles y multimodales, así como enfoques investigativos eficaces para detectar y monitorizar con precisión los resultados de salud de los pacientes. Por ello, se consideran algoritmos de aprendizaje automático con diversas categorías y técnicas para predecir resultados, incluyendo pronóstico, evaluación de riesgos, estratificación de pacientes y monitorización de enfermedades. El desarrollo del trabajo propuesto se divide en tres etapas, ya que la primera etapa define la importancia de la atención sanitaria con estudios de caso, seguida por los algoritmos tradicionales de Aprendizaje Automático (ML), los enfoques tradicionales de Aprendizaje Profundo (DL) y las técnicas modernas de aprendizaje profundo (TabNet y AutoInt) en la segunda etapa. Finalmente, los experimentos se implementan para justificar los resultados. Este trabajo destaca la agrupación de modalidades integrando biomarcadores moleculares de proteínas, químicos y genéticos con características emergentes del aprendizaje automático. Los resultados indican una mejora significativa en la predicción de la precisión utilizando la metodología propuesta.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El sistema sanitario utiliza cada vez más analíticas predictivas para monitorizar a los pacientes y diagnosticar los resultados de salud de forma oportuna, facilitando la atención proactiva y mejorando los resultados para los pacientes. Al integrar la analítica predictiva con biomarcadores, los clínicos pueden mejorar la precisión diagnóstica, identificar tratamientos eficaces, monitorizar el progreso de la terapia y obtener valiosos conocimientos sobre los mecanismos de la enfermedad, lo que en última instancia conduce a decisiones de tratamiento más informadas y efectivas. Los biomarcadores se refieren a las características de moléculas biológicas o indicadores encontrados en muestras, como biofluidos, tejidos, células, ADN, ARN, sangre y orina, que miden la presencia o progresión de una enfermedad en el cuerpo humano, ayudando a evaluar la eficacia deltratamiento 1.

Los avances en la aplicación de biomarcadores moleculares juegan un papel crucial en la medicina personalizada, midiendo con precisión moléculas específicas para identificar problemas de salud únicos en pacientes, permitiendo estrategias de tratamiento dirigidas desde las etapasiniciales 2. De cara al futuro, los enfoques multimodales ayudarán a integrar múltiples modalidades de patrones complejos de enfermedades, permitiendo una identificación más precisa del pronóstico de enfermedades en cáncer y enfermedades neurodegenerativas mediante técnicas analíticas predictivasavanzadas 3. La metodología de vanguardia utiliza datos multiómicos, bioinformática y algoritmos de aprendizaje automático para identificar nuevos biomarcadores, permitiendo un perfil de riesgo específico para cada paciente y estrategias de tratamiento subjetivo para enfermedades cardiovasculares (ECV) y otras enfermedadescomplejas 4. La combinación de biomarcadores moleculares y enfoques multiómicos promete mejorar la precisión diagnóstica y la estratificación terapéutica en enfermedades neurológicas.

Con el avance de las técnicas de aprendizaje automático, los biomarcadores moleculares multimodales pueden integrar diversos tipos de datos para identificar nuevas firmas de enfermedades en diversas condiciones de salud, permitiendo un diagnóstico más preciso y estrategias de tratamiento personalizadas. Aprovechando este potencial, el autor explora diversas técnicas de aprendizaje automático en la sanidad para predecir los factores de riesgo de diagnóstico de enfermedades y destaca su importancia en distintos sectoressanitarios 6. Con la transformación del aprendizaje automático en el diagnóstico y tratamiento de enfermedades, las clínicas farmacéuticas están aprovechando cada vez más los algoritmos de toma de decisiones para analizar los resultados de salud de los pacientes y atender sus necesidades diarias, permitiendo una atención más informada yeficaz 7. Aprovechando la posible necesidad de integración de datos multimodales, este estudio desarrolló biomarcadores utilizando datos multimodales (resonancia magnética y genética) para predecir el desarrollo y progresión de la enfermedad de Alzheimer, mostrando que los datos genéticos predecían mejor la progresión futura del Alzheimer en sujetos controlados normales, mientras que los datos de resonancia magnética caracterizaban mejor el deterioro cognitivo leve estable, combinando ambos, mejor rendimiento de clasificaciónde calidad 8.

Para avanzar aún más en la aplicación del análisis de datos multimodales, el aprendizaje profundo multimodal utiliza datos de expresión génica para identificar fármacos que atacan líneas celulares específicas de moléculas biológicas novedosas, esclareciendo así cómo las variaciones genómicas influyen en la respuesta altratamiento 9. En conjunto con los avances en el análisis de datos multimodales, los biomarcadores no invasivos, evaluados mediante métricas de IA y aprendizaje automático, están emergiendo como herramientas prometedoras para el diagnóstico, con perfiles de especificidad y sensibilidad variables en comparación con biomarcadores invasivos, dependiendo de la aplicación específica y del contextode datos 10. En línea con la creciente importancia del análisis multimodal de datos, los modelos de ensamblaje de Aprendizaje Profundo (DL) pueden manejar eficazmente datos complejos integrando nuevos biomarcadores, incluidas las interacciones gen-proteína, para mejorar la investigación sobre el cáncer y optimizar estrategiasde tratamiento 11. A medida que los modelos de ensamble DL continúan avanzando en la investigación oncológica, la analítica predictiva desempeña un papel crucial en el diagnóstico y tratamiento de enfermedades, analizando grandes cantidades de datos colectivos de múltiples fuentes, incluyendo diversas condiciones de salud, para proporcionar una visión completa del estado, como la evaluación de riesgos yel diagnóstico 12.

El objetivo del protocolo propuesto es implementar algoritmos basados en aprendizaje automático y aprendizaje automático que integren los marcadores biológicos distintos para mejorar la precisión de la analítica sanitaria. Las técnicas convencionales de predicción que utilizan biomarcadores suelen basarse en datos de modalidad única y modelos estadísticos lineales, que pueden no capturar adecuadamente las complejas relaciones no lineales que influyen en el desarrollo de la enfermedad y las diferencias individuales. La incorporación de grandes cantidades de datos procedentes de observaciones, registros electrónicos de salud, lecturas de laboratorio, mediciones físicas y evaluaciones clínicas ofrece una oportunidad significativa para sintetizar y optimizar la evaluación de riesgos en el diagnósticodel paciente 13. Los biomarcadores desempeñan un papel crucial en la medicina de precisión, permitiendo un tratamiento dirigido en el momento adecuado. Aunque los biomarcadores son complejos y plantean desafíos para medir subtipos de enfermedades y crecimiento molecular, son invaluables para evaluar reacciones tóxicas bajo diversas condiciones anormales, facilitando así un análisis posterior. Al utilizar biomarcadores durante la observación clínica, los profesionales sanitarios pueden predecir con mayor precisión la progresión de la enfermedad y monitorizar las respuestas al tratamiento. En última instancia, la convergencia de biomarcadores moleculares multimodales en la analítica sanitaria con la IA permite un reconocimiento de patrones más efectivo, ajustando características existentes para mitigar el impacto clínico.

En comparación con enfoques de vanguardia, especialmente el trabajo de Somepalli et al.14, donde los autores propusieron algoritmos de aprendizaje automático sobre datos genómicos, como datos metabólicos, epigenéticos y proteómicos, y propusieron directrices generales para seleccionar algoritmos de aprendizaje automático. Sin embargo, existe una limitación en el análisis de los datos. En el trabajoexistente, 15 métodos de integración no supervisada se aplicaron a datos ómicos, centrándose en los desafíos computacionales. En cambio, existen limitaciones en el alcance y el análisis de los métodos. Además, Huang et al.16 cubrieron la mayoría de los métodos de aprendizaje de la línea para analizar diversas aplicaciones, con el objetivo de comprender el poder del big data y los marcos computacionales. Los inconvenientes incluían desequilibrio de datos, sobreajuste y problemas de interpretación. El protocolo propuesto es crucial para abordar una brecha crítica en la investigación de biomarcadores integradores, ya que las técnicas actuales no combinan eficazmente datos biológicos de alta dimensión y diversos. Utilizando sofisticados ML y DL que destacan en el reconocimiento de patrones, la selección de características y la fusión multimodal, la propuesta pretende identificar firmas predictivas robustas que mejoren el diagnóstico precoz, el pronóstico y las opciones de tratamiento individual. Este protocolo aborda directamente la limitación de las evaluaciones de biomarcadores desarticuladas al presentar un modelo integral basado en datos que permite predicciones de salud escalables, interpretables y clínicamente relevantes.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Flujo de trabajo experimental

La Figura 1 ilustra una cadena de flujo de trabajo organizada y modular diseñada para categorizar biomarcadores moleculares en categorías de indicación de riesgo o diagnóstico utilizando técnicas de aprendizaje automático y aprendizaje profundo. Aquí tienes una explicación detallada paso a paso del proceso:

  1. Adquisición de conjuntos de datos
    El conjunto de datos se recopila de MarkerDB 2.0, una base de datos curada de biomarcadores moleculares.
  2. Preprocesamiento de datos
    Esto garantiza la calidad y consistencia de los datos al manejar valores nulos y entradas faltantes, codificar características categóricas usando LabelEncoder y escalar características numéricas (por ejemplo, entrez_gene_id) usando StandardScaler.
  3. Ingeniería de características
    Se recomienda seleccionar características relevantes que influyan en la clasificación de biomarcadores, eviten fugas de datos y mejoren el rendimiento del modelo.
  4. Desarrollo de modelos
    Los enfoques utilizados son Regresión Logística, Bosque Aleatorio, XGBoost, mientras que en DL: MLP, MLP con LR Scheduler, AutoInt, TabNet. Las actividades realizadas son ajuste de hiperparámetros, validación cruzada y optimización para tareas de clasificación.
  5. División de datos
    Aquí, el Set de entrenamiento (80%) se usa para aprender parámetros del modelo, y el Set de pruebas (20%) se usa para evaluar el modelo sobre datos no vistos. En la etapa final, se utilizan métricas de evaluación para asegurar que el rendimiento se mide de forma holística, especialmente en escenarios de clase desequilibrados.

figure-protocol-1
Figura 1: Diagrama de flujo del trabajo propuesto. El flujo de trabajo del problema propuesto se muestra en esta figura. Los pasos son preprocesamiento de datos, ingeniería de características, desarrollo de modelos, divisiones, evaluación de modelos mediante métricas y análisis de biomarcadores. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

2. Descripción del conjunto de datos

El nombre del conjunto de datos se all_sequence_variants con extensión csv. Hay columnas con nombres como 'id', 'variación', 'posición', 'external_link', 'gene_symbol', 'entrez_gene_id', 'referencia', condiciones', 'indication_types', donde todas son tipo objeto excepto id como tipo int y entrez_gene_id tipo flotante. El número total de filas es de 42.818 con 9 columnas. Además, el conjunto de datos tiene valores nulos para variación, posición, external_link, entrez_gene_id, referencia, condiciones y indication_types. El conjunto de datos se extrae del enlace dado como: https://markerdb.ca/downloads17

3. Preprocesamiento de conjuntos de datos

En esta etapa, el preprocesamiento de datos comienza con la recopilación de información del conjunto de datos, descripción, identificación de duplicados y localización de valores ausentes o nulos. No hay impacto de la característica external_link cuando se mide por el coeficiente de correlación, por lo que se elimina. Los valores nulos de las columnas categóricas y numéricas se rellenan con la mediana y la media, respectivamente. Finalmente, la forma del conjunto de datos de entrada y salida es (42787, 6)(42787,). Las columnas de entrada son 'id', 'variación', 'posición', 'gene_symbol', 'entrez_gene_id', 'condiciones', mientras que la columna objetivo es indication_types.

4. Biomarcadores: categorías, desafíos de datos y el papel del riesgo molecular

Un biomarcador es un rasgo cuantificable que indica actividades biológicas normales o anormales o respuestas a diversas exposiciones o intervenciones. Los biomarcadores pueden ser de naturaleza molecular, histológica, radiográfica o fisiológica y se dividen en siete categorías principales: (1) Un biomarcador diagnóstico determina si un individuo tiene una enfermedad o trastorno específico y si pertenece a un subtipo, (2) Un biomarcador de monitorización indica la progresión de una enfermedad y su respuesta al tratamiento, (3) Un biomarcador de respuesta muestra si el paciente está reaccionando a un medicamento o terapia, como un cambio en la frecuencia cardíaca, (4) Un biomarcador predictivo puede determinar si una persona está en riesgo de desarrollar una determinada enfermedad y cómo puede responder a un tratamiento concreto, (5) Un biomarcador pronóstico puede ofrecer información sobre la probabilidad de progresión o recurrencia de la enfermedad si un paciente está predispuesto a un resultado de salud específico, (6) Un biomarcador de riesgo evalúa el nivel potencial de riesgo para una condición antes de que el paciente reciba un diagnóstico oficial, y (7) Un biomarcador de seguridad evalúa el potencial de reacciones tóxicas o adversas que puedan surgir del tratamiento. Este estudio se centra principalmente en el análisis de biomarcadores moleculares relacionados con la evaluación de riesgos y el diagnóstico, tal como se muestra en la Figura 2. Dada la gran cantidad de datos clínicos disponibles en todo el mundo, los biomarcadores son esenciales para orientar las decisiones clínicas, avanzar en la investigación y facilitar la medicina personalizada.

figure-protocol-2
Figura 2: Categoría de biomarcadores para la toma de decisiones clínicas. Las decisiones del biomarcador se representan en este diagrama. En base a los análisis aplicados a los biomarcadores, se consideran las decisiones clínicas y se implementan algoritmos de aprendizaje automático. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Encontrar y comprender información clínicamente útil sobre biomarcadores es un reto debido a la amplia variedad de tipos, características y calidad de biomarcadores. El rápido crecimiento de los estudios de biomarcadores en las últimas dos décadas ha complicado aún más el acceso a datos completos y actualizados, especialmente en el caso de biomarcadores moleculares. Esto ha dado lugar a problemas como hallazgos inconsistentes, redescubrimiento redundante de biomarcadores existentes, resultados contradictorios y oportunidades pasadas por alto para utilizar biomarcadoresya establecidos. La aparición de mediciones "ómicas" ha agravado este problema, resultando en la proliferación de nuevos biomarcadores moleculares en ensayos clínicos y en la literatura, lo que dificulta cada vez más la navegación y aplicación eficaz del conocimientode biomarcadores 19.

MarkerDB 2.0 proporciona acceso a diversos biomarcadores moleculares con finesexperimentales 20. Diversos biomarcadores se utilizan en la investigación clínica y en aplicaciones sanitarias para diagnosticar, predecir y monitorizar enfermedades. Entre ellos, los biomarcadores proteicos utilizan biofluidos como suero, sangre, líquido cefalorraquídeo (LCR), líquido peritoneal, líquido amniótico, plasma y orina para analizar condiciones como diabetes mellitus, tuberculosis, síndrome de Down y trastornos relacionados con la miopatía. De manera similar, los biomarcadores genéticos utilizan símbolos génicos como LRP1, LPP, MAPT y SPI1 para analizar condiciones como la degeneración macular relacionada con la edad, enfermedades alérgicas, enfermedad de Alzheimer, cáncer y asma. Además, los biomarcadores moleculares multimodales ayudan a medir el riesgo del paciente y los indicadoresdiagnósticos 21. Este trabajo pone de manifiesto la necesidad de análisis sanitarios utilizando enfoques de aprendizaje automático para mejorar el diagnóstico, la predicción y el tratamiento personalizado de enfermedades.

5. Modelización de enfoques estadísticos de aprendizaje automático para el descubrimiento de biomarcadores

La aplicación de enfoques de aprendizaje automático ha transformado el campo sanitario de numerosas maneras. Específicamente, los biomarcadores moleculares han sido analizados utilizando diversas técnicas de aprendizaje automático, incluyendo el Análisis de Componentes Principales (PCA), el agrupamiento K-means (KMA), el Análisis de Vecinos Más Cercanos (NNA) y los algoritmosde redes neuronales 22. Estos modelos identifican patrones intrincados a partir de características seleccionadas, gestionan datos incompletos o inconsistentes y apoyan el seguimiento en tiempo real del avance de la enfermedad. Además de diagnosticar enfermedades, los algoritmos de aprendizaje automático proporcionan información significativa sobre los problemas del paciente mediante el examen y visualización de datos, permitiendo una atención rápiday dirigida 23. Como resultado, esto mejora los resultados de salud del paciente en condiciones inusuales. Además, la capacidad del aprendizaje automático para revolucionar el descubrimiento de biomarcadores y los resultados terapéuticos en diversas enfermedades, incluido el análisis de biomarcadores moleculares, está cobrando cada vez más vida.

Los algoritmos de aprendizaje automático se categorizan en cinco tipos principales, como se muestra en la Figura 3. El aprendizaje supervisado es el proceso de entrenar sobre conjuntos de datos etiquetados para entender las relaciones entrada-salida, lo que lo hace ideal para tareas como la clasificación y la regresión, como árboles de decisión y máquinas de vectores de soporte. El aprendizaje no supervisado identifica patrones dentro de datos no etiquetados y a menudo se aplica para agrupamiento y reducción de dimensionalidad, con técnicas como el agrupamiento k-means y el análisis de componentes principales. El aprendizaje semi-supervisado fusiona tanto datos etiquetados como no etiquetados para generar predicciones. El aprendizaje por refuerzo se centra en la toma de decisiones informada por la retroalimentación del entorno, y se utiliza frecuentemente en juegos y robótica, con métodos como el Q-learning y las redes de aprendizaje por refuerzo profundo. El aprendizaje profundo emplea redes neuronales artificiales con múltiples capas para identificar patrones intrincados en los datos. Esta técnica ayuda a predecir biomarcadores para enfermedades comunes, incluyendo cáncer, ictus, enfermedad de Alzheimer y enfermedad de Parkinson. Numerosos programas clínicamente aprobados utilizan estatecnología 24,25. El diagnóstico preciso de los pacientes con tumores malignos suele depender de la adquisición y el análisis patológico de muestras de tejido, que proporcionan información crítica sobre el grado histológico, subtipo, estadio y otros biomarcadores tumorales.

figure-protocol-3
Figura 3: Categorización de algoritmos de aprendizaje automático para la toma de decisiones clínicas. Los tipos de algoritmos de aprendizaje automático en el diagrama se ilustran para ayudar a comprender la metodología aplicada. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La estadística y el aprendizaje automático son dos disciplinas separadas que frecuentemente se cruzan. La estadística implica recopilar, analizar e interpretar datos, normalmente trabajando con conjuntos de datos más pequeños y bien definidos, y se centra principalmente en comparar y resumir información. Por otro lado, el aprendizaje automático es un subconjunto de la inteligencia artificial que crea modelos predictivos, a menudo lidiando con conjuntos de datos grandes e intrincados. Aunque la estadística desempeña un papel importante en la investigación confirmatoria y en la comprensión de los mecanismos subyacentes, el aprendizaje automático es más eficaz en la investigación exploratoria, descubriendo patrones complejos y gestionando datos perdidos. Métodos como la regresión logística pueden considerarse tanto modelos estadísticos como modelos de aprendizaje automático supervisado, ilustrando las difusas distinciones entre ambos dominios. En última instancia, los investigadores deben evaluar sus objetivos de investigación y la naturaleza de sus datos para seleccionar el método más adecuado.

6. Modelado de MLP y variantes de MLP

MLP, también conocido como perceptrón multicapa, es un tipo de arquitectura de red neuronal que presenta múltiples capas neuronales entre las capas de entrada y salida, como se ilustra en la Figura 4. La MLP se introdujo en los años 50 y ganó un uso generalizado gracias al avance y avances en la retropropagación en los años 80, lo que ayudó a minimizar la pérdida. Los principios básicos de aprendizaje de MLP son redes neuronales, pesos y valores de sesgo para calcular la salida. Finalmente, conocer la función de activación y el valor umbral para obtener la salida en la capa de salida. En la metodología propuesta, los nodos de la capa de entrada, capa oculta y capa de salida corresponden a características clínicas y génicas, capas totalmente conectadas con activación de ReLU y una sola neurona con activación sigmoide para predecir el resultado binario del tipo de indicación (Riesgo, Diagnóstico), respectivamente. Las principales ventajas son que son fáciles de entrenar e interpretar. Sin embargo, el MLP simple no puede manejar grandes conjuntos de datos y es sensible a la tasa de aprendizaje26. Por lo tanto, para superar estos inconvenientes, se considera MLP con Learning Rate Scheduler con la arquitectura que se muestra en la Figura 3B. MLP con LR es un mecanismo dinámico potente con decaimiento pronunciado, decaimiento exponencial, decaimiento inverso del tiempo, ReduceLROnPlateau y recocido coseno. En lugar de un valor LR fijo, la tasa de aprendizaje cambia en función del rendimiento y el entrenamiento del modelo.

figure-protocol-4
Figura 4: Modelado de perceptrón multicapa y MLP con un planificador LR. (A) Perceptrón Multicapa: La estructura de MLP se ilustra con la Capa de Entrada, la Capa Oculta y la Capa de Salida. La primera capa recibe la entrada y la procesa en la segunda capa con activaciones, y la salida se recibe en la última capa. MLP es sencillo de implementar. (B) MLP con planificador LR: Esto es similar a MLP; sin embargo, se añade un Planificador de Tasa de Aprendizaje para controlar la velocidad de entrenamiento y así lograr una mejor tasa de convergencia. La tasa de aprendizaje se reduce en una meseta. Esto reduce los mínimos que se exceden. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Este enfoque es más eficiente, fiable y eficaz para datos tabulares. Además, existen beneficios como la mejora estable de la convergencia en datos ruidosos, una mayor generalización y un esfuerzo reducido en la afinación de hiperparámetros. Sin embargo, en algunas tareas de predicción, pueden surgir dificultades, como quedarse atascado en mínimos locales. Además, en la arquitectura MLP amplia y profunda presentada en la Figura 5, se introducen componentes anchos y profundos en la MLP para destacar en mapeo de correlación, memorización de reglas y aprendizaje de nuevos patrones, manteniendo altos estándares de generalización. Al combinar estos aspectos en la capa de salida, se predice la salida binaria27. Sin embargo, existen limitaciones en la generalización de características invisibles y en la sobregeneralización. En conclusión, se utiliza MLP con Norma por Lotes y Abandono para normalizar el proceso de entrenamiento, incorporando el abandono para el aprendizaje y la generalización de atributos desconocidos. En particular, esta técnica puede aplicarse a datos de alta dimensión y ayuda a evitar el sobreajuste. No obstante, esta técnica sufre de limitaciones de tamaño por lote, un mayor consumo de memoria (debido a las capas de normalización por lotes) y no es una solución universal28,29.

figure-protocol-5
Figura 5: Modelado de redes MLP a nivel largo y profundo. El diagrama ilustra el camino profundo de la MLP, que puede capturar relaciones no lineales y combina la salida con una unidad sigmoide para su clasificación. Esta arquitectura captura el aprendizaje de patrones y el conocimiento para datos heterogéneos de biomarcadores. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

7. TabNet

La TabNet es un modelo de aprendizaje profundo conocido como Red Tabular desarrollado por el equipo de investigaciónde Google 30. La principal motivación del modelo TabNet es reconciliar las diferencias entre los enfoques de aprendizaje automático para imagen, texto, voz (CNN, Autoencoder, Transformers) y enfoques de aprendizaje automático basado en árbol (XGBoost, Random Forest, LightGBM). Además, las limitaciones de los enfoques DL tienen un gran impacto en el modelo TabNet, siendo MLP un modelo parametrizado. Por encima de todo, los enfoques DL carecen de interpretación en problemas del mundo real, aprendizaje autosupervisado y capacidad de aprendizajesecuencial 31. Los modelos TabNet se limitan a aplicaciones como la predicción de riesgode seguros 32, la estimación del contenido de cenizas decarbón 33, la predicción de toxicidad química34 y la detección de trampas en pruebaseducativas 35. La arquitectura de TabNet se muestra en la Figura 6.

figure-protocol-6
Figura 6: Modelado de redes tabulares. La red tabular toma las características de entrada en formato tabular y aplica la técnica del transformador de forma secuencial en cada bloque. El bloque GLU, también conocido como bloque de Unidad Lineal Controlada, controla el flujo de información hacia adelante a través de la red, facilitando la selección de características y un aprendizaje estable. La salida se presenta en la capa de salida a partir de la salida acumulada. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

A partir del diagrama arquitectónico anterior, el sistema se divide en cuatro componentes: bloque de entrada, transformador de características compartidas, pasos secuenciales de decisión y el cálculo de pérdidas mediante optimización. En las características categóricas, las características se convierten en enteros siguiendo la capa de incrustación. Al mismo tiempo, las características continuas se toman tal cual. Finalmente, las características se convierten en un vector unificado donde x ∈ Rd. En el siguiente paso, se implementan capas totalmente conectadas con funciones de activación, seguidas de una transformación para convertir los datos en vector, y se toma una decisión. En el tercer paso, se utilizan sucesivamente el transformador de atención, el enmascaramiento, el transformador de decisión y la acumulación de predicción. Los objetivos de este paso son la atención selectiva, el razonamiento secuencial y las vías de decisión. En el último paso, se utilizan métodos binarios de entropía cruzada o similares para encontrar la pérdida y optimizar el valor. Además, la regularización se realiza utilizando atención escasa para evitar el sobreajuste.

8. AutoInt

El aprendizaje automático de interacción de características mediante redes neuronales autoatentas (AutoInt) es la forma completa de AutoInt, introducida en la predicción de tasa de clics (CTR) 36 y posteriormente aplicada a diversas aplicaciones, incluyendo la predicción de defectos desoftware 37, sistemas derecomendación 38 y detección degenomas 39. Existen limitaciones en los enfoques existentes de ML, incluyendo el manejo de datos dispersos de alta dimensión, características combinatorias de orden superior, la comprensión de la capacidad de predicción de la característica y la necesidad de ingeniería manual de características. Todos estos desafíos mencionados se abordan con eficiencia, eficacia y explicabilidad en el modelo AutoInt. El objetivo de AutoInt en la metodología propuesta es predecir si la variante dada es de un tipo de indicación de Riesgo o Diagnóstico. Se proponen siete pasos para el conjunto de datos dado, como se muestra en la Figura 6, junto con el código fuente. En primer lugar, la lectura de datos y el preprocesamiento se implementan para codificar todas las características categóricas como enteros y asignar las etiquetas a 0 y 1 para Riesgo y Diagnóstico, respectivamente. En el segundo paso, se realiza la representación de características para crear la matriz de incrustación; a su vez, la matriz se convierte para normalizar las características numéricas. Existen capas de interacción donde se aprende la interacción automática neutra entre las características sin interacción manual con los transformadores. Además, varias cabezas aprenden diferentes tipos de interacciones y, finalmente, las características se concatenan, mejorando la representación. Existen conexiones residuales para aprender tanto interacciones de orden inferior como superior, como 1 característica, 2 características, 3 características, y así sucesivamente. Finalmente, desde la red residual, las salidas se pasan a la función sigmoide para cálculos de valores binarios, como se muestra en la Figura 7.

figure-protocol-7
Figura 7: Modelado de la red AutoInt. La Red AutoInt aprende automáticamente las características, donde la capa de incrustación toma las características y las mapea a la siguiente capa usando un mecanismo de autoatención y conexiones residuales. El último componente tiene la capa MLP y funciones de activación para producir la salida. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los experimentos se realizan utilizando enfoques de ML y DL para comparar su rendimiento. Al mismo tiempo, se considera crear modelos de aprendizaje automático que utilicen tanto mecanismos de aprendizaje supervisado como no supervisado. Las técnicas supervisadas utilizadas en esta metodología son Regresión Logística, Árbol de Decisión, Bosque Aleatorio, Impulso de Gradiente, Máquina de Vectores de Soporte y algoritmos de K Vecinos Más Cercanos. Estos algoritmos van desde modelos estadís...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El trabajo propuesto analiza claramente la importancia de los biomarcadores en la identificación y monitorización de una enfermedad y sus características. El enfoque sugerido para la metodología de biomarcadores se basa en cuatro pasos esenciales: preparación cuidadosa de los datos (limpieza, codificación, eliminación de identificadores); codificación uniforme de objetivos (Riesgo=0, Diagnóstico=1); normalización de características y incrustación profunda de alta calidad para modelos com...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no recibieron financiación externa.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Modelo AutoIntUniversidad de Pekínhttps://github.com/shichence/AutoIntAprendizaje automático de interacción de características mediante redes neuronales auto-atentas: Algoritmo eficiente para aprender automáticamente interacciones de características de alto orden para características categóricas y numéricas (dispersas)
deepctr_torch.modelosCódigo abiertohttps://github.com/shenweichen/DeepCTR-TorchPaquete modular y extensible de modelos CTR basados en aprendizaje profundo para construir su propio modelo personalizado fácilmente.
Colaboratorio de GoogleGooglehttps://colab.research.google.com/Basado en la nube  entorno para escribir y ejecutar código Python a través del navegador para aprendizaje automático y análisis de datos
Keras 2.6.0Kerashttps://keras.io/Proporciona una interfaz en Python para ejecutar redes neuronales que se ejecuta sobre Tensorflow
MarkerDB 2.0MarkerDBhttps://markerdb.ca/downloadsBase de datos pública disponible de biomarcadores moleculares
Matplotlib 3.4.3Matplotlib https://matplotlib.org/Biblioteca de visualización para python
Numpy 1.21.4Entumecidohttps://numpy.org/Paquete fundamental para la computación científica con Python
Pandas 1.3.4Pandashttps://pandas.pydata.org/Herramienta de análisis y manipulación de datos de código abierto potente, flexible y fácil de usar, construida sobre el lenguaje de programación Python.
Python 3.8.10Fundación de Software Pythonhttps://www.python.org/Lenguaje de programación popular que integra sistemas de aprendizaje profundo de forma más eficaz.
pytorch_tabnet.tab_modelPytorchhttps://pypi.org/project/pytorch-tabnet/Por implementar problemas de clasificación binaria/multiclase y regresión.
Scikit-learnScikit-learnhttps://scikit-learn.org/stable/Módulo de Python para algoritmos de aprendizaje automático
SeabornSeabornhttps://seaborn.pydata.org/Biblioteca de visualización de datos de alto nivel para dibujar gráficos estadísticos atractivos e informativos
Modelo TabNetGooglehttps://github.com/dreamquark-ai/tabnetTabNet es una red neuronal de extremo a extremo diseñada para manejar directamente datos tabulares
Tensorflow 2.6.0Googlehttps://www.tensorflow.org/Una plataforma de extremo a extremo para aprendizaje automático

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Mollarasouli, F., Bakirhan, N. K., Ozkan, S. A. Introduction to biomarkers. The detection of biomarkers. , Academic Press. 1-22 (2022).
  2. Doroszkiewicz, J., Groblewska, M., Mroczko, B. Molecular biomarkers and their implications for the early diagnosis of selected neurodegenerative diseases. Int J Mol Sci. 23 (9), 4610(2022).
  3. Steyaert, S., et al. Multimodal data fusion for cancer biomarker discovery with deep learning. Nat Mach Intell. 5 (4), 351-362 (2023).
  4. DeGroat, W., et al. Multimodal AI/ML for discovering novel biomarkers and predicting disease using multi-omics profiles of patients with cardiovascular diseases. Sci Rep. 14 (1), 26503(2024).
  5. Myrou, A., Barmpagiannos, K., Ioakimidou, A., Savopoulos, C. Molecular biomarkers in neurological diseases: advances in diagnosis and prognosis. Int J Mol Sci. 26 (5), 2231(2025).
  6. Bansal, A., Shukla, A. K., Bansal, S. Machine learning methods for predictive analytics in health care. Proc IEEE Int Conf Syst Modeling Adv Res Trends. , 258-262 (2021).
  7. Adeghe, E. P., Okolo, C. A., Ojeyinka, O. T. A review of the use of machine learning in predictive analytics for patient health outcomes in pharmacy practice. OARJ Life Sci. 7 (1), 052-058 (2024).
  8. Mirabnahrazam, G., et al. Machine learning based multimodal neuroimaging genomics dementia score for predicting future conversion to Alzheimer's disease. J Alzheimers Dis. 87 (3), 1345-1365 (2022).
  9. Taj, F., Stein, L. D. MMDRP: drug response prediction and biomarker discovery using multimodal deep learning. Bioinform Adv. 4 (1), vbae010(2024).
  10. Lazaros, K., et al. Non-invasive biomarkers in the era of big data and machine learning. Sens. 25 (5), 1396(2025).
  11. Mathema, V. B., Sen, P., Lamichhane, S., Orešič, M., Khoomrung, S. Deep learning facilitates multi-data type analysis and predictive biomarker discovery in cancer precision medicine. Comput Struct Biotechnol J. 21, 1372-1382 (2023).
  12. Pearson, T. A., et al. Precision health analytics with predictive analytics and implementation research: JACC state-of-the-art review. JACC. 76 (3), 306-320 (2020).
  13. Parvin, N., Joo, S. W., Jung, J. H., Mandal, T. K. Multimodal AI in biomedicine: Pioneering the future of biomaterials, diagnostics, and personalized healthcare. Nanomaterials. 15 (12), 895(2025).
  14. Somepalli, G., Goldblum, M., Schwarzschild, A., Bruss, C. B., Goldstein, T. SAINT: Improved neural networks for tabular data via row attention and contrastive pre-training. arXiv. , (2021).
  15. Libbrecht, M. W., Noble, W. S. Machine learning applications in genetics and genomics. Nat Rev Genet. 16 (6), 321-332 (2015).
  16. Huang, S., Chaudhary, K., Garmire, L. X. More is better: Recent progress in multi-omics data integration methods. Front Genet. 8, 84(2017).
  17. Li, Y., Huang, C., Ding, L., Li, Z., Pan, Y., Gao, X. Deep learning in bioinformatics: introduction, application, and perspective in the big data era. Methods. 166, 4-21 (2019).
  18. Frangogiannis, N. G. Biomarkers: Hopes and challenges in the path from discovery to clinical practice. Transl Res. 159 (4), 197-204 (2012).
  19. Frantzi, M., et al. Omics-derived biomarkers and novel drug targets for improved intervention in advanced prostate cancer. Diagn. 10 (9), 658(2020).
  20. Jackson, H., et al. MarkerDB 2.0: A comprehensive molecular biomarker database for 2025. Nucleic Acids Res. 53, D1415-D1426 (2025).
  21. DeGroat, W., et al. IntelliGenes: A novel machine learning pipeline for biomarker discovery and predictive analysis using multi-genomic profiles. Bioinform. 39 (12), btad755(2023).
  22. Thelagathoti, R. K., et al. A hybrid sequential feature selection approach for identifying new potential mRNA biomarkers for Usher syndrome using machine learning. Biomol. 15 (7), 963(2025).
  23. Ng, S., Masarone, S., Watson, D., Barnes, M. R. The benefits and pitfalls of machine learning for biomarker discovery. Cell Tissue Res. 394 (1), 17-31 (2023).
  24. Chudzik, A., Śledzianowski, A., Przybyszewski, A. W. Machine learning and digital biomarkers can detect early stages of neurodegenerative diseases. Sens. 24 (5), 1572(2024).
  25. Chang, C. H., Lin, C. H., Lane, H. Y. Machine learning and novel biomarkers for the diagnosis of Alzheimer's disease. Int J Mol Sci. 22 (5), 2761(2021).
  26. Bzdo, D., Altman, N., Krzywinski, M. Statistics versus machine learning. Nat Methods. 15 (4), 233-234 (2018).
  27. Bikku, T. Multi-layered deep learning perceptron approach for health risk prediction. J Big Data. 7 (1), 50(2020).
  28. Smith, L. N. A disciplined approach to neural network hyper-parameters: part 1-learning rate, batch size, momentum, and weight decay. arXiv. , (2018).
  29. Kim, T. Generalizing MLPs with dropouts, batch normalization, and skip connections. arXiv. , (2021).
  30. Chen, G., Chen, P., Shi, Y., Hsieh, C. Y., Liao, B., Zhang, S. Rethinking the usage of batch normalization and dropout in the training of deep neural networks. arXiv. , (2019).
  31. Arik, S. Ö, Pfister, T. Tabnet: attentive interpretable tabular learning. Proc AAAI Conf Artif Intell. 35 (8), 6679-6687 (2021).
  32. Qamar, T., Bawany, N. Z. Understanding the black-box: towards interpretable and reliable deep learning models. PeerJ Comput Sci. 9, e1629(2023).
  33. McDonnell, K., Murphy, F., Sheehan, B., Masello, L., Castignani, G. Deep learning in insurance: accuracy and model interpretability using TabNet. Expert Syst Appl. 217, 119543(2023).
  34. Zhou, M., Wen, Z., Xu, G., Zhang, Z., Zhou, C. Deep learning with TabNet: Rapid coal ash content estimation via X-ray fluorescence. Int J Coal Prep Util. 45 (3), 523-547 (2025).
  35. Mustafa, F. M., et al. TabNet and TabTransformer: Novel deep learning models for chemical toxicity prediction in comparison with machine learning. J Appl Toxicol. , (2025).
  36. Zhen, Y., Zhu, X. An ensemble learning approach based on TabNet and machine learning models for cheating detection in educational tests. Educ Psychol Meas. 84 (4), 780-809 (2024).
  37. Song, W., et al. Autoint: Automatic feature interaction learning via self-attentive neural networks. Proc ACM Int Conf Inf Knowl Manage. , 1161-1170 (2019).
  38. Jadhav, S., Manikandan, S., Ryu, D. Enhancing the software defect prediction using AutoInt. IEEE Int Conf Big Data Smart Comput. , 103-104 (2025).
  39. He, H., Zhang, R., Zhang, Y., Ren, J. AAIN: Attentional aggregative interaction network for deep learning based recommender systems. Neurocomputing. 547, 126374(2023).
  40. Fan, Y., Waldmann, P. Tabular deep learning: A comparative study applied to multi-task genome-wide prediction. BMC Bioinform. 25 (1), 22(2024).
  41. Kanász, R., Drotár, P., Gnip, P., Zoričák, M. Clash of titans on imbalanced data: TabNet vs XGBoost. Conf IEEE Trans Artif. , 320-325 (2024).
  42. Hwang, Y., Song, J. Recent deep learning methods for tabular data. Commun Stat Appl Methods. 30 (2), 215-226 (2023).
  43. Gorishniy, Y., et al. TabR: Tabular deep learning meets nearest neighbors in 2023. arXiv. , (2023).
  44. Kalidindi, A., Arrama, M. B. A TabTransformer based model for detecting botnet-attacks on internet of things using deep learning. J Theor Appl Inf Technol. 101 (13), 5206-5218 (2023).
  45. Holzmüller, D., Grinsztajn, L., Steinwart, I. RealMLP: Advancing MLPs and default parameters for tabular data. ELLIS Workshop on Representation Learning and Generative Models for Structured Data. , (2025).
  46. Zhu, B., et al. Xtab: cross-table pretraining for tabular transformers. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Machine Learning BiomarkersMultimodal BiomarkersPredictive Health AnalyticsMolecular BiomarkersDisease MonitoringRisk AssessmentPatient StratificationDeep Learning TechniquesProtein BiomarkersGenetic Biomarkers

Related Articles