$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Flujo de trabajo experimental
La Figura 1 ilustra una cadena de flujo de trabajo organizada y modular diseñada para categorizar biomarcadores moleculares en categorías de indicación de riesgo o diagnóstico utilizando técnicas de aprendizaje automático y aprendizaje profundo. Aquí tienes una explicación detallada paso a paso del proceso:
- Adquisición de conjuntos de datos
El conjunto de datos se recopila de MarkerDB 2.0, una base de datos curada de biomarcadores moleculares.
- Preprocesamiento de datos
Esto garantiza la calidad y consistencia de los datos al manejar valores nulos y entradas faltantes, codificar características categóricas usando LabelEncoder y escalar características numéricas (por ejemplo, entrez_gene_id) usando StandardScaler.
- Ingeniería de características
Se recomienda seleccionar características relevantes que influyan en la clasificación de biomarcadores, eviten fugas de datos y mejoren el rendimiento del modelo.
- Desarrollo de modelos
Los enfoques utilizados son Regresión Logística, Bosque Aleatorio, XGBoost, mientras que en DL: MLP, MLP con LR Scheduler, AutoInt, TabNet. Las actividades realizadas son ajuste de hiperparámetros, validación cruzada y optimización para tareas de clasificación.
- División de datos
Aquí, el Set de entrenamiento (80%) se usa para aprender parámetros del modelo, y el Set de pruebas (20%) se usa para evaluar el modelo sobre datos no vistos. En la etapa final, se utilizan métricas de evaluación para asegurar que el rendimiento se mide de forma holística, especialmente en escenarios de clase desequilibrados.

Figura 1: Diagrama de flujo del trabajo propuesto. El flujo de trabajo del problema propuesto se muestra en esta figura. Los pasos son preprocesamiento de datos, ingeniería de características, desarrollo de modelos, divisiones, evaluación de modelos mediante métricas y análisis de biomarcadores. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
2. Descripción del conjunto de datos
El nombre del conjunto de datos se all_sequence_variants con extensión csv. Hay columnas con nombres como 'id', 'variación', 'posición', 'external_link', 'gene_symbol', 'entrez_gene_id', 'referencia', condiciones', 'indication_types', donde todas son tipo objeto excepto id como tipo int y entrez_gene_id tipo flotante. El número total de filas es de 42.818 con 9 columnas. Además, el conjunto de datos tiene valores nulos para variación, posición, external_link, entrez_gene_id, referencia, condiciones y indication_types. El conjunto de datos se extrae del enlace dado como: https://markerdb.ca/downloads17
3. Preprocesamiento de conjuntos de datos
En esta etapa, el preprocesamiento de datos comienza con la recopilación de información del conjunto de datos, descripción, identificación de duplicados y localización de valores ausentes o nulos. No hay impacto de la característica external_link cuando se mide por el coeficiente de correlación, por lo que se elimina. Los valores nulos de las columnas categóricas y numéricas se rellenan con la mediana y la media, respectivamente. Finalmente, la forma del conjunto de datos de entrada y salida es (42787, 6)(42787,). Las columnas de entrada son 'id', 'variación', 'posición', 'gene_symbol', 'entrez_gene_id', 'condiciones', mientras que la columna objetivo es indication_types.
4. Biomarcadores: categorías, desafíos de datos y el papel del riesgo molecular
Un biomarcador es un rasgo cuantificable que indica actividades biológicas normales o anormales o respuestas a diversas exposiciones o intervenciones. Los biomarcadores pueden ser de naturaleza molecular, histológica, radiográfica o fisiológica y se dividen en siete categorías principales: (1) Un biomarcador diagnóstico determina si un individuo tiene una enfermedad o trastorno específico y si pertenece a un subtipo, (2) Un biomarcador de monitorización indica la progresión de una enfermedad y su respuesta al tratamiento, (3) Un biomarcador de respuesta muestra si el paciente está reaccionando a un medicamento o terapia, como un cambio en la frecuencia cardíaca, (4) Un biomarcador predictivo puede determinar si una persona está en riesgo de desarrollar una determinada enfermedad y cómo puede responder a un tratamiento concreto, (5) Un biomarcador pronóstico puede ofrecer información sobre la probabilidad de progresión o recurrencia de la enfermedad si un paciente está predispuesto a un resultado de salud específico, (6) Un biomarcador de riesgo evalúa el nivel potencial de riesgo para una condición antes de que el paciente reciba un diagnóstico oficial, y (7) Un biomarcador de seguridad evalúa el potencial de reacciones tóxicas o adversas que puedan surgir del tratamiento. Este estudio se centra principalmente en el análisis de biomarcadores moleculares relacionados con la evaluación de riesgos y el diagnóstico, tal como se muestra en la Figura 2. Dada la gran cantidad de datos clínicos disponibles en todo el mundo, los biomarcadores son esenciales para orientar las decisiones clínicas, avanzar en la investigación y facilitar la medicina personalizada.

Figura 2: Categoría de biomarcadores para la toma de decisiones clínicas. Las decisiones del biomarcador se representan en este diagrama. En base a los análisis aplicados a los biomarcadores, se consideran las decisiones clínicas y se implementan algoritmos de aprendizaje automático. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Encontrar y comprender información clínicamente útil sobre biomarcadores es un reto debido a la amplia variedad de tipos, características y calidad de biomarcadores. El rápido crecimiento de los estudios de biomarcadores en las últimas dos décadas ha complicado aún más el acceso a datos completos y actualizados, especialmente en el caso de biomarcadores moleculares. Esto ha dado lugar a problemas como hallazgos inconsistentes, redescubrimiento redundante de biomarcadores existentes, resultados contradictorios y oportunidades pasadas por alto para utilizar biomarcadoresya establecidos. La aparición de mediciones "ómicas" ha agravado este problema, resultando en la proliferación de nuevos biomarcadores moleculares en ensayos clínicos y en la literatura, lo que dificulta cada vez más la navegación y aplicación eficaz del conocimientode biomarcadores 19.
MarkerDB 2.0 proporciona acceso a diversos biomarcadores moleculares con finesexperimentales 20. Diversos biomarcadores se utilizan en la investigación clínica y en aplicaciones sanitarias para diagnosticar, predecir y monitorizar enfermedades. Entre ellos, los biomarcadores proteicos utilizan biofluidos como suero, sangre, líquido cefalorraquídeo (LCR), líquido peritoneal, líquido amniótico, plasma y orina para analizar condiciones como diabetes mellitus, tuberculosis, síndrome de Down y trastornos relacionados con la miopatía. De manera similar, los biomarcadores genéticos utilizan símbolos génicos como LRP1, LPP, MAPT y SPI1 para analizar condiciones como la degeneración macular relacionada con la edad, enfermedades alérgicas, enfermedad de Alzheimer, cáncer y asma. Además, los biomarcadores moleculares multimodales ayudan a medir el riesgo del paciente y los indicadoresdiagnósticos 21. Este trabajo pone de manifiesto la necesidad de análisis sanitarios utilizando enfoques de aprendizaje automático para mejorar el diagnóstico, la predicción y el tratamiento personalizado de enfermedades.
5. Modelización de enfoques estadísticos de aprendizaje automático para el descubrimiento de biomarcadores
La aplicación de enfoques de aprendizaje automático ha transformado el campo sanitario de numerosas maneras. Específicamente, los biomarcadores moleculares han sido analizados utilizando diversas técnicas de aprendizaje automático, incluyendo el Análisis de Componentes Principales (PCA), el agrupamiento K-means (KMA), el Análisis de Vecinos Más Cercanos (NNA) y los algoritmosde redes neuronales 22. Estos modelos identifican patrones intrincados a partir de características seleccionadas, gestionan datos incompletos o inconsistentes y apoyan el seguimiento en tiempo real del avance de la enfermedad. Además de diagnosticar enfermedades, los algoritmos de aprendizaje automático proporcionan información significativa sobre los problemas del paciente mediante el examen y visualización de datos, permitiendo una atención rápiday dirigida 23. Como resultado, esto mejora los resultados de salud del paciente en condiciones inusuales. Además, la capacidad del aprendizaje automático para revolucionar el descubrimiento de biomarcadores y los resultados terapéuticos en diversas enfermedades, incluido el análisis de biomarcadores moleculares, está cobrando cada vez más vida.
Los algoritmos de aprendizaje automático se categorizan en cinco tipos principales, como se muestra en la Figura 3. El aprendizaje supervisado es el proceso de entrenar sobre conjuntos de datos etiquetados para entender las relaciones entrada-salida, lo que lo hace ideal para tareas como la clasificación y la regresión, como árboles de decisión y máquinas de vectores de soporte. El aprendizaje no supervisado identifica patrones dentro de datos no etiquetados y a menudo se aplica para agrupamiento y reducción de dimensionalidad, con técnicas como el agrupamiento k-means y el análisis de componentes principales. El aprendizaje semi-supervisado fusiona tanto datos etiquetados como no etiquetados para generar predicciones. El aprendizaje por refuerzo se centra en la toma de decisiones informada por la retroalimentación del entorno, y se utiliza frecuentemente en juegos y robótica, con métodos como el Q-learning y las redes de aprendizaje por refuerzo profundo. El aprendizaje profundo emplea redes neuronales artificiales con múltiples capas para identificar patrones intrincados en los datos. Esta técnica ayuda a predecir biomarcadores para enfermedades comunes, incluyendo cáncer, ictus, enfermedad de Alzheimer y enfermedad de Parkinson. Numerosos programas clínicamente aprobados utilizan estatecnología 24,25. El diagnóstico preciso de los pacientes con tumores malignos suele depender de la adquisición y el análisis patológico de muestras de tejido, que proporcionan información crítica sobre el grado histológico, subtipo, estadio y otros biomarcadores tumorales.

Figura 3: Categorización de algoritmos de aprendizaje automático para la toma de decisiones clínicas. Los tipos de algoritmos de aprendizaje automático en el diagrama se ilustran para ayudar a comprender la metodología aplicada. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La estadística y el aprendizaje automático son dos disciplinas separadas que frecuentemente se cruzan. La estadística implica recopilar, analizar e interpretar datos, normalmente trabajando con conjuntos de datos más pequeños y bien definidos, y se centra principalmente en comparar y resumir información. Por otro lado, el aprendizaje automático es un subconjunto de la inteligencia artificial que crea modelos predictivos, a menudo lidiando con conjuntos de datos grandes e intrincados. Aunque la estadística desempeña un papel importante en la investigación confirmatoria y en la comprensión de los mecanismos subyacentes, el aprendizaje automático es más eficaz en la investigación exploratoria, descubriendo patrones complejos y gestionando datos perdidos. Métodos como la regresión logística pueden considerarse tanto modelos estadísticos como modelos de aprendizaje automático supervisado, ilustrando las difusas distinciones entre ambos dominios. En última instancia, los investigadores deben evaluar sus objetivos de investigación y la naturaleza de sus datos para seleccionar el método más adecuado.
6. Modelado de MLP y variantes de MLP
MLP, también conocido como perceptrón multicapa, es un tipo de arquitectura de red neuronal que presenta múltiples capas neuronales entre las capas de entrada y salida, como se ilustra en la Figura 4. La MLP se introdujo en los años 50 y ganó un uso generalizado gracias al avance y avances en la retropropagación en los años 80, lo que ayudó a minimizar la pérdida. Los principios básicos de aprendizaje de MLP son redes neuronales, pesos y valores de sesgo para calcular la salida. Finalmente, conocer la función de activación y el valor umbral para obtener la salida en la capa de salida. En la metodología propuesta, los nodos de la capa de entrada, capa oculta y capa de salida corresponden a características clínicas y génicas, capas totalmente conectadas con activación de ReLU y una sola neurona con activación sigmoide para predecir el resultado binario del tipo de indicación (Riesgo, Diagnóstico), respectivamente. Las principales ventajas son que son fáciles de entrenar e interpretar. Sin embargo, el MLP simple no puede manejar grandes conjuntos de datos y es sensible a la tasa de aprendizaje26. Por lo tanto, para superar estos inconvenientes, se considera MLP con Learning Rate Scheduler con la arquitectura que se muestra en la Figura 3B. MLP con LR es un mecanismo dinámico potente con decaimiento pronunciado, decaimiento exponencial, decaimiento inverso del tiempo, ReduceLROnPlateau y recocido coseno. En lugar de un valor LR fijo, la tasa de aprendizaje cambia en función del rendimiento y el entrenamiento del modelo.

Figura 4: Modelado de perceptrón multicapa y MLP con un planificador LR. (A) Perceptrón Multicapa: La estructura de MLP se ilustra con la Capa de Entrada, la Capa Oculta y la Capa de Salida. La primera capa recibe la entrada y la procesa en la segunda capa con activaciones, y la salida se recibe en la última capa. MLP es sencillo de implementar. (B) MLP con planificador LR: Esto es similar a MLP; sin embargo, se añade un Planificador de Tasa de Aprendizaje para controlar la velocidad de entrenamiento y así lograr una mejor tasa de convergencia. La tasa de aprendizaje se reduce en una meseta. Esto reduce los mínimos que se exceden. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Este enfoque es más eficiente, fiable y eficaz para datos tabulares. Además, existen beneficios como la mejora estable de la convergencia en datos ruidosos, una mayor generalización y un esfuerzo reducido en la afinación de hiperparámetros. Sin embargo, en algunas tareas de predicción, pueden surgir dificultades, como quedarse atascado en mínimos locales. Además, en la arquitectura MLP amplia y profunda presentada en la Figura 5, se introducen componentes anchos y profundos en la MLP para destacar en mapeo de correlación, memorización de reglas y aprendizaje de nuevos patrones, manteniendo altos estándares de generalización. Al combinar estos aspectos en la capa de salida, se predice la salida binaria27. Sin embargo, existen limitaciones en la generalización de características invisibles y en la sobregeneralización. En conclusión, se utiliza MLP con Norma por Lotes y Abandono para normalizar el proceso de entrenamiento, incorporando el abandono para el aprendizaje y la generalización de atributos desconocidos. En particular, esta técnica puede aplicarse a datos de alta dimensión y ayuda a evitar el sobreajuste. No obstante, esta técnica sufre de limitaciones de tamaño por lote, un mayor consumo de memoria (debido a las capas de normalización por lotes) y no es una solución universal28,29.

Figura 5: Modelado de redes MLP a nivel largo y profundo. El diagrama ilustra el camino profundo de la MLP, que puede capturar relaciones no lineales y combina la salida con una unidad sigmoide para su clasificación. Esta arquitectura captura el aprendizaje de patrones y el conocimiento para datos heterogéneos de biomarcadores. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
7. TabNet
La TabNet es un modelo de aprendizaje profundo conocido como Red Tabular desarrollado por el equipo de investigaciónde Google 30. La principal motivación del modelo TabNet es reconciliar las diferencias entre los enfoques de aprendizaje automático para imagen, texto, voz (CNN, Autoencoder, Transformers) y enfoques de aprendizaje automático basado en árbol (XGBoost, Random Forest, LightGBM). Además, las limitaciones de los enfoques DL tienen un gran impacto en el modelo TabNet, siendo MLP un modelo parametrizado. Por encima de todo, los enfoques DL carecen de interpretación en problemas del mundo real, aprendizaje autosupervisado y capacidad de aprendizajesecuencial 31. Los modelos TabNet se limitan a aplicaciones como la predicción de riesgode seguros 32, la estimación del contenido de cenizas decarbón 33, la predicción de toxicidad química34 y la detección de trampas en pruebaseducativas 35. La arquitectura de TabNet se muestra en la Figura 6.

Figura 6: Modelado de redes tabulares. La red tabular toma las características de entrada en formato tabular y aplica la técnica del transformador de forma secuencial en cada bloque. El bloque GLU, también conocido como bloque de Unidad Lineal Controlada, controla el flujo de información hacia adelante a través de la red, facilitando la selección de características y un aprendizaje estable. La salida se presenta en la capa de salida a partir de la salida acumulada. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
A partir del diagrama arquitectónico anterior, el sistema se divide en cuatro componentes: bloque de entrada, transformador de características compartidas, pasos secuenciales de decisión y el cálculo de pérdidas mediante optimización. En las características categóricas, las características se convierten en enteros siguiendo la capa de incrustación. Al mismo tiempo, las características continuas se toman tal cual. Finalmente, las características se convierten en un vector unificado donde x ∈ Rd. En el siguiente paso, se implementan capas totalmente conectadas con funciones de activación, seguidas de una transformación para convertir los datos en vector, y se toma una decisión. En el tercer paso, se utilizan sucesivamente el transformador de atención, el enmascaramiento, el transformador de decisión y la acumulación de predicción. Los objetivos de este paso son la atención selectiva, el razonamiento secuencial y las vías de decisión. En el último paso, se utilizan métodos binarios de entropía cruzada o similares para encontrar la pérdida y optimizar el valor. Además, la regularización se realiza utilizando atención escasa para evitar el sobreajuste.
8. AutoInt
El aprendizaje automático de interacción de características mediante redes neuronales autoatentas (AutoInt) es la forma completa de AutoInt, introducida en la predicción de tasa de clics (CTR) 36 y posteriormente aplicada a diversas aplicaciones, incluyendo la predicción de defectos desoftware 37, sistemas derecomendación 38 y detección degenomas 39. Existen limitaciones en los enfoques existentes de ML, incluyendo el manejo de datos dispersos de alta dimensión, características combinatorias de orden superior, la comprensión de la capacidad de predicción de la característica y la necesidad de ingeniería manual de características. Todos estos desafíos mencionados se abordan con eficiencia, eficacia y explicabilidad en el modelo AutoInt. El objetivo de AutoInt en la metodología propuesta es predecir si la variante dada es de un tipo de indicación de Riesgo o Diagnóstico. Se proponen siete pasos para el conjunto de datos dado, como se muestra en la Figura 6, junto con el código fuente. En primer lugar, la lectura de datos y el preprocesamiento se implementan para codificar todas las características categóricas como enteros y asignar las etiquetas a 0 y 1 para Riesgo y Diagnóstico, respectivamente. En el segundo paso, se realiza la representación de características para crear la matriz de incrustación; a su vez, la matriz se convierte para normalizar las características numéricas. Existen capas de interacción donde se aprende la interacción automática neutra entre las características sin interacción manual con los transformadores. Además, varias cabezas aprenden diferentes tipos de interacciones y, finalmente, las características se concatenan, mejorando la representación. Existen conexiones residuales para aprender tanto interacciones de orden inferior como superior, como 1 característica, 2 características, 3 características, y así sucesivamente. Finalmente, desde la red residual, las salidas se pasan a la función sigmoide para cálculos de valores binarios, como se muestra en la Figura 7.

Figura 7: Modelado de la red AutoInt. La Red AutoInt aprende automáticamente las características, donde la capa de incrustación toma las características y las mapea a la siguiente capa usando un mecanismo de autoatención y conexiones residuales. El último componente tiene la capa MLP y funciones de activación para producir la salida. Por favor, haz clic aquí para ver una versión ampliada de esta figura.