Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Aprendizaje por refuerzo profundo híbrido para fusión multimodal de señales biomédicas

225 vistas

DOI:

10.3791/69929

10 de abril de 2026

En este artículo

Resumen

Esta investigación propone un marco híbrido de aprendizaje por refuerzo profundo (HDRL) que integra redes neuronales profundas (DNN) para la extracción de características con aprendizaje por refuerzo (RL) para la fusión dinámica de señales multimodales. Evaluado sobre conjuntos de datos biomédicos, destaca por su precisión, robustez y detección de eventos raros, ofreciendo aplicaciones importantes en medicina personalizada y clasificación de enfermedades.

Resumen

Mejorar la toma de decisiones y la precisión diagnóstica en la atención sanitaria requiere combinar señales biomédicas multimodales como electrocardiogramas (ECG), electroencefalogramas (EEG) e imágenes médicas. Las técnicas tradicionales de fusión de señales enfrentan desafíos significativos debido a la variabilidad de la señal y a su complejidad inherente. Proponemos un modelo híbrido de Aprendizaje por Refuerzo Profundo (HDRL) que emplea Redes Neuronales Profundas (DNN) para la extracción de características y Aprendizaje por Refuerzo (RL) para la optimización de fusión dinámica. Este modelo híbrido utiliza retroalimentación en tiempo real para optimizar el aprendizaje de políticas de fusión y adaptarse a las características variables de los datos. Para evaluar su desempeño, el modelo propuesto se comparó con técnicas convencionales de fusión, como los métodos basados en redes neuronales profundas y el análisis de componentes principales (PCA). El modelo híbrido de aprendizaje por refuerzo profundo fue probado en varios conjuntos de datos biomédicos del mundo real. El modelo propuesto es aplicable a la medicina personalizada y la clasificación de enfermedades, ya que la evidencia experimental demuestra un mejor rendimiento en términos de robustez bajo condiciones ruidosas, precisión de clasificación y detección de eventos raros. La metodología propuesta, además de abordar las preocupaciones con las técnicas tradicionales de fusión de señales, ofrece soluciones prometedoras que impulsan el procesamiento multimodal de señales biomédicas. El modelo utiliza un DNN para la minería de características y agentes RL (DQN, PPO) para la optimización de políticas.

Introducción

La sanidad moderna depende cada vez más de la integración de diversas fuentes de datos biomédicos para mejorar la precisión diagnóstica y la toma de decisiones clínicas. Señales fisiológicas como electrocardiogramas (ECG), electroencefalogramas (EEG) y modalidades de imagen médica, incluyendo resonancia magnética (RM) y tomografía computarizada (TC), proporcionan información fisiológica complementaria que apoya el diagnóstico de enfermedades y el tratamiento personalizado. Sin embargo, las señales biomédicas son inherentemente complejas y a menudo contienen ruido, valores ausentes y estructuras de alta dimensión, lo que dificulta su análisis e interpretación. La fusión multimodal de señales biomédicas, que integra información de múltiples flujos de datos fisiológicos, se ha convertido por ello en un enfoque importante para mejorar el rendimiento diagnóstico, mejorar la robustez frente a las variaciones en la calidad de los datos y permitir una monitorización integral del paciente en entornos clínicos como las unidades de cuidados intensivos (UCI)1.

Los métodos tradicionales de fusión multimodal de señales se han basado en gran medida en técnicas estadísticas y lineales. El Análisis de Componentes Principales (PCA) reduce la dimensionalidad de los datos al transformar las señales en componentes ortogonales, mientras que el Análisis de Correlación Canónica (CCA) identifica relaciones lineales entre modalidades para alinear conjuntos de datosmultimodales 2. Estas técnicas se han aplicado con éxito en entornos biomédicos de fusiónmultimodal 3. Sin embargo, su dependencia de supuestos lineales limita su capacidad para capturar relaciones no lineales complejas que a menudo existen entre señales fisiológicas. En la práctica, los datos biomédicos rara vez son puramente lineales. Los métodos convencionales de fusión multimodal a menudo no logran captar interacciones significativas entre modalidades debido a estas dependencias nolineales 4,5. Como resultado, los métodos convencionales de fusión pueden no captar interacciones significativas entre modalidades, limitando su eficacia en tareas como el diagnóstico de enfermedades y la toma de decisiones clínicas en tiempo real.

Los avances recientes en aprendizaje profundo han transformado significativamente el procesamiento de señales biomédicas al permitir que las redes neuronales extraigan automáticamente representaciones jerárquicas de los datos en bruto. Las Redes Neuronales Convolucionales (CNNs) han demostrado un gran desempeño en el análisis de patrones espaciales en imágenesmédicas 5,6. Se han utilizado arquitecturas CNN multimodales para integrar modalidades de imagen como la resonancia magnética y la tomografía computarizada para mejorar la precisióndiagnóstica 3. De manera similar, las redes neuronales recurrentes (RNN) y las redes de memoria a corto plazo largo (LSTM) se han aplicado a señales biomédicas secuenciales, incluyendo ECG y EEG, para tareas de clasificaciónde enfermedades 7. A pesar de estos avances, muchos enfoques de fusión basados en aprendizaje profundo dependen de estrategias de fusión fijas, como la concatenación de características o el promedio ponderado. Estos mecanismos de fusión estática no se adaptan eficazmente a las variaciones en la calidad de la señal. En entornos clínicos reales, las señales pueden degradarse debido a artefactos de movimiento, desplazamiento de electrodos, distorsión o ruido ambiental. Estas variaciones pueden reducir la fiabilidad de modalidades individuales y afectar negativamente al proceso global de fusión. Abordar estos desafíos requiere estrategias de fusión adaptativas capaces de responder a condiciones dinámicas de datos en entornos clínicosen tiempo real 8.

El Aprendizaje por Refuerzo (RL) proporciona un marco potente para la toma de decisiones secuenciales en entornos inciertos. En RL, un agente aprende a seleccionar acciones que maximicen la recompensa acumulativa a través de la interacción con su entorno. Este proceso de toma de decisiones se formula comúnmente usando la ecuación de Bellman, que define el valor de un estado como la suma de la recompensa inmediata y el valor descontado de las recompensasfuturas 9. Métodos como las Deep Q-Networks (DQN) extienden el aprendizaje por refuerzo a problemas de alta dimensión aproximando la función acción-valor con redes neuronalesprofundas 10. De manera similar, los métodos de aprendizaje profundo por refuerzo basados en políticas permiten un aprendizaje de políticas estable y eficiente mediante actualizaciones iterativas de la política11 del agente. Las técnicas de aprendizaje por refuerzo ya se han explorado en varias aplicaciones sanitarias, incluyendo la optimización del tratamiento y la detecciónde anomalías 12, pero su aplicación a la fusión adaptativa multimodal de señales sigue siendo relativamente limitada.

El Aprendizaje por Refuerzo Profundo Híbrido (HDRL) integra el aprendizaje profundo con el aprendizaje por refuerzo para combinar la extracción de características y la toma de decisiones adaptativa. En este marco, las redes neuronales profundas transforman señales biomédicas multimodales en representaciones de características de alto nivel, mientras que los agentes de aprendizaje por refuerzo seleccionan dinámicamente estrategias de fusión basándose en el rendimiento de latarea 4. Este mecanismo adaptativo permite al sistema responder a variaciones en la calidad de la señal y la disponibilidad modal, lo que permite un funcionamiento más robusto en entornos clínicos complejos como la monitorización en UCI y los sistemas de diagnósticoportátiles 8.

Además de los enfoques clásicos de aprendizaje por refuerzo, se han explorado varias técnicas de aprendizaje híbrido que combinan lógica difusa, algoritmos genéticos y aprendizaje por refuerzo para tareas de clasificación biomédica. Por ejemplo, el aprendizaje difuso de la Q combinado con algoritmos genéticos se ha aplicado a la clasificación de crisis epilépticas utilizando señales EEG, demostrando una mejor adaptabilidad a patrones temporales inciertos13. De manera similar, se han propuesto enfoques de aprendizaje evolutivo basados en red difusa para la clasificación de enfermedades pulmonares utilizando imágenesmédicas 14. Otros estudios han investigado enfoques basados en aprendizaje por refuerzo para el reconocimiento de crisisepilépticas 15 y clasificadores de aprendizaje Q borrosos modificados para detectar neumonía y tuberculosis a partir de radiografías detórax 16. Aunque estos estudios demuestran el potencial de los métodos de aprendizaje híbrido en el análisis biomédico, la mayoría de los enfoques existentes se centran en la clasificación monomodal en lugar de la fusión multimodal de señales.

Los desarrollos recientes en aprendizaje automático multimodal también han explorado arquitecturas basadas en transformadores para aplicaciones médicas multimodales. Estos modelos han mostrado un rendimiento prometedor en tareas como la síntesis de imágenes sanitarias y el análisis de conjuntos de datos biomédicos heterogéneos en los que una o más modalidades pueden estar incompletas ofaltar 17. Sin embargo, incluso con estos avances, la necesidad de mecanismos de fusión adaptativos que respondan dinámicamente a variaciones en los datos multimodales sigue siendo un desafío importante en la investigación.

En este trabajo, se propone un marco híbrido de aprendizaje por refuerzo profundo (HDRL) para la fusión multimodal de señales biomédicas. Se utilizan modelos CNN específicos por modalidad para extraer características de los datos de ECG, EEG y MRI, que luego se combinan para formar una representación multimodal unificada. Un agente de Deep Q-Network (DQN) selecciona dinámicamente estrategias de fusión, como la concatenación de características o la combinación ponderada, según el estado actual de las características. Un clasificador aguas abajo proporciona una señal de recompensa basada en el rendimiento de la clasificación, permitiendo al agente de aprendizaje por refuerzo optimizar la política de fusión mediante retroalimentación continua. Este marco adaptativo permite que el modelo se ajuste a las variaciones en la calidad de la señal y la disponibilidad de modalidades. El enfoque propuesto se evalúa utilizando los conjuntos de datos PhysioNet 2016, CHB-MIT EEG y OASIS-3, y se compara con técnicas convencionales basadas en PCA y fusión basadas en aprendizaje profundo.

Figura 1
Figura 1: Diagrama de bloques que ilustra la arquitectura del sistema propuesto de fusión de señales multimodal basado en HDRL. Representación esquemática del marco multimodal de fusión que muestra las entradas de ECG, EEG e imágenes médicas procesadas mediante extractores profundos de características de redes neuronales, seguidas de fusión adaptativa basada en aprendizaje por refuerzo y retroalimentación de recompensas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La arquitectura del marco propuesto de fusión multimodal de señales se ilustra en la Figura 1. En esta arquitectura, los modelos CNN específicos de modalidad extraen de forma independiente características de las señales de ECG, EEG y MRI. Estas características se combinan entonces en una representación unificada, que el agente de aprendizaje por refuerzo utiliza para determinar la estrategia óptima de fusión.

El procesamiento biomédico de señales desempeña un papel crucial en la sanidad moderna, ya que permite un diagnóstico, monitorización y planificación del tratamiento precisos mediante el análisis de señales fisiológicas obtenidas de múltiples modalidades. Integrar señales como ECG, EEG e imágenes médicas requiere técnicas de fusión sofisticadas que capturen información complementaria de diferentes fuentes. La Tabla 1 resume los enfoques de fusión multimodal de señales comúnmente utilizados, incluyendo sus características clave, ventajas y limitaciones, y destaca la motivación para el marco propuesto basado en HDRL.

MétodoCaracterísticas principalesVentajasLimitaciones
PCAReducción lineal de dimensionalidadRápido, sencilloLimitado a relaciones lineales
DNNAprendizaje de características no linealCaptura patrones complejosEstrategia de fusión fija
DRLAprendizaje dinámico de políticasSe adapta a los datosAlta computación
HDRLDNN + RL híbridoAdaptativo, robusto, eficienteRequiere una afinación cuidadosa

Tabla 1: Comparación de métodos de fusión multimodales. Resumen de los enfoques de fusión multimodal de señales comúnmente utilizados, detallando sus características clave, ventajas y limitaciones.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este protocolo describe la implementación paso a paso del modelo de Aprendizaje por Refuerzo Profundo Híbrido (HDRL) para la fusión multimodal de señales biomédicas. El marco integra técnicas de aprendizaje profundo y aprendizaje por refuerzo para optimizar la fusión en tiempo real de los datos de ECG, EEG e imagen médica. La sección también describe los procedimientos de extracción de características, entrenamiento y preparación de datos utilizados en el modelo propuesto.

Materiales
Todos los experimentos se realizaron en una estación de trabajo con una CPU multinúcleo, ≥32 GB de RAM y una GPU dedicada (≥8 GB de VRAM). El entorno de implementación consistía en Python (v3.9 o posterior), TensorFlow (v2.12) y Keras (v2.12). Las bibliotecas de aprendizaje por refuerzo se instalaron usando pip install stable-baselines3. El paquete18 de Stable-Baselines3 proporciona implementaciones eficientes de algoritmos de Aprendizaje por Refuerzo, como Deep Q-Network (DQN) y Proximal Policy Optimization (PPO).

Conjuntos de datos
El marco propuesto de Aprendizaje por Refuerzo Profundo Híbrido (HDRL) fue evaluado utilizando tres conjuntos de datos biomédicos disponibles públicamente que representan tipos de señales multimodales. (1) PhysioNet Challenge 2016: Una colección de registros de ECG con 12 derivaciones de pacientes con enfermedades cardíacas, incluyendo fibrilación auricular, arritmia ventricular y enfermedad cardíaca isquémica. El conjunto de datos incluye etiquetas anotadas para las afeccionescardíacas 19. (2) Base de Datos de EEG de Cuero Cabelludo CHB-MIT: Se utiliza un conjunto de datos de registros de EEG de cuero cabelludo para la detección de crisis epilépticas, con anotaciones que marcan los eventos de convulsión y noconvulsión 20. (3) Base de datos de resonancia magnética OASIS-3: Se utiliza una colección de imágenes cerebrales de resonancia magnética y valoraciones clínicas para la detección y seguimiento de la enfermedadde Alzheimer 21. Las muestras representativas de cada modalidad demuestran la variabilidad inherente y las características de ruido presentes en los datos biomédicos multimodales (Figura 2).

Figura 2
Figura 2: Muestreo de señales biomédicas de ECG, EEG e imágenes médicas. Ejemplos representativos de forma de onda ECG, señal EEG y una exploración de imagen médica que ilustran las diferentes modalidades utilizadas en el estudio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Preprocesamiento de datos
Cada modalidad pasó por procedimientos de preprocesamiento específicos de cada modalidad para asegurar una representación estandarizada de las entradas. Las señales EEG y ECG se filtraban usando un filtro pasa-banda Butterworth de cuarto orden. El rango de frecuencias se ajustó a 0,5–40 Hz para EEG y 0,5–45 Hz para ECG. Las muestras se segmentaron en ventanas de 5 segundos con un 50% de solapamiento. Cada señal se normalizaba segmentándola para lograr una media cero y una varianza unitaria. Las imágenes de la resonancia magnética se procesaron mediante desmontaje craneal con la Herramienta de Extracción Cerebral (BET) de FSL. Las imágenes se redimensionaron a 224 × 224 píxeles. Las intensidades de píxeles se normalizaron al rango [0,1] para estandarizar las distribuciones de entrada.

Extracción de características
La extracción de características se realizó de forma independiente para cada modalidad utilizando DNNs, asegurando que las características únicas de cada modalidad se capturaran eficazmente.

Extractores de características de ECG y EEG:
Se empleó una arquitectura de Red Neuronal Convolucional 1D (1D-CNN) para el procesamiento de señales en series temporales. La arquitectura consistía en (1) una capa de entrada (window_length, 1), (2) capas Conv1D con 64 filtros y un tamaño de kernel de 3, (3) activación de ReLU, (4) MaxPooling1D con tamaño de pool=2, (5) capas Flatten y Dense (128 unidades, ReLU). Las representaciones de capas densas penúltimas se extrajeron como vectores de características específicas de la modalidad.

Extractor de características de resonancia magnética
Se ajustó finamente un modelo CNN bidimensional preentrenado (por ejemplo, VGG16 o ResNet50) para extraer características espaciales de imágenes de resonancia magnética. El CNN se entrenó con el conjunto de datos OASIS-3, con las últimas capas del modelo preentrenado modificadas para adaptarse a la tarea de clasificaciónespecífica 21. Las capas finales de clasificación fueron reemplazadas por capas específicas de tarea, y se extrajeron características espaciales de alto nivel de la penúltima capa 5,6.

Arquitectura y formación de modelos
El marco propuesto de Aprendizaje Profundo por Refuerzo Híbrido (HDRL) se desarrolló y entrenó en dos etapas secuenciales: extracción de características específicas por modalidad seguida de optimización basada en fusión basada en aprendizaje por refuerzo. En la primera etapa, se entrenaron Redes Neuronales Convolucionales (CNN) separadas con datos etiquetados para modalidades de ECG, EEG y resonancia magnética. Durante el entrenamiento supervisado se empleó el optimizador de Estimación de Momento Adaptativo (Adam), con una tasa de aprendizaje de 0,001 y pérdida categórica de entropía cruzada. Tras la convergencia, se extrajeron representaciones de alto nivel de la penúltima capa de cada CNN, dando lugar a vectores de características específicos de la modalidad FECG = CNNECG(XECG), FECG = CNN ECG (X ECG) y FMRI =CNN MRI(XMRI). Estos vectores se concatenaron para formar una representación multimodal unificada Fconcat = [FECG, FEEG,F MRI], que sirve como entrada a la etapa de Aprendizaje por Refuerzo.

El proceso de fusión se formuló como un Proceso de Decisión de Markov (MDP), donde el estado s correspondía al vector de características concatenado F concat, la acción representaba la selección de una estrategia de fusión (ya fuera suma ponderada o concatenación directa) y la recompensa r se definía como la precisión de clasificación obtenida de un clasificador posterior entrenado sobre las características fusionadas. La función acción-valor Q(s,a) se aproximaba usando una Red Profunda Q-Network (DQN), que estimaba la recompensa Ecuación 1acumulada esperada. Los parámetros del modelo se actualizaban iterativamente según la regla.

Ecuación 2

donde α = 0,0001 es la tasa de aprendizaje, γ = 0,99 es el factor de descuento y s' denota el siguiente estado.

Durante la optimización por Aprendizaje por Refuerzo, el modelo se entrenó para 1.000 episodios con un tamaño de lote de 32. Se adoptó una estrategia codiciosa de épsilon para equilibrar exploración y explotación, Ecuación 3 con una inicialización en 1.0 y decaída en 0,995 por episodio. Con probabilidad Ecuación 3, se seleccionó una estrategia de fusión aleatoria, mientras que con probabilidad 1 - Ecuación 3, se eligió la estrategia con el valor Q estimado más alto. La convergencia de recompensas se monitorizó durante todo el entrenamiento, con un rendimiento estable (>0,85 de recompensa acumulada) observado típicamente en aproximadamente 500 episodios.

El flujo de trabajo HDRL implica preprocesar señales multimodales, extraer características profundas específicas de la modalidad, formar una representación unificada de estados, seleccionar estrategias de fusión y mejorar la política utilizando retroalimentación de clasificación del agente DQN. La interacción entre extractores de características basados en CNN y el agente de aprendizaje por refuerzo forma un sistema de fusión adaptativa de lazo cerrado (Figura 3), que permite actualizaciones de políticas basadas en la retroalimentación de recompensa.

Figura 3
Figura 3: Diagrama de flujo del flujo de trabajo propuesto de Aprendizaje Profundo por Refuerzo Híbrido (HDRL). Diagrama de flujo de trabajo que muestra la extracción de características CNN específicas por modalidad, la concatenación de características, la selección basada en aprendizaje por refuerzo de una estrategia de fusión (DQN/PPO), la clasificación downstream y la actualización de políticas basada en recompensas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Los resultados experimentales indican que el modelo propuesto de Aprendizaje Híbrido por Refuerzo Profundo (HDRL) logra un mejor rendimiento para la fusión multimodal de señales biomédicas. El modelo HDRL fue evaluado validándolo frente a varios conjuntos de datos biomédicos del mundo real. Los resultados, en términos de robustez, adaptabilidad y precisión en la clasificación, muestran su superioridad sobre otros métodos tradicionales de fusión, como la fusión basada en PCA y DNN.

Mont...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Eficiencia en la fusión:
Esta sección presenta un análisis comparativo de la eficiencia de fusión entre HDRL, PCA y DNN. El conjunto de datos multimodal, obtenido fusionando datos de EEG, ECG y MRI del PhysioNet Challenge2016-19, la base de datos20 de EEG para el cuero cabelludo CHB-MIT y la base de datos21 de resonancia magnética OASIS-3, se utilizó para calcular la eficiencia de fusión. El tiempo de procesamiento es un parámetro...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores declaran que no existen conflictos de interés relacionados con esta obra.

Agradecimientos

La investigación se llevó a cabo parcialmente en las instalaciones del Palacio de la Ciencia, Centro de Dotación Miodrag Kostić - Centro de Inteligencia Artificial Aplicada. Esta investigación fue apoyada por EUROHPC-JU, Subvención nº 101191697, EuroCC4SEE.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Filtro Butterworth (4º orden, implementación SciPy)Comunidad SciPyN/APreprocesamiento de señales EEG/ECG
Base de datos de EEG para el cuero cabelludo CHB-MITPhysioNetDOI: 10.13026/C2K01RConjunto de datos EEG
Herramienta de Extracción Cerebral de FSL (BET)Biblioteca de Software FMRIB (FSL)N/ADesmontaje de cráneo por resonancia magnética
Keras (v2.12)Google LLCN/AAPI de redes neuronales de alto nivel
NVIDIA GPU (≥ 8 GB de VRAM)NVIDIA CorporationDependiente del modeloObligatorio para la formación acelerada en aprendizaje profundo
Base de datos de resonancia magnética OASIS-3Universidad de WashingtonDOI: 10.1002/alz.047259Conjunto de datos de resonancia magnética
Conjunto de datos PhysioNet Challenge 2016PhysioNetDOI: 10.22489/CinC.2016.179-154Conjunto de datos ECG
Python (v3.9 o posterior)Fundación de Software PythonN/AEntorno de programación
Líneas Base Estables3DLR-RM (Código abierto)N/AImplementación de aprendizaje por refuerzo (DQN, PPO)
TensorFlow (v2.12)Google LLCN/AMarco de aprendizaje profundo
Estación de trabajo (CPU multinúcleo, ≥ 32 GB de RAM, ≥ GPU de 8 GB)Proveedor personalizado / localN/AUtilizado para el entrenamiento y experimentación de modelos

Referencias

  1. Stahlschmidt, S. R., Ulfenborg, B., Synnergren, J. Multimodal deep learning for biomedical data fusion: a review. Brief. Bioinform. 23 (2), bbab569(2022).
  2. Er, A. G., et al. Multimodal data fusion using sparse canonical correlation analysis and cooperative learning: a COVID-19 cohort study. NPJ Digit. Med. 7 (1), 45(2024).
  3. Deng, X., Dragotti, P. L. Deep convolutional neural network for multi-modal image restoration and fusion. IEEE Trans. Pattern Anal. Mach. Intell. 43 (10), 3333-3348 (2021).
  4. Duan, J., Xiong, J., Li, Y., Ding, W. Deep learning based multimodal biomedical data fusion: overview and comparative review. Inf. Fusion. 105, 102536(2024).
  5. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. Proc. Int. Conf. Learn. Represent. , (2015).
  6. He, K., Zhang, X., Ren, S., Sun, J. Deep residual learning for image recognition. Proc. IEEE Conf. Comput. Vis. Pattern Recognit. , 770-778 (2016).
  7. Boda, S., Mahadevappa, M., Dutta, P. K. Automated patient-specific ECG beat classification using LSTM-based recurrent neural networks. Biomed. Signal Process. Control. 84, 104756(2023).
  8. Mulani, J., et al. Deep reinforcement learning based personalized health recommendations. Adv. Healthcare Syst. , 231-255 (2020).
  9. Sutton, R. S., Barto, A. G. Reinforcement Learning: An Introduction. , 2nd ed, MIT Press. (2018).
  10. Mnih, V., et al. Human-level control through deep reinforcement learning. Nature. 518 (7540), 529-533 (2015).
  11. Mnih, V., et al. Asynchronous methods for deep reinforcement learning. arXiv. , (2016).
  12. Yu, C., Liu, J., Nemati, S., Yin, G. Reinforcement learning in healthcare: a survey. ACM Comput. Surv. 55 (1), 1-36 (2023).
  13. Gupta, A., et al. Genetic algorithm assisted fuzzy Q-learning epileptic seizure classifier. IEEE Trans. Neural Syst. Rehabil. Eng. 30, 112-123 (2022).
  14. Sharma, R., et al. Fuzzy lattices assisted EJAYA Q-learning for pulmonary disease classification. Comput. Biol. Med. 145, 105432(2022).
  15. Kumar, P., et al. Epileptic seizure classification using fuzzy lattices and neural reinforcement learning. J. Biomed. Inform. 135, 104210(2023).
  16. Singh, V., et al. Modified fuzzy Q-learning classifier for pneumonia and tuberculosis. Med. Image Anal. 85, 102756(2023).
  17. Zhu, X., Li, Y. Latent multi-scale residual transformer for cross-modal medical image synthesis. IEEE Access. 13, 58745-58758 (2025).
  18. Raffin, A., et al. Stable-baselines3: reliable reinforcement learning implementations. J. Mach. Learn. Res. 22 (268), 1-8 (2021).
  19. Clifford, G. D., et al. Classification of normal/abnormal heart sound recordings: PhysioNet/Computing in Cardiology Challenge 2016. Comput. Cardiol. 43, 609-612 (2016).
  20. Goldberger, A., et al. CHB-MIT Scalp EEG Database. PhysioNet. , (2021).
  21. Marcus, D., et al. OASIS-3 MRI database for Alzheimer’s disease detection. Alzheimers Dement. 16 (S10), e047259(2020).
  22. Jain, A., Mehrotra, A., Rewariya, A., Kumar, S. A systematic study of deep Q-networks and their variations. 2nd Int. Conf. Adv. Comput. Innov. Technol. Eng, , 2157-2162 (2022).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Aprendizaje profundo h bridose ales multimodalesredes neuronales profundasextracci n de caracter sticasoptimizaci n de pol ticasim genes m dicasclasificaci n de enfermedadesan lisis de componentes principales