Este protocolo describe la implementación paso a paso del modelo de Aprendizaje por Refuerzo Profundo Híbrido (HDRL) para la fusión multimodal de señales biomédicas. El marco integra técnicas de aprendizaje profundo y aprendizaje por refuerzo para optimizar la fusión en tiempo real de los datos de ECG, EEG e imagen médica. La sección también describe los procedimientos de extracción de características, entrenamiento y preparación de datos utilizados en el modelo propuesto.
Materiales
Todos los experimentos se realizaron en una estación de trabajo con una CPU multinúcleo, ≥32 GB de RAM y una GPU dedicada (≥8 GB de VRAM). El entorno de implementación consistía en Python (v3.9 o posterior), TensorFlow (v2.12) y Keras (v2.12). Las bibliotecas de aprendizaje por refuerzo se instalaron usando pip install stable-baselines3. El paquete18 de Stable-Baselines3 proporciona implementaciones eficientes de algoritmos de Aprendizaje por Refuerzo, como Deep Q-Network (DQN) y Proximal Policy Optimization (PPO).
Conjuntos de datos
El marco propuesto de Aprendizaje por Refuerzo Profundo Híbrido (HDRL) fue evaluado utilizando tres conjuntos de datos biomédicos disponibles públicamente que representan tipos de señales multimodales. (1) PhysioNet Challenge 2016: Una colección de registros de ECG con 12 derivaciones de pacientes con enfermedades cardíacas, incluyendo fibrilación auricular, arritmia ventricular y enfermedad cardíaca isquémica. El conjunto de datos incluye etiquetas anotadas para las afeccionescardíacas 19. (2) Base de Datos de EEG de Cuero Cabelludo CHB-MIT: Se utiliza un conjunto de datos de registros de EEG de cuero cabelludo para la detección de crisis epilépticas, con anotaciones que marcan los eventos de convulsión y noconvulsión 20. (3) Base de datos de resonancia magnética OASIS-3: Se utiliza una colección de imágenes cerebrales de resonancia magnética y valoraciones clínicas para la detección y seguimiento de la enfermedadde Alzheimer 21. Las muestras representativas de cada modalidad demuestran la variabilidad inherente y las características de ruido presentes en los datos biomédicos multimodales (Figura 2).

Figura 2: Muestreo de señales biomédicas de ECG, EEG e imágenes médicas. Ejemplos representativos de forma de onda ECG, señal EEG y una exploración de imagen médica que ilustran las diferentes modalidades utilizadas en el estudio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Preprocesamiento de datos
Cada modalidad pasó por procedimientos de preprocesamiento específicos de cada modalidad para asegurar una representación estandarizada de las entradas. Las señales EEG y ECG se filtraban usando un filtro pasa-banda Butterworth de cuarto orden. El rango de frecuencias se ajustó a 0,5–40 Hz para EEG y 0,5–45 Hz para ECG. Las muestras se segmentaron en ventanas de 5 segundos con un 50% de solapamiento. Cada señal se normalizaba segmentándola para lograr una media cero y una varianza unitaria. Las imágenes de la resonancia magnética se procesaron mediante desmontaje craneal con la Herramienta de Extracción Cerebral (BET) de FSL. Las imágenes se redimensionaron a 224 × 224 píxeles. Las intensidades de píxeles se normalizaron al rango [0,1] para estandarizar las distribuciones de entrada.
Extracción de características
La extracción de características se realizó de forma independiente para cada modalidad utilizando DNNs, asegurando que las características únicas de cada modalidad se capturaran eficazmente.
Extractores de características de ECG y EEG:
Se empleó una arquitectura de Red Neuronal Convolucional 1D (1D-CNN) para el procesamiento de señales en series temporales. La arquitectura consistía en (1) una capa de entrada (window_length, 1), (2) capas Conv1D con 64 filtros y un tamaño de kernel de 3, (3) activación de ReLU, (4) MaxPooling1D con tamaño de pool=2, (5) capas Flatten y Dense (128 unidades, ReLU). Las representaciones de capas densas penúltimas se extrajeron como vectores de características específicas de la modalidad.
Extractor de características de resonancia magnética
Se ajustó finamente un modelo CNN bidimensional preentrenado (por ejemplo, VGG16 o ResNet50) para extraer características espaciales de imágenes de resonancia magnética. El CNN se entrenó con el conjunto de datos OASIS-3, con las últimas capas del modelo preentrenado modificadas para adaptarse a la tarea de clasificaciónespecífica 21. Las capas finales de clasificación fueron reemplazadas por capas específicas de tarea, y se extrajeron características espaciales de alto nivel de la penúltima capa 5,6.
Arquitectura y formación de modelos
El marco propuesto de Aprendizaje Profundo por Refuerzo Híbrido (HDRL) se desarrolló y entrenó en dos etapas secuenciales: extracción de características específicas por modalidad seguida de optimización basada en fusión basada en aprendizaje por refuerzo. En la primera etapa, se entrenaron Redes Neuronales Convolucionales (CNN) separadas con datos etiquetados para modalidades de ECG, EEG y resonancia magnética. Durante el entrenamiento supervisado se empleó el optimizador de Estimación de Momento Adaptativo (Adam), con una tasa de aprendizaje de 0,001 y pérdida categórica de entropía cruzada. Tras la convergencia, se extrajeron representaciones de alto nivel de la penúltima capa de cada CNN, dando lugar a vectores de características específicos de la modalidad FECG = CNNECG(XECG), FECG = CNN ECG (X ECG) y FMRI =CNN MRI(XMRI). Estos vectores se concatenaron para formar una representación multimodal unificada Fconcat = [FECG, FEEG,F MRI], que sirve como entrada a la etapa de Aprendizaje por Refuerzo.
El proceso de fusión se formuló como un Proceso de Decisión de Markov (MDP), donde el estado s correspondía al vector de características concatenado F concat, la acción representaba la selección de una estrategia de fusión (ya fuera suma ponderada o concatenación directa) y la recompensa r se definía como la precisión de clasificación obtenida de un clasificador posterior entrenado sobre las características fusionadas. La función acción-valor Q(s,a) se aproximaba usando una Red Profunda Q-Network (DQN), que estimaba la recompensa
acumulada esperada. Los parámetros del modelo se actualizaban iterativamente según la regla.

donde α = 0,0001 es la tasa de aprendizaje, γ = 0,99 es el factor de descuento y s' denota el siguiente estado.
Durante la optimización por Aprendizaje por Refuerzo, el modelo se entrenó para 1.000 episodios con un tamaño de lote de 32. Se adoptó una estrategia codiciosa de épsilon para equilibrar exploración y explotación,
con una inicialización en 1.0 y decaída en 0,995 por episodio. Con probabilidad
, se seleccionó una estrategia de fusión aleatoria, mientras que con probabilidad 1 -
, se eligió la estrategia con el valor Q estimado más alto. La convergencia de recompensas se monitorizó durante todo el entrenamiento, con un rendimiento estable (>0,85 de recompensa acumulada) observado típicamente en aproximadamente 500 episodios.
El flujo de trabajo HDRL implica preprocesar señales multimodales, extraer características profundas específicas de la modalidad, formar una representación unificada de estados, seleccionar estrategias de fusión y mejorar la política utilizando retroalimentación de clasificación del agente DQN. La interacción entre extractores de características basados en CNN y el agente de aprendizaje por refuerzo forma un sistema de fusión adaptativa de lazo cerrado (Figura 3), que permite actualizaciones de políticas basadas en la retroalimentación de recompensa.

Figura 3: Diagrama de flujo del flujo de trabajo propuesto de Aprendizaje Profundo por Refuerzo Híbrido (HDRL). Diagrama de flujo de trabajo que muestra la extracción de características CNN específicas por modalidad, la concatenación de características, la selección basada en aprendizaje por refuerzo de una estrategia de fusión (DQN/PPO), la clasificación downstream y la actualización de políticas basada en recompensas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.