Ce protocole décrit la mise en œuvre étape par étape du modèle hybride d’apprentissage par renforcement profond (HDRL) pour la fusion multimodale du signal biomédical. Le cadre intègre des techniques d’apprentissage profond et d’apprentissage par renforcement afin d’optimiser la fusion en temps réel des données ECG, EEG et imagerie médicale. La section décrit également les procédures d’extraction de caractéristiques, d’entraînement et de préparation des données utilisées dans le modèle proposé.
Matériaux
Toutes les expériences ont été menées sur une station de travail équipée d’un processeur multi-cœurs, de ≥32 Go de RAM et d’un GPU dédié (≥8 Go de VRAM). L’environnement d’implémentation comprenait Python (v3.9 ou ultérieur), TensorFlow (v2.12) et Keras (v2.12). Les bibliothèques d’apprentissage par renforcement étaient installées en utilisant pip install stable-baselines3. Le packageStable-Baselines3 18 offre des implémentations efficaces d’algorithmes d’apprentissage par renforcement, tels que Deep Q-Network (DQN) et Proximal Policy Optimisation (PPO).
Ensembles de données
Le cadre proposé d’apprentissage par renforcement profond hybride (HDRL) a été évalué à l’aide de trois ensembles de données biomédicales accessibles publiquement représentant des types de signaux multimodaux. (1) PhysioNet Challenge 2016 : Une collection d’enregistrements ECG à 12 dérivations de patients atteints de maladies cardiaques, incluant la fibrillation auriculaire, l’arythmie ventriculaire et la maladie cardiaque ischémique. Le jeu de données inclut des étiquettes annotées pour les maladiescardiaques 19. (2) Base de données EEG du cuir chevelu CHB-MIT : Un ensemble de données d’enregistrements EEG du cuir chevelu est utilisé pour la détection des crises épileptiques, avec des annotations marquant les événements de crise et noncrise 20. (3) Base de données IRM OASIS-3 : Une collection d’images cérébrales IRM et de notes cliniques est utilisée pour la détection et le suivi de la maladied’Alzheimer 21. Des échantillons représentatifs de chaque modalité démontrent la variabilité inhérente et les caractéristiques de bruit présentes dans les données biomédicales multimodales (Figure 2).

Figure 2 : Échantillonner les signaux biomédicaux issus de l’ECG, de l’EEG et de l’imagerie médicale. Exemples représentatifs de forme d’onde ECG, de signal EEG et d’imagerie médicale illustrant les différentes modalités utilisées dans l’étude. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Prétraitement des données
Chaque modalité a subi des procédures de prétraitement spécifiques à chaque modalité afin d’assurer une représentation standardisée des entrées. Les signaux EEG et ECG étaient filtrés à l’aide d’un filtre Butterworth passe-bande de quatrième ordre. La plage de fréquences était réglée à 0,5–40 Hz pour l’EEG et 0,5–45 Hz pour l’ECG. Les échantillons ont été segmentés en fenêtres de 5 secondes avec un chevauchement de 50 %. Chaque signal était normalisé en le segmentant pour obtenir une moyenne nulle et une variance unitaire. Les images IRM ont été traitées par dénuage du crâne à l’aide de l’outil d’extraction cérébrale FSL (BET). Les images ont été redimensionnées à 224 × 224 pixels. Les intensités des pixels ont été normalisées à la plage [0,1] afin de standardiser les distributions d’entrée.
Extraction des caractéristiques
L’extraction des caractéristiques a été réalisée indépendamment pour chaque modalité à l’aide de DNN, garantissant que les caractéristiques uniques de chaque modalité étaient capturées efficacement.
Extracteurs de caractéristiques ECG et EEG :
Une architecture de réseau de neurones convolutionnel 1D (1D-CNN) était employée pour le traitement des signaux en série temporelle. L’architecture comprenait (1) une couche d’entrée (window_length, 1), (2) des couches Conv1D avec 64 filtres et une taille de noyau de 3, (3) l’activation de ReLU, (4) MaxPooling1D avec taille de pool = 2, (5) les couches Flatten et Dense (128 unités, ReLU). Les représentations des couches denses avant-dernière ont été extraites sous forme de vecteurs de caractéristiques spécifiques à la modalité.
Extracteur de caractéristiques IRM
Un modèle CNN bidimensionnel pré-entraîné (par exemple, VGG16 ou ResNet50) a été affiné pour extraire des caractéristiques spatiales à partir d’images IRM. Le CNN a été entraîné sur le jeu de données OASIS-3, avec les dernières couches du modèle pré-entraîné modifiées pour s’adapter à la tâchede classification spécifique 21. Les dernières couches de classification ont été remplacées par des couches spécifiques à chaque tâche, et les caractéristiques spatiales de haut niveau ont été extraites de l’avant-dernièrecouche 5,6.
Architecture et entraînement du modèle
Le cadre proposé d’apprentissage par renforcement profond hybride (HDRL) a été développé et entraîné en deux étapes séquentielles : extraction de caractéristiques spécifiques à la modalité suivie d’optimisation par fusion basée sur l’apprentissage par renforcement. Lors de la première étape, des réseaux neuronaux convolutionnels (CNN) distincts ont été entraînés sur des données marquées pour les modalités ECG, EEG et IRM. L’optimiseur Adaptive Moment Estimation (Adam) avec un taux d’apprentissage de 0,001 et une perte d’entropie croisée catégorique a été utilisé lors d’un entraînement supervisé. Après convergence, des représentations de haut niveau ont été extraites de l’avant-dernière couche de chaque CNN, donnant des vecteurs de caractéristiques spécifiques à chaque modalité FECG =CNN ECG(XECG), FECG = CNN ECG (X ECG) et FIRM =CNN IRM(XIRM). Ces vecteurs ont été concaténés pour former une représentation multimodale unifiée Fconcat = [FECG,F EEG,F IRM], qui sert d’entrée à l’étape d’apprentissage par renforcement.
Le processus de fusion a été formulé comme un processus de décision de Markov (MDP), où l’état s correspondait au vecteur de caractéristiques concaténé F concat, l’action représentait le choix d’une stratégie de fusion (soit sommation pondérée, soit concaténation directe) et la récompense r était définie comme la précision de classification obtenue grâce à un classificateur en aval entraîné sur les caractéristiques fusionnées. La fonction action-valeur Q(s,a) a été approximée à l’aide d’un Réseau Q profond (DQN), qui a estimé la récompense
cumulative attendue . Les paramètres du modèle ont été mis à jour de manière itérative selon la règle.

où α = 0,0001 est le taux d’apprentissage, γ = 0,99 est le facteur d’actualisation et s’désigne l’état suivant.
Lors de l’optimisation par renforcement de l’apprentissage, le modèle a été entraîné pour 1 000 épisodes avec une taille de groupe de 32. Une stratégie gourmande d’epsilon a été adoptée pour équilibrer exploration et exploitation,
initialisée à 1,0 et dégradée de 0,995 par épisode. Avec la probabilité
, une stratégie de fusion aléatoire a été sélectionnée, tandis qu’avec la probabilité de 1 -
, la stratégie avec la valeur de Q estimée la plus élevée a été choisie. La convergence de la récompense a été surveillée tout au long de l’entraînement, avec une performance stable (>0,85 de récompense cumulative) généralement observée sur environ 500 épisodes.
Le flux de travail HDRL implique le prétraitement des signaux multimodaux, l’extraction de caractéristiques profondes spécifiques à chaque modalité, la formation d’une représentation d’état unifiée, la sélection de stratégies de fusion et l’amélioration de la politique en utilisant le retour de classification de l’agent DQN. L’interaction entre les extracteurs de caractéristiques basés sur CNN et l’agent d’apprentissage par renforcement forme un système de fusion adaptative en boucle fermée (Figure 3), permettant des mises à jour de politiques basées sur la rétroaction de récompense.

Figure 3 : Diagramme de flux du flux de travail proposé par apprentissage par renforcement profond hybride (HDRL). Diagramme de flux de travail montrant l’extraction de caractéristiques CNN spécifique à la modalité, la concaténation de caractéristiques, la sélection d’une stratégie de fusion basée sur l’apprentissage par renforcement (DQN/PPO), la classification en aval et la mise à jour de la politique basée sur la récompense. Veuillez cliquer ici pour voir une version agrandie de cette figurine.