本研究提出了一种混合深度强化学习(HDRL)框架,该框架将用于特征提取的深度神经网络(DNN)与用于动态多模态信号融合的强化学习(RL)相结合。在生物医学数据集上的评估结果表明,该方法在准确性、鲁棒性以及罕见事件检测方面表现优异,可广泛应用于个性化医疗和疾病分类等领域。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本研究提出了一种混合深度强化学习(HDRL)框架,该框架将用于特征提取的深度神经网络(DNN)与用于动态多模态信号融合的强化学习(RL)相结合。在生物医学数据集上的评估结果表明,该方法在准确性、鲁棒性以及罕见事件检测方面表现优异,可广泛应用于个性化医疗和疾病分类等领域。
提高医疗保健中的决策能力和诊断准确性,需要整合多种生物医学信号,例如心电图(ECG)、脑电图(EEG)和医学影像。传统的信号融合技术由于信号的变异性及内在复杂性而面临重大挑战。我们提出一种混合深度强化学习(HDRL)模型,该模型采用深度神经网络(DNN)进行特征提取,并利用强化学习(RL)实现动态融合优化。该混合模型通过实时反馈优化融合策略学习,以适应不同数据特征。为评估其性能,将所提出的模型与基于深度神经网络的方法和主成分分析(PCA)等传统融合技术进行了比较。该混合深度强化学习模型在多个真实世界生物医学数据集上进行了测试。实验结果表明,该模型在噪声环境下的鲁棒性、分类准确性和罕见事件检测能力方面均有提升,适用于个性化医疗和疾病分类。该方法不仅解决了传统信号融合技术存在的问题,还为多模态生物医学信号处理的进步提供了有前景的解决方案。该模型使用DNN进行特征挖掘,并采用RL智能体(DQN、PPO)进行策略优化。
现代医疗保健日益依赖整合多种生物医学数据源,以提高诊断准确性和临床决策水平。心电图(ECG)、脑电图(EEG)等生理信号,以及磁共振成像(MRI)和计算机断层扫描(CT)等医学影像模态,提供了支持疾病诊断和个体化治疗的互补性生理信息。然而,生物医学信号本身具有复杂性,常包含噪声、缺失值和高维结构,使其分析与解释具有挑战性。因此,多模态生物医学信号融合——即整合来自多个生理数据流的信息——已成为提高诊断性能、增强对数据质量变化的鲁棒性,并在重症监护室(ICU)等临床环境中实现全面患者监测的重要方法1。
传统的多模态信号融合方法在很大程度上依赖于统计和线性技术。主成分分析(PCA)通过将信号转换为正交分量来降低数据的维度,而典型相关分析(CCA)则通过识别模态间的线性关系来对齐多模态数据集2。这些技术已成功应用于生物医学多模态融合场景中3。然而,由于其依赖线性假设,这些方法在捕捉生理信号之间普遍存在的复杂非线性关系方面能力有限。在实际中,生物医学数据很少是完全线性的。传统的多模态融合方法常常因这些非线性依赖关系而无法捕捉模态间的有意义交互4,5。因此,传统融合方法可能无法有效捕捉模态间的有意义相互作用,从而限制了其在疾病诊断和实时临床决策等任务中的有效性。
深度学习的最新进展通过使神经网络能够从原始数据中自动提取分层表示,显著改变了生物医学信号处理领域。卷积神经网络(CNN)在分析医学图像中的空间模式方面表现出色5,6。多模态CNN架构已被用于整合MRI和CT等成像模态,以提高诊断准确性3。类似地,循环神经网络(RNN)和长短期记忆(LSTM)网络已被应用于心电图(ECG)和脑电图(EEG)等序列性生物医学信号,用于疾病分类任务7。尽管取得了这些进展,许多基于深度学习的融合方法仍依赖于固定的融合策略,例如特征拼接或加权平均。这些静态融合机制无法有效适应信号质量的变化。在真实临床环境中,信号可能因运动伪影、电极移位、失真或环境噪声而退化。此类变化会降低单个模态的可靠性,并对整体融合过程产生负面影响。应对这些挑战需要具备实时响应动态数据条件能力的自适应融合策略8。
强化学习(Reinforcement Learning, RL)为在不确定环境中进行序列化决策提供了一个强大的框架。在强化学习中,智能体通过与环境的交互,学习选择能够最大化累积奖励的行为。这一决策过程通常通过贝尔曼方程(Bellman equation)进行建模,该方程将某个状态的价值定义为即时奖励与未来奖励折现值之和9。诸如深度Q网络(Deep Q-Networks, DQN)等方法通过使用深度神经网络对行为价值函数进行近似,将强化学习扩展到高维问题中10。类似地,基于策略的深度强化学习方法通过迭代更新智能体的策略,实现稳定且高效的策略学习11。强化学习技术已在多个医疗健康领域得到探索,包括治疗方案优化和异常检测12,但其在自适应多模态信号融合中的应用仍相对有限。
混合深度强化学习(HDRL)将深度学习与强化学习相结合,以实现特征提取与自适应决策的融合。在该框架中,深度神经网络将多模态生物医学信号转换为高层特征表示,而强化学习代理则根据任务表现动态选择融合策略4。这种自适应机制使系统能够响应信号质量及模态可用性的变化,从而在重症监护室监测和可穿戴诊断系统等复杂的临床环境中实现更稳健的运行8。
除了经典的强化学习方法外,已有多种混合学习技术被探索用于生物医学分类任务,这些技术结合了模糊逻辑、遗传算法与强化学习。例如,结合遗传算法的模糊Q学习已被应用于基于脑电(EEG)信号的癫痫发作分类,表现出对不确定时间模式更强的适应能力13。类似地,基于模糊格的进化学习方法已被提出用于基于医学影像的肺部疾病分类14。其他研究还探讨了基于强化学习的癫痫发作识别方法15,以及改进的模糊Q学习分类器用于从胸部X光图像中检测肺炎和肺结核16。尽管这些研究展示了混合学习方法在生物医学分析中的潜力,但大多数现有方法仍集中于单模态分类,而非多模态信号融合。
多模态机器学习领域的最新进展也探索了基于变换器(transformer)的架构在跨模态医学应用中的使用。这些模型在医疗图像生成以及异构生物医学数据集分析等任务中表现出良好的性能,其中一种或多种模态数据可能存在不完整或缺失的情况17. 然而,即使取得了这些进展,仍迫切需要能够动态响应多模态数据变化的自适应融合机制,这依然是当前重要的研究挑战。
本研究提出了一种用于多模态生物医学信号融合的混合深度强化学习(HDRL)框架。采用模态特异的卷积神经网络(CNN)模型从心电图(ECG)、脑电图(EEG)和磁共振成像(MRI)数据中提取特征,随后将这些特征组合形成统一的多模态表征。一个深度Q网络(DQN)智能体根据当前的特征状态动态选择融合策略,例如特征拼接或加权组合。下游分类器根据分类性能提供奖励信号,使强化学习智能体能够通过持续反馈优化融合策略。该自适应框架使模型能够根据信号质量及模态可用性的变化进行调整。所提出的方法在PhysioNet 2016、CHB-MIT EEG和OASIS-3数据集上进行了评估,并与传统的基于主成分分析(PCA)和基于深度学习的融合技术进行了比较。

图1:基于HDRL的多模态信号融合系统的架构框图。 多模态融合框架的示意图,显示了ECG、EEG和医学图像输入通过深度神经网络特征提取器进行处理,随后进行基于强化学习的自适应融合及奖励反馈。请点击此处查看该图的放大版本。
图 1 展示了所提出的多模态信号融合框架的架构。在此架构中,针对不同模态的卷积神经网络(CNN)模型分别从心电图(ECG)、脑电图(EEG)和磁共振成像(MRI)信号中独立提取特征。随后,这些特征被整合为统一的表示形式,强化学习智能体利用该表示来确定最优的融合策略。
生物医学信号处理通过分析来自多种模态的生理信号,在现代医疗中发挥着关键作用,能够实现准确的诊断、监测和治疗规划。整合心电图(ECG)、脑电图(EEG)和医学影像数据等信号需要复杂的融合技术,以捕获来自不同来源的互补信息。表1总结了常用的多模态信号融合方法,包括其主要特征、优势与局限性,并阐明了所提出的基于高维表示学习(HDRL)框架的研究动机。
| 方法 | 关键特征 | 优势 | 局限性 |
| PCA | 线性降维 | 快速、简单 | 仅限于线性关系 |
| DNN | 非线性特征学习 | 可捕捉复杂模式 | 融合策略固定 |
| DRL | 动态策略学习 | 可适应数据变化 | 计算量高 |
| HDRL | DNN 与 RL 混合模型 | 自适应性强、鲁棒性高、效率高 | 需要精细调参 |
表1:多模态融合方法的比较。 常用多模态信号融合方法的概述,列出了它们的关键特征、优势和局限性。
访问受限。请登录或开始试用以查看此内容。
本方案详细描述了用于多模态生物医学信号融合的混合深度强化学习(HDRL)模型的逐步实现方法。该框架结合了深度学习与强化学习技术,以优化心电图(ECG)、脑电图(EEG)和医学影像数据的实时融合。本节还概述了所提出模型中采用的特征提取、训练及数据预处理流程。
材料
所有实验均在配备多核 CPU、≥32 GB 内存和独立 GPU(≥8 GB 显存)的工作站上进行。实现环境包括 Python(v3.9 或更高版本)、TensorFlow(v2.12)和 Keras(v2.12)。使用 pip install stable-baselines3 安装强化学习库。Stable-Baselines3 软件包18 提供了高效的强化学习算法实现,例如深度 Q 网络(DQN)和近端策略优化(PPO)。
数据集
所提出的混合深度强化学习(HDRL)框架在三个公开可用的生物医学数据集上进行了评估,这些数据集代表了多模态信号类型。(1)PhysioNet Challenge 2016:包含心脏病患者(如心房颤动、室性心律失常和缺血性心脏病)的12导联心电图记录。该数据集提供了心脏状况的标注标签19。(2)CHB-MIT 头皮脑电图数据库:用于癫痫发作检测的头皮脑电图记录数据集,包含标记癫痫发作与非发作事件的注释20。(3)OASIS-3 MRI 数据库:包含脑部磁共振成像(MRI)图像和临床评分,用于阿尔茨海默病的检测与监测21。来自每种模态的代表性样本展示了多模态生物医学数据中存在的固有变异性与噪声特征(图2)。

图2:来自心电图、脑电图和医学影像的生物医学信号样本。 代表性的心电图波形、脑电图信号及医学影像扫描示例,展示了本研究中使用的不同模态。请点击此处查看该图的放大版本。
数据预处理
每种模态均经过特定的预处理步骤,以确保输入表示的标准化。脑电图(EEG)和心电图(ECG)信号使用四阶巴特沃斯带通滤波器进行滤波,EEG 的频率范围设置为 0.5–40 Hz,ECG 的频率范围设置为 0.5–45 Hz。样本被分割为 5 秒的时间窗,重叠率为 50%。每个信号通过分段进行归一化,使其均值为零,方差为 1。磁共振成像(MRI)图像使用 FSL 脑提取工具(BET)进行去颅骨处理,并将图像调整为 224 × 224 像素。像素强度被归一化至 [0,1] 范围,以标准化输入分布。
特征提取
使用深度神经网络(DNN)针对每种模态独立进行特征提取,以有效捕捉每种模态的独特特征。
心电图和脑电图特征提取器:
采用一维卷积神经网络(1D-CNN)架构进行时间序列信号处理。该架构包括:(1) 输入层(window_length, 1),(2) 带有64个滤波器、卷积核大小为3的Conv1D层,(3) ReLU激活函数,(4) 池化大小为2的MaxPooling1D层,(5) Flatten层和全连接层(128个单元,ReLU激活)。倒数第二层全连接层的输出被提取为模态特异性的特征向量。
MRI 特征提取器
采用一个预训练的二维卷积神经网络模型(例如 VGG16 或 ResNet50),并对其进行微调,以从 MRI 图像中提取空间特征。该卷积神经网络在 OASIS-3 数据集上进行训练,通过修改预训练模型的最后几层,使其适应特定的分类任务21。最终的分类层被替换为针对具体任务设计的网络层,并从倒数第二层提取高层空间特征5,6。
模型架构与训练
所提出的混合深度强化学习(Hybrid Deep Reinforcement Learning, HDRL)框架分为两个连续阶段进行开发与训练:模态特异性特征提取,随后是基于强化学习的融合优化。在第一阶段,分别针对心电图(ECG)、脑电图(EEG)和磁共振成像(MRI)模态的标注数据,训练独立的卷积神经网络(CNN)。在有监督训练过程中,采用学习率为 0.001 的自适应矩估计(Adam)优化器,并以分类交叉熵损失函数进行优化。在模型收敛后,从各 CNN 的倒数第二层中提取高层表示,得到各模态对应的特征向量 FECG = CNNECG(XECG)、FEEG = CNNEEG(XEEG) 和 FMRI = CNNMRI(XMRI)。这些向量被拼接形成统一的多模态表示 Fconcat = [FECG, FEEG, FMRI],作为强化学习阶段的输入。
融合过程被建模为一个马尔可夫决策过程(Markov Decision Process, MDP),其中状态s对应于拼接后的特征向量Fconcat,动作为融合策略的选择(加权求和或直接拼接),奖励r则定义为基于融合特征训练的下游分类器所获得的分类准确率。动作值函数Q(s,a)通过深度Q网络(Deep Q-Network, DQN)进行近似,该网络用于估计期望的累积奖励
。模型参数根据以下规则进行迭代更新。

其中 α = 0.0001 为学习率,γ = 0.99 为折扣因子,s' 表示下一个状态。
在强化学习优化过程中,模型训练了1,000轮,每批大小为32。采用ε-贪心策略来平衡探索与利用,其中
初始值设为1.0,并以每轮0.995的比率衰减。以概率
选择随机融合策略,而以概率1 -
选择具有最高估计Q值的策略。在整个训练过程中监测奖励的收敛情况,通常在约500轮时可观察到稳定性能(>0.85的累积奖励)。
HDRL 工作流程包括对多模态信号进行预处理、提取模态特异性深度特征、构建统一的状态表征、选择融合策略,并利用来自 DQN 智能体的分类反馈来优化策略。基于卷积神经网络的特征提取器与强化学习智能体之间的交互构成一个闭环自适应融合系统(图 3),从而能够根据奖励反馈更新策略。

图 3:所提出的混合深度强化学习(HDRL)工作流程示意图。工作流程图展示了模态特异的卷积神经网络(CNN)特征提取、特征拼接、基于强化学习的融合策略选择(DQN/PPO)、下游分类以及基于奖励的策略更新。请点击此处查看该图的放大版本。
访问受限。请登录或开始试用以查看此内容。
实验结果表明,所提出的混合深度强化学习(HDRL)模型在多模态生物医学信号融合方面表现出更优的性能。通过在多个真实世界生物医学数据集上进行验证,评估了HDRL模型的性能。在鲁棒性、适应性和分类准确率方面的结果表明,该模型优于其他传统融合方法,如基于主成分分析(PCA)和深度神经网络(DNN)的融合方法。
实验设置
本研究使用了三个公开的生物医学数据集来评估所提出的 HDRL 模型的性能。在使用深度神经网络进行特征提取之前,数据已按照前文所述方法进行了预处理。采用深度 Q 网络(DQN)技术训练所提出的模型,奖励函数基于模型对数据分类的准确率。为进行对比,还评估了传统方法。用于评估模型性能的指标如下:1)分类准确率:正确分类的样本所占的百分比。2)精确率、召回率和 F1 分数:这些指标用于评估模型检测正类和负类样本的能力,尤其适用于类别不平衡的数据集。3)融合效率:通过考虑数据处理及后续预测所耗的时间,计算融合过程的计算效率。4)
访问受限。请登录或开始试用以查看此内容。
融合效率:
本节对 HDRL、PCA 和 DNN 之间的融合效率进行了比较分析。融合效率的计算基于多模态数据集,该数据集通过整合来自 PhysioNet Challenge 201619、CHB-MIT 头皮脑电图数据库20 和 OASIS-3 MRI 数据库21 的脑电图(EEG)、心电图(ECG)和磁共振成像(MRI)数据获得。处理时间是重症监护室(ICU)监测和可穿戴诊断等实时临床应用中的关键参数,及时决策直接影响患者的临床结局1。
确保可重复性的关键实验步骤: 重现本研究的关键步骤包括适当的信号预处理(如前所述的滤波与归一化),以及合理选择强化学习的超参数(例如,依据成熟的DQN指南设定epsilon衰减策略)。10,
访问受限。请登录或开始试用以查看此内容。
作者声明本研究不存在任何利益冲突。
该研究部分在科学宫米奥德拉格·科斯蒂奇基金会——应用人工智能中心的场地内进行。本研究由欧洲高性能计算联合体(EUROHPC-JU)资助,资助编号为101191697,项目名称EuroCC4SEE。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 巴特沃斯滤波器(4阶,SciPy实现) | SciPy Community | N/A | 脑电/心电信号预处理 |
| CHB-MIT 头皮脑电数据库 | PhysioNet | DOI: 10.13026/C2K01R | 脑电数据集 |
| FSL 脑提取工具(BET) | FMRIB 软件库(FSL) | N/A | MRI 去除颅骨 |
| Keras(v2.12) | Google LLC | N/A | 高级神经网络API |
| NVIDIA GPU(≥8 GB VRAM) | NVIDIA Corporation | 取决于模型 | 加速深度学习训练所需 |
| OASIS-3 MRI 数据库 | 华盛顿大学 | DOI: 10.1002/alz.047259 | MRI 数据集 |
| PhysioNet 2016 挑战赛数据集 | PhysioNet | DOI: 10.22489/CinC.2016.179-154 | 心电数据集 |
| Python(v3.9 或更高版本) | Python 软件基金会 | N/A | 编程环境 |
| Stable-Baselines3 | DLR-RM(开源) | N/A | 强化学习实现(DQN, PPO) |
| TensorFlow(v2.12) | Google LLC | N/A | 深度学习框架 |
| 工作站(多核CPU,≥32 GB RAM,≥8 GB GPU) | 自行搭建 / 本地供应商 | N/A | 用于模型训练与实验 |
访问受限。请登录或开始试用以查看此内容。