结合多模态生物标志物的机器学习可增强疾病预测与监测能力,在多个领域为医疗进步带来希望,并通过精确的疾病预测改善医疗健康结局。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
结合多模态生物标志物的机器学习可增强疾病预测与监测能力,在多个领域为医疗进步带来希望,并通过精确的疾病预测改善医疗健康结局。
每年,全球都有许多人逐渐受到心脏病、呼吸道感染、神经功能障碍、认知压力、癌症、中风、糖尿病等严重健康问题的影响,这些疾病会导致严重的健康并发症及相关异常。因此,早期健康分析至关重要,因为它能够实现及时干预和靶向治疗,可能提供即时缓解并带来持久的长期益处,从而延缓疾病进展。由于各种健康状况涉及复杂的病理生理过程和异质性的临床试验,迫切需要高灵敏度的多模态生物标志物以及有效的研究方法,以准确检测和监测患者的健康结局。因此,人们考虑采用多种类别和技术的机器学习算法来预测结果,包括预后判断、风险评估、患者分层和疾病监测。本研究的工作流程分为三个阶段:第一阶段通过案例研究阐明医疗保健的重要性;第二阶段介绍传统的机器学习(ML)算法、传统的深度学习(DL)方法以及现代的深度学习技术(TabNet 和 AutoInt);最后在第三阶段开展实验以验证结果。本研究强调通过整合分子蛋白、化学和遗传生物标志物与新兴的机器学习特征,实现模态的分组。结果表明,采用所提出的方法在预测准确性方面有显著提升。
医疗系统正越来越多地利用预测分析来监测患者,并及时诊断健康结果,从而促进主动医疗并改善患者预后。通过将预测分析与生物标志物相结合,临床医生可以提高诊断准确性,识别有效治疗方法,监测治疗进展,并深入了解疾病机制,最终实现更科学、更有效的治疗决策。生物标志物是指存在于样本(如生物液体、组织、细胞、DNA、RNA、血液和尿液)中的生物分子特征或指标,用于测量人体内疾病的存在或进展情况,有助于评估治疗效果1。
分子生物标志物应用的进展在精准医疗中发挥着关键作用,通过精确测量特定分子来识别患者独特的健康问题,从而在疾病早期阶段即可实施靶向治疗策略2。未来,多模态方法将有助于整合复杂疾病的多种数据模式,利用先进的预测性分析技术,更准确地识别癌症和神经退行性疾病的预后情况3。这一前沿方法结合多组学数据、生物信息学和机器学习(ML)算法,用于发现新的生物标志物,从而实现对心血管疾病(CVDs)及其他复杂疾病的个体化风险评估和个性化治疗策略4。分子生物标志物与多组学方法的结合,有望提高神经系统疾病的诊断准确性和治疗分层水平5。
随着机器学习技术的进步,多模态分子生物标志物能够整合多种类型的数据,以识别各....
访问受限。请登录或开始试用以查看此内容。
1. 实验流程
图1 展示了一个有序且模块化的流程管线,旨在利用机器学习和深度学习技术将分子生物标志物分类为风险或诊断指示类别。以下是该过程的详细逐步说明:
访问受限。请登录或开始试用以查看此内容。
实验采用机器学习(ML)和深度学习(DL)方法,以比较其性能表现。同时,考虑构建结合监督学习与无监督学习机制的机器学习模型。本方法中使用的监督学习技术包括逻辑回归、决策树、随机森林、梯度提升、支持向量机以及K近邻算法。这些算法涵盖了从简单的统计模型到复杂的基于树的分析方法。另一方面,无监督机器学习算法包括K均值聚类、DBSCAN聚类和凝聚聚类技术。而所采用的深度学习技术则包括简单的多层感知机(MLP)、MLP结合批归一化与早停机制、宽深网络(表格数据混合模型)以及带学习率调度器(进阶)的MLP。在分析结果之前,使用基于模型的特征重要性评估、排列重要性以及SHAP(SHapley Additive exPlanations)和LIME(Local Interpretable Model-agnostic Explanations)方法计算特征重要性。此外,这些方法为AdaBoost技术提供了“黑箱”解释能力,有助于理解模型间的关系、识别冗余特征、提升模型性能并检测偏差。因此,通过多种技术测量特征重要性,并将结果在图8中进行可视化展示。
访问受限。请登录或开始试用以查看此内容。
本研究明确阐述了生物标志物在疾病识别、监测及其特征分析中的重要性。所提出的生物标志物研究方法基于四个关键步骤:细致的数据准备(包括数据清洗、编码及去除标识符);统一的目标编码(风险=0,诊断=1);特征归一化,以及为AutoInt37/TabNet等模型提供高质量的深度嵌入;以及严谨的评估流程保障(合理的训练集/测试集划分、准确的指标报告)。此外,借助机器学习(ML)和深度学习(DL)算法,实现了基于基因对疾病状态的预测。在数据集上实施了最常用的ML算法,算法与数据集之间的协调性和效率与前述部分的结果一致。另外,除MLP29、TabNet和AutoInt之外的新DL模型也被应用于该数据集分析,且模型运行情况与所采用数据集相匹配。结果表明,这些模型优于现有研究,实验结果支持这一结论。为确保可重复性,建议实施若干改进措施,例如对新的分类变量使用OrdinalEncoder,并引入Dropout/BatchNorm以减轻模型过拟合。采用动态学习率调度器可提升训练稳定性。故障排查应优先考虑避免数据泄露(如删除ID列)、解决过拟合问题(通过衰减策略),.......
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者未获得外部资助。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AutoInt 模型 | 北京大学 | https://github.com/shichence/AutoInt | 通过自注意力神经网络实现自动特征交互学习:一种高效算法,可自动学习(稀疏)分类和数值特征的高阶特征交互 |
| deepctr_torch.models | 开源 | https://github.com/shenweichen/DeepCTR-Torch | 基于深度学习的点击率(CTR)模型模块化且可扩展的工具包,便于轻松构建自定义模型 |
| Google Colaboratory | https://colab.research.google.com/ | 基于云的 环境,可通过浏览器编写和执行用于机器学习和数据分析的 Python 代码 | |
| Keras 2.6.0 | Keras | https://keras.io/ | 提供用于执行神经网络的 Python 接口,运行在 TensorFlow 之上 |
| MarkerDB 2.0 | MarkerDB | https://markerdb.ca/downloads | 公开可用的分子生物标志物数据库 |
| Matplotlib 3.4.3 | Matplotlib | https://matplotlib.org/ | Python 的可视化库 |
| Numpy 1.21.4 | Numpy | https://numpy.org/ | 用于 Python 科学计算的基础软件包 |
| Pandas 1.3.4 | Pandas | https://pandas.pydata.org/ | 功能强大、灵活且易于使用的开源数据分析与处理工具,基于 Python 编程语言构建 |
| Python 3.8.10 | Python 软件基金会 | https://www.python.org/ | 一种流行的编程语言,能更有效地集成深度学习系统 |
| pytorch_tabnet.tab_model | Pytorch | https://pypi.org/project/pytorch-tabnet/ | 用于实现二分类/多分类及回归问题 |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/ | 用于机器学习算法的 Python 模块 |
| Seaborn | Seaborn | https://seaborn.pydata.org/ | 高级数据可视化库,用于绘制美观且信息丰富的统计图形 |
| TabNet 模型 | https://github.com/dreamquark-ai/tabnet | TabNet 是一种端到端神经网络,专为直接处理表格数据而设计 | |
| Tensorflow 2.6.0 | https://www.tensorflow.org/ | 一个端到端的机器学习平台 |
访问受限。请登录或开始试用以查看此内容。