多模态生物标志物的机器学习提升了疾病预测和监测能力,为医疗在多个领域的进步带来了希望,通过准确的疾病预测改善医疗结果。
Research Article
多模态生物标志物的机器学习提升了疾病预测和监测能力,为医疗在多个领域的进步带来了希望,通过准确的疾病预测改善医疗结果。
每年,全球许多人逐渐受到心脏病、呼吸道感染、神经功能障碍、认知压力、癌症、中风、糖尿病等严重健康问题的影响,这些疾病导致严重的健康并发症和相关异常。因此,早期健康分析至关重要,因为它们能够及时通过靶向治疗进行干预,可能带来即时缓解和持续的长期益处,从而减缓疾病进展。由于复杂的病理生理过程和各种健康状况下的异质临床试验,亟需高度敏感的多模态生物标志物和有效的调查方法,以准确检测和监测患者健康结果。因此,考虑采用多种类别和技术的机器学习算法来预测结局,包括预后、风险评估、患者分层和疾病监测。本研究流程分为三个阶段,第一阶段通过案例研究阐明医疗的重要性,第二阶段则采用传统机器学习(ML)算法、传统深度学习(DL)方法,以及现代深度学习技术(TabNet和AutoInt)。最后,实验被实施以证明结果的合理性。这项工作通过整合分子蛋白、化学和遗传生物标志物与新兴机器学习特征,将模态进行分组。结果显示,使用该方法预测准确率有显著提升。
医疗系统越来越多地利用预测分析来监测患者并及时诊断健康结果,促进主动护理并改善患者预后。通过将预测分析与生物标志物结合,临床医生可以提升诊断准确性,识别有效治疗方法,监测治疗进展,并深入了解疾病机制,最终做出更明智、更有效的治疗决策。生物标志物指的是样本中发现的生物分子或指标的特征,如生物流体、组织、细胞、DNA、RNA、血液和尿液,这些指标用于测量疾病在人体内的存在或进展,有助于评估治疗效果。
分子生物标志物应用的进展在个性化医疗中发挥着关键作用,通过精确测量特定分子以识别患者独特的健康问题,使从初期阶段起就能够制定针对性的治疗策略。展望未来,多模态方法将有助于整合复杂疾病模式的多种模态,通过先进的预测分析技术,更准确地识别癌症和神经退行性疾病的预后。该前沿方法利用多组学数据、生物信息学和机器学习算法识别新型生物标志物,实现针对患者的风险分析和心血管疾病(CVD)及其他复杂疾病的主观治疗策略4.分子生物标志物与多组学方法的结合,有望提升神经疾病的诊断准确性和治疗分层能力5.
随着机器学习技术的发展,多模态分子生物标志物可以整合多种数据类型,识别各种健康状况中的新型疾病特征,从而实现更准确的诊断和个性化治疗策略。基于这一潜力,作者探讨了医疗领域的多种机器学习技术以预测疾病诊断风险因素,并强调其在不同医疗领域的重要性。随着机器学习改变疾病诊断和治疗,制药行业越来越多地利用决策算法分析患者健康结果,满足其日常需求,实现更为知情和高效的护理。利用多模态数据整合的潜在需求,本研究利用多模态数据(MRI和遗传学)开发了生物标志物,预测阿尔茨海默病的发展和进展,显示遗传数据更能预测正常对照组未来的阿尔茨海默病进展,而MRI数据更能更好地描述稳定的轻度认知障碍,结合了两者,更优质的分类表现8。
进一步推动多模态数据分析的应用,多模态深度学习利用基因表达数据识别针对新型生物分子特定细胞系的药物,从而阐明基因组变异如何影响治疗反应9。配合多模态数据分析的进展,利用人工智能和机器学习指标评估的非侵入性生物标志物正成为有前景的诊断工具,其特异性和敏感性特征相较侵入性生物标志物,具体取决于具体应用和数据背景10。随着多模态数据分析日益重要,深度学习(DL)集合模型通过整合包括基因-蛋白质相互作用在内的新型生物标志物,有效处理复杂数据,以提升癌症研究并优化治疗策略11。随着DL集合模型持续推动癌症研究的发展,预测分析在疾病诊断和治疗中发挥着关键作用,它通过分析来自多个来源的大量集体数据,包括多种健康状况,提供全面状态概览,如风险评估和诊断。
该方案的目标是实现基于机器学习和深度学习的算法,整合不同的生物标志物,以提升医疗分析的准确性。传统的预测技术通常依赖单一模态数据和线性统计模型,这些模型可能无法充分捕捉影响疾病发展和个体差异的复杂非线性关系。整合大量观察数据、电子健康记录、实验室读数、身体测量和临床评估,为综合和优化患者诊断风险评估提供了重要机会。生物标志物在精准医疗中发挥着关键作用,能够在合适的时间进行针对性治疗。虽然生物标志物复杂且在疾病亚型和分子生长测量上存在挑战,但它们在评估各种异常条件下的毒性反应中极为宝贵,从而促进进一步分析。通过在临床观察中使用生物标志物,医疗专业人员可以更准确地预测疾病进展并监测治疗反应。最终,医疗分析中多模态分子生物标志物与人工智能的融合,使得更有效的模式识别能够匹配现有特征,减轻临床影响。
与最先进的方法相比,尤其是Somepalli等人14的研究,作者提出了针对基因组数据(如代谢、表观遗传和蛋白质组数据)的机器学习算法,并提出了选择机器学习算法的通用指南。然而,数据分析存在局限性。在现有工作中,15 应用了无监督积分方法,重点解决了计算难题。相比之下,方法的范围和分析存在局限。此外,Huang等人16 涵盖了大多数DL方法,用于分析多样化应用,旨在理解大数据和计算框架的力量。缺点包括数据不平衡、过拟合和解释问题。本方案对于填补整合生物标志物研究中的关键空白至关重要,因为现有技术未能有效结合高维和多样化的生物数据。通过利用在模式识别、特征选择和多模态融合方面表现出色的复杂机器学习和深度学习,拟提交的申请旨在识别强有力的预测特征,提升早期诊断、预后和个体治疗方案。该方案直接解决了断裂生物标志物评估的局限性,通过提出一个全面的数据驱动模型,使健康预测能够实现可扩展、可解释且临床相关的预测。
Access restricted. Please log in or start a trial to view this content.
1. 实验工作流程
图1 展示了一个有组织且模块化的工作流程流程,旨在利用机器学习和深度学习技术将分子生物标志物分类为风险类或诊断适应症类别。以下是该流程的详细逐步说明:

图1:拟议工作的流程图。 该提议问题的工作流程如图所示。步骤包括数据预处理、特征工程、模型开发、拆分、利用指标进行模型评估以及生物标志物分析。 请点击此处查看该图的放大版本。
2. 数据集描述
数据集名称all_sequence_variants csv 扩展。有列名称为“id”、“variation”、“position”、“external_link”、“gene_symbol”、“entrez_gene_id”、“reference”、“condition”、“indication_types”,其中除id为整数类型和entrez_gene_id为float类型外,其他列均为对象类型。行总数为42818行,共9列。此外,数据集的变异、位置、external_link、entrez_gene_id、参考、条件和indication_types值均为空值。该数据集取自链接:https://markerdb.ca/downloads17
3. 数据集预处理
此阶段,数据预处理从收集数据集信息、描述、识别重复值以及寻找缺失/空值开始。当用相关系数测量时,external_link特征没有影响,因此该特征被移除。类别列和数值列的空值分别填充中位数和均值。最后,输入和输出的数据集形状为 (42787, 6)(42787,)。输入列为“id”、“variation”、“position”、“gene_symbol”、“entrez_gene_id”、“condition”,而目标列为indication_types。
4. 生物标志物:类别、数据挑战及分子风险的作用
生物标志物是一种可量化的特征,表示对各种暴露或干预的正常或异常生物活动或反应。生物标志物可以是分子性的、组织学的、放射学的或生理性的,主要分为七大类:(1)诊断性生物标志物确定个体是否患有特定疾病或障碍,以及其是否属于某个亚型,(2)监测生物标志物指示疾病的进展及其对治疗的反应,(3)反应生物标志物显示患者是否对药物或治疗产生反应, 例如心率的变化,(4)预测性生物标志物可以确定个体是否有患某种疾病的风险及其对特定治疗的反应,(5)预后生物标志物可以洞察患者在特定健康结果的倾向时病情进展或复发的可能性, (6)风险生物标志物评估患者在获得正式诊断前的潜在风险水平,(7)安全生物标志物评估治疗可能引发的毒性或不良反应的可能性。本研究主要聚焦于与风险评估和诊断相关的分子生物标志物分析,如 图2所示。鉴于全球可获得的大量临床数据,生物标志物对于指导临床决策、推动研究进展和促进个性化医疗至关重要。

图2:临床决策生物标志物类别。 生物标志物的决策在图中表示。基于应用于生物标志物的分析,临床决策被考虑,并实施机器学习算法。 请点击此处查看该图的放大版本。
由于生物标志物类型、特征和质量的广泛,寻找和理解临床有用的生物标志物信息具有挑战性。过去二十年生物标志物研究的快速增长进一步加剧了获取全面且最新数据的复杂性,尤其是分子生物标志物方面。这导致了诸如发现不一致、现有生物标志物重复重新发现、结果矛盾以及利用既有生物标志物的机会被忽视等问题。“组学”测量的出现加剧了这一问题,导致临床测试和文献中新型分子生物标志物激增,使得有效应用和应用生物标志物知识变得越来越困难。
MarkerDB 2.0为实验目的提供了多样化分子生物标志物的访问20.各种生物标志物被用于临床研究和医疗应用,用于诊断、预测和监测疾病。其中,蛋白质生物标志物利用血清、血液、脑脊液(CSF)、腹膜液、羊水、血浆和尿液等生物流体来分析糖尿病、结核病、唐氏综合征及肌病相关疾病等疾病。同样,遗传生物标志物利用LRP1、LPP、MAPT和SPI1等基因符号分析年龄相关黄斑变性、过敏性疾病、阿尔茨海默病、癌症和哮喘等疾病。此外,多模态分子生物标志物有助于测量患者风险和诊断指标21。这项工作强调了利用机器学习方法进行医疗分析以提升疾病诊断、预测和个性化治疗的必要性。
5. 统计机器学习建模方法以发现生物标志物
机器学习方法的应用在多方面改变了医疗领域。具体来说,分子生物标志物已通过多种机器学习技术进行分析,包括主成分分析(PCA)、K-均值聚类(KMA)、最近邻分析(NNA)和神经网络算法22。这些模型识别所选特征中的复杂模式,管理不完整或不一致的数据,并支持疾病进展的实时追踪。除了诊断疾病外,机器学习算法还通过数据分析和可视化,为患者问题提供重要洞察,实现及时且有针对性的护理。因此,这在特殊情况下提升了患者的健康结果。此外,机器学习在多种疾病中革新生物标志物发现和治疗效果的能力,包括分子生物标志物的分析,正日益蓬勃发展。
机器学习算法分为五大类型,如图3所示。监督学习是指在带标签数据集上训练以理解输入-输出关系的过程,非常适合分类和回归等任务,如决策树和支持向量机。无监督学习识别未标记数据中的模式,常用于聚类和降维,采用k均值聚类和主成分分析等技术。半监督学习通过合并有标签和无标签的数据来生成预测数据。强化学习侧重于基于环境反馈的决策,常用于游戏和机器人技术,方法包括Q学习和深度强化学习网络。深度学习采用多层人工神经网络来识别数据中的复杂模式。该技术有助于预测常见疾病的生物标志物,包括癌症、中风、阿尔茨海默病和帕金森病。许多临床批准的应用采用了这项技术。恶性肿瘤患者的准确诊断通常依赖于组织样本的获取和病理分析,这些样本提供了关于组织学分级、亚型、分期及其他多种肿瘤生物标志物的关键信息。

图3:临床决策机器学习算法的分类。 图中展示了机器学习算法的类型,以帮助理解所采用的方法论。 请点击此处查看该图的放大版本。
统计学和机器学习是两个经常交汇的独立学科。统计学涉及收集、分析和解读数据,通常使用较小且定义清晰的数据集,主要侧重于比较和总结信息。另一方面,机器学习是人工智能的一个子集,创建预测模型,通常处理庞大复杂的数据集。虽然统计学在验证性研究和理解背后机制中发挥重要作用,但机器学习在探索性研究、揭示复杂模式和管理缺失数据方面更有效。逻辑回归等方法既可视为统计模型,也可视为监督机器学习模型,体现了两者界限的模糊。最终,研究人员必须评估他们的研究目标和数据的性质,以选择最合适的方法。
6. MLP建模及其变体
MLP,也称为多层感知器,是一种神经网络架构,具有输入层和输出层之间的多层神经元,如 图4所示。MLP于20世纪50年代引入,随着1980年代反向传播的进步和进步,广泛应用,有助于减少损失。MLP的基本学习原则是神经网络、权重和偏置值用于计算输出。最后,要知道激活函数和阈值,以获得输出层的输出。在所提方法中,输入层、隐藏层和输出层的节点分别对应临床和基因特征,完全连通层具有ReLU激活,单一神经元具有乙状结肠激活,分别用于预测适应症(风险、诊断)类型的二元结果。主要优势是训练和解读简单。然而,简单MLP无法处理大型数据集,且对学习率26非常敏感。因此,为了克服这些缺点,考虑了带有学习速率调度器的MLP,采用 图3B中给出的架构。带有LR的MLP是一种强大的动力学机制,具有陡峭衰变、指数衰减、反时间衰变、ReduceLROnPlateau和余弦退火。学习率不再固定,而是根据模型表现和训练而变化。

图4:使用LR调度器建模多层感知器和MLP。 (A) 多层感知器:MLP的结构由输入层、隐藏层和输出层展示。第一层接收输入并在第二层通过激活处理,输出则在最后一层接收。MLP的实施非常简单。(B) 带 LR 调度器的 MLP:这与 MLP 类似;不过,增加了学习率调度器以控制训练速度,从而提升收敛率。学习速度会在一个平台期下降。这减少了超传最小值。 请点击此处查看该图的放大版本。
这种方法更高效、更可靠,也更适合表格数据。此外,还带来了诸如对噪声数据的稳定收敛改进、改进泛化以及减少超参数调优工作等好处。然而,对于某些预测任务,可能会遇到困难,比如卡在局部极小值。此外,在图5所示的宽深度MLP架构中,引入了宽深度组件,以在相关映射、规则记忆和学习新模式方面表现出色,同时保持较高的泛化标准。通过将这些方面合并到输出层,预测二进制输出为27。然而,对看不见特征的推广和过度泛化存在局限性。总之,使用带有批次范数和退出的MLP用于规范训练过程,将退出用于学习和泛化未知属性。特别是,该技术可以应用于高维数据,有助于防止过拟合。然而,该技术存在批处理大小限制、由于批处理归一化层导致内存消耗增加,且并非通用解决方案28,29。

图5:建模MLP范围和深度网络。 图示展示了MLP的深层路径,该路径能够捕捉非线性关系,并将输出与S形单元结合进行分类。该架构捕捉了异构生物标志物数据的模式学习和知识。 请点击此处查看该图的放大版本。
7. TabNet
TabNet 是一种深度学习模型,称为 Tabular Network,由谷歌研究团队开发。TabNet模型的主要动机是调和图像、文本、语音(CNN、自编码器、变换器)与基于树的机器学习(XGBoost、随机森林、LightGBM)方法之间的差异。此外,DL方法的局限性对TabNet模型产生巨大影响,MLP是一个参数化模型。最重要的是,DL方法缺乏对现实问题的解释、自我监督学习和顺序学习能力31。TabNet模型仅限于保险风险预测32、煤灰含量估计33、化学毒性预测34和教育测试作弊检测35等应用。TabNet的架构如 图6所示。

图6:表格网络建模。 表格网络将输入特征以表格形式处理,并在每个模块中顺序应用变压器技术。GLU块,也称为门控线性单元块,控制信息在网络中的前进流动,促进特征选择和稳定学习。输出会从累积输出中呈现在输出层中。 请点击此处查看该图的放大版本。
从上述架构图,系统被划分为四个部分:输入块、共享特征变换器、顺序决策步骤以及利用优化计算损耗。在类别特征中,特征会在嵌入层之后转换为整数。同时,连续特征也被原封不动地处理。最后,特征被转换为统一特征向量,其中x∈Rd。下一步,实现带有激活函数的全连通层,随后进行数据转换为矢量,做出决策。第三步依次使用注意力转换器、掩蔽、决策转换器和预测累积。这一步的目标是选择性关注、顺序推理和决策路径。最后一步,使用二元交叉熵或类似方法来确定损失并优化该值。此外,正则化通过疏远关注来防止过拟合。
8. 自动智能
通过自关注神经网络实现的自动特征交互学习(AutoInt)是AutoInt的完整形式,首次出现在点击率(CTR)预测36中,后来应用于多种应用,包括软件缺陷预测37、推荐系统38和基因组检测39。现有机器学习方法存在局限性,包括处理高维稀疏数据、高阶组合特征、理解特征预测能力以及需要手动特征工程。所有上述挑战都通过AutoInt模型高效、有效且可解释性地解决。在拟议方法中,AutoInt的目标是预测该变异是风险型还是诊断型。如图6所示,给定数据集提出了七个步骤,并附有源代码。首先,读取数据和预处理实现了将所有类别特征编码为整数,并将标签分别映射为风险和诊断的0和1。第二步,进行特征表示以创建嵌入矩阵;随后,矩阵被转换以归一化数值特征。存在交互层,在这些层中,特征之间的中性自动交互是学习的,而无需与变压器进行人工作。此外,多个头学习不同类型的交互,最终特征被串接,增强了表征。存在残差连接,用于学习低阶和高阶相互作用,如1特征、2特征、3特征等。最后,从残差网络中,输出传递给S形函数进行二进制值计算,如图7所示。

图7:AutoInt网络建模。 AutoInt网络会自动学习特征,嵌入层通过自关注机制和残余连接将特征映射到下一层。最后一个组件包含MLP层和激活函数以产生输出。 请点击此处查看该图的放大版本。
Access restricted. Please log in or start a trial to view this content.
实验采用机器学习和深度学习方法进行,以比较它们的性能。同时,也考虑创建既利用监督学习机制的机器学习模型,也包括无监督学习机制。该方法论中使用的监督技术包括逻辑回归、决策树、随机森林、梯度提升、支持向量机和K最近邻算法。这些算法涵盖从简单的统计模型到复杂的基于树状的分析。另一方面,无监督机器学习算法包括K均值聚类、DBSCAN聚类和聚合聚类技术。而所使用的深度学习技术包括简单的MLP、MLP + 批量归一化 + 早期停止、宽深度网络(表混合)以及带学习率调度器的MLP(高级)。在分析结果之前,通过基于模型的置换重要性以及SHapley加法解释(SHAP)和局部可解释模型无关解释(LIME)方法计算特征重要性。此外,这些方法为Adaboost技术提供了黑箱,有助于理解模型间的关系,识别冗余特征,提升性能,并检测偏见。因此,特征重要性通过多种技术进行测量,结果如 图8所示。
<...
Access restricted. Please log in or start a trial to view this content.
本研究明确讨论了生物标志物在识别和监测疾病及其特征中的重要性。建议的生物标志物方法基于四个基本步骤:仔细的数据准备(清理、编码、消除标识符);统一目标编码(Risk=0,诊断=1);为 AutoInt37/TabNet 等模型提供特征规范化和高质量深度嵌入;以及稳固的评估流程完整性(适当的训练/测试分工,正确的指标报告)。此外,利用基因预测疾病适应症,并借助机器学习和深度学习算法。最常用的机器学习算法已在数据集上实现,算法与数据集的协调和效率与上述部分结果一致。此外,除了MLP29、TabNet和AutoInt外,还与数据集进行了新的DL模型分析,模型的工作与所考虑的数据集同步。另一方面,这些模型优于现有研究,结果也支持了这一观点。为保证可重复性,考虑实施诸如使用OrdinalEncoder替代新类别变量,并引入Dropout/BatchNorm以减少模型中的过拟合。使用动态学习率调度器可以增强训练稳定性。排查应优先避免数据泄露(通过消除ID列)、解决过拟合(通过衰减),以及...
Access restricted. Please log in or start a trial to view this content.
作者没有什么可透露的。
作者未获得外部资金支持。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| AutoInt 模型 | 北京大学 | https://github.com/shichence/AutoInt | 通过自关注神经网络实现的自动特征交互学习:一种高效的算法,用于自动学习(稀疏)范类和数值特征的高阶特征交互 |
| deepctr_torch.模型 | 开源 | https://github.com/shenweichen/DeepCTR-Torch | 模块化且可扩展的深度学习CTR模型包,方便轻松构建自定义模型。 |
| 谷歌协作实验室 | 谷歌 | https://colab.research.google.com/ | 基于云的 通过浏览器编写和执行 Python 代码,用于机器学习和数据分析 |
| Keras 2.6.0 | 克拉斯 | https://keras.io/ | 提供运行在Tensorflow之上运行的Python接口,用于执行神经网络 |
| MarkerDB 2.0 | MarkerDB | https://markerdb.ca/downloads | 公开可用的分子生物标志物数据库 |
| Matplotlib 3.4.3 | MatplotLib | https://matplotlib.org/ | Python 可视化库 |
| Numpy 1.21.4 | Numpy | https://numpy.org/ | 基于Python进行科学计算的基础软件包 |
| 熊猫 1.3.4 | 熊猫 | https://pandas.pydata.org/ | 强大、灵活且易于使用的开源数据分析与作工具,基于Python编程语言构建。 |
| Python 3.8.10 | Python 软件基础 | https://www.python.org/ | 流行的编程语言,能够更有效地集成深度学习系统。 |
| pytorch_tabnet.tab_model | 火炬 | https://pypi.org/project/pytorch-tabnet/ | 用于实现二元/多类分类和回归问题。 |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/ | 机器学习算法的Python模块 |
| 海本 | 海本 | https://seaborn.pydata.org/ | 用于绘制美观且信息丰富的统计图形的高级数据可视化库 |
| TabNet模型 | 谷歌 | https://github.com/dreamquark-ai/tabnet | TabNet 是一个端到端神经网络,设计用于直接处理表格数据 |
| 张量流 2.6.0 | 谷歌 | https://www.tensorflow.org/ | 一个端到端的机器学习平台 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission