现有的算法为生物标志物检测数据集生成单一解决方案。本方案展示了存在多个效果相似的解决方案,并提供了一款用户友好的软件,以帮助生物医学研究人员针对所提出的挑战深入分析其数据集。计算机科学家也可在其生物标志物检测算法中集成此项功能。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
现有的算法为生物标志物检测数据集生成单一解决方案。本方案展示了存在多个效果相似的解决方案,并提供了一款用户友好的软件,以帮助生物医学研究人员针对所提出的挑战深入分析其数据集。计算机科学家也可在其生物标志物检测算法中集成此项功能。
生物标志物检测是高通量“组学”研究人员面临的重要生物医学问题之一,几乎所有现有的生物标志物检测算法都会为给定数据集生成一个具有最优性能度量的生物标志物子集。然而,最近的一项研究证明了存在多个生物标志物子集,其分类性能相似甚至完全相同。本实验方案提供了一种简单直接的方法,用于检测二元分类性能优于用户自定义阈值的生物标志物子集。该方案包括数据准备与加载、基线信息汇总、参数调优、生物标志物筛选、结果可视化与解释、生物标志物基因注释,以及达到出版质量的结果和可视化导出。所提出的生物标志物筛选策略直观易懂,展示了开发生物标志物检测算法的一般性原则。我们使用编程语言 Python 开发了一个用户友好的图形用户界面(GUI),使生物医学研究人员能够直接访问其分析结果。kSolutionVis 的源代码和使用手册可从 http://www.healthinformaticslab.org/supp/resources.php 下载。
二元分类是生物医学领域中最常见且具有挑战性的数据挖掘问题之一,用于构建分类模型,通过对两组样本进行训练以实现最准确的区分能力1,2,3,4,5,6,7。然而,生物医学领域产生的大数据具有固有的“高维小样本”范式,即特征数量通常远大于样本数量6,8,9。因此,生物医学研究人员在使用分类算法前必须降低特征维度,以避免过拟合问题8,9。诊断生物标志物被定义为一组能够将特定疾病的患者样本与健康对照样本区分开来的检测特征10,11。通常将患者定义为阳性样本,健康对照则定义为阴性样本12。
最近的研究表明,对于生物医学数据集,可能存在多个具有相同或相似分类性能的解决方案5。几乎所有的特征选择算法都是确定性算法,对同一数据集仅产生一个解决方案。遗传算法可能同时生成多个性能相似的解决方案,但它们仍然试图为给定数据集选择一个具有最佳适应度函数的解决方案作为输出13,14。
特征选择算法大致可分为过滤法或封装法12一种过滤算法选择排名靠前的k 基于特征间相互独立的假设,根据各特征与二分类标签的显著性个体关联程度进行排序的特征15,16,17尽管这一假设几乎不适用于所有真实世界的数据集,但在许多情况下,启发式过滤规则仍表现出良好的效果,例如最小冗余最大相关(Minimum Redundancy and Maximum Relevance, mRMR)算法、基于Wilcoxon检验的特征筛选(WRank)算法以及基于受试者工作特征曲线(Receiver operating characteristic, ROC)图的筛选(ROCRank)算法。与最大依赖性特征选择算法相比,mRMR是一种高效的过滤算法,它将组合估计问题近似为一系列更小的问题,每个问题仅涉及两个变量,因而使用成对联合概率,具有更强的鲁棒性18,19然而,mRMR 可能会低估某些特征的有用性,因为它不衡量特征之间的相互作用(这些相互作用可提高相关性),因此会遗漏一些单独无用但组合起来有用的特征组合。WRank 算法计算一个特征在两类样本之间区分能力的非参数评分,以其对异常值的鲁棒性而著称20,21此外,ROCRank 算法评估某一特征在所研究的二分类性能中其受试者工作特征曲线下面积(AUC)的显著性程度22,23.
另一方面,包装法通过启发式规则迭代生成给定特征子集,并评估预定义分类器在该子集上的性能,从而获得性能度量最优的特征子集24. 在分类性能方面,包装法通常优于过滤法,但运行速度较慢25例如,正则化随机森林(RRF)26,27 该算法采用贪心规则,在随机森林的每个节点上通过吉尼指数评估训练数据子集上特征的重要性得分。若新特征的信息增益未能优于已选特征的信息增益,则该特征的选择将受到惩罚。此外,微阵列预测分析(PAM)28,29 算法,同样也是一种封装算法,会为每个类别标签计算一个质心,然后选择特征以将基因质心向整体类别质心收缩。PAM 对异常特征具有较强的鲁棒性。
对于任何给定数据集,可能存在多个具有最优分类性能的解决方案。首先,确定性算法的优化目标由数学公式定义, 例如, 最小错误率30,这对于生物样本而言未必理想。其次,一个数据集可能存在多个显著不同的解决方案,但其分类效果相似甚至完全相同。几乎所有现有的特征选择算法都会随机选取其中一种解决方案作为输出31.
本研究将介绍一种信息学分析流程,用于为任意给定的二分类数据集生成多个具有相似性能的特征选择方案。考虑到大多数生物医学研究人员对信息学技术或计算机编程不熟悉,本研究开发了一个用户友好的图形用户界面(GUI),以促进对生物医学二分类数据集的快速分析。该分析流程包括数据加载与汇总、参数调优、流程执行及结果解读。研究人员只需简单点击,即可生成生物标志物子集以及可用于发表的高质量可视化图表。该流程已使用急性淋巴细胞白血病(ALL)的两个二分类数据集的转录组数据进行了验证, 即,ALL1 和 ALL212ALL1和ALL2数据集下载自布罗德研究所基因组数据分析中心,可从http://www.broadinstitute.org/cgi-bin/cancer/datasets.cgi获取。 ALL1 包含 128 个样本,每个样本具有 12,625 个特征。其中,95 个为 B 细胞急性淋巴细胞白血病(B-cell ALL)样本,33 个为 T 细胞急性淋巴细胞白血病(T-cell ALL)样本。ALL2 同样包含 100 个样本,每个样本具有 12,625 个特征,其中 65 名患者出现复发,35 名患者未复发。ALL1 是一个较易进行二分类的數據集,四种过滤法和四种封装法的最低分类准确率为 96.7%,八种特征选择算法中有六种达到了 100% 的准确率12尽管ALL2是一个更具挑战性的数据集,上述8种特征选择算法在该数据集上的准确率均未超过83.7%12该最高准确率由包装器算法“基于相关性的特征选择”(CFS)检测出的56个特征实现。
访问受限。请登录或开始试用以查看此内容。
注意:以下方案详细描述了信息学分析流程及主要模块的伪代码。该自动分析系统使用 Python 3.6.0 版本及 Python 模块 pandas、abc、numpy、scipy、sklearn、sys、PyQt5、sys、mRMR、math 和 matplotlib 开发而成。本研究中使用的材料列于材料表中。
1. 准备数据矩阵和类别标签
2. 加载数据矩阵和类别标签
3. 汇总并展示数据集的基线统计信息
4. 确定类别标签和最高排名特征的数量
5. 针对不同性能调优系统参数
[0, 1] 作为阈值以显示符合条件的解。软件将执行全面的特征子集筛选,适当选择 pCutoff 可使三维可视化结果更加直观和清晰。pCutoff 的默认值为 0.70。6. 运行流程并生成交互式可视化结果
7. 解读三维散点图——使用三维散点图可视化并解读具有相似有效二分类性能的特征子集
8. 查找基因注释及其与人类疾病的相关性
注意:步骤 8 至 10 将说明如何从 DNA 和蛋白质序列水平对基因进行注释。首先,将从数据库 DAVID32 中检索上述步骤中各生物标志物 ID 的基因符号,然后分别使用两个代表性网络服务器从 DNA 和蛋白质水平分析该基因符号。GeneCard 服务器提供对特定基因符号的全面功能注释,而在线人类孟德尔遗传数据库(OMIM)提供最全面的疾病-基因关联 curated 数据。UniProtKB 服务器是最全面的蛋白质数据库之一,而基于基序的预测系统(GPS)可预测大量激酶的信号磷酸化位点。
9. 注释编码蛋白及其翻译后修饰
10. 注释蛋白质-蛋白质相互作用及其富集的功能模块
11. 导出生成的生物标志物子集及可视化图谱
访问受限。请登录或开始试用以查看此内容。
本工作流程(图 6)的目标是检测多个具有相似效能的生物标志物子集,适用于二元分类数据集。整个过程通过两个示例数据集 ALL1 和 ALL2 进行说明,这些数据集提取自最近发表的一项生物标志物检测研究12,48。用户可按照补充材料中的说明安装 kSolutionVis。
数据集ALL1对95份B细胞和33份T细胞急性淋巴细胞白血病患者血液样本的12,625个转录组学特征进行了分析。而数据集ALL2则检测了65名治疗后复发的ALL患者和35名未复发ALL患者的12,625个转录组学特征的表达水平。为方便用户,该软件1.4版本中提供了这两个转录组数据集及其类别标签。两个数据集均位于软件源代码目录下的"data"子目录中。
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种易于操作的多解生物标志物检测与表征方案,适用于用户指定的二分类数据集。该软件注重用户友好性,并提供针对多种文件格式的灵活导入/导出接口,使生物医学研究人员能够通过软件的图形用户界面(GUI)轻松分析其数据集。本研究还强调了生成多个建模性能相近的有效解的必要性,而这一点此前被许多现有的生物标志物检测算法所忽略。未来,新开发的生物标志物检测算法可通过记录所有具有足够建模性能的中间生物标志物子集,将此功能纳入其中。
在本方案中,步骤1和步骤5最为重要,因为该软件是一个完全自动化的系统,依赖于格式正确的输入文件。在测试过程中发现,数据矩阵与类别标签文件中的样本名称不匹配可能导致软件出错,此时软件将弹出关于此错误的警告对话框。因此,如果用户发现数据矩阵或类别标签文件中没有任何样本被加载,应通过以下故障排查技巧进行检查 是再次检查两个输入文件中的样本名称是否不一致。如果在三维散点图中未显示任何点,则可能是由于参数 pCutoff 高于最佳解决方案。此时,故障排除的技巧是降低分类性能评估指标的阈值(参数 pCutoff然而,对于较难的...
访问受限。请登录或开始试用以查看此内容。
我们与本报告无任何利益冲突。
本工作得到了中国科学院战略性先导科技专项(XDB13040400)和吉林大学启动经费的支持。感谢匿名评审人和生物医学测试用户对提升kSolutionVis的可用性和功能所提出的建设性意见。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 硬件 | |||
| 笔记本电脑 | Lenovo | X1 carbon | 任何计算机均可使用。推荐最低配置:额外1GB硬盘空间、1GB内存、2.0MHz CPU |
| 名称 | 公司 | 目录编号 | 备注 |
| 软件 | |||
| Python 3.0 | WingWare | Wing Personal | 任何支持 Python 3.0 或更高版本的编程与运行环境均可使用 |
访问受限。请登录或开始试用以查看此内容。