需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

选择具有相似有效二元分类性能的多个生物标志物子集

7.2K 次观看

DOI:

10.3791/57738

2018年10月11日

本文内容

摘要

现有的算法为生物标志物检测数据集生成单一解决方案。本方案展示了存在多个效果相似的解决方案,并提供了一款用户友好的软件,以帮助生物医学研究人员针对所提出的挑战深入分析其数据集。计算机科学家也可在其生物标志物检测算法中集成此项功能。

摘要

生物标志物检测是高通量“组学”研究人员面临的重要生物医学问题之一,几乎所有现有的生物标志物检测算法都会为给定数据集生成一个具有最优性能度量的生物标志物子集。然而,最近的一项研究证明了存在多个生物标志物子集,其分类性能相似甚至完全相同。本实验方案提供了一种简单直接的方法,用于检测二元分类性能优于用户自定义阈值的生物标志物子集。该方案包括数据准备与加载、基线信息汇总、参数调优、生物标志物筛选、结果可视化与解释、生物标志物基因注释,以及达到出版质量的结果和可视化导出。所提出的生物标志物筛选策略直观易懂,展示了开发生物标志物检测算法的一般性原则。我们使用编程语言 Python 开发了一个用户友好的图形用户界面(GUI),使生物医学研究人员能够直接访问其分析结果。kSolutionVis 的源代码和使用手册可从 http://www.healthinformaticslab.org/supp/resources.php 下载。

引言

二元分类是生物医学领域中最常见且具有挑战性的数据挖掘问题之一,用于构建分类模型,通过对两组样本进行训练以实现最准确的区分能力1,2,3,4,5,6,7。然而,生物医学领域产生的大数据具有固有的“高维小样本”范式,即特征数量通常远大于样本数量6,8,9。因此,生物医学研究人员在使用分类算法前必须降低特征维度,以避免过拟合问题8,9。诊断生物标志物被定义为一组能够将特定疾病的患者样本与健康对照样本区分开来的检测特征10,11。通常将患者定义为阳性样本,健康对照则定义为阴性样本12

最近的研究表明,对于生物医学数据集,可能存在多个具有相同或相似分类性能的解决方案5。几乎所有的特征选择算法都是确定性算法,对同一数据集仅产生一个解决方案。遗传算法可能同时生成多个性能相似的解决方案,但它们仍然试图为给定数据集选择一个具有最佳适应度函数的解决方案作为输出13,14

特征选择算法大致可分为过滤法或封装法12一种过滤算法选择排名靠前的k 基于特征间相互独立的假设,根据各特征与二分类标签的显著性个体关联程度进行排序的特征15,16,17尽管这一假设几乎不适用于所有真实世界的数据集,但在许多情况下,启发式过滤规则仍表现出良好的效果,例如最小冗余最大相关(Minimum Redundancy and Maximum Relevance, mRMR)算法、基于Wilcoxon检验的特征筛选(WRank)算法以及基于受试者工作特征曲线(Receiver operating characteristic, ROC)图的筛选(ROCRank)算法。与最大依赖性特征选择算法相比,mRMR是一种高效的过滤算法,它将组合估计问题近似为一系列更小的问题,每个问题仅涉及两个变量,因而使用成对联合概率,具有更强的鲁棒性18,19然而,mRMR 可能会低估某些特征的有用性,因为它不衡量特征之间的相互作用(这些相互作用可提高相关性),因此会遗漏一些单独无用但组合起来有用的特征组合。WRank 算法计算一个特征在两类样本之间区分能力的非参数评分,以其对异常值的鲁棒性而著称20,21此外,ROCRank 算法评估某一特征在所研究的二分类性能中其受试者工作特征曲线下面积(AUC)的显著性程度22,23.

另一方面,包装法通过启发式规则迭代生成给定特征子集,并评估预定义分类器在该子集上的性能,从而获得性能度量最优的特征子集24. 在分类性能方面,包装法通常优于过滤法,但运行速度较慢25例如,正则化随机森林(RRF)26,27 该算法采用贪心规则,在随机森林的每个节点上通过吉尼指数评估训练数据子集上特征的重要性得分。若新特征的信息增益未能优于已选特征的信息增益,则该特征的选择将受到惩罚。此外,微阵列预测分析(PAM)28,29 算法,同样也是一种封装算法,会为每个类别标签计算一个质心,然后选择特征以将基因质心向整体类别质心收缩。PAM 对异常特征具有较强的鲁棒性。

对于任何给定数据集,可能存在多个具有最优分类性能的解决方案。首先,确定性算法的优化目标由数学公式定义, 例如, 最小错误率30,这对于生物样本而言未必理想。其次,一个数据集可能存在多个显著不同的解决方案,但其分类效果相似甚至完全相同。几乎所有现有的特征选择算法都会随机选取其中一种解决方案作为输出31.

本研究将介绍一种信息学分析流程,用于为任意给定的二分类数据集生成多个具有相似性能的特征选择方案。考虑到大多数生物医学研究人员对信息学技术或计算机编程不熟悉,本研究开发了一个用户友好的图形用户界面(GUI),以促进对生物医学二分类数据集的快速分析。该分析流程包括数据加载与汇总、参数调优、流程执行及结果解读。研究人员只需简单点击,即可生成生物标志物子集以及可用于发表的高质量可视化图表。该流程已使用急性淋巴细胞白血病(ALL)的两个二分类数据集的转录组数据进行了验证, ,ALL1 和 ALL212ALL1和ALL2数据集下载自布罗德研究所基因组数据分析中心,可从http://www.broadinstitute.org/cgi-bin/cancer/datasets.cgi获取。 ALL1 包含 128 个样本,每个样本具有 12,625 个特征。其中,95 个为 B 细胞急性淋巴细胞白血病(B-cell ALL)样本,33 个为 T 细胞急性淋巴细胞白血病(T-cell ALL)样本。ALL2 同样包含 100 个样本,每个样本具有 12,625 个特征,其中 65 名患者出现复发,35 名患者未复发。ALL1 是一个较易进行二分类的數據集,四种过滤法和四种封装法的最低分类准确率为 96.7%,八种特征选择算法中有六种达到了 100% 的准确率12尽管ALL2是一个更具挑战性的数据集,上述8种特征选择算法在该数据集上的准确率均未超过83.7%12该最高准确率由包装器算法“基于相关性的特征选择”(CFS)检测出的56个特征实现。

访问受限。请登录或开始试用以查看此内容。

方案

注意:以下方案详细描述了信息学分析流程及主要模块的伪代码。该自动分析系统使用 Python 3.6.0 版本及 Python 模块 pandas、abc、numpy、scipy、sklearn、sys、PyQt5、sys、mRMR、math 和 matplotlib 开发而成。本研究中使用的材料列于材料表中。

1. 准备数据矩阵和类别标签

  1. 将数据矩阵文件准备为以制表符(TAB)或逗号分隔的矩阵文件,如图1A所示。
    注意:每一行包含一个特征的所有数值,第一项为特征名称。特征可以是基于微阵列转录组数据集的探针集ID,也可以是甲基化组数据集中带有甲基化值的半胱氨酸残基等其他值ID。每一列给出一个给定样本的特征值,第一项为样本名称。行内各列通过制表符(图1B)或逗号(图1C)分隔。以制表符分隔的矩阵文件使用 .tsv 作为文件扩展名,以逗号分隔的矩阵文件使用 .csv 作为扩展名。该文件可通过在 Microsoft Excel 等软件中将矩阵另存为 .tsv 或 .csv 格式生成,也可通过编程代码生成。
  2. 将类别标签文件准备为以制表符或逗号分隔的矩阵文件(图1D),格式与数据矩阵文件类似。
    注意:第一列为样本名称,每个样本的类别标签位于标题为Class的列中。编码过程中已考虑最大兼容性,因此可添加额外列。类别标签文件可保存为 .tsv 或 .csv 格式。Class列中的名称可以是任意术语,样本类别可超过两类。用户可在后续分析中任选其中两类进行分析。

2. 加载数据矩阵和类别标签

  1. 将数据矩阵和类别标签加载到软件中。点击按钮 Load data matrix 选择用户指定的数据矩阵文件。点击按钮 Load class labels 选择对应的类别标签文件。
    注意:两个文件加载完成后,kSolutionVis 将自动检查两个文件之间的兼容性。
  2. 从数据矩阵文件中汇总特征和样本信息。评估数据矩阵文件的大小。
  3. 从类别标签文件中汇总样本和类别信息。评估类别标签文件的大小。
  4. 检测数据矩阵中的每个样本是否都有对应的类别标签。统计具有类别标签的样本数量。

3. 汇总并展示数据集的基线统计信息

  1. 点击按钮 总结,无需输入特定关键词,软件将显示20个索引特征及其对应的特征名称。
    注意:用户需要指定希望查找的特征名称,以查看其在所有输入样本中的基线统计信息及相应的值分布。
  2. 提供一个关键词, 例如 “1000_at”,在文本框中 特征 以查找需汇总的特定特征。点击按钮 总结 以获取该特征的基线统计信息。
    注意:关键词可出现在目标特征名称的任意位置,便于用户进行搜索。
  3. 点击按钮 总结 通过给定的关键词查找多个特征,然后指定唯一的特征ID,以继续执行上述步骤来汇总某一特定特征。

4. 确定类别标签和最高排名特征的数量

  1. 在下拉框中选择阳性(“P (33)”)和阴性(“N (95)”)类别的名称 阳性类别阴性类别,如图所示 图2 (中)
    注意:建议选择一个平衡的二分类数据集, ,阳性样本与阴性样本数量之间的差异极小。每个类别标签名称后的括号中也给出了相应的样本数量。
  2. 选择10作为排名靠前的特征数量(参数) pTopX下拉框中的) 前X个(?) 用于特征子集的全面筛选。
    注意:该软件会自动根据特征对所有特征进行排序 P-通过 t 检验对每个特征在阳性组和阴性组之间进行比较而计算得出。具有较小 p 值的特征 P- 在两类样本之间具有更强的区分能力。综合筛选模块计算量较大。参数 pTopX 默认值为10。用户可在10至50的范围内调整此参数,直至找到具有优良分类性能且令人满意的功能子集。

5. 针对不同性能调优系统参数

  1. 在下拉框 Acc/bAcc (?) 中为所选分类器极限学习机(Extreme Learning Machine, ELM)选择性能度量指标(pMeasurement)准确率(Acc)。该参数的另一个选项是平衡准确率(bAcc)。
    注:设 TP、FN、TN 和 FP 分别为真阳性、假阴性、真阴性和假阳性的数量。度量指标 Acc 定义为 (TP+TN)/(TP+FN+TN+FP),在平衡数据集上表现最佳6。但如果负样本数量远大于正样本数量,以 Acc 为优化目标的分类器倾向于将所有样本归为负类。bAcc 定义为 (Sn+Sp)/2,其中 Sn = TP/(TP+FN) 和 Sp = TN/(TN+FP) 分别为正样本和负样本的正确预测率。因此,bAcc 对两个类别的预测性能进行归一化处理,可在两个不平衡类别之间实现较为均衡的预测性能。AccpMeasurement 的默认选项。软件默认使用 ELM 分类器来计算分类性能。用户也可从支持向量机(SVM)、k 近邻(KNN)、决策树或朴素贝叶斯分类器中选择其他分类器。
  2. 在输入框 pCutoff: 中为指定的性能度量指标选择阈值 0.70(参数 pCutoff)。
    注:AccbAcc 的取值范围均为 0 到 1,用户可指定一个 pCutoff静态平衡图,ΣFx=0,矢量力,教育物理概念,力平衡分析[0, 1] 作为阈值以显示符合条件的解。软件将执行全面的特征子集筛选,适当选择 pCutoff 可使三维可视化结果更加直观和清晰。pCutoff 的默认值为 0.70。

6. 运行流程并生成交互式可视化结果

  1. 单击 分析 按钮以运行流程并生成可视化图表,如 图2(底部)所示。
    注意:左侧表格列出了所有特征子集及其通过ELM分类器的10折交叉验证策略计算得到的 pMeasurement 值,具体方法如前所述5。根据当前参数设置,将生成两个三维散点图和两个折线图,用于特征子集筛选过程。
  2. pMeasurement 截断值(参数 piCutoff,输入框 )的默认值设为0.70,并将最佳特征子集数量(参数 piFSNum)的默认值设为10。
    注意:流程使用参数 pTopXpMeasurementpCutoff 执行。检测到的特征子集可进一步通过截断值 piCutoff 进行筛选,但 piCutoff 不得小于 pCutoff。因此,piCutoff 初始化为 pCutoff,仅性能度量值 ≥ piCutoff 的特征子集将被可视化。默认情况下,piCutoff 等于 pCutoff。有时kSolutionVis会检测到大量解,此时仅可视化性能最优的 piFSNum 个特征子集(默认为10个)。若软件检测到的特征子集数量少于 piFSNum,则所有特征子集都将被可视化。
  3. 收集并解读软件检测到的特征,如 图3 所示。
    注意:左侧框中的表格展示了检测到的特征子集及其性能度量值。前三列的列名分别为“F1”、“F2”和“F3”,每个特征子集中的三个特征按其排序顺序排列在一行中(F1 < F2 < F3)。最后一列给出每个特征子集的性能度量值(AccbAcc),该列的列名(AccbAcc)即为 pMeasurement 的取值。

7. 解读三维散点图——使用三维散点图可视化并解读具有相似有效二分类性能的特征子集

  1. 点击按钮 分析 生成分类性能最优的前 10 个特征子集的三维散点图(AccbAcc) 由软件检测到,如图所示 图3 (中间框)。将特征子集中的三个特征按其排名升序排列,并以这三个特征的排名作为 F1/F2/F3 轴, , F1 < F2 < F3.
    注意:点的颜色表示相应特征子集的二元分类性能。一个数据集可能具有多个性能度量相近的特征子集。因此,需要一个交互式且简化的散点图。
  2. 在输入框中将数值更改为 0.70 pCutoff: 并点击按钮 分析 生成性能度量 ≥ 的特征子集的三维散点图 piCutoff,如图所示 图3 (右侧框)。单击按钮 3D 调参 打开一个新窗口,以手动调整三维散点图的视角。
    注意:每个特征子集均以与上述相同的方式用一个点表示。三维散点图以默认角度生成。为便于三维可视化与调节,点击按钮将打开一个独立窗口 3D 调参.
  3. 点击按钮 减少 以降低检测到的特征子集的冗余性。
    注意:如果用户希望进一步筛选特征三元组并最小化特征子集的冗余性,该软件还提供了基于 mRMR 特征选择算法的此功能。单击后 减少 按钮,kSolutionVis 将移除特征三元组中的冗余特征,并重新生成上述表格和两个散点图。特征三元组中被移除的特征将在表格中由关键词替代。其数值的 在 F1/F2/F3 轴上的值将表示为 piFSNum (F1/F2/F3 正常值范围为 [1, top_x])。因此,包含一个 该值在三维图中可能显示为“离群”点。手动可调节的三维点图可在补充材料的“三维点图的手动调节”部分找到。

8. 查找基因注释及其与人类疾病的相关性

注意:步骤 8 至 10 将说明如何从 DNA 和蛋白质序列水平对基因进行注释。首先,将从数据库 DAVID32 中检索上述步骤中各生物标志物 ID 的基因符号,然后分别使用两个代表性网络服务器从 DNA 和蛋白质水平分析该基因符号。GeneCard 服务器提供对特定基因符号的全面功能注释,而在线人类孟德尔遗传数据库(OMIM)提供最全面的疾病-基因关联 curated 数据。UniProtKB 服务器是最全面的蛋白质数据库之一,而基于基序的预测系统(GPS)可预测大量激酶的信号磷酸化位点。

  1. 将数据库 DAVID 的网页链接复制并粘贴到网络浏览器中,打开该数据库的网页。点击链接 基因 ID 转换 见于 图4A 并输入数据集 ALL1 的第一个生物标志物子集的特征 ID 38319_at/38147_at/33238_at图4B。点击链接 基因列表 并点击 提交列表 如所示 图4B. 检索感兴趣的注释并点击 显示基因列表 (图4C). 获取基因符号列表(图 4D).
    注意:此处获取的基因符号将在后续步骤中用于进一步的功能注释。
  2. 将 Gene Cards 数据库的网址复制并粘贴到网页浏览器中,打开该数据库的网页。在数据库的查询输入框中搜索基因名称 CD3D,并从 Gene Cards 中获取该基因的注释信息33,34,如图所示 表1图 5A.
    注意:Gene Cards 是一个综合性的基因知识库,提供基因命名、基因组学、蛋白质组学、亚细胞定位以及相关通路和其他功能模块信息。此外,它还提供指向 PDB/PDB_REDO 等多种其他生物医学数据库的外部链接。35, Entrez基因36OMIM37,以及 UniProtKB38如果特征名称不是标准基因符号,请使用 ENSEMBL 数据库进行转换39CD3D 是 T 细胞受体 T3 delta 链基因的名称。
  3. 将数据库 OMIM 的网页链接复制并粘贴到网络浏览器中,打开该数据库的网页。搜索基因名称 CD3D,并从数据库 OMIM 中查找该基因的注释信息。37,如图所示 表1图5B.
    注意:OMIM 目前是人类基因与遗传性疾病关联信息最全面且权威的资源之一。OMIM 由 Victor A. McKusick 博士发起,旨在对与疾病相关的遗传突变进行编目40. 截至12月,OMIM现已涵盖超过15,000个人类基因和超过8,500种表型,st 2017.

9. 注释编码蛋白及其翻译后修饰

  1. 将数据库 UniProtKB 的网页链接复制并粘贴到网络浏览器中,打开该数据库的网页。在 UniProtKB 的查询输入框中搜索基因名称 CD3D,并从数据库中查找该基因的注释信息38,如表1图5C所示。
    注意:UniProtKB 收集了丰富的蛋白质注释信息,包括命名法和功能信息。该数据库还提供与其他广泛使用的数据库的外部链接,包括 PDB/PDB_REDO35、OMIM37 和 Pfam41
  2. 将网络服务器 GPS 的网页链接复制并粘贴到网络浏览器中,打开该服务器的网页。从 UniProtKB 数据库38中获取生物标志物基因 CD3D 编码的蛋白质序列,并使用在线工具 GPS 预测该蛋白质的翻译后修饰(PTM)残基,如表1图5D所示。
    注意:生物系统是动态且复杂的,现有数据库仅收集已知信息。因此,生物医学预测的在线工具以及离线程序可提供有用的证据,以补充假设的作用机制。GPS 已开发并持续改进超过12年7,42,可用于预测给定肽序列中蛋白质的翻译后修饰残基43,44。此外,还提供适用于多种研究主题的工具,包括蛋白质亚细胞定位45和转录因子结合基序46的预测等。

10. 注释蛋白质-蛋白质相互作用及其富集的功能模块

  1. 将 String 网络服务器的网页链接复制并粘贴到网络浏览器中,打开该网络服务器的网页。在数据库 String47 中搜索基因 CD3D 和 P53,并查找它们的协调特性。也可使用另一个网络服务器 DAVID32 执行相同的操作。
    注意:除了上述针对单个基因的注释外,目前还有许多大规模生物信息学工具可用于研究一组基因的特性。最近一项研究表明,单独表现不佳的标志基因可能共同组成显著改善的基因集合5。因此,投入计算资源筛选更复杂的生物标志物是值得的。数据库 String 可视化已知或预测的相互作用连接,而 DAVID 服务器可检测查询基因中具有显著表型关联的功能模块47,32。此外,还有多种其他大规模生物信息学分析工具可供使用。

11. 导出生成的生物标志物子集及可视化图谱

  1. 将检测到的生物标志物子集导出为 .tsv 或 .csv 文本文件,以便进一步分析。点击所有检测到的生物标志物子集表格下方的 导出表格 按钮,并选择要保存的文本格式。
  2. 将可视化图表导出为图像文件。点击每个图表下方的 保存 按钮,并选择要保存的图像格式。
    注意:软件支持像素格式 .png 和矢量格式 .svg。像素图像适用于在计算机屏幕上显示,而矢量图像可转换为适用于期刊发表所需的任意分辨率。

访问受限。请登录或开始试用以查看此内容。

结果

本工作流程(图 6)的目标是检测多个具有相似效能的生物标志物子集,适用于二元分类数据集。整个过程通过两个示例数据集 ALL1 和 ALL2 进行说明,这些数据集提取自最近发表的一项生物标志物检测研究12,48。用户可按照补充材料中的说明安装 kSolutionVis。

数据集ALL1对95份B细胞和33份T细胞急性淋巴细胞白血病患者血液样本的12,625个转录组学特征进行了分析。而数据集ALL2则检测了65名治疗后复发的ALL患者和35名未复发ALL患者的12,625个转录组学特征的表达水平。为方便用户,该软件1.4版本中提供了这两个转录组数据集及其类别标签。两个数据集均位于软件源代码目录下的"data"子目录中。

访问受限。请登录或开始试用以查看此内容。

讨论

本研究提出了一种易于操作的多解生物标志物检测与表征方案,适用于用户指定的二分类数据集。该软件注重用户友好性,并提供针对多种文件格式的灵活导入/导出接口,使生物医学研究人员能够通过软件的图形用户界面(GUI)轻松分析其数据集。本研究还强调了生成多个建模性能相近的有效解的必要性,而这一点此前被许多现有的生物标志物检测算法所忽略。未来,新开发的生物标志物检测算法可通过记录所有具有足够建模性能的中间生物标志物子集,将此功能纳入其中。

在本方案中,步骤1和步骤5最为重要,因为该软件是一个完全自动化的系统,依赖于格式正确的输入文件。在测试过程中发现,数据矩阵与类别标签文件中的样本名称不匹配可能导致软件出错,此时软件将弹出关于此错误的警告对话框。因此,如果用户发现数据矩阵或类别标签文件中没有任何样本被加载,应通过以下故障排查技巧进行检查 是再次检查两个输入文件中的样本名称是否不一致。如果在三维散点图中未显示任何点,则可能是由于参数 pCutoff 高于最佳解决方案。此时,故障排除的技巧是降低分类性能评估指标的阈值(参数 pCutoff然而,对于较难的...

访问受限。请登录或开始试用以查看此内容。

披露

我们与本报告无任何利益冲突。

致谢

本工作得到了中国科学院战略性先导科技专项(XDB13040400)和吉林大学启动经费的支持。感谢匿名评审人和生物医学测试用户对提升kSolutionVis的可用性和功能所提出的建设性意见。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
硬件
笔记本电脑LenovoX1 carbon任何计算机均可使用。推荐最低配置:额外1GB硬盘空间、1GB内存、2.0MHz CPU
名称公司目录编号备注
软件
Python 3.0WingWareWing Personal任何支持 Python 3.0 或更高版本的编程与运行环境均可使用

参考文献

  1. Heckerman, D., et al. Genetic variants associated with physical performance and anthropometry in old age: a genome-wide association study in the ilSIRENTE cohort. Scientific Reports. 7, 15879(2017).
  2. Li, Z., et al. Genome-wide association analysis identifies 30 new susceptibility loci for schizophrenia. Nature Genetics. 49, 1576-1583 (2017).
  3. Winkler, T. W., et al. Quality control and conduct of genome-wide association meta-analyses. Nature Protocols. 9, 1192-1212 (2014).
  4. Harrison, R. N. S., et al. Development of multivariable models to predict change in Body Mass Index within a clinical trial population of psychotic individuals. Scientific Reports. 7, 14738(2017).
  5. Liu, J., et al. Multiple similarly-well solutions exist for biomedical feature selection and classification problems. Scientific Reports. 7, 12830(2017).
  6. Ye, Y., Zhang, R., Zheng, W., Liu, S., Zhou, F. RIFS: a randomly restarted incremental feature selection algorithm. Scientific Reports. 7, 13013(2017).
  7. Zhou, F. F., Xue, Y., Chen, G. L., Yao, X. GPS: a novel group-based phosphorylation predicting and scoring method. Biochemical and Biophysical Research Communications. 325, 1443-1448 (2004).
  8. Sanchez, B. N., Wu, M., Song, P. X., Wang, W. Study design in high-dimensional classification analysis. Biostatistics. 17, 722-736 (2016).
  9. Shujie, M. A., Carroll, R. J., Liang, H., Xu, S. Estimation and Inference in Generalized Additive Coefficient Models for Nonlinear Interactions with High-Dimensional Covariates. Annals of Statistics. 43, 2102-2131 (2015).
  10. Li, J. H., et al. MiR-205 as a promising biomarker in the diagnosis and prognosis of lung cancer. Oncotarget. 8, 91938-91949 (2017).
  11. Lyskjaer, I., Rasmussen, M. H., Andersen, C. L. Putting a brake on stress signaling: miR-625-3p as a biomarker for choice of therapy in colorectal cancer. Epigenomics. 8, 1449-1452 (2016).
  12. Ge, R., et al. McTwo: a two-step feature selection algorithm based on maximal information coefficient. BMC Bioinformatics. 17, 142(2016).
  13. Tumuluru, J. S., McCulloch, R. Application of Hybrid Genetic Algorithm Routine in Optimizing Food and Bioengineering Processes. Foods. 5, (2016).
  14. Gen, M., Cheng, R., Lin, L. Network models and optimization: Multiobjective genetic algorithm approach. , Springer Science & Business Media. (2008).
  15. Radovic, M., Ghalwash, M., Filipovic, N., Obradovic, Z. Minimum redundancy maximum relevance feature selection approach for temporal gene expression data. BMC Bioinformatics. 18, 9(2017).
  16. Ciuculete, D. M., et al. A methylome-wide mQTL analysis reveals associations of methylation sites with GAD1 and HDAC3 SNPs and a general psychiatric risk score. Translational Psychiatry. 7, e1002(2017).
  17. Lin, H., et al. Methylome-wide Association Study of Atrial Fibrillation in Framingham Heart Study. Scientific Reports. 7, 40377(2017).
  18. Wang, S., Li, J., Yuan, F., Huang, T., Cai, Y. D. Computational method for distinguishing lysine acetylation, sumoylation, and ubiquitination using the random forest algorithm with a feature selection procedure. combinatorial chemistry & high throughput screening. , (2017).
  19. Zhang, Q., et al. Predicting Citrullination Sites in Protein Sequences Using mRMR Method and Random Forest Algorithm. combinatorial chemistry & high throughput screening. 20, 164-173 (2017).
  20. Cuena-Lombrana, A., Fois, M., Fenu, G., Cogoni, D., Bacchetta, G. The impact of climatic variations on the reproductive success of Gentiana lutea L. in a Mediterranean mountain area. International journal of biometeorology. , (2018).
  21. Coghe, G., et al. Fatigue, as measured using the Modified Fatigue Impact Scale, is a predictor of processing speed improvement induced by exercise in patients with multiple sclerosis: data from a randomized controlled trial. Journal of Neurology. , (2018).
  22. Hong, H., et al. Applying genetic algorithms to set the optimal combination of forest fire related variables and model forest fire susceptibility based on data mining models. The case of Dayu County, China. Science of the Total Environment. 630, 1044-1056 (2018).
  23. Borges, D. L., et al. Photoanthropometric face iridial proportions for age estimation: An investigation using features selected via a joint mutual information criterion. Forensic Science International. 284, 9-14 (2018).
  24. Kohavi, R., John, G. H. Wrappers for feature subset selection. Artificial intelligence. 97, 273-324 (1997).
  25. Yu, L., Liu, H. Efficient feature selection via analysis of relevance and redundancy. Journal of machine learning research. 5, 1205-1224 (2004).
  26. Wexler, R. B., Martirez, J. M. P., Rappe, A. M. Chemical Pressure-Driven Enhancement of the Hydrogen Evolving Activity of Ni2P from Nonmetal Surface Doping Interpreted via Machine Learning. Journal of American Chemical Society. , (2018).
  27. Wijaya, S. H., Batubara, I., Nishioka, T., Altaf-Ul-Amin, M., Kanaya, S. Metabolomic Studies of Indonesian Jamu Medicines: Prediction of Jamu Efficacy and Identification of Important Metabolites. Molecular Informatics. 36, (2017).
  28. Shangkuan, W. C., et al. Risk analysis of colorectal cancer incidence by gene expression analysis. PeerJ. 5, e3003(2017).
  29. Chu, C. M., et al. Gene expression profiling of colorectal tumors and normal mucosa by microarrays meta-analysis using prediction analysis of microarray, artificial neural network, classification, and regression trees. Disease Markers. , 634123(2014).
  30. Fleuret, F. Fast binary feature selection with conditional mutual information. Journal of Machine Learning Research. 5, 1531-1555 (2004).
  31. Pacheco, J., Alfaro, E., Casado, S., Gámez, M., García, N. A GRASP method for building classification trees. Expert Systems with Applications. 39, 3241-3248 (2012).
  32. Jiao, X., et al. DAVID-WS: a stateful web service to facilitate gene/protein list analysis. Bioinformatics. 28, 1805-1806 (2012).
  33. Rappaport, N., et al. Rational confederation of genes and diseases: NGS interpretation via GeneCards, MalaCards and VarElect. Biomedical Engineering OnLine. 16, 72(2017).
  34. Rebhan, M., Chalifa-Caspi, V., Prilusky, J., Lancet, D. GeneCards: integrating information about genes, proteins and diseases. Trends in Genet. 13, 163(1997).
  35. Joosten, R. P., Long, F., Murshudov, G. N., Perrakis, A. The PDB_REDO server for macromolecular structure model optimization. IUCrJ. 1, 213-220 (2014).
  36. Maglott, D., Ostell, J., Pruitt, K. D., Tatusova, T. Entrez Gene: gene-centered information at NCBI. Nucleic Acids Research. 39, D52-D57 (2011).
  37. Amberger, J. S., Bocchini, C. A., Schiettecatte, F., Scott, A. F., Hamosh, A. OMIM.org: Online Mendelian Inheritance in Man (OMIM(R)), an online catalog of human genes and genetic disorders. Nucleic Acids Research. 43, D789-D798 (2015).
  38. Boutet, E., et al. the Manually Annotated Section of the UniProt KnowledgeBase: How to Use the Entry View. Methods in Molecular Biology. 1374, 23-54 (2016).
  39. Zerbino, D. R., et al. Ensembl 2018. Nucleic Acids Res. , (2017).
  40. McKusick, V. A., Amberger, J. S. The morbid anatomy of the human genome: chromosomal location of mutations causing disease. Journal of Medical Genetics. 30, 1-26 (1993).
  41. Finn, R. D., et al. The Pfam protein families database: towards a more sustainable future. Nucleic Acids Research. 44, D279-D285 (2016).
  42. Xue, Y., et al. GPS: a comprehensive www server for phosphorylation sites prediction. Nucleic Acids Research. 33, W184-W187 (2005).
  43. Deng, W., et al. GPS-PAIL: prediction of lysine acetyltransferase-specific modification sites from protein sequences. Scientific Reports. 6, 39787(2016).
  44. Zhao, Q., et al. GPS-SUMO: a tool for the prediction of sumoylation sites and SUMO-interaction motifs. Nucleic Acids Research. 42, W325-W330 (2014).
  45. Wan, S., Duan, Y., Zou, Q. HPSLPred: An Ensemble Multi-Label Classifier for Human Protein Subcellular Location Prediction with Imbalanced Source. Proteomics. 17, (2017).
  46. Zhang, H., Zhu, L., Huang, D. S. WSMD: weakly-supervised motif discovery in transcription factor ChIP-seq data. Scientific Reports. 7, 3217(2017).
  47. Szklarczyk, D., et al. STRING v10: protein-protein interaction networks, integrated over the tree of life. Nucleic Acids Research. 43, D447-D452 (2015).
  48. Chiaretti, S., et al. Gene expression profile of adult T-cell acute lymphocytic leukemia identifies distinct subsets of patients with different response to therapy and survival. Blood. 103, 2771-2778 (2004).
  49. Rowley, J. D., et al. Mapping chromosome band 11q23 in human acute leukemia with biotinylated probes: identification of 11q23 translocation breakpoints with a yeast artificial chromosome. Proceedings of the National Academy of Sciences of the United States of America. 87, 9358-9362 (1990).
  50. Rabbitts, T. H., et al. The chromosomal location of T-cell receptor genes and a T cell rearranging gene: possible correlation with specific translocations in human T cell leukaemia. Embo Journal. 4, 1461-1465 (1985).
  51. Yin, L., et al. SH2D1A mutation analysis for diagnosis of XLP in typical and atypical patients. Human Genetics. 105, 501-505 (1999).
  52. Brandau, O., et al. Epstein-Barr virus-negative boys with non-Hodgkin lymphoma are mutated in the SH2D1A gene, as are patients with X-linked lymphoproliferative disease (XLP). Human Molecular Genetics. 8, 2407-2413 (1999).
  53. Burnett, R. C., Thirman, M. J., Rowley, J. D., Diaz, M. O. Molecular analysis of the T-cell acute lymphoblastic leukemia-associated t(1;7)(p34;q34) that fuses LCK and TCRB. Blood. 84, 1232-1236 (1994).
  54. Taylor, G. M., et al. Genetic susceptibility to childhood common acute lymphoblastic leukaemia is associated with polymorphic peptide-binding pocket profiles in HLA-DPB1*0201. Human Molecular Genetics. 11, 1585-1597 (2002).
  55. Wadia, P. P., et al. Antibodies specifically target AML antigen NuSAP1 after allogeneic bone marrow transplantation. Blood. 115, 2077-2087 (2010).
  56. Wilson, D. M., et al. 3rd et al. Hex1: a new human Rad2 nuclease family member with homology to yeast exonuclease 1. Nucleic Acids Research. 26, 3762-3768 (1998).
  57. O'Sullivan, R. J., et al. Rapid induction of alternative lengthening of telomeres by depletion of the histone chaperone ASF1. Nature Structural & Molecular Biology. 21, 167-174 (2014).
  58. Lee-Sherick, A. B., et al. Aberrant Mer receptor tyrosine kinase expression contributes to leukemogenesis in acute myeloid leukemia. Oncogene. 32, 5359-5368 (2013).
  59. Guyon, I., Elisseeff, A. An introduction to variable and feature selection. Journal of machine learning research. 3, 1157-1182 (2003).
  60. John, G. H., Kohavi, R., Pfleger, K. Machine learning: proceedings of the eleventh international conference. , 121-129 (1994).
  61. Jain, A., Zongker, D. Feature selection: Evaluation, application, and small sample performance. IEEE transactions on pattern analysis and machine intelligence. 19, 153-158 (1997).
  62. Taylor, S. L., Kim, K. A jackknife and voting classifier approach to feature selection and classification. Cancer Informatics. 10, 133-147 (2011).
  63. Andresen, K., et al. Novel target genes and a valid biomarker panel identified for cholangiocarcinoma. Epigenetics. 7, 1249-1257 (2012).
  64. Guo, P., et al. Gene expression profile based classification models of psoriasis. Genomics. 103, 48-55 (2014).
  65. Xie, J., Wang, C. Using support vector machines with a novel hybrid feature selection method for diagnosis of erythemato-squamous diseases. Expert Systems with Applications. 38, 5809-5815 (2011).
  66. Zou, Q., Zeng, J., Cao, L., Ji, R. A novel features ranking metric with application to scalable visual and bioinformatics data classification. Neurocomputing. 173, 346-354 (2016).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

生物标志物检测特征子集选择性能评估图形用户界面数据准备参数调优结果可视化基因注释可视化导出