2018年10月11日
现有的算法为生物标志物检测数据集生成单一解决方案。本方案展示了存在多个效果相似的解决方案,并提供了一款用户友好的软件,以帮助生物医学研究人员针对所提出的挑战深入分析其数据集。计算机科学家也可在其生物标志物检测算法中集成此项功能。
该方法有助于回答生物医学检测领域中关于生成多个解决方案的关键问题。该技术的主要优势在于提供了一个用户友好的图形界面,以协助生物医学研究人员进行多特征子集的检测。首先将数据矩阵和类别标签加载到软件中。
单击“加载数据矩阵”以选择用户指定的数据矩阵文件,并单击“加载类别标签”以选择相应的类别标签文件。为确定在排名靠前的特征数量中的类别标签,请在相应的下拉框中选择正类和负类的名称,并在“前 X 个”下拉框中选择 10 作为排名靠前的特征数量,以全面筛查特征子集。为针对不同性能调优系统参数,请在所选极限学习机分类器的“准确率平衡准确率”下拉框中选择性能度量指标为“准确率”。
然后,在性能阈值输入框中为指定的性能度量选择 0.7 的截断值。要运行该流程,请单击“分析”并选择 0.7 作为性能度量截断值的默认值,以及 10 作为最优特征子集的默认数量。
然后收集并解读软件检测到的特征。要生成软件检测到的分类性能最优的子集中排名前10位特征的三维散点图,请点击“analyze”,并将特征子集中的三个特征按照其排名升序排列,以这三个特征的排名作为F1、F2和F3轴。将性能阈值更改为0.7,然后点击“analyze”,以生成性能测量值大于或等于该阈值的特征子集的三维散点图。
然后点击 3D tuning 以打开一个新窗口,手动调整 3D 散点图的观察角度,并点击 reduce 以减少所检测特征子集的冗余性。要在 DNA 和蛋白质序列水平上对基因进行注释,打开 David 数据库网页,点击基因 ID 转换链接,输入已准备数据集中第一个生物标志物子集的特征 ID。点击基因列表链接,然后点击提交列表以获取感兴趣的注释信息,并显示基因列表以获得基因符号列表。
接下来,打开 GeneCards 数据库网页,将目标基因的名称输入数据库查询输入框,以查找该基因的注释信息。打开在线人类孟德尔遗传数据库(Online Mendelian Inheritance in Man),搜索该基因以获取该数据库中该基因的注释信息。为注释其编码的蛋白质,打开 UniProt 知识库数据库页面,并在此数据库中搜索该基因的注释信息。
打开基于组的预测系统(GPS网络服务器),从UniProt知识库数据库中检索生物标志物基因编码的蛋白质序列,并使用在线GPS工具预测蛋白质的翻译后修饰位点。为了注释蛋白质-蛋白质相互作用及其富集的功能模块,请打开STRING网络服务器页面,利用STRING数据库搜索目标基因,以发现它们的协同特性。如需导出检测到的生物标志物子集以进行进一步分析,请点击“导出表格”并选择合适的文本格式保存文件。
然后,将可视化图表分别导出为独立的图像文件,单击每个图表下方的“保存”按钮,并选择适当的图像格式来保存每个文件。在此代表性实验中,两个数据集被格式化为 CSV 文件,并按演示方式加载到软件中。在第一个数据集中,加载了包含 12,625 个特征和各自类别标签的 128 个样本,最终的数据矩阵包含 95 个阴性样本和 33 个阳性样本。
对第二个较难的数据集也进行了类似的分析操作。在特征名称中搜索用户自定义的关键词,可显示每个数据集中特征的直方图。在对每个数据集执行流程算法后,共检测到120个符合条件的生物标志物子集,其中在易于区分的数据集中,有57个三联生物标志物子集表现出100%的准确率。
然而,对于这个较难的数据集,仅检测到76个生物标志物子集。并且,由于生物标志物子集的准确性较低,提示生物标志物具有表型特异性,这是生物标志物检测中的另一个主要挑战。在使用此流程时,重要的是要认识到未来的筛选问题可能存在多个解决方案。
阅读SIM的最佳性能表现。该技术开发后,为 biomedical 研究人员探索具有多种解决方案的生物医学检测铺平了道路。
查看完整文字稿并访问数千部科学视频
本方案展示了生物标志物检测数据集存在多种有效的解决方案。它提供了一个用户友好的软件界面,以协助生物医学研究人员开展研究工作。
生物标志物检测通常仅产生一个经过优化的解决方案,可能忽略了其他具有相似预测性能的替代子集。本方案表明,多个生物标志物子集均可实现同样有效的二分类,有助于生成更可靠的假设,并减少对单一且可能存在偏倚的标志物的依赖。通过识别多种有效的解决方案,研发团队可在发现早期获得更充分的靶点验证信心和机制层面的风险评估。
该方法可整合到早期发现工作流程中,通过定量检测和可视化生物标志物亚群,支持假设验证和先导化合物的鉴定。