2011年1月2日
可视化分析(VA)是一种交互式数据分析的新方法。本视频中,我们讨论了高通量生物实验带来的数据过载问题,并提出将可视化分析作为解决该问题的方案。视频展示了使用一种名为 Tableau 的可视化分析工具对免疫学数据集内部及数据集之间进行分析的过程。
利用可视化分析技术促进免疫学数据的分析。尽管数据的采集和存储能力已迅速发展,但数据的处理与分析能力相比之下进展甚微。因此,大量数据集常存在于生物医学实验室中,却未能得到有效的分析或高效的利用。
然而,这些潜在的丰富而强大的信息却可能在存储系统的深渊中丢失。可视化分析(Visual Analytics,简称 VA)作为一种分析大型复杂数据集的新方法应运而生。VA 技术基于可视化手段,使分析人员能够利用自身的视觉智能来识别数据中的模式,例如总体趋势或异常值。
这些快速可视化方法可在探索数据时迅速形成假设。可视化分析(VA)工具的灵活性使分析人员能够在探索数据间关系的同时,进行放大、深入挖掘,并在多个数据集之间建立关联。通过将可视化分析应用于整合的数据源,用户可以揭示出新的重要发现。
亲本分析是一种可视化分析方法,在该方法中,可视化分析工具专家与技术专家(也称为领域专家)共同协作,由领域专家针对数据提出具有生物学意义的问题。随后,可视化分析工具专家创建相应的可视化图形,以帮助揭示有助于回答该问题或引导进一步探索的数据模式。该过程可反复迭代,以构建不同的可视化形式,从而获得更深入的洞察。
我们着手检验成对分析可视化分析方法在大型复杂生物医学数据集中的适用性。在初步的预实验中,我们评估了当前问题所涉及的多种现有可视化分析工具。最终选择 Tableau 软件开发的 Tableau 作为最适合该任务的工具。
这些初步实验中的选择标准基于主观参数,如易用性和整体可用性,以及客观技术特征,如多种交互技术和可视化功能。我们在此拥有一个典型的传染病研究实验室所使用的 Microsoft Excel 电子表格形式的数据集。该数据集包含受试者标识符以及遗传 DNA 序列变异的相关数据。
在此案例中,我们关注的是受试者的 NF kappa BIA 单核苷酸多态性(SNPs),以及在特定刺激激活受试者免疫细胞后,免疫细胞所产生的多种生物分子(此处为细胞因子)的观测浓度。现在,我们将向下滚动至电子表格。为了使您了解该数据集的规模,我们的目标是探究基因型——即本例中 NF Kappa BIA 基因的不同 SNP 位点——与所观察到的细胞因子反应之间是否存在普遍关联。
刺激后,我们现在将数据集连接到 Tableau,并确保导入 NF kappa BIA 表。您可以在左侧看到,Tableau 已连接到正确的表,并自动将列变量分为 Tableau 所称的“维度”和“度量”。“维度”仅指对数据进行分类的列,而“度量”则指该列中的定量数值。
为了进行此可视化分析,我们现在将刺激物浓度水平与观察到的细胞因子反应浓度进行绘图。接下来,我们对细胞因子浓度水平的数值进行平均。浓度水平的顺序有误,但可以很容易地快速重新排序。
然后我们可以切换视图以适应屏幕,从而更方便地观察数据。由于我们希望研究如何区分不同基因型,只需将基因型维度拖放到此颜色区域即可。可视化结果将自动并立即按基因型进行分离。
现在,我们可以尝试不同的显示格式。例如,折线图可能更有利于揭示我们希望捕捉的模式。显然,还有许多其他选项。
成对分析中的生物学家建议,我们首先探索在使用名为 3M oh oh two 的试剂刺激后,一种称为 QNF alpha 的细胞因子标志物的产生关系。为此,我们需要筛选标志物维度 TNF alpha 和刺激物维度 3M oh oh two。为了使筛选过程更加灵活,我们可以为标志物和刺激物维度均选择“显示快速筛选”选项,并确保其为单值列表。
该可视化结果清晰地展示了不同基因型(以不同颜色区分)在三种 MOI的 oh two 刺激水平下,TNF-α 产生的差异。我们可以选择其他任意的标记物和刺激参数组合,可视化结果将相应改变。类似于 Excel,我们可以在不同的选项卡中构建不同的可视化图表。为了展示目的,我们还可以生成多个分析结果的汇总视图。
在此案例中,我们研究了具有不同 NF Kappa BIAS snip 基因型的多个受试者中 TNF Alpha 的产生情况。在本演示中,我们采用配对分析 VA 方法,成功在约 1 分 30 秒内生成了一系列强有力的可视化结果。而通常情况下,生物医学研究人员在 Excel 中生成类似的一组可视化结果需要 30 分钟。
之前的示例是一个简单的二维分析。VA 的真正强大之处在于能够同时可视化多个维度。例如,Tableau 支持通过关键值的逻辑连接对数据集之间进行分析。
以下是位于同一工作簿中的两个电子表格。第一个数据集来自之前的演示示例,另一个数据集则是通过流式细胞术分析单个细胞同时产生多种细胞因子的结果。同时,还包含一个称为多能性程度(poly functionality degree 或 PFD)的指标。您可为工作表命名,以便在导入阶段更易于识别。
这使得 Tableau 能够连接两个电子表格。选择多表选项后,您可以使用“添加新表”功能来合并这两个表格。该功能会将第二个电子表格添加到第一个中,并利用连接语句通过相同的键(如细胞类型、浓度水平阶段、分组刺激和受试者标识符)来整合数据集。
请注意,维度按电子表格名称分隔。这使我们能够使用未包含在逻辑联合语句中的维度。例如,多能性的定义是指产生一种以上细胞因子的细胞所占的百分比。
例如,一个细胞产生两种细胞因子,其多因子分泌能力(PFD)为2;另一个细胞产生三种细胞因子,其PFD为3。在此,我们创建一个计算字段,将这些值合并为一个可用于可视化展示的综合指标。现在,我们可以开始构建可视化图表。
首先,我们将细胞因子水平的浓度与光子通量密度(PFD)在两个及以上数值之间进行绘图,并像上一个示例一样,取PFD大于二的平均值。我们还通过手动设置将浓度标签按从低到高的顺序排列。由于该组中仅部分样本具有基因型信息,因此需要过滤掉不含基因型信息的数据行。
与之前一样,我们可以快速将基因型信息添加到颜色标签中,从而也能区分不同的基因型。然后我们可以调整视图以适应屏幕,便于更直观地观察数据。我们还可以修改柱状图的显示方式。
例如,展示该结果的折线图可以很好地反映不同基因型特有模式下CYT反应与PFP反应的变化情况。您会立即注意到,具有GG基因型的NF kappa b SNP与其他基因型相比表现出不同的反应模式。我们可以通过进一步研究不同刺激因素对该模式的影响来深入探讨这一现象。
请注意,在刺激维度中加入LPS后,三种主要基因型在所有浓度下均表现出相似的PFD水平;但仅在3M MO oh two刺激条件下,GG基因型在刺激物低浓度到高浓度之间表现出PFD的显著上升。该发现使我们能够提出一个假设,供后续实验验证,即刺激类型会影响PFD。在最后两个示例中,我们观察到可快速生成可视化结果,以检测数据集内部及数据集之间可能存在的有意义模式。
可视化分析的强大功能可以迅速扩展到大规模数据集,根据具体应用需求提升分析的维度,并整合来自海量数据集的信息。例如,在队列研究中产生了众多孤立的数据存储,可视化分析(VA)是一种高度可迁移的方法,有可能应用于任何包含大量不同类型数据的领域,包括分类数据和数值型数据集。VA 方法具有两个主要优势。
其一,灵活的假设生成。用户可根据当前发现即时生成关于数据的假设,并快速创建新的可视化结果以探索该假设,从而节省时间。UVA 工具相较于传统信息可视化工具的主要优势在于其可用性和高效性。
使用传统方法进行绘图通常需要耗费数个工作日才能完成的任务,利用 Tableau 等可视化分析(VA)平台仅需两到三个小时即可轻松实现。显然,目前存在并且未来还可能出现其他各类应用平台,每种平台都具有各自特定的优缺点。采用并行分析(para analysis)方法来处理此类任务,显然进一步增强了基于可视化分析方法在复杂多维数据分析中的整体优势。
查看完整文字稿并访问数千部科学视频
本视频探讨了分析大规模免疫学数据集所面临的挑战,并介绍了可视化分析(VA)作为一种解决方案。VA 技术利用可视化手段帮助分析人员识别复杂数据中的模式和趋势。
可视化分析(VA)通过实现对复杂、多维数据集的快速交互式探索,应对免疫学数据过载日益增长的挑战。该方法可加速假设的生成与验证,缩短早期发现工作流程中的洞察时间。通过将领域专业知识与可视化分析工具的熟练应用相结合,生物制药团队能够提高靶点验证的可信度,并优先选择具有更高预测价值的候选分子。
VA 方法可融入从早期靶点验证到先导化合物鉴定的整个发现流程,通过生成可直接用于假设分析且具有直观可解释性的数据集,实现向临床前评估的无缝过渡。