来自多种成像技术的三维数据分割是分析复杂生物系统的主要瓶颈。本文中,我们以冷冻电子断层扫描、冷冻软X射线断层扫描和相衬X射线断层扫描技术的示例数据集为例,介绍如何利用SuRVoS Workbench在不同长度尺度上对体数据进行半自动分割。
来自多种成像技术的三维数据分割是分析复杂生物系统的主要瓶颈。本文中,我们以冷冻电子断层扫描、冷冻软X射线断层扫描和相衬X射线断层扫描技术的示例数据集为例,介绍如何利用SuRVoS Workbench在不同长度尺度上对体数据进行半自动分割。
分割是指在成像体积中分离出特定区域或对象,以便对这些感兴趣区域进行进一步研究。在分析复杂的生物系统时,对三维图像数据进行分割是一项耗时且劳动密集型的工作。随着多种成像模态的普及以及自动化数据采集方案的发展,现代实验生物学家面临从数据向知识转化的更大挑战。本文介绍 SuRVoS Workbench 的使用方法,该程序旨在通过提供半自动分割复杂生物体数据的方法来解决上述问题。本文展示了三种不同放大倍数和成像模态的数据集,每种数据集突出了使用 SuRVoS 进行分割的不同策略。利用植物子实体的相衬X射线断层扫描(microCT)数据演示了基于模型训练的分割方法;利用人血小板的冷冻电子断层扫描(cryoET)数据演示了基于超体素(super-voxels)和巨体素(megavoxels)的分割方法;利用哺乳动物细胞系的冷冻软X射线断层扫描(cryoSXT)数据演示了标签分割工具的使用。同时提供了针对每种数据类型的策略与参数设置。SuRVoS 将多种半自动处理流程整合到一个交互式工具中,带来了多项优势。与许多图像处理领域常用的全手动分割方法相比,分割体数据的总时间可减少五倍。当完全手动分割可能需要数周工作时,这一效率提升具有重要意义。此外,通过采用计算识别的边界,并根据对象的计算属性而非逐个案例地拆分复杂对象集合,有效降低了人为主观性的影响。
SuRVoS 工作台是一款软件,旨在帮助研究人员从各种样本的体数据中提取科学上相关的信息,而无论其感兴趣的结构、分辨率或成像方式如何1,2。此类体数据通常通过X射线或电子断层扫描系统采集,由于系统复杂,这些设备通常位于大型实验室或集中式设施中。这两种方法以及其他技术所产生的数据集通常体量庞大且信息丰富,使用半自动方法或手动方式进行分割均具有挑战性。特别是接近天然状态的冷冻固定样本数据集,需在低剂量成像条件下获取,导致信噪比较低、对比度较差,尤其是在冷冻电子断层扫描(cryoET)中表现更为明显3,4,5。此外,某些三维数据集中还存在由实验条件困难所引入的伪影,例如由于倾斜角度范围有限而导致的缺失楔形伪影,从而造成信息缺失以及沿电子束方向的拉伸现象3,4,5。即使在信噪比低或缺失楔形伪影不显著的情况下(例如聚焦离子束扫描电镜6或连续块面扫描电镜7),样本本身的复杂性和三维特性,以及庞大的数据量,仍使得数据分析需要借助自动化的数据分割流程以提高效率和准确性。
目前,在分析细胞的生物体积时,有许多方法可自动或半自动地识别特定的细胞结构,例如使用基于模板的搜索来识别肌动蛋白、微管或特定蛋白质复合物,或在特定类型的数据集中识别这些结构例如 高对比度、染色、树脂包埋样品8,9,10,11,12。然而,在这些情况下 先验的 信息或特定的样品制备方案是必需的,这限制了这些分割策略的广泛应用。此外,还有一些工具可在体素水平上进行模型训练,当提供用户输入时,能够学习各种目标结构的形态特征。13然而,在这一层面上,模型的训练与测试过程较为复杂,容易出错且计算成本高昂。鉴于成像条件的挑战性,以及缺乏广泛适用的半自动分割策略,即使在处理复杂的生物材料时,手动分割仍十分常见。14,15,16,17然而,普遍认为手动分割过程不仅耗时,而且容易出错、具有主观性且结果不稳定4,5,18,19,20某些分割程序提供了可简化手动分割过程的工具(即 插值、套索或吹气工具21,22然而,在数据集噪声较大的情况下,这些方法难以成功应用,即使能够成功应用,该过程仍然具有主观性和变异性。
传统上,图像分割以两种截然不同的方式被使用:定性或定量。随着成像技术和分割策略的进步,将分割作为定量工具来回答生物学问题,并作为算法开发的"金标准"的做法已越来越普遍8,12,15,23,24,25。为此,必须进行详细的核查与制衡,以降低整个过程中的变异性与主观性26。然而,这些预防措施进一步增加了分割过程的耗时性。因此,提供一种更快速且变异性更小的分割策略至关重要。
SuRVoS 工作台通过向用户提供一系列机器学习和图像处理工具,帮助用户完成分割过程,同时引导用户完成必要步骤,从而开始解决上述问题。为实现这一目标,SuRVoS 将两项关键技术革新结合在一起。首先,它采用超区域层级结构,根据数据固有属性将相似且邻近的区域进行分组。该层级结构中的每个区域均以更少的元素表示相同体积的数据,同时仍保持对边界的高精度贴合。因此,超区域可将体数据分割的复杂性降低数个数量级,同时在不显著损失信息的前提下准确表征数据27。其次,SuRVoS 提供一种半自动分割策略,该策略仅需极少的手动分割输入即可训练分类器,随后利用该分类器对剩余体数据进行分割28,29。该策略减少了人工分割的工作量,显著降低了用户在分割任务上所需的时间;当结合使用超区域时,还可避免对边界的逐一手动勾画,从而可能降低分割结果的变异性与主观性。
SuRVoS 的另一个关键特性是标签分割工具,用户可利用该工具根据已分割对象的固有属性对其进行分类。在完成对各类感兴趣对象的分割后,可使用此工具依据平均对象强度、方差、大小、位置等参数将对象集合划分为不同的子类。 等等。 这对于分类具有高度复杂性的大量对象非常有用。例如,可将一组细胞器分为线粒体、空泡、脂滴等;或根据大小或形状对一组材料包涵体进行分离。分割完成后,可利用任意数量的分类器将各个标签进一步划分为不同组别,从而降低识别偏差。
SuRVoS 工作台已成功用于分割多种成像技术的数据。本文中,利用植物子实体的同步辐射X射线相位衬度断层扫描(microCT)数据,演示基于模型训练的分割方法;利用人血小板的冷冻电子断层扫描(cryoET)数据,演示基于超体素和巨体素的分割方法;利用哺乳动物细胞系的冷冻软X射线断层扫描(cryoSXT)数据,演示标签分割工具的使用。
注意:每个处理步骤的参数通常适用的范围以及此处所示每种数据类型的具体参数见表1。
1. 准备工作区并加载数据
2. 预处理与数据表示
3. 生成合适的超区域
4. 注释简介
5. 利用模型训练进行分割,并以微计算机断层扫描数据集演示。
注意:对于许多数据集而言,首次分割的目的是区分多个较大的区域。例如,将细胞核与细胞质分开,或将细胞与外部的冰层和支持结构分离。对于此类具有清晰边界和较大区域的分割,模型训练非常有用。为演示这一点,将使用牛筋草的X射线相衬断层扫描数据。
6. 使用超区域进行分割,以冷冻电子断层扫描数据集为例演示。
注意:由于超区域分割适用于较小且边界分明的区域,此处的重点是分割该数据集中的细胞器和微管。采用模型训练快速分割血小板与背景中的冰和碳;这些参数不再进一步讨论,但已在表1中列出。
7. 基于内在特征对数据对象进行分类与分析——以冷冻软X射线断层成像数据集为例
注意:通常情况下,分割后的下一步是对数据进行分析。SuRVoS 中的标签拆分工具可根据对象的内在特征(如对象的平均强度、方差、体积或位置)对已分割的对象进行分类。标签统计工具则可用于可视化每个新对象类别之间这些度量指标之间的关系。这些是分割完成后分析复杂三维数据集的强大新工具。
8. 导出数据与分割结果
采用三种不同技术(microCT、cryoET 和 cryoSXT)获取的三个体数据集,用于展示 SuRVoS Workbench 的三个重要功能:模型训练、超区域分割和标签拆分。这些数据集代表了多样化的实验结果,每个数据集均提供了完整的处理参数(表 1)。
为了演示使用SuRVoS Workbench进行模型训练,选择了一个具有较明显对比度且区域边界清晰的数据集。该数据集为果实的 猪殃殃,或称牛筋草,使用位于英国牛津郡奇尔顿时钻石光源(Diamond Light Source)的I13-2 Diamond-Manchester成像光束线上的X射线相位衬度断层扫描技术进行采集。新鲜样品在空气中固定于旋转台上的测角仪底座,样品与探测器之间的距离为30 mm。采用平均能量约为22 keV的粉红光束谱,曝光时间为0.10 s。通过旋转样品采集投影图像 180° 步长为 0.1°采用Savu进行断层扫描重建30,31 使用Paganin滤波器处理基于传播的相位衬度图像32 随后在ASTRA工具箱中进行滤波反投影重建33,34然后通过2 x 2 x 2像素合并对数据进行降采样,以减小文件大小,再输入至SuRVoS Workbench中。
首先,对输入数据(图3A)进行滤波和钳制处理(以去除数据中的高、低强度值)(图3B)。通过该方法,背景与前景更易于区分,同时突出了果实内部结构的纹理特征。接下来,在滤波后的数据集基础上构建超体素(图3C)。为评估超体素的质量,将其在无原始数据背景下显示,以验证超体素是否准确表征了数据集中的关键细节(图3D)。随后,基于超体素在该数据体的三个切片上进行人工标注,作为训练数据(图3E,深色区域)。该训练数据足以训练分类器,以预测对应于背景(绿色)、果刺(红色)、种子物质(紫色)和周围果肉(蓝色)的区域(浅色区域)。采用形态学优化方法对分割结果进行清理,包括填充孔洞以及根据需要进行扩张或收缩(图3F)。确定合适参数并完成该数据集分割的总耗时为2小时。
为了演示使用 SuRVoS Workbench 进行超区域分割,选择了一个噪声较多且复杂的數據集15。该数据集是在美国德克萨斯州休斯顿市贝勒医学院大分子成像国家中心利用冷冻电子断层扫描技术(cryoET)采集的。简而言之,将血小板在辉光放电处理并涂有金标记物的穿孔碳膜透射电镜载网上进行急速冷冻。倾斜系列图像以2°为增量,从±65°范围内采集。随后,使用 IMOD 软件中的加权反投影法对倾斜系列图像进行重构35。
将数据载入 SuRVoS 后(图 4A),选择一个感兴趣区域并应用适当的滤波器组合。本实验中,先使用平滑高斯滤波器,再结合对比度钳制的全变分滤波器,以增强数据的边缘和纹理特征(图 4B)。接着,通过基于超体素的最少用户输入进行模型训练,将血小板与背景中的冰和碳分离。随后,利用兆体素和超体素进行半手动分割,以分割细胞器。最后,将超体素的源参数更改为较弱的去噪滤波器,并减小超体素的形状尺寸(见 表 1),以便更好地保留微管边界用于分割(图 4C)。对于细胞器和微管,每隔 5–10 个切片进行快速的手动标注,以选择描述目标特征的超体素(图 4D 和 4E)。确定合适参数并完成所示感兴趣区域分割的总耗时为 6 小时。
为了演示使用 SuRVoS Workbench 进行标签分割,选择了一个包含多种细胞器的复杂数据集。该数据集是在英国牛津郡迪奇勒的钻石光源(Diamond Light Source)B24 光束线上利用低温软X射线断层成像技术(cryoSXT)采集的36。简而言之,将 HEK293 细胞培养在带有金标记的网格上,添加适当尺寸的金标记物,并使用带有背侧 blotting 的冷冻电镜进行快速冷冻。随后,在显微镜上以 ±65° 范围、0.5° 步长采集倾斜系列图像。倾斜系列图像随后在 IMOD 软件中通过加权反投影法进行重构35。
将数据载入 SuRVoS 后(图 5A),选择一个感兴趣区域,并应用适当的全变分滤波器,以增强整个体数据中细胞器的边界(图 5B)。接着,使用 mega体素(megavoxels)和 super体素(supervoxels)对细胞器进行半手动分割,随后通过填充空洞、闭合和膨胀操作优化分割结果,以平滑边缘(图 5C)。确定合适参数并完成所示感兴趣区域的分割总共耗时 4 小时。分割完成后,使用标签分离器(Label Splitter)将每个细胞器作为独立对象在数据集中进行可视化,并在数据图中显示各对象的多种特征(图 5D 和 图 5E)。标签分离器界面具有交互性,可在可视化视图和数据图中同步更新每个新标签类别的对应颜色。这使得用户能够基于数据中固有的特征创建多种分类规则,从而将对象划分为具有实际意义的类别(图 5F)。

图1. SuRVoS工作台的布局与总体特征。
图形用户界面(GUI)位于左侧,可视化面板位于右侧。这两个区域之间由一列工具和快捷方式分隔。GUI 的布局引导用户完成数据预处理的主要步骤,包括选择超体素和/或巨体素参数、对数据进行分割,以及在需要时使用模型训练,最后导出分割结果。可视化面板可在三种模式下使用:基本可视化与分割模式,用于查看数据及应用的任何滤波器并对数据进行分割;标签拆分模式,用于根据数据固有的特征将对象分类为新的标签;以及标签统计模式,用于测量和可视化已分割对象的特征。对于每种模式,左上角的下拉菜单控制显示的数据内容,顶部的滑块控制 z 轴位置。工具快捷方式提供了对可视化面板中对比度、图层透明度、缩放、平移以及返回“初始视图”的便捷控制,并可打开用于注释的工具,具体操作如实验方案所述。请点击此处查看该图的放大版本。

图 2. 超区域层级结构降低图像分割的复杂性。
采用伯克利分割数据集(BSDS50037)中的一幅图像来展示超区域的特性及其效果。原始图像(左)由数千个体素组成,随后被聚合成相邻且相似的组,形成数百个超体素(中)。超体素也可进一步聚合成相邻且相似的组,形成数十个兆体素(右)。每一次聚合都降低了分割任务的复杂性,无论是对计算资源还是人工处理而言均是如此。需要注意的是,此处展示的是一个二维示例,但实际上超体素和兆体素均为三维结构。请点击此处查看该图的放大版本。

图 3. 使用模型训练分割策略处理微计算机断层扫描(microCT)数据集。
A. 原始数据的一个二维切片。B. 对原始数据应用钳位全变差滤波器,增强了子实体各部分之间的边界。C. 选择了合适的超体素参数。D. 显示感兴趣区域(红色框,位于C中),以证明数据的边界已存在于超体素内部。E. 体积中的三个切片,其中数据集中不同区域的手动标注以深色显示(绿色、红色、蓝色和紫色),模型训练后的预测结果以对应浅色显示。F. 相同的三个切片,在接受模型训练的预测结果后得到的最终分割结果。比例尺为 1 mm。请点击此处查看该图的放大版本。

图 4. 使用超区域分割策略处理冷冻电子断层扫描数据集。
A. 原始数据的一个二维切片。B. �感兴区域(红色框,位于A中),应用了分层滤波器以增强细胞器边界的可见性。C. 使用超区域对细胞器进行标注的示例。左侧显示单个细胞器及其叠加的手动用户标注(黑色),右侧显示根据该标注选中的超体素(蓝色)。D. 使用超区域对微管进行标注的示例。左侧显示一段微管及其手动用户标注(黑色),右侧显示根据该标注选中的超体素(绿色)。E. 最终分割结果,其中血小板通过模型训练从背景中分割出来(详见表1),而各种细胞器和微管则采用超区域分割策略进行分割。颜色在此处不代表特定类型的细胞器,因尚未进行分类。A、B和E中的比例尺为1 μm,C和D中的比例尺为0.5 μm。 请点击此处查看该图的放大版本。

图5. 使用标签分割工具分析冷冻软X射线断层成像数据集
A. 原始数据的一个二维切片。 B. 应用全变差滤波以增强细胞器对比度的关注区域(A 中的红色框)。 C. 叠加超体素的最终分割结果。 D. 标签分割器的可视化部分,其中细胞器根据显示的规则进行分类 F. E. 标签分割器的绘图部分,显示每个对象内部的平均强度,并展示相应的规则 F 应用。x轴上的每条垂直线代表一个单独的对象,并以颜色编码以匹配其被分配的类别。 F. 基于固有属性分离不同对象的分类规则示例。比例尺为 1 μm. 请点击此处以查看此图的放大版本。
| 名称 / 数据集 | 来源 | P1 | P2 | P3 | P4 |
| 高斯滤波器 | Sigma | ||||
| 范围 / 默认值 | - | [0.5, 10] / 1 | |||
| (G1) cryoET | 原始数据 | 1 | |||
| (G2) cryoET | 原始数据 | 2 | |||
| 全变分 | Lambda | Spacing | # Iter | Clamp | |
| 范围 / 默认值 | - | [0.1, 30] / 10 | [0.1, 10] / 1 | [50, 500] / 100 | - |
| (TV1) microCT | 原始数据 | 10 | 1 | 100 | (1, -) |
| (TV2) cryoET | G1 | 7 | 1 | 200 | - |
| (TV3) cryoET | G2 | 10 | 1 | 100 | - |
| (TV4) cryoSXR | 原始数据 | 7 | 1 | 100 | - |
| 阈值分割 | Vmin | Vmax | |||
| 范围 / 默认值 | |||||
| (TH1) cryoET | TV3 | 0 | - | ||
| 高斯中心化 | Sigma | ||||
| 范围 / 默认值 | - | [0.5, 10] / 2 | |||
| (GC1) microCT | TV1 | 2 | |||
| 高斯归一化 | Sigma | ||||
| 范围 / 默认值 | - | [0.5, 10] /2 | |||
| (GN1) microCT | TV1 | 2 | |||
| 高斯拉普拉斯算子 | Sigma | Thresh | Response | ||
| 范围 / 默认值 | - | [0.5, 10] / 2 | [Yes/No] / No | [Bright/Dark] / Bright | |
| (LG1) microCT | TV1 | 2 | No | Bright | |
| 高斯差分 | Sigma Init | Sigma Ratio | |||
| 范围 / 默认值 | - | [0.5, 10] / 2 | [1.1, 3] / 1.6 | ||
| (DG1) microCT | TV1 | 2 | 1.6 | ||
| (DG2) cryoET | TV3 | 2 | 1.6 | ||
| 结构张量行列式 | Sigma1 | Sigma Area | |||
| 范围 / 默认值 | - | [0.5, 10] / 2 | [0.5, 10] / 2 | ||
| (ST1) cryoET | TV3 | 2 | 2 | ||
| 超体素 | Shape | Spacing | Compactness | ||
| 范围 / 默认值 | - | [1, 10] / 10 | [0.1, 5] / 1 | [1, 200] / 20 | |
| (SV1) microCT | TV1 | (10, 10, 10) | (1, 1, 1) | 30 | |
| (SV2) cryoET | TV3 | (10, 10, 10) | (1, 1, 1) | 50 | |
| (SV3) cryoET | TV2 | (3, 5, 5) | (1, 1, 1) | 50 | |
| (SV4) cryoSXT | TV4 | (10, 10, 10) | (1, 1, 1) | 30 | |
| 兆体素 | Lambda | # Bins | Gamma | ||
| 范围 / 默认值 | - | [0.01, 1] / 0.1 | [10, 200] / 20 | None, auto 或 [0, 1] / None | |
| (MV1) cryoET | SV2 | 0.1 | 50 | auto | |
| TV1 | |||||
| (MV2) cryoSXT | SV4 | 0.4 | 50 | None | |
| TV4 | |||||
| 模型训练 | 区域 | 分类器 | 优化 | ||
| 可用选项 / 默认值 | [体素 / 超体素] | [集成方法, SVM, 在线线性模型] / | [无, Potts, 外观] / 外观 | ||
| 集成 - RF | |||||
| microCT | TV3 | SV1 | 随机森林: | 外观 | |
| TH1 | |||||
| GC1 | - # 树: | - Lambda: | |||
| GN1 | [10, 100] / 100 | [1, 500] / 10 | |||
| LG1 | 100 | 50 | |||
| DG1 | |||||
| cryoET | TV2 DG2 ST1 | SV2 | 随机森林: | 外观 | |
| - # 树: | - Lambda: | ||||
| [10, 100] / 100 | [1, 500] / 10 | ||||
| 100 | 50 | ||||
| 标注优化 | 半径 | ||||
| 范围 / 默认值 | [1, 20] / 1 | ||||
| microCT | |||||
| 开运算 | 5 | ||||
| 填充孔洞 | 1 | ||||
| 膨胀 | 2 | ||||
| cryoET | |||||
| 开运算 | 3 | ||||
| 填充孔洞 | 1 | ||||
| 膨胀 | 2 | ||||
| cryoSXT | |||||
| 开运算 | 3 | ||||
| 填充孔洞 | 1 | ||||
| 膨胀 | 2 | ||||
表1. 用于处理三个数据集(microCT、cryoET 和 cryoSXT)的优化参数。
针对每个参数,给出了通用的取值范围和默认值。在许多情况下,经过滤波处理的数据被用作后续处理的输入数据。在此类情况下,使用缩写表示新的源数据集。例如,G1(经高斯滤波处理的 cryoET 原始数据)被用作全变分滤波的输入,以生成 TV2。仅列出在 Workbench 中实际用于处理各数据集的功能部分的相关信息。例如,本文所展示的 cryoSXT 数据集在处理过程中未使用模型训练(Model Training),因此未提供该部分的参数。
SuRVoS 工作台与其他分割程序的不同之处在于,在开始实际分割之前,优化参数是一个必要且重要的步骤。在一些手动或半手动分割程序中,用户在新建项目后几分钟内即可开始分割。而对于 SuRVoS,由于程序将自动分割大部分体数据,且边界由程序划定,仅需极少的用户输入,因此参数优化对于成功分割至关重要。具体而言,特征通道和超区域构建是需要重点关注的两个方面。
特征通道与模型训练
除了原始数据外,SuRVoS 还允许用户基于现有数据集创建额外的数据集或通道。这些通道可通过一系列计算方法或特征提取器生成。所有数据表示均可并行获取,并可单独显示,以评估特征或滤波器应用的效果。由于这些特性,它们在 SuRVoS 中被称为特征通道。SuRVoS 提供了多种特征通道选项。有关此处所用选项和参数的信息,请参见表 1;如需可用特征通道的完整列表及描述,请访问 https://diamondlightsource.github.io/SuRVoS/ 2。首先,对于噪声较多的数据集,建议使用高斯滤波器或全变分滤波器进行去噪。通常建议以其中一种去噪后的数据集作为数据源,进一步进行特征通道以及超体素/兆体素的计算。一般情况下,全变分去噪后的数据集被用作特征通道及超体素/兆体素计算的源数据。建议首先使用默认参数运行,然后在三维视图中评估结果,最后针对该数据集迭代优化参数。此外,特征通道还可组合成"滤波器集合",以特异性地分离数据集中的某些特征,随后可将这些集合用作生成超体素和兆体素的数据源。尽管该策略高度依赖于具体数据集,但在某些情况下可能具有显著优势。
特征通道在模型训练中也被用作分类器的训练来源。在选择使用哪些特征通道时,建议选用几个稳健的特征通道(例如,当使用少量标注数据来训练分类器时,可采用来自斑点检测、纹理与结构或鲁棒特征类别的特征。当拥有大量训练数据时,建议总体上使用更多的特征通道,可来自任意类别,只要这些特征能为分类器提供多样化的信息即可例如,将局部特征和高斯特征类别的特征通道添加到上述列表中。
模型训练主要包括三个部分:提供描述数据的输入数据源,利用这些输入训练分类器,以及最终优化输出预测结果。通常,数据中较小的区域需要更多的用户标注才能准确训练分类器,而较大的区域则需要较少的用户标注。可先在不选择优化条件的情况下进行模型训练,以获得最佳预测结果;然后加入优化条件,并根据需要调整 lambda 参数,以修正预测结果中的问题,例如孔洞或锯齿状边缘。
超体素与巨体素
超体素(supervoxel)是多个邻近且相似的体素(voxel)组成的簇38,39。超体素最初是一个标准的三维网格,覆盖在数据之上,随后通过迭代变形以贴合数据中的底层边界,从而更准确地表示数据。超体素的生成与变形由四个用户输入参数控制:数据源、超像素形状、间距和紧凑度。数据源提供在生成超体素过程中被查询的数据输入,任何来源的数据均可使用,包括经过滤波处理的数据源。超像素形状参数决定初始三维网格以及最终超体素的大致期望形状。调整这些参数可在变形前增大或减小超体素的尺寸。间距参数定义各个方向上边界的相对重要性。调整这些参数可突出一个或两个方向上的边界,而牺牲其他方向,这意味着生成的超体素将更倾向于沿指定方向的数据边界进行变形。最后一个参数——紧凑度,控制超体素可变形的程度。较低的紧凑度数值允许超体素发生更大的变形。应优化这些参数,以获得能够准确反映目标数据边界的超体素。注意:当前,超体素形状参数的乘积必须等于或小于1024。
在某些方面,超体素参数可以相互补偿,因此在确定参数时并不存在唯一的"正确答案"。例如,较大的起始网格(e.g. 超像素形状:10 × 10 × 10)与较低的紧凑度数值(例如 20),可能产生与较小的起始网格(e.g. 超像素形状:5 × 5 × 5)和较高的紧凑度数值(e.g. 50)相似的边界贴合度。由于第二种情况下的超体素数量更多且体积更小,因此它们在表示边界时无需发生显著形变。这两组参数均可适用于该数据集的分割。
选择超体素参数时最重要的考虑因素是超体素对数据的表征程度。如图2D所示,单独显示超体素(其下方不叠加原始数据)是评估超体素参数的一种有效方法。以这种方式显示时,数据中形状的边缘和轮廓在超体素中仍应清晰可见。
兆体素(megavoxels)是由多个相邻且相似的超体素(supervoxels)聚合而成的结构38,39。其生成过程同样由四个用户输入参数控制:数据源(data source)、lambda、numbins 和 gamma。与超体素类似,数据源为创建兆体素时所查询的数据输入提供支持。lambda 和 numbins 均会影响兆体素的大小及其对边界的贴合程度。当兆体素增大(lambda 值高,numbins 值低)时,其对边界的贴合能力会下降;反之,当兆体素较小(lambda 值低,numbins 值高)时,边界贴合能力增强。然而,随着兆体素尺寸减小,其在快速分割大量体素方面的实用性也随之降低。可选参数 gamma 用于控制两个超体素合并时平滑因子与合并代价之间的权衡。较小的 gamma 值可增强两个超体素之间的相似性,但总体生成的兆体素数量会减少。
与超体素类似,在选择和优化巨体素参数时,最重要的考虑因素是巨体素对数据的表征程度。可以再次采用如超体素所述的方法,单独显示巨体素以评估参数。然而,由于巨体素通常要大得多且具有三维特性,建议使用标注工具选择单个巨体素,以确保感兴趣区域之间的边界紧密贴合。
注释策略
已描述了两种通用的标注策略:模型训练方法适用于划分数据集中的大范围区域,而超区域分割方法则适用于较小且更具多样性的特征,例如单个细胞器。标注可以采用分层方式组织,从而能够首先标注大范围区域,然后通过父子关系将其细分为更具体的子区域。通过点击标签颜色选择区域右侧的空白处,并从上一级中选择适当的父级标签,即可为当前标签指定其父级标签。在实际应用中,大多数数据集会同时使用模型训练和超区域分割这两种策略,以分割出特定的兴趣区域或特征。
在此模型训练示例中,使用了少量训练输入(以用户手动基于超体素标注的形式),应用于数据中三个等间距的切片上。通过这种方式,SuRVoS 的模型训练部分极大地提高了分割速度,尤其是在处理大型且具有明显差异的区域时,例如鹅肠草子实体中不同区域之间的分界,如图3所示。
在模型训练过程中,如果无法看到预测结果,可能需要进入“可视化”(Visualization)选项卡,确保已启用“预测”(Predictions)图层,并将其设置为适当的透明度。此外,置信度为0时,系统会根据最接近的匹配结果,为每个未标记的超体素分配一个标签;置信度为100时,仅当某一类标签存在比例匹配时才会分配标签。介于0和100之间的置信度则是这两种极端情况之间的权衡。在选择置信度水平时,建议检查若干切片,通过视觉评估确认在将预测结果保存为标签之前不存在错误预测的体素。
使用超区域进行标注的一个有效策略是:利用放大工具放大数据,在单个切片上同时标注几个细胞器,使用一个 "快速,杂乱" 方法优先(图4C)。接着,在Z轴方向上下移动几个切片,并重复此过程。由于超体素是三维的,许多此类缺陷 "杂乱" 通过上层或下层切片中的标注来固定该方法,从而加快分割速度,且边界由超体素提供,而非手动划定。
为了优化标签,已提供标准的分割细化选项。膨胀会使选定的分割标签按给定半径向外扩展,腐蚀则使其向内收缩。开运算和闭运算分别指先腐蚀后膨胀、或先膨胀后腐蚀的操作。填充孔洞功能则专门用于填补分割区域内的空洞。这些操作的执行顺序至关重要。通常,先执行填充孔洞,然后进行开运算,最后进行膨胀,效果较好。每种细化方法均可应用于单个切片("本切片")、所有二维切片("所有切片(2D)")或三维整体数据("整个体积(3D)")。推荐使用“所有切片(2D)”模式。
意义与未来研究方向
高效且准确的分割是处理三维数据集的下一个瓶颈,尤其是在长时间运行过程中常规自动化采集的图像数据达到太字节量级时。SuRVoS Workbench 可将分割速度较手动分割提高5倍。此外,由于边界由超体素(supervoxels)界定,所得分割结果的变异性应有所改善。未来,我们希望探索利用代表性三维感兴趣区域的分割结果作为训练数据,以高置信度将其应用于其余体积,甚至其他独立体积的方法。这一进展将进一步减少分割复杂生物体积所需的人工时间和干预,有助于缓解图像处理与分割的瓶颈问题。这反过来将使得在不同状态下(例如非疾病状态、疾病状态、治疗后状态)的生物数据能够基于可靠的实验数据进行定量比较。
作者声明不存在任何竞争性经济利益。
我们谨向贝勒医学院的 Rui Wang 和 Wah Chiu 致以感谢,感谢他们提供冷冻电子断层扫描数据集;同时感谢钻石光源的 Andrew Bodey 在 I13 线站机时方面的协助。本研究的部分工作得到了美国国立卫生研究院(NIH)基金(编号:P41GM103832)的支持。我们感谢钻石光源共同资助了 Imanol Luengo 的博士研究(项目编号:STU0079)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机 | 无 | 无 | 必须运行 Linux 操作系统,并配备至少 4 GB 显存的 NVidia GPU |