本文介绍了如何使用基于模拟监督的机器学习方法,分析固定细胞荧光显微镜图像中线粒体的形态。
本文介绍了如何使用基于模拟监督的机器学习方法,分析固定细胞荧光显微镜图像中线粒体的形态。
在细胞荧光显微图像中对线粒体等亚细胞器进行定量分析是一项具有挑战性的任务,原因在于这些结构体积微小且形态多样,分割过程存在固有困难。本文展示了一种基于机器学习辅助的分割与分析流程,用于对固定细胞的荧光显微图像中线粒体形态进行量化分析。该基于深度学习的分割工具在模拟图像上进行训练,无需为监督式深度学习提供真实标注数据。我们在稳定表达荧光线粒体标记物的固定心肌母细胞的荧光显微图像上验证了该工具的有效性,并采用特定的细胞培养条件诱导线粒体形态发生变化。
本文展示了基于物理的机器学习工具在表达荧光线粒体标记物的固定心肌母细胞荧光显微图像中进行亚细胞分割1的应用价值。
线粒体是哺乳动物细胞中主要的能量生成细胞器。具体而言,线粒体是高度动态的细胞器,常以网络形式存在,其长度和分支结构持续发生变化。线粒体的形态影响其功能,细胞能够快速改变线粒体的形态以适应环境变化2。为了理解这一现象,将线粒体的形态分类为点状、杆状或网络状具有重要的参考价值3。
线粒体的分割对于分析细胞中线粒体的形态至关重要。目前用于分割和分析线粒体荧光显微图像的方法主要依赖于手动分割或传统的图像处理技术。基于阈值的方法(如Otsu4)由于显微图像中噪声水平较高,准确性较低。通常,用于线粒体形态分析的图像包含大量线粒体,使得手动分割极为繁琐。数学方法(如MorphoLibJ5)以及半监督机器学习方法(如Weka6)虽然可用,但操作复杂且需要专业知识。对线粒体图像分析技术的一项综述7表明,基于深度学习的技术可能适用于该任务。事实上,基于深度学习的模型已在日常图像的分割中(如自动驾驶等应用)带来了革命性进展。
深度学习是机器学习的一个子集,它提供能够从大量数据中进行学习的算法。有监督的深度学习算法通过学习带有真实标签(GT)的大规模图像数据集中的关系来实现训练。在荧光显微图像中对线粒体进行分割时,使用有监督深度学习面临两方面的挑战。首先,有监督深度学习需要大规模的训练图像数据集,而在荧光显微成像的情况下,获取如此大规模数据集的工作量远大于使用更易获得的传统相机图像。其次,荧光显微图像需要对训练图像中的目标对象进行真实标签(GT)标注,这是一项繁琐且需要专家知识的任务。对于一张标记了荧光亚细胞结构的细胞图像,专家完成标注可能需要数小时甚至数天时间。此外,不同标注者之间的标注差异也会带来问题。为了消除对手动标注的依赖,并充分利用深度学习技术的优越性能,本研究采用了一种基于深度学习的分割模型,该模型在模拟图像上进行训练。基于物理的模拟器能够模拟并控制显微镜中的图像形成过程,从而生成具有已知形状的图像。通过使用基于物理的模拟器,本研究为此目的构建了一个包含大量模拟荧光显微图像的线粒体数据集。
模拟从使用参数曲线生成几何形状开始。发射源以均匀分布的方式随机放置在形状表面,使其密度与实验值相匹配。显微镜的三维点扩散函数(PSF)通过Gibson-Lanni模型的一种计算高效的近似方法89进行计算。为了使模拟图像与实验图像高度一致,系统同时模拟了暗电流和散粒噪声,以实现照片级真实感。物理真值(GT)以二值图的形式生成。生成该数据集并训练模拟模型的代码已公开10,创建此模拟数据集的具体步骤如图1所示。
我们通过分析固定的心肌母细胞的共聚焦显微镜图像,展示了完全基于模拟数据集训练的深度学习分割方法的应用价值。这些心肌母细胞在外膜表达了一种荧光标记物,从而可在荧光显微图像中实现线粒体的可视化。在进行本示例实验之前,细胞在培养中被剥夺葡萄糖并适应半乳糖培养基达7天。用半乳糖替代培养基中的葡萄糖可迫使培养细胞转向更依赖氧化代谢的状态,因而更加依赖线粒体产生能量11,12。此外,这种处理使细胞对线粒体损伤更为敏感。通过向细胞培养基中添加线粒体解偶联剂(如羰基氰化物间氯苯腙,CCCP),可实验性地诱导线粒体形态的变化13。CCCP会导致线粒体膜电位(ΔΨm)的丧失,从而使线粒体形态由较管状(杆状)转变为更球状(点状)14。此外,在CCCP处理过程中,线粒体往往出现肿胀15。我们展示了经半乳糖适应的心肌母细胞在使用线粒体解偶联剂CCCP处理后,其线粒体形态分布的变化情况。利用深度学习对线粒体进行分割,使我们能够将它们分类为点状、杆状或网络状结构。随后,我们提取了定量指标,用于评估不同线粒体表型的分支长度及其丰度。分析步骤如图2所示,下文将详细介绍细胞培养、成像、用于深度学习分割的数据集构建,以及线粒体定量分析的具体方法。
注意:如果使用已知实验条件的现有线粒体显微图像,则可省略第1至第4节。
1. 细胞培养
2. 实验步骤
3. 盖玻片上细胞的染色与封片
4. 显微镜与成像
5. 生成模拟训练数据
6. 基于深度学习的分割
7. 形态学分析:对“葡萄糖”和“CCCP”两个数据组的线粒体形态进行分析
利用表达荧光线粒体标记物的固定心肌母细胞的共聚焦图像,通过深度学习对线粒体进行分割的结果展示了该方法的实用性。该方法适用于其他细胞类型和显微镜系统,仅需重新训练即可。
经半乳糖适应的H9c2心肌成纤维细胞(其线粒体带有荧光标记)经CCCP处理或未处理2小时。随后将细胞固定,用核染料染色,并接种于载玻片上进行荧光显微镜分析。使用共聚焦显微镜获取对照组和CCCP处理组细胞的图像。我们共分析了12张共聚焦图像,每种条件下约60个细胞。随后确定并量化每张图像中线粒体的形态状态。本实验中,由训练模型获得的分割掩膜经过骨架化处理,以实现对单个线粒体拓扑结构的分析。单个线粒体的分支长度被用作分类参数。根据以下规则将单个线粒体划分为不同的形态类别:具体而言,任何骨架长度小于1,500 nm的线粒体被归类为点状(dot),而较长的线粒体则进一步分为网络状(network)或杆状(rod)。如果存在至少一个两个或多个分支交汇的节点,则定义为网络状;否则,该线粒体被归类为杆状。带有线粒体骨架及其形态类别标注的示例图像见图3。
线粒体形态分类在 图 4A 表明在使用CCCP处理2小时后,可以检测到显著变化;经CCCP处理的细胞中斑点数量的增加最为明显。
图4B中的平均分支长度是展示形态学上可检测且显著变化的另一种途径。如预期所示,当细胞经CCCP处理后,与对照组相比,线粒体棒状结构和网络结构均显著减少。由于线粒体在暴露于CCCP时会发生肿胀,因此点状结构的平均分支长度显著增加也符合预期。

图1:荧光显微镜图像模拟流程图。 该流程包括(i)三维几何结构生成,(ii)发射体与光动力学模拟,(iii)三维点扩散函数卷积,(iv)噪声添加,以及(v)二值化处理。 请点击此处查看该图的放大版本。

图 2:基于机器学习的线粒体形态分析步骤。 (1)首先将待分割的图像裁剪为适合分割模型处理的尺寸。(2)对裁剪后的图像区域应用基于深度学习的分割方法。(3)将分割结果重新拼接回原始图像尺寸。(4)对拼接后的分割图像进行骨架化处理。(6)基于骨架化所得的拓扑结构进行形态学分析。请点击此处查看该图的放大版本。

图3:线粒体骨架叠加在显微镜图像的分割结果上。(A)分割结果。(B)直线骨架(分支起点与终点之间的欧几里得距离)叠加在分割结果之上。骨架的颜色编码表示线粒体的类别:网络状结构为红色,杆状结构为绿色,点状结构为紫色。请点击此处查看该图的放大版本。

图4:线粒体形态学分析。(A)基于总线粒体长度的不同形态类别的相对百分比概览。(B)实验条件下及不同形态类别之间的平均线粒体分支长度比较。横轴显示形态学分类,纵轴显示以纳米(nm)为单位的线粒体平均分支长度。统计学显著性以p值表示,即 * p < 0.05,** p < 0.01,*** p < 0.001,以及 **** p < 0.0001。请点击此处查看该图的放大版本。

图 5:分割失败案例。 线粒体密度过高是分割模型面临的一种挑战性情况。彩色骨架表示在图像中检测到的最长单个线粒体。通过分析长度测量结果,可以识别此类情况,并利用形态学腐蚀操作符(可使检测到的骨架变细)进一步优化分割效果。请点击此处查看该图的放大版本。
补充文件。 请点击此处下载文件。
我们在“"几何结构生成"和“"模拟器参数"部分中讨论了与实验方案关键步骤相关的注意事项。题为“"迁移学习"的段落讨论了在适配多种显微镜时实现更高通量的改进方法。关于“"颗粒分析"和“"生成其他亚细胞结构"的段落涉及本方法未来的应用方向。关于“"与生物学真实情况的差异"的段落探讨了模拟结果可能偏离真实数据的不同原因,以及这些因素是否会影响我们的应用。最后,我们在“"密集排列的结构"段落中讨论了本方法面临的一个具有挑战性的场景。
几何结构生成
为了生成线粒体的三维几何结构,使用基于B样条曲线构建的简单二维结构作为骨架,可有效用于合成数据集的创建。这些合成形状能够高度模拟在二维细胞培养中观察到的线粒体形态。然而,对于心脏组织等三维组织而言,线粒体的形态和排列方式存在显著差异。在此类情况下,通过在模拟图像中引入方向性特征,可能有助于提升分割模型的性能。
模拟器参数
设置模拟器参数时应谨慎,确保这些参数与用于推理的实际数据参数相匹配,否则可能导致分割性能下降。其中一个关键参数是信噪比(SNR)范围。待测试数据的信噪比范围应与模拟数据集所使用的值一致。此外,所使用的点扩散函数(PSF)也应与目标测试数据的PSF相匹配。例如,使用共聚焦显微镜PSF训练的模型不应直接用于测试落射荧光显微镜获取的图像。另一个需要注意的参数是测试数据中是否使用了额外的放大倍数。如果测试数据中应用了额外放大,模拟器也应相应地进行设置。
迁移学习
迁移学习是指利用在一个任务上训练得到的模型来服务于另一个任务的现象。这一现象同样适用于我们所面对的不同类型的显微镜数据问题。在一种显微成像数据上训练得到的分割模型(随源代码提供)的权重,可用于初始化适用于另一种光学显微镜数据的分割模型。这使得我们能够在训练数据集的一个显著更小的子集上进行训练(3,000 张图像对比 10,000 张),从而降低仿真的计算成本。
颗粒分析
也可对分割后的掩膜进行颗粒分析。该分析可提供单个线粒体的面积、曲率等信息。这些信息还可作为线粒体定量比较的指标(本实验未使用)。例如,目前我们通过线粒体长度的阈值来定义点状形态。在某些情况下,结合椭圆率可能有助于更好地区分小型棒状线粒体与点状或颗粒状线粒体。此外,若特定生物学条件导致线粒体发生卷曲,则曲率的量化分析可能对线粒体群体的研究具有重要意义。
生成其他亚细胞结构
基于物理特性的亚细胞结构分割方法已在对线粒体和囊泡的研究中得到验证1。尽管囊泡具有多样的形态,但其尺寸较小,在荧光显微镜下通常呈现为简单的球形。因此,囊泡的几何结构可通过适当直径范围的球形结构进行模拟。这意味着生成结构几何形状的函数需相应调整(在线粒体情况下为圆柱体,在囊泡情况下为球体),并调整相关参数(见方案部分的步骤5.4)。从几何角度而言,内质网和微管也已被模拟为管状结构17。将内质网建模为直径150 nm的管状结构,微管建模为平均外径25 nm、内腔直径15 nm的中空管状结构,可近似反映这些结构的形态。另一个在各类亚细胞结构之间存在差异的参数是荧光染料密度。该参数根据荧光染料所结合的生物分子分布情况及其结合概率进行计算。
与生物学真实情况的差异
用于深度学习模型模拟监督训练的模拟数据在许多方面与真实数据存在差异。(i)模拟数据中不存在非特异性标记,而真实数据中通常存在游离的荧光团,因此真实图像的平均背景值更高。这一差异通过匹配信噪比(SNR)并设置背景值以使其与观测到的真实值一致而得以缓解。(ii)亚细胞结构的运动和光动力学是系统中动态变化的两个来源。活细胞中移动的结构(运动时间尺度为几毫秒)会导致运动模糊。在真实数据采集过程中,通过缩短曝光时间以避免模糊效应。另一方面,我们并未模拟时间序列图像,而是假设结构静止;当真实数据的曝光时间较短时,该假设成立。然而,若真实数据的曝光时间足够长以致引入运动模糊,则该假设可能导致输出结果出现误差。而光动力学的时间尺度为纳秒至微秒级,由于实验通常的曝光时间足够长(毫秒级),足以平均化光动力学效应,因此在模拟中可忽略光动力学的影响。(iii)显微镜图像中的噪声具有多种来源,且这些来源具有不同的概率密度函数。我们并未对各类噪声来源进行单独建模,而是将其近似为在恒定背景上的高斯噪声。在低信背比条件(约为2–4)以及处理荧光团宏观密度时,这种近似不会显著改变数据分布1。(iv)成像伪影可能来源于像差、漂移和系统性模糊。我们假设显微镜系统已良好校准,并且真实数据中用于分析的区域不包含这些伪影。此外,也可在点扩散函数(PSF)中对部分此类伪影进行建模18,19,20。
紧密排列的结构
在二维显微图像分割中,无法区分重叠的棒状结构与网络状结构是一个长期存在的问题。图5展示了一种极具挑战性的情况:线粒体高度密集排列,导致分割模型及后续分析结果不理想。尽管存在这一挑战,在此类情况下使用形态学算子对骨架进行细化,有助于打破过度连接的网络,同时仍能检测到线粒体形态各类别的显著变化。此外,采用共聚焦显微镜而非宽场显微镜成像,可通过消除离焦光信号在一定程度上缓解该问题。未来,进行三维分割将有助于区分真正相交(即物理上形成网络)的线粒体与在单个投影平面中影像重叠的棒状线粒体。
深度学习分割是一种前景广阔的技术工具,可拓展显微镜使用者的分析能力,从而实现对复杂数据和大规模定量数据集的自动化分析,而这些数据在以往是难以处理的。
作者声明本文不存在任何利益冲突。
作者感谢 Arif Ahmed Sekh 的讨论交流。感谢 Zambarlal Bhujabal 在构建稳定的 H9c2 细胞系方面提供的帮助。我们感谢以下资助项目:欧洲研究委员会启动资助项目编号 804233(资助对象:K.A.),科研人员科学振兴项目资助编号 325741(资助对象:D.K.P.),北挪威地区卫生当局资助项目编号 HNF1449-19(资助对象:Å.B.B.),以及挪威北极大学(UiT)主题资助项目 VirtualStain(Cristin 项目编号 2061348,资助对象:D.K.P.、Å.B.B.、K.A. 和 A.H.)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 12孔板 | FALCON | 353043 | |
| 水性电镜级25%戊二醛 | Electron Microscopy Sciences | 16200 | |
| Axio Vert.A1 | Zeiss | 明场显微镜 | |
| CCCP | Sigma-Aldrich | C2759 | |
| 计算机 | n/a | n/a | 必须运行Linux/Windows操作系统,并配备至少4GB显存的NVIDIA GPU |
| 盖玻片 | VWR | 631-0150 | |
| DAPI(染色剂) | Sigma-Aldrich | D9542 | |
| DMEM | gibco | 11966-025 | |
| 胎牛血清 | Sigma-Aldrich | F7524 | |
| 载玻片(磨砂边) | epredia | AA00000112E01MNZ10 | |
| H9c2 mCherry-EGFP-OMP25 | 由购买的细胞系构建的本实验室稳定细胞系 | ||
| 培养箱 | Thermo Fisher Scientific | 51033557 | |
| LSM 800 | Zeiss | 共聚焦显微镜 | |
| 封片剂(玻璃用) | Thermo Fisher Scientific | P36980 | |
| 4%多聚甲醛PBS溶液 | Thermo Fisher Scientific | J19943-K2 | |
| Plan-Apochromat 63x油镜(M27),数值孔径1.4 | Zeiss | 420782-9900-000 | |
| 无菌超净工作台 | Labogene | SCANLAF MARS | |
| 胰蛋白酶 | Sigma-Aldrich | T4049 | |
| Vacusafe抽吸系统 | VACUUBRAND | 20727400 | |
| ZEN 2.6 | Zeiss |