本方案提供了一种可与神经生理学测量指标时间锁定的、用于长期追踪啮齿类动物自动眨眼的方法。该方案预期对研究偏头痛等疼痛障碍机制的研究人员具有实用价值。
方法文章
* These authors contributed equally
本方案提供了一种可与神经生理学测量指标时间锁定的、用于长期追踪啮齿类动物自动眨眼的方法。该方案预期对研究偏头痛等疼痛障碍机制的研究人员具有实用价值。
自发性疼痛在实时追踪和量化方面一直存在挑战,难以避免人为偏差。对于头痛类指标(如偏头痛等疾病)而言,这一问题尤为突出。眼睑收缩(eye squint)作为一种可随时间连续测量的变量指标,已被证明在预测此类检测中的疼痛状态方面具有有效性。本文提供了一种利用 DeepLabCut(DLC)对头部可自由旋转但身体固定的实验小鼠进行眼睑收缩(眼睑之间的欧氏距离)自动化量化分析的实验方案。该方案可实现无偏倚的眼睑收缩量化,并能与神经生理学等机制性测量指标直接配对和比较。我们评估了人工智能训练所需的关键参数,以确保能够有效区分收缩与非收缩时段。我们还展示了在降钙素基因相关肽(CGRP)诱导的偏头痛样表型中,以亚秒级分辨率可靠追踪和区分眼睑收缩的能力。
偏头痛是全球最常见的脑部疾病之一,影响超过十亿人1。偏头痛的临床前小鼠模型已成为研究偏头痛机制的重要手段,因为与人类研究相比,这些研究更容易进行控制,从而能够对与偏头痛相关的行为进行因果关系分析2。此类模型已显示出对诱发偏头痛的化合物(如降钙素基因相关肽(CGRP))具有强烈且可重复的表型反应。在啮齿类动物模型中,对与偏头痛相关行为的可靠测量仍存在迫切需求,尤其是那些可与成像和电生理学等机制性指标相结合的行为测量方法。
偏头痛样脑状态的表型特征表现为畏光、足爪痛觉过敏、面部伤害性刺激超敏以及面部痛苦表情3。这些行为通过动物在光照区域停留的总时间(畏光)以及足爪或面部触觉敏感阈值(足爪痛觉过敏和面部伤害性超敏)进行测量,且通常仅在较长时间段(数分钟或更长)内进行单次读数。通过给予偏头痛诱导化合物(如CGRP)可在动物中诱发偏头痛样行为,从而模拟人类偏头痛患者所经历的症状3(即体现表面效度)。此类化合物在人类中给药时同样可引发偏头痛症状,表明这些模型具有构建 效度4。通过药物干预使行为表型得到缓解的研究,已推动了偏头痛治疗相关发现,并进一步验证了这些模型的有效性(即体现预测效度)5,6。
例如,单克隆抗降钙素基因相关肽(CGRP)抗体(ALD405)可减轻经CGRP处理小鼠的畏光行为5和面部 grimace(痛苦表情)6;其他研究也表明,CGRP拮抗剂药物可减少动物由一氧化二氮诱导的类偏头痛行为7,8。近期的临床试验已证实,阻断CGRP在治疗偏头痛方面取得成功9,10,由此推动了多种靶向CGRP或其受体的药物获得美国食品药品监督管理局(FDA)批准。偏头痛相关表型的临床前评估促进了临床研究的突破,因此对于理解某些难以在人体中直接检测的偏头痛复杂机制至关重要。
尽管具有诸多优势,使用这些啮齿类动物偏头痛行为读数的实验通常在时间点采样的能力上受到限制,且可能具有主观性并容易受到人为实验误差的影响。许多行为检测方法难以在更精细的时间分辨率下捕捉活动,通常难以捕获发生在亚秒时间尺度上的更动态的事件,例如脑活动层面的变化。在具有意义的时间分辨率下,对随时间推移而发生的更自发、自然出现的行为要素进行量化已被证明十分困难,这限制了对神经生理机制的研究。建立一种能够在更快速时间尺度上识别偏头痛样活动的方法,将有助于对外验证偏头痛样脑状态。进而,这种方法可与脑活动同步,从而构建出更为可靠的偏头痛脑活动特征谱型。
一种与偏头痛相关的表型——面部痛苦表情,已被广泛用于多种情境下作为动物疼痛的测量指标,可实现瞬时测量并随时间进行追踪11。面部痛苦表情通常被用作自发性疼痛的指标,其依据在于人类(尤其是非言语个体)及其他哺乳动物在经历疼痛时会自然地表现出面部表情的变化11。过去十年中,针对小鼠疼痛的面部痛苦表情研究已采用诸如小鼠面部痛苦评分量表(Mouse Grimace Scale, MGS)等标准化工具,以统一描述啮齿类动物的疼痛状态12。MGS的面部表情变量包括眼眶紧缩(眯眼)、鼻部隆起、颊部隆起、耳部位置及胡须形态变化。尽管已有研究表明MGS能够可靠地表征动物疼痛13,但该方法主观性强,依赖于准确的评分,而不同实验操作者之间的评分可能存在差异。此外,MGS的局限性在于其采用非连续性评分尺度,且缺乏足够的时间分辨率,难以精确追踪随时间自然发生的疼痛相关行为。
一种应对方法是客观量化一种稳定的面部特征。眯眼是最稳定可追踪的面部特征6。在考虑所有MGS变量(眯眼、鼻部隆起、面颊隆起、耳位和胡须变化)时,眯眼占数据总变异性的大部分6。由于眯眼对使用MGS获得的总体评分贡献最大,并且能够可靠地追踪对CGRP的反应6,14,因此它是追踪偏头痛小鼠模型中自发性疼痛最可靠的方法。这使得眯眼成为一种由CGRP诱导的可量化的非稳态行为。多个实验室已使用包括眯眼在内的面部表情特征来表征与偏头痛相关的潜在自发性疼痛6,15。
在将自动化斜视检测与偏头痛机制研究相结合方面,仍存在若干挑战。例如,若不依赖必须在各次实验中以相同方式校准的固定位置,可靠地追踪斜视一直较为困难。另一个挑战是,难以以连续尺度而非离散尺度(如MGS)进行此类分析。为应对这些挑战,我们旨在将机器学习方法(以DeepLabCut(DLC)的形式)整合到我们的数据分析流程中。DLC是由Mathis及其同事开发的一种姿态估计算法模型,已广泛应用于多种行为研究16。利用该姿态估计软件,我们训练出能够以接近人类水平的准确度预测小鼠眼部关键点位置的模型。该方法解决了重复性人工评分的问题,同时显著提高了时间分辨率。此外,通过建立这些模型,我们实现了在更大实验群体中可重复地量化斜视程度,并估算类似偏头痛的脑部活动。本文介绍了该方法的开发与验证过程,该方法可实现斜视行为的追踪,并能与神经生理学等其他机制性测量指标进行时间同步。总体目标是推动需要时间锁定斜视行为的啮齿类动物模型中的机制性研究。
注意:本实验中使用的所有动物均按照美国爱荷华大学机构动物护理和使用委员会(IACUC)批准的方案进行操作。
1. 准备数据采集设备
2. 设置 DLC
3. 构建模型
4. 配置设置
注意:此处可定义诸如需要追踪的点、从每个训练视频中提取的帧数、默认标记点大小,以及与模型训练方式相关的变量等细节。
5. 提取训练帧
6. 标注训练帧
7. 创建训练数据集
8. 评估网络
9. 分析数据/生成带标签的视频
10. 处理最终数据
本文提供了一种利用 DeepLabCut 高时间分辨率可靠检测斜视的方法。我们优化了训练参数,并对该方法的优势与局限性进行了评估(图 1)。
在训练模型后,我们验证了模型能够准确估计眼睑的上缘点和下缘点(图2),这些点作为欧氏距离测量的坐标点。欧氏距离定义为眼睛上下两点之间距离的平均长度。我们的模型能够识别非眯眼(图2A)和眯眼(图2B)的情况。蓝色点表示用于确定每一帧图像中欧氏距离的点。绿色、黄色、橙色和紫色点用于帮助模型更准确地估计欧氏距离,并在头部处于非理想位置时降低置信度值(即校正头部运动以及不同实验会话中位置变化的影响)。随后,我们采用多种不同方法对模型的准确性进行了验证。
为了验证用于模型训练的理想帧数,我们训练并测试了四个样本帧数不同的模型(图3)。我们首先比较了测试数据与训练数据之间的均方根误差(RMSE)值,以评估模型对未参与训练的测试数据的预测准确性。该比较结果显示,在达到300帧后,人工标注点与模型标注点之间的变异程度趋于稳定。这一趋势与报告中的似然性平均值一致,后者在标注帧数超过300后也趋于平稳。我们使用这些报告的似然性值对低于0.92的点进行过滤。这些似然性值反映了模型基于训练数据判断某个点被正确标注的置信度。我们对参与计算欧氏距离指标的点的似然性值进行平均,以评估各模型之间的相对性能。尽管300帧与400帧之间无显著差异,但我们最终选择使用400帧,因其平均似然性值高于0.95,接近我们手动过滤的阈值,并且与用于姿态估计的类似模型所采用的阈值一致16。
我们验证模型准确性的另一种方法是使用混淆矩阵,将人工标注的帧与DLC标注的帧进行比较。两名不知情的研究人员对八段视频中同一只眼睛的300帧进行了人工标注。我们利用这些数据构建混淆矩阵,以评估真阳性、假阳性、真阴性和假阴性(图4),其中以人工评分的数据作为真实标准。对于DLC而言,当欧氏距离小于75像素时记录为阳性眯眼值(即动物眯眼),当欧氏距离大于75像素时记录为阴性值(即动物未眯眼)。我们得到的阳性预测值为96.96%,表示模型相对于人工标注的眯眼情况,正确预测眯眼的百分比;阴性预测值为99.66%,表示模型相对于人工标注的非眯眼情况,正确预测无眯眼的百分比。这些数值反映了被正确标注的阴性和阳性结果所占的比例。此外,我们还得到真阳性率为98.1%,真阴性率为99.46%,分别表示模型相对于所有实际阳性值和实际阴性值中正确预测阳性与阴性的比例。我们的马修斯相关系数(MCC)为93.8%,表明观测值与预测值之间的相关系数。
在我们确信模型能够可靠地追踪斜视后,便利用一个临床前偏头痛数据集,将该深度学习卷积(DLC)方法与先前发表的斜视追踪方法进行了比较14我们将此另一种方法称为“眼裂面积斜视模型(ASM)”,因为该模型采用睁眼时的眼裂面积作为衡量斜视程度的连续变量14. 面部斜视区域模型利用经过训练的人脸检测软件,结合自定义的 MATLAB 脚本,分析眼睛的平均像素面积,同时排除跟踪错误率较高的帧 >15%14一个主要的局限性在于,“ASM”并非开源软件,因此无法广泛获取。DLC能够在无需大量购置软件和硬件的情况下,实现更高的优化性和适应性。
我们使用了包含10只雌性和10只雄性CD1小鼠的数据集。实验上,所有动物在记录开始前的总共3天内,每天在轻柔束缚条件下适应30分钟。每只动物先记录5分钟的基础状态,随后记录5分钟的处理期数据。在处理阶段,动物通过腹腔注射给予PBS(对照)或0.1 mg/kg CGRP(处理)以诱导偏头痛样状态。数据采集在光线充足的房间内进行,使用配备红外光源的摄像头对面部进行照明,以确保面部特征点的准确检测。红外摄像头配备有Kowa LM35JC 2/3" 35 mm F1.6手动光圈C接口镜头,焦距为254 mm,并适当调整了光圈。数据采集完成后,我们利用ASM和DLC对数据进行了分析。由于在该领域中,面部痛苦表情的量化通常采用人工评分方法,而眯眼是面部痛苦表情的一个组成部分14,因此我们也对我们的数据与人工评分结果进行了比较。
根据先前的研究发现,外周注射CGRP可在小鼠中诱导眯眼反应,因此我们预期在对照溶剂(vehicle)与CGRP处理组之间观察到显著的眯眼反应差异6,14。我们比较了ASM、人工手动评分和DLC三种方法,发现我们的模型能够稳健地检测到眯眼表型,ASM和人工手动方法同样能够检测到该表型(图5)。需要特别指出的是,ASM模型曾被用于评估CGRP诱导的疼痛及眯眼反应。在那项研究中,Rea等人将CGRP注射后引发的眯眼反应与后肢足垫注射福尔马林后的眯眼反应进行了比较,后者被视为一种“更传统”的疼痛诱导检测方法14。此外,已有充分文献报道,通过使用von Frey纤维丝测试,CGRP可诱导小鼠产生触觉过敏3,17。与该领域常规做法一致,我们将每只动物在处理期间的平均眯眼程度相对于其5分钟给药前基线进行归一化处理,并比较了PBS组(n = 10)与CGRP处理组(n = 11)动物的数据。PBS组与CGRP处理组之间的统计分析结果如下:我们发现,采用面积眯眼追踪法,CGRP处理组动物的平均像素面积显著减小(p = 0.012,图5A);在人工评分中,其欧氏距离显著降低(p = 0.0007,图5B);使用我们的DLC模型也观察到欧氏距离显著下降(p = 0.007,图5C)。当我们对单个代表性动物在不同时间点的各方法结果进行比较时,也观察到了相同的趋势(图5)。该动物在接受CGRP处理后表现出非常明显的眯眼表型,而在PBS处理后则无此表现。所有三种模型均能检测到这些差异,但数据在我们的DLC模型中呈现得最为清晰(图5)。当需要在更高时间分辨率下分析数据,而平均值无法充分反映完整行为反应(例如脑活动)时,精确且准确的量化指标尤为重要。利用DLC方法检测小鼠眯眼反应,使我们能够在毫秒时间尺度上采集数据,并将其与同样发生在毫秒级时间尺度上的脑活动指标(如局部场电位)进行时间同步。随后,我们可以利用该技术构建更为全面的大脑状态特征谱,以表征偏头痛及其他复杂脑部疾病背景下的自发性疼痛状态。

图1:使用DLC生成训练后网络的流程概述。 该流程的通用示意图展示了如何通过机器学习追踪并分析动物的眼部特征。缩写:DLC = DeepLabCut。 请点击此处查看此图的放大版本。

图 2:代表性 CD1 小鼠中自动眯眼跟踪示例。(A)治疗日小鼠未眯眼时,DeepLabCut(DLC)对眼部轮廓进行跟踪(彩色圆点)的某一帧示例。(B)使用本研究建立的 DLC 模型在治疗日自动检测眯眼的某一帧示例。欧氏距离通过测量眼周上方和下方蓝色圆点 B 与 C 之间的平均距离获得。蓝色圆点组位于眼周上下方,用于欧氏距离的跟踪。其余点位(绿色、黄色、橙色、紫色)为构图参考点,既有助于模型估算欧氏距离点位,也可在数据采集后用于滤除头部位置不佳的帧。缩写:DLC = DeepLabCut。 请点击此处查看该图的高清版本。

图3:用于模型训练的帧数选择依据。(A)均方根误差(RMSE)分析显示了预测值与观测值在测试集和训练集中的平均距离。训练数据集代表模型训练过程中采样的帧,测试数据集代表未参与训练的帧,用于验证模型识别相似但不同图像的能力。我们使用了五组训练和测试数据,发现测试组的RMSE值在约300帧时趋于稳定。(B)某一点被正确标注的似然性(均值 + 标准误)。结果显示,400帧人工标注的数据最为理想,因为原始数据集的似然性平均值高于0.95,同时其RMSE值最接近训练数据。这表明模型不仅能够准确逼近其训练所用的点,还能以高似然性对大多数帧进行预测。缩写:RMSE = 均方根误差。请点击此处查看该图的放大版本。

图 4:DLC 斜视测量的混淆矩阵。 我们从八段视频(五段为 CGRP,三段为 PBS)中采样了 300 秒的数据,并将这些时间点与人工标注的斜视“是”或“否”二分类评分进行比较。我们将预测值定义为 DLC 识别的结果,实际值定义为人工手动评分的结果。随后,我们将预测结果与人工评分数据进行对比,以评估斜视被正确识别的频率,相对于人工评分的“是”或“否”结果。缩写:DLC = DeepLabCut;CGRP = 降钙素基因相关肽;PBS = 磷酸盐缓冲盐水;TP = 真阳性;FP = 假阳性;FN = 假阴性;TN = 真阴性;PPV = 阳性预测值;NPV = 阴性预测值;TPR = 真阳性率;TNR = 真阴性率;MCC = 马修斯相关系数。 请点击此处查看该图的放大版本。

图5:在三种不同斜视检测模型中观察到的斜视表型。前两行显示了同一只代表性动物在不同处理条件(PBS或CGRP)下,使用三种不同斜视检测模型的结果。最下面一行反映了所有动物的平均值。(A) 在使用先前发表并验证过的面积法斜视模型处理所有数据后,CGRP处理组小鼠相较于PBS处理组小鼠的平均像素面积(总体平均像素面积/基线)有所降低(t(18) = 2.805, p = 0.012)14。(B) 手动评分数据也显示出类似的结果(t(18) = 4.064, p = 0.0007)。(C) 使用深度学习姿态估计算法(DLC)处理所有数据时,CGRP处理组小鼠的眼睑间平均距离(处理后的欧氏距离/处理前的欧氏距离,基线)低于PBS处理组小鼠(t(18) = 3.040, p = 0.007)。N = 20(10只雌性,10只雄性)。误差条表示均值 ± 标准误(SEM)。请点击此处查看该图的放大版本。
本方案提供了一种易于获取的深度方法,用于使用基于机器学习的工具,在保持与先前方法相同(或更优)时间分辨率的同时,以接近人类水平的准确度区分斜视。该方法主要使自动化斜视评估能够更便捷地为更广泛的使用者所采用。相较于以往模型,我们用于评估自动化斜视的新方法具有多项改进。首先,通过使用更少但实际参与斜视量化计算的关键点,该方法提供了比ASM更为稳健的度量指标。这降低了假阳性与假阴性的可能性,因为在生成表征斜视的数值时,分析所依赖的关键点更少。换言之,DLC模型要求眼部周围每个点均为必要但非充分条件,以决定是否纳入某一时间点。这使得我们能够在使用与ASM相同数量关键点的情况下,过滤质量不佳的数据,同时避免因依赖过多组成点所带来的更大变异性。此外,我们通过设计不完全依赖训练人员准确性的模型,减少了潜在的人为误差。
在处理数据时,我们发现该方法能够准确过滤掉次优点和超出可能范围的异常点,因为这些点超出了小鼠眼球的最大尺寸(方案第10节)。我们使用了宏程序来检查围绕眼球的10个点中每个点的置信度值是否大于0.92,并过滤掉低于该阈值的点。未来可根据需要调整此参数,以使处理后的数据更具或更少选择性。宏程序还将所有欧氏距离值超过200像素的数据进行了过滤,因为我们发现眼球顶部与底部之间的最大可能距离为150像素。这一阈值可能需要根据实验设置进行调整。如果相机与眼球的距离不同,则最大值可能会显著增加或减少。这些宏程序的优势在于,它们使我们能够以依赖模型对围绕眼球的所有组成点报告较高置信度的方式,提取眼球顶部与底部之间的测量值。
DLC 和 ASM 均存在一定的局限性,即它们依赖于小鼠在固定位置且与相机保持预设距离,以确保基线条件与处理条件之间具有一致的放大倍数比例。因此,动物自身的移动、在装置中位置不正确或实验操作的改变,都会影响模型对眼部总面积的检测能力。我们的模型通过利用欧几里得距离(即眼部长轴的上下距离)在一定程度上改进了这些局限,使得即使在相机角度不同、动物发生移动或不同实验阶段存在操作差异的情况下,仍能实现更优的追踪效果,且无需额外重新校准。然而,我们承认,若能进一步优化用于校正头部运动的归一化方法,可能实现在活动动物中对眯眼行为更精确的追踪。
本方法的另一个局限性在于,它过滤掉了欧几里得距离趋近于零的点,而这些点代表了眼睛闭合的状态。尽管去除了对眯眼具有显著贡献的这些数据点,我们仍比以往方法更可靠地检测到了CGRP诱导的眯眼反应(p = 0.007)。然而,当试图将结果与其它感兴趣的数据点(如脑活动)进行比较时,去除眯眼的这一组成部分就显得尤为受限。我们认为,在去除这些数据点的情况下仍能发现显著性,恰恰说明了本方法的稳健性;但我们承认,去除眯眼的这部分特征并非理想做法。未来使用该方法的研究应纳入更多异常帧数据,以更好地训练模型识别眼睛逐渐闭合时的眯眼行为。总体而言,开发一种可靠追踪自动眯眼的方法,可能推动将自然行为的重要特征与其脑状态相关联的研究,从而对偏头痛等情境下的脑活动谱型进行稳健的探究。
我们没有需要披露的利益冲突。本文中的观点不代表退伍军人事务部或美国政府的立场。
感谢 Rajyashree Sen 的深入交流。感谢麦克奈特基金会神经疾病奖(RH)、NIH 1DP2MH126377-01(RH)、罗伊·J·卡弗慈善信托基金(RH)、NINDS T32NS007124(MJ)、拉蒙·D·巴克利研究生奖(MJ)以及美国退伍军人事务部康复研究与发展服务局(VA-ORD RR&D)杰出研究奖 1 I01 RX003523-0(LS)的资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CUDA toolkit 11.8 | |||
| cuDNN SDK 8.6.0 | |||
| 搭载 Windows 11 系统的英特尔第 13 代处理器计算机 | |||
| 用于自由活动小鼠的 LabFaceX 2D 眼睑追踪附加模块: | FaceX LLC | NA | 任何能够记录动物眼睛的相机均可满足要求,但这是我们的眼动追踪硬件。 |
| NVIDIA GPU 驱动程序版本 450.80.02 或更高 | |||
| NVIDIA RTX A5500,24 GB DDR6 | NVIDIA | [490-BHXV] | 任何满足您所使用的 DLC 版本最低要求(目前为 8 GB)的 GPU 均可满足需求。我们使用的是 NVIDIA GeForce RTX 3080 Ti GPU |
| Python 3.9–3.11 | |||
| TensorFlow 版本 2.10 |