本实验方案的目的是利用逻辑回归方法确定物种和地点特异性的置信度评分阈值,以提高使用自动声学识别软件处理大型声学数据集时的检测精度。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本实验方案的目的是利用逻辑回归方法确定物种和地点特异性的置信度评分阈值,以提高使用自动声学识别软件处理大型声学数据集时的检测精度。
被动声学监测(PAM)已成为生物多样性研究中不可或缺的工具,能够以非侵入方式收集大量数据集。然而,如何高效且可靠地处理这些海量数据,以提取不同地点的物种特异性信息,仍是一项重大挑战。本文提出了一种详细的分步操作方案,利用生物声学分析软件中的机器学习检测模块来应对这一挑战。该方法旨在从原始声学录音中准确且可靠地识别并验证鸟类鸣叫。
本方案详细阐述了从使用自主录音单元(ARUs)进行初始数据采集,到最终生成高质量标注数据集的完整流程。关键步骤包括配置机器学习检测模块以生成初步检测结果,通过人工验证程序计算精确度表格,以及采用逻辑回归分析确定物种特异性、并在适当时段确定地点特异性的置信度评分阈值。该基于统计方法得出的阈值随后用于优化检测器的输出结果,并在两种重叠配置(0 秒和 2 秒)下进行测试。我们证明,应用所推导出的最优置信度评分阈值,可显著提升基于机器学习的鸟类声音识别模型在不同地点的检测精确度。以用于说明该流程的三个地点(利物浦公园、凯恩戈姆山脉和格拉斯哥郊区)为例,在重叠时间为 0 秒时,精确度分别提高了 26.1%、17.7% 和 17%;在重叠时间为 2 秒时,精确度分别提高了 28.77%、16.87% 和 15%。我们认为,该方法在速度和可靠性方面均优于人工计数方法。总之,本文提供了一个可重复的框架,有助于在生物声学研究中便捷而有效地应用机器学习方法,使研究人员能够自信地利用大规模声学数据集开展生态学研究与参数分析。
动物的发声为了解自然世界提供了宝贵的见解,并作为一种强大的生物学工具,使研究人员能够探究动物生活的各个方面1。生物声学领域在生物多样性监测与保护中正变得日益重要,有助于物种鉴定以及种群动态和生态系统健康的评估2,3,4。该研究领域还有助于加深我们对动物行为的理解,例如在通讯和栖息地利用方面的研究5,6。近年来,生物声学还被证明是评估动物福利的一种有前景的方法7,8。
使用声学分析作为研究工具的一个关键优势在于,自主录音单元(ARUs)近年来的技术进步,使得研究人员能够以非侵入性和远程的方式长时间监测动物的发声行为,这种技术被称为被动声学监测(PAM)9。这使得在无需人为干预的情况下即可采集隐秘物种的数据10,11。此外,ARUs 成本较低,并减少了对训练有素的研究人员进行野外工作的需求9。一项针对隐秘的欧洲夜鹰(Caprimulgus europaeus)的研究证实了这些优势,发现使用 ARUs 在检测该物种方面显著优于人工观察者12。大规模的生物声学研究正变得越来越受欢迎,因为它们能够揭示多种生态和行为特征,且非常适用于野外研究。然而,ARUs 长时间运行意味着研究人员不可避免地面临如何高效且可靠地处理大量声学数据的挑战13。
近年来,研究人员开始将被动声学监测(PAM)与自动识别工具结合使用,以在大型数据集中检测物种,从而加快并提升数据的整体处理效率。这些技术通常基于发声类型自动识别和分类物种13,并常采用机器学习和深度学习模型(如人工神经网络),此类方法近年来已得到广泛应用14。自动识别软件的可靠性通常优于人工物种检测方法,这一点已在关于大熊猫 (Ailuropoda melanoleuca) 发声15 和马来西亚蛙类物种16 的研究中得到证实。尤为重要的是,推动这些方法被广泛采用的主要因素之一是处理速度,特别是随着被动声学监测产生的声学数据量持续增长13。对大型声学数据集进行人工分析在大规模应用中效率低下且不切实际,而自动识别工具可在远少于人工所需的时间内完成录音数据的处理。例如,有研究报道,257 小时的人工视觉扫描工作量相当于使用 BirdNET(基于机器学习的鸟类声音识别模型)仅需 1 小时的处理时间17。
这种基于机器学习的鸟类声音识别模型是近年来在鸟类学及其他声学研究领域获得广泛关注的工具之一,它是一种易于使用的自动化软件,依靠深度学习模型实现鸟类物种识别18,19。迄今为止,大多数研究利用该基于机器学习的鸟类声音识别模型生成特定区域的物种清单,结合人工验证的结果表明,该模型可检测到群落中89%的物种,且所需时间不足单纯视觉观察的四分之一17。该模型还被证实能够有效识别特定目标物种在某一区域的存在,例如欧亚麻鳽(Botaurus stellaris),识别成功率达到93.7%20。然而,该模型通常在结合人工验证时成功率更高,尚不能作为完全自动化的检测工具可靠使用21。此外,根据Wood和Kahl21的研究,该模型生成无量纲预测结果方面也存在其他挑战需要考虑。
机器学习检测模块会为每个检测到的鸟类鸣叫分配一个介于0到1之间的定量置信度分数,该分数表示软件对所检测声音被正确识别为特定物种的确信程度18,19,21。精确率(precision)定义为检测结果中真实阳性(即正确识别)所占的比例,是受该分数影响的关键指标22。因此,较高的置信度分数可能产生较少的检测结果,但精确率更高,然而在噪声较大的环境中容易遗漏部分检测;而较低的分数可能产生更多的检测结果,但其精确率的可靠性较低22,23。置信度分数与精确率之间的关系较为复杂,通常发现某些高置信度分数的检测结果仍可能是假阳性,例如在背景噪声较高的地点,或对于容易模仿其他物种鸣叫的鸟类23,24。由于不同物种和不同地点之间的精确率存在差异,在配置过程中可以为每个鸟类物种单独设定置信度分数阈值,仅当检测分数高于该阈值时才进行标注。虽然可以在所有物种和地点统一应用较高的置信度分数阈值,但这样做通常会增加假阴性(即漏检)的数量22,25,26,而假阳性的数量则因物种不同以及录音环境的差异而有所变化。
多项研究和最佳实践指南提出了多种方法,用于确定在特定物种和研究地点运行机器学习检测模块时的最佳置信度分数阈值,从而以更高置信度将检测结果判定为真阳性21,24,26,27,28。其中一种方法是在一系列置信度阈值下计算F分数,并选择使F分数最大化的阈值,以平衡精确率和召回率29,30。另一种允许概率校准的方法是手动验证一组随机预测结果,并拟合逻辑回归模型,建立二元验证结果(真实/错误检测)与相应置信度分数之间的关系21。该方法可用于确定特定情境下的阈值,并可根据不同物种和环境条件(例如背景噪声的变化)进行调整19。此类方法已应用于尤卡坦黑吼猴(Alouatta pigra)、灰狼(Canis lupus)和郊狼(C. latrans)的被动声学监测研究中27,28。
本方法学论文旨在展示并验证一种可扩展的方法,用于通过Raven Pro生物声学分析软件(版本1.6)中的基于机器学习的鸟类声音识别模型19,31,从大规模声学数据集中准确且可靠地提取物种特异性发声数据。该方法遵循Wood和Kahl21提出的最佳实践指南,计算适当的置信度评分阈值。尽管这些指南21为在基于机器学习的鸟类声音识别模型19中应用置信度评分提供了全面的框架,但其主要以最佳实践建议的形式呈现。在现实监测条件下,尤其是在声学条件和背景噪声存在空间差异的分布式自动录音单元(ARU)研究系统中,极少有研究将这些流程实际应用于此类复杂场景22。本方案(图1)特别适用于涉及多个监测点位、多变声学环境或误分类率较高的目标物种的大规模被动声学监测研究。此外,此前尚未有研究展示如何在生物声学分析软件(版本1.6)19,31这一相较基于编程环境更为便捷且用户友好的平台中实现上述指南的应用32,33。

图 1:整个工作流程的示意图。请点击此处查看此图的放大版本。
为弥补这一不足,我们应用并验证了该方案,使用 AudioMoths —— 声学记录单元(ARUs,版本 1.2.0)34,35 在多种生境中采集的大规模数据集。我们的目标物种欧亚鸲(Erithacus rubecula)具有高度的鸣声变异性和结构复杂性36,37,在初步的试点分析中表现出易被误识别的倾向。通过在生物声学分析软件中,针对基于机器学习的鸟类声音识别模型19,31 设置物种和地点特异性的置信度评分阈值,我们在不同的声学条件下评估该方案,纳入了不同背景噪声水平和物种组成,并证明与默认设置相比,定制化的阈值优化可显著提高检测精度。该方法旨在最终促进基于机器学习的鸟类声音识别模型19 在大规模被动声学监测(PAM)研究中的便捷、高效和流程化应用,同时最大限度减少编程需求。
访问受限。请登录或开始试用以查看此内容。
伦理声明
本方案遵循利物浦约翰摩尔斯大学的伦理准则。研究方法仅涉及被动声学监测,不包括对动物的捕捉、干扰或实验性操作。部署声学记录单元(ARUs)无需进行任何危险操作。ARUs 的部署符合机构科研与野外工作指南,并在录音地点设置了适当的标识,以告知公众正在进行声学监测。然而,强烈建议在开展野外活动前查看天气预报,并对每个野外工作地点进行风险评估。
软件、许可与使用
注意:ARU 数据应使用生物声学分析软件(v1.6)19,31 中基于机器学习的鸟类声音识别模型进行处理,探测器输出结果也需在同一软件(v1.6)31 中处理。该软件为授权使用,不免费提供,使用本文所述工作流程需通过机构或个人许可证获取访问权限。此外,该软件(v1.6)19,31 中基于机器学习的鸟类声音识别模型目前无法在采用基于 ARM 处理器架构(M1 或 M2 芯片)的 Apple 设备上运行,但本方案适用于搭载 Intel CPU 的 macOS 计算机以及 Windows 操作系统
1. 收集音频数据
2. 在生物声学分析软件中使用机器学习检测模块19,31进行物种自动检测
3. 从每个研究地点的代表性自动记录单元(ARU)创建目标物种的精确度表
4. 对验证表进行逻辑回归分析,以生成最佳置信度评分阈值

访问受限。请登录或开始试用以查看此内容。
为了说明所述方案的有效性,我们展示了对欧洲知更鸟(Erithacus rubecula)声学数据进行分析的代表性结果,这些数据来自三种不同环境和鸟类物种组成的地点,包括利物浦的一个公园(ARU 1)、凯恩戈姆国家公园内一处自然再生的林地(ARU 2)以及格拉斯哥的一个郊区地点(ARU 3)。这些示例表明,如何通过应用统计方法得出的置信度评分阈值来提高在不同声学环境下的检测精度。在本研究中,成功的标准定义为经过阈值优化后检测精度达到或超过90%;低于该阈值的结果被视为次优,表明仍存在物种误判现象。
利物浦公园 - ARU 1
首先在利物浦公园站点记录的为期一个月的完整数据集上运行机器学习检测模块19,默认置信度阈值设为 0.1,重叠时间为 0 秒,共检测到 299 次信号。根据方案第 3 节所述方法对所有检测结果进行人工验证,初始检测精确度为 66.56%,低于期望的 90% 基准,表明需要通过逻辑回归分析来确定更准确的阈值。
访问受限。请登录或开始试用以查看此内容。
本文所述方案的使用为生成物种特异且准确分类的鸟类鸣声数据集提供了一种可靠且高效的途径,在处理大规模音频数据集时已被证明具有实用价值。我们选择欧洲知更鸟作为测试该方案的物种,因其鸣唱曲目在结构和频率上具有显著的变异性43。最初的结果显示,检测结果存在较高的误标率(假阳性率)(表1)。我们还通过方案实施后的验证测试,评估了使用新建立的置信度评分阈值后检测精确率的提升情况,以验证这些方法的有效性。代表性结果通过对知更鸟鸣声的手动验证及随后的逻辑回归分析,获得用于提高机器学习检测模块检测精度的置信度评分阈值19。目标是将检测精确率提升至至少90%,该目标在三个基于地点的数据集中有两个得以实现。凯恩戈姆地区的ARU 2检测精确率提升至100%(重叠0)和99.17%(重叠2);利物浦公园的ARU 1检测精确率提升至92.66%(重叠0)和95.33%(重叠2)。本方案中对检测精确率具有显著影响的关键步骤包括:检测结果的随机化处理与准确的手动验证、逻辑回归模型对验证数据集的精确拟合,以及在检测器重新配置过程中应用新获得的...
访问受限。请登录或开始试用以查看此内容。
作者无竞争性财务利益。
感谢利物浦约翰摩尔斯大学提供的指导和资源。同时感谢野生动物倡议组织(WAI)提供的资金支持,本研究由WAI资助(项目编号:S-2023–00038)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 自主录音单元 v1.2.0 | Open Acoustic Devices | N/A | 自主录音单元 (ARU) |
| 生物声学分析软件 v1.6.5 | Cornell Lab of Ornithology | RRID:SCR_016190 | 声音分析软件 |
| 数据传输线缆 | 多家制造商 | N/A | 用于从设备传输数据 |
| 设备配置应用程序 | Open Acoustic Devices | N/A | 用于配置 AudioMoth 设备的应用程序 |
| 机器学习检测模块 v2.4 | Cornell Lab of Ornithology | N/A | 机器学习检测器 |
| 可充电碱性电池 | 多家制造商 | N/A | 录音单元的电源 |
| 可移动存储卡 | 多家制造商 | N/A | 录音数据的存储介质 |
| 统计计算软件 | R Core Team | RRID:SCR_001905 | 统计计算软件 |
访问受限。请登录或开始试用以查看此内容。