2026年4月11日
本实验方案的目的是利用逻辑回归方法确定物种和地点特异性的置信度评分阈值,以提高使用自动声学识别软件处理大型声学数据集时的检测精度。
我们的研究致力于开发一个框架,以帮助生物声学家提高自动声学物种检测的准确性。若未进行适当配置,鸟类声音识别模型在准确检测鸣叫方面会面临困难。本实验方案旨在通过确定物种和地点特定的置信度评分阈值,来提高检测精度。
首先,使用数据传输线缆将每个声学记录单元(ARU)单独连接到计算机,并将 ARU 切换至 USB 模式。使用 AudioMoth ARU 设备配置应用程序设置 ARU,以确定其休眠间隔和主动录音时段。确定目标物种活动最频繁的时间窗口,并据此安排录音时段。
通过选择首次和末次录音日期,添加多个录音时段并安排录音时间。使用ARU设备配置应用程序将设备设置为以48千赫的采样率和中等增益进行录音。将每个ARU设备放入防静电的Ziploc密封袋中,并根据需要额外使用防水胶带,以防止水损。
然后,将 ARU 设备部署到野外,并将其切换至自定义模式。将每个可移动存储卡上的所有波形文件传输到计算机上。打开 Raven Pro 1.6 生物声学分析软件,选择“工具”,然后选择“检测器”,并从下拉菜单中选择“学习检测器”。
在“选择检测器输入”窗口中,选择“浏览”。在随后打开的“打开声音文件”窗口中,选中相关 ARU 文件夹内的所有波形文件,然后点击“打开”。这将打开“配置新声音窗口”。
在“配置新声音”窗口中,于“分页和页面声音”部分,根据每段录音的长度输入适当的页面大小。然后,在“多个文件”部分,选择“在单个窗口中作为文件序列打开”,并点击“确定”。此时将弹出“打开文件序列”提示框和“选择检测器输入”窗口,显示所选文件已添加至序列中。在随后返回的“选择检测器输入”窗口中,于“可用信号和视图”下选择“波形”,然后使用箭头按钮将其移至“必需输入”区域。
确认“必需输入”下的状态变为“就绪”,然后点击“确定”。这将打开“配置机器学习检测器”窗口。在“配置机器学习检测器”窗口的“输入”选项卡下,从“选择模型”中选取所需模型。重叠时间保持默认的零秒不变。
单击“输出”选项卡。打开输出类别文件的下拉菜单,选择与研究地理位置相对应的输出列表。将阈值降低至 0.1,然后选择“全部应用”。
确保物种列表中的所有阈值均设置为 0.1。选择“抑制所有物种”选项,以选中所有物种。找到目标物种,然后在“抑制”列中取消选中该物种。
单击“确定”以开始学习检测器处理。通过进度管理器监控已完成的百分比和剩余时间。打开已保存的学习检测器选择表,并将其导入电子表格软件。
确认仅目标物种出现在“标签”列中。删除除“选择”列和“得分”列之外的所有列。使用随机化函数添加一个新列,根据此列对行进行排序,然后删除“随机化”列。
保留前 300 个随机检测结果,如果不足 300 个则保留全部。使用 ARU 名称和标识符(例如 AM1_ValidationDataset)保存验证数据集。打开 Raven Pro 1.6 生物声学分析软件,然后选择“文件”。
然后,打开声音文件以选择所有相应的波形文件,然后单击“打开”。这将打开“配置新声音”窗口。在“配置新声音”窗口的“分页”部分,选择“分页声音”并输入之前使用的页大小。
接下来,在多个文件下,选择“在单个窗口中打开为文件序列”,然后单击“确定”。这将把选定的文件添加到序列中,并在多个选定文件中分别打开每个文件的语谱图。转到“文件”菜单,选择“打开选区表格”,以打开正在分析的 ARU 的学习检测表格。在布局选项卡和视图中,声音视图左侧的面板内,取消选中“波形视图”,使所有文件均以语谱图视图显示。
将验证电子表格与已准备数据的生物声学分析软件同时打开。在电子表格中创建一个新列,并将其标记为“正确检测”。从电子表格的随机列表中选择一个编号,并将其输入频谱图视图中的绘制字段。
然后,点击“播放”。在“正确检测”列中,若检测正确则输入 1,若检测错误则输入 0。根据正确检测次数与总验证检测次数计算检测器的精确率,并乘以 100 以百分比形式表示。
使用软件 RStudio 导入上一节创建的验证数据集。利用广义线性模型函数,将分布族设为二项分布,对数据集进行逻辑回归分析。将期望的精确度概率设为 0.9,即检测结果为真阳性的概率达到 90% 或以上。
通过求解拟合的逻辑回归方程以获得预测变量值,计算最优阈值,并验证所得阈值。使用先前的检测器设置,在正在研究的自动记录单元(ARU)上重新运行学习检测器。选择声音文件。
输入页面大小,并选择“在一个窗口中打开为文件序列”。接下来,在“选择检测器输入”窗口中选择“波形”,然后使用箭头按钮将其移至“必需输入”区域,然后点击“确定”。在“配置机器学习检测器”窗口的“输入”选项卡下,选择所需的模型,并确认重叠时间已设置为零秒。接下来,在“输出”选项卡中,选择输出类别文件中的地理区域,将目标物种的阈值更改为上一步确定的阈值,并点击“全部应用”。
然后,选择“抑制所有物种”选项。取消勾选目标物种对应的复选框,然后单击“确定”以打开进度管理器窗口。最后,使用优化后的阈值创建一个新的检测结果列表,以提高准确性并减少假阳性结果。
对在利物浦公园、凯恩戈姆国家公园内一处自然再生林地以及格拉斯哥一处郊区采集的欧亚鸲声学数据进行分析,其代表性结果展示了基于统计方法得出的置信度分数阈值如何在不同声学环境中提升检测精度。通过逻辑回归分析,确定了在利物浦公园样地的最优置信度分数阈值为0.54,在凯恩戈姆样地为0.23,以实现90%或更高的精确率。在利物浦公园和凯恩戈姆样地重新运行检测器,并采用优化后的阈值后,在重叠时间为零秒和两秒的条件下,检测精度均提升至90%以上。
在格拉斯哥郊区站点使用0.36的优化阈值重新运行检测器提高了检测精度,但在零秒和两秒重叠条件下,回归后的总体精度仍低于90%。本方案使研究人员能够在大规模且声学特征多样的数据集中准确检测目标物种。尽管该方案可减少假阳性,提高检测精度,但也可能遗漏部分真实检出事件,凸显了与召回率之间的重要权衡。
在获得准确的检测结果后,可在软件中对发声进行标注,以提取参数并进一步分析其声学行为。
查看完整文字稿并访问数千部科学视频
本文介绍了一种全面的方案,用于提高在被动声学监测(PAM)数据集中自动鸟类鸣叫检测的精确度。通过将基于机器学习的检测方法与严格的手动验证及统计阈值优化相结合,该方法使研究人员能够从利用自主录音单元(ARUs)采集的大规模、多样化声学数据集中高效且可靠地提取物种特异性信息。
大规模数据集中生物信号的自动化检测对于可扩展的目标验证和早期发现阶段的高置信度决策至关重要。本方案展示了如何通过逻辑回归优化统计阈值,以提高基于机器学习的检测精度,从而直接影响下游分析的可靠性。该方法支持从复杂环境中提取稳健且可重复的数据,有助于更科学地进行项目筛选和基于风险评估的推进决策。
本方案整合了从早期发现到筛选及转化研究的全过程,支持在每个关键节点上做出可靠的数据驱动决策。