Вокализации животных дают ценные знания о природном мире и выступают мощным биологическим инструментом, позволяющим исследователям изучать различные аспекты жизниживотных 1. Область биоакустика становится всё более значимой в мониторинге и сохранении биоразнообразия, помогая в идентификации видов и оценке тенденций популяций и здоровья экосистем 2,3,4. Эта область исследований также способствует пониманию поведения животных, например, в области коммуникации и использования средыобитания 5,6. В последнее время он был продемонстрирован как перспективный подход для оценки благополучия животных 7,8.
Одним из ключевых преимуществ использования акустического анализа в качестве исследовательского инструмента являются недавние технологические достижения в автономных блоках записи (ARU), которые позволяют исследователям неинвазивно и дистанционно отслеживать вокализации животных в течение длительного времени — технику, известную как пассивный акустический мониторинг (PAM)9. Это позволило собирать данные о загадочных видах без вмешательства человека10,11. Кроме того, ARU экономически эффективны и минимизируют необходимость обученных исследователей в работе вэтой области 9. Исследование загадочного европейского ночного кодоя (Caprimulgus europaeus) продемонстрировало эти преимущества, показав, что использование ARU было значительно эффективнее по сравнению с человеческими наблюдателями при обнаружениивида 12. Крупномасштабные биоакустические исследования становятся всё более популярными, поскольку они могут дать представление о различных экологических и поведенческих аспектах, а также весьма применимы и хорошо подходят для полевых исследований. Тем не менее, длительное время работы ARU означает, что исследователи неизбежно сталкиваются с задачей эффективной и надёжной обработки огромных объёмов акустическихданных 13.
В последнее время исследователи начали совмещать PAM с использованием автоматических инструментов распознавания для обнаружения видов в больших наборах данных, что ускоряет и улучшает общую обработку данных. Эти методы автоматически распознают и классифицируют виды по типувокализации 13, часто используя модели машинного обучения и глубокого обучения, такие как искусственные нейронные сети, которые получили популярность в последниегоды 14. Надёжность программного обеспечения для автоматического распознавания часто превосходит ручные методы обнаружения видов, что показано в исследованиях вокализации гигантской панды (Ailuropoda melanoleuca) 15 и малайзийских лягушеквидов 16. Важно, что одним из основных факторов внедрения этих подходов является скорость обработки, особенно учитывая, что объем акустических данных, генерируемых через PAM, продолжаетрасти на 13. Ручной анализ больших акустических наборов данных неэффективен и неудобен в масштабах, однако автоматизированные инструменты распознавания могут обрабатывать записи за долю времени, необходимого человеку наблюдателю. Например, одно исследование показало, что 257 часов ручного визуального сканирования соответствует 1 часам обработки с использованием BirdNET (модель распознавания звука птиц на основе машинного обучения)17.
Эта модель распознавания звука птиц на основе машинного обучения — один из таких инструментов, который недавно получил популярность в орнитологии и других акустических исследованиях, это доступное автоматизированное программное обеспечение для идентификации видов птиц, основанное на модели глубокогообучения 18,19. Большинство исследований на сегодняшний день использовали модель распознавания звуков птиц на основе машинного обучения для составления списков видов для определённой территории, и с помощью человека было показано, что она обнаруживает 89% видов в сообществе, при этом занимая менее четверти времени, задерживаемого только при визуальномсканировании 17. Эта модель распознавания звука птиц на основе машинного обучения также показала эффективную эффективность присутствия конкретного целевого вида в определённой области, например, евразийский выпёк (Botaurus stellaris), с 93,7% успешностью20. Однако эта модель часто имеет более высокий процент успеха в сочетании с ручной валидацией и пока не является надёжной как полностью автоматический инструментобнаружения 21. Существуют и другие трудности, которые следует рассмотреть, согласно Вуду иКалу 21, связанные с производством предсказаний без единиц.
Модуль детектора машинного обучения присваивает каждой обнаруженной птице количественную оценку доверия от 0 до 1, которая показывает, насколько программа уверена, что обнаруженный звук был правильно идентифицирован какконкретный вид 18,19,21. Точность, определяемая как доля обнаружений, которые являются истинно положительными (то есть правильные идентификации), является ключевым показателем, на который влияет этотбалл 22. Следовательно, более высокий доверительный балл может привести к меньшему числу обнаружений, но с большей точностью, но при этом ошибки обнаружения, особенно в шумных условиях, а более низкий балл может привести к большему числу обнаружений с меньшейточностью 22,23. Связь между оценками доверия и точностью сложна: часто выясняется, что некоторые высокие оценки доверия могут быть ложноположительными, например, в местах с высоким уровнем фонового шума или с видами, которые, вероятно, имитируют вокализации другихвидов 23,24. Из-за вариативности точности между видами и расположением в процессе конфигурации возможно присваивать индивидуальные пороги доверия каждому виду птиц, при этом маркируются только обнаружения с баллами выше этого порога. Высокий универсальный порог доверия может применяться для всех видов и мест, однако это часто увеличивает количество ложноотрицательных результатов (пропущенных идентификаций)22,25,26, в то время как количество ложноположительных результатов варьируется между видами и с экологическими различиями между записями.
Несколько исследований и рекомендаций по лучшей практике описывают различные методы определения оптимального порога доверия для запуска модуля детектора машинного обучения для конкретных видов и мест изучения, что позволяет с большей уверенностью принимать обнаружения как истинноположительные результаты 21,24,26,27,28 . Один из подходов включает расчёт F-баллов по диапазону порог доверия и выбор порога, максимизирующего F-балл, балансируя точность ивоспоминание 29,30. Альтернативный подход, позволяющий калибровку вероятностей, включает ручную валидацию случайного подмножества предсказаний и подборку логистической регрессии для установления связи между результатом бинарной валидации (истинно/ложное обнаружение) и соответствующим рейтингомдоверия 21. Этот метод затем может быть использован для определения контекстно-специфических порогов, которые можно корректировать в зависимости от видов и условий окружающей среды (например, изменяющийся фоновой шум)19. Такие методы применялись в пассивных акустических мониторинговых исследованиях юкатских чёрных ревуновых обезьян (Alouatta pigra), серых волков (Canis lupus) и койотов (C. latrans)27,28.
Цель этой работы по методам — продемонстрировать и подтвердить масштабируемую методологию для точного и надёжного извлечения видоспецифических голосовых данных из больших акустических наборов данных с использованием модели распознавания звуков птиц на основе машинного обучения в программном обеспечении Raven Pro-bioacoustics для анализа (версия 1.6)19,31. Этот подход включает расчёт соответствующих порог доверия в соответствии с21 рекомендацией по лучшей практике Вуда и Кала. Хотя этирекомендации 21 предоставляют комплексную основу для применения оценок уверенности в модели распознавания звука птицна основе машинного обучения 19, они в первую очередь представлены как рекомендации по лучшим практикам. Немногие исследования внедряли эти процедуры в распределённых системах ARU при реалистичных ограничениях мониторинга, где акустические условия и фоновые шумы пространственноменяются 22. Этот протокол (рисунок 1) особенно подходит для масштабных пассивных акустических исследований с участием нескольких участков, изменяющихся акустических сред или целевых видов с высоким уровнем ошибок классификации. Кроме того, внедрение этих рекомендаций в программное обеспечение биоакустического анализа (версия 1.6)19,31, более доступной и удобной для пользователя по сравнению с средами на основе кодирования32,33, ранее не демонстрировалось.

Рисунок 1: Схематическое представление всего рабочего процесса. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Для устранения этого пробела мы применяем и проверяем протокол, используя крупномасштабные наборы данных, записанные с помощью AudioMoths - ARU (версия 1.2.0)34,35, охватывающих разнообразные среды обитания. Наш основной вид, европейский дрозд (Erithacus rubecula), демонстрирует высокую изменчивость песни и структурнуюсложность 36,37, а также продемонстрировал подверженность ошибочной идентификации в первичных пилотных анализах. Применяя пороги доверия, специфичные для вида и мест, к конфигурации модели распознавания звука птиц на основе машинного обучения в программном обеспечении биоакустикидля анализа 19,31, мы оцениваем протокол при различных акустических условиях, учитывая разные уровни фонового шума и видовые ассамбляжи, и демонстрируем, что оптимизация пороговых параметров может значительно повысить точность обнаружения по сравнению с стандартными настройками. Этот подход в конечном итоге предназначен для обеспечения доступного, упрощённого и эффективного применения модели распознавания звука птиц19 на основе машинного обучения в масштабных PAM-исследованиях с минимальным кодированием.