Las vocalizaciones animales ofrecen valiosas perspectivas sobre el mundo natural y actúan como poderosas herramientas biológicas, permitiendo a los investigadores investigar diversos aspectos de la vida animal1. El campo de la bioacústica se ha vuelto cada vez más importante en el monitoreo y conservación de la biodiversidad, ayudando en la identificación de especies y en la evaluación de tendencias poblacionales y la salud delos ecosistemas 2,3,4. Este campo de investigación también contribuye a nuestra comprensión del comportamiento animal, por ejemplo, en comunicación y uso de hábitats 5,6. Más recientemente, se ha demostrado que es un enfoque prometedor para evaluar el bienestaranimal 7,8.
Una de las principales ventajas de utilizar el análisis acústico como herramienta de investigación son los recientes avances tecnológicos en unidades autónomas de registro (ARUs), que permiten a los investigadores monitorizar vocalizaciones animales de forma no invasiva y remota durante largos periodos de tiempo, una técnica conocida como monitorización acústica pasiva (PAM)9. Esto ha permitido la recopilación de datos de especies crípticas sin intervención humana10,11. Además, las ARUs son rentables y minimizan la necesidad de que los investigadores formados estén en el campo9. Un estudio sobre el críptico chotacabras europeo (Caprimulgus europaeus) demostró estas ventajas, descubriendo que el uso de ARUs era significativamente más efectivo que el de observadores humanos para detectar la especie12. Los estudios de bioacústica a gran escala están ganando cada vez más popularidad porque pueden aportar información sobre una variedad de aspectos ecológicos y conductuales, además de ser muy aplicables y muy adecuados para estudios de campo. Sin embargo, que las ARUs funcionen durante largos periodos significa que los investigadores inevitablemente se enfrentan al reto de procesar de forma eficiente y fiable grandes cantidades de datosacústicos 13.
Más recientemente, los investigadores han comenzado a combinar PAM con el uso de herramientas de reconocimiento automático para detectar especies dentro de grandes conjuntos de datos, mejorando y acelerando el procesamiento general de datos. Estas técnicas reconocen y clasifican automáticamente las especies basándose en el tipo de vocalización13, a menudo utilizando modelos de aprendizaje automático y aprendizaje profundo como redes neuronales artificiales, que han ganado popularidad en los últimosaños 14. La fiabilidad del software de reconocimiento automático suele ser superior a los métodos manuales de detección de especies, como demuestran estudios sobre las vocalizaciones de panda gigante (Ailuropoda melanoleuca) 15 y la especie de ranamalaya 16. Es importante destacar que uno de los principales factores detrás de la adopción de estos enfoques es la velocidad de procesamiento, especialmente a medida que el volumen de datos acústicos generados por PAM siguecreciendo 13. El análisis manual de grandes conjuntos de datos acústicos es ineficiente e impráctico a gran escala, pero las herramientas de reconocimiento automatizado pueden procesar grabaciones en una fracción del tiempo requerido por un observador humano. Por ejemplo, un estudio informó que 257 horas de escaneo visual manual equivalían a 1 hora de tiempo de procesamiento usando BirdNET (modelo de reconocimiento acústico aviar basado en aprendizaje automático)17.
Este modelo de reconocimiento acústico aviar basado en aprendizaje automático es una de esas herramientas que recientemente ha ganado popularidad por su uso en ornitología y otros estudios de acústica; es un software automatizado accesible para la identificación de especies de aves que se basa en un modelo de aprendizajeprofundo 18,19. La mayoría de los estudios hasta la fecha han utilizado el modelo de reconocimiento sonoro aviar basado en aprendizaje automático para generar listas de especies para un área determinada, y con validación humana se ha demostrado detectar el 89% de las especies en una comunidad, mientras que requiere menos de una cuarta parte del tiempo utilizado solo por el escaneovisual 17. Este modelo de reconocimiento sonoro aviar basado en aprendizaje automático también ha demostrado identificar eficazmente la presencia de una especie objetivo específica en una zona, como el avetoro euroasiático (Botaurus stellaris), con una tasa de éxito del 93,7%20. Sin embargo, este modelo suele tener una tasa de éxito mayor cuando se combina con validación manual y aún no es fiable como herramienta de deteccióntotalmente automática 21. También existen otros desafíos a considerar según Wood y Kahl21 respecto a la producción de predicciones sin unidades.
El módulo detector de aprendizaje automático asigna a cada vocalización de ave detectada una puntuación de confianza cuantitativa entre 0 y 1, lo que indica cuán seguro está el software de que el sonido detectado ha sido correctamente identificado como una especieparticular 18,19,21. La precisión, definida como la proporción de detecciones que son verdaderas positivas (es decir, identificaciones correctas), es una métrica clave influenciada por estapuntuación 22. En consecuencia, una puntuación de confianza más alta puede producir menos detecciones, pero con mayor precisión, aunque detectar errores especialmente en entornos ruidosos, y una puntuación más baja puede producir más detecciones con menor precisiónsegura 22,23. La relación entre las puntuaciones de confianza y la precisión es compleja; a menudo se encuentra que algunas puntuaciones de confianza altas pueden ser falsos positivos, por ejemplo en lugares con altos niveles de ruido de fondo, o en especies que probablemente imiten vocalizaciones de otrasespecies 23,24. Debido a la variabilidad en la precisión entre especies y ubicaciones, es posible durante el proceso de configuración asignar umbrales individuales de puntuación de confianza a cada especie de ave, de modo que solo se etiquetarán las detecciones con puntuaciones superiores a ese umbral. Se podría aplicar un umbral alto de puntuación de confianza universal en todas las especies y ubicaciones, sin embargo, hacerlo suele aumentar el número de falsos negativos (identificaciones perdidas)22,25,26, mientras que el número de falsos positivos varía entre especies y con diferencias ambientales entre registros.
Varios estudios y guías de buenas prácticas describen distintos métodos para determinar un umbral óptimo de puntuación de confianza al que ejecutar el módulo detector de aprendizaje automático para especies y ubicaciones específicas de estudio, permitiendo que las detecciones sean aceptadas con mayor confianza como verdaderos positivos 21,24,26,27,28. Un enfoque consiste en calcular puntuaciones F a lo largo de un rango de umbrales de confianza y seleccionar el umbral que maximice la puntuación F, equilibrando tanto la precisión como la memoria29,30. Un enfoque alternativo, que permite la calibración de probabilidad, consiste en validar manualmente un subconjunto aleatorio de predicciones y ajustar una regresión logística para establecer una relación entre el resultado de validación binaria (detección verdadera/falsa) y la puntuación de confianzaasociada 21. Este método puede utilizarse para determinar umbrales específicos de contexto, que pueden ajustarse según especies y condiciones ambientales (por ejemplo, variando el ruido de fondo)19. Estos métodos se han aplicado en estudios de monitorización acústica pasiva en monos gris aulladores de Yucatán (Alouatta pigra), lobos grises (Canis lupus) y coyotes (C. latrans)27,28.
El objetivo de este artículo de métodos es demostrar y validar una metodología escalable para extraer de forma precisa y fiable datos vocales específicos de especies a partir de grandes conjuntos de datos acústicos utilizando el modelo de reconocimiento sonoro aviar basado en aprendizaje automático dentro del software de análisis bioacústico Raven Pro (ver 1.6)19,31. Este enfoque incorpora el cálculo de umbrales apropiados de puntuación de confianza siguiendo las21 directrices de buenas prácticas de Wood y Kahl. Aunque estas directrices21 proporcionan un marco integral para aplicar las puntuaciones de confianza dentro del modelo19 de reconocimiento acústico aviar basado en aprendizaje automático, se presentan principalmente como recomendaciones de mejores prácticas. Pocos estudios han operacionalizado estos procedimientos en sistemas de estudio ARU distribuidos bajo restricciones realistas de monitorización, donde las condiciones acústicas y el ruido de fondo varíanespacialmente 22. Este protocolo (Figura 1) es especialmente adecuado para estudios de monitorización acústica pasiva a gran escala que involucran múltiples sitios, entornos acústicos variables o especies objetivo con altas tasas de clasificación incorrecta. Además, la implementación de estas directrices en el software de análisis bioacústico (ver 1.6)19,31, una plataforma más accesible y fácil de usar en comparación con entornos basados encodificación, no se había demostrado previamente.

Figura 1: Representación esquemática de todo el flujo de trabajo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Para cubrir esta brecha, aplicamos y validamos el protocolo utilizando conjuntos de datos a gran escala grabados con AudioMoths - ARUs (ver 1.2.0)34,35, en una amplia variedad de hábitats. Nuestra especie focal, el petirrojo europeo (Erithacus rubecula), presenta alta variabilidad del canto y complejidadestructural 36,37, y demostró susceptibilidad a la identificación errónea en los análisis piloto iniciales. Aplicando umbrales específicos de puntuación de confianza por especie y sitio a la configuración del modelo de reconocimiento sonoro aviar basado en aprendizaje automático dentro del software de análisisbioacústico 19,31, evaluamos el protocolo bajo condiciones acústicas variables, incorporando distintos niveles de ruido de fondo y ensamblajes de especies, y demostramos que adaptar la optimización de umbrales puede mejorar sustancialmente la precisión de detección en comparación con la configuración predeterminada. Este enfoque está diseñado para facilitar la aplicación accesible, simplificada y eficiente del modelo de reconocimiento acústicoaviar basado en aprendizaje automático 19 en estudios PAM a gran escala, con una codificación mínima.