2026년 4월 11일
이 프로토콜의 목표는 로지스틱 회귀를 사용하여 자동 음향 인식 소프트웨어로 처리된 대규모 음향 데이터셋에서 탐지 정밀도를 높이기 위해 종 및 장소별 신뢰 점수 임계값을 결정하는 것입니다.
저희 연구는 바이오음향 전문가들이 자동화된 음향 종 검출의 정밀도를 향상시키기 위한 프레임워크 개발에 중점을 두고 있습니다. 적절한 설정이 없으면 조류 소리 인식 모델은 발성을 정확히 감지하는 데 어려움을 겪습니다. 이 프로토콜은 종과 장소별 신뢰 점수 임계값을 결정하여 정밀도를 높이는 것을 목표로 합니다.
우선, 각 ARU를 데이터 전송 케이블로 컴퓨터에 개별적으로 연결하고 ARU를 USB 모드로 전환하세요. AudioMoth ARU 장치 설정 애플리케이션을 사용하여 ARU를 설정하여 수면 간격과 활성 녹화 기간을 결정하세요. 목표 종이 가장 활발한 시간대를 식별하고, 그에 맞게 기록 기간을 일정에 맞추세요.
여러 녹음 기간을 추가하고, 첫 번째와 마지막 녹음 날짜를 선택하여 녹음 날짜를 일정에 맞추세요. ARU 장치 구성 애플리케이션을 사용해 장치를 중간 이득으로 48킬로헤르츠 샘플링 속도로 녹음하도록 설정하세요. 각 ARU 기기를 정전기 방지 지퍼백에 넣고, 필요에 따라 추가 방수 테이프를 붙여 물 손상을 방지하세요.
그 후 현장에 ARU 장치를 배치하고 사용자 지정 모드로 전환하세요. 각 탈착식 메모리 카드에서 모든 파동 파일을 컴퓨터로 옮깁니다. Raven Pro 1.6 생물음향 분석 소프트웨어를 열고 도구를 선택한 후 Detector를 선택한 후 드롭다운 메뉴에서 Learning Detector를 선택하세요.
검출기 입력 선택 창에서 탐색(Browse)을 선택하세요. 이어지는 '사운드 파일 열기' 창에서 해당 ARU 폴더 내 모든 파도 파일을 선택하고 '열기'를 클릭하세요. 이 경우 '새 사운드 구성 창'이 열립니다.
새 사운드 구성 창에서 페이지 지정과 페이지 사운드 항목에 각 녹음 길이에 맞는 페이지 크기를 입력하세요. 그 다음 '여러 파일' 아래에서 한 창에서 '파일 형식으로 열기'를 선택하고 확인을 클릭하세요. 파일 시퀀스 열기 팝업과 검출기 입력 선택 창이 나타나 선택한 파일들이 시퀀스에 추가된 것을 보여줍니다. 반환된 검출기 입력 선택 창에서 사용 가능한 신호 및 뷰에서 파형을 선택한 후 화살표 버튼을 사용해 필수 입력으로 이동하세요.
필수 입력 상태가 준비 완료로 바뀌었는지 확인하고 확인 버튼을 클릭하세요. 이 경우 '머신러닝 감지기 구성 창'이 열립니다. 머신러닝 감지기 구성 창 내, 입력 탭에서 모델 선택에서 원하는 모델을 선택하세요. 오버랩은 기본값인 0초로 두세요.
출력 탭을 클릭하세요. 출력 클래스 파일을 위한 드롭다운 메뉴를 열고 연구의 지리적 위치에 대응하는 출력 목록을 선택하세요. 임계값을 0.1로 낮추고 모두 적용을 선택하세요.
종 목록의 모든 임계값이 0.1로 설정되어 있는지 확인하세요. 모든 종을 억제하는 옵션을 선택해 모든 종이 선택됩니다. 목표 종을 찾아서 억제 열에서 선택 해제하세요.
학습 탐지기 처리를 시작하려면 확인을 선택하세요. 진행 상황 관리자를 모니터링하여 완료 비율과 남은 시간을 추적하세요. 저장된 학습 탐지기 선택 테이블을 열고 이를 스프레드시트 소프트웨어로 옮기세요.
라벨 열에 목표 종만 표시되는지 확인하세요. 선택 및 점수 열을 제외한 모든 열을 삭제하세요. 무작위화 함수로 새 열을 추가하고, 그 열을 기준으로 행을 정렬한 후 무작위화 열을 삭제하세요.
처음 300건의 무작위 발견을 유지하거나, 300개 미만이면 모두 유지하세요. 검증 데이터셋을 ARU 이름과 AM1_ValidationDataset 같은 식별자를 사용해 저장하세요. Raven Pro 1.6 생물음향 분석 소프트웨어를 열고 파일을 선택하세요.
그 다음, 사운드 파일을 열어 해당 웨이브 파일을 모두 선택하고 열기를 클릭하세요. 이 경우 '새 사운드 구성 창'이 열립니다. 페이지 설정의 새 사운드 구성 창에서 페이지 사운드를 선택하고 이전에 사용한 페이지 크기를 입력하세요.
다음으로 여러 파일 항목에서 한 창에서 '파일 순서로 열기'를 선택하고 확인 버튼을 누르세요. 이렇게 하면 선택한 파일들이 시퀀스에 추가되고, 여러 선택된 파일들 사이에서 각 파일의 스펙트로그램이 열립니다. 파일로 이동하여 Open Selection Table을 선택하여 분석 중인 ARU의 학습 감지 테이블을 엽니다. 사운드 뷰 왼쪽 패널의 레이아웃 탭과 뷰에서 파형 뷰를 선택 해제하면 모든 파일이 스펙트로그램 뷰로 표시됩니다.
준비된 데이터를 가지고 생체음향 분석 소프트웨어와 함께 검증 스프레드시트를 열어보세요. 스프레드시트에 새 열을 만들고 '올바르게 감지됨'이라고 라벨을 붙이세요. 스프레드시트에서 무작위 목록에서 숫자를 선택하여 스펙트로그램 뷰의 드로우 필드에 입력하세요.
그다음 재생을 클릭하세요. 올바르게 감지됨 열에 1을 입력하세요. 잘못 감지됨은 0을 입력하세요. 정답 검출 수와 검증된 총 검출 수를 이용해 검출기의 정밀도를 계산하고, 100을 곱해 백분율로 표현합니다.
RStudio 소프트웨어를 사용하여 이전 섹션에서 생성된 검증 데이터 세트를 가져오세요. 가족 집합을 이항법으로 사용하여 일반화된 선형 모델링 함수를 사용하여 데이터 집합에 대해 로지스틱 회귀분석을 실행합니다. 원하는 정밀도 확률을 0.9로 설정하여 검출이 진양일 확률이 90% 이상이 되도록 합니다.
예측 값에 대한 적합 로지스틱 회귀 방정식을 풀어 최적의 임계값을 계산하고, 얻은 임계값을 검증합니다. 이전 검출기 설정을 사용해 조사 중인 ARU에서 학습 검출기를 다시 실행하세요. 사운드 파일을 선택하세요.
페이지 크기를 입력하고 한 창에서 '파일 형식으로 열기'를 선택하세요. 다음으로 '검출기 입력 선택 창'에서 파형을 선택한 후 화살표 버튼을 눌러 '필수 입력'으로 이동시키고 확인 버튼을 클릭하세요. 머신러닝 감지기 구성 창의 입력 탭에서 원하는 모델을 선택하고 겹침이 0초로 설정되었는지 확인하세요. 다음으로 출력 탭에서 출력 클래스 파일의 지리적 위치를 선택하고 목표 종의 임계값을 이전 단계에서 결정한 임계값으로 변경한 후 모두 적용을 선택하세요.
그 다음, '모든 종 억제' 옵션을 선택하세요. 대상 종 박스를 해제하고 확인을 클릭하면 진행 관리자 창을 열어보세요. 마지막으로, 최적화된 임계값 값을 사용하여 정확도가 향상되고 거짓 양성이 적은 새로운 탐지 목록을 만듭니다.
리버풀의 한 공원, 케언고름스 국립공원 내 자연재생 숲지, 그리고 글래스고의 교외 지역에서 수집된 유럽 로빈의 음향 데이터 분석 대표 결과는 통계적으로 도출된 신뢰 점수 임계값이 다양한 음향 환경에서 탐지 정밀도를 어떻게 향상시켰는지를 보여주었습니다. 로지스틱 회귀분석을 통해 리버풀 파크 부지의 최적 신뢰 점수 임계값을 0.54, 케언고름스 부지의 0.23을 결정하여 90% 이상의 정밀도를 달성하였습니다. 리버풀 파크와 케언고름스 지점에서 최적화된 임계값을 적용해 검출기를 재가동하면, 0초 및 2초 중첩 조건 모두에서 90% 이상의 검출 정밀도가 향상되었습니다.
글래스고 교외 지점에서 0.36 최적화 임계값으로 검출기를 재가동하면 검출 정밀도가 향상되었으나, 전체 회귀 후 정밀도는 0초 및 2초 중첩 조건 모두에서 90% 미만으로 유지되었습니다. 이 프로토콜은 연구자들이 방대하고 음향적으로 다양한 데이터 세트 내에서 목표 종을 정확하게 탐지할 수 있게 해줍니다. 이 프로토콜은 오탐을 줄이고 탐지 정밀도를 높여주지만, 일부 진정 탐지를 놓칠 수 있어 리콜과 관련된 중요한 절충점을 부각시킵니다.
정확한 탐지 결과가 나온 후, 음성 표현은 소프트웨어 내에서 매개변수 추출과 음향 거동의 추가 분석을 위해 주석을 달 수 있습니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
본 논문은 수동형 음향 모니터링(PAM) 데이터셋에서 자동 조류 발성 검출의 정밀도를 향상시키기 위한 종합적인 프로토콜을 제시합니다. 머신러닝 기반의 검출 방식과 엄격한 수동 검증 및 통계적 임계값 최적화를 통합함으로써, 연구자는 자율 기록 장치(ARU)를 통해 수집된 대규모의 다양한 음향 데이터셋에서 종 특이적 정보를 효율적이고 신뢰성 있게 추출할 수 있습니다.
대규모 데이터셋에서 생물학적 신호를 자동 검출하는 것은 확장 가능한 타겟 검증과 초기 발굴 단계에서의 신뢰도 높은 의사결정에 매우 중요합니다. 본 프로토콜은 로지스틱 회귀를 이용한 통계적 임계값 최적화가 머신러닝 기반 검출의 정밀도를 어떻게 향상시키는지 보여주며, 이는 하위 분석의 신뢰성에 직접적인 영향을 미칩니다. 이러한 접근 방식은 복잡한 환경에서 강건하고 재현 가능한 데이터 추출을 지원하여, 보다 정보에 기반한 포트폴리오 선별 및 위험 조정 추진을 가능하게 합니다.
본 프로토콜은 초기 발굴부터 스크리닝, 그리고 중개 연구까지 통합하여, 각 전환점마다 강력한 데이터 기반 의사결정을 지원합니다.