이 연구는 L1-L2-영어와 L1-L2 포르투갈어를 비교하여 외국어 억양의 영향이 메트릭과 운율-음향 매개변수, 음성 라인업에서 대상 음성 선택을 얼마나 설명하는지 확인하는 것을 목표로 했습니다.
방법 논문
이 연구는 L1-L2-영어와 L1-L2 포르투갈어를 비교하여 외국어 억양의 영향이 메트릭과 운율-음향 매개변수, 음성 라인업에서 대상 음성 선택을 얼마나 설명하는지 확인하는 것을 목표로 했습니다.
본 연구는 외국어 억양의 영어와 외국어 억양의 브라질 포르투갈어의 운율-음향 특징과 지각적 상관관계를 모두 조사하고, 화자의 외국어 억양과 원어민 억양이 청취자의 인식과 어떤 상관관계가 있는지 확인하는 것을 목표로 합니다. 방법론에서는 L2 브라질 포르투갈어를 구사하는 미국인 그룹과 L2 영어를 구사하는 브라질 사용자 그룹과 함께 음성 생성 절차를 수행했으며, 두 언어에 대한 음성 라인업을 수행하는 음성 인식 절차를 수행했습니다. 음성 생성 통계 분석을 위해 Generalized Additive Model을 실행하여 반대 부류의 공변량(들)의 평활화 효과에 대해 제어되는 기능의 각 클래스(미터법 또는 운율-음향학)에 대한 언어 그룹의 효과를 평가했습니다. 음성 인식 통계 분석을 위해 Kruskal-Wallis 테스트와 사후 Dunn's 테스트를 실행하여 청취자가 판단한 점수에 대한 라인업의 목소리가 미치는 영향을 평가했습니다. 그럼에도 불구하고 우리는 코사인과 유클리드 거리를 기반으로 음향(음성) 유사성 테스트를 수행했습니다. 결과는 f0, 지속 시간 및 음성 품질의 가변성 측면에서 언어 그룹 간에 상당한 음향적 차이를 보여주었습니다. 라인업의 경우, 결과는 f0, 강도 및 음성 품질의 운율적 특징이 청취자의 인지된 판단과 상관관계가 있음을 나타냈습니다.
억양은 모국어(L1)와 외국어(L2) 모두에서 의사 소통과 유창함의 두드러지고 역동적인 측면입니다1. 외국어 악센트는 대상 언어의 L2 음성 기능을 나타내며 화자의 L2 경험, 말하기 스타일, 입력 품질, 설명 등에 따라 시간이 지남에 따라 변경될 수 있습니다. 외국어 악센트는 외국어 화자가 생성한 L2 음성과 대상 언어의 현지 또는 참조 악센트 간의 (스칼라) 차이 정도2,3,4,5.
이 연구는 외국어 억양의 영어와 외국어 억양의 브라질 포르투갈어(BP)의 운율-음향 특징과 지각적 상관관계를 조사하고, 화자의 외국어 및 원어민 억양이 청취자의 인식과 어느 정도 상관관계가 있는지 확인하는 것을 목표로 합니다. 법의학 분야의 선행 연구에서는 외국어 억양 식별에서 모음과 자음의 견고성이 개인에 대한 장기 분석(The Lo Case6) 또는 화자의 높은 ID 정확도(The Lindbergh Case7)를 참조하여 안정적임을 입증했습니다. 그러나 지속 시간, 기본 주파수(f0, 즉, 피치의 음향 상관 관계), 강도 및 음성 품질(VQ)을 기반으로 하는 운율 음향 기능에 대한 탐색이 점점 더 주목을 받고 있습니다8,9. 따라서 이 연구에서 운율-음향 기능에 대한 선택은 법의학 음성학 분야에서 유망한 길을 나타냅니다8,10,11,12,13.
본 연구는 법의학 사례에서 음성 위장의 한 형태로 외국어 억양에 관한 연구14,15, 화자 인식을 위한 음성 라인업 준비16,17. 예를 들어, 말하기 속도는 독일어, 이탈리아어, 일본어 및 브라질어 영어 사용자를 식별하는 데 중요한 역할을 했습니다18,19,20,21,22. 말하기 속도 외에도, 장기 스펙트럼 및 f0 기능은 뇌와 인지 기반이 기억력, 주의력 및 감정의 결핍을 겪기 때문에 장기 스펙트럼 및 f0 기능은 긴 말하기 회전 동안 화자의 음성 수행에 반영되기 때문에 대상 언어에 익숙한 L2 능숙한 사용자에게 도전23. 법의학 분야에서 외국어 억양에 대한 견해는 실제로 외국어 억양처럼 들리는 것에 대한 정의는 극단적이지 않은 정도의 외국어 억양이 있는 말투를 갖는 것보다 듣는 사람의 낯설음에 크게 좌우된다는 것입니다24.
지각 영역에서 1990년대 중반부터 범죄자 인식을 위해 사용된 일반적인 포렌식 도구는 범죄 현장에서 범인을 식별하는 데 사용되는 시각적 인식과 유사한 Voice Lineup(청각 인식)입니다16,25. 음성 라인업에서 용의자의 목소리는 목격자가 식별할 수 있도록 나이, 성별, 지리적 위치, 방언 및 문화적 지위와 같은 사회 언어학적 측면에서 유사한 호일 목소리와 함께 제시됩니다. 음성 라인업의 성공 또는 실패는 음성 샘플의 수와 샘플 지속 시간에 따라 달라집니다.25,26. 또한 실제 샘플의 경우 오디오 품질이 음성 인식의 정확도에 지속적으로 영향을 미치는 것으로 간주됩니다. 오디오 품질이 좋지 않으면 voice27의 고유한 특성이 왜곡될 수 있습니다. 음성 유사성의 경우 f0을 기반으로 하는 미세한 음성 세부 정보는 음성 인식 중에 청취자를 혼동할 수 있습니다28,29. 이러한 음향 기능은 f0를 넘어 확장되며 지속 시간 요소와 강도 및 VQ30의 스펙트럼 기능을 포함합니다. 여러 운율 기능에 대한 이러한 보기는 정확한 화자 식별을 보장하기 위해 포렌식 음성 비교의 맥락에서 매우 중요합니다9,14,15,29,31.
요약하면, 법의학 음성학의 연구는 지난 수십 년 동안 외국어 억양 식별과 관련하여 약간의 변화를 보여주었습니다. 한편으로는, 외국어 억양은 화자를 식별하는 과정에 영향을 미치지 않는 것 같습니다32,33 (특히 화자가 대상 외국어 억양에 익숙하지 않은 경우34). 반면에 반대 방향의 결과가 있습니다12,34,35.
이 연구는 인간 연구 윤리 위원회의 승인을 받았습니다. 또한, 본 연구에 참여한 모든 참가자로부터 자신의 데이터를 사용하고 게시하기 위해 정보에 입각한 동의를 얻었습니다.
1. 음성 제작
참고: 그룹 1: The American English (from the U.S.A.) Speakers (AmE-S)와 Group 2: The Brazilian Speakers (Bra-S)가 제작한 'L1 BP-L2 English'에 대한 읽기 과제에서 음성을 수집했습니다. 음성 생성을 위한 순서도는 그림 1을 참조하십시오.

그림 1: 음성 생성을 위한 회로도 순서도. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 2: MAUS 강제 정렬기를 사용한 음성 정렬의 스크린샷. (A) 점선 사각형은 'my_file.wav'/' my_file.txt' 파일을 드래그 앤 드롭하거나 내부를 클릭하여 폴더에서 해당 파일을 검색하기 위한 것입니다. 업로드 버튼은 빨간색 화살표로 표시됩니다. (B) 패널 A에서 업로드된 파일(파란색 화살표 참조), 사용할 파이프라인, 파일 쌍의 언어, 반환할 파일 형식 및 모든 파일을 보관하기 위한 'true/false' 버튼. (C) 사용 확인란 사용 약관(녹색 화살표 참조), 웹 서비스 실행 버튼 및 결과(다운로드할 TextGrid 파일). 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: 재정렬 절차의 스크린샷. (A) 재정렬 절차를 위한 입력 설정 양식. (B) 부분 파형, f0(파란색) 윤곽이 있는 광대역 스펙트로그램, 계층 1로 분할된(및 레이블링된) 6개 계층: 다음 모음 시작까지의 모음 시작 단위(V_to_V); 모음 시작 (V_to_V); Tier 2 : 모음 (V), 자음 (C) 및 일시 중지 (#)의 단위; Tier 3 : 음성 표현 V_to_V; Tier 4 : 텍스트의 일부 단어; 계층 5: 텍스트에서 음성의 일부 청크(CH); 티어 6: 여성 AmE-S가 생성한 각 음성 청크의 가장 높은(H) 톤과 가장 낮은(L) 톤을 포함하는 톤 계층입니다. (C) 음향 기능의 자동 추출을 위한 입력 설정. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
2. 음성 인식
참고: 미국 청취자를 대상으로 4개의 영어 음성 라인업을, 브라질 청취자를 대상으로 BP에서 4개의 음성 라인업을 수행했습니다. 음성 인식을 위한 순서도는 그림 4를 참조하십시오.

그림 4: 음성 인식을 위한 개략적인 순서도. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 5: 음성 인식을 위한 디렉토리 설정. 라인업 폴더. 각 폴더에는 6개의 L1 음성, L2 대상 음성, "CreateLineup" 스크립트 및 음성 라인업 오디오 파일(스크립트 실행 후 반환됨)이 포함되어 있습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
음성 생성 결과
이 섹션에서는 통계적으로 유의미한 운율-음향 기능과 리듬 메트릭의 성능을 설명했습니다. 이러한 운율적 특징은 지속 시간과 관련된 음성, 조음 및 일시 중지 속도와 음성 품질과 관련된 쉬머였습니다. 리듬 메트릭은 음절 길이의 표준 편차(SD), 자음의 SD, 음성 또는 자음 길이의 SD, 음절 길이의 변동 계수였습니다(보충 표 S1 참조).
음성 속도(그림 6A)는 L1-L2 BP보다 L1-L2 영어에서 더 빠르게 감소하지만 두 L2 모두 속도가 더 낮습니다. 말하기 속도는 음절 길이의 SD(SD-S), 모음의 SD(SD-V) 및 음절 변동 계수(Varco-S)의 세 가지 메트릭과 관련이 있습니다. AmE-S와 Bra-S 그룹 모두 L2에 능숙하다는 점을 명심하는 것도 중요합니다. 이러한 속도는 음절 지속 시간의 더 높은 값과 L1-L2 BP에 의해 생성되는 더 낮은 변동성의 영향을 받아 덜 가파른 기울기를 유발하는 것으로 보입니다.
조음 속도(그림 6D)는 SD-S, Varco-S 및 음절 리듬 비율(RR-S)과 관련이 있으며, 후자는 짧은 음절과 긴 음절 사이의 비율을 나타냅니다. 이러한 메트릭은 문장 길이와 지속 시간의 변화로 인해 영향을 받는 음성 속도와 마찬가지로 조음 속도에 영향을 미치는 것으로 보이며 L2 인지 부하9,23,54. 운율-음향 매개변수가 영향을 받는 방식으로 문장 길이 영역에서 더 높은 인지-언어 부하가 필요할 수 있습니다55.
말하기 및 조음 속도의 운율-음향 특성과 관련하여, 우리의 연구 결과는 화자가 음절(및 모음)의 지속 시간을 더 많이 변화시킬수록 그러한 비율이 낮아진다는 것을 시사합니다. 우리는 L1 및 L2 BP의 음성 인식이 L1 및 L2-영어보다 다소 느리게 들리고 L1-영어가 다른 모든 언어 수준보다 빠르게 들린다는 가설을 세웠습니다. 이 사실은 언어 리듬 및 L1-L2 BP가 리듬 연속체의 음절 타이밍 극 쪽으로 기울어지는 반면 L1-L2 영어는 스트레스 타이밍 극 쪽으로 이동한다는 가설과 관련이 있을 수 있습니다21,22.
로컬 쉬머 그림 6B는 SD-S 및 Varco-S의 영향을 받습니다. 로컬 쉬머의 경우, Bra-S, L1-BP 및 L2-English의 두 작품은 음절 지속 시간의 가변성이 증가함에 따라 다소 단조로운 궤적을 나타냅니다(SD 및 Varco, 보충 표 S1 참조). 보컬 노력에 대한 인식은 8.5dB에서 9dB 사이의 낮은 변화로 인해 Bra-S의 프로덕션을 들을 때 분명할 수 있습니다. 브라-S 말은 목소리 부하의 영향을 받습니다. L1-BP는 문장 길이가 음절 길이의 높은 변화에 덜 민감하다는 점에 큰 영향을 받습니다(BP 리듬 패턴은 음절 변화가 적음22,56).
일시정지 속도(그림 6C)는 L2-영어 사용자가 L1-English, L1-BP 및 L2-BP보다 더 긴 일시 중지(200ms에서 375ms)를 생성한다는 것을 보여줍니다(L1-English의 경우 평균 30ms, L1-BP의 경우 50ms, L2-BP의 경우 100ms). 이 경우 음성 계획은 뇌 활동 증가로 인해 L2-영어 생성에 영향을 미쳤을 수 있습니다54,57. 언어 능력이 높을수록 읽기 속도와 span54; 그럼에도 불구하고, L2에 능숙한 화자들조차도 읽기 과제는 외국어 말의 고차원적 인지적 측면과 언어 처리에서 더 많은 노력을 기울였습니다54,57. 우리의 연구 결과는 적어도 예비적으로는 L2-BP 화자가 L2-영어보다 두 언어의 리듬 패턴의 차이로 인해 일시 중지의 영향을 덜 받을 수 있음을 보여줍니다.

그림 6: 운율-음향 기능에 대한 일반화된 덧셈 모델. Y축에서 응답 변수(모델링할 음향 기능); X축에서 예측 변수(곡선의 모양과 궤적을 제공할 덧셈 모델의 요인 'Language' 및 공변량(즉, 평활 효과: 'Language + covariates'), 'Language'의 곱 및 응답 변수의 보다 정확한 투영을 제공하는 메트릭 기능(즉, factor-smooth interactions: 'covariate:Language')를 사용합니다. 약어: GAMs = Generalized Additive Models. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
리듬 메트릭과 관련하여 SD-S(그림 7A)의 경우 화자가 f0 곡선을 더 많이 변경하고 말하기 속도를 증가시킬수록 모든 언어 수준에서 SD-S가 더 많이 감소하는 것으로 나타났습니다(그림 6A). 자음용 SD(SD-C, 그림 7C)의 경우, L1-BP는 L1 영어와 달리 말하기 속도 또는 일시 중지 시간이 증가함에 따라 낮은 변동을 수행합니다. 음절 지속 시간의 L1-영어 변동성이 (통계적으로) L1-BP44,58보다 (통계적으로) 훨씬 높기 때문에 이러한 SD 방향이 예측됩니다. Varco-S(그림 7B 및 보충 표 S1)는 동일한 언어 그룹의 L1 및 L2와 어느 정도 상관관계가 있는 것으로 보입니다. f0 변동성과 말하기 속도가 증가함에 따라 L1-BP에 대해 Varco-S가 감소하고 L2-BP에 대해 감소 및 감쇠되는 것으로 보입니다. 영어 프로덕션의 경우 f0 가변성과 음성 속도가 증가하는 반면 Varco-S는 L1-English 및 L2-English에서 증가하고 감쇠됩니다.
모음 또는 자음의 SD(SD-V_C, 그림 7D 및 보충 표 S1)와 관련하여, 우리의 결과는 Varco-S 성능과 몇 가지 유사점을 보여줍니다(그림 7B). 예를 들어, 음성 속도, 일시 중지 시간 및 f0 변동성이 높을수록 L1-BP 및 L2-BP에 대한 SD-V_C의 하강-상승 궤적이 촉진됩니다. 영어 작품에서는 이러한 운율 기능이 더 높지만 SD-V_C은 약간 감소하고 L1-English에 대해 감쇠되고 약간 증가한 다음 L2-English에 대해 감쇠됩니다. 동일한 언어 그룹의 L1-L2에 대한 Varco-S 및 SD-V_C 상관 관계는 배경 소음으로 인한 음성의 음향 매개 변수 변경을 나타내는 롬바르드 효과에 의해 부분적으로 설명 될 수 있습니다 59.
외국어 연설에서 작업의 복잡성(예: 음성 읽기)에 따라 화자는 L1 및 L2 모두에서 유사한 음향 전략을 사용했습니다59,60. 한편으로, Marcoux와 Ernestus는 L2 롬바르디아어 연설에서 f0 측정(범위 및 중앙값)이 L2 영어 사용자가 L1 Dutch61,62의 영향을 받았다는 것을 시사합니다. 반면에, 보다 최근의 연구 결과에 따르면 L2 롬바드어 말은 L2를 말할 때 인지 부하가 높기 때문에 L1 롬바드어 말과 다를 것으로 예상되지만 L2 영어 사용자는 L1 영어 화자와 같은 방향으로 롬바드어 말을 생성했습니다63. 우리의 연구 결과가 Marcoux 및 Ernestus63과 일치하고 Waaning59, Villegas et al.60 및 Marcoux 및 Ernestus61,62와 일치하는 정도는 추가 조사가 필요합니다.

그림 7: 메트릭 기능에 대한 일반화된 덧셈 모델. Y축에서 응답 변수(모델링할 메트릭 기능); X축에서 예측 변수(곡선의 모양과 궤적을 제공할 덧셈 모델의 요인 'Language' 및 공변량(즉, 평활 효과: 'Language + covariates'), 'Language'의 곱 및 응답 변수의 보다 정확한 투영을 제공하는 메트릭 기능(즉, factor-smooth interactions: 'covariate:Language')를 사용합니다. 약어: GAMs = Generalized Additive Models. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
음성 인식 결과
BP 음성 라인업과 관련하여, 라인업 #1 (그림 8A)에서 포일 음성 #3이 대상 음성으로 판단되었다. 사실, 타겟 목소리는 목소리 # 4였습니다. 결과는 포일 #3(83%)과 대상 음성 #4(71%) 사이에 통계적으로 유의미한 차이가 없음을 보여주었습니다(보충 표 S1 참조). 라인업 #2(그림 8B)에서 대상 음성 #3(40%)과 포일 #4(20%)를 비교한 결과, 영어 음성 라인업에 대해 통계적으로 유의미한 차이는 없었습니다(보충 표 S1 참조). 라인업 #1(그림 9A)에서는 포일 #2(26%)와 타겟 보이스 #4(54%) 사이에 유의미한 차이가 없었다(보충 표 S1 참조).
음성 유사성 분석에서 코사인 유사성(CoSim)과 유클리드 거리(EucDist, [EucDist transformed]54) 모두 포일 #3과 BP 라인업 #1의 목표(CoSim = 0.99; 유크디스트 = 77.4, [0.93]). 포일 #4와 타겟 사이의 상관관계는 BP 라인업 #2에서도 비슷하게 강했습니다(CoSim = 0.99, EucDist = 76.3, [0.93]). 영어 라인업 #1에서 CoSim은 상관관계가 일관되었지만(0.83(), EucDist(213.0, [0.47])는 미약하거나 만족스럽지 않았습니다. 전반적으로 CoSim과 EucDist는 모두 음성 유사성을 결정하는 데 만족스러운 기술이었습니다. 또한 CoSim은 Gahman과 Elangovan52(보충 표 S1 참조)에서 언급한 것처럼 약간 더 효과적으로 수행되었습니다.
유사성 측면에서 무엇이 오경보의 증가로 이어질 수 있었습니까? 운율-음향 특징은 그림 8A,B 및 되었지만>그림 9A-청취자의 선택은 다른 라인업의 다른 포일에 따라 다소 다양화되었다(그림 8C,D 및 그림 9B-D)를 사용합니다. 이러한 판단은 전체 부류의 운율-음향 기능보다 화자가 공유하는 하나(또는 그 이상)의 특정 음향 기능에 더 의존하는 것 같습니다. 예를 들어, 우리의 연구는 프로덕션마다 다른 몇 가지 기능을 제시했습니다. 그럼에도 불구하고 지각 결과는 대상 음성과 일치하는 특정 호일에 대한 판단의 선호도를 보여줍니다8,35,64,65. 향후 연구에서 추가 분석이 필요합니다.
이 연구에서 제시된 것과 같이 음향 유사성을 위한 다차원 파라메트릭 행렬의 선택을 고려하는 것은 주목할 만합니다66. 본 연구의 결과는 f0, VQ 및 intensity9,35를 기반으로 음향 기능을 사용한 이전 연구와 일치합니다. 이러한 기능은 포렌식 분야의 화자 비교 작업에 현저하게 제안됩니다9,66. 그럼에도 불구하고 현재 연구에서는 외국어 억양 화자 인식을 위한 음성 라인업을 준비할 때 McFarlane의 지침16,17의 변형을 사용했지만 대상 음성과 유사한 포일이 없는 것으로 예측되었다는 점을 강조하는 것이 중요합니다. 또한, 우리의 음성 라인업 절차에는 자극 길이, 목소리 수, 포일 선택(여기서는 무작위), 연설 스타일 등 McFarlane의 지침과 중요한 차이점이 포함되어 있다는 점을 강조해야 합니다.
f0의 운율-음향 특성, 목소리 품질 및 강도가 청취자의 인식과 어느 정도 관련이 있는지는 연구에 사용된 말하기 스타일에 따라 크게 달라집니다. 여기서 우리는 읽기 구절을 사용했습니다. 대부분의 귀증인 연구는 (반) 자발적 자극을 균형 잡힌 해결책으로 선택하는데, 예를 들어 현대 귀증인 조사에 광범위하게 사용되어 온 DyVis corpus6728,68. 우리가 읽기 과제를 선택하게 된 이유는 이 원고가 작성될 당시 우리의 말뭉치가 읽기 과제에서 얻은 데이터로만 구성되어 있었기 때문입니다. 그러나 (반) 자발적인 말뭉치를 컴파일하는 과정이 이미 진행 중임을 인정하는 것이 중요합니다. 더욱이, 이야기를 읽는 행위는 화자 내부와 화자 간 모두에서 신뢰할 수 있는 수준의 균일성과 다양성을 생성할 수 있습니다. 이것은 음성 비교와 관련된 운율 또는 음성 특성(개별 또는 방언 상황)에 대한 강조를 용이하게 합니다. 이것은 능숙한 화자들 사이에서도 8,9,23,54
.
그림 8: 브라질 청취자가 수행한 4개의 라인업에 대한 결과를 포함하는 막대 플롯. (A,B) 대상 음성(파란색)과 포일(연한 파란색) 간의 중요하지 않은 차이입니다. (C,D) 포일 및 대상 음성과 상당한 차이점. 약어: NS = 중요하지 않음. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 9: 미국 청취자가 수행한 4개의 라인업에 대한 결과를 포함하는 막대 플롯.(A) 대상 음성(빨간색)과 호일(분홍색) 간의 유의미한 차이. (비, 씨, 디) 포일과 대상 목소리와 상당한 차이가 있습니다. 약어: NS = 중요하지 않음. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
보충 표 S1: 음성 생성 통계 - 일반화 덧셈 모델(GAM): F-통계(자유도), 통계적으로 유의한 각 운율-음향 특성의 조정된 R2(그림 6) 및 리듬 메트릭(그림 7)을 언어 수준별로 지정하고, 각 평활 항의 개별 값(공변량)을 사용할 수 있습니다. 음성 인식 통계: Kruskall-Wallis χ2 통계(자유도), p-값 및 조정된 η2, 그리고 타겟-포일 음성 쌍( 및 그림 9) 간의 통계적으로 유의하지 않은 각 차이에 대한 쌍별 비교(<>>그림 9A). 각 라인업의 코사인 및 유클리드 거리에 대한 음향 유사성 매트릭스. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
현재 프로토콜은 (법의학) 음성학 분야에서 참신함을 제시합니다. 생산(음향 분석)과 지각(판단 분석)의 두 단계로 나뉩니다. 생산 분석 단계는 통계 외에 데이터 준비 및 강제 정렬, 재정렬 및 운율-음향 특징의 자동 추출로 구성됩니다. 이 프로토콜은 주로 수동 세분화를 기반으로 하는 기존 프로토콜보다 더 빠르고 효율적인 방식으로 데이터 수집 단계를 데이터 분석에 연결합니다.
그러나 프로토콜 단계 1.3.6 - 1.3.6.9에 표시된 재정렬 프로세스는 기본적으로 프로토콜 단계 1.3.1 - 1.3.4에서 생성된 전화 및 워드 유닛에서 작동합니다. 재정렬 프로세스의 참신함은 음절 계층, 단어를 기반으로 자동 또는 수동으로 생성할 수 있는 음성 청크 계층, f0 측정값을 계산하는 데 매우 유용할 수 있는 톤 계층의 세 가지 새로운 텍스트 계층을 포함하는 새로운 TextGrid를 생성한다는 것입니다. 이 프로토콜에 대해 제안된 재정렬 지침은 이전에 L2 음성 리듬 연구(21,69,70), 기계 학습 기술을 사용한 외국 억양 정도 감지 연구(22) 및 법의학 영역 연구(9)에서 사용되었습니다.
프로토콜 단계 1.3.7 내지 1.3.7.10에 제시된 운율 특징의 자동 추출은 현재 연구에서 입증될 수 있는 운율-음향 특징의 다차원 매트릭스를 생성합니다. 이러한 특징은 멜로디, 지속 시간 및 스펙트럼(음성 품질 및 강도) 음성 특징(71)을 포함한다. 이들 음향 특징들 중 상당수는 덜 민감하고 법의학 또는 임의의 다른 시나리오에서 최종적으로 수집되는 시끄러운 오디오 녹음에 대해 다소 견고하다72. 또한 다차원 매트릭스는 여러 AI 기술을 통해 음성 인식 시스템에 적용될 수 있습니다(작업 진행 중). L2 발음 수업21 (진행 중인 작업)에서 운율 측면을 가르치는 데 여전히 매우 유용할 수 있습니다.
프로토콜의 이 부분에 대한 통계 분석은 특정 음향 기능과 여러 언어 요소 화자 간의 복잡한 관계를 다루었기 때문에 GAM 방법의 사용을 나타냅니다. 예를 들어, 특정 음향 특징을 모델링하려면 음성 생성 중에 일어나는 일을 보다 정확하게 설명할 수 있도록 매트릭스의 다른 음향 특징(부드러운 항)이 어떻게 수행되는지 확인해야 했습니다.
지각 분석과 관련하여 현재 프로토콜은 음성 라인업, 통계 분석 및 음향 유사성 분석을 준비 및 구현하여 구성되었습니다. 라인업을 준비하기 위해 프로토콜 단계 2.2에서 2.2.1.9에 설명된 대로 무작위로 시퀀싱된 포일과 대상 음성이 포함된 각 라인업에 대한 오디오 파일을 자동으로 생성하는 Praat용 CreateLineup 스크립트를 사용했습니다.
이 프로토콜의 통계 분석을 위해 데이터가 분산 분석(ANOVA) 가정을 충족하지 못했기 때문에 Kruskal-Wallis 비모수 테스트를 실행했습니다. 청취자가 평가하고 대상 음성과 포일에 대해 제어한 판단 점수 간의 관계가 생기면 선형 모델 통계를 사용하기로 결정했습니다.
음향 유사성 분석을 위해 Python용 AcousticSmilarity_cosine_euclidean 스크립트를 사용했습니다. 이 프로그램은 컴퓨터의 디렉토리 트리를 팝업하고 사용자에게 포일의 운율 음향 특징과 분석에서 라인업을 구성하는 대상 음성이 포함된 파일을 선택하도록 요청합니다. 버튼을 클릭하면 스크립트는 '.txt'(탭으로 구분됨) 및 '.csv' 파일 모두에서 코사인, 유클리드 및 변환된(0에서 1로) 유클리드 등 세 가지 유사성 행렬을 생성합니다. 우리는 여전히 모든 데이터 세트(포일과 타겟의 운율-음향 특징을 포함하는 '.txt' 파일)가 라인업의 원래 폴더에 있어야 하며 모든 라인업 폴더에는 AcousticSmilarity_cosine_euclidean 스크립트의 복사본이 있어야 한다는 점을 명심해야 합니다.
요약하면, 현재 프로토콜은 (법의학) 음성학 연구에서 발전하고 있습니다. 생산 및 인식 분석과 음향 유사성 등 뚜렷한 단계로 구성된 이 시스템은 데이터 수집과 다차원 음향 특징 분석 간의 격차를 해소합니다. 연구자들은 생산과 인식 측면을 모두 탐구하는 전체적인 관점에서 이점을 얻을 수 있습니다. 또한 이 프로토콜은 연구 재현성을 보장하여 다른 사람들이 이 작업의 지침을 기반으로 구축할 수 있도록 합니다.
한계 및 향후 방향
데이터 준비가 프로토콜 단계 1.3.1에서 1.3.4까지 제안된 지침을 따르면 모든 것이 성공적으로 진행될 것이라는 점을 명심해야 합니다. 게다가, 강제 정렬 절차에서 현재 작업에 사용되는 MAUS와 같은 외부 사전 훈련된 강제 정렬기는 특히 사전 훈련되지 않은 외국 악센트 데이터 또는 사전 훈련된 교정 장치에서 분할 오류에 취약하다는 점을 인식해야 합니다. 법의학 전사, 특히 긴 오디오 파일의 전사는 음성 녹음의 정확하고 신뢰할 수 있는 표현과 관련하여 어려움에 직면합니다72.
더 긴 오디오 파일을 전사하고 정렬하는 데에도 몇 가지 어려움이 있습니다. 얼라이너 성능은 말하기 스타일과 음성 환경, 방언별 요인의 영향을 받습니다. 얼라이너별 차이가 있지만 일반적으로 성능은 유사하며 전체 수동 정렬과 잘 비교되는 분할을 생성합니다73. 또한 L1 및 L2 영어 제작은 MAUS에서 외국어 음성 모델을 사용할 수 없기 때문에 사전 훈련된 미국 영어 음향 모델로 실행되었습니다. 또한 MAUS에는 BP에 대한 사전 훈련된 음향 모델이 없습니다. BP 데이터의 경우 이탈리아어의 기존 음향 모델이 사용되었습니다(참고, 프로토콜 단계 1.3.5.7 참조).
향후 작업(진행 중)에서 프로토콜의 일부로 MFA(Montreal Forced Aligner)74 를 사용할 것입니다. MFA의 가장 큰 장점은 다양한 언어(BP 포함)에 대해 사전 훈련된 음향 모델 및 자소-음소 모델의 가용성뿐만 아니라 새로운 데이터 세트(즉, 외국어 악센트 음성 말뭉치)에 대해 새로운 음향 및 자소-음소 모델을 훈련할 수 있는 기능입니다75.
저자는 선언할 이해 상충이 없습니다.
이 연구는 National Council for Scientific and Technological Development - CNPq, 제1저자에 대한 보조금 번호 307010/2022-8, 두 번째 저자에 대한 보조금 번호 302194/2019-3의 지원을 받았습니다. 저자들은 본 연구에 참여한 분들의 아낌없는 협력과 귀중한 기여
에 진심으로 감사의 뜻을 표한다.| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| CreateLineup | 개인 컬렉션 | # | 스크립트 for praat for voice 라인업 준비 |
| Dell I3 (솔리드 스테이트 드라이브 - SSD 포함) | Dell | # | 노트북 컴퓨터 |
| Praat | Paul Boersma & David Weenink | # | 음성 분석을 위한 소프트웨어 |
| Python 3 | Python Software Foundation | # | 인터프리터, 고수준, 범용 프로그래밍 언어 |
| R | 통계 컴퓨팅을 위한 R 프로젝트 | # | 통계 컴퓨팅을 위한 프로그래밍 언어 |
| Shure Beta SM7B | Shure | # | 마이크 |
| SpeechRhythmExtractor | 개인 소장품 | # | 음향 기능 자동 추출을 위한 스크립트 |
| SurveyMonkey | SurveyMonkey Inc. | # | 사용자 정의 가능한 무료 설문 조사와 데이터 분석, 표본 선택, 편향 제거 및 데이터 표현을 포함하는 백엔드 프로그램 제품군을 조합합니다. |
| Tascam DR-100 MKII | Tascam | # | 디지털 음성 녹음기 |
| 뮌헨 자동 세분화 시스템 MAUS | 뮌헨 대학교 | # | 오디오(.wav) 및 언어 정보(.txt) 파일의 강제 정렬기 |
| VVUnitAligner | 개인 컬렉션 | # | 음성 단위의 자동 재정렬 및 사후 처리를 위한 스크립트 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청