이 연구는 L1-L2-영어와 L1-L2 포르투갈어를 비교하여 외국어 억양의 영향이 메트릭과 운율-음향 매개변수, 음성 라인업에서 대상 음성 선택을 얼마나 설명하는지 확인하는 것을 목표로 했습니다.
이 연구는 L1-L2-영어와 L1-L2 포르투갈어를 비교하여 외국어 억양의 영향이 메트릭과 운율-음향 매개변수, 음성 라인업에서 대상 음성 선택을 얼마나 설명하는지 확인하는 것을 목표로 했습니다.
본 연구는 외국어 억양의 영어와 외국어 억양의 브라질 포르투갈어의 운율-음향 특징과 지각적 상관관계를 모두 조사하고, 화자의 외국어 억양과 원어민 억양이 청취자의 인식과 어떤 상관관계가 있는지 확인하는 것을 목표로 합니다. 방법론에서는 L2 브라질 포르투갈어를 구사하는 미국인 그룹과 L2 영어를 구사하는 브라질 사용자 그룹과 함께 음성 생성 절차를 수행했으며, 두 언어에 대한 음성 라인업을 수행하는 음성 인식 절차를 수행했습니다. 음성 생성 통계 분석을 위해 Generalized Additive Model을 실행하여 반대 부류의 공변량(들)의 평활화 효과에 대해 제어되는 기능의 각 클래스(미터법 또는 운율-음향학)에 대한 언어 그룹의 효과를 평가했습니다. 음성 인식 통계 분석을 위해 Kruskal-Wallis 테스트와 사후 Dunn's 테스트를 실행하여 청취자가 판단한 점수에 대한 라인업의 목소리가 미치는 영향을 평가했습니다. 그럼에도 불구하고 우리는 코사인과 유클리드 거리를 기반으로 음향(음성) 유사성 테스트를 수행했습니다. 결과는 f0, 지속 시간 및 음성 품질의 가변성 측면에서 언어 그룹 간에 상당한 음향적 차이를 보여주었습니다. 라인업의 경우, 결과는 f0, 강도 및 음성 품질의 운율적 특징이 청취자의 인지된 판단과 상관관계가 있음을 나타냈습니다.
억양은 모국어(L1)와 외국어(L2) 모두에서 의사 소통과 유창함의 두드러지고 역동적인 측면입니다1. 외국어 악센트는 대상 언어의 L2 음성 기능을 나타내며 화자의 L2 경험, 말하기 스타일, 입력 품질, 설명 등에 따라 시간이 지남에 따라 변경될 수 있습니다. 외국어 악센트는 외국어 화자가 생성한 L2 음성과 대상 언어의 현지 또는 참조 악센트 간의 (스칼라) 차이 정도2,3,4,5.
이 연구는 외국어 억양의 영어와 외국어 억양의 브라질 포르투갈어(BP)의 운율-음향 특징과 지각적 상관관계를 조사하고, 화자의 외국어 및 원어민 억양이 청취자의 인식과 어느 정도 상관관계가 있는지 확인하는 것을 목표로 합니다. 법의학 분야의 선행 연구에서는 외국어 억양 식별에서 모음과 자음의 견고성이 개인에 대한 장기 분석(The Lo Case6) 또는 화자의 높은 ID 정확도(The Lindbergh Case7)를 참조하여 안정적임을 입증했습니다. 그러나 지속 시간, 기본 주파수(f0, 즉, 피치의 음향 상관 관계), 강도 및 음성 품질(VQ)을 기반으로 하는 운율 음향 기능에 대한 탐색이 점점 더 주목을 받고 있습니다8,9. 따라서 이 연구에서 운율-음향 기능에 대한 선택은 법의학 음성학 분야에서 유망한 길을 나타냅니다8,10,11,12,13.
본 연구는 법의학 사례에서 음성 위장의 한 형태로 외국어 억양에 관한 연구14,15, 화자 인식을 위한 음성 라인업 준비16,17. 예를 들어, 말하기 속도는 독일어, 이탈리아어, 일본어 및 브라질어 영어 사용자를 식별하는 데 중요한 역할을 했습니다18,19,20,21,22. 말하기 속도 외에도, 장기 스펙트럼 및 f0 기능은 뇌와 인지 기반이 기억력, 주의력 및 감정의 결핍을 겪기 때문에 장기 스펙트럼 및 f0 기능은 긴 말하기 회전 동안 화자의 음성 수행에 반영되기 때문에 대상 언어에 익숙한 L2 능숙한 사용자에게 도전23. 법의학 분야에서 외국어 억양에 대한 견해는 실제로 외국어 억양처럼 들리는 것에 대한 정의는 극단적이지 않은 정도의 외국어 억양이 있는 말투를 갖는 것보다 듣는 사람의 낯설음에 크게 좌우된다는 것입니다24.
지각 영역에서 1990년대 중반부터 범죄자 인식을 위해 사용된 일반적인 포렌식 도구는 범죄 현장에서 범인을 식별하는 데 사용되는 시각적 인식과 유사한 Voice Lineup(청각 인식)입니다16,25. 음성 라인업에서 용의자의 목소리는 목격자가 식별할 수 있도록 나이, 성별, 지리적 위치, 방언 및 문화적 지위와 같은 사회 언어학적 측면에서 유사한 호일 목소리와 함께 제시됩니다. 음성 라인업의 성공 또는 실패는 음성 샘플의 수와 샘플 지속 시간에 따라 달라집니다.25,26. 또한 실제 샘플의 경우 오디오 품질이 음성 인식의 정확도에 지속적으로 영향을 미치는 것으로 간주됩니다. 오디오 품질이 좋지 않으면 voice27의 고유한 특성이 왜곡될 수 있습니다. 음성 유사성의 경우 f0을 기반으로 하는 미세한 음성 세부 정보는 음성 인식 중에 청취자를 혼동할 수 있습니다28,29. 이러한 음향 기능은 f0를 넘어 확장되며 지속 시간 요소와 강도 및 VQ30의 스펙트럼 기능을 포함합니다. 여러 운율 기능에 대한 이러한 보기는 정확한 화자 식별을 보장하기 위해 포렌식 음성 비교의 맥락에서 매우 중요합니다9,14,15,29,31.
요약하면, 법의학 음성학의 연구는 지난 수십 년 동안 외국어 억양 식별과 관련하여 약간의 변화를 보여주었습니다. 한편으로는, 외국어 억양은 화자를 식별하는 과정에 영향을 미치지 않는 것 같습니다32,33 (특히 화자가 대상 외국어 억양에 익숙하지 않은 경우34). 반면에 반대 방향의 결과가 있습니다12,34,35.
이 연구는 인간 연구 윤리 위원회의 승인을 받았습니다. 또한, 본 연구에 참여한 모든 참가자로부터 자신의 데이터를 사용하고 게시하기 위해 정보에 입각한 동의를 얻었습니다.
1. 음성 제작
참고: 그룹 1: The American English (from the U.S.A.) Speakers (AmE-S)와 Group 2: The Brazilian Speakers (Bra-S)가 제작한 'L1 BP-L2 English'에 대한 읽기 과제에서 음성을 수집했습니다. 음성 생성을 위한 순서도는 그림 1을 참조하십시오.

그림 1: 음성 생성을 위한 회로도 순서도. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 2: MAUS 강제 정렬기를 사용한 음성 정렬의 스크린샷. (A) 점선 사각형은 'my_file.wav'/' my_file.txt' 파일을 드래그 앤 드롭하거나 내부를 클릭하여 폴더에서 해당 파일을 검색하기 위한 것입니다. 업로드 버튼은 빨간색 화살표로 표시됩니다. (B) 패널 A에서 업로드된 파일(파란색 화살표 참조), 사용할 파이프라인, 파일 쌍의 언어, 반환할 파일 형식 및 모든 파일을 보관하기 위한 'true/false' 버튼. (C) 사용 확인란 사용 약관(녹색 화살표 참조), 웹 서비스 실행 버튼 및 결과(다운로드할 TextGrid 파일). 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: 재정렬 절차의 스크린샷. (A) 재정렬 절차를 위한 입력 설정 양식. (B) 부분 파형, f0(파란색) 윤곽이 있는 광대역 스펙트로그램, 계층 1로 분할된(및 레이블링된) 6개 계층: 다음 모음 시작까지의 모음 시작 단위(V_to_V); 모음 시작 (V_to_V); Tier 2 : 모음 (V), 자음 (C) 및 일시 중지 (#)의 단위; Tier 3 : 음성 표현 V_to_V; Tier 4 : 텍스트의 일부 단어; 계층 5: 텍스트에서 음성의 일부 청크(CH); 티어 6: 여성 AmE-S가 생성한 각 음성 청크의 가장 높은(H) 톤과 가장 낮은(L) 톤을 포함하는 톤 계층입니다. (C) 음향 기능의 자동 추출을 위한 입력 설정. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
2. 음성 인식
참고: 미국 청취자를 대상으로 4개의 영어 음성 라인업을, 브라질 청취자를 대상으로 BP에서 4개의 음성 라인업을 수행했습니다. 음성 인식을 위한 순서도는 그림 4를 참조하십시오.

그림 4: 음성 인식을 위한 개략적인 순서도. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 5: 음성 인식을 위한 디렉토리 설정. 라인업 폴더. 각 폴더에는 6개의 L1 음성, L2 대상 음성, "CreateLineup" 스크립트 및 음성 라인업 오디오 파일(스크립트 실행 후 반환됨)이 포함되어 있습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
언어 생성 결과
이 섹션에서는 통계적으로 유의미한 운율-음향 특성과 리듬 지표의 성능을 설명했습니다. 이러한 운율 특성에는 지속 시간과 관련된 발화 속도, 조음 속도, 휴지 속도 및 음성 품질과 관련된 쉬머(shimmer)가 포함되었습니다. 리듬 지표로는 음절 지속 시간의 표준 편차(SD), 자음의 SD, 모음 또는 자음 지속 시간의 SD, 그리고 음절 지속 시간의 변동 계수가 사용되었습니다(보충 표 S1 참조).
The 말하기 속도 (그림 6A) L1-L2 영어의 경우 L1-L2 브라질 포르투갈어(BP)보다 더 빠르게 감소하지만, 두 제2언어(L2) 모두에서 그 속도는 더 낮습니다. 이 말하기 속도 세 가지 지표, 즉 음절 지속 시간의 표준 편차(SD)와 관련이 있습니다.SD-S), 모음의 표준편차(SD-V), 그리고 음절 변이 계수(Varco-S). 또한 AmE-S 집단과 Bra-S 집단 모두 제2언어(L2)에 능숙하다는 점을 염두에 두는 것이 중요합니다. 이러한 속도는 L1-L2 BP에 의해 생성된 더 높은 음절 지속 시간 값과 더 낮은 가변성의 영향을 받아 기울기가 완만해지는 것으로 보입니다.
조음률(그림 6D)은 SD-S, Varco-S 및 음절 리듬 비율(RR-S)과 관련이 있으며, 여기서 후자는 짧은 음절과 긴 음절 사이의 비율을 나타냅니다. 이러한 지표들은 문장 길이와 지속 시간의 변동으로 인해 L2 언어 계획 및 L2 인지 부하가 증가하여 발화율이 영향을 받는 것과 마찬가지로 조음률에 영향을 미치는 것으로 보입니다9,23,54. 문장 길이 영역에서 운율-음향 매개변수에 영향을 주는 방식으로 더 높은 인지-언어적 부하가 요구될 수 있습니다5.
말하기 속도(Speech rate) 및 조음 속도(Articulation rate)의 운율-음향적 특징과 관련하여, 본 연구 결과는 화자가 음절(및 모음)의 길이를 더 많이 변화시킬수록 해당 속도가 낮아짐을 시사합니다. 본 연구진은 L1 및 L2 BP의 언어 지각 속도가 L1 및 L2 영어보다 다소 느리며, L1 영어는 다른 모든 언어 수준보다 빠르게 들릴 것이라고 가설을 세웠습니다. 이러한 사실은 언어 리듬과 관련이 있을 수 있으며, L1-L2 BP는 리듬 연속체의 음절 타이밍(syllable-timed) 극단으로 기울어지는 반면, L1-L2 영어는 강세 타이밍(stress-timed) 극단으로 이동한다는 가설과 연결될 수 있습니다21,2.
그림 6B의 국소 지터(Local shimmer)는 SD-S와 Varco-S의 영향을 받습니다. 국소 지터의 경우, 음절 지속 시간의 가변성(SD 및 Varco, 부록 표 S1 참조)이 증가함에 따라 Bra-S, L1-BP 및 L2-English의 모든 발화가 어느 정도 단조로운 궤적을 보입니다. Bra-S 발화를 청취할 때, 8.5에서 9 dB 사이의 낮은 변동 범위로 인해 성대 노력(vocal effort)에 대한 지각이 뚜렷하게 나타날 수 있습니다. Bra-S 언어는 성대 부하(vocal load)의 영향을 받습니다. L1-BP는 문장 길이에 큰 영향을 받으며, 음절 지속 시간의 높은 가변성에는 덜 민감합니다(BP 리듬 패턴은 음절 가변성이 더 적게 나타남22,56).
그 정지율 (그림 6C)는 L2 영어 화자가 L1 영어, L1 BP 및 L2 BP 화자보다 더 긴 일시 정지(20ms에서 375ms)를 생성함을 보여줍니다(L1 영어 평균 30ms, L1 BP 평균 50ms, L2 BP 평균 10ms). 이 경우, 증가된 뇌 활동으로 인해 언어 계획 단계가 L2 영어 생성에 영향을 미쳤을 수 있습니다.54,57언어 능숙도가 높을수록 읽기 속도와 범위가 더 넓어질 것으로 예상됩니다.54그럼에도 불구하고, L2 능숙도가 높은 화자들의 경우에도 읽기 과제는 외국어 발화의 고차원적 인지 측면과 언어 처리 과정에서 더 많은 노력이 요구되었습니다.54,57우리의 연구 결과는 최소한 예비 단계에서, 두 언어의 리듬 패턴 차이로 인해 L2-BP 화자가 L2-영어 화자보다 휴지(pause)의 영향을 덜 받을 수 있음을 보여줍니다.

그림 6운율-음향적 특성을 위한 일반화 가산 모델. Y축에는 반응 변수(모델링할 음향적 특징)를, X축에는 예측 변수(곡선의 형태와 궤적을 제공하는 '언어' 요인 및 가산 모델 내의 공변량, 즉 평활 효과인 '언어 + 공변량', 그리고 반응 변수의 더 정확한 투영을 제공하는 '언어'와 측정 특징의 곱, 즉 요인-평활 상호작용인 '공변량:언어')를 배치합니다. 약어: GAMs = 일반화 가산 모델. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
리듬 지표와 관련하여, SD-S (그림 7A), 본 연구 결과는 화자가 기본 주파수(f0) 곡선을 더 많이 변화시키고 발화 속도를 높일수록, 더 많이 SD-S 모든 언어 수준에서 감소하며(다음의 거울 효과), 그림 6A). 자음의 표준편차(SD)의 경우 (SD-C, 그림 7CL1-BP는 L1-영어와 달리 말하기 속도나 휴지 지속 시간이 증가함에 따라 낮은 변동성을 보입니다. 이러한 표준편차(SD)의 방향성은 음절 지속 시간의 변동성이 L1-BP보다 L1-영어에서 (통계적으로) 유의하게 더 높기 때문에 예측 가능합니다.44,58. The Varco-S (그림 7B 및 부록 표 S1)는 동일한 언어 그룹의 L1 및 L2와 어느 정도 상관관계가 있는 것으로 보입니다. f0 변동성과 발화 속도가 증가함에 따라, L1-BP의 경우 Varco-S가 감소하며, L2-BP의 경우 감소 및 감쇠하는 것으로 보입니다. 영어 발화의 경우, f0 변동성과 말속도 증가, Varco-S는 L1-영어 및 L2-영어에 대해 증가 및 감쇄시킵니다.
모음 또는 자음의 SD(SD-V_C, 그림 7D 및 보충 표 S1)와 관련하여, 본 연구 결과는 Varco-S 성능과 일부 유사성을 보입니다(그림 7B). 예를 들어, 더 높은 말속도(Speech rate), 휴지 지속시간(Pause duration) 및 f0 가변성(f0 variability)은 L1-BP 및 L2-BP에서 SD-V_C의 하강-상승 궤적을 촉진합니다. 영어 발화의 경우, 이러한 운율적 특징들이 더 높게 나타나는 반면, SD-V_C는 L1-English에서 약간 감소하며 감쇠하고, L2-English에서는 약간 증가한 후 감쇠합니다. Varco-S와 SD-V_C가 동일 언어 집단의 L1-L2와 상관관계를 보이는 것은 배경 소음으로 인해 말소리의 음향적 매개변수가 변화하는 현상인 롬바드 효과(Lombard Effect)59로 일부 설명될 수 있습니다.
외국어 발화 시, 과업의 복잡성(예: 낭독 발화)에 따라 화자들은 제1언어(L1)와 제2언어(L2) 모두에서 유사한 음향적 전략을 사용해 왔습니다59,60. 한편, Marcoux와 Ernestus는 L2 롬바르드 발화의 f0 측정치(범위 및 중앙값)를 통해 L2 영어 화자들이 자신의 L1인 네덜란드어의 영향을 받았음을 발견했습니다61,62. 반면, 보다 최근의 연구 결과에 따르면, L2로 말할 때 인지 부하가 더 높기 때문에 L2 롬바르드 발화가 L1 롬바르드 발화와 다를 것으로 예상됨에도 불구하고, L2 영어 화자들은 L1 영어 화자들과 동일한 방향으로 롬바르드 발화를 생성했습니다63. 본 연구의 결과가 Marcoux와 Ernestus63의 연구와 얼마나 일치하며, Waaning59, Villegas 등60, 그리고 Marcoux와 Ernestus61,62의 연구와 얼마나 다른지에 대해서는 추가적인 조사가 필요합니다.

그림 7측정 특성을 위한 일반화 가법 모델. Y축에는 반응 변수(모델링할 측정 특성)를, X축에는 예측 변수를 배치합니다. 예측 변수에는 곡선의 형태와 궤적을 제공하는 요인 '언어(Language)' 및 가산 모델 내의 공변량(즉, 평활화 효과: 'Language + 공변량'), 그리고 반응 변수의 더 정확한 투영을 제공하는 '언어'와 측정 특성의 곱(즉, 요인-평활화 상호작용: '공변량:Language')이 포함됩니다. 약어: GAMs = 일반화 가산 모델. 이 그림의 확대 버전을 보시려면 여기를 클릭하십시오.
언어 지각 결과
BP 음성 라인업과 관련하여, 라인업 #1 (그림 8A)에서 오답 음성 #3이 타겟 음성으로 판단되었습니다. 실제로 타겟 음성은 음성 #4였습니다. 결과에 따르면 오답 #3(83%)과 타겟 음성 #4(71%) 사이에 통계적으로 유의미한 차이가 없었습니다 (부록 표 S1 참조). 라인업 #2 (그림 8B)에서 영어 음성 라인업의 타겟 음성 #3(40%)과 오답 #4(20%)를 비교했을 때 또한 통계적으로 유의미한 차이가 나타나지 않았습니다 (부록 표 S1 참조). 라인업 #1 (그림 9A)에서는 오답 #2(26%)와 타겟 음성 #4(54%) 사이에 유의미한 차이가 없었습니다 (부록 표 S1 참조).
음성 유사도 분석에서 코사인 유사도(CoSim)와 유클리드 거리(EucDist, [EucDist 변환됨]54) 모두 BP 라인업 #1의 오답지(foil) #3과 표적(target) 사이에서 일관된 상관관계를 보였다(CoSim = 0.9; EucDist = 77.4, [0.93]). BP 라인업 #2에서도 오답지 #4와 표적 사이의 상관관계가 비슷하게 강하게 나타났다(CoSim = 0.9, EucDist = 76.3, [0.93]). 영어 라인업 #1에서는 CoSim(0.83)의 상관관계는 일관되었으나, EucDist(213.0, [0.47])의 상관관계는 약함에서 만족스러운 수준이었다. 전반적으로 CoSim과 EucDist 모두 음성 유사도를 결정하는 데 만족스러운 기술이었다. 또한, Gahman과 Elangovan52이 다룬 바와 같이 CoSim이 약간 더 효과적인 성능을 보였다(부록 표 S1 참조).
유사성의 관점에서, 무엇이 오경보(false alarms)의 증가를 유도했을까요? 운율-음향적 특징 분석 결과, 그림 8A,B 및 그림 9A에서 제시된 라인업을 제외하고는 오답(foil)과 표적 음성이 (통계적으로) 유의미하게 다른 성능을 보였으나, 다른 라인업(그림 8C,D 및 그림 9B-D)에서는 청취자의 선택이 서로 다른 오답들 사이에서 어느 정도 다양하게 나타났습니다. 이러한 판단은 운율-음향적 특징의 전체 범주보다는 화자들이 공유하는 하나(또는 그 이상)의 특정 음향적 특징에 더 많이 의존하는 것으로 보입니다. 예를 들어, 본 연구에서는 발화 간에 (공)변하는 여러 특징을 제시했음에도 불구하고, 지각적 결과는 특정 오답을 표적 음성과 일치시키려는 판단의 선호도를 보여줍니다8,35,64,65. 향후 연구에서 추가적인 분석이 필요합니다.
음향적 유사성을 위해 본 연구에서 제시한 것과 같은 다차원 매개변수 행렬의 선택을 고려하는 것이 주목할 만합니다6. 우리의 연구 결과는 f0, VQ 및 강도에 기반한 음향적 특징을 사용한 이전 연구들과 일치합니다9,35. 이러한 특징들은 법과학 분야의 화자 비교 작업에 매우 유용한 것으로 제안됩니다9,6. 그럼에도 불구하고, 외국어 억양 화자 인식을 위한 음성 라인업 준비 과정에서 McFarlane의 가이드라인 변형 모델을 사용했음에도 불구하고16,17, 본 연구에서는 어떤 유인 자극(foil)도 표적 음성과 유사할 것으로 예측되지 않았다는 점을 강조하는 것이 중요합니다. 또한, 우리의 음성 라인업 절차는 자극 길이, 음성 수, 유인 자극의 선택(본 연구에서는 무작위 추출), 그리고 발화 스타일을 포함하여 McFarlane의 가이드라인과 중요한 차이점이 있음을 강조해야 합니다.
f0, 성질(voice quality) 및 강도의 운율-음향적 특징이 청취자의 지각과 얼마나 관련이 있는지는 연구에 사용된 발화 스타일에 따라 크게 달라질 것입니다. 본 연구에서는 낭독 지문을 사용하였습니다. 대부분의 청각 목격자(earwitness) 연구에서는 균형 잡힌 해결책으로서 (반)자발적 자극-예를 들어, 현대의 청각 목격자 조사에서 광범위하게 활용되어 온 DyVis 코퍼스6728,68-를 선택합니다. 저희가 낭독 과제를 선택한 이유는 본 원고 작성 당시 저희의 코퍼스가 전적으로 낭독 과제에서 얻은 데이터로만 구성되어 있었기 때문입니다. 하지만 (반)자발적 코퍼스를 구축하는 과정이 이미 진행 중임을 인정하는 것이 중요합니다. 또한, 이야기를 낭독하는 행위는 화자 내부 및 화자 간에 신뢰할 수 있는 수준의 균일성과 변이성을 생성할 수 있습니다. 이는 음성 비교가 포함된 상황에서 개인적 또는 방언적 특성인 운율적 또는 음성적 특징을 강조하는 것을 용이하게 합니다. 이는 숙련된 화자들 사이에서도 외국어 억양을 생성하는 동안 발생하는 음성 부하(vocal load) 사례에서 특히 두드러집니다 8,9,23,54.

그림 8브라질 청취자들이 수행한 4가지 라인업 결과가 포함된 막대 그래프. (A,B) 표적 음성(파란색)과 유인 음성(연한 파란색) 간의 유의미하지 않은 차이. (C,D) 호일(foils) 및 표적 음성과 유의미한 차이가 있음. 약어: NS = 유의미하지 않음. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 9미국인 청취자들이 수행한 4가지 라인업의 결과가 포함된 막대 그래프. (A) 표적 음성(빨간색)과 유인 음성(분홍색) 간의 유의미하지 않은 차이. (B,C,D) 포일(foils) 및 표적 음성과 유의미한 차이. 약어: NS = 유의하지 않음. 이 그림의 확대 버전을 보시려면 여기를 클릭하십시오.
부록 표 S1언어 생성 통계 - 일반화 가법 모델(GAMs): F-통계량(자유도), 수정된 R2 통계적으로 유의미한 각 운율-음향적 특징의 (그림 6), 그리고 리듬 지표(그림 7) 언어 수준별뿐만 아니라 각 평활화 항(공변량)의 개별 값에 대해서도 분석하였습니다. 언어 인지 통계: Kruskall-Wallis χ2 통계량(자유도), p-값 및 보정된 η2또한, 쌍별 비교를 위한 사후 Dunn 검정(그림 8 및 그림 9각 표적-방해 자극 음성 쌍 간의 통계적으로 유의미하지 않은 차이)의그림 8A,B 및 그림 9A). 각 라인업의 코사인 및 유클리드 거리에 대한 음향 유사도 행렬. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.
현재 프로토콜은 (법의학) 음성학 분야에서 참신함을 제시합니다. 생산(음향 분석)과 지각(판단 분석)의 두 단계로 나뉩니다. 생산 분석 단계는 통계 외에 데이터 준비 및 강제 정렬, 재정렬 및 운율-음향 특징의 자동 추출로 구성됩니다. 이 프로토콜은 주로 수동 세분화를 기반으로 하는 기존 프로토콜보다 더 빠르고 효율적인 방식으로 데이터 수집 단계를 데이터 분석에 연결합니다.
그러나 프로토콜 단계 1.3.6 - 1.3.6.9에 표시된 재정렬 프로세스는 기본적으로 프로토콜 단계 1.3.1 - 1.3.4에서 생성된 전화 및 워드 유닛에서 작동합니다. 재정렬 프로세스의 참신함은 음절 계층, 단어를 기반으로 자동 또는 수동으로 생성할 수 있는 음성 청크 계층, f0 측정값을 계산하는 데 매우 유용할 수 있는 톤 계층의 세 가지 새로운 텍스트 계층을 포함하는 새로운 TextGrid를 생성한다는 것입니다. 이 프로토콜에 대해 제안된 재정렬 지침은 이전에 L2 음성 리듬 연구(21,69,70), 기계 학습 기술을 사용한 외국 억양 정도 감지 연구(22) 및 법의학 영역 연구(9)에서 사용되었습니다.
프로토콜 단계 1.3.7 내지 1.3.7.10에 제시된 운율 특징의 자동 추출은 현재 연구에서 입증될 수 있는 운율-음향 특징의 다차원 매트릭스를 생성합니다. 이러한 특징은 멜로디, 지속 시간 및 스펙트럼(음성 품질 및 강도) 음성 특징(71)을 포함한다. 이들 음향 특징들 중 상당수는 덜 민감하고 법의학 또는 임의의 다른 시나리오에서 최종적으로 수집되는 시끄러운 오디오 녹음에 대해 다소 견고하다72. 또한 다차원 매트릭스는 여러 AI 기술을 통해 음성 인식 시스템에 적용될 수 있습니다(작업 진행 중). L2 발음 수업21 (진행 중인 작업)에서 운율 측면을 가르치는 데 여전히 매우 유용할 수 있습니다.
프로토콜의 이 부분에 대한 통계 분석은 특정 음향 기능과 여러 언어 요소 화자 간의 복잡한 관계를 다루었기 때문에 GAM 방법의 사용을 나타냅니다. 예를 들어, 특정 음향 특징을 모델링하려면 음성 생성 중에 일어나는 일을 보다 정확하게 설명할 수 있도록 매트릭스의 다른 음향 특징(부드러운 항)이 어떻게 수행되는지 확인해야 했습니다.
지각 분석과 관련하여 현재 프로토콜은 음성 라인업, 통계 분석 및 음향 유사성 분석을 준비 및 구현하여 구성되었습니다. 라인업을 준비하기 위해 프로토콜 단계 2.2에서 2.2.1.9에 설명된 대로 무작위로 시퀀싱된 포일과 대상 음성이 포함된 각 라인업에 대한 오디오 파일을 자동으로 생성하는 Praat용 CreateLineup 스크립트를 사용했습니다.
이 프로토콜의 통계 분석을 위해 데이터가 분산 분석(ANOVA) 가정을 충족하지 못했기 때문에 Kruskal-Wallis 비모수 테스트를 실행했습니다. 청취자가 평가하고 대상 음성과 포일에 대해 제어한 판단 점수 간의 관계가 생기면 선형 모델 통계를 사용하기로 결정했습니다.
음향 유사성 분석을 위해 Python용 AcousticSmilarity_cosine_euclidean 스크립트를 사용했습니다. 이 프로그램은 컴퓨터의 디렉토리 트리를 팝업하고 사용자에게 포일의 운율 음향 특징과 분석에서 라인업을 구성하는 대상 음성이 포함된 파일을 선택하도록 요청합니다. 버튼을 클릭하면 스크립트는 '.txt'(탭으로 구분됨) 및 '.csv' 파일 모두에서 코사인, 유클리드 및 변환된(0에서 1로) 유클리드 등 세 가지 유사성 행렬을 생성합니다. 우리는 여전히 모든 데이터 세트(포일과 타겟의 운율-음향 특징을 포함하는 '.txt' 파일)가 라인업의 원래 폴더에 있어야 하며 모든 라인업 폴더에는 AcousticSmilarity_cosine_euclidean 스크립트의 복사본이 있어야 한다는 점을 명심해야 합니다.
요약하면, 현재 프로토콜은 (법의학) 음성학 연구에서 발전하고 있습니다. 생산 및 인식 분석과 음향 유사성 등 뚜렷한 단계로 구성된 이 시스템은 데이터 수집과 다차원 음향 특징 분석 간의 격차를 해소합니다. 연구자들은 생산과 인식 측면을 모두 탐구하는 전체적인 관점에서 이점을 얻을 수 있습니다. 또한 이 프로토콜은 연구 재현성을 보장하여 다른 사람들이 이 작업의 지침을 기반으로 구축할 수 있도록 합니다.
한계 및 향후 방향
데이터 준비가 프로토콜 단계 1.3.1에서 1.3.4까지 제안된 지침을 따르면 모든 것이 성공적으로 진행될 것이라는 점을 명심해야 합니다. 게다가, 강제 정렬 절차에서 현재 작업에 사용되는 MAUS와 같은 외부 사전 훈련된 강제 정렬기는 특히 사전 훈련되지 않은 외국 악센트 데이터 또는 사전 훈련된 교정 장치에서 분할 오류에 취약하다는 점을 인식해야 합니다. 법의학 전사, 특히 긴 오디오 파일의 전사는 음성 녹음의 정확하고 신뢰할 수 있는 표현과 관련하여 어려움에 직면합니다72.
더 긴 오디오 파일을 전사하고 정렬하는 데에도 몇 가지 어려움이 있습니다. 얼라이너 성능은 말하기 스타일과 음성 환경, 방언별 요인의 영향을 받습니다. 얼라이너별 차이가 있지만 일반적으로 성능은 유사하며 전체 수동 정렬과 잘 비교되는 분할을 생성합니다73. 또한 L1 및 L2 영어 제작은 MAUS에서 외국어 음성 모델을 사용할 수 없기 때문에 사전 훈련된 미국 영어 음향 모델로 실행되었습니다. 또한 MAUS에는 BP에 대한 사전 훈련된 음향 모델이 없습니다. BP 데이터의 경우 이탈리아어의 기존 음향 모델이 사용되었습니다(참고, 프로토콜 단계 1.3.5.7 참조).
향후 작업(진행 중)에서 프로토콜의 일부로 MFA(Montreal Forced Aligner)74 를 사용할 것입니다. MFA의 가장 큰 장점은 다양한 언어(BP 포함)에 대해 사전 훈련된 음향 모델 및 자소-음소 모델의 가용성뿐만 아니라 새로운 데이터 세트(즉, 외국어 악센트 음성 말뭉치)에 대해 새로운 음향 및 자소-음소 모델을 훈련할 수 있는 기능입니다75.
저자는 선언할 이해 상충이 없습니다.
이 연구는 National Council for Scientific and Technological Development - CNPq, 제1저자에 대한 보조금 번호 307010/2022-8, 두 번째 저자에 대한 보조금 번호 302194/2019-3의 지원을 받았습니다. 저자들은 본 연구에 참여한 분들의 아낌없는 협력과 귀중한 기여
에 진심으로 감사의 뜻을 표한다.| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| CreateLineup | 개인 컬렉션 | # | 스크립트 for praat for voice 라인업 준비 |
| Dell I3 (솔리드 스테이트 드라이브 - SSD 포함) | Dell | # | 노트북 컴퓨터 |
| Praat | Paul Boersma & David Weenink | # | 음성 분석을 위한 소프트웨어 |
| Python 3 | Python Software Foundation | # | 인터프리터, 고수준, 범용 프로그래밍 언어 |
| R | 통계 컴퓨팅을 위한 R 프로젝트 | # | 통계 컴퓨팅을 위한 프로그래밍 언어 |
| Shure Beta SM7B | Shure | # | 마이크 |
| SpeechRhythmExtractor | 개인 소장품 | # | 음향 기능 자동 추출을 위한 스크립트 |
| SurveyMonkey | SurveyMonkey Inc. | # | 사용자 정의 가능한 무료 설문 조사와 데이터 분석, 표본 선택, 편향 제거 및 데이터 표현을 포함하는 백엔드 프로그램 제품군을 조합합니다. |
| Tascam DR-100 MKII | Tascam | # | 디지털 음성 녹음기 |
| 뮌헨 자동 세분화 시스템 MAUS | 뮌헨 대학교 | # | 오디오(.wav) 및 언어 정보(.txt) 파일의 강제 정렬기 |
| VVUnitAligner | 개인 컬렉션 | # | 음성 단위의 자동 재정렬 및 사후 처리를 위한 스크립트 |