To badanie miało na celu porównanie L1-L2-angielskiego i L1-L2 portugalskiego, aby sprawdzić, jak bardzo wpływ obcego akcentu wpływa zarówno na metryki, jak i parametry prozodowo-akustyczne, a także na wybór docelowego głosu w zestawie głosowym.
Artykuł metodologiczny
To badanie miało na celu porównanie L1-L2-angielskiego i L1-L2 portugalskiego, aby sprawdzić, jak bardzo wpływ obcego akcentu wpływa zarówno na metryki, jak i parametry prozodowo-akustyczne, a także na wybór docelowego głosu w zestawie głosowym.
To badanie ma na celu zbadanie zarówno cech prozodyczno-akustycznych, jak i percepcyjnych korelatów angielskiego z obcym akcentem i brazylijskiego portugalskiego z obcym akcentem oraz sprawdzenie, jak produkcja obcych i rodzimych akcentów przez mówców jest skorelowana z percepcją słuchaczy. W ramach Metodyki przeprowadziliśmy procedurę produkcji mowy z grupą Amerykanów posługujących się L2 (brazylijski portugalski) oraz grupą Brazylijczyków (L2 English), a także procedurę percepcji mowy, w której wykonaliśmy składy głosowe dla obu języków. Na potrzeby analizy statystycznej produkcji mowy przeprowadziliśmy uogólnione modele addytywne, aby ocenić wpływ grup językowych na każdą klasę (metryczną lub prozodyczno-akustyczną) cech kontrolowanych pod kątem efektu wygładzania współzmiennych przeciwnej klasy. Na potrzeby analizy statystycznej percepcji mowy przeprowadziliśmy test Kruskala-Wallisa oraz test Dunna post hoc, aby ocenić wpływ głosów składów na wyniki oceniane przez słuchaczy. Przeprowadziliśmy jednak testy podobieństwa akustycznego (głosowego) w oparciu o odległości cosinusowe i euklidesowe. Wyniki wykazały istotne różnice akustyczne między grupami językowymi pod względem zmienności f0, czasu trwania i jakości głosu. W przypadku składów wyniki wykazały, że cechy prozodyczne f0, intensywności i jakości głosu korelowały z postrzeganymi ocenami słuchaczy.
Akcent jest istotnym i dynamicznym aspektem komunikacji i płynności, zarówno w języku ojczystym (L1), jak i w języku obcym (L2)1. Akcent obcy reprezentuje cechy fonetyczne L2 języka docelowego i może się zmieniać (w czasie) w odpowiedzi na doświadczenie mówcy w L2, styl mówienia, jakość danych wejściowych, ekspozycję i inne zmienne. Akcent obcy można określić ilościowo jako (skalarny) stopień różnicy między mową L2 wytwarzaną przez obcokrajowca a akcentem lokalnym lub referencyjnym języka docelowego2,3,4,5.
To badanie ma na celu zbadanie zarówno cech prozodyczno-akustycznych, jak i percepcyjnych korelatów angielskiego z obcym akcentem i brazylijskiego portugalskiego (BP), a także sprawdzenie, w jakim stopniu produkcja obcych i rodzimych akcentów przez użytkowników jest skorelowana z percepcją słuchaczy. Wcześniejsze badania w dziedzinie kryminalistyki wykazały, że samogłoski i spółgłoski w identyfikacji obcego akcentu są albo stabilne w długoterminowej analizie danej osoby (The Lo Case6) lub odnoszą się do wysokiej dokładności ID osoby mówiącej (The Lindbergh Case7). Jednak eksploracja cech prozodowo-akustycznych w oparciu o czas trwania, częstotliwość podstawową (f0, tj. akustyczny korelat wysokości dźwięku), intensywność i jakość głosu (VQ) zyskuje coraz większą uwagę8,9. W związku z tym wybór cech prozodowo-akustycznych w tym badaniu stanowi obiecującą drogę w dziedzinie fonetyki sądowej8,10,11,12,13.
Obecne badania są wspierane przez badania poświęcone obcym akcentom jako formie maskowania głosu w sprawach kryminalistycznych14,15, a także w przygotowaniu składów głosowych do rozpoznawania mówcy16,17. Na przykład szybkość mowy odegrała ważną rolę w identyfikacji niemieckich, włoskich, japońskich i brazylijskich użytkowników języka angielskiego18,19,20,21,22. Oprócz szybkości mowy, długoterminowe funkcje spektralne i f0 stanowią wyzwanie dla biegłych użytkowników L2 w zakresie znajomości języka docelowego, ponieważ mózg i podstawy poznawcze cierpią na deficyt pamięci, uwagi i emocji, co odbija się na wydajności fonetycznej mówcy podczas długich zwrotów mowy23. Pogląd na temat obcych akcentów w dziedzinie kryminalistyki jest taki, że definicja tego, co naprawdę brzmi jak obcy akcent, zależy w dużej mierze od nieznajomości słuchacza, a nie od zerowego do skrajnego stopnia mowy z obcym akcentem24.
W dziedzinie percepcyjnej, powszechnym narzędziem kryminalistycznym używanym od połowy lat 90. do rozpoznawania przestępców jest Voice Lineup (rozpoznawanie słuchowe), które jest analogiczne do rozpoznawania wizualnego używanego do identyfikacji sprawcy na miejscu zbrodni16,25. W zestawieniu głosowym głos podejrzanego jest prezentowany wraz z kontrastami – głosami podobnymi w aspektach socjolingwistycznych, takich jak wiek, płeć, położenie geograficzne, dialekt i status kulturowy – w celu identyfikacji przez naocznego świadka. Powodzenie lub niepowodzenie składu głosowego będzie zależało od liczby próbek głosu i czasu trwania próbki25,26. Ponadto w przypadku próbek ze świata rzeczywistego uważa się, że jakość dźwięku konsekwentnie wpływa na dokładność rozpoznawania głosu. Niska jakość dźwięku może zniekształcić unikalne cechy głosu27. W przypadku podobieństwa głosu, drobne szczegóły fonetyczne oparte na f0 mogą zmylić słuchacza podczas rozpoznawania głosu28,29. Takie cechy akustyczne wykraczają poza f0 i obejmują elementy czasu trwania oraz cechy spektralne intensywności i VQ30. To spojrzenie na wiele cech prozodycznych ma kluczowe znaczenie w kontekście porównywania głosu w kryminalistyce, aby zapewnić dokładną identyfikację mówcy9,14,15,29,31.
Podsumowując, badania nad fonetyką kryminalistyczną wykazały pewne różnice w zakresie identyfikacji obcego akcentu w ciągu ostatnich dziesięcioleci. Z jednej strony, obcy akcent nie wydaje się wpływać na proces identyfikacji mówcy32,33 (zwłaszcza jeśli mówca nie jest zaznajomiony z docelowym obcym akcentem34). Z drugiej strony istnieją wyniki w przeciwnym kierunku12,34,35.
Ta praca została zatwierdzona przez komisję etyki badań na ludziach. Ponadto uzyskano świadomą zgodę wszystkich uczestników biorących udział w tym badaniu na wykorzystanie i opublikowanie ich danych.
1. Produkcja mowy
UWAGA: Zebraliśmy mowę z zadania czytania zarówno na temat 'L1 English-L2 BP' wyprodukowanego przez Grupę 1: The American English (z USA) speakers (AmE-S), jak i na obu 'L1 BP-L2 English' wyprodukowanego przez Grupę 2: The Brazilian Speakers (Bra-S). Zobacz Rysunek 1 przedstawia schemat blokowy do produkcji mowy.

Rysunek 1: Schematyczny schemat blokowy do produkcji mowy. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 2: Zrzut ekranu z wyrównania fonetycznego za pomocą wymuszonego wyrównywania MAUS. (A) Przerywany prostokąt jest przeznaczony do przeciągania i upuszczania plików 'my_file.wav'/' my_file.txt' lub klikania do środka w celu wyszukania takich plików z folderu; Przycisk Prześlij jest oznaczony czerwoną strzałką. (B) Przesłane pliki z panelu A (patrz niebieska strzałka), potok, który ma być używany, język par plików, format pliku, który ma zostać zwrócony, oraz przycisk "prawda/fałsz" do przechowywania wszystkich plików. (C) Pole wyboru warunki użytkowania (patrz zielona strzałka), przycisk Uruchom usługi sieci Web i Wyniki (pliki TextGrid do pobrania). Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 3: Zrzut ekranu procedury wyrównania. (A) Formularz ustawień wejściowych dla procedury wyrównania. (B) Częściowy kształt fali, spektrogram szerokopasmowy z konturem f0 (niebieskim) i sześcioma poziomami podzielonymi (i oznaczonymi) jako poziom 1: jednostki początku samogłoski do początku następnej samogłoski (V_to_V); początek samogłoski (V_to_V); poziom 2: jednostki samogłoski (V), spółgłoski (C) i pauzy (#); Poziom 3: Reprezentacje foniczne V_to_V; Poziom 4: kilka słów z tekstu; poziom 5: kilka fragmentów (CH) mowy z tekstu; poziom 6: poziom tonalny zawierający najwyższy (H) i najniższy (L) ton każdego fragmentu mowy wytwarzanego przez kobietę AmE-S. (C) Ustawienia wejściowe do automatycznego usuwania cech akustycznych. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
2. Percepcja mowy
UWAGA: Przeprowadziliśmy cztery składy głosowe w języku angielskim ze słuchaczami amerykańskimi i cztery składy w BP ze słuchaczami brazylijskimi. Zobacz Rysunek 4 przedstawia schemat blokowy dla percepcji mowy.

Rysunek 4: Schematyczny schemat blokowy dla percepcji mowy. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 5: Konfiguracja katalogu do percepcji mowy. Foldery składu. Każdy folder zawiera sześć głosów L1, docelowy głos L2, skrypt "CreateLineup" i plik audio składu głosowego (zwracany po uruchomieniu skryptu). Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
Wyniki dla produkcji mowy
W tej części opisaliśmy wydajność statystycznie istotnych cech prozodowo-akustycznych i metryk rytmicznych. Takimi cechami prozodycznymi były częstotliwość mowy, artykulacji i pauzy, które są związane z czasem trwania, oraz migotanie, które jest związane z jakością głosu. Wskaźnikami rytmu były odchylenie standardowe (SD) czasu trwania sylaby, SD spółgłoski, SD czasu trwania wokalu lub spółgłoski oraz współczynnik zmienności czasu trwania sylaby (patrz tabela uzupełniająca S1).
Szybkość mowy (Rysunek 6A) spada szybciej dla L1-L2 English niż dla L1-L2 BP, chociaż szybkość jest niższa dla obu L2. Szybkość mowy jest związana z trzema wskaźnikami - SD czasu trwania sylaby (SD-S), SD samogłosek (SD-V) i współczynnikiem zmienności sylabicznej (Varco-S). Ważne jest również, aby pamiętać, że zarówno grupa AmE-S, jak i Bra-S są biegli w swoich L2. Wydaje się, że na takie tempo wpływają wyższe wartości czasu trwania sylab i mniejsza zmienność wytwarzana przez L1-L2 BP, powodująca mniej strome zbocza.
Współczynnik artykulacji (Rysunek 6D) jest związany z SD-S, Varco-S, a także ze stosunkiem rytmu sylabicznego (RR-S); ten ostatni reprezentuje stosunek między krótszymi i dłuższymi sylabami. Wydaje się, że takie wskaźniki wpływają na szybkość artykulacji, podobnie jak szybkość mowy, na którą wpływa długość zdania i różnice w czasie trwania, co prowadzi do lepszego planowania mowy L2 i obciążenia poznawczego L29,23,54. Większe obciążenie kognitywno-językowe może być wymagane w dziedzinie długości zdania w taki sposób, że wpływa to na parametry prozodowo-akustyczne55.
Jeśli chodzi o prozodyczno-akustyczne cechy mowy i częstotliwości artykulacji, nasze wyniki sugerują, że im bardziej mówca zmienia czas trwania sylab (i samogłosek), tym niższe są te wskaźniki. Przypuszczamy, że percepcja mowy zarówno L1, jak i L2 BP brzmi nieco wolniej niż L1 i L2-angielski, a L1-angielski brzmi szybciej niż wszystkie inne poziomy językowe. Fakt ten może być związany z rytmem mowy i hipotezą, że podczas gdy L1-L2 BP skłania się ku biegunowi czasowemu sylaby kontinuum rytmu, L1-L2 angielski przesuwa się w kierunku bieguna z czasem akcentu21,22.
Lokalny migotanie, Rysunek 6B, jest pod wpływem SD-S i Varco-S. W przypadku lokalnego migotania, obie produkcje Bra-S, L1-BP i L2-English prezentują nieco monotonną trajektorię wraz ze wzrostem zmienności czasu trwania sylab (SD i Varco, patrz tabela uzupełniająca S1). Wrażenie wysiłku wokalnego może być widoczne podczas słuchania produkcji Bra-S ze względu na niską zmienność, która waha się od 8,5 do 9 dB. Na mowę Bra-S ma wpływ obciążenie głosu. Na L1-BP duży wpływ ma długość zdań, która jest mniej wrażliwa na duże zmiany czasu trwania sylaby (wzorzec rytmiczny BP wykazuje mniejszą zmienność sylabiczną22,56).
Częstotliwość pauz (Rysunek 6C) pokazuje, że osoby mówiące L2-English robią dłuższe przerwy (od 200 ms do 375 ms) niż L1-English, L1-BP i L2-BP (średnio 30 ms dla L1-English, 50 ms dla L1-BP i 100 ms dla L2-BP). Planowanie mowy, w tym przypadku, mogło mieć wpływ na produkcję L2-English ze względu na zwiększoną aktywność mózgu54,57. Oczekuje się, że wyższa biegłość językowa spowoduje większą szybkość czytania i span54; niemniej jednak, nawet dla osób biegle posługujących się językiem L2, zadania związane z czytaniem wymagały większego wysiłku w zakresie poznawczych aspektów mowy obcej wyższego rzędu oraz w przetwarzaniu języka54,57. Nasze odkrycia pokazują, przynajmniej na wstępnej podstawie, że osoby posługujące się L2-BP mogą być mniej dotknięte pauzami niż L2-angielski ze względu na różnice we wzorcu rytmicznym obu języków.

Rysunek 6: Uogólnione modele addytywne dla cech prozodowo-akustycznych. Na osi Y zmienna odpowiedzi (cechy akustyczne, które mają być modelowane); na osi X, zmienne predyktora (czynnik "Język" i współzmienne w modelach addytywnych, które zapewnią kształt i trajektorie krzywych (tj. efekty wygładzania: "Język + współzmienne") oraz iloczyn "Języka" i cechy metrycznej, która zapewni dokładniejsze odwzorowanie zmiennej odpowiedzi (tj. interakcje wygładzone czynnikowo: 'współzmienna:Język'). Skrót: GAMs = uogólnione modele addytywne. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
W odniesieniu do metryk rytmu, dla SD-S (Rysunek 7A), nasze wyniki pokazują, że im bardziej mówca zmienia krzywą f0 i zwiększa szybkość mowy, tym bardziej SD-S spada dla wszystkich poziomów językowych (efekt lustrzany Rysunek 6A). W przypadku SD dla spółgłosek (SD-C, Rysunek 7C), L1-BP, w przeciwieństwie do języka angielskiego L1, wykonuje niską zmienność wraz ze wzrostem szybkości mowy lub czasu trwania pauzy. Taki kierunek SD jest przewidywany, ponieważ zmienność czasu trwania sylaby w języku L1-angielskim jest (statystycznie) znacznie wyższa niż L1-BP44,58. Varco-S (Rysunek 7B i tabela uzupełniająca S1) wydaje się być nieco skorelowany z L1 i L2 tej samej grupy językowej. Wraz ze wzrostem zmienności f0 i szybkości mowy, Varco-S zmniejsza się dla L1-BP i wydaje się, że zmniejsza się i osłabia dla L2-BP. W przypadku produkcji angielskich, podczas gdy zmienność f0 i szybkość mowy wzrastają, Varco-S zwiększa się i tłumi dla L1-English i L2-English.
Jeśli chodzi o SD dla samogłosek lub spółgłosek (SD-V_C, Rysunek 7D i tabela uzupełniająca S1), nasze wyniki pokazują pewne podobieństwa do wydajności Varco-S (Rysunek 7B). Na przykład wyższy wskaźnik mowy, czas trwania pauzy i zmienność f0 sprzyjają spadkowej trajektorii SD-V_C dla L1-BP i dla L2-BP. W produkcjach angielskich, o ile takie cechy prozodyczne są wyższe, o tyle SD-V_C nieznacznie maleje, osłabia się dla L1-English, nieznacznie wzrasta, a następnie osłabia się dla L2-English. Korelację Varco-S i SD-V_C z L1-L2 tych samych grup językowych można częściowo wyjaśnić efektem lombarda, który odnosi się do zmiany parametrów akustycznych mowy spowodowanej hałasem tła59.
W mowie obcej, w zależności od złożoności zadania (np. czytanie mowy), mówcy stosowali podobne strategie akustyczne zarówno na L1, jak i L259,60. Z jednej strony Marcoux i Ernestus odkryli, że miary f0 (zakres i mediana) w mowie lombardzkiej L2 sugerują, że osoby mówiące po angielsku L2 były pod wpływem ich L1 Dutch61,62. Z drugiej strony, nowsze odkrycia sugerują, że chociaż oczekuje się, że mowa lombardzka L2 będzie się różnić od mowy lombardzkiej L1 ze względu na większe obciążenie poznawcze podczas mówienia L2, osoby mówiące po angielsku L2 wytworzyły mowę lombardzką w tym samym kierunku, co osoby mówiące po angielsku L163. Stopień, w jakim nasze ustalenia są zgodne z Marcoux i Ernestus63 i różnią się od Waaning59, Villegas et al.60 oraz Marcoux and Ernestus61,62 wymaga dalszych badań.

Rysunek 7: Uogólnione modele addytywne dla cech metrycznych. Na osi Y zmienna odpowiedzi (cechy metryki, które mają być modelowane); na osi X, zmienne predyktora (czynnik "Język" i współzmienne w modelach addytywnych, które zapewnią kształt i trajektorie krzywych (tj. efekty wygładzania: "Język + współzmienne") oraz iloczyn "Języka" i cechy metrycznej, która zapewni dokładniejsze odwzorowanie zmiennej odpowiedzi (tj. interakcje wygładzone czynnikowo: 'współzmienna:Język'). Skrót: GAMs = uogólnione modele addytywne. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
Wyniki dla percepcji mowy
W odniesieniu do składów głosowych BP, w składzie #1 (Rysunek 8A), głos foliowy #3 został oceniony jako głos docelowy. W rzeczywistości docelowym głosem był głos #4. Wyniki nie wykazują statystycznie istotnej różnicy (patrz Tabela Uzupełniająca S1) pomiędzy folią #3 (83%) a głosem docelowym #4 (71%). W składzie #2 (Rysunek 8B), porównanie między głosem docelowym #3 (40%) a folią #4 (20%) również nie wykazało statystycznie istotnej różnicy (patrz Tabela Uzupełniająca S1) dla składów głosów angielskich. W składzie #1 (Rysunek 9A) nie było istotnej różnicy (patrz Tabela Uzupełniająca S1) między folią #2 (26%) a głosem docelowym #4 (54%).
W analizie podobieństwa głosu, zarówno podobieństwo cosinusowe (CoSim), jak i odległość euklidesowa (EucDist, [EucDist transformed]54) wykazały stałą korelację między folią #3 a celem dla składu BP #1 (CoSim = 0,99; Rozkład.Euc = 77,4, [0,93]). Korelacja między folią #4 a celem była podobnie silna w składzie BP #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). W angielskim składzie #1 korelacja była spójna dla CoSim (0,83(, ale słaba lub zadowalająca dla EucDist (213,0, [0,47]. Ogólnie rzecz biorąc, zarówno CoSim, jak i EucDist były zadowalającymi technikami w określaniu podobieństwa głosu. Ponadto, CoSim działał nieco skuteczniej, o czym mówili Gahman i Elangovan52(patrz Tabela uzupełniająca S1).
Jeśli chodzi o podobieństwo, co mogło doprowadzić do wzrostu liczby fałszywych alarmów? Cechy prozodyczno-akustyczne wykazały, że chociaż folie i głosy docelowe działały (statystycznie) znacząco inaczej - z wyjątkiem składów prezentowanych w Rysunek 8A,B i Rysunek 9A) - wybory słuchaczy nieco zróżnicowały się wzdłuż różnych kontrastów w innych składach (Rysunek 8C,D i Rysunek 9B-D). Wydaje się, że taka ocena zależy bardziej od jednej (a może więcej) specyficznej cechy akustycznej, którą dzielą głośniki, niż od całej klasy cech prozodowo-akustycznych. Na przykład nasze badanie wykazało kilka cech (współ)różniących się między produkcjami; Niemniej jednak wyniki percepcyjne pokazują preferencje osądów dotyczące konkretnego folii, aby pasował do docelowego głosu8,35,64,65. W przyszłych pracach konieczne są dalsze analizy.
Warto rozważyć wybór wielowymiarowej matrycy parametrycznej dla podobieństwa akustycznego66 jako przedstawionej w tym badaniu. Nasze wyniki są zgodne z wcześniejszymi badaniami, w których wykorzystano cechy akustyczne oparte na f0, VQ i intensywności9,35. Takie cechy są niezwykle sugerowane w zadaniach porównywania głośników w dziedzinie kryminalistyki9,66. Niemniej jednak ważne jest, aby podkreślić, że w obecnych badaniach nie przewidziano, aby żaden z kontrastów był podobny do głosu docelowego, chociaż użyliśmy wariantu wytycznych McFarlane'a16,17 podczas przygotowywania składów głosowych do rozpoznawania mówcy z obcym akcentem. Ponadto musimy podkreślić, że nasza procedura składu głosowego zawiera istotne różnice w stosunku do wytycznych McFarlane'a, w tym długość bodźca, liczbę głosów, wybór folii (tutaj losowo) i styl mowy.
Na ile cechy prozodowo-akustyczne f0, jakość i intensywność głosu wydają się być związane z percepcją słuchaczy, zależy to w dużej mierze od stylu mówienia użytego w badaniach. Tutaj korzystaliśmy z fragmentów do czytania. Większość badań naocznych świadków wybiera (pół)spontaniczne bodźce jako zrównoważone rozwiązanie - np. DyVis corpus67 - który jest szeroko stosowany we współczesnych badaniach nausznych świadków28,68. Powodem, który skłonił nas do wyboru zadań czytania, jest to, że nasz korpus, w czasie tworzenia tego rękopisu, składał się wyłącznie z danych uzyskanych z zadań czytania. Ważne jest jednak, aby przyznać, że proces kompilacji (pół)spontanicznego korpusu jest już w toku. Co więcej, akt czytania opowieści może generować niezawodny poziom jednolitości i zmienności, zarówno wewnątrzmówcy, jak i między mówcami. Ułatwia to położenie nacisku na cechy prozodyczne lub fonetyczne – indywidualne lub dialektalne – w sytuacjach związanych z porównaniem głosu. Staje się to szczególnie zauważalne w przypadku obciążenia mowy podczas produkcji obcego akcentu, nawet wśród biegłych mówców 8,9,23,54.

Rysunek 8: Wykresy słupkowe zawierające wyniki dla czterech składów przeprowadzonych przez brazylijskich słuchaczy. Panie przewodniczący, panie i panowie! Nieistotna różnica między głosem docelowym (w kolorze niebieskim) a folią (w kolorze jasnoniebieskim). (C,D) znaczące różnice w stosunku do folii, oraz głosu docelowego. Skrót: NS = nieistotny. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 9: Wykresy słupkowe zawierające wyniki dla czterech składów przeprowadzonych przez amerykańskich słuchaczy. (A) Nieistotna różnica między głosem docelowym (w kolorze czerwonym) a folią (w kolorze różowym). (B,C,D) Znaczące różnice w stosunku do folii i głosu docelowego. Skrót: NS = nieistotny. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
Tabela uzupełniająca S1: Statystyki produkcji mowy - Uogólnione modele addytywne (GAMs): Statystyki F (stopnie swobody), skorygowane R2 każdej statystycznie istotnej cechy prozodowo-akustycznej (Rysunek 6) oraz metryka rytmu (Rysunek 7) dla każdego poziomu języka, a także indywidualne wartości każdego gładkiego terminu (współzmiennych). Statystyki percepcji mowy: Statystyki Kruskalla-Wallisa χ2 (stopnie swobody), wartości p i skorygowany η2, a także test post-hoc Dunna do porównania parami (Rysunek 8 i Rysunek 9) każdej statystycznie nieistotnej różnicy między parami głosów z folii docelowej (Rysunek 8A,B i Rysunek 9A). Macierze podobieństwa akustycznego dla odległości cosinusowej i euklidesowej każdego składu. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
Obecny protokół stanowi nowość w dziedzinie fonetyki (sądowej). Dzieli się na dwie fazy: jedną opartą na produkcji (analiza akustyczna) i drugą opartą na percepcji (analiza osądu). Faza analizy produkcji obejmuje przygotowanie danych i wymuszone wyrównanie, ponowne wyrównanie i automatyczną ekstrakcję cech prozodowo-akustycznych oprócz statystyk. Protokół ten łączy etap zbierania danych z analizą danych w szybszy i bardziej efektywny sposób niż tradycyjne protokoły oparte na głównie ręcznej segmentacji.
Jednak proces dostosowania, pokazany w krokach protokołu od 1.3.6 do 1.3.6.9, zasadniczo działa na jednostkach telefonu i słowa wygenerowanych w krokach protokołu od 1.3.1 do 1.3.4. Nowością procesu wyrównywania jest to, że generuje on nowy element TextGrid zawierający trzy nowe warstwy tekstu: warstwę sylabiczną, warstwę fragmentu mowy, która może być generowana automatycznie lub ręcznie na podstawie słów, oraz warstwę tonu, która może być bardzo przydatna do obliczania miar f0. Wytyczne dotyczące dostosowania zaproponowane dla tego protokołu były wcześniej stosowane w badaniach rytmu mowy L2 21,69,70, badaniach nad wykrywaniem stopnia obcego akcentu przy użyciu technik uczenia maszynowego22 oraz w badaniach w dziedzinie kryminalistyki 9.
Automatyczna ekstrakcja cech prozodycznych, przedstawiona w krokach protokołu od 1.3.7 do 1.3.7.10, generuje wielowymiarową matrycę cech prozodowo-akustycznych, co można udowodnić w obecnych badaniach. Do takich cech należą cechy mowy melodycznej, czasowej i spektralnej (jakość i intensywność głosu)71. Znaczna liczba tych cech akustycznych jest mniej czuła i nieco odporna na hałaśliwe nagrania dźwiękowe, które ostatecznie zostaną zebrane w ramach badań kryminalistycznych lub innych scenariuszy72. Co więcej, wielowymiarowa matryca może być zastosowana w systemach rozpoznawania mowy za pomocą kilku technik sztucznej inteligencji (prace w toku). Nadal może być bardzo przydatny w nauczaniu aspektów prozodycznych w klasach wymowy L221 (praca w toku).
Analiza statystyczna tej części protokołu reprezentuje zastosowanie metody GAM, ponieważ mieliśmy do czynienia ze złożoną relacją między określoną cechą akustyczną a wieloma mówcami wykorzystującymi czynnik językowy. Na przykład, aby zamodelować konkretną cechę akustyczną, konieczne było sprawdzenie, jak zachowają się inne cechy akustyczne z matrycy (wyrazy gładkie), abyśmy mogli dokładniej opisać, co dzieje się podczas produkcji mowy.
Jeśli chodzi o analizę percepcji, obecny protokół został stworzony poprzez przygotowanie i wdrożenie składów głosowych, analizę statystyczną oraz analizę podobieństwa akustycznego. Do przygotowania składów użyliśmy skryptu CreateLineup dla Praat, który automatycznie generuje plik audio dla każdego składu, zawierający losowo ułożone folie i docelowy głos, zgodnie z opisem w krokach protokołu od 2.2 do 2.2.1.9.
Na potrzeby analizy statystycznej tego protokołu przeprowadziliśmy nieparametryczny test Kruskala-Wallisa, ponieważ nasze dane nie spełniały założeń analizy wariancji (ANOVA). Kiedy już mieliśmy związek między wynikami oceny ocenianymi przez słuchaczy i kontrolowanymi dla głosu docelowego i kontrastów, zdecydowaliśmy się użyć statystyk modelu liniowego.
Do analizy podobieństwa akustycznego użyliśmy skryptu AcousticSmilarity_cosine_euclidean dla Pythona. Program wyświetla drzewo katalogów komputera i prosi użytkownika o wybranie pliku zawierającego cechy prozodowo-akustyczne folii oraz docelowy głos, który składa się na skład w analizie. Za jednym kliknięciem skrypt generuje trzy macierze podobieństwa: cosinus, euklidesowy i przekształcony (zero do jednego) euklidesowy, zarówno w plikach ".txt" (rozdzielanych tabulatorami), jak i ".csv". Musimy jednak pamiętać, że każdy zbiór danych (plik '.txt' zawierający cechy prozodowo-akustyczne folii i tarczy) musi znajdować się w oryginalnym folderze składu, a każdy folder składu musi mieć kopię skryptu AcousticSmilarity_cosine_euclidean .
Podsumowując, obecny protokół czyni postępy w badaniach (kryminalistycznych) nad fonetyką. Składa się z odrębnych faz - analiz produkcji i percepcji, a także podobieństwa akustycznego - wypełniając lukę między gromadzeniem danych a wielowymiarową analizą cech akustycznych. Naukowcy mogą skorzystać z holistycznej perspektywy, badając zarówno aspekty produkcyjne, jak i percepcyjne. Co więcej, protokół ten zapewnia powtarzalność badań, umożliwiając innym korzystanie z wytycznych zawartych w tych pracach.
Ograniczenia i kierunki na przyszłość
Musimy jednak pamiętać, że wszystko zakończy się sukcesem, jeśli przygotowanie danych będzie zgodne z wytycznymi zaproponowanymi w krokach protokołu od 1.3.1 do 1.3.4. Poza tym w procedurach wymuszonego wyrównania musimy mieć świadomość, że zewnętrzny, wstępnie wytrenowany wymuszony nakładek – podobny do MAUS używany w obecnej pracy – jest podatny na błędy segmentacji, zwłaszcza w przypadku nieprzeszkolonych danych z akcentem obcym, a nawet w wstępnie wytrenowanych alignerach, niezależnie od tego, czy dźwięk nie jest dobrej jakości, czy nakładka nie zawiera języka audio (fakt ten utrudniłby pracę eksperta i uczyniłby go bardziej czasochłonnym). Transkrypcja kryminalistyczna, zwłaszcza dłuższych plików audio, napotyka trudności w odniesieniu do dokładnego i wiarygodnego odwzorowania nagrań mówionych72.
Istnieje również kilka wyzwań związanych z transkrypcją i wyrównywaniem dłuższych plików audio. Na wydajność nakładek ma wpływ styl mówienia i środowisko fonetyczne, a także czynniki specyficzne dla dialektu. Chociaż istnieją różnice specyficzne dla nakładek, ogólnie rzecz biorąc, ich wydajność jest podobna i generuje segmentacje, które dobrze wypadają w porównaniu z ogólnym wyrównaniemręcznym 73. Ponadto produkcja języków angielskich L1 i L2 została uruchomiona przy użyciu wstępnie wytrenowanego modelu akustycznego amerykańskiego języka angielskiego ze względu na niedostępność modeli mowy obcej w MAUS. Co więcej, w MAUS nie ma wstępnie wytrenowanych modeli akustycznych dla BP. W przypadku danych BP wykorzystano istniejące wcześniej modele akustyczne języka włoskiego (patrz UWAGA, krok protokołu 1.3.5.7).
W przyszłych pracach (w toku) będziemy używać Montreal Forced Aligner (MFA)74 jako części protokołu. Dużą zaletą uwierzytelniania wieloskładnikowego jest dostępność wstępnie wytrenowanych modeli akustycznych i modeli grafem-fonem dla szerokiej gamy języków (w tym BP), a także możliwość trenowania nowych modeli akustycznych i grafem-fonemów do dowolnego nowego zestawu danych (tj. naszego korpusu mowy z obcym akcentem)75.
Autorzy nie mają do zadeklarowania konfliktu interesów.
To badanie było wspierane przez Narodową Radę Rozwoju Naukowego i Technologicznego - CNPq, grant nr 307010/2022-8 dla pierwszego autora i grant nr 302194/2019-3 dla drugiego autora. Autorzy pragną wyrazić szczerą wdzięczność uczestnikom tych badań za ich hojną współpracę i nieoceniony wkład.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| CreateLineup | Personal collection | # | Skrypt do przygotowania składów głosowych |
| Dell I3 (z dyskiem SSD - SSD) | Dell | # | Laptop |
| Praat | Paul Boersma & David Weenink | # | Oprogramowanie do analizy fonetycznej |
| Python 3 | Python Software Foundation | # | Interpretowany, wysokopoziomowy język programowania ogólnego przeznaczenia |
| R | The R Project for Statistical Computing | # | Język programowania do obliczeń statystycznych |
| Shure Beta SM7B | Shure | # | Microphone |
| SpeechRhythmExtractor | Personal collection | # | Script for praat for automatic extract of acoustic features |
| SurveyMonkey Inc. | # | Zbierz bezpłatne, konfigurowalne ankiety, a także zestaw programów zaplecza, które obejmują analizę danych, wybór próby, usuwanie uprzedzeń i reprezentację danych. | |
| Tascam DR-100 MKII | Tascam | # | Dyktafon cyfrowy |
| Monachijski automatyczny system segmentacji MAUS | Uniwersytet w Monachium | # | Wymuszone wyrównywanie plików audio (.wav) i informacji językowych (.txt) |
| VVUnitAligner | Kolekcja osobista | # | Skrypt do automatycznego wyrównywania i przetwarzania końcowego jednostek fonetycznych |
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie