To badanie miało na celu porównanie L1-L2-angielskiego i L1-L2 portugalskiego, aby sprawdzić, jak bardzo wpływ obcego akcentu wpływa zarówno na metryki, jak i parametry prozodowo-akustyczne, a także na wybór docelowego głosu w zestawie głosowym.
Artykuł metodologiczny
To badanie miało na celu porównanie L1-L2-angielskiego i L1-L2 portugalskiego, aby sprawdzić, jak bardzo wpływ obcego akcentu wpływa zarówno na metryki, jak i parametry prozodowo-akustyczne, a także na wybór docelowego głosu w zestawie głosowym.
To badanie ma na celu zbadanie zarówno cech prozodyczno-akustycznych, jak i percepcyjnych korelatów angielskiego z obcym akcentem i brazylijskiego portugalskiego z obcym akcentem oraz sprawdzenie, jak produkcja obcych i rodzimych akcentów przez mówców jest skorelowana z percepcją słuchaczy. W ramach Metodyki przeprowadziliśmy procedurę produkcji mowy z grupą Amerykanów posługujących się L2 (brazylijski portugalski) oraz grupą Brazylijczyków (L2 English), a także procedurę percepcji mowy, w której wykonaliśmy składy głosowe dla obu języków. Na potrzeby analizy statystycznej produkcji mowy przeprowadziliśmy uogólnione modele addytywne, aby ocenić wpływ grup językowych na każdą klasę (metryczną lub prozodyczno-akustyczną) cech kontrolowanych pod kątem efektu wygładzania współzmiennych przeciwnej klasy. Na potrzeby analizy statystycznej percepcji mowy przeprowadziliśmy test Kruskala-Wallisa oraz test Dunna post hoc, aby ocenić wpływ głosów składów na wyniki oceniane przez słuchaczy. Przeprowadziliśmy jednak testy podobieństwa akustycznego (głosowego) w oparciu o odległości cosinusowe i euklidesowe. Wyniki wykazały istotne różnice akustyczne między grupami językowymi pod względem zmienności f0, czasu trwania i jakości głosu. W przypadku składów wyniki wykazały, że cechy prozodyczne f0, intensywności i jakości głosu korelowały z postrzeganymi ocenami słuchaczy.
Akcent jest istotnym i dynamicznym aspektem komunikacji i płynności, zarówno w języku ojczystym (L1), jak i w języku obcym (L2)1. Akcent obcy reprezentuje cechy fonetyczne L2 języka docelowego i może się zmieniać (w czasie) w odpowiedzi na doświadczenie mówcy w L2, styl mówienia, jakość danych wejściowych, ekspozycję i inne zmienne. Akcent obcy można określić ilościowo jako (skalarny) stopień różnicy między mową L2 wytwarzaną przez obcokrajowca a akcentem lokalnym lub referencyjnym języka docelowego2,3,4,5.
To badanie ma na celu zbadanie zarówno cech prozodyczno-akustycznych, jak i percepcyjnych korelatów angielskiego z obcym akcentem i brazylijskiego portugalskiego (BP), a także sprawdzenie, w jakim stopniu produkcja obcych i rodzimych akcentów przez użytkowników jest skorelowana z percepcją słuchaczy. Wcześniejsze badania w dziedzinie kryminalistyki wykazały, że samogłoski i spółgłoski w identyfikacji obcego akcentu są albo stabilne w długoterminowej analizie danej osoby (The Lo Case6) lub odnoszą się do wysokiej dokładności ID osoby mówiącej (The Lindbergh Case7). Jednak eksploracja cech prozodowo-akustycznych w oparciu o czas trwania, częstotliwość podstawową (f0, tj. akustyczny korelat wysokości dźwięku), intensywność i jakość głosu (VQ) zyskuje coraz większą uwagę8,9. W związku z tym wybór cech prozodowo-akustycznych w tym badaniu stanowi obiecującą drogę w dziedzinie fonetyki sądowej8,10,11,12,13.
Obecne badania są wspierane przez badania poświęcone obcym akcentom jako formie maskowania głosu w sprawach kryminalistycznych14,15, a także w przygotowaniu składów głosowych do rozpoznawania mówcy16,17. Na przykład szybkość mowy odegrała ważną rolę w identyfikacji niemieckich, włoskich, japońskich i brazylijskich użytkowników języka angielskiego18,19,20,21,22. Oprócz szybkości mowy, długoterminowe funkcje spektralne i f0 stanowią wyzwanie dla biegłych użytkowników L2 w zakresie znajomości języka docelowego, ponieważ mózg i podstawy poznawcze cierpią na deficyt pamięci, uwagi i emocji, co odbija się na wydajności fonetycznej mówcy podczas długich zwrotów mowy23. Pogląd na temat obcych akcentów w dziedzinie kryminalistyki jest taki, że definicja tego, co naprawdę brzmi jak obcy akcent, zależy w dużej mierze od nieznajomości słuchacza, a nie od zerowego do skrajnego stopnia mowy z obcym akcentem24.
W dziedzinie percepcyjnej, powszechnym narzędziem kryminalistycznym używanym od połowy lat 90. do rozpoznawania przestępców jest Voice Lineup (rozpoznawanie słuchowe), które jest analogiczne do rozpoznawania wizualnego używanego do identyfikacji sprawcy na miejscu zbrodni16,25. W zestawieniu głosowym głos podejrzanego jest prezentowany wraz z kontrastami – głosami podobnymi w aspektach socjolingwistycznych, takich jak wiek, płeć, położenie geograficzne, dialekt i status kulturowy – w celu identyfikacji przez naocznego świadka. Powodzenie lub niepowodzenie składu głosowego będzie zależało od liczby próbek głosu i czasu trwania próbki25,26. Ponadto w przypadku próbek ze świata rzeczywistego uważa się, że jakość dźwięku konsekwentnie wpływa na dokładność rozpoznawania głosu. Niska jakość dźwięku może zniekształcić unikalne cechy głosu27. W przypadku podobieństwa głosu, drobne szczegóły fonetyczne oparte na f0 mogą zmylić słuchacza podczas rozpoznawania głosu28,29. Takie cechy akustyczne wykraczają poza f0 i obejmują elementy czasu trwania oraz cechy spektralne intensywności i VQ30. To spojrzenie na wiele cech prozodycznych ma kluczowe znaczenie w kontekście porównywania głosu w kryminalistyce, aby zapewnić dokładną identyfikację mówcy9,14,15,29,31.
Podsumowując, badania nad fonetyką kryminalistyczną wykazały pewne różnice w zakresie identyfikacji obcego akcentu w ciągu ostatnich dziesięcioleci. Z jednej strony, obcy akcent nie wydaje się wpływać na proces identyfikacji mówcy32,33 (zwłaszcza jeśli mówca nie jest zaznajomiony z docelowym obcym akcentem34). Z drugiej strony istnieją wyniki w przeciwnym kierunku12,34,35.
Praca ta uzyskała zatwierdzenie komisji etyki badań z udziałem ludzi. Ponadto od wszystkich uczestników zaangażowanych w niniejsze badanie uzyskano świadomą zgodę na wykorzystanie i publikację ich danych.
1. Produkcja mowy
UWAGA: Zebraliśmy mowę z zadania czytania zarówno dla „L1 English-L2 BP” wygenerowanej przez Grupę 1: Amerykańskich mówców języka angielskiego (z USA) (AmE-S), jak i dla „L1 BP-L2 English” wygenerowanej przez Grupę 2: Brazylijskich mówców (Bra-S). Schemat blokowy produkcji mowy przedstawiono na Rysunku 1.

Rysunek 1Schematyczny blokowy przebieg procesu produkcji mowy. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 2Zrzut ekranu z dopasowania fonetycznego przy użyciu narzędzia do wymuszonego wyrównywania MAUS. (A) Przerywany prostokąt służy do przeciągania i upuszczania pliku 'my_file.wav'/' mój_plikProszę o dostarczenie tekstu źródłowego do tłumaczenia.pliki lub kliknięcie wewnątrz obszaru w celu wyszukania takich plików w folderze; przycisk przesyłania jest wskazany czerwoną strzałką. (B) Przesłane pliki z panelu A (patrz niebieska strzałka), potok do zastosowania, język dla par plików, format pliku do zwrócenia oraz przycisk „prawda/fałsz” w celu zachowania wszystkich plików. (C) pole wyboru Warunków użytkowania (patrz zielona strzałka), Uruchamianie usług sieciowych przycisk oraz wyniki (do pobrania pliki TextGrid). Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.

Rysunek 3Zrzut ekranu procedury ponownego wyrównania. (A) Formularz ustawień wejściowych dla procedury ponownego dopasowania. (B) Częściowy przebieg fali, spektrogram szerokopasmowy z konturem f0 (kolor niebieski) oraz sześć poziomów podzielonych na segmenty (i opisanych) jako poziom 1jednostki od początku samogłoski do początku kolejnej samogłoski (V_to_V); początek samogłoski (V_to_V); poziom 2jednostki samogłosek (V), spółgłosek (C) i pauz (#); poziom 3reprezentacje fonetyczne V_do_V; poziom 4kilka słów z tekstu; poziom 5: niektóre fragmenty (CH) mowy z tekstu; warstwa 6: warstwa tonalna zawierająca najwyższy (H) i najniższy (L) ton każdego fragmentu mowy wyprodukowanego przez kobietę posługującą się amerykańską odmianą języka angielskiego (AmE-S).C) Ustawienia wejściowe dla automatycznej ekstrakcji cech akustycznych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.
2. Percepcja mowy
UWAGA: Przeprowadziliśmy cztery próby rozpoznawania głosu w języku angielskim z udziałem słuchaczy z USA oraz cztery próby w BP z udziałem słuchaczy z Brazylii. Schemat blokowy percepcji mowy przedstawiono na Rysunku 4.

Rysunek 4Schematyczny przebieg procesu percepcji mowy. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 5Konfiguracja katalogów dla percepcji mowy. Ustaw foldery w linii. Każdy folder zawiera sześć głosów L1, głos docelowy L2, the "Tworzenie zestawu" skrypt oraz plik audio z zestawieniem głosów (wygenerowany po uruchomieniu skryptu). Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej figury.
Wyniki produkcji mowy
W tej sekcji opisano wyniki statystycznie istotnych prozodyczno-akustycznych cech oraz miar rytmicznych. Cechy prozodyczne obejmowały tempo mowy, tempo artykulacji oraz częstotliwość pauz, które wiążą się z czasem trwania, a także shimmer, który wiąże się z jakością głosu. Miary rytmiczne obejmowały odchylenie standardowe (SD) czasu trwania sylaby, SD spółgłoski, SD czasu trwania samogłosek lub spółgłosek oraz współczynnik zmienności czasu trwania sylaby (patrz Tabela uzupełniająca S1).
Szybkość mowy (Rycina 6A) spada szybciej w przypadku języka angielskiego jako L2 (L1-L2 English) niż w przypadku brazylijskiego portugalskiego jako L2 (L1-L2 BP), choć szybkość ta jest niższa dla obu języków L2. Szybkość mowy jest powiązana z trzema miarami – odchyleniem standardowym czasu trwania sylaby (SD-S), odchyleniem standardowym samogłosek (SD-V) oraz współczynnikiem zmienności sylabicznej (Varco-S). Należy również pamiętać, że obie grupy – AmE-S oraz Bra-S – biegle posługują się swoimi językami L2. Wydaje się, że na taką szybkość wpływają wyższe wartości czasu trwania sylaby oraz mniejsza zmienność generowana przez grupę L1-L2 BP, co skutkuje łagodniejszym nachyleniem krzywych.
The Szybkość artykulacji (Rycina 6D) jest powiązane z SD-S, Varco-S, a także wskaźnik rytmu sylabicznego (RR-S); ta druga wartość reprezentuje stosunek sylab krótkich do długich. Wydaje się, że takie wskaźniki wpływają na Szybkość artykulacji podobnie jak w przypadku osób dotkniętych schorzeniem Tempo mowy ze względu na długość zdań oraz zróżnicowanie czasu trwania, co prowadzi do dłuższego planowania wypowiedzi w języku L2 oraz większego obciążenia poznawczego w języku L29,23,54W obrębie długości zdań może występować zapotrzebowanie na wyższe obciążenie poznawczo-lingwistyczne w sposób, który wpływa na parametry prozodyczno-akustyczne.55.
W odniesieniu do prozodyczno-akustycznych cech tempa mowy oraz tempa artykulacji, nasze wyniki sugerują, że im bardziej mówca różnicuje czas trwania sylab (oraz samogłosek), tym niższe są te wskaźniki. Hipotezyzujemy, że percepcja mowy w przypadku zarówno L1, jak i L2 BP wydaje się nieco wolniejsza niż w przypadku L1 i L2 angielskiego, a L1 angielski brzmi szybciej niż wszystkie pozostałe poziomy językowe. Fakt ten może być związany z rytmem mowy i hipotezą, że podczas gdy L1-L2 BP skłania się ku biegunowi sylabicznemu kontinuum rytmicznego, L1-L2 angielski przesuwa się w stronę bieguna akcentowego21,2.
Lokalny shimmer, Rysunek 6B, jest pod wpływem SD-S oraz Varco-S. W przypadku lokalnego shimmeru, w obu produkcjach Bra-S, L1-BP oraz L2-English występuje w pewnym stopniu monotoniczna trajektoria wraz ze wzrostem zmienności czasu trwania sylab (SD i Varco, patrz Tabela uzupełniająca S1). Percepcja wysiłku wokalnego może być widoczna podczas słuchania produkcji Bra-S ze względu na niską zmienność w zakresie od 8,5 do 9 dB. Mowa Bra-S jest pod wpływem obciążenia wokalnego. L1-BP jest w dużym stopniu zależne od długości zdania, będąc mniej wrażliwe na wysokie wariacje czasu trwania sylab (wzorzec rytmiczny BP wykazuje mniejszą zmienność sylabiczną2,56).
Wykres 6C przedstawiający częstość pauz wskazuje, że osoby posługujące się językiem angielskim jako drugim językiem (L2-English) generują dłuższe pauzy (od 20 ms do 375 ms) niż osoby posługujące się językiem angielskim jako pierwszym (L1-English), braziilijskim portugalskim jako pierwszym (L1-BP) oraz brazylijskim portugalskim jako drugim (L2-BP) (średnio 30 ms dla L1-English, 50 ms dla L1-BP i 100 ms dla L2-BP). W tym przypadku planowanie wypowiedzi mogło wpłynąć na produkcję w języku L2-English ze względu na zwiększoną aktywność mózgu54,57. Oczekuje się, że wyższa biegłość językowa przełoży się na większą szybkość i zakres czytania54; niemniej jednak, nawet w przypadku biegłych mówców L2, zadania czytania wymagały większego wysiłku w zakresie wyższych funkcji poznawczych mowy obcej oraz przetwarzania języka54,57. Nasze wyniki pokazują, przynajmniej wstępnie, że mówcy L2-BP mogą być w mniejszym stopniu narażeni na pauzy niż mówcy L2-English ze względu na różnice w strukturze rytmicznej obu języków.

Rysunek 6Uogólnione modele addytywne dla prozodyczno-akustycznych cech sygnału. Na osi Y znajduje się zmienna objaśniana (cechy akustyczne podlegające modelowaniu); na osi X zmienne objaśniające (czynnik „Language” oraz kowarianty w modelach addytywnych, które określą kształt i trajektorie krzywych, tj. efekty wygładzające: „Language + covariates”, a także iloczyn czynnika „Language” i cechy metrycznej, co zapewni dokładniejszą projekcję zmiennej objaśnianej, tj. interakcje czynnik-wygładzanie: „covariate:Language”). Skrót: GAMs = uogólnione modele addytywne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.
W odniesieniu do parametrów rytmicznych, w przypadku SD-S (Rycina 7A), nasze wyniki wykazują, że im bardziej mówca różnicuje krzywą f0 i zwiększa tempo mowy, tym bardziej SD-S spada dla wszystkich poziomów biegłości językowej (efekt lustrzany Ryciny 6A). W przypadku SD dla spółgłosek (SD-C, Rycina 7C), osoby L1-BP, w przeciwieństwie do L1 English, wykazują niską zmienność wraz ze wzrostem tempa mowy lub czasu trwania pauzy. Taki kierunek zmian SD jest przewidywalny, ponieważ zmienność czasu trwania sylaby w L1-English jest (statystycznie) istotnie wyższa niż w L1-BP4,58. Varco-S (Rycina 7B oraz Tabela uzupełniająca S1) wydaje się być w pewnym stopniu skorelowany z L1 i L2 w obrębie tej samej grupy językowej. Wraz ze wzrostem zmienności f0 i tempa mowy, Varco-S spada dla L1-BP oraz wydaje się spadać i tłumić dla L2-BP. W przypadku produkcji w języku angielskim, podczas gdy zmienność f0 i tempo mowy rosną, Varco-S rośnie i tłumi się dla L1-English oraz L2-English.
W odniesieniu do SD dla samogłosek lub spółgłosek (SD-V_C, Rysunek 7D i Tabela uzupełniająca S1), nasze wyniki wykazują pewne podobieństwa do wyników Varco-S (Rysunek 7B). Na przykład wyższe tempo mowy, czas trwania pauzy oraz zmienność f0 sprzyjają trajektorii spadkowo-wznoszącej SD-V_C dla L1-BP oraz dla L2-BP. W produkcjach w języku angielskim, mimo że cechy prozodyczne te są wyższe, SD-V_C lekko spada, słabnie dla L1-English, lekko wzrasta, a następnie słabnie dla L2-English. Korelacja Varco-S i SD-V_C z L1-L2 w tych samych grupach językowych może być częściowo wyjaśniona efektem Lombarda, który odnosi się do zmiany parametrów akustycznych mowy pod wpływem hałasu w tle59.
W mowie obcojęzycznej, w zależności od stopnia złożoności zadania (np. mowy czytanej), mówcy stosowali podobne strategie akustyczne zarówno w L1, jak i w L259,60. Z jednej strony Marcoux i Ernestus stwierdzili, że pomiary f0 (zakres i mediana) w mowie Lombard w L2 sugerują, że osoby mówiące po angielsku jako w L2 znajdowały się pod wpływem swojego ojczystego języka niderlandzkiego (L1)61,62. Z drugiej strony nowsze ustalenia wskazują, że choć oczekuje się, iż mowa Lombard w L2 będzie różnić się od mowy Lombard w L1 ze względu na wyższe obciążenie poznawcze podczas mówienia w L2, osoby posługujące się językiem angielskim w L2 generowały mowę Lombard w tym samym kierunku, co osoby mówiące w L1 po angielsku63. Zakres, w jakim nasze wyniki są zgodne z ustaleniami Marcoux i Ernestusa63 oraz odbiegają od wyników Waaninga59, Villegasa i współpracowników60 oraz Marcoux i Ernestusa61,62, wymaga dalszych badań.

Rysunek 7Uogólnione modele addytywne dla cech metrycznych. Na osi Y znajduje się zmienna reakcji (cechy metryczne podlegające modelowaniu); na osi X znajdują się zmienne predyktory (czynnik „Language” oraz współzmienne w modelach addytywnych, które określą kształt i trajektorie krzywych (tj. efekty wygładzania: „Language + covariates”), oraz iloczyn czynnika „Language” i cechy metrycznej, który zapewni dokładniejszą projekcję zmiennej reakcji (tj. interakcje czynnik-wygładzanie: „covariate:Language”)). Skrót: GAMs = uogólnione modele addytywne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Wyniki percepcji mowy
W odniesieniu do zestawów głosów BP, w zestawie nr 1 (Rysunek 8A) głos dystraktor nr 3 został uznany za głos docelowy. W rzeczywistości głosem docelowym był głos nr 4. Wyniki nie wykazują statystycznie istotnej różnicy (patrz Tabela uzupełniająca S1) pomiędzy dystraktorem nr 3 (83%) a głosem docelowym nr 4 (71%). W zestawie nr 2 (Rysunek 8B) porównanie głosu docelowego nr 3 (40%) i dystraktora nr 4 (20%) również nie wykazało statystycznie istotnej różnicy (patrz Tabela uzupełniająca S1) dla zestawów głosów w języku angielskim. W zestawie nr 1 (Rysunek 9A) nie stwierdzono istotnej różnicy (patrz Tabela uzupełniająca S1) pomiędzy dystraktorem nr 2 (26%) a głosem docelowym nr 4 (54%).
W analizie podobieństwa głosów zarówno podobieństwo cosinusowe (CoSim), jak i odległość euklidesowa (EucDist, [EucDist przekształcona]54) wykazały spójną korelację między dystraktorem nr 3 a celem dla zestawu BP nr 1 (CoSim = 0,99; EucDist = 7,4, [0,93]). Korelacja między dystraktorem nr 4 a celem była podobnie silna w zestawie BP nr 2 (CoSim = 0,9, EucDist = 76,3, [0,93]). W angielskim zestawie nr 1 korelacja była spójna dla CoSim (0,83), ale słaba do zadowalającej dla EucDist (213,0, [0,47]). Ogólnie rzecz biorąc, zarówno CoSim, jak i EucDist okazały się zadowalającymi technikami w określaniu podobieństwa głosów. Ponadto CoSim sprawowała się nieco skuteczniej, co wskazali Gahman i Elangovan52(patrz Tabela uzupełniająca S1)).
Pod kątem podobieństwa, co mogło doprowadzić do zwiększenia liczby fałszywych alarmów? Cechy prozodyczno-akustyczne wykazały, że choć głosy dystraktorów i głosy docelowe różniły się (statystycznie) znacząco — z wyjątkiem zestawów przedstawionych na Rysunku 8A,B oraz Rysunku 9A — wybory słuchaczy były w pewnym stopniu zróżnicowane pomiędzy różnymi dystraktorami w pozostałych zestawach (Rysunek 8C,D oraz Rysunek 9B-D). Takie osądy wydają się zależeć bardziej od jednej (lub być może większej liczby) konkretnej cechy akustycznej wspólnej dla mówców niż od całej klasy cech prozodyczno-akustycznych. Na przykład w naszym badaniu przedstawiono kilka cech (współ)zmiennych pomiędzy próbkami; niemniej jednak wyniki percepcyjne wskazują na preferencje w osądach dla konkretnego dystraktora pasującego do głosu docelowego8,35,64,65. W przyszłych pracach niezbędne będą dalsze analizy.
Warto rozważyć wybór wielowymiarowej macierzy parametrów dla podobieństwa akustycznego6 w formie zaprezentowanej w niniejszym badaniu. Nasze wyniki są zgodne z wcześniejszymi badaniami, w których wykorzystano cechy akustyczne oparte na f0, VQ i intensywności9,35. Takie cechy są wysoce rekomendowane do zadań porównywania mówców w kryminalistyce9,6. Należy jednak podkreślić, że w obecnym badaniu żadne z wypełniaczy nie zostało uznane za podobne do głosu docelowego, mimo zastosowania wariantowych wytycznych McFarlane'a16,17 podczas przygotowywania zestawów głosów do rozpoznawania mówców z obcym akcentem. Ponadto należy zaznaczyć, że nasza procedura tworzenia zestawów głosów zawiera istotne różnice w stosunku do wytycznych McFarlane'a, w tym w zakresie długości bodźca, liczby głosów, wyboru wypełniaczy (tutaj zrandomizowanych) oraz stylu mowy.
Zakres, w jakim cechy prozodyczno-akustyczne f0, jakości głosu i intensywności wydają się być powiązane z percepcją słuchaczy, w dużym stopniu zależy od stylu mówienia zastosowanego w badaniu. W niniejszej pracy wykorzystano odczytywanie fragmentów tekstu. Większość badań nad świadkami słuchowymi wybiera bodźce (pół-)spontaniczne jako zbalansowane rozwiązanie – np. korpus DyVis67 – który był szeroko stosowany w aktualnych badaniach nad świadkami słuchowymi28,68. Powodem, dla którego zdecydowaliśmy się na zadania polegające na czytaniu, jest fakt, że nasz korpus w momencie sporządzania tego manuskryptu składał się wyłącznie z danych uzyskanych z takich zadań. Należy jednak zaznaczyć, że proces tworzenia korpusu (pół-)spontanicznego jest już w toku. Co więcej, akt czytania opowiadania może generować stabilny poziom jednolitości i zmienności, zarówno wewnątrz jednego mówcy, jak i między różnymi mówcami. Ułatwia to skupienie uwagi na cechach prozodycznych lub fonetycznych – indywidualnych lub dialektalnych – w sytuacjach związanych z porównywaniem głosu. Staje się to szczególnie zauważalne w przypadkach obciążenia wokalnego podczas produkcji obcego akcentu, nawet u biegłych mówców 8,9,23,54.

Rysunek 8Wykresy słupkowe zawierające wyniki dla czterech zestawów porównawczych przeprowadzonych przez brazylijskich słuchaczy. (A,B) Brak istotnej różnicy między głosem docelowym (na niebiesko) a głosem dystraktorem (na jasnoniebiesko). (C,D) istotne różnice w stosunku do dystraktorów oraz głosu docelowego. Skrót: NS = nieistotne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 9Wykresy słupkowe zawierające wyniki czterech prób rozpoznania przeprowadzonych przez amerykańskich słuchaczy. (A) Brak istotnej różnicy między głosem docelowym (na czerwono) a głosem dystraktorem (na różowo). (B,C,D) Istotne różnice w stosunku do dystraktorów i głosu docelowego. Skrót: NS = nieistotne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Tabela uzupełniająca S1Statystyki produkcji mowy - uogólnione modele addytywne (GAM): statystyki F (stopnie swobody), skorygowany R2 każdej statystycznie istotnej cechy prozodyczno-akustycznej (Rysunek 6), oraz metrykę rytmu (Rycina 7) w zależności od poziomu językowego, a także indywidualne wartości każdego składnika wygładzającego (kowariantów). Statystyki percepcji mowy: test Kruskalla-Wallisa χ2 statystyki (stopnie swobody), wartości p oraz skorygowane η2oraz test post-hoc Dunna do porównań parzystych (Rycina 8 i Rysunek 9) każdej statystycznie nieistotnej różnicy pomiędzy parami głosów docelowych i dystraktorów (Rycina 8A,B i Rysunek 9A). Macierze podobieństwa akustycznego dla odległości cosinusowej i euklidesowej dla każdego zestawu porównawczego. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej figury.
Obecny protokół stanowi nowość w dziedzinie fonetyki (sądowej). Dzieli się na dwie fazy: jedną opartą na produkcji (analiza akustyczna) i drugą opartą na percepcji (analiza osądu). Faza analizy produkcji obejmuje przygotowanie danych i wymuszone wyrównanie, ponowne wyrównanie i automatyczną ekstrakcję cech prozodowo-akustycznych oprócz statystyk. Protokół ten łączy etap zbierania danych z analizą danych w szybszy i bardziej efektywny sposób niż tradycyjne protokoły oparte na głównie ręcznej segmentacji.
Jednak proces dostosowania, pokazany w krokach protokołu od 1.3.6 do 1.3.6.9, zasadniczo działa na jednostkach telefonu i słowa wygenerowanych w krokach protokołu od 1.3.1 do 1.3.4. Nowością procesu wyrównywania jest to, że generuje on nowy element TextGrid zawierający trzy nowe warstwy tekstu: warstwę sylabiczną, warstwę fragmentu mowy, która może być generowana automatycznie lub ręcznie na podstawie słów, oraz warstwę tonu, która może być bardzo przydatna do obliczania miar f0. Wytyczne dotyczące dostosowania zaproponowane dla tego protokołu były wcześniej stosowane w badaniach rytmu mowy L2 21,69,70, badaniach nad wykrywaniem stopnia obcego akcentu przy użyciu technik uczenia maszynowego22 oraz w badaniach w dziedzinie kryminalistyki 9.
Automatyczna ekstrakcja cech prozodycznych, przedstawiona w krokach protokołu od 1.3.7 do 1.3.7.10, generuje wielowymiarową matrycę cech prozodowo-akustycznych, co można udowodnić w obecnych badaniach. Do takich cech należą cechy mowy melodycznej, czasowej i spektralnej (jakość i intensywność głosu)71. Znaczna liczba tych cech akustycznych jest mniej czuła i nieco odporna na hałaśliwe nagrania dźwiękowe, które ostatecznie zostaną zebrane w ramach badań kryminalistycznych lub innych scenariuszy72. Co więcej, wielowymiarowa matryca może być zastosowana w systemach rozpoznawania mowy za pomocą kilku technik sztucznej inteligencji (prace w toku). Nadal może być bardzo przydatny w nauczaniu aspektów prozodycznych w klasach wymowy L221 (praca w toku).
Analiza statystyczna tej części protokołu reprezentuje zastosowanie metody GAM, ponieważ mieliśmy do czynienia ze złożoną relacją między określoną cechą akustyczną a wieloma mówcami wykorzystującymi czynnik językowy. Na przykład, aby zamodelować konkretną cechę akustyczną, konieczne było sprawdzenie, jak zachowają się inne cechy akustyczne z matrycy (wyrazy gładkie), abyśmy mogli dokładniej opisać, co dzieje się podczas produkcji mowy.
Jeśli chodzi o analizę percepcji, obecny protokół został stworzony poprzez przygotowanie i wdrożenie składów głosowych, analizę statystyczną oraz analizę podobieństwa akustycznego. Do przygotowania składów użyliśmy skryptu CreateLineup dla Praat, który automatycznie generuje plik audio dla każdego składu, zawierający losowo ułożone folie i docelowy głos, zgodnie z opisem w krokach protokołu od 2.2 do 2.2.1.9.
Na potrzeby analizy statystycznej tego protokołu przeprowadziliśmy nieparametryczny test Kruskala-Wallisa, ponieważ nasze dane nie spełniały założeń analizy wariancji (ANOVA). Kiedy już mieliśmy związek między wynikami oceny ocenianymi przez słuchaczy i kontrolowanymi dla głosu docelowego i kontrastów, zdecydowaliśmy się użyć statystyk modelu liniowego.
Do analizy podobieństwa akustycznego użyliśmy skryptu AcousticSmilarity_cosine_euclidean dla Pythona. Program wyświetla drzewo katalogów komputera i prosi użytkownika o wybranie pliku zawierającego cechy prozodowo-akustyczne folii oraz docelowy głos, który składa się na skład w analizie. Za jednym kliknięciem skrypt generuje trzy macierze podobieństwa: cosinus, euklidesowy i przekształcony (zero do jednego) euklidesowy, zarówno w plikach ".txt" (rozdzielanych tabulatorami), jak i ".csv". Musimy jednak pamiętać, że każdy zbiór danych (plik '.txt' zawierający cechy prozodowo-akustyczne folii i tarczy) musi znajdować się w oryginalnym folderze składu, a każdy folder składu musi mieć kopię skryptu AcousticSmilarity_cosine_euclidean .
Podsumowując, obecny protokół czyni postępy w badaniach (kryminalistycznych) nad fonetyką. Składa się z odrębnych faz - analiz produkcji i percepcji, a także podobieństwa akustycznego - wypełniając lukę między gromadzeniem danych a wielowymiarową analizą cech akustycznych. Naukowcy mogą skorzystać z holistycznej perspektywy, badając zarówno aspekty produkcyjne, jak i percepcyjne. Co więcej, protokół ten zapewnia powtarzalność badań, umożliwiając innym korzystanie z wytycznych zawartych w tych pracach.
Ograniczenia i kierunki na przyszłość
Musimy jednak pamiętać, że wszystko zakończy się sukcesem, jeśli przygotowanie danych będzie zgodne z wytycznymi zaproponowanymi w krokach protokołu od 1.3.1 do 1.3.4. Poza tym w procedurach wymuszonego wyrównania musimy mieć świadomość, że zewnętrzny, wstępnie wytrenowany wymuszony nakładek – podobny do MAUS używany w obecnej pracy – jest podatny na błędy segmentacji, zwłaszcza w przypadku nieprzeszkolonych danych z akcentem obcym, a nawet w wstępnie wytrenowanych alignerach, niezależnie od tego, czy dźwięk nie jest dobrej jakości, czy nakładka nie zawiera języka audio (fakt ten utrudniłby pracę eksperta i uczyniłby go bardziej czasochłonnym). Transkrypcja kryminalistyczna, zwłaszcza dłuższych plików audio, napotyka trudności w odniesieniu do dokładnego i wiarygodnego odwzorowania nagrań mówionych72.
Istnieje również kilka wyzwań związanych z transkrypcją i wyrównywaniem dłuższych plików audio. Na wydajność nakładek ma wpływ styl mówienia i środowisko fonetyczne, a także czynniki specyficzne dla dialektu. Chociaż istnieją różnice specyficzne dla nakładek, ogólnie rzecz biorąc, ich wydajność jest podobna i generuje segmentacje, które dobrze wypadają w porównaniu z ogólnym wyrównaniemręcznym 73. Ponadto produkcja języków angielskich L1 i L2 została uruchomiona przy użyciu wstępnie wytrenowanego modelu akustycznego amerykańskiego języka angielskiego ze względu na niedostępność modeli mowy obcej w MAUS. Co więcej, w MAUS nie ma wstępnie wytrenowanych modeli akustycznych dla BP. W przypadku danych BP wykorzystano istniejące wcześniej modele akustyczne języka włoskiego (patrz UWAGA, krok protokołu 1.3.5.7).
W przyszłych pracach (w toku) będziemy używać Montreal Forced Aligner (MFA)74 jako części protokołu. Dużą zaletą uwierzytelniania wieloskładnikowego jest dostępność wstępnie wytrenowanych modeli akustycznych i modeli grafem-fonem dla szerokiej gamy języków (w tym BP), a także możliwość trenowania nowych modeli akustycznych i grafem-fonemów do dowolnego nowego zestawu danych (tj. naszego korpusu mowy z obcym akcentem)75.
Autorzy nie mają do zadeklarowania konfliktu interesów.
To badanie było wspierane przez Narodową Radę Rozwoju Naukowego i Technologicznego - CNPq, grant nr 307010/2022-8 dla pierwszego autora i grant nr 302194/2019-3 dla drugiego autora. Autorzy pragną wyrazić szczerą wdzięczność uczestnikom tych badań za ich hojną współpracę i nieoceniony wkład.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| CreateLineup | Personal collection | # | Skrypt do przygotowania składów głosowych |
| Dell I3 (z dyskiem SSD - SSD) | Dell | # | Laptop |
| Praat | Paul Boersma & David Weenink | # | Oprogramowanie do analizy fonetycznej |
| Python 3 | Python Software Foundation | # | Interpretowany, wysokopoziomowy język programowania ogólnego przeznaczenia |
| R | The R Project for Statistical Computing | # | Język programowania do obliczeń statystycznych |
| Shure Beta SM7B | Shure | # | Microphone |
| SpeechRhythmExtractor | Personal collection | # | Script for praat for automatic extract of acoustic features |
| SurveyMonkey Inc. | # | Zbierz bezpłatne, konfigurowalne ankiety, a także zestaw programów zaplecza, które obejmują analizę danych, wybór próby, usuwanie uprzedzeń i reprezentację danych. | |
| Tascam DR-100 MKII | Tascam | # | Dyktafon cyfrowy |
| Monachijski automatyczny system segmentacji MAUS | Uniwersytet w Monachium | # | Wymuszone wyrównywanie plików audio (.wav) i informacji językowych (.txt) |
| VVUnitAligner | Kolekcja osobista | # | Skrypt do automatycznego wyrównywania i przetwarzania końcowego jednostek fonetycznych |