Artykuł metodologiczny

Obcy akcent i kryminalistyczna identyfikacja mówcy w składach głosowych: wpływ cech akustycznych na podstawie prozodii

1.5K wyświetleń

DOI:

10.3791/66313

27 września 2024

W tym artykule

Podsumowanie

To badanie miało na celu porównanie L1-L2-angielskiego i L1-L2 portugalskiego, aby sprawdzić, jak bardzo wpływ obcego akcentu wpływa zarówno na metryki, jak i parametry prozodowo-akustyczne, a także na wybór docelowego głosu w zestawie głosowym.

Streszczenie

To badanie ma na celu zbadanie zarówno cech prozodyczno-akustycznych, jak i percepcyjnych korelatów angielskiego z obcym akcentem i brazylijskiego portugalskiego z obcym akcentem oraz sprawdzenie, jak produkcja obcych i rodzimych akcentów przez mówców jest skorelowana z percepcją słuchaczy. W ramach Metodyki przeprowadziliśmy procedurę produkcji mowy z grupą Amerykanów posługujących się L2 (brazylijski portugalski) oraz grupą Brazylijczyków (L2 English), a także procedurę percepcji mowy, w której wykonaliśmy składy głosowe dla obu języków. Na potrzeby analizy statystycznej produkcji mowy przeprowadziliśmy uogólnione modele addytywne, aby ocenić wpływ grup językowych na każdą klasę (metryczną lub prozodyczno-akustyczną) cech kontrolowanych pod kątem efektu wygładzania współzmiennych przeciwnej klasy. Na potrzeby analizy statystycznej percepcji mowy przeprowadziliśmy test Kruskala-Wallisa oraz test Dunna post hoc, aby ocenić wpływ głosów składów na wyniki oceniane przez słuchaczy. Przeprowadziliśmy jednak testy podobieństwa akustycznego (głosowego) w oparciu o odległości cosinusowe i euklidesowe. Wyniki wykazały istotne różnice akustyczne między grupami językowymi pod względem zmienności f0, czasu trwania i jakości głosu. W przypadku składów wyniki wykazały, że cechy prozodyczne f0, intensywności i jakości głosu korelowały z postrzeganymi ocenami słuchaczy.

Wprowadzenie

Akcent jest istotnym i dynamicznym aspektem komunikacji i płynności, zarówno w języku ojczystym (L1), jak i w języku obcym (L2)1. Akcent obcy reprezentuje cechy fonetyczne L2 języka docelowego i może się zmieniać (w czasie) w odpowiedzi na doświadczenie mówcy w L2, styl mówienia, jakość danych wejściowych, ekspozycję i inne zmienne. Akcent obcy można określić ilościowo jako (skalarny) stopień różnicy między mową L2 wytwarzaną przez obcokrajowca a akcentem lokalnym lub referencyjnym języka docelowego2,3,4,5.

To badanie ma na celu zbadanie zarówno cech prozodyczno-akustycznych, jak i percepcyjnych korelatów angielskiego z obcym akcentem i brazylijskiego portugalskiego (BP), a także sprawdzenie, w jakim stopniu produkcja obcych i rodzimych akcentów przez użytkowników jest skorelowana z percepcją słuchaczy. Wcześniejsze badania w dziedzinie kryminalistyki wykazały, że samogłoski i spółgłoski w identyfikacji obcego akcentu są albo stabilne w długoterminowej analizie danej osoby (The Lo Case6) lub odnoszą się do wysokiej dokładności ID osoby mówiącej (The Lindbergh Case7). Jednak eksploracja cech prozodowo-akustycznych w oparciu o czas trwania, częstotliwość podstawową (f0, tj. akustyczny korelat wysokości dźwięku), intensywność i jakość głosu (VQ) zyskuje coraz większą uwagę8,9. W związku z tym wybór cech prozodowo-akustycznych w tym badaniu stanowi obiecującą drogę w dziedzinie fonetyki sądowej8,10,11,12,13.

Obecne badania są wspierane przez badania poświęcone obcym akcentom jako formie maskowania głosu w sprawach kryminalistycznych14,15, a także w przygotowaniu składów głosowych do rozpoznawania mówcy16,17. Na przykład szybkość mowy odegrała ważną rolę w identyfikacji niemieckich, włoskich, japońskich i brazylijskich użytkowników języka angielskiego18,19,20,21,22. Oprócz szybkości mowy, długoterminowe funkcje spektralne i f0 stanowią wyzwanie dla biegłych użytkowników L2 w zakresie znajomości języka docelowego, ponieważ mózg i podstawy poznawcze cierpią na deficyt pamięci, uwagi i emocji, co odbija się na wydajności fonetycznej mówcy podczas długich zwrotów mowy23. Pogląd na temat obcych akcentów w dziedzinie kryminalistyki jest taki, że definicja tego, co naprawdę brzmi jak obcy akcent, zależy w dużej mierze od nieznajomości słuchacza, a nie od zerowego do skrajnego stopnia mowy z obcym akcentem24.

W dziedzinie percepcyjnej, powszechnym narzędziem kryminalistycznym używanym od połowy lat 90. do rozpoznawania przestępców jest Voice Lineup (rozpoznawanie słuchowe), które jest analogiczne do rozpoznawania wizualnego używanego do identyfikacji sprawcy na miejscu zbrodni16,25. W zestawieniu głosowym głos podejrzanego jest prezentowany wraz z kontrastami – głosami podobnymi w aspektach socjolingwistycznych, takich jak wiek, płeć, położenie geograficzne, dialekt i status kulturowy – w celu identyfikacji przez naocznego świadka. Powodzenie lub niepowodzenie składu głosowego będzie zależało od liczby próbek głosu i czasu trwania próbki25,26. Ponadto w przypadku próbek ze świata rzeczywistego uważa się, że jakość dźwięku konsekwentnie wpływa na dokładność rozpoznawania głosu. Niska jakość dźwięku może zniekształcić unikalne cechy głosu27. W przypadku podobieństwa głosu, drobne szczegóły fonetyczne oparte na f0 mogą zmylić słuchacza podczas rozpoznawania głosu28,29. Takie cechy akustyczne wykraczają poza f0 i obejmują elementy czasu trwania oraz cechy spektralne intensywności i VQ30. To spojrzenie na wiele cech prozodycznych ma kluczowe znaczenie w kontekście porównywania głosu w kryminalistyce, aby zapewnić dokładną identyfikację mówcy9,14,15,29,31.

Podsumowując, badania nad fonetyką kryminalistyczną wykazały pewne różnice w zakresie identyfikacji obcego akcentu w ciągu ostatnich dziesięcioleci. Z jednej strony, obcy akcent nie wydaje się wpływać na proces identyfikacji mówcy32,33 (zwłaszcza jeśli mówca nie jest zaznajomiony z docelowym obcym akcentem34). Z drugiej strony istnieją wyniki w przeciwnym kierunku12,34,35.

Protokół

Praca ta uzyskała zatwierdzenie komisji etyki badań z udziałem ludzi. Ponadto od wszystkich uczestników zaangażowanych w niniejsze badanie uzyskano świadomą zgodę na wykorzystanie i publikację ich danych.

1. Produkcja mowy

UWAGA: Zebraliśmy mowę z zadania czytania zarówno dla „L1 English-L2 BP” wygenerowanej przez Grupę 1: Amerykańskich mówców języka angielskiego (z USA) (AmE-S), jak i dla „L1 BP-L2 English” wygenerowanej przez Grupę 2: Brazylijskich mówców (Bra-S). Schemat blokowy produkcji mowy przedstawiono na Rysunku 1.

figure-protocol-1
Rysunek 1Schematyczny blokowy przebieg procesu produkcji mowy. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

  1. Uczestnicy
    1. Wyznacz liczbę uczestników, język (L1 angielski, L2 BP; L1 BP, L2 angielski), płeć (żeńska lub męska), wiek (średnia, odchylenie standardowe), charakterystykę grupy (specjaliści lub studenci studiów licencjackich) oraz poziom biegłości w języku L2 (zaawansowany lub bardzo zaawansowany) dla każdej grupy.
      UWAGA: W niniejszym badaniu zarówno grupę AmE-S, jak i Bra-S uznano za biegłe w L2 (obie grupy zakwalifikowano na poziomach B2-C136). Osoby z grupy AmE-S mieszkały w Brazylii przez dwa lata w momencie przeprowadzania procedur. Osoby z grupy Bra-S mieszkały w USA ponad dwa lata w momencie przeprowadzania procedur. Podczas pobytu za granicą obie grupy posługiwały się językiem L2 w celach edukacyjnych i zawodowych co najmniej 6 dni w tygodniu przez ok. 4-5 h dziennie.
    2. Zakwateruj uczestników w wygodnym i cichym pomieszczeniu i przedstaw materiał do czytania dla każdej grupy.
  2. Gromadzenie danych
    UWAGA: Dane mowy muszą zostać zebrane podczas zadania czytania w następujących językach: L1-angielski i L2-BP oraz L1-BP i L2-angielski. W razie potrzeby pozwól uczestnikom zapoznać się z tekstami wcześniej.
    1. Procedury nagrywania
      1. Nagraj dane mowy w cichym miejscu o odpowiednich warunkach akustycznych.
      2. Użyj cyfrowego rejestratora dźwięku (patrz Tabela materiałów)37 oraz jednokierunkowego, izolowanego elektromagnetycznie mikrofonu kardioidalnego (patrz Tabela materiałów)38.
      3. Nagraj dane audio w formacie '.wav'.
      4. Ustaw częstotliwość próbkowania na 48 kHz oraz rozdzielczość kwantyzacji na 16 bitów.
        UWAGA: Format audio oraz konfiguracja częstotliwości próbkowania i kwantyzacji opisane w krokach 1.2.1.3 i 1.2.1.4 są stosowane w celu zapewnienia wysokiej jakości i redukcji szumów, aby zachować cechy spektralne wykorzystywane w późniejszej analizie akustycznej.
  3. Analiza akustyczna
    UWAGA: Podziel procedury analizy akustycznej na trzy etapy: wymuszone wyrównanie (forced-alignment), ponowne wyrównanie (realignment) oraz ekstrakcję cech akustycznych.
    1. Przygotuj transkrypcję lingwistyczną (w pliku '.txt') dla każdego pliku audio.
    2. Oznacz pary plików '.txt'/'.wav' taką samą nazwą (np. 'my_file.wav'/ 'my_file.txt').
      UWAGA: Aby usprawnić działanie procedury opisanej w sekcji 1.3.7, wysoce zaleca się, aby pierwsze trzy znaki nazw plików '.txt/.wav' reprezentowały język, dialekt lub akcent, a czwarty do szóstego znaku oznaczały płeć (np. EL1FEM dla English L1 Female). Od siódmego znaku użytkownik powinien wskazać numer mówcy (np. 01 dla pierwszego mówcy). W związku z tym pierwsza para '.txt/.wav' to EL1FEM01.
    3. Utwórz folder dla każdej pary języków L1-L2.
      UWAGA: Folder dla L1-L2 angielski i folder dla L1-L2 BP.
    4. Upewnij się, że wszystkie pary plików w tym samym języku znajdują się w tym samym folderze.
    5. Przeprowadź wymuszone wyrównanie (forced alignment).
      1. Wejdź w interfejs sieciowy narzędzia do wymuszonego wyrównania Munich Automatic Segmentation (MAUS) (webMAUS)39 pod adresem https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Przeciągnij i upuść każdą parę plików .wav / .txt z folderu do przerywanego prostokąta w sekcji Files (lub kliknij wewnątrz prostokąta, Rysunek 2A).
      3. Kliknij przycisk Upload , aby przesłać pliki do wyrównywacza (patrz czerwona strzałka na Rysunku 2A).
      4. Wybierz następujące opcje w menu Service options (Rysunek 2B): G2P-MAUS-PHO2SYL dla Pipeline name; English (US) (dla Language) w przypadku danych L1-L2 angielskich; Italian (IT) (dla Language) w przypadku danych L1-L2 BP.
        UWAGA: Wybraliśmy język włoski ('Italian') dla danych BP, ponieważ webMAUS nie oferuje wstępnie wytrenowanych modeli akustycznych dla wymuszonego wyrównania języka BP. Literatura fonetyczna wskazuje, że fonologia włoska posiada nieco porównywalny, symetryczny zestaw siedmiu samogłosek, podobnie jak BP40, a także podobieństwa akustyczne spółgłosek41,42.
      5. Zachowaj domyślne opcje dla 'Output format' oraz 'Keep everything'.
      6. Zaznacz pole Run , aby zaakceptować warunki użytkowania (patrz zielona strzałka na Rysunku 2C).
      7. Kliknij przycisk Run Web Service, aby przetworzyć przesłane pliki w wyrównywaczu.
        UWAGA: Dla każdego pliku audio wyrównywacz MAUS zwraca obiekt Praat TextGrid (plik '.txt' sformatowany dla programu Praat, zawierający adnotacje słów, sylab fonologicznych i fonemów na podstawie transkrypcji lingwistycznej wyekstrahowanej z pliku '.txt' opisanego w kroku 1.3.1).
      8. Kliknij przycisk Download as ZIP-File, aby pobrać pliki TextGrid jako plik skompresowany (Rysunek 2C).
        UWAGA: Upewnij się, że skompresowane pliki TextGrid zostały pobrane do tego samego folderu, w którym znajdują się pliki audio.
      9. Wypakuj pliki TextGrid do późniejszego ponownego wyrównania w oprogramowaniu do analizy fonetycznej43.
    6. Przeprowadź ponowne wyrównanie (realignment).
      1. Znajdź i pobierz skrypt dla Praat VVUnitAligner4 ze strony https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. Upewnij się, że wszystkie pary plików w tym samym języku oraz skrypt VVUnitAligner znajdują się w tym samym folderze.
        UWAGA: Folder dla plików L1-L2 angielskich i VVunitAligner oraz folder dla plików L1-L2 BP i VVunitAligner.
      3. Otwórz oprogramowanie do analizy fonetycznej.
      4. Kliknij Praat | Open Praat script…, aby wywołać skrypt z okna obiektów.
      5. Kliknij raz przycisk Run .
        UWAGA: Na ekranie pojawi się formularz o nazwie Phonetic syllable alignment zawierający ustawienia do korzystania ze skryptu (Rysunek 3A).
      6. Kliknij przycisk Language , aby wybrać język z listy: 'English (US),' 'Portuguese (BR),' 'French (FR)' lub 'Spanish (ES)'.
      7. Kliknij przycisk Chunk segmentation , aby wybrać procedurę segmentacji: 'Automatic,' 'Forced (manual)' lub 'None'.
      8. Zaznacz opcję Save TextGrid files , aby automatycznie zapisać nowe pliki TextGrid.
      9. Kliknij przyciski Ok | Run, aby przeprowadzić ponowne wyrównanie jednostek fonetycznych z kroku 1.3.5.7 .
        UWAGA: Dla każdego pliku audio VVUnitAligner wygeneruje nowy plik TextGrid dla sekcji 1.3.7 (Rysunek 3B).
    7. Przeprowadź automatyczną ekstrakcję cech akustycznych.
      1. Znajdź i pobierz skrypt SpeechRhythmExtractor45 ze strony https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat w celu automatycznej ekstrakcji cech prozodyczno-akustycznych.
      2. Utwórz nowy folder i umieść w nim skrypt SpeechRhythmExtractor wraz ze wszystkimi parami plików audio/TextGrid we wszystkich językach.
      3. Otwórz oprogramowanie do analizy fonetycznej.
      4. Kliknij Praat | Open Praat script…, aby wywołać skrypt z okna obiektów.
      5. Kliknij przycisk Run tylko raz.
        UWAGA: Na ekranie pojawi się formularz z ustawieniami skryptu. W polach nazw wyjściowych plików '.txt' zmień nazwy plików w odpowiedni sposób lub pozostaw nazwy domyślne.
      6. Zaznacz opcję voice quality parameters, aby zapisać Output file VQ dla jakości głosu (Rysunek 3C).
        UWAGA: Ten drugi plik wyjściowy (Output file VQ) zawiera parametry różnicy między 1.szym a 2.gim harmonicznymi (H1-H2) oraz szczytową prominencję cepstralną (CPP)9.
      7. Zaznacz opcję Linguistic target , aby wybrać etykietę 'Language,' 'Dialect' lub 'Accent' (Rysunek 3C).
      8. Zaznacz opcję Unit , aby wybrać cechy f0 w Hz lub w półtonach (Rysunek 3C).
      9. Wprowadź wartości dla F0 threshold, określając minimalny i maksymalny próg f0 (Rysunek 3C).
        UWAGA: Jeśli badanie nie ma specyficznych celów lub wcześniej określonych cech audio, zdecydowanie zaleca się pozostawienie parametrów z kroku 1.3.7.9 z wartościami domyślnymi.
      10. Kliknij Ok | Run, aby przeprowadzić automatyczną ekstrakcję cech akustycznych.
        UWAGA: Skrypt SpeechRhythmExtractor zwraca plik '.txt' z rozdzielaczem tabulacyjnym (Output file/ Output file VQ) zawierający cechy akustyczne wyekstrahowane od mówców.
  4. Analiza statystyczna
    1. Wgraj arkusz zawierający cechy akustyczne do środowiska R46 (lub dowolnego wybranego oprogramowania/środowiska statystycznego).
    2. Przeprowadź nieparametryczną analizę statystyczną za pomocą uogólnionych modeli addytywnych (GAMs).
      1. Wykonaj GAMs w programie R.
      2. Wpisz następujące polecenia i naciśnij Enter.
        library(mgcv)
        model = gam(the metric/prosodic-acoustic feature in analysis ~ the Language + s(the chosen metric feature, by = the Language) + other metric/prosodic-acoustic features, data = the data frame)
        UWAGA: Zdecydowaliśmy się przeprowadzić testy statystyczne protokołu w języku programowania R ze względu na jego rosnącą popularność wśród fonetyków (i lingwistów) w środowisku akademickim. R jest szeroko stosowany w badaniach terenowych z zakresu fonetyki47. Należy pamiętać, że krok 1.4.2.2 zawiera pseudokod. Napisz kod zgodnie ze zmiennymi badawczymi.

figure-protocol-2
Rysunek 2Zrzut ekranu z dopasowania fonetycznego przy użyciu narzędzia do wymuszonego wyrównywania MAUS. (A) Przerywany prostokąt służy do przeciągania i upuszczania pliku 'my_file.wav'/' mój_plikProszę o dostarczenie tekstu źródłowego do tłumaczenia.pliki lub kliknięcie wewnątrz obszaru w celu wyszukania takich plików w folderze; przycisk przesyłania jest wskazany czerwoną strzałką. (B) Przesłane pliki z panelu A (patrz niebieska strzałka), potok do zastosowania, język dla par plików, format pliku do zwrócenia oraz przycisk „prawda/fałsz” w celu zachowania wszystkich plików. (C) pole wyboru Warunków użytkowania (patrz zielona strzałka), Uruchamianie usług sieciowych przycisk oraz wyniki (do pobrania pliki TextGrid). Aby wyświetlić powiększoną wersję tego rysunku, kliknij tutaj.

figure-protocol-3
Rysunek 3Zrzut ekranu procedury ponownego wyrównania. (A) Formularz ustawień wejściowych dla procedury ponownego dopasowania. (B) Częściowy przebieg fali, spektrogram szerokopasmowy z konturem f0 (kolor niebieski) oraz sześć poziomów podzielonych na segmenty (i opisanych) jako poziom 1jednostki od początku samogłoski do początku kolejnej samogłoski (V_to_V); początek samogłoski (V_to_V); poziom 2jednostki samogłosek (V), spółgłosek (C) i pauz (#); poziom 3reprezentacje fonetyczne V_do_V; poziom 4kilka słów z tekstu; poziom 5: niektóre fragmenty (CH) mowy z tekstu; warstwa 6: warstwa tonalna zawierająca najwyższy (H) i najniższy (L) ton każdego fragmentu mowy wyprodukowanego przez kobietę posługującą się amerykańską odmianą języka angielskiego (AmE-S).C) Ustawienia wejściowe dla automatycznej ekstrakcji cech akustycznych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

2. Percepcja mowy

UWAGA: Przeprowadziliśmy cztery próby rozpoznawania głosu w języku angielskim z udziałem słuchaczy z USA oraz cztery próby w BP z udziałem słuchaczy z Brazylii. Schemat blokowy percepcji mowy przedstawiono na Rysunku 4.

figure-protocol-4
Rysunek 4Schematyczny przebieg procesu percepcji mowy. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

  1. Uczestnicy
    1. Dla każdej grupy należy wybrać innych uczestników niż ci, którzy brali udział w protokole produkcji mowy.
      UWAGA: Do tej części protokołu wybrano dwie grupy uczestników: Grupa 1The Amamerykański Eangielski (z USA) Lsłuchaczy (AmE-L) oraz Grupa 2Wprowadzenie Brazilian Lsłuchaczy (Bra-L). W niniejszym badaniu zarówno osoby z grupy AmE-L, jak i Bra-L uznano za biegłe w języku L2 (obie grupy zakwalifikowano na poziomie B2-C1)36 Grupa AmE-L mieszkała w Brazylii przez dwa lata w momencie przeprowadzania procedur. Grupa Bra-L mieszkała w USA przez ponad dwa lata w momencie przeprowadzania procedur. Podczas pobytu za granicą obie grupy posługiwały się swoim językiem L2 w celach naukowych i zawodowych (przynajmniej sześć dni w tygodniu przez około 4 do 5 godzin dziennie).
    2. Wyznaczyć liczba uczestników, the język (L1 angielski, L2 BP; L1 BP, L2 angielski), the płeć (żeński lub męski), the wiek (średnia, odchylenie standardowe), the charakterystyka grup (specjaliści lub studenci studiów licencjackich) oraz Poziom biegłości w drugim języku (L2) dla każdej grupy.
  2. Ścieżki dźwiękowe
    UWAGA: Podziel procedury dotyczące zestawów głosowych na dwa oddzielne etapy: przygotowanie i przeprowadzenie zestawów głosowych.
    1. Przygotuj cztery zestawy próbek głosowych dla języka angielskiego i cztery dla BP.
      1. Pobierz pliki audio od prelegentów z sekcji 1: Produkcja mowy.
      2. Upewnij się, że pliki audio dla każdego czynnika językowego znajdują się w osobnych folderach.
      3. Wybierz losowo sześć fragmentów głosowych w języku angielskim (L1) lub w języku brazylijskim portugalskim (L1 BP).
        UWAGA: Sześć głosów w zestawieniu reprezentuje jeden głos docelowy i pięć folii.
      4. Wybierz fragment głosowy w języku angielskim jako drugim języku (L2 English) lub w brazylijskim portugalskim jako drugim języku (L2 BP) jednego z mówców uwzględnionych w kroku 2.2.1.3.
        UWAGA: Fragment dźwiękowy w kroku 2.2.1.4 to głos referencyjny8. Fragmenty powinny trwać około 20 s.
      5. Pobierz skrypt Praat CreateLineup48 z https://github.com/pabarbosa/prosody-scripts-CreateLineUp
      6. Przed uruchomieniem skryptu CreateLineup należy upewnić się, że głos referencyjny L2, folie L1 oraz głos docelowy L1 znajdują się w tym samym folderze (Rycina 5).
      7. Uruchom oprogramowanie do analizy fonetycznej.
      8. Z okno obiektu, kliknij Praat | Otwieranie skryptu Praat… aby wywołać skrypt.
      9. Kliknij Uruchom | Uruchom.
        UWAGA: Skrypt zwraca plik w następującej kolejności: (głos referencyjny L2) + (głos docelowy L1 oraz losowo rozmieszczone dystraktory)Rysunek 5).
    2. Przeprowadzanie konfrontacji głosowych
      1. Utwórz przestrzeń online do hostowania zestawień na dowolnej wybranej platformie (np. SurveyMonkey. Zobacz Tabela materiałów) do zdalnego przeprowadzania okazów głosowych.
      2. Przejdź do łącza w przestrzeni online.
      3. Prześlij pliki zwrócone przez skrypt CreateLineup na platformę.
      4. Przeprowadź procedurę w obecności uczestników, aby przetestować każdy etap.
        UWAGA: Zaleca się wcześniejsze przejście pod wskazany link i uruchomienie sekwencji w celu sprawdzenia, czy wszystko działa prawidłowo.
  3. Analiza statystyczna
    1. Wgraj arkusz kalkulacyjny zawierający wyniki ocen słuchaczy do środowiska R (lub dowolnego innego wybranego oprogramowania/środowiska statystycznego).
      1. Przeprowadź test Kruskala-Wallisa w programie R.
      2. Wpisz następujące polecenia i naciśnij Wprowadź.
        ​model = kruskal.test(oceny każdy przebieg przesłuchania głosowego, dane = the ramka danych)
    2. Wykonaj test post-hoc Dunna.
      1. Przeprowadź test Dunna w programie R.
      2. Wpisz następujące polecenia i naciśnij Wprowadź.
        library(FSA)
        model = dunnTest(oceny każdy identyfikacja głosowa, dane = data, metoda = "Bonferroni")
        UWAGA: Kody w krokach 2.3.1.2 i 2.3.2.2 są pseudokodami (patrz UWAGA 1.4.2.2).
  4. Analiza podobieństwa akustycznego
    1. Wybierz serie (por. UWAGA w kroku 2.2.1.3), w których nie stwierdzono istotnych różnic między bodźcem docelowym a którymkolwiek z dystraktorów.
    2. Powtórzyć procedury z kroków od 1.3.1 do 1.3.7.5 oraz kroków od 1.3.7.8 do 1.3.7.10.
    3. Pobierz i uruchom skrypt dla języka Python49, PodobieństwoAkustyczne_cosinusowe_euklidesowe50 z https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      UWAGA: Skrypt zwraca trzy macierze (w formatach „.txt” i „.csv”): jedną dla podobieństwa cosinusowego51,52, jedna dla odległości euklidesowej52,53oraz jeden dla wartości przekształconej odległości euklidesowej, a także porównanie parowe głosu docelowego z każdym z głosów dystrakcyjnych.
    4. Upewnij się, że skrypt został pobrany do tego samego folderu, w którym znajduje się zbiór danych lineup.
    5. Kliknij w Otwórz plik… przycisk do uruchomienia skryptu.
    6. Kliknij Uruchom | Uruchom bez debugowania przyciski
      UWAGA: Drugi Uruchomienie przycisk może być otagowany jako Uruchom lub uruchom bez debugowania lub Uruchom skrypt. Wszystkie one wykonują te same polecenia. Zależy to po prostu od użytego środowiska Python.
    7. Przeprowadzenie testów podobieństwa głosu w oparciu o cechy akustyczne.
      ​UWAGA: Podobieństwo cosinusowe (lub dystans cosinusowy) to technika stosowana w sztucznej inteligencji (AI), w szczególności w uczeniu maszynowym w systemach automatycznego rozpoznawania mowy (ASR). Jest to miara podobieństwa przyjmująca wartości od zera do jedynki. Podobieństwo cosinusowe bliskie jedynce oznacza, że dwa głosy są z dużym prawdopodobieństwem podobne. Podobieństwo cosinusowe bliskie zeru oznacza, że głosy są z dużym prawdopodobieństwem niepodobne.52Odległość euklidesowa, często określana jako podobieństwo euklidesowe, jest również szeroko stosowana w sztucznej inteligencji, uczeniu maszynowym oraz ASR. Reprezentuje ona odległość w linii prostej między dwoma punktami w przestrzeni euklidesowej.53tj. im bliżej siebie znajdują się punkty (krótsze wartości odległości), tym bardziej podobne są głosy. Aby zapewnić lepsze zrozumienie wyników obu technik, dokonano transformacji surowych wyników odległości euklidesowej na wartości z zakresu od zera (mniejsze podobieństwo głosów) do jeden (większe podobieństwo głosów).54.

figure-protocol-5
Rysunek 5Konfiguracja katalogów dla percepcji mowy. Ustaw foldery w linii. Każdy folder zawiera sześć głosów L1, głos docelowy L2, the "Tworzenie zestawu" skrypt oraz plik audio z zestawieniem głosów (wygenerowany po uruchomieniu skryptu). Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej figury.

Wyniki

Wyniki produkcji mowy
W tej sekcji opisano wyniki statystycznie istotnych prozodyczno-akustycznych cech oraz miar rytmicznych. Cechy prozodyczne obejmowały tempo mowy, tempo artykulacji oraz częstotliwość pauz, które wiążą się z czasem trwania, a także shimmer, który wiąże się z jakością głosu. Miary rytmiczne obejmowały odchylenie standardowe (SD) czasu trwania sylaby, SD spółgłoski, SD czasu trwania samogłosek lub spółgłosek oraz współczynnik zmienności czasu trwania sylaby (patrz Tabela uzupełniająca S1).

Szybkość mowy (Rycina 6A) spada szybciej w przypadku języka angielskiego jako L2 (L1-L2 English) niż w przypadku brazylijskiego portugalskiego jako L2 (L1-L2 BP), choć szybkość ta jest niższa dla obu języków L2. Szybkość mowy jest powiązana z trzema miarami – odchyleniem standardowym czasu trwania sylaby (SD-S), odchyleniem standardowym samogłosek (SD-V) oraz współczynnikiem zmienności sylabicznej (Varco-S). Należy również pamiętać, że obie grupy – AmE-S oraz Bra-S – biegle posługują się swoimi językami L2. Wydaje się, że na taką szybkość wpływają wyższe wartości czasu trwania sylaby oraz mniejsza zmienność generowana przez grupę L1-L2 BP, co skutkuje łagodniejszym nachyleniem krzywych.

The Szybkość artykulacji (Rycina 6D) jest powiązane z SD-S, Varco-S, a także wskaźnik rytmu sylabicznego (RR-S); ta druga wartość reprezentuje stosunek sylab krótkich do długich. Wydaje się, że takie wskaźniki wpływają na Szybkość artykulacji podobnie jak w przypadku osób dotkniętych schorzeniem Tempo mowy ze względu na długość zdań oraz zróżnicowanie czasu trwania, co prowadzi do dłuższego planowania wypowiedzi w języku L2 oraz większego obciążenia poznawczego w języku L29,23,54W obrębie długości zdań może występować zapotrzebowanie na wyższe obciążenie poznawczo-lingwistyczne w sposób, który wpływa na parametry prozodyczno-akustyczne.55.

W odniesieniu do prozodyczno-akustycznych cech tempa mowy oraz tempa artykulacji, nasze wyniki sugerują, że im bardziej mówca różnicuje czas trwania sylab (oraz samogłosek), tym niższe są te wskaźniki. Hipotezyzujemy, że percepcja mowy w przypadku zarówno L1, jak i L2 BP wydaje się nieco wolniejsza niż w przypadku L1 i L2 angielskiego, a L1 angielski brzmi szybciej niż wszystkie pozostałe poziomy językowe. Fakt ten może być związany z rytmem mowy i hipotezą, że podczas gdy L1-L2 BP skłania się ku biegunowi sylabicznemu kontinuum rytmicznego, L1-L2 angielski przesuwa się w stronę bieguna akcentowego21,2.

Lokalny shimmer, Rysunek 6B, jest pod wpływem SD-S oraz Varco-S. W przypadku lokalnego shimmeru, w obu produkcjach Bra-S, L1-BP oraz L2-English występuje w pewnym stopniu monotoniczna trajektoria wraz ze wzrostem zmienności czasu trwania sylab (SD i Varco, patrz Tabela uzupełniająca S1). Percepcja wysiłku wokalnego może być widoczna podczas słuchania produkcji Bra-S ze względu na niską zmienność w zakresie od 8,5 do 9 dB. Mowa Bra-S jest pod wpływem obciążenia wokalnego. L1-BP jest w dużym stopniu zależne od długości zdania, będąc mniej wrażliwe na wysokie wariacje czasu trwania sylab (wzorzec rytmiczny BP wykazuje mniejszą zmienność sylabiczną2,56).

Wykres 6C przedstawiający częstość pauz wskazuje, że osoby posługujące się językiem angielskim jako drugim językiem (L2-English) generują dłuższe pauzy (od 20 ms do 375 ms) niż osoby posługujące się językiem angielskim jako pierwszym (L1-English), braziilijskim portugalskim jako pierwszym (L1-BP) oraz brazylijskim portugalskim jako drugim (L2-BP) (średnio 30 ms dla L1-English, 50 ms dla L1-BP i 100 ms dla L2-BP). W tym przypadku planowanie wypowiedzi mogło wpłynąć na produkcję w języku L2-English ze względu na zwiększoną aktywność mózgu54,57. Oczekuje się, że wyższa biegłość językowa przełoży się na większą szybkość i zakres czytania54; niemniej jednak, nawet w przypadku biegłych mówców L2, zadania czytania wymagały większego wysiłku w zakresie wyższych funkcji poznawczych mowy obcej oraz przetwarzania języka54,57. Nasze wyniki pokazują, przynajmniej wstępnie, że mówcy L2-BP mogą być w mniejszym stopniu narażeni na pauzy niż mówcy L2-English ze względu na różnice w strukturze rytmicznej obu języków.

figure-results-1
Rysunek 6Uogólnione modele addytywne dla prozodyczno-akustycznych cech sygnału. Na osi Y znajduje się zmienna objaśniana (cechy akustyczne podlegające modelowaniu); na osi X zmienne objaśniające (czynnik „Language” oraz kowarianty w modelach addytywnych, które określą kształt i trajektorie krzywych, tj. efekty wygładzające: „Language + covariates”, a także iloczyn czynnika „Language” i cechy metrycznej, co zapewni dokładniejszą projekcję zmiennej objaśnianej, tj. interakcje czynnik-wygładzanie: „covariate:Language”). Skrót: GAMs = uogólnione modele addytywne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

W odniesieniu do parametrów rytmicznych, w przypadku SD-S (Rycina 7A), nasze wyniki wykazują, że im bardziej mówca różnicuje krzywą f0 i zwiększa tempo mowy, tym bardziej SD-S spada dla wszystkich poziomów biegłości językowej (efekt lustrzany Ryciny 6A). W przypadku SD dla spółgłosek (SD-C, Rycina 7C), osoby L1-BP, w przeciwieństwie do L1 English, wykazują niską zmienność wraz ze wzrostem tempa mowy lub czasu trwania pauzy. Taki kierunek zmian SD jest przewidywalny, ponieważ zmienność czasu trwania sylaby w L1-English jest (statystycznie) istotnie wyższa niż w L1-BP4,58. Varco-S (Rycina 7B oraz Tabela uzupełniająca S1) wydaje się być w pewnym stopniu skorelowany z L1 i L2 w obrębie tej samej grupy językowej. Wraz ze wzrostem zmienności f0 i tempa mowy, Varco-S spada dla L1-BP oraz wydaje się spadać i tłumić dla L2-BP. W przypadku produkcji w języku angielskim, podczas gdy zmienność f0 i tempo mowy rosną, Varco-S rośnie i tłumi się dla L1-English oraz L2-English.

W odniesieniu do SD dla samogłosek lub spółgłosek (SD-V_C, Rysunek 7D i Tabela uzupełniająca S1), nasze wyniki wykazują pewne podobieństwa do wyników Varco-S (Rysunek 7B). Na przykład wyższe tempo mowy, czas trwania pauzy oraz zmienność f0 sprzyjają trajektorii spadkowo-wznoszącej SD-V_C dla L1-BP oraz dla L2-BP. W produkcjach w języku angielskim, mimo że cechy prozodyczne te są wyższe, SD-V_C lekko spada, słabnie dla L1-English, lekko wzrasta, a następnie słabnie dla L2-English. Korelacja Varco-S i SD-V_C z L1-L2 w tych samych grupach językowych może być częściowo wyjaśniona efektem Lombarda, który odnosi się do zmiany parametrów akustycznych mowy pod wpływem hałasu w tle59.

W mowie obcojęzycznej, w zależności od stopnia złożoności zadania (np. mowy czytanej), mówcy stosowali podobne strategie akustyczne zarówno w L1, jak i w L259,60. Z jednej strony Marcoux i Ernestus stwierdzili, że pomiary f0 (zakres i mediana) w mowie Lombard w L2 sugerują, że osoby mówiące po angielsku jako w L2 znajdowały się pod wpływem swojego ojczystego języka niderlandzkiego (L1)61,62. Z drugiej strony nowsze ustalenia wskazują, że choć oczekuje się, iż mowa Lombard w L2 będzie różnić się od mowy Lombard w L1 ze względu na wyższe obciążenie poznawcze podczas mówienia w L2, osoby posługujące się językiem angielskim w L2 generowały mowę Lombard w tym samym kierunku, co osoby mówiące w L1 po angielsku63. Zakres, w jakim nasze wyniki są zgodne z ustaleniami Marcoux i Ernestusa63 oraz odbiegają od wyników Waaninga59, Villegasa i współpracowników60 oraz Marcoux i Ernestusa61,62, wymaga dalszych badań.

figure-results-2
Rysunek 7Uogólnione modele addytywne dla cech metrycznych. Na osi Y znajduje się zmienna reakcji (cechy metryczne podlegające modelowaniu); na osi X znajdują się zmienne predyktory (czynnik „Language” oraz współzmienne w modelach addytywnych, które określą kształt i trajektorie krzywych (tj. efekty wygładzania: „Language + covariates”), oraz iloczyn czynnika „Language” i cechy metrycznej, który zapewni dokładniejszą projekcję zmiennej reakcji (tj. interakcje czynnik-wygładzanie: „covariate:Language”)). Skrót: GAMs = uogólnione modele addytywne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wyniki percepcji mowy
W odniesieniu do zestawów głosów BP, w zestawie nr 1 (Rysunek 8A) głos dystraktor nr 3 został uznany za głos docelowy. W rzeczywistości głosem docelowym był głos nr 4. Wyniki nie wykazują statystycznie istotnej różnicy (patrz Tabela uzupełniająca S1) pomiędzy dystraktorem nr 3 (83%) a głosem docelowym nr 4 (71%). W zestawie nr 2 (Rysunek 8B) porównanie głosu docelowego nr 3 (40%) i dystraktora nr 4 (20%) również nie wykazało statystycznie istotnej różnicy (patrz Tabela uzupełniająca S1) dla zestawów głosów w języku angielskim. W zestawie nr 1 (Rysunek 9A) nie stwierdzono istotnej różnicy (patrz Tabela uzupełniająca S1) pomiędzy dystraktorem nr 2 (26%) a głosem docelowym nr 4 (54%).

W analizie podobieństwa głosów zarówno podobieństwo cosinusowe (CoSim), jak i odległość euklidesowa (EucDist, [EucDist przekształcona]54) wykazały spójną korelację między dystraktorem nr 3 a celem dla zestawu BP nr 1 (CoSim = 0,99; EucDist = 7,4, [0,93]). Korelacja między dystraktorem nr 4 a celem była podobnie silna w zestawie BP nr 2 (CoSim = 0,9, EucDist = 76,3, [0,93]). W angielskim zestawie nr 1 korelacja była spójna dla CoSim (0,83), ale słaba do zadowalającej dla EucDist (213,0, [0,47]). Ogólnie rzecz biorąc, zarówno CoSim, jak i EucDist okazały się zadowalającymi technikami w określaniu podobieństwa głosów. Ponadto CoSim sprawowała się nieco skuteczniej, co wskazali Gahman i Elangovan52(patrz Tabela uzupełniająca S1)).

Pod kątem podobieństwa, co mogło doprowadzić do zwiększenia liczby fałszywych alarmów? Cechy prozodyczno-akustyczne wykazały, że choć głosy dystraktorów i głosy docelowe różniły się (statystycznie) znacząco — z wyjątkiem zestawów przedstawionych na Rysunku 8A,B oraz Rysunku 9A — wybory słuchaczy były w pewnym stopniu zróżnicowane pomiędzy różnymi dystraktorami w pozostałych zestawach (Rysunek 8C,D oraz Rysunek 9B-D). Takie osądy wydają się zależeć bardziej od jednej (lub być może większej liczby) konkretnej cechy akustycznej wspólnej dla mówców niż od całej klasy cech prozodyczno-akustycznych. Na przykład w naszym badaniu przedstawiono kilka cech (współ)zmiennych pomiędzy próbkami; niemniej jednak wyniki percepcyjne wskazują na preferencje w osądach dla konkretnego dystraktora pasującego do głosu docelowego8,35,64,65. W przyszłych pracach niezbędne będą dalsze analizy.

Warto rozważyć wybór wielowymiarowej macierzy parametrów dla podobieństwa akustycznego6 w formie zaprezentowanej w niniejszym badaniu. Nasze wyniki są zgodne z wcześniejszymi badaniami, w których wykorzystano cechy akustyczne oparte na f0, VQ i intensywności9,35. Takie cechy są wysoce rekomendowane do zadań porównywania mówców w kryminalistyce9,6. Należy jednak podkreślić, że w obecnym badaniu żadne z wypełniaczy nie zostało uznane za podobne do głosu docelowego, mimo zastosowania wariantowych wytycznych McFarlane'a16,17 podczas przygotowywania zestawów głosów do rozpoznawania mówców z obcym akcentem. Ponadto należy zaznaczyć, że nasza procedura tworzenia zestawów głosów zawiera istotne różnice w stosunku do wytycznych McFarlane'a, w tym w zakresie długości bodźca, liczby głosów, wyboru wypełniaczy (tutaj zrandomizowanych) oraz stylu mowy.

Zakres, w jakim cechy prozodyczno-akustyczne f0, jakości głosu i intensywności wydają się być powiązane z percepcją słuchaczy, w dużym stopniu zależy od stylu mówienia zastosowanego w badaniu. W niniejszej pracy wykorzystano odczytywanie fragmentów tekstu. Większość badań nad świadkami słuchowymi wybiera bodźce (pół-)spontaniczne jako zbalansowane rozwiązanie – np. korpus DyVis67 – który był szeroko stosowany w aktualnych badaniach nad świadkami słuchowymi28,68. Powodem, dla którego zdecydowaliśmy się na zadania polegające na czytaniu, jest fakt, że nasz korpus w momencie sporządzania tego manuskryptu składał się wyłącznie z danych uzyskanych z takich zadań. Należy jednak zaznaczyć, że proces tworzenia korpusu (pół-)spontanicznego jest już w toku. Co więcej, akt czytania opowiadania może generować stabilny poziom jednolitości i zmienności, zarówno wewnątrz jednego mówcy, jak i między różnymi mówcami. Ułatwia to skupienie uwagi na cechach prozodycznych lub fonetycznych – indywidualnych lub dialektalnych – w sytuacjach związanych z porównywaniem głosu. Staje się to szczególnie zauważalne w przypadkach obciążenia wokalnego podczas produkcji obcego akcentu, nawet u biegłych mówców 8,9,23,54.

figure-results-3
Rysunek 8Wykresy słupkowe zawierające wyniki dla czterech zestawów porównawczych przeprowadzonych przez brazylijskich słuchaczy. (A,B) Brak istotnej różnicy między głosem docelowym (na niebiesko) a głosem dystraktorem (na jasnoniebiesko). (C,D) istotne różnice w stosunku do dystraktorów oraz głosu docelowego. Skrót: NS = nieistotne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

figure-results-4
Rycina 9Wykresy słupkowe zawierające wyniki czterech prób rozpoznania przeprowadzonych przez amerykańskich słuchaczy. (A) Brak istotnej różnicy między głosem docelowym (na czerwono) a głosem dystraktorem (na różowo). (B,C,D) Istotne różnice w stosunku do dystraktorów i głosu docelowego. Skrót: NS = nieistotne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Tabela uzupełniająca S1Statystyki produkcji mowy - uogólnione modele addytywne (GAM): statystyki F (stopnie swobody), skorygowany R2 każdej statystycznie istotnej cechy prozodyczno-akustycznej (Rysunek 6), oraz metrykę rytmu (Rycina 7) w zależności od poziomu językowego, a także indywidualne wartości każdego składnika wygładzającego (kowariantów). Statystyki percepcji mowy: test Kruskalla-Wallisa χ2 statystyki (stopnie swobody), wartości p oraz skorygowane η2oraz test post-hoc Dunna do porównań parzystych (Rycina 8 i Rysunek 9) każdej statystycznie nieistotnej różnicy pomiędzy parami głosów docelowych i dystraktorów (Rycina 8A,B i Rysunek 9A). Macierze podobieństwa akustycznego dla odległości cosinusowej i euklidesowej dla każdego zestawu porównawczego. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej figury.

Dyskusja

Obecny protokół stanowi nowość w dziedzinie fonetyki (sądowej). Dzieli się na dwie fazy: jedną opartą na produkcji (analiza akustyczna) i drugą opartą na percepcji (analiza osądu). Faza analizy produkcji obejmuje przygotowanie danych i wymuszone wyrównanie, ponowne wyrównanie i automatyczną ekstrakcję cech prozodowo-akustycznych oprócz statystyk. Protokół ten łączy etap zbierania danych z analizą danych w szybszy i bardziej efektywny sposób niż tradycyjne protokoły oparte na głównie ręcznej segmentacji.

Jednak proces dostosowania, pokazany w krokach protokołu od 1.3.6 do 1.3.6.9, zasadniczo działa na jednostkach telefonu i słowa wygenerowanych w krokach protokołu od 1.3.1 do 1.3.4. Nowością procesu wyrównywania jest to, że generuje on nowy element TextGrid zawierający trzy nowe warstwy tekstu: warstwę sylabiczną, warstwę fragmentu mowy, która może być generowana automatycznie lub ręcznie na podstawie słów, oraz warstwę tonu, która może być bardzo przydatna do obliczania miar f0. Wytyczne dotyczące dostosowania zaproponowane dla tego protokołu były wcześniej stosowane w badaniach rytmu mowy L2 21,69,70, badaniach nad wykrywaniem stopnia obcego akcentu przy użyciu technik uczenia maszynowego22 oraz w badaniach w dziedzinie kryminalistyki 9.

Automatyczna ekstrakcja cech prozodycznych, przedstawiona w krokach protokołu od 1.3.7 do 1.3.7.10, generuje wielowymiarową matrycę cech prozodowo-akustycznych, co można udowodnić w obecnych badaniach. Do takich cech należą cechy mowy melodycznej, czasowej i spektralnej (jakość i intensywność głosu)71. Znaczna liczba tych cech akustycznych jest mniej czuła i nieco odporna na hałaśliwe nagrania dźwiękowe, które ostatecznie zostaną zebrane w ramach badań kryminalistycznych lub innych scenariuszy72. Co więcej, wielowymiarowa matryca może być zastosowana w systemach rozpoznawania mowy za pomocą kilku technik sztucznej inteligencji (prace w toku). Nadal może być bardzo przydatny w nauczaniu aspektów prozodycznych w klasach wymowy L221 (praca w toku).

Analiza statystyczna tej części protokołu reprezentuje zastosowanie metody GAM, ponieważ mieliśmy do czynienia ze złożoną relacją między określoną cechą akustyczną a wieloma mówcami wykorzystującymi czynnik językowy. Na przykład, aby zamodelować konkretną cechę akustyczną, konieczne było sprawdzenie, jak zachowają się inne cechy akustyczne z matrycy (wyrazy gładkie), abyśmy mogli dokładniej opisać, co dzieje się podczas produkcji mowy.

Jeśli chodzi o analizę percepcji, obecny protokół został stworzony poprzez przygotowanie i wdrożenie składów głosowych, analizę statystyczną oraz analizę podobieństwa akustycznego. Do przygotowania składów użyliśmy skryptu CreateLineup dla Praat, który automatycznie generuje plik audio dla każdego składu, zawierający losowo ułożone folie i docelowy głos, zgodnie z opisem w krokach protokołu od 2.2 do 2.2.1.9.

Na potrzeby analizy statystycznej tego protokołu przeprowadziliśmy nieparametryczny test Kruskala-Wallisa, ponieważ nasze dane nie spełniały założeń analizy wariancji (ANOVA). Kiedy już mieliśmy związek między wynikami oceny ocenianymi przez słuchaczy i kontrolowanymi dla głosu docelowego i kontrastów, zdecydowaliśmy się użyć statystyk modelu liniowego.

Do analizy podobieństwa akustycznego użyliśmy skryptu AcousticSmilarity_cosine_euclidean dla Pythona. Program wyświetla drzewo katalogów komputera i prosi użytkownika o wybranie pliku zawierającego cechy prozodowo-akustyczne folii oraz docelowy głos, który składa się na skład w analizie. Za jednym kliknięciem skrypt generuje trzy macierze podobieństwa: cosinus, euklidesowy i przekształcony (zero do jednego) euklidesowy, zarówno w plikach ".txt" (rozdzielanych tabulatorami), jak i ".csv". Musimy jednak pamiętać, że każdy zbiór danych (plik '.txt' zawierający cechy prozodowo-akustyczne folii i tarczy) musi znajdować się w oryginalnym folderze składu, a każdy folder składu musi mieć kopię skryptu AcousticSmilarity_cosine_euclidean .

Podsumowując, obecny protokół czyni postępy w badaniach (kryminalistycznych) nad fonetyką. Składa się z odrębnych faz - analiz produkcji i percepcji, a także podobieństwa akustycznego - wypełniając lukę między gromadzeniem danych a wielowymiarową analizą cech akustycznych. Naukowcy mogą skorzystać z holistycznej perspektywy, badając zarówno aspekty produkcyjne, jak i percepcyjne. Co więcej, protokół ten zapewnia powtarzalność badań, umożliwiając innym korzystanie z wytycznych zawartych w tych pracach.

Ograniczenia i kierunki na przyszłość
Musimy jednak pamiętać, że wszystko zakończy się sukcesem, jeśli przygotowanie danych będzie zgodne z wytycznymi zaproponowanymi w krokach protokołu od 1.3.1 do 1.3.4. Poza tym w procedurach wymuszonego wyrównania musimy mieć świadomość, że zewnętrzny, wstępnie wytrenowany wymuszony nakładek – podobny do MAUS używany w obecnej pracy – jest podatny na błędy segmentacji, zwłaszcza w przypadku nieprzeszkolonych danych z akcentem obcym, a nawet w wstępnie wytrenowanych alignerach, niezależnie od tego, czy dźwięk nie jest dobrej jakości, czy nakładka nie zawiera języka audio (fakt ten utrudniłby pracę eksperta i uczyniłby go bardziej czasochłonnym). Transkrypcja kryminalistyczna, zwłaszcza dłuższych plików audio, napotyka trudności w odniesieniu do dokładnego i wiarygodnego odwzorowania nagrań mówionych72.

Istnieje również kilka wyzwań związanych z transkrypcją i wyrównywaniem dłuższych plików audio. Na wydajność nakładek ma wpływ styl mówienia i środowisko fonetyczne, a także czynniki specyficzne dla dialektu. Chociaż istnieją różnice specyficzne dla nakładek, ogólnie rzecz biorąc, ich wydajność jest podobna i generuje segmentacje, które dobrze wypadają w porównaniu z ogólnym wyrównaniemręcznym 73. Ponadto produkcja języków angielskich L1 i L2 została uruchomiona przy użyciu wstępnie wytrenowanego modelu akustycznego amerykańskiego języka angielskiego ze względu na niedostępność modeli mowy obcej w MAUS. Co więcej, w MAUS nie ma wstępnie wytrenowanych modeli akustycznych dla BP. W przypadku danych BP wykorzystano istniejące wcześniej modele akustyczne języka włoskiego (patrz UWAGA, krok protokołu 1.3.5.7).

W przyszłych pracach (w toku) będziemy używać Montreal Forced Aligner (MFA)74 jako części protokołu. Dużą zaletą uwierzytelniania wieloskładnikowego jest dostępność wstępnie wytrenowanych modeli akustycznych i modeli grafem-fonem dla szerokiej gamy języków (w tym BP), a także możliwość trenowania nowych modeli akustycznych i grafem-fonemów do dowolnego nowego zestawu danych (tj. naszego korpusu mowy z obcym akcentem)75.

Oświadczenia

Autorzy nie mają do zadeklarowania konfliktu interesów.

Podziękowania

To badanie było wspierane przez Narodową Radę Rozwoju Naukowego i Technologicznego - CNPq, grant nr 307010/2022-8 dla pierwszego autora i grant nr 302194/2019-3 dla drugiego autora. Autorzy pragną wyrazić szczerą wdzięczność uczestnikom tych badań za ich hojną współpracę i nieoceniony wkład.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
CreateLineupPersonal collection#Skrypt do przygotowania składów głosowych
Dell I3 (z dyskiem SSD - SSD) Dell#Laptop
PraatPaul Boersma & David Weenink#Oprogramowanie do analizy fonetycznej
Python 3Python Software Foundation#Interpretowany, wysokopoziomowy język programowania ogólnego przeznaczenia 
RThe R Project for Statistical Computing#Język programowania do obliczeń statystycznych
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersonal collection#Script for praat for automatic extract of acoustic features
SurveyMonkey Inc.#Zbierz bezpłatne, konfigurowalne ankiety, a także zestaw programów zaplecza, które obejmują analizę danych, wybór próby, usuwanie uprzedzeń i reprezentację danych.
Tascam DR-100 MKIITascam#Dyktafon cyfrowy
Monachijski automatyczny system segmentacji MAUSUniwersytet w Monachium#Wymuszone wyrównywanie plików audio (.wav) i informacji językowych (.txt)
VVUnitAlignerKolekcja osobista#Skrypt do automatycznego wyrównywania i przetwarzania końcowego jednostek fonetycznych

Bibliografia

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Przedruki i uprawnienia

Tagi

Cechy prozodycznepercepcja mowyjakość głosuczęstotliwość podstawowarozpoznawanie mówcypodobieństwo akustyczne