27 września 2024
To badanie miało na celu porównanie L1-L2-angielskiego i L1-L2 portugalskiego, aby sprawdzić, jak bardzo wpływ obcego akcentu wpływa zarówno na metryki, jak i parametry prozodowo-akustyczne, a także na wybór docelowego głosu w zestawie głosowym.
W naszych badaniach sprawdzamy, jak obcy akcent wpłynął na identyfikację mówcy. Skupiamy się na cechach prozodycznych w oparciu o częstotliwość podstawową, czyli wysokość głosu, czas trwania i jakość głosu. Naszym celem jest zrozumienie, w jaki sposób te funkcje wpływają na oceny słuchaczy w składach głosowych.
Coraz częściej skupia się na badaniach nad wydajnością automatycznego rozpoznawania mówcy, które stosuje automatyzację w przepływie pracy związanych z porównywaniem mówców w kryminalistyce. Jednak informacje te są jak skrzynka, którą naukowcy medycyny sądowej mogą zgłaszać policji, sędziom i ławie przysięgłych. Systemy automatycznego rozpoznawania mówcy oparte na klasycznych technikach, takich jak GMM, modele UBM i aktorzy na żywo.
Istnieją również badania neuronowe oparte na sztucznej inteligencji. Proponujemy zautomatyzowany przepływ zachowujący informacje językowe pominięte przez systemy automatycznego rozpoznawania mowy. Nasz protokół wykorzystuje połączone podejście słuchowe i akustyczne do kryminalistycznego porównywania mowy przy ustalaniu krajów, w których rozwinięto naukę, ale przy użyciu zautomatyzowanych narzędzi do wyodrębniania szerokiego zakresu cech akustycznych, a także do przeprowadzania procedur podobieństwa akustycznego.
Aby rozpocząć, napisz transkrypcję językową dla każdego pliku audio w formacie pliku TXT. Oznacz parę plików TXT i WAV tą samą nazwą. Utwórz folder dla każdego języka L1 i L2.
Upewnij się, że wszystkie pary plików w tym samym języku znajdują się w tym samym folderze. Uzyskaj dostęp do interfejsu internetowego wymuszonego wyrównywania automatycznej segmentacji w Monachium, przeciągnij i upuść każdą parę plików WAV i TXT z folderu do przerywanego prostokąta w plikach. Kliknij przycisk przesyłania, aby przesłać pliki do nakładki.
W menu opcji usługi, dla L1 L2 Angielskie dane, wybierz grafem do fonemu do myszy do telefonu do sylaby dla nazwy potoku i angielski-amerykański dla języka. Zachowaj domyślne opcje formatu wyjściowego i zachowaj wszystko. Zaznacz pole opcji uruchamiania, aby zaakceptować warunki użytkowania.
Kliknij przycisk uruchamiania usługi internetowej, aby uruchomić przesłane pliki w wyrównywaczu. Po przetworzeniu plików kliknij przycisk Pobierz jako plik zip, aby pobrać pliki siatki tekstowej. Wyodrębnij pliki siatki tekstowej w celu późniejszego wyrównania w oprogramowaniu do analizy fonetycznej.
Uzyskaj dostęp do skryptu dla PRAAT VVUnitAligner i pobierz go. Upewnij się, że wszystkie pary plików w tym samym języku i skrypt VVUnitAligner znajdują się w tym samym folderze. Otwórz oprogramowanie do analizy fonetycznej.
W oknie obiektu kliknij Praat i otwórz skrypt Praat, aby załadować skrypt. Kliknij przycisk uruchom, a następnie wybierz język jako angielski (USA). Teraz z przycisku segmentacji fragmentów wybierz opcję automatycznie.
Zaznacz opcję Zapisz pliki siatki tekstowej, aby automatycznie zapisać nowo wygenerowane pliki siatki tekstowej. Kliknij przyciski OK i Uruchom, aby wyrównać jednostki fonetyczne. Z podanej strony pobierz skrypt do ekstrakcji rytmu mowy do automatycznej ekstrakcji prozodycznych cech akustycznych.
Utwórz nowy folder i dodaj skrypt ekstraktora rytmu mowy wraz ze wszystkimi plikami siatki tekstu audio we wszystkich językach. Otwórz oprogramowanie do analizy fonetycznej. W oknie obiektu kliknij Praat i otwórz skrypt Praat, aby załadować skrypt.
Następnie kliknij raz przycisk uruchom. Zaznacz opcję parametrów jakości głosu, aby zapisać plik wyjściowy VQ dla jakości głosu. Teraz zaznacz opcję docelowy język, aby wybrać język.
Następnie zaznacz opcję jednostki, aby wybrać funkcje F0 w półtonach. Ustaw wartości progu F0, w tym progi minimalne i maksymalne. Kliknij przycisk OK, a następnie uruchom, aby automatycznie wyodrębnić cechy akustyczne.
Aby wykonać uogólnione modele addytywne, nieparametryczną analizę statystyczną, wpisz wskazane polecenie i prześlij arkusz kalkulacyjny zawierający wyodrębnione cechy akustyczne do środowiska R. Na koniec naciśnij enter, aby wykonać. Tempo mowy spadało szybciej w przypadku języka angielskiego L1 L2 w porównaniu z L1 L2 BP, które miało mniej strome zbocza ze względu na dłuższy czas trwania sylaby i mniejszą zmienność.
Lokalne migotanie pozostało stosunkowo stabilne dla osób mówiących po ludzku brazylijsko, L1 BP i L2 English, pomimo rosnącej zmienności czasu trwania sylab. Częstotliwość pauz była wyższa w przypadku osób posługujących się językiem L2 BP, z dłuższymi przerwami w porównaniu z osobami posługującymi się językiem angielskim L1, L1 BP i L2. Szybkość artykulacji była podobnie zaburzona jak szybkość mowy, przy czym niższe wskaźniki wiązały się z wyższym obciążeniem poznawczym i zmiennością sylab.
Odchylenie standardowe czasu trwania sylaby zmniejszało się wraz ze wzrostem szybkości mowy na wszystkich poziomach języka. Varco sylab zmniejszyło się dla L1 BP i L2 BP wraz ze wzrostem zmienności F0 i szybkości mowy, podczas gdy wzrosło dla L1 English i L2 English. Odchylenie standardowe spółgłosek wykazało mniejszą zmienność w L1 BP wraz ze wzrostem szybkości mowy lub czasu trwania pauzy w porównaniu z językiem angielskim L1.
Odchylenie standardowe dla samogłosek i spółgłosek było zgodne ze wzorcem spadku wzrostu dla L1 BP i L2 BP, ze wzrostem cech prozodycznych, podczas gdy zmniejszało się, a następnie osłabiało dla L1 English i L2 English. Po przygotowaniu czterech składów głosowych dla języka angielskiego i BP, pobierz pliki audio od wybranych głośników i ułóż je w folderach specyficznych dla danego języka. Losowo wybierz sześć fragmentów głosu w języku angielskim L1 lub L1 BP. Następnie wybierz jeden fragment głosu w języku angielskim L2 lub L2 BP z jednego z sześciu fragmentów głosowych.
Uzyskaj dostęp do skryptu dla Praat Create Lineup i pobierz go. Przed uruchomieniem skryptu upewnij się, że głos referencyjny L2, folie L1 i docelowy głos L1 znajdują się w tym samym folderze. Otwórz oprogramowanie do analizy fonetycznej.
W oknie obiektu kliknij Praat i otwórz skrypt Praat, aby załadować skrypt. Następnie kliknij uruchom, aby wykonać skrypt tworzenia składu. W środowisku R, aby wykonać test Kruskala-Wallace'a, wpisz wskazane polecenie.
Następnie prześlij arkusz kalkulacyjny zawierający wyniki ocen słuchaczy i naciśnij enter. Następnie, aby wykonać test post-hoc Dunna, wpisz następujące polecenie i naciśnij Enter. Uzyskaj dostęp do skryptu Pythona Acoustic Similarity Cosinus Euclidean i pobierz go.
Upewnij się, że pobrany skrypt jest zapisany w tym samym folderze, co zestaw danych zestawu danych zestawu poleceń głosowych. Kliknij przycisk Otwórz plik, aby wywołać skrypt, a następnie kliknij przycisk Uruchom i uruchom bez debugowania, aby wykonać skrypt. Na koniec wykonaj testy podobieństwa głosu w oparciu o cechy akustyczne.
W pierwszym składzie głosowym BP, głos foliowy trzeci był oceniany jako głos docelowy, bez znaczącej różnicy między głosem trzecim a głosem docelowym czwartym. W drugim składzie głosowym BP nie stwierdzono istotnej różnicy między głosem docelowym trzecim a głosem czwórki. Zarówno podobieństwo cosinusowe, jak i dystans euklidesowy wykazały silną korelację między trzecim folią a głosem docelowym w pierwszym składzie BP.
W drugim składzie BP oba wskaźniki podobieństwa były silnie skorelowane między folią czwartą a celem.
Niniejsze badanie analizuje, w jaki sposób obcy akcent wpływa na identyfikację mówcy, koncentrując się na cechach prozodycznych, takich jak wysokość głosu, czas trwania oraz barwa. Celem badania jest zrozumienie, jak cechy te wpływają na oceny słuchaczy w ramach okazania głosowego.
Ilościowa analiza cech prozodyczno-akustycznych w mowie z obcym akcentem umożliwia obiektywną ocenę tożsamości mówcy, wspierając procesy badawczo-rozwojowe w obszarze kryminalistyki i bezpieczeństwa. Integracja modelowania statystycznego z metrykami podobieństwa akustycznego zwiększa pewność predykcyjną w identyfikacji głosowej, redukując niejednoznaczność w kluczowych punktach decyzyjnych. Możliwości te są krytyczne dla procesów przedsiębiorstw, w których solidne i powtarzalne porównywanie mówców wpływa na decyzje dotyczące portfela dostosowane do poziomu ryzyka.
Niniejszy protokół integruje procesy od wczesnego odkrywania markerów akustycznych, poprzez walidację statystyczną i screening, wspierając przepływy pracy od testowania hipotez po ewaluację systemów przedklinicznych.