Artykuł metodologiczny

Trening i testowanie oparte na zapamiętywaniu paradygmatu dla solidnej identyfikacji głosu w emocjonalnej mowie z wykorzystaniem analizy potencjałów związanych z wydarzeniami

2.1K wyświetleń

DOI:

10.3791/66913

9 sierpnia 2024

W tym artykule

Podsumowanie

Badanie wprowadza paradygmat treningowo-testujący w celu zbadania efektów starych/nowych potencjałów związanych z wydarzeniem w pewnych i wątpliwych scenariuszach prozodycznych. Dane ujawniają zwiększoną późną składową dodatnią w przedziale 400-850 ms w Pz i innych elektrodach. Ten proces może badać czynniki poza prozodią mowy i ich wpływ na identyfikację wskaźników wiązania celu.

Streszczenie

Rozpoznawanie znanych mówców ze strumieni głosowych jest fundamentalnym aspektem ludzkiej komunikacji werbalnej. Jednak nadal nie jest jasne, w jaki sposób słuchacze mogą nadal rozróżniać tożsamość mówcy w ekspresywnej mowie. To badanie opracowuje metodę rozpoznawania indywidualnej tożsamości mówcy opartą na zapamiętywaniu oraz towarzyszącej jej analizie danych elektroencefalogramu (EEG), która monitoruje, jak słuchacze rozpoznają znanych mówców i odróżniają nieznanych. Dane EEG rejestrują procesy poznawcze online podczas rozróżniania nowych i starych mówców na podstawie głosu, oferując miernik aktywności mózgu w czasie rzeczywistym, przezwyciężając ograniczenia czasu reakcji i pomiarów dokładności. Paradygmat obejmuje trzy kroki: słuchacze ustalają powiązania między trzema głosami a ich imionami (trening); słuchacze wskazują imię odpowiadające głosowi spośród trzech kandydatów (sprawdzanie); słuchacze rozróżniają trzy stare i trzy nowe głosy mówców w zadaniu dwualternatywnym (testowanie). Prozodia w teście była albo pewna, albo wątpliwa. Dane EEG zostały zebrane za pomocą 64-kanałowego systemu EEG, następnie przetworzone i zaimportowane do RStudio do analizy ERP i statystycznej oraz do MATLAB do topografii mózgu. Wyniki wykazały powiększony późny składnik dodatni (LPC) wywołany w warunku starego mówcy w porównaniu z warunkiem nowego mówcy w oknie 400-850 ms na elektrodzie Pz i innym szerszym zakresie elektrod w obu prozodii. Jednak efekt stary/nowy był wyraźny na środkowych i tylnych elektrodach w przypadku wątpliwej percepcji prozodii, podczas gdy przednie, środkowe i tylne elektrody były dla warunku pewnej prozodii. To badanie sugeruje, że ten projekt eksperymentu może służyć jako odniesienie do badania efektów wiążących wskazówki specyficzne dla mówcy w różnych scenariuszach (np. ekspresja anaforyczna) oraz patologii u pacjentów, takich jak fonagnozja.

Wprowadzenie

Strumienie głosowe człowieka są bogate w informacje, takie jak emocje1,2, stan zdrowia3,4, płeć biologiczna5, wiek6, a co ważniejsze, indywidualna tożsamość głosowa7,8. Badania sugerują, że ludzkie słuchacze mają mocną zdolność do rozpoznawania i rozróżniania tożsamości swoich rówieśników poprzez głosy, przezwyciężając wariacje wewnątrz-mówcy wokół przeciętnej reprezentacji tożsamości mówcy w przestrzeni akustycznej9. Takie różnice są spowodowane manipulacjami akustycznymi (częstotliwością podstawową i długością traktu głosowego, czyli F0 i VTL), które nie odpowiadają żadnym jasnym intencjom pragmatycznym9, prozodiami emocjonalnymi10 i pewnością głosu, która przekazuje uczucie pewności mówców11. Eksperymenty behawioralne skupią się na wielu czynnikach, które wpływają na wydajność słuchaczy w rozpoznawaniu mówców, w tym manipulacje związane z językiem8,12,13, cechy związane z uczestnikami, takie jak doświadczenie muzyczne czy umiejętność czytania14,15 oraz adaptacje dotyczące stymulacji, takie jak mowa wspak lub niesłowa16,17; więcej można znaleźć w przeglądach literatury18,19. Kilka ostatnich eksperymentów badało, jak indywidualna wariacja reprezentacji tożsamości mówcy może osłabić dokładność rozpoznawania, biorąc pod uwagę aspekty, takie jak wysoka i niska ekspresja emocjonalna16 oraz neutralne i przestraszone prozody5; sugeruje to wiele możliwych scenariuszy do dalszych badań20.

W celu wypełnienia pierwszej luki w badaniach, badanie proponuje, że neurofizjologiczne podstawy identyfikacji mówcy jeszcze nie w pełni badają, jak wariacje wewnątrz-mówcy wyzwania dla aktywności mózgu słuchaczy. Na przykład w zadaniu rozpoznawania mówcy opartego na fMRI autorstwa Zäske i wsp., prawa tylna górna zakręt skroniowy (pSTG), prawa dolna/środkowa zakręt czołowy (IFG/MFG), prawa środkowa zakręt czołowy i lewa caudata wykazywały zmniejszoną aktywność, gdy prawidłowo identyfikowano starych i nowych mówców, niezależnie od tego, czy treść językowa była taka sama czy różna21. Jednak wcześniejsze badanie EEG autorstwa Zäske i wsp. nie zaobserwowało tego efektu stary/nowy, gdy różnica tożsamości mówcy została wprowadzona poprzez różne teksty22. Konkretnie, większy, późny dodatni składnik (LPC) w zakresie od 300 do 700 ms, wykryty na elektrodzie Pz, gdy słuchacze spotkali swojego zapoznanego mówcę, który wyrażał ten sam tekst (czyli słysząc powtórkę o niezmienionej treści językowej), był nieobecny, gdy mówcy dostarczali nowe teksty.

Wsparciem dla twierdzenia Zäske i wsp.21 to badanie podejrzewa, że efekt stary/nowy nadal można zaobserwować pomimo różnic w treści językowej między sesjami szkoleniowymi i testowymi w analizach potencjałów związanych z zdarzeniem (ERP). Ta racja pochodzi od poglądu, że brak efektu stary/nowy w Zäske i wsp.22, w warunkach, gdy używano różnych tekstów, może być przypisany brakowi dodatkowej sesji kontrolnej podczas zadania szkoleniowego, aby zapewnić dokładne i skuteczne uczenie się tożsamości, jak sugerują Lavan i wsp.23. W związku z tym, pierwszym celem badania jest zbadanie i zweryfikowanie tej hipotezy. To badanie ma na celu przetestowanie tego, dodając sesję kontrolną do paradygmatu szkoleniowo-testowego22.

Kolejnym kluczowym pytaniem, które to badanie ma na celu udokumentować, jest odporność identyfikacji mówcy w obecności prozodii mowy. Poprzednie badania behawioralne sugerują, że słuchacze szczególnie mają trudności z rozpoznawaniem mówców w różnych prozodiach, co wskazuje na modulacyjną rolę kontekstu prozodycznego - słuchacze słabo się spisali w różnych warunkach treningu i testowania prozody. To badanie ma na celu przetestować to, eksponując słuchaczy do rozpoznawania zapoznanych mówców w pewnych lub wątpliwych prozodiach24. To badanie spodziewa się, że zaobserwowane różnice ERP pomogą wyjaśnić, jak prozodia mowy wpływa na rozpoznawanie tożsamości.

Głównym celem obecnego badania jest zbadanie odporności efektu stary/nowy w rozpoznawaniu mówcy, szczególnie badając, czy są różnice w rozpoznawaniu mów

Protokół

Etyczny Komitet Instytutu Lingwistyki, Międzynarodowego Uniwersytetu Studiów w Szanghaju, zatwierdził opisany poniżej projekt eksperymentu. Wszyscy uczestnicy dali pisemną zgodę na udział w badaniu.

1. Przygotowanie i walidacja biblioteki audio

  1. Nagrywanie i edycja audio
    1. Stwórz bazę danych głosów po chińsku, przestrzegając standardowej procedury tworzenia wcześniejszej wersji angielskiej, dokonując jednocześnie adaptacji tam, gdzie jest to konieczne, aby pasowała do kontekstu Chin11. Do eksperymentu użyto 123 zdań zawierających trzy rodzaje intencji pragmatycznych, mianowicie osąd, intencję i fakt. W tym celu odwołaj się do istniejącego korpusu oświadczeń angielskich11 i stwórz zlokalizowany chiński wariant z dodatkowymi zlokalizowanymi scenariuszami.
    2. Zwerbować 24 mówców (12 kobiet), aby wyrazili te zdania w neutralnym, wątpliwym i pewnym prosodii, odnosząc się i dostosowując określone instrukcje z poprzednich zadań nagraniowych11,24.
      1. Dla mówców tutaj, zwerbuj 24 standardowych mówców mandaryńskich z Międzynarodowego Uniwersytetu Studiów w Szanghaju, 12 kobiet i 12 mężczyzn, z wykazem biegłości w języku mandaryńskim poprzez wyniki 87 do 91 w teście sprawności w języku Putonghua. Mężczyźni mieli średnio 24,55 ± 2,09 lat, z 18,55 ± 1,79 lat edukacji i średnią wysokością 174,02 ± 20,64 cm. Kobiety miały średnio 22,30 ± 2,54 lat, z 18,20 ± 2,59 lat edukacji i średnią wysokością 165,24 ± 11,42 cm. Żaden nie zgłosił upośledzenia słuchu ani zaburzeń neurologicznych lub psychiatrycznych.
    3. Poproś mówców, aby powtórzyli każdy tekst dwa razy. Ustaw częstotliwość próbkowania na 48 000 Hz w oprogramowaniu Praat27. Upewnij się, że żaden strumień nie jest dłuższy niż 10 min, ponieważ Praat może się rozpaść, powodując utratę nagrań.
    4. Edytuj długi strumień audio na kawałki na zdanie z Praat. Ponieważ są dwie powtórki tego samego tekstu, wybierz wersję, która najlepiej reprezentuje zamierzoną prosodię jako docelowe zdanie.
  2. Selekcja audio
    1. Normalizuj bibliotekę audio na 70 dB, a częstotliwość próbkowania na 41 000 Hz za pomocą skryptu Praat28. Aby to zrobić, otwórz Praat, załaduj pliki dźwiękowe i wybierz je w oknie Obiekty. Przejdź do menu Modyfikuj, wybierz Skaluj intensywność..., ustaw Nową średnią intensywność (dB SPL) na 70 w oknie ustawień i kliknij OK , aby zastosować normalizację.
    2. Zwerbować 48 niezależnych słuchaczy, aby ocenili każde audio na jednej 7-punktowej skali Likerta o poziomie pewności siebie: 1 dla wcale i 7 dla bardzo pewny11. Upewnij się, że każde zdanie zostało ocenionych przez 12 osób.
    3. Wybierz audio, które pasuje do wyznaczonych progów z jedną zasadą: upewnij się, że średnia ocena dla pewnego zamierzenia jest wyższa niż dla wątpliwego zamierzenia. Upewnij się, że te progi są spójne wśród 12 mówców tej samej płci biologicznej. Na przykład, jeśli ci mówcy wyrazili dwa zdania, każde z pewnym i wątpliwym prosodium, muszą zostać zaobserwowane znaczące różnice w ocenach.
    4. W celu obecnego eksperymentu użyj czterech bloków audio, łącznie 480 klipów audio, przy czym każdy blok zawiera 120 audio.
      1. Podziel 24 mówców na cztery grupy po sześć, z dwiema grupami mężczyzn i dwiema grupami kobiet, przy czym każda grupa składa się z mówców tej samej płci biologicznej.
      2. Dla każdej grupy wybierz klipy audio na podstawie ocen percepcyjnych (dla tego samego tekstu), upewniając się, że średnie oceny pewności były wyższe niż oceny wątpliwości dla każdego zdania. Te cztery bloki różnią się następująco: 1) łączni sześciu mówcy - ich tożsamość jest różna; 2) połowa bloków jest wyrażana przez mężczyzn, a druga połowa przez kobiety; i 3) tekst wyrażony w każdym bloku jest różny.
    5. Przed rozpoczęciem procesu selekcji udokumentuj dane dotyczące wzrostu dla każdego mówcy. Użyj tych informacji, aby podzielić mówców na cztery niezależne grupy w oparciu o płeć i wzrost.
      1. Są łącznie 24 mówców, podzielonych równo między mężczyzn i kobiety. W obrębie każdej grupy płci posortuj 12 osób według wzrostu.
    6. Podziel tych 12 osób na dwie grupy w sposób naprze

Wyniki

Klasyczny efekt stary/nowy charakteryzuje się znacznym wzrostem aktywności mózgu słuchaczy na elektrodzie Pz (między 300 a 700 ms), gdy treść mowy sesji testowej pasuje do treści sesji treningowej, szczególnie w warunku starego mówcy w porównaniu z warunkiem nowego mówcy22. Protokół ujawnia zaktualizowany wariant tego efektu: Po pierwsze, obserwowanie większych dodatnich trendów na elektrodzie Pz i na całym obszarze mózgu w warunku starym w porównaniu z warunkiem nowego mówcy między 400 a 850 ms. Po drugie, treść mowy w sesji testowej będzie różnić się od treści sesji treningowej. Po trzecie, zarówno warunki pewnej, jak i wątpliwej prozodii mowy powinny wykazywać te trendy. Wreszcie, efekt stary/nowy jest bardziej zauważalny w warunku wątpliwym podczas sesji testowej (Rysunek 2).

Analiza LMER z formułą

lmer(Voltage ~ Memory * ROI + (1|Subject) + (1|Channel))

sugerują, że zarówno typy pamięci (stary versus nowy) i ROI mają efekty główne, a także interakcję między pamięcią i ROI (Tabela 1). Dalsza analiza post-hoc wykazała, że we wszystkich obszarach mózgu warunek stary wykazuje większe dodatnie napięcie niż warunek wątpliwy, w tym w obszarach przednich, centralnych i tylnych (Tabela 2). Porównanie wartości beta sugeruje, że efekt stary/nowy był bardziej zauważalny na centralnych i tylnych elektrodach niż na przednich elektrodach: dla zestawu danych łączonych - Przedni β =.40, Centralny β =.63 i Tylny β =.60; dla zestawu pewnych danych - Przedni β =.61, Centralny β =.63 i Tylny β =.76 oraz dla zestawu wątpliwych danych - Przedni β =.44, Centralny β =.87 i Tylny β =.69. Zaangażowanie elektrod centralnych i tylnych było najbardziej zauważalne w warunku wątpliwej prozodii.

Z formułą

lmer(Voltage ~ Memory + (1|Subject))

potwierdziliśmy istnienie efektów stary/nowy na elektrodzie Pz. Na elektrodzie Pz zaobserwowano główny efekt pamięci (stary versus nowy) (F(1, 69341.99) = 120.46, p < .001, η²p =.002, β =.425, SE =.039, stosunek z = 10.98, p < .001). W warunku tylko pewnym zaobserwowano główny efekt pamięci (stary versus nowy) na elektrodzie Pz (F(1, 34318.32) = 5.04, p = .025, η²p =.0001, β =.125, SE =.056, stosunek z = 2.25, p = .025). W warunku tylko wątpliwym zaobserwowano główny efekt pamięci (stary versus nowy) na elektrodzie Pz (F(1, 34993.20) = 317.02, p < .001, η²p =.009, β =.914, SE =.051, stosunek z = 17.81, p < .001).

figure-results-1
Rysunek 1: Przepływ pracy zbierania danych dla każdego bloku. W (A) Treningu, słuchacze słyszą głos i kojarzą nazwę, która następnie jest z nim prezentowana. Wymagane jest zapamiętanie trzech starych mówców. Język, który pojawił się w programie, pierwotnie był chiński. A i C reprezentują nazwy takie jak Xiao (Junior) ZHANG. W (B) Sprawdzaniu, słuchacze identyfikują nazwę mówcy po usłyszeniu głosu, naciskając 1, 2 lub 3 na klawiaturze liczbowej, aby skojarzyć tożsamość głosu z nazwiskami takimi jak Xiao ZHAO. W (C) Testowaniu, słuchacze słyszą głos i klasyfikują go jako mówiony przez starego lub nowego mówcę. Jak pokazano w (D) Projekt prozodii, słuchacze uczą się, że trzy mówcy wyrażają się tylko pewnie lub wątpliwie, ale słyszą sześć mówców mówiących zarówno pewnie, jak i wątpliwie. Pojawienie się Wersji A lub B jest wzajemnie wyłączne. Jeśli Wersja A pojawi się z męskim lub żeńskim mówcą, Wersja B pojawi się z odpowiednim żeńskim lub męskim mówcą. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-2
Rysunek 2</

Dyskusja

Przedstawione badanie przedstawia procedurę zbierania i analizy danych EEG, koncentrując się na rozpoznawaniu wcześniej nauczonych tożsamości mówców. Badanie to dotyczy różnic między fazami uczenia się a rozpoznawania, w tym różnic w treści mowy22 i prozodii10. Konstrukcja jest przystosowana do zastosowania w różnych dziedzinach badań, w tym psycholingwistyce, takich jak przetwarzanie zaimków i anafor41.

Paradygmat treningowo-testowy jest klasycznym wzorcem eksperymentalnym używanym do oceny wyników uczenia się uczestników w konkretnych tematach, takich jak uczenie się głosów42,43. Ten paradygmat ocenia, jak dobrze uczestnicy opanowali określone informacje (co przejawia się w dokładności)10. Pozwala to badaczom wprowadzać zmienne stopniowo w kontrolowanych warunkach eksperymentalnych, takich jak różne prozody w fazach treningowych i testowych, aby zrozumieć ich wpływ na dokładność rozpoznawania głosów, na przykład głosy VTL/F0 modułowane23, tchórzliwe versus neutralne10 lub wątpliwe versus pewne w tym badaniu.

Jednak paradygmat ma ograniczenia. Różnice między środowiskami uczenia się i testowania mogą wpływać na ważność wyników eksperymentu, ponieważ kontrolowane warunki uczenia się mogą nie odzwierciedlać bardziej zmiennych warunków testowych. Na przykład, sesja treningowa korzysta z pojedynczej prozodii zamiast proporcjonalnej różnicy, takiej jak 30% versus 70%44. Aby zapobiec tej nierównowagę, zapewnienie bardziej zróżnicowanego środowiska uczenia się mogłoby lepiej naśladować scenariusze z życia codziennego, gdzie mówcy używają zróżnicowanej prozodii podczas interakcji z słuchaczami. Dodatkowo, to badanie przyznaje, że złożoność projektu eksperymentalnego, obejmującego wiele etapów i zaawansowaną programowanie (z wykorzystaniem narzędzi takich jak R Studio, MATLAB i Python), może być wyzwaniem dla nowicjuszy.

Główne wnioski podkreślają znaczenie odpowiedniej znajomości i fazy sprawdzającej. Praca Xu i Armony wskazuje, że słuchacze mają trudności z identyfikacją starych tożsamości mówców bez wystarczającego treningu i sprawdzeń powyżej poziomu przypadkowego10. Ponadto Zaske i wsp. stwierdzili, że efekt LPC stary/nowy był obecny tylko wtedy, gdy ten sam tekst był powtarzany, a nie z różnymi tekstami22. W tym badaniu wdrożenie fazy sprawdzającej ujawniło trwałość efektu ERP stary/nowy, nawet z różnymi stymulacyjnymi tekstami, co wspiera twierdzenia badań fMRI21. Badanie sugeruje, że w przypadku paradygmatów opartych na treningu i testowaniu, wstawienie sesji sprawdzającej jest kluczowe. Pozwala to słuchaczom stworzyć mocne wrażenie o akustycznej tożsamości mówcy, kojarząc go z określonym symbolem, takim jak imię23. Bez wystarczającego nauczenia się reprezentacji mówcy, słuchacze mogą mieć trudności z adaptacją do zmian wewnątrz mówcy10.

To badanie obserwowało również rolę prozodii jako wskaźnika wiążącego w rozpoznawaniu mówcy45. W przeciwieństwie do poprzednich poglądów, że prozodię może utrudniać rozpoznawanie starego mówcy, to badanie znalazło efekt stary/nowy w warunkach pewnej i wątpliwej prozodii. Ten trwały efekt sugeruje rolę modulacyjną prozodii w rozpoznawaniu mówców. Dalsza analiza ujawniła różnice w aktywacji regionu przedniego w różnych warunkach prozodii. Pewna prozodja wywoływała niższe poziomy efektu stary/nowy w regionach przednich w porównaniu z wątpliwą prozodią. To odkrycie sugeruje, że pewna mowa może utrudnić identyfikację mówcy z powodu wydłużonej długości drogi głosowej i obniżonej częstotliwości podstawowej, co może prowadzić do zwiększonej uwagi słuchaczy11,29.

Projekt tego badania może zainspirować przyszłe badania nad upośledzeniami rozpoznawania w populacjach pacjentów, takich jak osoby z prosopagnozją lub fonagnozją46,47. Ponadto, modyfikacje w celu przystosowania się do uczestników o krótszej uwagi, takich jak osoby z zaburzeniami ze spektrum autyzmu48, mogą poprawić dostępność badania.

Ponadto, paradygmat rozciąga się poza rozpoznawanie mówców, aby badać przetwarzanie zaimków i rozumienie anaforyczne w badaniach psycholingwistycznych. Coopmans i Nieuwland41 pokazują, jak wzory synchronizacji oscylacyjnej neuronów odróżniają aktywację poprzednika i integrację w rozumieniu anafor, co jest zgodne z badaniem tej pracy nad sygnałami związanymi z tożsamością. Podobne wskazówki obejmują style komunikacyjne (np. stwierdzenia dosłowne lub ironiczne), kolejność

Oświadczenia

Nie ma informacji do ujawnięcia.

Podziękowania

To dzieło zostało wspierane przez Narodowe Fundacje Nauk Przyrodniczych Chin (Grant nr 31971037); Program Shuguang wspierany przez Fundację Rozwoju Edukacji w Szanghaju i Szanghajskiego Komitetu Edukacji Miejskiej (Grant nr 20SG31); Fundację Nauk Przyrodniczych w Szanghaju (22ZR1460200); Program Doradztwa Naukowca Międzynarodowych Studiów w Szanghaju (2022113001); oraz Główny Program Narodowej Fundacji Nauk Społecznych Chin (Grant nr 18ZDA293).

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
64Ch Standard BrainCap for BrainAmpEasycap GmbHSteingrabenstrasse 14 DE-82211https://shop.easycap.de/products/64ch-standard-braincap
Abrasive Electrolyte-GelEasycap GmbHAbralyt 2000https://shop.easycap.de/products/abralyt-2000
actiCHamp PlusBrain Products GmbH64 channels + 8 AUXhttps://www.brainproducts.com/solutions/actichamp/
Audio InterfaceNative Instruments GmbHKomplete audio 6https://www.native-instruments.com/en/products/komplete/audio-interfaces/komplete-audio-6/
Foam EartipsNeuronixER3-14 https://neuronix.ca/products/er3-14-foam-eartips
Gel-based passive electrode systemBrain Products GmbHBC 01453https://www.brainproducts.com/solutions/braincap/
High-Viscosity Electrolyte Gel Easycap GmbHSuperVischttps://shop.easycap.de/products/supervisc

Bibliografia

  1. Larrouy-Maestri, P., Poeppel, D., Pell, M. D. The sound of emotional prosody: Nearly 3 decades of research and future directions. Perspect Psychol Sci. , 17456916231217722(2024).
  2. Pell, M. D., Kotz, S. A. Comment: The next frontier: Prosody research gets interpersonal. Emotion Rev. 13 (1), 51-56 (2021).
  3. Cummins, N., et al. Multilingual markers of depression in remotely collected speech samples: A preliminary analysis. J Affect Disor. 341, 128-136 (2023).
  4. Cummins, N., Baird, A., Schuller, B. W. Speech analysis for health: Current state-of-the-art and the increasing impact of deep learning. Methods. 151, 41-54 (2018).
  5. Kennedy, E., Thibeault, S. L. Voice-gender incongruence and voice health information-seeking behaviors in the transgender community. Am J Speech-language Pathol. 29 (3), 1563-1573 (2020).
  6. Zäske, R., et al. Electrophysiological correlates of voice memory for young and old speakers in young and old listeners. Neuropsychologia. 116, 215-227 (2018).
  7. Lavan, N., Burton, A. M., Scott, S. K., Mcgettigan, C. Flexible voices: Identity perception from variable vocal signals. Psychonomic Bullet Rev. 26, 90-102 (2019).
  8. Perrachione, T. K., Del Tufo, S. N., Gabrieli, J. D. Human voice recognition depends on language ability. Science. 333 (6042), 595-595 (2011).
  9. Lavan, N., Knight, S., Mcgettigan, C. Listeners form average-based representations of individual voice identities. Nat Comm. 10 (1), 2404(2019).
  10. Xu, H., Armony, J. L. Influence of emotional prosody, content, and repetition on memory recognition of speaker identity. Quart J Exp Psychol. 74 (7), 1185-1201 (2021).
  11. Jiang, X., Pell, M. D. The sound of confidence and doubt. Speech Comm. 88, 106-126 (2017).
  12. Winters, S. J., Levi, S. V., Pisoni, D. B. Identification and discrimination of bilingual talkers across languages. J Acoustical Soci Am. 123 (6), 4524-4538 (2008).
  13. Orena, A. J., Polka, L., Theodore, R. M. Identifying bilingual talkers after a language switch: Language experience matters. J Acoustical Soc Am. 145 (4), EL303-EL309 (2019).
  14. Xie, X., Myers, E. The impact of musical training and tone language experience on talker identification. J Acoustical Soc Am. 137 (1), 419-432 (2015).
  15. Kadam, M. A., Orena, A. J., Theodore, R. M., Polka, L. Reading ability influences native and non-native voice recognition, even for unimpaired readers. J Acoustical Soc Am. 139 (1), EL6-EL12 (2016).
  16. Fleming, D., Giordano, B. L., Caldara, R., Belin, P. A language-familiarity effect for speaker discrimination without comprehension. Proc Natl Acad Sci. 111 (38), 13795-13798 (2014).
  17. White, K. S., Yee, E., Blumstein, S. E., Morgan, J. L. Adults show less sensitivity to phonetic detail in unfamiliar words, too. J Memory Lang. 68 (4), 362-378 (2013).
  18. Levi, S. Methodological considerations for interpreting the language familiarity effect in talker processing. Wiley Interdiscip Revi: Cognitive Sci. 10 (2), e1483(2019).
  19. Perrachione, T. K. Recognizing Speakers Across Languages. The Oxford Handbook of Voice Perception. Frühholz, S., Belin, P. , Oxford University Press. 515-538 (2018).
  20. Lavan, N., Burton, A. M., Scott, S. K., Mcgettigan, C. Flexible voices: Identity perception from variable vocal signals. Psychonomic Bullet Rev. 26 (1), 90-102 (2019).
  21. Zäske, R., Hasan, B. aS., Belin, P. It doesn't matter what you say: Fmri correlates of voice learning and recognition independent of speech content. Cortex. 94, 100-112 (2017).
  22. Zäske, R., Volberg, G., Kovács, G., Schweinberger, S. R. Electrophysiological correlates of voice learning and recognition. J Neurosci. 34 (33), 10821-10831 (2014).
  23. Lavan, N., Knight, S., Mcgettigan, C. Listeners form average-based representations of individual voice identities. Nat Comm. 10 (1), 1-9 (2019).
  24. Chen, W., Jiang, X. Voice-Cloning Artificial-Intelligence Speakers Can Also Mimic Human-Specific Vocal Expression. Preprints. , 10.20944/preprints202312.0807.v1 (2023).
  25. Pisanski, K., Anikin, A., Reby, D. Vocal size exaggeration may have contributed to the origins of vocalic complexity. Philosoph Trans Royal Soc B. 377 (1841), 20200401(2022).
  26. Belin, P., Fecteau, S., Bedard, C. Thinking the voice: Neural correlates of voice perception. Trend Cognitive Sci. 8 (3), 129-135 (2004).
  27. Boersma, P., Weenink, D. Praat: doing phonetics by computer. , Available from: https://www.fon.hum.uva.nl/praat/ (2022).
  28. Jiang, X., Pell, M. D. On how the brain decodes vocal cues about speaker confidence. Cortex. 66, 9-34 (2015).
  29. Jiang, X., Gossack-Keenan, K., Pell, M. D. To believe or not to believe? How voice and accent information in speech alter listener impressions of trust. Quart J Exp Psychol. 73 (1), 55-79 (2020).
  30. Rigoulot, S., Pell, M. D. Seeing emotion with your ears: Emotional prosody implicitly guides visual attention to faces. PloS One. 7 (1), e30740(2012).
  31. Cui, X., Jiang, X., Ding, H. Affective prosody guides facial emotion processing. Curr Psychol. 42 (27), 23891-23902 (2023).
  32. Chen, W., Jiang, X. Memorization-based training and testing paradigm for robust vocal identity recognition in expressive speech using event-related potentials analysis. , Available from: https://osf.io/6zu83/ (2024).
  33. Gmbh, B. P. Brainvision recorder. , Available from: https://www.brainproducts.com/downloads/recorder/ (2024).
  34. Jiang, X., Paulmann, S., Robin, J., Pell, M. D. More than accuracy: Nonverbal dialects modulate the time course of vocal emotion recognition across cultures. J Exp Psychol. 41 (3), 597(2015).
  35. Jiang, X., Pell, M. D. The feeling of another's knowing: How "mixed messages" in speech are reconciled. J Exp Psychol. 42 (9), 1412(2016).
  36. Zhou, X., et al. Semantic integration processes at different levels of syntactic hierarchy during sentence comprehension: An erp study. Neuropsychologia. 48 (6), 1551-1562 (2010).
  37. Jiang, X., Tan, Y., Zhou, X. Processing the universal quantifier during sentence comprehension: Erp evidence. Neuropsychologia. 47 (8-9), 1799-1815 (2009).
  38. Acunzo, D. J., Mackenzie, G., Van Rossum, M. C. W. Systematic biases in early erp and erf components as a result of high-pass filtering. J Neurosci Meth. 209 (1), 212-218 (2012).
  39. Bates, D. Fitting linear mixed models in r. R. 5 (1), 27-30 (2005).
  40. Oostenveld, R., Fries, P., Maris, E., Schoffelen, J. M. Fieldtrip: Open source software for advanced analysis of meg, eeg, and invasive electrophysiological data. Computat Intelligence Neurosci. 2011, 1-9 (2011).
  41. Coopmans, C. W., Nieuwland, M. S. Dissociating activation and integration of discourse referents: Evidence from erps and oscillations. Cortex. 126, 83-106 (2020).
  42. Humble, D., et al. The jena voice learning and memory test (jvlmt): A standardized tool for assessing the ability to learn and recognize voices. Behavior Res Meth. 55 (3), 1352-1371 (2023).
  43. Holmes, E., To, G., Johnsrude, I. S. How long does it take for a voice to become familiar? Speech intelligibility and voice recognition are differentially sensitive to voice training. Psychol Sci. 32 (6), 903-915 (2021).
  44. Kroczek, L. O. H., Gunter, T. C. Communicative predictions can overrule linguistic priors. Sci Rep. 7 (1), 17581(2017).
  45. Kroczek, L. O. H., Gunter, T. C. The time course of speaker-specific language processing. Cortex. 141, 311-321 (2021).
  46. Schroeger, A., et al. Atypical prosopagnosia following right hemispheric stroke: A 23-year follow-up study with mt. Cognitive Neuropsychol. 39 (3-4), 196-207 (2022).
  47. Garrido, L., et al. Developmental phonagnosia: A selective deficit of vocal identity recognition. Neuropsychologia. 47 (1), 123-131 (2009).
  48. Schelinski, S., Borowiak, K., Von Kriegstein, K. Temporal voice areas exist in autism spectrum disorder but are dysfunctional for voice identity recognition. Social Cognitive Affective Neurosci. 11 (11), 1812-1822 (2016).
  49. Holle, H., Gunter, T. C. The role of iconic gestures in speech disambiguation: Erp evidence. J Cognitive Neurosci. 19 (7), 1175-1192 (2007).
  50. Regel, S., Coulson, S., Gunter, T. C. The communicative style of a speaker can affect language comprehension? Erp evidence from the comprehension of irony. Brain Res. 1311, 121-135 (2010).

Przedruki i uprawnienia

Tagi

Analiza EEGrozpoznawanie mówcytrening zapamiętywaniapóźny komponent pozytywnyprozodia mowyrozpoznawanie znanego mówcytopografia mózgu